晚上好,各位。今天GitHub Trending上这波项目,没有一个是讲模型的,全是 工具链层面 的真家伙——代码审查、浏览器自动化、视频理解,每一个都解决了一个「每天都在烦你但之前没人好好做」的问题。
而且有意思的是,三个项目分别来自大厂(阿里)、创业团队(CitroLabs)和个人开发者(Brad),说明在AI工具这个赛道,规模不是优势,痛点抓得准才是。
1. Alibaba OpenCodeReview — 阿里内部用了两年的AI代码审查,今天开源了
⭐ 15.7K Stars | Go | Apache 2.0 | GitHub Trending 连续霸榜
GitHub → alibaba/open-code-review
代码审查这个事,说大不大说小不小——每天都要做,但做得不好就是走个过场。我之前用Claude Code加prompt做review,效果时好时坏,有时候token烧了几万块,它给我回一句「Looks good to me」。
OpenCodeReview(简称OCR)是阿里内部用了两年的AI代码审查工具,服务了几万开发者、抓了数百万个代码缺陷,现在开源了。跟那些套个LLM就说是AI review的项目不一样,它的架构是 确定性工程 + Agent混合 的:
- 确定性部分:精确的文件选择、智能文件捆绑(比如把中英文properties文件绑在一起审)、细粒度规则匹配(内置NPE、线程安全、XSS、SQL注入等规则集)、独立的评论定位和反思模块
- Agent部分:场景优化的Prompt模版、精简的工具集、动态上下文检索——只做Agent擅长的事
关键数据:在一个50个开源仓库、200个真实PR、10种编程语言的评测基准上,OCR在相同底层模型下,精准度(Precision)和F1显著高于通用Agent,而token消耗只有通用Agent的1/9。也就是说,同样的模型,它审得准、审得快、还省钱。
怎么用:
# npm全局安装
npm install -g @alibaba-group/open-code-review
# 审查当前变更
ocr review
# 审查两个分支间的差异
ocr review --base main --head feature
# GitHub Actions集成,一行配置就行
Claude Code / Codex / Cursor都有插件支持,安装后直接在Agent里敲 /review 就行。ocr scan 命令还能做全文件扫描——适合审计不熟悉的代码库。
适合谁:每个要做代码审查的团队。尤其是PR量大、或者对代码质量有严格要求的项目。如果你现在还在靠人工Review或者用通用Agent随便审审,OCR几乎是零成本升级的选择。
⚠️ 我还没在生产环境实测,但看架构设计和阿里内部的落地数据,靠谱程度很高。Go语言写的CLI,跨平台二进制,不需要折腾环境。
2. ego-lite — 别让Agent抢你的浏览器标签页了
⭐ 6K Stars | JavaScript/MIT | 本周+4,904
这是我这周觉得最「对对对,就是这个痛点」的项目。
你让Agent帮你填个表单、扒个数据、批量登录几个网站——传统方案是Headless Chrome或者Puppeteer,但这些工具要单独维护session、cookie、登录态,而且你开一个headless,Agent跟你在同一个Chrome里抢标签页。你正看着文档呢,Agent把你标签页关了。
ego-lite 是一个专为AI Agent设计的浏览器。不是浏览器自动化框架,而是从底层Chromium定制的一个你可以和Agent一起用的浏览器。核心概念叫 「Spaces」:
- 你的空间:正常浏览网页、看文档、刷X
- Agent的空间:隔离的标签页和DOM上下文,Agent在里面随便操作,不影响你
- 并行运行:多个Agent可以同时在各自的Space里干活,互不干扰
- 继承Chrome登录态:第一次启动时问你要不要迁移Chrome数据,你已有的cookies、密码、插件、书签全给你Agent用
怎么用:
目前macOS可用(Windows/Linux在路上)。
# 第一步:装ego-browser skill
npx skills add citrolabs/ego-lite
# 第二步:在你的Agent CLI里
/ego-browser 帮我登录godsun.pro后台,查看最近7天文章数据
# Agent会在自己的Space里干活,你在浏览器前台继续你的操作
跟竞品的对比很清楚:Browser-Use和Vercel agent-browser是自动化框架,没有自己的浏览器,登录态需要自己折腾;ChatGPT Atlas和Perplexity Comet只让自己内置的Agent开浏览器。ego-lite是一个你和你带的任意Agent共享的浏览器——你做你的,Agent做Agent的,互不打扰。
适合谁:经常让Agent做浏览器自动化任务的开发者。填表单、批量数据抓取、表单自动化、QA测试、多网站竞品监控——以前需要puppeteer写脚本的活,现在一句自然语言就能让Agent干,而且不打断你自己的工作流程。
⚠️ 目前只有macOS版,Windows和Linux还在路线图上。6K星在同类里不算多,但增长势头很猛(一周+4.9K)。免费开源,MIT协议。
3. claude-video — 给Claude一双眼睛看视频,不只是读标题
⭐ 11.9K Stars | Python | MIT | 本周+2.5K
GitHub → bradautomates/claude-video
这个项目解决的是个很傻但很真实的问题:Claude能看网页、读代码、写文档,但你不能给它一个YouTube链接让它「看一下这个视频讲了什么」。它要么靠标题猜,要么拉个字幕文件——但字幕往往丢了90%的画面信息。
claude-video 给Claude装上了一双看视频的眼睛。装完之后,你在Claude里用 /watch 命令,贴上视频URL(YouTube、B站?其实yt-dlp支持几百个源),它就会:
- 先试拉字幕(免费,秒回)
- 没字幕的话用
yt-dlp下载视频 ffmpeg按场景提取关键帧——不是均匀抽帧,是按画面变化检测场景切换,去掉重复帧- 把帧图片+时间戳字幕一并喂给Claude
- Claude「看完」之后回答你的问题
安装:
# Claude Code(推荐,自动更新)
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video
# Codex、Cursor、Gemini CLI等
npx skills add bradautomates/claude-video -g
然后直接问:
/watch https://youtu.be/xxxx 这个视频前30秒用了什么钩子?
/watch bug-repro.mov 帮我看看哪里出了问题
/watch https://youtu.be/xxxx 总结一下,跳过广告部分
我实测的几个场景:
- 内容分析:别人的视频开头怎么抓注意力的,结构怎么编排的——比手动刷一遍效率高一截
- Bug复现诊断:同事发你一个屏幕录制bug视频,直接丢给Claude看,它找到问题帧告诉你是哪行代码的问题
- 长视频总结:1小时的发布会/课程,Claude几分钟读完给你结构化的要点
帧预算控制做得不错——默认根据视频时长自动调节帧密度,短视频密集抽帧,长视频稀疏覆盖。还支持 --start --end 只看某一段,密集抽帧到2fps。token消耗可预期,不会一个视频吃掉你整个上下文。
适合谁:经常需要分析视频内容的创作者、做竞品调研的人、远程团队(同事发bug视频你秒懂)、课程学习者。
⚠️ 依赖 yt-dlp 和 ffmpeg,安装时会自动帮你装(macOS用brew,Linux/Windows会打印安装命令)。需要Whisper API key的场景只在视频没字幕时才用,大部分情况免费字幕够用。
三个项目的共同信号
放在一起看,这周的项目有一个特别明显的共性:AI从「能做什么」转向了「怎么做得更好」。
- OCR不关心模型参数,关心怎么用同样的模型审出更准的结果、花更少的token
- ego-lite不关心Agent能力,关心怎么让Agent跟人类和谐共用一个浏览器
- claude-video不关心视频生成,关心怎么让AI看懂已有视频
都是细节,但都是真实工作流里的瓶颈。模型已经够强了,2026下半年拼的是谁把这些「最后一公里」的工具补齐了。
觉得有用?收藏关注,每日更新AI前沿速递
by 数码罗记·godsun.pro