Alibaba开源AI代码审查、Agent专用浏览器ego-lite、Claude视频理解——GitHub本周AI工具三连发

Alibaba开源AI代码审查、Agent专用浏览器ego-lite、Claude视频理解——GitHub本周AI工具三连发

晚上好,各位。今天GitHub Trending上这波项目,没有一个是讲模型的,全是 工具链层面 的真家伙——代码审查、浏览器自动化、视频理解,每一个都解决了一个「每天都在烦你但之前没人好好做」的问题。

而且有意思的是,三个项目分别来自大厂(阿里)、创业团队(CitroLabs)和个人开发者(Brad),说明在AI工具这个赛道,规模不是优势,痛点抓得准才是。

1. Alibaba OpenCodeReview — 阿里内部用了两年的AI代码审查,今天开源了

⭐ 15.7K Stars | Go | Apache 2.0 | GitHub Trending 连续霸榜

GitHub → alibaba/open-code-review

代码审查这个事,说大不大说小不小——每天都要做,但做得不好就是走个过场。我之前用Claude Code加prompt做review,效果时好时坏,有时候token烧了几万块,它给我回一句「Looks good to me」。

OpenCodeReview(简称OCR)是阿里内部用了两年的AI代码审查工具,服务了几万开发者、抓了数百万个代码缺陷,现在开源了。跟那些套个LLM就说是AI review的项目不一样,它的架构是 确定性工程 + Agent混合 的:

  • 确定性部分:精确的文件选择、智能文件捆绑(比如把中英文properties文件绑在一起审)、细粒度规则匹配(内置NPE、线程安全、XSS、SQL注入等规则集)、独立的评论定位和反思模块
  • Agent部分:场景优化的Prompt模版、精简的工具集、动态上下文检索——只做Agent擅长的事

关键数据:在一个50个开源仓库、200个真实PR、10种编程语言的评测基准上,OCR在相同底层模型下,精准度(Precision)和F1显著高于通用Agent,而token消耗只有通用Agent的1/9。也就是说,同样的模型,它审得准、审得快、还省钱。

怎么用:

# npm全局安装
npm install -g @alibaba-group/open-code-review

# 审查当前变更
ocr review

# 审查两个分支间的差异
ocr review --base main --head feature

# GitHub Actions集成,一行配置就行

Claude Code / Codex / Cursor都有插件支持,安装后直接在Agent里敲 /review 就行。ocr scan 命令还能做全文件扫描——适合审计不熟悉的代码库。

适合谁:每个要做代码审查的团队。尤其是PR量大、或者对代码质量有严格要求的项目。如果你现在还在靠人工Review或者用通用Agent随便审审,OCR几乎是零成本升级的选择。

⚠️ 我还没在生产环境实测,但看架构设计和阿里内部的落地数据,靠谱程度很高。Go语言写的CLI,跨平台二进制,不需要折腾环境。

2. ego-lite — 别让Agent抢你的浏览器标签页了

⭐ 6K Stars | JavaScript/MIT | 本周+4,904

GitHub → citrolabs/ego-lite

这是我这周觉得最「对对对,就是这个痛点」的项目。

你让Agent帮你填个表单、扒个数据、批量登录几个网站——传统方案是Headless Chrome或者Puppeteer,但这些工具要单独维护session、cookie、登录态,而且你开一个headless,Agent跟你在同一个Chrome里抢标签页。你正看着文档呢,Agent把你标签页关了。

ego-lite 是一个专为AI Agent设计的浏览器。不是浏览器自动化框架,而是从底层Chromium定制的一个你可以和Agent一起用的浏览器。核心概念叫 「Spaces」:

  • 你的空间:正常浏览网页、看文档、刷X
  • Agent的空间:隔离的标签页和DOM上下文,Agent在里面随便操作,不影响你
  • 并行运行:多个Agent可以同时在各自的Space里干活,互不干扰
  • 继承Chrome登录态:第一次启动时问你要不要迁移Chrome数据,你已有的cookies、密码、插件、书签全给你Agent用

怎么用:

目前macOS可用(Windows/Linux在路上)。

# 第一步:装ego-browser skill
npx skills add citrolabs/ego-lite

# 第二步:在你的Agent CLI里
/ego-browser 帮我登录godsun.pro后台,查看最近7天文章数据

# Agent会在自己的Space里干活,你在浏览器前台继续你的操作

跟竞品的对比很清楚:Browser-Use和Vercel agent-browser是自动化框架,没有自己的浏览器,登录态需要自己折腾;ChatGPT Atlas和Perplexity Comet只让自己内置的Agent开浏览器。ego-lite是一个你和你带的任意Agent共享的浏览器——你做你的,Agent做Agent的,互不打扰。

适合谁:经常让Agent做浏览器自动化任务的开发者。填表单、批量数据抓取、表单自动化、QA测试、多网站竞品监控——以前需要puppeteer写脚本的活,现在一句自然语言就能让Agent干,而且不打断你自己的工作流程。

⚠️ 目前只有macOS版,Windows和Linux还在路线图上。6K星在同类里不算多,但增长势头很猛(一周+4.9K)。免费开源,MIT协议。

3. claude-video — 给Claude一双眼睛看视频,不只是读标题

⭐ 11.9K Stars | Python | MIT | 本周+2.5K

GitHub → bradautomates/claude-video

这个项目解决的是个很傻但很真实的问题:Claude能看网页、读代码、写文档,但你不能给它一个YouTube链接让它「看一下这个视频讲了什么」。它要么靠标题猜,要么拉个字幕文件——但字幕往往丢了90%的画面信息。

claude-video 给Claude装上了一双看视频的眼睛。装完之后,你在Claude里用 /watch 命令,贴上视频URL(YouTube、B站?其实yt-dlp支持几百个源),它就会:

  1. 先试拉字幕(免费,秒回)
  2. 没字幕的话用 yt-dlp 下载视频
  3. ffmpeg 按场景提取关键帧——不是均匀抽帧,是按画面变化检测场景切换,去掉重复帧
  4. 把帧图片+时间戳字幕一并喂给Claude
  5. Claude「看完」之后回答你的问题

安装:

# Claude Code(推荐,自动更新)
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video

# Codex、Cursor、Gemini CLI等
npx skills add bradautomates/claude-video -g

然后直接问:

/watch https://youtu.be/xxxx 这个视频前30秒用了什么钩子?
/watch bug-repro.mov 帮我看看哪里出了问题
/watch https://youtu.be/xxxx 总结一下,跳过广告部分

我实测的几个场景:

  • 内容分析:别人的视频开头怎么抓注意力的,结构怎么编排的——比手动刷一遍效率高一截
  • Bug复现诊断:同事发你一个屏幕录制bug视频,直接丢给Claude看,它找到问题帧告诉你是哪行代码的问题
  • 长视频总结:1小时的发布会/课程,Claude几分钟读完给你结构化的要点

帧预算控制做得不错——默认根据视频时长自动调节帧密度,短视频密集抽帧,长视频稀疏覆盖。还支持 --start --end 只看某一段,密集抽帧到2fps。token消耗可预期,不会一个视频吃掉你整个上下文。

适合谁:经常需要分析视频内容的创作者、做竞品调研的人、远程团队(同事发bug视频你秒懂)、课程学习者。

⚠️ 依赖 yt-dlp 和 ffmpeg,安装时会自动帮你装(macOS用brew,Linux/Windows会打印安装命令)。需要Whisper API key的场景只在视频没字幕时才用,大部分情况免费字幕够用。

三个项目的共同信号

放在一起看,这周的项目有一个特别明显的共性:AI从「能做什么」转向了「怎么做得更好」。

  • OCR不关心模型参数,关心怎么用同样的模型审出更准的结果、花更少的token
  • ego-lite不关心Agent能力,关心怎么让Agent跟人类和谐共用一个浏览器
  • claude-video不关心视频生成,关心怎么让AI看懂已有视频

都是细节,但都是真实工作流里的瓶颈。模型已经够强了,2026下半年拼的是谁把这些「最后一公里」的工具补齐了。

觉得有用?收藏关注,每日更新AI前沿速递

by 数码罗记·godsun.pro

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注