AI前沿速递|LTX-2开源”声画一体”视频生成、Kimi Code能看视频的编码Agent、Harvey LAB给律师Agent发考卷、MediaCrawler 61K星自媒体爬虫
这周 GitHub 热榜:生成模型、编码 Agent、行业评测、数据采集各占一角,凑齐了 AI 从”造内容”到”干活”再到”验收”的完整链条。最扎眼的是 Lightricks 开源了”声画一体”的视频生成模型,以前音画同步靠后期对轨,现在一个模型直接出片;Harvey 给律师 Agent 出了一套正经考卷;编码 Agent 圈来了个能”看视频”的 Kimi Code;MediaCrawler 涨到 61K 星,数据采集热度没减。逐个说。
1. LTX-2 — ⭐8.6K,首个”声画一体”的 DiT 视频生成基座模型
解决什么问题: 以前的视频生成模型,画面归画面、声音归声音,想让人物开口、音效对上口型,得额外接 TTS 再后期对齐。LTX-2 把音频和视频放进同一个 DiT 架构联合生成,一条 prompt 直接产出带同步声音的画面,官方称这是首个功能完整的音视频基座模型。
核心亮点:
– 单模型同步生成画面+音频,人物说话、环境音一次成型
– 推荐权重 LTX-2.5:22B 蒸馏 Transformer + Gemma4-12B 文本编码器 + 视频/音频双 VAE + 2x 潜空间超分
– 官方 monorepo:ltx-core(推理)、ltx-pipelines(文生/图生视频)、ltx-trainer(LoRA/全参/IC-LoRA 微调)
– 接入了 ComfyUI,节点流里直接玩
– 支持 fp8 量化 + CPU/disk offload,显存不够也能硬跑
上手方式:
uv sync --extra natten # 装依赖,natten 是 Linux+CUDA 最快后端
hf download Lightricks/LTX-2.5 ... # 约 66GB,需先在 HF 同意模型条款
uv run python -m ltx_pipelines.distilled --transformer-path ... --prompt "你的提示词"
实话: 没实测。66GB 权重 + 大显存卡,普通玩家门槛不低;许可证是 Lightricks 自定义社区版,年营收超 1000 万美元的公司商用要付费,个人研究没问题,”开源”得打引号看。
适合谁: 有 24GB+ 显存、想本地跑音视频生成的玩家,以及想研究 LoRA 微调的人。
2. Kimi Code CLI — ⭐6.5K,月之暗面官方编码 Agent,还能”看视频”
解决什么问题: 终端里的 AI 编码 Agent 已不少,Kimi Code 主打”开箱即用”:单二进制安装、秒开 TUI,默认接自家 Kimi 模型,也兼容其他 provider。最特别的是支持把录屏、演示视频拖进对话,让 Agent”看着”干活——比如参考片段转 LUT、录屏变代码。
核心亮点:
– 一行命令安装,不需要 Node.js:curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
– 视频输入:录屏/演示视频直接进对话,Agent 边看边写
– /mcp-config 对话式配置 MCP 服务器,不用手改 JSON
– 内置 coder/explore/plan 子 Agent,隔离上下文并行干活
– 插件市场装 skills/MCP/数据源,装前明示信任等级
– 支持 ACP 协议,Zed、JetBrains 等编辑器直接驱动
– 迭代极快:62 个 release,0.35.0 是 8 月 12 号刚发的
上手方式: 装完 kimi 进项目目录,/login 用 OAuth 或 API Key 登录,然后直接下指令。
实话: 没实测。模型走云端,不是纯本地;”视频输入”是最大卖点但效果没验证过;6.5K 星含金量如何,得自己上手才知道。
适合谁: 用腻了 Codex/Claude Code、想试试国产模型编码 Agent 的开发者。
3. Harvey LAB — ⭐803,给律师 Agent 出的正经考卷
解决什么问题: Agent 吹得再响,法律这种高合规行业,谁敢拿没验证过的模型干活?Harvey(法律 AI 独角兽)开源了这个评测基准,用真实法律任务给 Agent 打分,把”能不能干律师的活”变成可量化、可复现的数字。
核心亮点:
– 1671 个任务,覆盖 25+ 执业领域(含合同审查),任务带完整文档和评分 rubric
– 两大部分:任务数据集 + 执行 harness(自动跑 Agent、打分、出报告、对比 dashboard)
– 全通过制评分 + LLM judge,避免”做对一半算对”
– 官方教程用一整个真实的 M&A 尽调数据室任务走通全流程
– MIT 协议,Python + uv 管理,干净好跑
上手方式: clone 下来 uv sync,跟着 docs/tutorial.md 跑 M&A 案例,从任务检查到评分报告一条龙。
实话: 没实测。803 星还是早期项目,任务集和 harness 都在持续扩充;它不是拿来即用的产品,更适合做研究参考——想给自家垂直行业 Agent 建 benchmark 的,抄它的框架最划算。
适合谁: 法律科技从业者、Agent 评测研究者、想给行业 Agent 建标尺的人。
4. MediaCrawler — ⭐61.6K,多平台自媒体数据采集工具
解决什么问题: 想研究小红书、抖音上的内容生态,手动翻页截图能累死。MediaCrawler 用 Playwright 保留登录态,绕开复杂的 JS 逆向签名,把七大平台的公开数据一键抓下来存库——这也是它常年霸榜的原因:门槛低。
核心亮点:
– 覆盖小红书、抖音、快手、B站、微博、贴吧、知乎 7 大平台
– 基于 Playwright 登录态缓存,不用逆向加密算法
– 支持关键词搜索、指定帖子 ID、创作者主页、二级评论、IP 代理池、评论词云图
– 数据落 CSV/JSON/Excel/SQLite/MySQL 随便选
– Pro 版还有”自媒体内容拆解 Agent”,专拆爆款套路
上手方式:
pip install -r requirements.txt
playwright install
python main.py --platform xhs --lt qrcode # 手机扫码登录后开抓
实话: 没实测。许可证是”非商业学习许可证 1.1″,明确禁止商用和大规模爬取——GitHub 上爬虫被判刑的案例一搜一大把,想商用先掂量法律风险;平台接口经常变,得跟着更新。
适合谁: 做内容研究、给 AI 攒语料的个人学习者;商用和团队项目请绕道。
今晚的观察
视频生成这波明显进入”有声电影”时代:音画同步从”后期补”变成”模型原生”,但代价是权重越来越大、许可证越来越”自定义”——开源这词得拆开看,代码开源≠权重随便商用。
另一个信号是 Agent 赛道开始分层:一边是 Kimi Code 这种”卖铲子”的基建玩家,一边是 Harvey LAB 这种出考卷的裁判员。当人人都在造 Agent,怎么证明它靠谱、怎么验收它的活,就是下一门好生意。数据采集工具热度不减,但合规红线越来越清晰——AI 的燃料是数据,水很深,下水前先看许可证。
以上项目均未深度实测,信息来自各仓库 README 与官方文档,上手前请自行验证。
by 数码罗记·godsun.pro