AI前沿速递|video-use 21K星让编码Agent剪视频、pdf-inspector 16K星Rust PDF识别

AI前沿速递|video-use 21K星让编码Agent剪视频、pdf-inspector 16K星Rust PDF识别

AI前沿速递|video-use 21K星让编码Agent剪视频、pdf-inspector 16K星Rust PDF识别

这阵子 GitHub 上的风向挺明显:Agent 开始”跨界”碰内容生产了。browser-use 团队前天放出的 video-use 一周干到 21K 星,玩法是让 Claude Code 这类编码 Agent 直接给你剪片子;另一边 firecrawl 的 pdf-inspector 用 Rust 写了个 PDF 识别器,专门解决”这PDF到底是扫描件还是文本件”的老问题。一个管动手,一个管识货,都挺狠。

1. video-use — ⭐21.2K

一句话定位: 教编码 Agent(Claude Code 等)直接剪辑视频的开源方案,写代码的 Agent 从此也能当剪辑师。

解决什么问题? 传统剪片靠人肉拖时间轴,或者靠 CapCut 那类 GUI 一步步点。video-use 的思路是把剪辑当成”代码任务”:Agent 读你的视频素材,用 FFmpeg 命令和脚本完成裁剪、拼接、字幕、转场,你在旁边口头提需求就行——”把前 3 秒去掉,B 站横屏比例,加个结尾字幕”。

核心亮点:
– 仓库自带 skills/manim-video 等技能包,Agent 加载后按 SKILL.md 里写好的制作规范执行,不是瞎剪
– 基于 browser-use 自家的 Agent 生态,和 Claude Code / Codex 等 CLI Agent 配合顺手
– MIT 协议,纯 Python + FFmpeg,无重型依赖
– 官方给了完整的 production rules(SKILL.md),包括成片质检流程

上手方式: clone 仓库,把 skills 目录挂给 Claude Code(或你用的 Agent),装好 FFmpeg,扔几个视频素材进去就能开始指挥。

实话: 没实测。让 Agent 剪片最大的坎在于”审美”——它能按规则执行 100% 的技术动作,但节奏感、留白、氛围这种东西规则写不全,成品大概率是”规范但平庸”。适合批量流水线片(口播、教程切片、混剪),不适合讲究艺术表达的作品。

适合谁: 做教程/口播切片的内容团队、每天要出 N 条短视频的运营、以及想给 Agent 加”视频技能”的开发者。

2. pdf-inspector — ⭐16.4K

一句话定位: firecrawl 开源的 Rust PDF 检查库,快速判断一份 PDF 是扫描件还是文本件,并完成分类和文本提取。

解决什么问题? 处理文档批量任务的人都有这痛点:一批 PDF 混着扫描版和文本版,扫描版要先 OCR 才能提取文字,文本版直接抽就行。如果用同一套流程处理,要么 OCR 白跑一遍浪费时间,要么漏了扫描件后面全乱。pdf-inspector 就是那个”先分诊”的家伙——看一眼就知道该走哪条路。

核心亮点:
– Rust 写的,性能快,适合大规模文档流水线
– 智能识别 scanned vs text-based PDF,让后续路由决策自动化
– 分类 + 文本提取一条龙,接口干净
– firecrawl 出品(抓网页那家),文档工程功底在,MIT 协议

上手方式: cargo 加依赖,或者看仓库 docs/ 里的集成示例,丢个 PDF 路径进去拿分类结果。

实话: 没实测。这类”前置分类”库单看很不起眼,但放进文档解析流水线里能省不少事——尤其配合 OCR 工具做路由,能把整个管线的速度提上去。16K 星对一个小工具库来说挺夸张,说明文档处理的自动化需求真的在爆发。

适合谁: 做文档解析/RAG 预处理的技术人、给 Agent 知识库做清洗的开发者、整天和 PDF 打交道的办公自动化选手。

今晚的观察

两个项目凑一起看,其实是一件事的两面:Agent 想真正帮人干活,就得先从”看”开始。video-use 解决 Agent 怎么”看”视频并动手改,pdf-inspector 解决怎么”看”文档再决定下一步。视觉输入、文件分诊、工具调用,这些基础能力的厚度,决定了 Agent 离”替你干活”还有多远。别光盯着谁家模型又刷榜了,工具链这层正在悄悄变强。

以上项目均未深度实测,内容基于仓库 README 与文档整理,仅供参考。
by 数码罗记·godsun.pro

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注