AI前沿速递|Cloudflare给Agent发”电脑”、pdf-inspector免OCR拆PDF、科学Agent技能包32K星、Spring之父转行写JVM Agent框架
今天刷 GitHub Trending,四个项目四个方向:云厂商开始给 Agent 发”电脑”了、PDF 解析卷到纯 Rust 两百毫秒、科研圈把 Agent 技能做成了标准件,最后还冒出个重磅——Spring 之父亲自下场写 Agent 框架。逐个说人话。
1. cloudflare/computer — ⭐4.9K,Cloudflare 给 Agent 发了一台”电脑”
解决什么问题:Agent 现在普遍缺一个”能干活的落地点”——沙箱要么太重要么太玩具。Cloudflare 干脆在自家 Durable Object 里塞了一个虚拟文件系统(SQLite 存权威状态),再给一个统一执行入口 workspace.runtime.exec(),三种后端随便挑。
核心亮点:
- 容器后端:把文件系统通过 FUSE 挂进沙箱容器,完整 Linux 用户态、真二进制、真网络
- Isolate 后端:不启动容器,直接在 Dynamic Worker 里跑 shell(just-bash)或 ECMAScript 模块,省掉同步往返
- 一套 Workspace 多后端:稳定 ID 注册,懒连接,先用哪个挂哪个
- 示例齐全:agent 写 markdown → 容器里跑 pandoc → 出 PDF;@cloudflare/think 聊天 agent 直接拿 workspace 当工作目录
上手方式:npm install @cloudflare/computer,按包 README 的入口映射走;examples/ 里 8 个可跑示例,从最简单的 worker-shell 开始。
实话: README 第一行就写着 PREVIEW ONLY——API 不稳定、设计随时变,官方明说别上生产。我没实测,纯读文档加示例代码。想提前摸 Cloudflare 路子的人可以玩,生产项目先别押注。
适合谁:已经在 Workers 生态里、想给 Agent 配一个”官方牌”沙箱文件系统的开发者。
2. firecrawl/pdf-inspector — ⭐12.6K,PDF 智能分诊:两百毫秒判断要不要上 OCR
解决什么问题:RAG 和文档解析最大的冤枉钱是”见 PDF 就上 OCR”——实际约 54% 的 PDF 是文本型,根本不需要。Firecrawl 把这个判断做成纯 Rust 库,10-50ms 出分类结果,带置信度和按页 OCR 路由建议。
核心亮点:
- 四分类:TextBased / Scanned / ImageBased / Mixed,配置信度分数
- 位置感知抽取:字体信息、X/Y 坐标、多栏报纸排版自动排阅读顺序,支持 RTL
- 直接转干净 Markdown:标题、列表、代码块、表格(矩形+启发式双模式)、粗斜体、链接全给你
- 零 OCR 零模型:不依赖任何 ML 模型,唯一依赖是 lopdf
- 绑定全家桶:Python / Node.js / 浏览器 WebAssembly,浏览器里也能本地跑
- 基准能打:opendataloader-bench 200 份 PDF 总体分 0.875,200 份跑完 0.47 秒,比 pymupdf4llm(17 秒)快三十多倍
上手方式:CLI 一条命令 cargo install pdf-inspector,然后 pdf2md document.pdf 直接转 Markdown;Python 党 pip install pdf-inspector,三行代码出结果。
实话: 没实测,基准来自官方 README(M4 Pro 上跑的,数字漂亮但得自己复现)。扫描件它不做抽取,只告诉你”这页该上 OCR”——设计如此,不是缺陷。
适合谁:做 RAG 管道、文档解析服务的人,能把 OCR 成本砍掉一大半,金融、法律、论文这类文本型 PDF 大户尤其划算。
3. K-Dense-AI/scientific-agent-skills — ⭐32.9K,把任意 Agent 变成 AI 科学家
解决什么问题:科研人员用通用 Agent 干活,痛点永远是”工具链没人教”——RDKit 怎么调、PubChem 怎么查、DICOM 怎么读,每次现场翻文档。这项目把 158 个科研技能打包成标准件,按开放 Agent Skills 标准做,Cursor、Claude Code、Codex、Antigravity 通吃。
核心亮点:
- 158 个现成技能:基因组学、药物发现、蛋白质设计、医学影像、地理空间、材料科学等 19 个学科方向
- 100+ 数据库直达:PubChem、ChEMBL、UniProt、ClinicalTrials.gov 等 78 个公共库统一查询,BioServices(40+ 服务)、BioPython(39 个 NCBI 子库)都在里面
- 70+ 优化过的 Python 包技能:RDKit、Scanpy、PyTorch Lightning、pymatgen、Qiskit,带版本约束和最佳实践
- 每个技能配文档+测试:SKILL.md + 示例 + 测试套件,CI 强制新技能必须带测试
- 配套桌面版:K-Dense BYOK,带自己 API key 的 AI 科研助手,数据不出本机
上手方式:把 skills 目录拷进 Agent 的技能目录,兼容 Agent Skills 标准的宿主会自动发现;README 有学科索引,按需取用。
实话: 没实测。”170,000+ 科学家在用”是官方口径,没法验证;158 个技能质量参差,有测试套件不代表个个靠谱。适合真做科研、愿意花时间挑技能的人,指望开箱即用全流程的会失望。
适合谁:生物、医药、化学方向的科研人员,以及给科研团队搭 Agent 工作流的人。
4. embabel/embabel-agent — ⭐4.0K,Spring 之父的新玩具:JVM 上的 Agent 框架
解决什么问题:Agent 框架满大街都是 Python 和 TypeScript,Java/Kotlin 企业级生态一直缺一个正经选项。Embabel 是 Rod Johnson——对,就是写了 Spring 的那位——的新项目,把 agentic flow 搬上 JVM,直接接 Spring 全家桶。
核心亮点:
- 真规划器:不是有限状态机硬编码,系统自己规划动作序列,每个动作执行完重规划(OODA 闭环),能干”没被编程过”的活
- 强类型领域模型:Actions / Goals / Conditions 由类型化对象驱动,告别魔法字典,IDE 重构照常
- 两套写法:Spring MVC 风格的 @Agent / @Goal / @Action 注解,或 Kotlin DSL 的
agent { }块 - 深度 Spring 集成:Spring 容器注入管理 agent、AOP 装饰函数,事务持久化现成
- 模型混排:不同任务用不同 LLM,本地小模型干点活,省钱又保隐私
上手方式:Maven 引 com.embabel.agent:embabel-agent-api,照文档写第一个 @Agent 类;官方还有个用 Embabel 自己写的文档问答机器人 hub.embabel.com 可以调戏。
实话: 没实测,版本还在 1.5.0-SNAPSHOT,项目相对早期。4K 星在 Agent 赛道不算多,但作者分量够重。适合 Java/Kotlin 后端尝鲜,Python 党可以无视。
适合谁:企业 Java 后端团队——想把 Agent 嵌进 Spring 服务,又不想引一堆 Python 微服务。
今晚的观察
四个项目凑一起,信号其实很清楚:Agent 的基础设施在分层。Cloudflare 管”Agent 的电脑”,pdf-inspector 管”Agent 的输入”,scientific-agent-skills 管”Agent 的专业能力”,embabel 管”Agent 进企业”。去年热门还是”又一个聊天机器人”,今年已经卷到给 Agent 配文件系统、配数据库、配职业执照了。
另一个信号:Rust 和 Kotlin 都在偷偷渗透 AI 工具链。pdf-inspector 用 Rust 卷性能,embabel 用 Kotlin 卷企业级——AI 不只有 Python 一种写法。
以上项目均未深度实测,信息来自各仓库 README 与官方文档,上手前请自行验证。
by 数码罗记·godsun.pro