如果你最近在看 Agent 生态,会发现一个挺明显的转向:大家不再满足于”给我一个能对话的 AI”,而是开始关心记忆和管理。
我这两天刷 GitHub Traning(其实是 Trending,手滑打错了),两个项目同时霸榜,而且是同一天。它们的星数涨得有点吓人,所以我干脆扒开代码看了一遍,跟你说说这两个到底在干嘛。
先说数据,都是刚从 GitHub API 拉的,不是抄的:
- hindsight(vectorize-io/hindsight):44,372 星,5,862 fork,Python,MIT 协议,2025 年 10 月 30 日创建
- paperclip(paperclipai/paperclip):95,898 星,16,255 fork,TypeScript,MIT 协议,2026 年 3 月 2 日创建
paperclip 三个月从零干到近 10 万星,这个速度在整个 GitHub 历史上都属于离谱那一档。
一、Hindsight:给 Agent 装一个会「学习」的大脑
仓库地址:https://github.com/vectorize-io/hindsight
Hindsight 的自我定位就一句话:Agent Memory That Learns(会学习的 Agent 记忆系统)。注意用词,是 learns 不是 recalls(回忆)。
这是它跟市面上绝大多数记忆方案最核心的区别。大多数 Agent 记忆系统在干的事是”把之前聊过的对话存起来,下次检索出来塞回上下文”——本质上就是个高级版聊天记录。而 Hindsight 认为这条路走不远:它主打的是 retain(记住)/ recall(回忆)/ reflect(反思) 三个操作,第三个 reflect 是关键——让 Agent 基于已有记忆做归纳,生成所谓 “mental models”(心智模型)和 “observations”(观察)。
心智模型这东西你可以理解成”经验总结”:Agent 不是记住”张三说他在北京工作”这一条孤立的记忆,而是慢慢归纳出”张三这个人常年出差、偏好线上会议”这种可复用的结论。记忆量大了以后,检索的是结论而不是原始碎片,上下文窗口压力小得多。
存储这块它没走纯向量库的老路,官方推荐 PostgreSQL + pgvector,也支持 Oracle AI Database 23ai(企业级,功能对等)。分库分租户设计是 bank(记忆库) 的概念——每个用户、每个项目一个 bank,靠 metadata 隔离,多租户 SaaS 场景能直接落地。
关于效果,它拿 LongMemEval 这个业内常用的长期记忆基准做了测试,声称是 SOTA(当时最优)。这里我得说句公道话:README 里明确写了,其他竞品的分数是厂商自报,只有它自己的成绩被弗吉尼亚理工 Sanghani 中心和《华盛顿邮报》的研究人员独立复现过。这个测试方法上的差异挺重要,参考的时候心里有数就行。
有意思的是它对现有订阅的态度:只要能接受心跳的 agent 就能塞进来,OpenClaw、Claude Code、Codex、Cursor 都能对接,还有现成的 MCP Server 和 Helm chart。这路子很聪明——不跟你抢生态,做生态的插件。
二、Paperclip:如果你同时开了 20 个 Claude Code 终端,你需要它
仓库地址:https://github.com/paperclipai/paperclip
README 里有一句话我觉得是整个项目最到位的自我注解:
如果 OpenClaw 是员工,那 Paperclip 就是公司。
OpenClaw 那个项目我在之前的文章里聊过——一只住在聊天软件里的自托管龙虾,管的是单个 Agent 自己的事。而 Paperclip 管的是一群 Agent 怎么协作上班。
它的形态是 Node.js 服务端 + React 前端,操作界面长得像个任务管理器(Trello/Jira 那味儿)。但底下不是任务列表那么单纯,是完整的东西:
四大支柱,我按我的理解翻成人话:
- Agent 任务管理——你提需求派任务,Agent 自己干,干完你验货。支持审批门禁、定时例行任务,从 diff、截图、测试结果三个维度审阅产出。
- Agent 组织架构——给 Agent 派职位、设汇报线、管权限边界。人和 Agent 混在同一张组织架构图里。Agent 有老板、有头衔、有 JD。
- Agent 员工培训——Skill Studio 技能工坊、eval 测试集、绩效评估。逻辑跟给真人做绩效考核一套逻辑。
- Agentic OS——跨厂商运行时、沙箱隔离、MCP 服务器、SSO/RBAC、成本管控。
几个我觉得真正戳痛点的设计:
心跳(Heartbeat)机制——Agent 按时间表自己醒来,检查任务列表然后干活。任务委派沿着组织架构上下流转。你不需要一直开着终端盯着,它自己会干活、会续上下文(跨重启保持同一任务上下文,不是每次从头再来)。
成本硬闸——每个 Agent 可以设月度预算,超了直接停。这条太重要了,我见过太多 Agent 半夜跑飞烧掉几百美金的案例。它还把”任务签出(task checkout)”做成原子操作,防止两个 Agent 抢同一个任务重复干活、也防止预算被并发击穿。
自带工单系统 + 不可变审计日志——每次对话都有完整 trace,每个决策都能追溯到原因。做企业的话这块是刚需。
至于它宣传的”如果它能接收心跳就算入职了”——OpenClaw、Claude Code、Codex、Cursor、Bash、HTTP 都能当员工,这个开放度在同类里确实少见。
三、说点实在的
两个项目我都扒了一遍,说几句不好听的。
hindsight 的坑在于它依赖 LLM 做归纳。reflect 这步要调模型做总结,意味着:不省钱、有延迟、还有幻觉风险——万一模型把错误信息归纳成了”心智模型”,那这个错误会被长期固化,比单纯记错更麻烦。他们给的应对是多租户隔离和 evals,但根子上这仍是个用准确率换能力的方案。
paperclip 的坑在于它想当的东西太大了。组织架构、治理、审计、成本控制、培训体系……一套做完是个不小的工程。它 3 月才创建,代码还在 design/pap-14557-monitor-visibility 这种设计文档目录里躺着,迭代很猛但成熟度存疑。而且默认开启遥测收集(PAPERCLIP_TELEMETRY_DISABLED=1 可以关掉),介意的话记得关。
不过话说回来,这两件事恰恰是当下 Agent 落地最后缺的那两块砖。
前面聊过 Letta 和 mem0 这类记忆优先的 Agent 项目,用久了就会发现两个绕不开的痛点:一是你得反复告诉 Agent 同样的背景信息(这正是 hindsight 要解决的),二是 Agent 一多就管不过来了(这正是 paperclip 要解决的)。
一年前 Agent 生态卷的是”谁更聪明”,现在卷的是”谁更能干活、谁更省心、谁更可控”。这大概是行业从 demo 阶段往工程化阶段走的信号。
值得盯。
本文项目均经 GitHub API 实测数据核实,星数为发稿时快照。
by 数码罗记·godsun.pro