Onyx 是什么?3.2万星的企业知识 Agent 底座,把 Glean 那套开源了

Onyx 是什么?3.2万星的企业知识 Agent 底座,把 Glean 那套开源了

Onyx 是什么?3.2万星的企业知识 Agent 底座,把 Glean 那套开源了

你有没有过这种经历:想问同事”去年那个功能的验收标准写在哪儿”,翻了 Slack、Confluence、Google Drive、GitHub,四十分钟后还是得开个会问本人。

大模型能帮你省时间,但有个硬前提——它得先知道你公司里有什么。Onyx 就是干这一件事的:把散在几十个应用里的知识索引成一个底座,然后让 AI Agent 和同事共用这一层。它不是又一个聊天 UI,而是给 AI Agent 用的公司记忆体。

它是谁

Onyx 是 YC W24 的旧金山团队做的,2023 年成立,二十来号人,主创 Yuhong Sun 在 Alation 做过 NL-to-SQL 和混合检索,Chris Weaver 是 Robinhood 的 TL。仓库在 onyx-dot-app/onyx,GitHub 32.3K 星、4.5K fork、1 万多次提交,2026 年 9 月底还在每天提交。

这项目的前身叫 Danswer,改名过来的——同一套代码、同一条 GitHub 历史、同一个 YC 批次,融资也跟着延续。所以你在老文章里看到 Danswer 不用怀疑,就是它。

2025 年 3 月拿了 1000 万美元种子轮。顺带排个雷:搜索”onyx 融资 1.13 亿 B 轮”出来的那个 Onyx Security 是一家做 AI 安全的另一家公司,跟这个项目没关系,别搞混。

到底解决什么

Onyx 的逻辑是:别让 Agent 每次都现去翻。README 里写得很直白——Agent 靠协调和反复调用几十个 MCP 搜索动辄烧掉几万 token,而 Onyx 直接在自己的知识表示里一次性把上下文捞出来、过滤成最相关的真实文档。

检索这块是真下了功夫的:向量索引加关键词索引的混合检索,配 prefix-aware embedding(对比损失训练)和 BM25,再叠 rerank 和查询扩展。文档站还提到用了上下文检索和 AI 生成的知识图谱。

接数据源方面,README 写的是 50+ 应用,Google Drive、Slack、GitHub、Confluence、Salesforce 这些常见的都在列。权限是跟着源一起继承的——这是它和”把文档全塞进向量库”的关键差别。

上手

官方给了一条命令:

curl -fsSL https://onyx.app/install_onyx.sh | bash

交互式脚本,会帮你装 Docker、拉配置、起全套服务。部署支持 Docker、Kubernetes、Helm、Terraform,仓库里连 terraform-provider-onyx 都给你写好了。

但硬件这块得先看清楚,官方明确写了最低要求:

模式 最低配置 放弃了什么
Standard 4 vCPU / 10GB 内存 / 32GB 磁盘 无,全功能
Lite 2 vCPU / 2GB 内存 / 10GB 磁盘 连接器、RAG 检索、向量召回

Standard 是十一个服务的 compose(Vespa + Redis + 模型服务 + Celery worker),Lite 本质就是个轻量聊天 UI,不建索引。想先看看长什么样,Lite 足够;真要接公司数据,Standard 起步 10GB 内存。

用起来之后入口很多:Web 和桌面端、Slack/Discord 机器人、MCP server(可以直接指给 Claude Code、Codex、OpenCode 用)、Chrome 扩展、能嵌进自家网站的 widget。手机上还有客户端。

模型随便接:Ollama、LiteLLM、vLLM 这类自托管的,OpenAI、Anthropic、Gemini 这类闭源的都行。

说实话

三点。

第一,MIT 许可只覆盖 Community Edition。 企业版(SSO、SCIM、RBAC、白标)单独授权,你要有合规硬需求,开源那一半只能顶个七成。

第二,别指望它替代 Glean 的全部能力。 Glean 闭源、估值 72 亿、ARR 3 亿,还有 OpenAI 挑过刺——这些是真本事,Onyx 的价值在于它把 60~70% 的场景用 MIT 协议免费给你了。云版标价 20 美元/用户/月,对照着看就行。

第三,这仓库正在被 Agent 一起开发。 我翻提交记录时看到 Co-authored-by: Claude Fable 5、Co-authored-by: Cursor、Co-authored-by: Codex,CI 里还有 Devin 在同步模型目录。这既是效率也是信号——这项目自己就是它主打那套玩法的活样本。

另外文档站挂了个预告:权限模型要改成 group-based,Curator / Global Curator 角色会移除。已有部署的现在该看一看了。

适合谁

  • 已经有几十人规模团队、资料散在三四套系统里、痛点是”找不到东西”的公司。
  • 有合规红线、数据不能出厂、又不想被按人头收费卡住的团队。
  • 想给 Claude Code / Codex 这类编码 Agent 喂公司上下文的开发者——MCP 那条路是真的好用。

个人玩家、家用两三台机器就折腾的,看这篇就够:AnythingLLM 那种轻量自托管;纯聊天入口,Open WebUI 星更多更省事。RAG 引擎本身怎么选,看 RAGFlow 那篇。要盯着 Agent 上线后的表现,配合 Langfuse 一起用。

Onyx 值得单独开一篇,是因为它代表了一个方向的确立:Agent 平台的下半场不是让 Agent 更聪明,是让它知道你们公司到底有什么。 谁的上下文层建得好,谁的 Agent 才敢真干活。


by 数码罗记·godsun.pro

本文数据核对于 2026 年 10 月 3 日,star 数、提交记录、许可条款与硬件要求均取自 GitHub 仓库与官方文档实时内容。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注