语音 Agent 这两年是最容易被营销话术淹没的赛道。Vapi、Retell、Bland、Synthflow 一个个把「AI 打电话」说得天花乱坠,但你打开它们的账单才知道,按分钟计费叠加 STT、TTS、LLM、线路费,一通三分钟的客服电话成本能让你怀疑人生。前几天我在 GitHub 上翻到一个叫 Dograh 的项目,5,788 星,BSD-2-Clause 协议,2025 年 9 月才创建,现在是全网唯一能一条命令自托管、还能自带 LLM/STT/TTS 的开源语音 Agent 平台。今天这篇就把它拆开讲清楚。
它到底是什么
Dograh 的自我定位很直白:Vapi 和 Retell 的开源、可自托管替代品。仓库描述写得很干脆——Open source voice AI platform, self-hosted alternative to Vapi and Retell。
先看硬数据(截至我写稿时从 GitHub API 直接拉的):
- star 5,788 / fork 1,465,主语言 Python
- 许可证 BSD-2-Clause,是真开源,不是挂着 open source 标签的 ELv2
- 2025 年 9 月 9 日创建,不到一年涨到 5.8K 星,还在每天提交(最近一次 push 是 10 月 2 日)
- 最新版本 v1.47.0,9 月 15 日发布,迭代节奏很稳
- 贡献者 65 人,issue 79 个——活跃度在这个体量的项目里算健康
架构上它是 Python 后端,底层挂在 Pipecat 上跑实时语音流水线。这个选择挺聪明:Pipecat 本身 1.6 万星、BSD 协议,LiveKit Agents 1.4 万星,Dograh 相当于把这两块的生态优势收进一个能看能点的壳里。
功能面覆盖得比想象中全:可视化工作流画布(起始节点、Agent 节点、全局指令、工具、转移条件、结束结果)、知识库、QA 节点、Webhook、嵌入组件、工具调用;电话线路支持 Twilio、Vonage、Telnyx、Plivo、Vobiz、Cloudonix,甚至直接接 Asterisk ARI;支持人工转接。存储层可以用自带的 MinIO,也能换 AWS/S3 兼容的对象存储。
上手有多快
它有个我很喜欢的设计:开箱不需要任何 API Key。Dograh 自带签发好的密钥和一套 LLM/TTS/STT 栈,你装完就能跑通第一个电话机器人,想换成自己的模型、自己的语音、自己的线路,随时再接。
自托管就三条命令:
curl -o docker-compose.yaml https://raw.githubusercontent.com/dograh-hq/dograh/main/docker-compose.yaml
curl -o start_docker.sh https://raw.githubusercontent.com/dograh-hq/dograh/main/scripts/start_docker.sh
chmod +x start_docker.sh && ./start_docker.sh
首次启动下载镜像大概 2-3 分钟,跑完开 http://localhost:3010。进去之后选 Inbound 还是 Outbound,给机器人起个名,用 5-10 个字描述清楚用途,点 Test Agent。
这里有个细节我觉得做得比同类好:它给了 Test Audio 和 Test Chat 两个测试入口。Test Audio 是浏览器里直接说话,验证语音链路;Test Chat 是纯文本快速迭代,而且你能在 Test Chat 里编辑、重新播放用户的某一轮对话,Dograh 会从那个节点重新生成回复和转移路径。调提示词的时候这能省掉大量来回打电话的时间。
还有个对当下很应景的东西——Dograh 原生带 MCP server。这意味着 Claude Code、Codex、Cursor 可以直接连进你的 Dograh 工作区,读现有 Agent、查文档、拉节点 schema、用自然语言创建新工作流并保存草稿。官方还做了 Claude Code / Codex 的 setup 插件,一句「set up Dograh」让编码 Agent 自己完成系统检测、部署路径选择、安装和验证。想了解 MCP 在实际项目里怎么落地的,可以看看我之前写的playwright-mcp-basic-intro。
它拿了 Product Hunt 的日榜、周榜、月榜和开发者工具分类月榜第一,团队自称 YC 校友和已退出创业者维护,Better Stack 做过一期实测视频。
说点实话
第一,「自托管省钱」要打个问号。 Dograh 本身不收平台费,这是真的。但语音 Agent 的成本大头从来不在平台,在于 STT、TTS、LLM、电话线路这四项。这四项你自托管了平台也还是要花钱,除非你连 TTS 和 STT 都换成 Whisper、Kokoro 这种本地模型——那就是另一套硬件账了。我站点上写过本地推理怎么选,那套逻辑在这里同样成立。所以别把「开源」自动等于「免费」,要自己拿计算器算一遍每分钟成本。
第二,5.8K 星在语音赛道里不算大,但增速吓人。 对比一下:Pipecat 1.6 万、LiveKit Agents 1.4 万、Bolna 780 星。Dograh 一年不到就干到 5.8K,说明需求真实存在——大家确实想要一个不被厂商锁死的语音底座。但生态厚度还是薄,第三方教程、预置集成、社区沉淀,跟 Vapi、Retell 这些商业平台差着一截。项目 9 月底还有个 HN 讨论里用户反馈通话延迟偏高,这类实时性问题需要你自己压测才能知道。
第三,它更适合谁? 如果你是开发者,要给产品加「打电话」的能力,又不想把通话数据和成本交给 SaaS——Dograh 值得试。Python 玩家、或者已经在用 Pipecat 的团队,接入成本几乎为零。反过来,如果你完全不懂代码、只想开通即用的客服机器人,Synthflow 这类纯 SaaS 更省事;如果你想自己搭可视化工作流画布,Flowise 那篇更对路;如果你的重心是对话设计而非语音,Voiceflow 那篇我已经写过了。
第四,横向 Agent 平台的启示。 把 Agent 平台拆成三层看会清楚很多:底层是模型推理,中间是编排框架(LangGraph、Dify 这类),最上面是场景化的产品外壳。Dograh 站在第三层,把「场景」锁定在语音这一个垂直上,反而做出了差异化。面面俱到的平台往往哪儿都不深,垂直场景的开源项目才是中小团队的机会。
最后一句实话:Dograh 现在的定位更像是「给开发者的语音 Agent 脚手架」,而不是「给老板的语音 AI 生意」。别指望装完就有客户打电话进来——电话线路、号码合规、呼叫频率限制、当地电信牌照,这些脏活一样都躲不掉。
by 数码罗记 · godsun.pro