AI前沿速递|VoiceStudio 17K星本地版ElevenLabs、OpenWhispr 6.7K星开源听写神器

AI前沿速递|VoiceStudio 17K星本地版ElevenLabs、OpenWhispr 6.7K星开源听写神器

AI前沿速递|VoiceStudio 17K星本地版ElevenLabs、OpenWhispr 6.7K星开源听写神器

语音AI这两年最火的话题,除了大模型本身,就是”本地化”。以前你想用个语音克隆、语音转文字,要么掏钱买商业API,要么把录音传到别人服务器上——多少人一想到自己的声音片段躺在某家公司的数据库里,心里就犯嘀咕。现在风向变了:能跑在你机器上的语音工具越来越多,而且开源。今天这俩项目正好是这波趋势的两个代表,一个管”说”,一个管”听”。

1. VoiceStudio — ⭐17.5K

一句话定位: 开源、全本地的ElevenLabs替代品,语音克隆、声音设计、视频配音、听写、转录、有声书创作一条龙,声称覆盖646种语言。前身叫OmniVoice-Studio,Python写的桌面应用。

解决什么问题: 本地工作流不需要账号、不需要API Key、没有订阅也没有用量计费。你的声音、工程、录音、生成结果默认全部留在本机。零样本克隆,3秒的干净录音就能出活,5到15秒效果更好;内置16个TTS引擎、11个ASR引擎,随时可切换。

核心亮点:
– 跨平台:macOS(Apple Silicon)、Windows 10/11、Linux,外加Docker镜像,一条命令跑起来
– 算力灵活:CUDA、苹果MPS/MLX、Linux下的ROCm、纯CPU都支持
– 内置水印:默认集成Meta的AudioSeal,生成的语音打上人耳听不出的水印,方便溯源防滥用
– 接口开放:桌面应用之外还有本地REST/WebSocket API、OpenAI兼容音频接口、MCP Server,能嵌进你自己的工作流
– 许可证AGPL-3.0;基于OmniVoice、WhisperX、Demucs、GPT-SoVITS、PocketTTS等一堆开源组件

上手方式: 去GitHub Releases下载对应平台安装包;Docker用户一条命令:docker run -d -p 127.0.0.1:3900:3900 palashdeb/omnivoice-studio:stable。首次启动会自动创建Python环境并下载默认模型。

实话: 我没在这台服务器上实测过。项目自己都标注是Active beta,main分支随时可能改。本地语音克隆的真实体验通常取决于显存,而且中文长文生成偶尔会有口音漂移,这些都得你亲自跑一遍才知道。另外别忘了:克隆别人声音前先征得同意,这是红线。

适合谁: 想做视频配音、有声书、语音包的Up主和独立开发者;以及所有在意”我的声音被第三方平台存着”这件事的人。

2. OpenWhispr — ⭐6.7K

一句话定位: 开源、隐私优先的语音听写App,按下热键说话,文字直接出现在光标处。官方定位是Wispr Flow和Granola的免费替代品。Electron/JavaScript写的,跨macOS、Windows、Linux。

解决什么问题: 把”说话”变成”打字”。开会转录、随手记笔记,还能接AI代理把语音文字加工成行动项。核心卖点就俩字:隐私。

核心亮点:
– 本地模型:Whisper(whisper.cpp)和NVIDIA Parakeet(sherpa-onnx)离线转录,音频不出设备
– 云端可选:追求速度可以带自己的API Key(BYOK)走云端,OpenAI、Gemini、Groq都支持
– 无数据采集、无遥测,MIT协议,个人商用都免费
– 技术栈很新:React 19 + TypeScript + Electron,数据用better-sqlite3存本地,自带MCP Server能跟你的Agent工具链打通
– 本地llama.cpp跑LLM做AI文字处理,从识别到加工全程不离机

上手方式: GitHub Releases直接下载安装包,装完设个热键,说话就行。想折腾的可以写自定义ASR shim,接自己非OpenAI兼容的后端。

实话: 同样没实测。听写类工具最大的考验永远是中文:口音、专有名词、中英混说,识别率行不行得自己试。另外”热键听写”这种交互,对键盘肌肉记忆已经固化的老码农来说,改习惯比装软件难。

适合谁: 写文档、回消息、记会议纪要嫌打字慢的人;开会必须录音但不想把内容传上云的打工人。

今晚的观察

这俩项目放一起看特别有意思:一个管声音输出,一个管声音输入,喊的是同一句口号——数据留在本地。语音克隆最敏感的点在于,声音就是你的生物特征,交给商业API等于把”你”永久授权出去;听写最敏感的是”你说了什么”。当输入和输出都能在本地闭环跑通,语音AI才真正从”平台的功能”变成”你的工具”。至于听写能不能替代键盘?我看短期不能全替代,但会议记录、长文口述这些场景,真能省不少手指头。开源的意义就在这:多一个选择,不用等着厂商施舍配额,也不用拿隐私换便利。

以上项目均未深度实测,星数与功能以仓库页面为准,上手请自备显存、耐心和一张同意被你克隆的嘴。
by 数码罗记·godsun.pro

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注