AI前沿速递|LiveKit语音Agent能打电话了、Voice-Pro开源平替ElevenLabs、Unstract把PDF榨成JSON、Android官方给Agent发技能包

AI前沿速递|LiveKit语音Agent能打电话了、Voice-Pro开源平替ElevenLabs、Unstract把PDF榨成JSON、Android官方给Agent发技能包

AI前沿速递|LiveKit语音Agent能打电话了、Voice-Pro开源平替ElevenLabs、Unstract把PDF榨成JSON、Android官方给Agent发技能包

今晚这期不聊编码Agent了,换换口味。翻了翻这周 GitHub 的动静,四个项目都挺有意思:两个跟”声音”有关,一个专门收拾 PDF 和发票,还有一个是谷歌官方下场给 Android 开发发 Agent 技能包。想给 Agent 装个嘴和耳朵的、想白嫖配音的、被纸质单据折磨的,这期都有得看。

1. LiveKit Agents — ⭐12.7K,让Agent真正”开口说话”的实时语音框架

LiveKit 是做实时音视频的老玩家,它的 WebRTC 服务器被无数人自托管。这个 agents 仓库就是官方出的 Python 框架,专门用来构建能听、能说、能看的实时语音 Agent——不是打字聊天的,是延迟低到可以打电话的那种。

  • 解决什么问题:想做一个语音客服、语音助手、会议机器人,从零开始要自己拼 STT、LLM、TTS 三大件,还要解决低延迟传输,光 WebRTC 就够喝一壶。LiveKit 把整条链路打包好了。
  • 核心亮点:
  • STT/LLM/TTS 任意组合(Deepgram、OpenAI、Cartesia 等插件化),还能用实时 API
  • 内置任务调度,用户一进房间自动分配 Agent
  • 支持 SIP 电话,Agent 能直接接打电话
  • 语义化轮次检测:用 transformer 判断你说完没说完,减少抢话
  • 原生支持 MCP,一行代码接入工具
  • 自带测试框架,用”评委模型”验收 Agent 表现
  • 上手方式:
pip install "livekit-agents[openai,deepgram,cartesia]"

配好 LIVEKIT_URL 和 API Key 就能跑一个会查天气的语音助手。想省事连 LiveKit Cloud,想全自托管也行,整个链路都是开源的。

  • 实话:我只读了 README 和示例代码,没实际部署。那套 WebRTC 环境变量对新手不算友好。适合想正经做语音产品、不介意折腾的开发者。

2. Voice-Pro — ⭐12.1K,开源”声音全家桶”,平替 ElevenLabs

一个韩国小团队做的 Gradio WebUI,把创作者需要的音频功能全塞进一个网页:YouTube 下载、人声分离、语音识别、翻译、TTS、零样本声音克隆、RVC 变声,README 直接把自己定位成 ElevenLabs 的开源替代。

  • 解决什么问题:做配音、字幕、多语言视频,以前要装五六个工具来回倒文件,这个全在一锅里炖。
  • 核心亮点:
  • 零样本克隆支持 E2/F5-TTS、CosyVoice,几秒音频就能克隆音色
  • TTS 内置 Edge-TTS 和 kokoro
  • Whisper 做识别,Demucs 做人声分离
  • 翻译成多语言再配音,一条龙
  • 上手方式:仓库里有一键启动脚本(one_click.py / start.sh / start.bat),Windows 和 Linux 都能跑,还有中文 README,对小白相当友好。

  • 实话:没实测。克隆效果和显存占用要看具体模型,显卡差的别指望跑满血版。适合做视频、播客、字幕的创作者。注意是 GPL-3.0,商用前看清条款。

3. Unstract — ⭐7.1K,把PDF、扫描件”榨”成结构化JSON

这名字起得挺损——un-stract,把”非结构化”抽干。用 LLM 从 PDF、发票、扫描件、图片里抽取结构化数据,你只需要用自然语言描述想要什么字段,剩下的交给 Prompt Studio。

  • 解决什么问题:传统文档抽取要针对每家供应商写正则、做模板,换个单据格式就崩。Unstract 写一次 prompt 通吃各种版式。
  • 核心亮点:
  • Prompt Studio:用自然语言定义抽取 schema,不用写代码
  • REST API 部署:文档进,JSON 出
  • ETL 管道模式:文件夹自动处理,直进数据仓库
  • 自带 MCP Server 和 n8n 节点,能接进 Agent 和自动化流程
  • LLM 随便换:OpenAI、Anthropic、Bedrock、Ollama 都行
  • 上手方式:Docker Compose 一把梭,或者 run-platform.sh 直接起。架构有点重(Django+Celery+Redis+RabbitMQ+PostgreSQL),小内存机器别硬上。

  • 实话:没实测。AGPL-3.0 协议 + 内置 Posthog 统计(可关),公司商用前务必过一遍法务。适合财务、保险、KYC 这类被纸质文档折磨的团队。

4. Android Skills — ⭐6.6K,谷歌官方给编码Agent发的”技能包”

谷歌官方下场了,把 Android 开发里 LLM 表现最差的一批场景做成标准化的 Agent 技能(SKILL.md),让 Claude Code、Codex、Gemini 这些编码 Agent 照着官方最佳实践干活。

  • 解决什么问题:AI 写 Android 代码经常”看起来对、跑起来错”,尤其 AGP 升级、CameraX、edge-to-edge 适配这类坑多的活。官方把踩坑经验沉淀成技能,Agent 干活前先读。
  • 核心亮点:
  • 只挑 LLM 不擅长的场景做,不在 Compose 基础写法上浪费
  • 覆盖 AGP 9 升级、r8 分析、Compose TV 迁移、Wear、XR 眼镜、Intent 安全等
  • 遵循 agentskills.io 开放标准,装了就能被 Agent 自动触发
  • 支持 Gemini/Antigravity、Claude Code、Codex 多生态
  • 上手方式:
android skills add --all   # 全装
android skills add --skill=r8-analyzer --project=.  # 按需装

默认装给 Gemini 和 Antigravity,其他 Agent 也能指过去。

  • 实话:没实测,但官方仓库质量下限有保障。目前不接受公开贡献,只能提 issue。适合所有用 AI 写 Android 的人——现在这基本就是一半程序员。

今晚的观察

这周四个项目有个共同点:都在往”落地”使劲。LiveKit 让 Agent 有嘴有耳能打电话,Voice-Pro 把声音克隆做成小白也能点的一键脚本,Unstract 盯上的是最无聊但最赚钱的文档处理,连谷歌都把”技能包”这种玩法从个人仓库推广成了官方标准。声音、文档、技能,全是离钱近的活儿。

另一个感觉是:Agent Skills 这股风是真刮起来了。从 mattpocock 的个人技能库到谷歌 Android 官方技能包,连 LiveKit 都出了自己的 agent-skills——以后”给 Agent 装技能”大概会跟装插件一样日常,谁家的技能包先做成标准,谁就占了先手。

以上项目均未深度实测,信息来自各仓库 README 与官方文档,上手前请自行验证。

by 数码罗记·godsun.pro

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注