AI前沿速递|HuggingFace语音Agent一条命令本地跑、DeepTutor 31.7K星终身AI家教、SurfSense开源NotebookLM、微软TRELLIS.2图生3D

AI前沿速递|HuggingFace语音Agent一条命令本地跑、DeepTutor 31.7K星终身AI家教、SurfSense开源NotebookLM、微软TRELLIS.2图生3D

AI前沿速递|HuggingFace语音Agent一条命令本地跑、DeepTutor 31.7K星终身AI家教、SurfSense开源NotebookLM、微软TRELLIS.2图生3D

晚上好,又到扒 GitHub Trending 的时间。这周现象挺明显:大厂官方下场抢”语音 Agent”和”3D 生成”,教育类和”给 Agent 供数据”的项目在猛涨星。挑了四个没写过的,老规矩,信息来自 README,没实测的我会明说。

1. huggingface/speech-to-speech — ⭐10.4K,HuggingFace 官方把语音 Agent 打包成一条命令

自己拼过语音助手的都知道:VAD 断句、语音识别、大模型、语音合成,四件套全自己串,光调延迟就能调一晚上。HF 官方直接把整条链路打包了,还拿到了当天 Trending 第一。

  • 核心是一条 VAD → STT → LLM → TTS 的流水线,对外暴露 OpenAI Realtime 兼容的 WebSocket API,OpenAI 的客户端换个地址就能连自己家的服务
  • 每段都能换:STT 用 NVIDIA Parakeet 或 Whisper 系,TTS 用 Qwen3-TTS / Kokoro / ChatTTS,LLM 指向任意 OpenAI 兼容 API 或本地 vLLM、llama.cpp
  • 想全本地跑也行:llama.cpp 起个 Gemma,整条链路不碰云端,数据不出门
  • 已经在给上千台 Reachy Mini 机器人当对话后端,不是 demo 玩具
  • Apache-2.0,带 Dockerfile(含 arm64)

上手是真的简单:pip install speech-to-speech,然后跑 speech-to-speech,服务就起来了。

实话:没实测。Qwen3-TTS 的 CUDA wheel 对版本很挑剔,Linux 上要折腾;纯 CPU 延迟难看。适合有显卡、想掌控语音链路的玩家,只想聊天就用现成 App。

2. HKUDS/DeepTutor — ⭐31.7K,港大数据科学实验室的”终身 AI 家教”

教育类 AI 大多是问答机器,聊完就忘。DeepTutor 想干的是记住你这个人:你学到哪了、哪块没懂、上次怎么教你的,下次接着来。一个月涨了 6 千多星,Apache-2.0。

  • 三层记忆图谱(L1/L2/L3),真·长期记忆,不是把聊天记录堆一起
  • My Agents:把本地 Claude Code / Codex / Gemini CLI 挂进来当”助教”,聊天中途实时调用帮你解编程题
  • Book Engine:把 PDF 变成”活书”——带测验、Manim 动画、交互组件的电子教材
  • Partners:接 15 种 IM 渠道(Telegram、微信、飞书都有),手机上接着学
  • 几乎天天发版;支持 Docker,还写了 rootless Podman 部署文档(加分)

上手:docker compose 起服务,或者 pip 装 deeptutor 包,配好模型 key 就能跑。

实话:没实测。功能多到离谱(101 个 CLI 应用、MCP 商店),全家桶架构,新手上手懵;自托管全得自己扛。适合爱折腾的家长/学生党,小白先玩官方 demo。

3. MODSetter/SurfSense — ⭐15.7K,开源 NotebookLM,顺带给 Agent 装上网

NotebookLM 好用但闭源。SurfSense 是开源替代,这周还把定位改成”给 Agent 提供真实网络数据”——Agent 想查 Reddit 在聊什么、YouTube 评论怎么说,以前全是反爬和限流,现在一个接口搞定。

  • 知识库老本行还在:50+ 文件格式、带引用的混合搜索、双人 AI 播客 20 秒生成、报告导出 PDF/DOCX/LaTeX
  • 新增 10+ 实时数据连接器:Reddit、YouTube、Instagram、TikTok、Amazon、Google Maps、Indeed……全部 REST API 返回结构化 JSON,不用自己写爬虫
  • 自带 MCP server,Claude、Cursor 或任意 Agent 框架直接当工具调
  • 支持 100+ LLM(LiteLLM)和本地模型(Ollama/vLLM),Docker 自托管,自托管不计费

上手:云版注册送 $5 额度直接玩;自托管需要 Docker,跑个安装脚本。

实话:没实测。README 自己承认”还不是 production-ready”;云版连接器按量计费,自托管免费但爬平台有合规风险,自己掂量。

4. microsoft/TRELLIS.2 — ⭐10.2K,微软 4B 参数图生 3D,又快又精细

图生 3D 的老问题:慢、糊、遇到衣服/镂空这类”开放表面”直接崩。TRELLIS.2 用新的 O-Voxel 稀疏体素表示把质量和速度都拉上来,MIT 全开源。

  • 4B 参数模型,512³ 分辨率约 3 秒,1024³ 约 17 秒(H100 上)
  • 能处理开放表面、非流形几何,以前做不了的拓扑现在都行
  • 直接输出带完整 PBR 材质(颜色/粗糙度/金属度/透明度)的 GLB,游戏、渲染管线拿来就能用
  • 训练代码全开源,可以自己微调;有 HF Space 在线 demo 可以先试

上手:门槛是硬性的——NVIDIA 显存 24GB 起步(A100/H100 验证过),conda + setup.sh 装依赖,flash-attn 编译要有点耐心。

实话:没实测,我的小主机连门槛都够不着。个人玩家基本靠在线 demo;想本地跑先确认显存,别装一半发现不够。

今晚的观察

这周榜单的共同点:官方下场。HuggingFace 做语音、微软做 3D,把以前要自己拼的活儿做成了产品,门槛在降。另一个信号:Agent 的竞争从”框架”转向”数据”,SurfSense 卖的不是模型而是实时数据接口——大家都在抢 Agent 的”眼睛”。

吐槽一句:现在开源项目一个比一个会画饼,DeepTutor 要 Docker、TRELLIS.2 要 24GB 显存、SurfSense 要防合规翻车。收藏一时爽,硬盘显卡先不够用了。挑一个真解决你痛点的玩,别全装。

以上项目均未深度实测,信息来自各仓库 README 与官方文档,上手前请自行验证。

by 数码罗记·godsun.pro

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注