AI前沿速递|开源Agent狂飙、本地推理成基建、免费API遍地开花
今晚又刷了一波GitHub trending和各路榜单,说实话有点上头——2026年过半,AI开源圈的卷法已经超出想象。去年这时候大家还在讨论”Agent到底能不能用”,现在GitHub上Agent框架满天飞,本地推理工具Stars破十万,免费API额度多到薅不完。
今晚的速递,我把最近最值得关注的8个项目整理了一下,按主题分好,各位各取所需。
🔥 AI Agent框架:谁是2026年的”Agent之王”?
1. OpenCode — 开源Coding Agent的新王
- Stars: ~160K 🔥
- GitHub: anomalyco/opencode
- 核心亮点: MIT协议,完全开源,provider无关——Claude、GPT、Gemini、本地模型随便接。终端TUI做得漂亮,还有桌面端beta。单日+343 stars的增长速度,半年时间从0冲到160K,GitHub历史上增长最快的开源项目之一。
- 适用场景: 日常写代码、代码审查、重构,想用开源替代Claude Code的第一选择
- 一句话: Claude Code的开源替代,160K Stars不是吹的
2. OpenHands — 自托管AI软件工程师
- Stars: ~78K
- GitHub: All-Hands-AI/OpenHands
- 核心亮点: 前身OpenDevin,给AI Agent一个沙箱环境让它自主写代码、跑命令、迭代。支持任意LLM后端,自托管,有Agent Server + Automation Server架构,适合企业级场景。
- 适用场景: 团队级代码自动化、CI/CD集成、自主编程Agent
- 一句话: 想在自家服务器跑一个Devin?OpenHands是目前最成熟的选择
🚀 本地推理引擎:你的显卡,就是你的API
3. Ollama — 本地LLM的Docker
- Stars: ~174K
- GitHub: ollama/ollama
- 核心亮点: 一行命令拉模型、一行命令跑推理,兼容OpenAI API格式。v0.30.8刚发布,支持DeepSeek V4 Pro、Qwen 3.6、GLM-5.1、MiniMax M3等最新模型。本地跑完直接推到云端Ollama Hosted,开发和部署无缝切换。GitHub历史上Stars增速最快的AI项目之一。
- 适用场景: 本地开发调试、隐私敏感场景、想快速体验新模型
- 一句话: 本地大模型的Docker,174K Stars,AI圈的”国民级工具”
4. llama.cpp — 百万开发者的推理底座
- Stars: ~100K+
- GitHub: ggerganov/llama.cpp
- 核心亮点: 2026年3月突破100K Stars,速度比PyTorch和TensorFlow都快。GGUF格式已成事实标准——HuggingFace上60%以上的量化模型都用GGUF。本地推理成本约$0.002/百万tokens,对比云端API的$2.5-$15/百万tokens,差了1000倍。几乎所有本地推理工具(包括Ollama)底层都跑的llama.cpp。
- 适用场景: 极致性能优化、嵌入式/边缘部署、自定义量化
- 一句话: 不是最友好的,但是最底层的——没有llama.cpp就没有本地推理生态
5. vLLM — 生产级高吞吐推理引擎
- Stars: ~83.4K
- GitHub: vllm-project/vllm
- 核心亮点: PagedAttention核心技术,单GPU吞吐量碾压原生Transformers数倍。2026年密集更新:Semantic Router、TurboQuant量化、Mooncake存储分离、GB300上的DeepSeek-V3.2优化。2800+贡献者,8200+项目依赖。如果你要在线上serve模型,vLLM几乎是目前唯一靠谱的选择。
- 适用场景: 线上模型服务、高并发推理、企业级LLM部署
- 一句话: 本地用Ollama,线上用vLLM,这已经是2026年的标准答案
🧠 Agent记忆与知识图谱:让Agent不再”金鱼脑”
6. Mem0 — AI Agent的通用记忆层
- Stars: ~58K
- GitHub: mem0ai/mem0
- 核心亮点: 向量数据库+知识图谱双存储架构,解决Agent”对话结束就失忆”的问题。2026年Q1累计80K+ Stars(含生态项目),采用率最高。支持用户级/会话级/Agent级记忆分层,自动提取实体关系。
- 适用场景: 对话式Agent、个性化推荐、长期记忆需求
- 一句话: Agent生态里增速最快的记忆方案,用的人最多
7. Graphiti — 时序知识图谱引擎
- Stars: ~27K
- GitHub: getzep/graphiti
- 核心亮点: 把”时间”作为一等公民的知识图谱——每条边都有时间戳,支持双向时序查询。Zep团队出品,在Agent记忆基准测试中得分71.2%。不是简单的向量搜索,而是真正的”知识会过期、会更新”的图谱系统。
- 适用场景: 事实会随时间变化的场景(新闻、金融、合规)、需要时序推理的Agent
- 一句话: 别人的记忆是”存了什么”,Graphiti还知道”什么时候存的,还过不过期”
🔗 MCP生态:14,000+服务器的工具链爆炸
8. awesome-mcp-servers — MCP生态的百科全书
- Stars: ~60K+
- GitHub: punkpeye/awesome-mcp-servers
- 核心亮点: 收录300+生产级MCP服务器,覆盖数据库、浏览器自动化、文件系统等。MCP协议已被Anthropic捐给Linux Foundation的AAIF(Agentic AI Foundation),由OpenAI、Google、Microsoft、AWS联合治理。2026年MCP生态已有14,000+服务器,Supabase、Notion、Figma、Slack都上线了远程HTTP端点,一行URL就能接入。
- 适用场景: 给Agent接工具、打通SaaS生态、MCP服务器选型
- 一句话: MCP就是Agent世界的USB接口,这个仓库是接口大全
💰 附送:2026年免费大模型API速查
既然聊到推理,顺带整理一下目前最值得薅的免费API额度:
| 平台 | 免费额度 | 亮点 |
|---|---|---|
| Google AI Studio | Gemini 2.5 Flash 30RPM/1440RPD | 额度最高之一,需梯子 |
| 硅基流动 | 1000 RPM/模型 | DeepSeek/Qwen3直连,国内首选 |
| 智谱GLM | GLM-4-Flash永久免费 | 国内最稳兜底方案 |
| 月之暗面Kimi | 2000次/天 | 256K超长上下文 |
| NVIDIA NIM | 无限次调用,40RPM | Kimi/MiniMax等开源模型 |
| GitHub Models | 150 RPD | GPT-4.1-free、GLM-5-free |
| 火山引擎 | 新用户7000万+ Tokens | 豆包Seed-2.0、DeepSeek-V3.2 |
| Fireworks AI | 免费$1积分 | 高并发支持 |
📝 今晚的观察
三个趋势越来越清晰了:
-
本地推理从实验走向基建——Ollama 174K Stars、llama.cpp破10万、vLLM 83K,三件套已成标配。不是”能不能本地跑”的问题,而是”不本地跑你数据怎么保证安全”。
-
Coding Agent赛道内卷到飞起——OpenCode半年160K Stars打破历史记录,OpenHands 78K、Cline 63K、Codex CLI 85K,每个都想当”AI程序员的默认入口”。2026下半年估计要洗牌了。
-
MCP从协议变成生态——14,000+服务器,Linux Foundation背书,大厂全部入局。Agent的”手”终于有了标准接口,不再是各自造轮子。
觉得有用?收藏关注,每日午间+晚间更新AI前沿速递 🚀
作者:A7z-爱马仕
by 数码罗记·godsun.pro