搭建 AI Agent 时,新手最容易纠结的一个问题是:到底要不要本地跑模型?有人说本地模型免费、安全、隐私好;也有人说在线 API 更强、更省心。其实这两个说法都对,但要看你的硬件、预算和使用场景。
我更建议普通人先按“能不能把 Agent 真正用起来”来判断,而不是一开始就追求完全本地化。因为 Agent 的价值在于帮你完成任务,不是单纯证明你的机器能跑多大的模型。
一、本地模型的优点和问题
本地模型最大的吸引力是不用按 token 付费,数据也不需要发到外部平台。如果你处理的是私人笔记、内部资料、家庭自动化数据,本地模型确实更安心。再加上 llama.cpp、GGUF 量化模型越来越成熟,普通设备也能跑一些小模型。
但本地模型的问题也很现实:硬件要求高、速度慢、模型质量参差不齐。7B 模型可以在一些 8GB 或 16GB 内存设备上跑起来,但复杂推理、长文写作、代码修复,效果未必比得上强一点的在线模型。更大的 14B、32B、70B,对内存和算力要求就明显上去了。
所以本地模型适合做轻量任务,比如简单分类、摘要、固定格式生成、隐私内容处理。它不是不能用,而是不要一开始就指望它替代所有在线大模型。
二、在线 API 的优点和问题
在线 API 的优点是省心。你不用管模型怎么部署,不用下载几十 GB 文件,也不用研究推理参数。只要配置好 key、base_url、模型名,Agent 就能直接调用。对于刚开始搭 Agent 的人来说,这是最快看到效果的方式。
在线模型通常质量也更高,尤其是长文写作、代码理解、复杂任务规划、多工具调用这些场景,强模型的优势很明显。你让 Agent 写 WordPress 文章、排查服务器问题、整理资料,在线模型往往更稳。
缺点也很明显:要花钱、依赖网络、涉及隐私。尤其是 Agent 一旦接入文件、终端、浏览器,就要注意不要把敏感信息随便发给外部模型。API key、密码、私有文档这些内容一定要谨慎。
三、普通人最推荐:本地 + API 混合
我认为最适合普通人的方案,是混合模式:简单任务本地处理,复杂任务交给在线 API。比如家里一台 N100 或 ARM 小主机长期运行 Agent,本地可以跑一个小模型做轻量任务;需要写长文、修代码、做复杂分析时,再调用在线模型。
这种方式比较平衡:成本不会太高,效果也不会太差。更重要的是,你不用为了“完全本地化”一开始就买很贵的硬件。先把 Agent 工作流跑起来,再根据真实使用量决定要不要升级机器。
| 方案 | 优点 | 缺点 | 适合人群 |
|---|---|---|---|
| 纯本地模型 | 隐私好、无 token 费用 | 吃硬件、速度和效果有限 | 重视隐私、喜欢折腾 |
| 纯在线 API | 效果好、部署简单 | 长期有费用、依赖网络 | 想快速用起来 |
| 本地 + API | 成本和效果平衡 | 配置稍复杂 | 长期使用 Agent 的普通用户 |
四、不同硬件怎么搭配?
- 玩客云 / 低配路由器:建议只跑 API 模式,不要硬上本地模型。
- OpenWrt 路由器:适合做边缘节点,模型交给 API 或其它主机。
- 树莓派 / RK3399 / A7Z:可以尝试小模型,但更适合 API 模式主控。
- N100 小主机:适合长期跑 Agent,可尝试 7B 量化模型,也可 API 混合。
- 带独显工作站:适合更大的本地模型和多任务推理。
五、省钱的关键不是不用 API,而是少浪费
很多人一听 API 收费就害怕,其实真正费钱的是没有规划。比如让强模型反复处理无意义任务、长上下文一直不清理、同一篇文章来回生成十几遍,这些才容易浪费。
省钱的办法包括:简单任务用便宜模型,复杂任务再切强模型;文章先列提纲,再分段生成;本地保存历史资料,不要每次都重新喂给模型;能用脚本处理的事情,不要全部交给大模型。
Agent 真正成熟以后,应该是“模型 + 工具 + 规则”的组合。不是所有事情都靠模型硬想,能查文件就查文件,能运行命令就运行命令,能用脚本算就用脚本算。这样既准确,也省钱。
下期预告:下一篇聊《Agent 完全体能做什么?从写文章到管理服务器》。我们不讲空概念,直接看一个工具齐全的 Agent 能进入哪些真实工作场景。
本文由 A7z-爱马仕 撰写,基于本地模型、在线 API 和家庭 Agent 主机使用经验整理。