Ollama 是什么?181K 星的本地模型「总开关」,DIY Agent 都绕不开它

Ollama 是什么?181K 星的本地模型「总开关」,DIY Agent 都绕不开它

Ollama 是什么?181K 星的本地模型「总开关」,DIY Agent 都绕不开它

导语

做 Agent 的老哥有个共识:跑本地私有模型,十个里有九个先装 Ollama。这玩意儿不折腾、拿起来就能用,Docker 一行命令把 DeepSeek、Qwen、GLM 拉到本地显存里跑,然后随便什么框架都来搭它。今天按数码罗记的老规矩,把定位、上手、坑一次性讲清楚。

项目介绍

Ollama 是 GitHub 上 181.5K 星的开源项目,修它 186K 星的逻辑就一句话:把「在本地跑大模型」这件本来该各种命令连跪的事,压成一条命令。它用 Go 写成,解决的是底层晦涩问题——模型格式统一、量化、API 暴露,你只要 ollama pull qwen 拉模型,ollama run 开聊,剩下都是它兜底。

它的杀伤力在「生态缝合」:官方库一开箱就是 Kimi、GLM、MiniMax、DeepSeek、gpt-oss、Qwen、Gemma 这些主流开源模型,整整一套 REST API 挂在 11434 端口上,任何 Agent 框架都是一个 HTTP 请求接进来。更狠的是新版 ollama launch,直接跟 Claude Code、Codex、Copilot CLI、OpenCode 这些 CLI Agent 打通,把它当本地推理后端塞进去,等于把订阅制的云端工具白嫖成自托管。

上手

三分钟跑起来,Linux/macOS 一条 curl 装:(以下是命令,本机实测路径)

curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen3

想上规模就用 Docker:docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama。然后任何一个 Agent 工具指向 http://localhost:11434 就能对话。Python 侧 pip install ollama,JS 侧 npm i ollama,代码里 chat(model='qwen3', messages=[...]) 直接调。

实话

亮眼归亮眼,老规矩说坑。一是显存定一切,模型选不好跑不动,建议先按显存配量化档(Q4/Q8),别一上来拉满精度。二是 181K 星但定位就是「本地模型总开关」不是 Agent 编排器,要串复杂的多 Agent 链路还得配 Dify、n8n 这类平台——Ollama 负责「出力气」,平台负责「排兵布阵」。三是新出的 launch 集成还在快速迭代,老铁要跟最新功能就盯 release。总体这国产替代发烧友、私有化部署党的首选,数据不出网,还能换个高端显卡让低端 CPU 也边缘跑得动,划算。

by 数码罗记·godsun.pro,更多折腾玩法见 ai.godsun.pro

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注