搞 AI Agent 的这两年,我写过的平台能凑一张excel了。Dify、n8n、CrewAI、Langflow、AutoGen……说白了都是同一个套路:把大模型包成一个「聊天框 + 工具列表」,让它在网页里替我点按钮、填表格、发邮件。
但有一类东西不在这个名单里——它们不看你的 API,不读你的 DOM,直接看屏幕截图,然后自己动鼠标。这条路走得更笨,但更通用:任何软件只要能被鼠标点开,它就都能用。
字节的 UI-TARS 就是这条路上的中国答案。截至今天,这个仓库在 GitHub 上是 39,201 Star、3,971 Fork,Apache-2.0 开源,最后一次提交是 2026 年 9 月 24 日,一次安全修复。它现在已经不叫”UI-TARS-desktop”了——官方把它定位成 TARS 多模态 Agent 栈,一个仓库里装了两个东西。
一个仓库,两个入口
这是它现在最容易被忽略的变化。TARS 栈同时发两条产品线:
Agent TARS —— 给开发者的。CLI 加 Web UI,npx 就能起,也支持 headless server 模式,可以塞进你自己的产品里。它的内核就是 MCP,还能挂载各种 MCP Server 去连真实世界的工具。
UI-TARS Desktop —— 给普通用户的。Electron 桌面客户端,靠 UI-TARS 和 Seed-1.5-VL/1.6 系列模型驱动,给你本机操作、远程机操作、浏览器操作三种操作器。
两条线共用同一套 Event Stream:事件流同时驱动「上下文工程」和前端界面。这也是它跟别家的核心区别——Dify 的工作流是你画好的,CrewAI 的角色是你写好的,TARS 的思路是让模型自己在一条事件流上决定下一步干这个还是干那个。
模型到底有多能打
UI-TARS-2 的技术报告(arXiv 2509.02544)里有一组硬数据,我直接抄给你:
| 榜单 | UI-TARS-1.5 | UI-TARS-2 | 对比对象 |
|---|---|---|---|
| OSWorld | 42.5 | 47.5 | Claude-4-Sonnet 43.9 / OpenAI CUA-o3 42.9 |
| WindowsAgentArena | 42.1 | 50.6 | — |
| AndroidWorld | 64.2 | 73.3 | — |
| Online-Mind2Web | 75.8 | 88.2 | — |
游戏那边,15 款游戏的归一化平均分 59.8,约等于人类水平的 60%,比 OpenAI CUA 高 2.4 倍、比 Claude Computer Use 高 2.8 倍。
但这组数据里有个细节比数字本身更重要:同一批任务,允许用 GUI SDK 时 vs 纯点鼠标时,差距是断崖式的。BrowseComp-en(英文高难多跳检索)纯 GUI 操作只有 7.0%,挂上 GUI SDK 直接到 29.6%。中文版 BrowseComp-zh 从 32.1% 涨到 50.5%。
翻译成人话:纯靠截图点鼠标,天花板很低;给它终端和工具,天花板马上抬起来。 这条结论也解释了为什么 TARS 要把 MCP 做进内核——它自己知道光靠眼睛是不行的。
上手:先别装桌面版
我的建议是,反着来。
先用 CLI 感受一下它「自己决定下一步」是什么样:
npx @agent-tars/cli@latest
零安装,起来之后是个本地 Web UI。模型后端可以随便换:Claude、GPT-4o、Qwen-VL 都行,也支持通过 Ollama 或 vLLM 本地部署走完全离线。
想看 GUI Agent 长什么样,再去下 UI-TARS Desktop 的安装包(Windows/macOS/Linux 都有),或者直接 Docker 拉一个 bytedance/ui-tars-desktop 起在 3000 端口上。
⚠️ 一句提醒:它给你的是你整块屏幕的控制权。上生产环境之前先在虚拟机里试,这是我给自己的规矩。
实话:星数之外的三件事
第一,它已经不是「桌面应用」了。 你去翻 star 记录就知道:2025 年 4 月才 1 万星,现在 3.9 万,一年涨了 3 倍多。但 v0.3.0(2025 年 11 月)之后,npm 上的发布记录就停了——main 分支上全是安全加固提交:防 DNS rebinding 的 Host 头校验、离开 loopback 后强制 token、iframe sandbox 逃逸修复、CSRF 和 CORS 白名单。功能开发基本停了,转去补安全。这对要上生产的人是好事,对想尝鲜功能的人来说是坏消息。
第二,「本地运行」这句话要打个折。 官方宣传 fully local processing,指的是 UI-TARS Desktop 在你本机算完再动手,屏幕内容不上传。但如果你是配的云端模型 API,那数据该走网络还是走网络。真要合规,ollama pull ui-tars-7b 自己跑本地是唯一路径——代价是长链条任务的准确率明显不如云端大模型。
第三,它和浏览器 Agent 是两条平行的路。 我之前写过 Browser Use 那 11.7 万星 那类项目,走的是读 DOM + 模拟点击,快且便宜,但碰上 Canvas、远程桌面、Electron 应用就抓瞎。TARS 走纯视觉,慢且贵,但只要屏幕上能看见就能操作。这俩不是替代关系——正经的生产方案往往是混着用的,我在 Agent 平台怎么选那篇横评 里也提过这个分层。
一句话总结:如果你需要 Agent 去操作没有 API 的老软件——老 ERP、桌面版 CAD、只能点不能调的内部系统——TARS 是目前开源里少数能真正看见你屏幕的方案。如果你只是想搭个 RAG 问答或者接一串工具调用,跑去看 Dify 或者 n8n,成熟度高一个数量级。
Apache-2.0 是真的开源,代码可审可改,敏感环境 fork 之后自己托管模型这条路是通的。
模型与成本:本文数据来自 GitHub API 与 arXiv 2509.02544 技术报告,核对于 2026 年 10 月 5 日。
by 数码罗记 · godsun.pro