写 Agent 的这两年,大家都在给 AI 配工具、配 API、配浏览器。但有件事一直没被解决干净:让 Agent 像个真人一样,去点那些没有 API 的老软件。今天这个项目,做的就是这个的地基。
这是谁
Cua(GitHub 上叫 trycua/cua)是一个 MIT 协议的开源项目,自我定位一句话就能说完:给每个 Agent 配一台云桌面。
数据先摆着(GitHub API 实时拉取,2026-10-05 核实):
| 指标 | 数值 |
|---|---|
| Star | 27,701 |
| Fork | 1,949 |
| 贡献者 | 约 133 人 |
| 未关 Issue / 已关 Issue | 507 / 627 |
| License | MIT |
| 建库时间 | 2025-01-31 |
| 最近 push | 2026-10-02 |
背后的公司叫 Cua AI,YC 2025 春季批次(P25),旧金山,创始人是 Francesco Bonacci(此前在 Xbox 和 Microsoft AI),团队规模 3 人。融资方面只有聚合站给出约 50 万美元 pre-seed 的说法(Tracxn 系),没有官方新闻稿,我不把它当定论——YC 官方招聘页只写了「a seed round closed」。
顺带一提,GitHub 网页版显示的 22.2K 是缓存的旧数,API 才是准的。这种事我每次都拉 API,不抄页面。
它到底解决什么问题
Agent 要操作 Photoshop、Fusion 360、Tableau、某个没开放 API 的 ERP,没有别的路:看屏幕、点鼠标、打字。Cua 把这一整套拆成了四层,而且跨操作系统统一:
- Lume——基于 Apple Virtualization.Framework 的 macOS/Linux 虚拟机管理层,官方称在 Apple Silicon 上能跑到接近原生的 CPU 速度。
- cua-sandbox——沙箱 SDK,一套 API 同时管 Linux 容器、Linux VM、macOS、Windows、Android,还有自带镜像(BYOI)。云端跑在 cua.ai,本地跑用 QEMU。
- cua-driver——后台操作层。这是今年最实用的那块:Agent 在后台点原生软件,不抢你的鼠标、不切你的焦点,macOS / Windows / Linux 通用,一行脚本安装、不需要管理员权限。
- cua-bench——评测和 RL 环境,跑 OSWorld、ScreenSpot、Windows Arena,还能把轨迹导出来喂训练。
Python SDK 在 PyPI 上叫 cua,当前 0.2.0(2026-10-01 上传),要求 Python ≥ 3.10,MIT。写法很朴素:
async with Sandbox(Image.linux()) as sb:
await sb.shell.run("echo hello")
shot = await sb.screenshot
await sb.mouse.click(100, 200)
上手有多难
分两种玩法。
玩法一:给你自己的电脑装个后台手(推荐先试这个,5 分钟)
macOS 14+ 一行装:
/bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"
cua-driver --version
cua-driver doctor # 检查版本、目录、权限
装完在「辅助功能」和「屏幕录制」里给它授权,然后:
cua-driver permissions status
之后从 Claude Code、Cursor、Codex、OpenClaw 这些 MCP 客户端直接连它。有个细节要说清楚:默认开着内容无关的遥测,cua-driver telemetry disable 一条命令关掉,这个选择权在你手上。另外权限模式(standard / bounded / unrestricted)是 daemon 启动时定死的,Agent 改不了,运行中你也改不了,得带不同参数重启——这个设计我觉得比很多「运行时动态提权」的方案干净。
玩法二:自己写 Agent:pip install cua,对着沙箱调 mouse / keyboard / screenshot,再套 cua-agent 跑模型,OpenAI、Anthropic、Ollama、LM Studio、OpenRouter 都支持。
Linux 那条路的实现值得一说:可访问性树走 D-Bus 上的 AT-SPI,输入合成走 XTEST,Agent 有自己一支画出来的光标,跟你的物理指针物理隔离。X11 和 XWayland 都支持,Wayland 的原生后台输入还有限制——这个坑官方在文档里写明了。
实话
第一,它不是 Agent 框架,是「场地」。 你拿它搭的是跑道,不是运动员。想直接抄个 Agent 就干活,那得看 Dify、n8n 或者 CrewAI 这类。它跟 E2B 沙箱 是同类不同层:E2B 给 Agent 一段云端代码执行环境,Cua 给它一整台带 GUI 的电脑;跟 browser-use 比,browser-use 只碰浏览器,Cua 碰的是整个桌面。
第二,能力天花板是真的低。 官方自己的 Cua-Bench 数据最能说明问题:25 道专家级 KiCad 原理图任务,最强的前沿 Agent 只过了 6 道,而且没有一个模型能从空白画布画出一张完整原理图。OpenAI 和 Anthropic 的旗舰模型打平。也就是说——「让 Agent 像人一样用电脑」这句话,2026 年了离能上线还差得远,别被 demo 骗了。
第三,坑不少,而且都在文档深处。 Lume 的 Sequoia 预设首次图形启动时还会卡在「辅助功能」步骤(官方 issue #2155),默认账号密码是 lume / lume;macOS 虚拟机的 GPU 通路是 2026 年 8 月才用进程级 Metal shim 打通的;BYOI 自带镜像目前只能本地 QEMU,云端还挂着「soon」;1024 个未关 Issue 堆在那儿。对一个 27K 星、133 个贡献者、还在用 release-please 自动发版(本周连发 sandbox 0.9.0、cua-spaces 0.2.0 四个版本)的项目来说,这属于「高速迭代必然的债」,不是 fatal,但要预期。
第四,商业模式还早期。 第三方站整理的定价是:开源核心免费、Pro 版 75 美元含 5100 credits、企业版面议。这个价格结构我只在聚合站看到,官网没明写,看的时候心里打个折。3 人团队 + YC 小批次 + 20 万美元量级的钱,扛 cloud desktop 这种重 infra 的活儿,能撑几年是个问号。
所以该不该用?
- 学习价值:高。「后台操作 + 合成光标 + 跨 OS 统一 API」这套思路,比看一百个 Playwright 教程都更接近真实产品的做法。
- 试玩价值:高。自己 macOS 上装个 driver,让 Claude Code 去点你桌面上任意软件,十几分钟就有体感。
- 生产价值:谨慎。GUI 自动化本身就不稳定(延迟、分辨率、弹窗都会打断),Cua 降低的是环境隔离的成本,没有解决识别准确率的问题。真实生产环境里,能用 API 就别用鼠标。
收尾
Agent 生态到今天,工具层(LangChain、AutoGen)、编排层(LangGraph、CrewAI)、应用层(Dify、Flowise、Langflow)都卷得差不多了。真正的空白在执行环境层——Agent 到哪儿去干活。Cua 从「Docker for Computer-Use Agents」这个名字切入,两年跑到 2.7 万星,公司从开源框架长成卖云桌面的生意,这条路走通了。
本文所有星数、Issue 数、提交时间、版本号均通过 GitHub API 与 PyPI 于 2026-10-05 实时拉取;融资与定价数据来自第三方聚合站,未经官方确认。
by 数码罗记·godsun.pro