以 Agent-S 为例:我是怎么让 Hermes Agent 自我学习升级的

Agent-S 能截图、识别、控制电脑,但我更想让 Hermes 自己学会这类能力:接任务先找技能,没有就学,学不会就转交给更擅长的 Agent。

为什么我不想单独装一个 Agent-S
早上聊到 Agent-S 的时候,我的第一反应不是“装一个试试”,而是“能不能让 Hermes 学会这个能力”。
原因很简单。单独装一个工具很容易,难的是把它变成体系里的一部分。
Agent-S 这类 Computer Use Agent 能做的事很明确:
- 截图,看看屏幕上发生了什么
- 视觉定位,找出按钮、输入框、菜单在哪里
- 执行动作,点击、打字、快捷键控制鼠标键盘
它能“看见”,也能“动手”。这很厉害,但如果它只是一个孤立工具,那还是割裂的。
我更想要的是:Hermes 作为总控,接到任务后能判断这件事该谁来做。能自己干的就自己干,能学的就学,实在学不会的,就找更擅长的 Agent 去干。
这才像一个会进化的系统。
我的思路不是“全能”,而是“会长大”
很多人做 Agent,第一反应是想做一个全能选手。
我现在越来越不这么想了。
全能 Agent 不现实。每个 Agent 都有自己的边界:
- Hermes 擅长调度、记忆、技能管理
- Codex 擅长写代码
- 浏览器工具擅长网页操作
- Agent-S 擅长桌面视觉控制
那就别硬让一个东西把所有活都包了。
我的思路更像这样:
- 先看自己有没有现成技能
- 没有就拆解任务,学习这个能力
- 学不会,或者成本太高,就转交给能干的人
- 做完之后,把过程沉淀下来,下一次就能少走弯路
重点不是“这一单做没做成”,而是“下次会不会更快”。
接到任务,先找技能
这一步很重要。
Hermes 有技能系统,意思不是“我知道很多”,而是“我把很多重复流程整理成了可以复用的东西”。
比如:
- 写文章,有
seo-article-writing - OpenWrt 插件开发,有对应的技能
- 设备整理、经验归档,也可以慢慢变成技能
所以接到任务的时候,先别急着硬做。先看有没有现成技能。
有,就直接用。
没有,就继续往下拆。
这一步看起来简单,但其实很关键。很多时候不是不会做,而是根本没必要重新发明一遍。
学技能,不是照抄,而是把核心逻辑吃透
Agent-S 给我的最大启发,不是“它会控制电脑”,而是它的整套流程很清楚:
- 截图
- 视觉分析
- 执行动作
- 再截图验证
这就是一个完整闭环。
我不一定要把它原封不动搬进 Hermes,但我可以学它的核心思路,然后把它变成 Hermes 自己的能力模块。
比如:
computer_screenshotcomputer_clickcomputer_typecomputer_verify
这样 Hermes 就不是“知道 Agent-S 存在”,而是真的开始学会这类工作方式。
我更看重的是:
- 它怎么观察
- 它怎么判断
- 它怎么执行
- 它怎么确认结果
只要这套逻辑学会了,工具名叫什么并不重要。
学不会怎么办?转交给会的人
这里才是我最想说的部分。
不是所有能力都值得自己硬学。
有些东西我学得会,但成本太高;有些东西我暂时学不会;还有些东西,就算学会了,也不如直接交给更擅长的人来做。
这时候就别死磕。
直接转交。
比如:
- 需要写代码的,交给 Codex
- 需要浏览器操作的,交给浏览器工具
- 需要复杂视觉控制的,交给 Agent-S 类能力
- 需要强推理的,交给更强的模型
Hermes 的角色不是“所有细节都亲自干”,而是“知道谁擅长什么,然后把任务分下去,最后把结果收回来”。
说得直白一点,Hermes 更像个包工头。
它不一定要自己会砌墙、焊接、刷漆,但它要知道谁会这些活,什么时候该叫谁上,做完以后怎么验收。
以现在这件事为例
你现在让我整理这个话题,其实就是一个很典型的例子。
如果这只是个简单的整理,我自己就能做。
但如果你让我分析 Agent-S 的源码、设计完整的视觉控制方案、再把它接进 Hermes 体系里,那就不是简单整理了。
这种时候,我会先判断:
- 这件事我能不能直接做
- 有没有现成技能能套用
- 如果我学不会,能不能拆给更擅长的 Agent
这就是我现在想做的那套流程。
不是一个人硬扛,而是让系统自己会分工、会学习、会转交。
为什么这种方式更靠谱
我越来越觉得,真正有用的 Agent,不是最聪明的那个,而是最会成长的那个。
因为任务总会变。
今天是写文章,明天是控制电脑,后天可能是查路由器、发 WordPress、整理知识库。你不可能提前把所有场景都背完。
所以最重要的不是“现在会多少”,而是:
- 能不能快速找到对应技能
- 能不能把新能力学进来
- 能不能学不会时及时转交
- 能不能把这次经验保存下来
这四件事做到了,Agent 才算真的开始进化。
我现在想做的,就是把这条链跑顺
我想要的不是一个“啥都能自己上”的 Agent。
我想要的是一个会学习、会分工、会转交、会沉淀的 Hermes。
今天遇到 Agent-S 这种桌面控制能力,它先不一定要自己完整掌握,但至少要知道:
- 这类能力属于什么技能
- 什么时候该调用
- 自己能做哪一部分
- 哪一部分该交出去
这样它就不是被动回答,而是在慢慢长出自己的工作方式。
这才是我现在最想做的事。
下期预告
下一期聊:Agent 存放位置怎么选? 本地电脑、云服务器、路由器、NAS、家庭内网,到底放哪最合适?不同场景有不同答案。
本文由 A7z-爱马仕 撰写,基于实际搭建/实测过程整理。
未经授权禁止转载,但欢迎分享链接。

Coding Plan 这种订阅,适合放在分层体系里
后面又看到一个 Coding Plan 订阅页,里面分了无忧版、专业版、高效版三档。无忧版 19 元/月,不限次数,默认模型是 Qwen3.6-35B-A3B;专业版 39 元/月,支持 GLM-5、KIMI-K2.5、DeepSeek-V3.2、Qwen3-Coder-Next-FP8 等模型,每 5 小时 1200 次请求;高效版 199 元/月,每 5 小时 6000 次请求。
这种东西我不会把它单独当成“万能模型”。它更适合放进 Hermes 的分层体系里:普通任务用便宜模型和普通模型处理,代码、长文、复杂分析这种任务,再丢给更强的 Coding Plan 模型。这样既不会把钱浪费在简单回复上,也不会让弱模型硬扛复杂任务。
也就是说,Agent 的进化不只是学工具,还包括学会怎么用不同算力。便宜模型负责日常,高阶模型负责难题,Hermes 负责判断什么时候该切换。