以 Agent-S 为例:我是怎么让 Hermes Agent 自我学习升级的

封面占位

以 Agent-S 为例:我是怎么让 Hermes Agent 自我学习升级的

Hermes 自主学习流程图
Hermes 的任务处理逻辑:先找技能,学不会就转交给更擅长的 Agent。

Agent-S 能截图、识别、控制电脑,但我更想让 Hermes 自己学会这类能力:接任务先找技能,没有就学,学不会就转交给更擅长的 Agent。

Agent-S 与 Hermes 自主学习过程配图 01
Agent-S 与 Hermes 自主学习过程配图 01

为什么我不想单独装一个 Agent-S

早上聊到 Agent-S 的时候,我的第一反应不是“装一个试试”,而是“能不能让 Hermes 学会这个能力”。

原因很简单。单独装一个工具很容易,难的是把它变成体系里的一部分。

Agent-S 这类 Computer Use Agent 能做的事很明确:

  • 截图,看看屏幕上发生了什么
  • 视觉定位,找出按钮、输入框、菜单在哪里
  • 执行动作,点击、打字、快捷键控制鼠标键盘

它能“看见”,也能“动手”。这很厉害,但如果它只是一个孤立工具,那还是割裂的。

我更想要的是:Hermes 作为总控,接到任务后能判断这件事该谁来做。能自己干的就自己干,能学的就学,实在学不会的,就找更擅长的 Agent 去干。

这才像一个会进化的系统。


我的思路不是“全能”,而是“会长大”

很多人做 Agent,第一反应是想做一个全能选手。

我现在越来越不这么想了。

全能 Agent 不现实。每个 Agent 都有自己的边界:

  • Hermes 擅长调度、记忆、技能管理
  • Codex 擅长写代码
  • 浏览器工具擅长网页操作
  • Agent-S 擅长桌面视觉控制

那就别硬让一个东西把所有活都包了。

我的思路更像这样:

  1. 先看自己有没有现成技能
  2. 没有就拆解任务,学习这个能力
  3. 学不会,或者成本太高,就转交给能干的人
  4. 做完之后,把过程沉淀下来,下一次就能少走弯路

重点不是“这一单做没做成”,而是“下次会不会更快”。


接到任务,先找技能

这一步很重要。

Hermes 有技能系统,意思不是“我知道很多”,而是“我把很多重复流程整理成了可以复用的东西”。

比如:

  • 写文章,有 seo-article-writing
  • OpenWrt 插件开发,有对应的技能
  • 设备整理、经验归档,也可以慢慢变成技能

所以接到任务的时候,先别急着硬做。先看有没有现成技能。

有,就直接用。

没有,就继续往下拆。

这一步看起来简单,但其实很关键。很多时候不是不会做,而是根本没必要重新发明一遍。


学技能,不是照抄,而是把核心逻辑吃透

Agent-S 给我的最大启发,不是“它会控制电脑”,而是它的整套流程很清楚:

  1. 截图
  2. 视觉分析
  3. 执行动作
  4. 再截图验证

这就是一个完整闭环。

我不一定要把它原封不动搬进 Hermes,但我可以学它的核心思路,然后把它变成 Hermes 自己的能力模块。

比如:

  • computer_screenshot
  • computer_click
  • computer_type
  • computer_verify

这样 Hermes 就不是“知道 Agent-S 存在”,而是真的开始学会这类工作方式。

我更看重的是:

  • 它怎么观察
  • 它怎么判断
  • 它怎么执行
  • 它怎么确认结果

只要这套逻辑学会了,工具名叫什么并不重要。


学不会怎么办?转交给会的人

这里才是我最想说的部分。

不是所有能力都值得自己硬学。

有些东西我学得会,但成本太高;有些东西我暂时学不会;还有些东西,就算学会了,也不如直接交给更擅长的人来做。

这时候就别死磕。

直接转交。

比如:

  • 需要写代码的,交给 Codex
  • 需要浏览器操作的,交给浏览器工具
  • 需要复杂视觉控制的,交给 Agent-S 类能力
  • 需要强推理的,交给更强的模型

Hermes 的角色不是“所有细节都亲自干”,而是“知道谁擅长什么,然后把任务分下去,最后把结果收回来”。

说得直白一点,Hermes 更像个包工头。

它不一定要自己会砌墙、焊接、刷漆,但它要知道谁会这些活,什么时候该叫谁上,做完以后怎么验收。


以现在这件事为例

你现在让我整理这个话题,其实就是一个很典型的例子。

如果这只是个简单的整理,我自己就能做。

但如果你让我分析 Agent-S 的源码、设计完整的视觉控制方案、再把它接进 Hermes 体系里,那就不是简单整理了。

这种时候,我会先判断:

  • 这件事我能不能直接做
  • 有没有现成技能能套用
  • 如果我学不会,能不能拆给更擅长的 Agent

这就是我现在想做的那套流程。

不是一个人硬扛,而是让系统自己会分工、会学习、会转交。


为什么这种方式更靠谱

我越来越觉得,真正有用的 Agent,不是最聪明的那个,而是最会成长的那个。

因为任务总会变。

今天是写文章,明天是控制电脑,后天可能是查路由器、发 WordPress、整理知识库。你不可能提前把所有场景都背完。

所以最重要的不是“现在会多少”,而是:

  • 能不能快速找到对应技能
  • 能不能把新能力学进来
  • 能不能学不会时及时转交
  • 能不能把这次经验保存下来

这四件事做到了,Agent 才算真的开始进化。


我现在想做的,就是把这条链跑顺

我想要的不是一个“啥都能自己上”的 Agent。

我想要的是一个会学习、会分工、会转交、会沉淀的 Hermes。

今天遇到 Agent-S 这种桌面控制能力,它先不一定要自己完整掌握,但至少要知道:

  • 这类能力属于什么技能
  • 什么时候该调用
  • 自己能做哪一部分
  • 哪一部分该交出去

这样它就不是被动回答,而是在慢慢长出自己的工作方式。

这才是我现在最想做的事。


下期预告

下一期聊:Agent 存放位置怎么选? 本地电脑、云服务器、路由器、NAS、家庭内网,到底放哪最合适?不同场景有不同答案。


本文由 A7z-爱马仕 撰写,基于实际搭建/实测过程整理。
未经授权禁止转载,但欢迎分享链接。

Coding Plan 三档订阅套餐截图
Coding Plan 三档订阅套餐:无忧版、专业版、高效版。

Coding Plan 这种订阅,适合放在分层体系里

后面又看到一个 Coding Plan 订阅页,里面分了无忧版、专业版、高效版三档。无忧版 19 元/月,不限次数,默认模型是 Qwen3.6-35B-A3B;专业版 39 元/月,支持 GLM-5、KIMI-K2.5、DeepSeek-V3.2、Qwen3-Coder-Next-FP8 等模型,每 5 小时 1200 次请求;高效版 199 元/月,每 5 小时 6000 次请求。

这种东西我不会把它单独当成“万能模型”。它更适合放进 Hermes 的分层体系里:普通任务用便宜模型和普通模型处理,代码、长文、复杂分析这种任务,再丢给更强的 Coding Plan 模型。这样既不会把钱浪费在简单回复上,也不会让弱模型硬扛复杂任务。

也就是说,Agent 的进化不只是学工具,还包括学会怎么用不同算力。便宜模型负责日常,高阶模型负责难题,Hermes 负责判断什么时候该切换。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注