Appearance
Hermes 凭什么两个月接棒 OpenClaw?深度拆解自进化的真相
4月,Hermes Agent 凭借"自进化"挑战了 OpenClaw 的霸主地位。尽管两者基础功能高度重合,但 Hermes 通过"技能自动进化"与"主动记忆管理",实现了从"手动配置"到"自主成长"的跨越。
GitHub 链接:
- OpenClaw: https://github.com/OpenClawAI/openclaw
- Hermes Agent: https://github.com/NiceneNerd/Hermes-Agent
这种将复杂度隐藏在底层规则中的设计,虽在处理复杂任务时仍有隐患,却精准踩中了"干预递减"的自动化趋势,为 Agent 向"伙伴"进化抢占了关键生态位。
一、功能几乎一样,差异在"启动键"
进入 2026 年 4 月,才火了两个月的 OpenClaw 就迎来了它的挑战者。Hermes Agent 连续数周占据 GitHub Trending 榜首,狂揽 22,000 颗星。
它火到什么程度呢?连 Anthropic 都要抄它的。
4 月 10 日,Nous Research 的创始人 Teknium 跳出来吐槽,说 Anthropic 正在「复制」Hermes 自动判断任务完成、主动提醒用户的功能。
社区叙事也因此非常统一,认为 Hermes 凭借自进化 Agent、自动记忆管理和用户建模系统,在技术上全面超越了前任王者 OpenClaw。
不过,如果抛开这些宏大叙事,真正把两边拆开对比,你会发现它们在功能上一模一样的地方,远比差异多得多。
功能清单对比
| 功能 | Hermes | OpenClaw |
|---|---|---|
| 定时调度 | ✅ cron + 自然语言 | ✅ at/every/cron |
| 子 Agent 委派 | ✅ delegate_task | ✅ sub-agent |
| 浏览器自动化 | ✅ | ✅ |
| TTS 语音合成 | ✅ | ✅ |
| Vision 视觉 | ✅ | ✅ |
| 图像生成 | ✅ | ✅ |
| 语音交互 | ✅ | ✅ |
| Gateway 平台 | ✅ 20+ 平台 | ✅ 30+ 平台 |
对着清单一项项打勾就会发现,两者的功能几乎完全重合。所谓功能表上的「绝对碾压」根本不存在。
那么问题来了,既然功能都一样,Hermes 凭什么火成这样?
二、会自己长大的 Skill
翻遍两边的默认配置,你能找到的唯一硬核差异就一个:Hermes 在 Skill 上实现了自动进化的闭环。
什么是 Skill?
Skill 是 Agent 的工作流知识单元,说白了就是一个 Markdown 文件,专门告诉 Agent 遇到某类任务该按什么步骤干、中间调什么工具、搞砸了怎么救场。
Hermes 的 Skill 生命周期
Hermes 把技能的生命周期劈成了两截:运行时的静默生成 + 离线的硬核进化。
第一步:静默生成
平时让 Agent 干活,只要满足以下任一条件,系统就会自动生成 Skill:
| 触发条件 | 说明 |
|---|---|
| 工具调用 ≥ 5 次 | 任务足够复杂,值得沉淀 |
| 出错后自救成功 | 从失败中学到了东西 |
| 用户直接纠正 | 被教了一遍,记下来 |
这一步完全静默,很多时候你根本不知道它又给自己写了个新技能。
第二步:离线进化
Hermes 内置了一套离线批量进化算法,专门拉了一个独立仓库:hermes-agent-self-evolution。
引擎用的是 DSPy 框架,加上一套叫 GEPA 的核心算法。
GEPA 算法详解
GEPA 全称:Genetic-Pareto Prompt Evolution(遗传-帕累托提示词进化)
这套体系出自 Lakshya Agrawal 等人的 ICLR 2026 Oral 论文:《反思性提示词进化可以跑赢强化学习》。
| 对比维度 | 传统 RL 路线 | GEPA 路线 |
|---|---|---|
| 更新机制 | 梯度更新 | 反思 + 进化算法 |
| 反馈信号 | 数值 reward(粗颗粒度) | 自然语言反馈(细颗粒度) |
| 样本效率 | 低 | 高 |
| 可解释性 | 黑盒 | 白盒(能看到改了什么) |
GEPA 的三个硬核底座:
| 底座 | 说明 |
|---|---|
| 反思性变异 | 大模型读执行轨迹,自己反思为什么对/错,提示词该改哪几个字 |
| 帕累托前沿选择 | 只要候选在某一个评估样本上表现最强就保留,保证多样性 |
| 自然语言反馈 | 具体到"这一步没检查边界条件",比数值 0.6 分有意义得多 |
进化流程:
读取现有 Skill → 抽样/合成评估集 → GEPA 反思 → 生成候选变体 → 跑评估 → 帕累托挑选赢家 → 生成 PR → 人工审核 → 合并生效⚠️ 关键设计:进化后的 Skill 不会直接覆盖原文件,而是生成 PR,必须人工审核通过才会生效。
这直接戳破了社区里那套「用户完全无需介入」的爽文神话。Hermes 的态度很明确:技能生成可以全自动,但技能进化必须过人眼。
OpenClaw 的 Skill 系统
OpenClaw 也有 Skill 系统,但要命的是每一步都得靠你主动:
| 步骤 | 操作 |
|---|---|
| 1 | 手动建文件 |
| 2 | 手动安装 |
| 3 | 手动授权 |
| 4 | 重启 Gateway |
而且它的加载极其简单粗暴:只要配了就全量塞进上下文里,不做任务匹配,除非你手动加禁用标签。
两边都有 Skill。真正的区别就在于谁来按下启动键。
Hermes 说「放着我来」,OpenClaw 说「你自己搞」。
三、谁在替谁记事:三家记忆系统对比
如果说 Skill 解释了 Hermes 为什么「越用越快」,那社区里传得神乎其神的另一半叙事「它懂我是谁」,就得归功于记忆系统了。
现在的三大主流 Agent(Claude Code、OpenClaw、Hermes)其实都有自动记忆。但只要稍微深挖就会发现,它们服务的对象、触发机制和记忆保质期完全是两码事。
1. Claude Code:项目级记忆
| 特点 | 说明 |
|---|---|
| 自动记忆 | 默认开启,自动记构建命令、调试经验、架构笔记、代码风格 |
| Auto Dream | 每 24 小时自动提炼上下文精华 |
| 服务对象 | 项目,不是你这个人 |
| 范围 | 绑在仓库根目录的 .claude/ 下,换仓库归零 |
Claude Code 的记忆天然是项目级绑定的——好处是对齐了代码工程场景,坏处是你个人的偏好、习惯统统带不走。
2. OpenClaw:从被动存储到主动整理
| 时间 | 里程碑 |
|---|---|
| 2 月 25 日 | 首发,只有本地 JSON 存储 |
| 4 月 3 日 | v0.7 版本推出 4 种记忆后端:Builtin、QMD、LlamaIndex、Honcho |
| 4 月 5 日 | 引入 Dreaming 系统,自动提炼会话精华 |
| 4 月 10 日 | Active Memory:自动判断哪些信息值得记、怎么分类、何时压缩 |
OpenClaw 的记忆后端架构确实更灵活——4 种后端各有特长:
| 后端 | 特点 |
|---|---|
| Builtin | SQLite 存储,关键词 + 向量混合搜索 |
| QMD | 本地优先,支持重排序和查询扩展 |
| LlamaIndex | 集成 RAG 管线,适合知识密集型场景 |
| Honcho | AI 原生跨会话记忆,用户建模 |
但「灵活」也有代价:你得自己选后端、自己维护索引、自己调压缩阈值。选错了,记忆质量就打折。
3. Hermes:用户级记忆
| 特点 | 说明 |
|---|---|
| 记忆单位 | 人,不是项目也不是仓库 |
| 触发方式 | 你开口说了什么、它就记什么;它看你做了什么、也记 |
| 用户建模 | 持续推断偏好模式,显式 + 隐式双通道 |
| 跨会话 | 原生跨会话持久化 |
| 进化 | 记忆本身也能被离线进化算法优化 |
Hermes 的记忆是用户级绑定的。你的偏好、习惯、工作模式,跟着你走,不绑定项目、不绑定仓库。
⚠️ 但这也意味着一个硬伤:复杂推理或跨会话长链任务时,向量检索的召回率会掉。Chroma 团队做过一组多轮对话压测,发现对话轮次一上去,性能衰减可以到 39%~85%。
三家记忆系统对比
| 维度 | Claude Code | OpenClaw | Hermes |
|---|---|---|---|
| 绑定粒度 | 项目级 | Agent 级 | 用户级 |
| 触发方式 | 自动 | 半自动 | 自动 |
| 跨项目/仓库 | ❌ | ✅(手动迁移) | ✅(原生) |
| 记忆进化 | ❌ | ❌ | ✅ |
| 后端灵活性 | ❌ | ✅(4 种) | ❌(内置) |
| 长链稳定性 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
四、复杂度守恒:谁替你按下了启动键
自动化的本质是复杂度的转移,不是消灭。你省掉的每一个手动操作,都被工程师写成了代码规则。
判断一个自动化产品是否靠谱,关键是看:转移后的复杂度由谁承担?
| 承担者 | 稳定性 | 灵活性 | 代表 |
|---|---|---|---|
| 工程师(硬规则) | 高 | 低 | Hermes |
| 模型(动态判断) | 低 | 高 | — |
| 用户(手动配置) | 中 | 高 | OpenClaw |
Hermes 选择让工程师承担——把"什么时候该生成 Skill""什么时候该进化""什么时候该记"全都写成规则。这是工程现实主义:宁可规则死板一点,也不要模型在关键节点上自由发挥。
五、干预递减光谱:你在哪个位置?
把市面上的 Agent 产品按"用户干预程度"排成光谱:
完全手动 ←————————————————————→ 完全自动
Claude Code OpenClaw Hermes
(生产工具) (可配置可自动) (全自动包办)| 定位 | 说明 |
|---|---|
| Claude Code 偏左 | 每个关键操作都需要人确认,适合生产环境 |
| OpenClaw 在中间 | 你可以全手动,也可以配自动化,弹性最大 |
| Hermes 偏右 | 尽量减少人工干预,自动生成、自动记忆、自动进化 |
选型时先定位自己在光谱上的位置,再选产品。
不要因为"Hermes 更先进"就选 Hermes——如果你需要的是可控和审计,偏右的产品反而更危险。
六、生态位争夺:先用工程抢位,再用技术加成
Hermes 的真正护城河不是今天的技术,而是三样有网络效应的东西:
| 护城河 | 网络效应 |
|---|---|
| 用户心智 | "自进化 Agent"= Hermes |
| 技能生态 | 用户越多 → 自动生成的 Skill 越多 |
| 记忆底座 | 用户越多 → 记忆越多 → 建模越准 → 体验越好 |
等到底层模型能力跨过临界点,Hermes 已经站在终点了。
这是典型的"先用工程抢位,再用技术加成"的互联网打法。
而 OpenClaw 的护城河是另一种:生态广度。30+ 平台、310k+ stars、庞大的社区贡献——这种广度不是一天建成的,也不是一两个功能差异能取代的。
总结
| 问题 | 答案 |
|---|---|
| Hermes 功能碾压 OpenClaw 吗? | 不,功能几乎一样 |
| Hermes 的核心差异是什么? | Skill 自动进化 + 用户级记忆 |
| 自进化 = 用户不用介入吗? | 不,进化后的 Skill 必须人工审核 |
| 记忆系统谁更强? | 各有长短:Hermes 更自动,OpenClaw 更灵活 |
| 现在该选谁? | 先定位你在干预光谱上的位置,再选 |
Hermes 凭什么两个月接棒?不是因为它更强,而是因为它把"谁来按下启动键"从用户转移给了系统——而这,恰好踩中了"干预递减"的时代趋势。
