Appearance
很多人看到Hermes之后,第一反应不是上手,而是继续等。但Agent这件事并不是"等到最强版本再开始"才有意义。越早把一套能跑起来的工作流搭好,后面无论工具怎么升级,你都能很快跟上。
一、定义"你是谁"——身份层
在Hermes里,身份层主要由SOUL.md决定。它决定了这个Agent的角色定位、表达方式、判断偏好、擅长方向。
推荐使用agency-agents-zh:
- 211个中文角色模板
- 覆盖小红书运营、技术写作、研究助手等场景
- 直接用GitHub搜索关键词,找到最接近你需求的角色
- 在Hermes里说一句"激活xxxx模式"即可
二、外部记忆系统——记忆层
Hermes内置的MEMORY.md更像是"模型主动记下来的东西",而不是真正擅长长期关系管理的记忆系统。
推荐Hindsight:
- 能自动从对话中提取实体和关系
- 周一提过的项目截止日期,周五重新开新会话时依然能接上
三、感知能力——五模块
真正能干活的Agent,必须具备感知能力。
| 模块 | 工具 | 适用场景 |
|---|---|---|
| 单页抓取 | Jina Reader | 快速把网页转成干净Markdown |
| 深度抓取 | Crawl4AI | 批量抓取、多层页面递归 |
| 反爬处理 | 代理+隐身浏览器 | Cloudflare、验证码、风控 |
| 浏览器自动化 | CamoFox + Browser Use | 登录、点击、翻页、复杂交互 |
| 文档处理 | Pandoc + Marker | PDF转Markdown |
四、搜索能力——分层配置
| 搜索工具 | 特点 | 适用场景 |
|---|---|---|
| Tavily | 结果结构化、带引用 | 主搜索,给Agent用 |
| DuckDuckGo | 成本低、稳定 | 兜底搜索 |
分工使用,不是二选一。
五、表达能力——语音+图片
| 能力 | 工具 | 说明 |
|---|---|---|
| 语音识别 | Whisper | 本地可用、多语言、稳定 |
| 语音合成 | Edge TTS | 免费、效果不差 |
| 图片生成 | FAL.ai / Midjourney / DALL·E 3 | 封面图、配图、海报 |
六、成本监控——越早做越好
| 工具 | 功能 |
|---|---|
| tokscale | 快速看整体消耗 |
| hermes-dashboard | 拆到组件级别,看系统提示/工具定义/消息历史各占多少 |
| RTK | 压缩无效token开销 |
七、进阶顺序建议
不要一开始就开满!基础没跑稳之前,这些东西越多反而越乱。
合理顺序:
| 顺序 | 层级 | 内容 |
|---|---|---|
| 1 | 身份层 | SOUL.md + 中文角色模板 |
| 2 | 记忆层 | Hindsight外部记忆系统 |
| 3 | 感知层 | Jina Reader + Crawl4AI |
| 4 | 搜索层 | Tavily + DuckDuckGo |
| 5 | 文档层 | Pandoc + Marker |
| 6 | 表达层 | Whisper + Edge TTS + 图片生成 |
| 7 | 成本层 | tokscale + dashboard + token压缩 |
最小可行配置清单
身份层 → 记忆层 → 感知层 → 搜索层 → 文档层 → 表达层 → 成本层每加一层,都会直接增强真实工作的效率,而不是只让配置清单看起来更高级。
最后
真正有用的,从来不是你等来了一个最强版本,而是你已经先搭出了一套能跑、能改、能积累的系统。
先跑起来,再持续优化,这比继续观望更重要。
