Appearance
AI Agent 入门 12 条:从 Claude Code 到 OpenClaw 都要懂的底层逻辑
工具会换,底层的东西不会换。Token 怎么算、上下文怎么管、规则怎么写、技能怎么搭,这些搞明白了,换什么工具都不慌。这篇总结了 12 条 Agent 入门核心知识,不管用 Claude Code、OpenClaw 还是 Hermes,看完这篇,入门就算交代清楚了。
说起来这个系列,最初是因为很多人开始接触 AI Agent,我就想把自己踩的坑写出来,没想到写着写着就写了二十多篇。
(更没想到的是,这个系列还没写完,已经有声音在说,OpenClaw 要被 Hermes 取代了。。。。)
但说实话,工具会换,底层的东西不会换。
Token 怎么算、上下文怎么管、规则怎么写、技能怎么搭,这些搞明白了,换什么工具都不慌。
好了不废话了,今天的目标很明确:
看完这一篇,Agent 入门这件事就算交代清楚了。
01 | Agent 是啥?
你把活儿丢给它,它自己去干。能改文件,能跑命令,不用你手动一步步操作。一杯茶一包烟,看着它干就完了。
这跟以前用网页版 AI 聊天完全不一样。以前是你问它"你觉得我该怎么办",它给你一堆建议,然后你自己动手。
Agent 是直接帮你动手。
02 | Agent 由三样东西组成
模型、工具、上下文。
| 组件 | 作用 | 你能控制吗 |
|---|---|---|
| 模型 | 脑子,决定聪不聪明 | 选不了太多,就几家几档 |
| 工具 | 手,决定能干什么 | 大家能装的差不多 |
| 上下文 | 脑子里装的东西 | 真正拉开差距的 |
这三个字我说过无数次了但真的很重要!!
03 | 上下文到底是啥?
很多人觉得就是聊天记录。不全是。
记忆、知识库、规则、技能,这些东西名字不同,但本质上都是一样的——塞进 Agent 的窗口之后,都会影响它怎么想、怎么做。
所以统称叫上下文。
04 | 脑子是有容量限制的
Agent 的窗口上下文有上限:
| 模型 | 上下文窗口 |
|---|---|
| Claude | 200K |
| GPT-4 | 128K |
| Gemini | 1M |
塞满了就处理不了新消息了,要么换个新窗口,要么压缩。
压缩就是把前面的对话内容做个摘要,腾出空间装新东西。但压缩完,之前的细节就丢了。
窗口装满 → 压缩 → 遗忘。
这条链路你得记住,后面很多问题都跟它有关。
05 | Token 是怎么算的?
Token 是 Agent 消耗资源的计量单位。你发一条消息,它回一条消息,消耗的不只是这两条消息的 Token,是整个窗口里所有内容的 Token!!
窗口越满,每条消息越贵。
Token 数量跟文件大小不是一回事:
- 文件大小用 KB
- Token 数量用 K(没有 B)
- 200KB 的中文文档要 100K-200K Token
- 同样大小的英文只要 50K 左右
💡 经验公式:中文约 1.5 字/token,英文约 4 字符/token
06 | Agent 的记忆靠什么?
靠读写文件。不是靠脑子记。
窗口一压缩或者一关,脑子里的东西全没了。想让它记住什么,就必须让它写在文件里。下次需要的时候再去读。
很多工具有自动记忆功能,比如每天存一个 memory 文件,启动时自动加载最近的。但这个自动记忆不完全靠谱,有些东西它可能压根没存。
重要的事你得手动让它记下来。
07 | 跟 Agent 沟通的 WWH 原则
What(做什么)、Why(为什么做)、How(怎么做)。
不管是你给 Agent 提需求,还是让它跟你汇报,都把这三件事说清楚。省得来回扯好几轮才搞明白在说啥。
尤其是 Why。
不说为什么,Agent 很容易按自己的理解瞎猜,猜偏了整个方向就歪了。
08 | 上下文少即是多
这个真的要反复说。很多人觉得跟 Agent 聊得越多,它越了解你,干活越好。
不是的。。。。
上下文太多它反而注意力分散,简单的事都能给你搞砸。
新任务开新窗口。别舍不得关。
清爽的脑子比熟悉你的脑子好使。
09 | 默认上下文怎么管?
Agent 每次启动会自动读一些文件,这就是默认上下文。一般分三类:
| 文件 | 内容 |
|---|---|
| CLAUDE.md / SOUL.md | 基础信息、人设 |
| RULE.md | 规则约束 |
| SKILL.md | 技能流程 |
但是!!什么都往里塞的话,Agent 还没开始干活脑子就满了。
所以要渐进加载。
启动时只加载最少的东西,需要的时候再去读详细内容。一层一层往下。
10 | 规则怎么写才有效?
Agent 有时候会偷懒、会耍小聪明、会走捷径。你写了操作手册它不看,觉得自己能行。
所以需要规则。每次启动自动加载的那种,开机就生效。
但写规则这件事,比养娃还难。。。。
你写个「禁止 xx」,Agent 看完心想,这规则不太合理啊,算了我按自己的来吧。
知错,认错,不改错。主打一个热情礼貌气死人。
所以一条有效的规则得有四样东西:
| 要素 | 说明 |
|---|---|
| 具体要求 | 明确说什么能做什么不能做 |
| 原因说明 | 解释为什么有这个要求 |
| 反合理化条款 | 提前堵住 Agent 可能找的借口 |
| 历史证据 | 用过去的教训证明规则的必要性 |
反合理化就是提前把 Agent 可能找的借口堵死:
- "时间不够?"时间多的很!
- "成本太高?"一点都不高!
- "方案太复杂?"复杂也得做!
堵完借口还不够。有时候告诉它应该怎么做、做了有什么好处,比一堆禁止管用。堵不如疏。
11 | Skill 就是操作手册
Skill 就是写给 Agent 看的操作手册。大白话告诉它什么场景该怎么干,里面还能带脚本工具。
物理结构很简单,就是一个文件夹。
里面有个说明文档,开头几行写一小段自我介绍。
安装? 把文件夹拷贝到技能目录。没有安装向导,没有下一步下一步,没有重启。就是拷贝粘贴。
但 Skill 里有一个很重要的东西——脚本。
Agent 聪明的时候是真聪明,但偶尔它会即兴发挥。。。。搞创作可以,搞业务流程不行。
需要 100% 稳定的环节,让 Agent 写个脚本处理。代码没有灵感,没有即兴发挥,1+1 跑一万次还是 2。稳定。
脚本写好了配一个说明文档,放同一个文件夹,丢进技能目录。你就做出了一个自己的 Skill。
12 | 多 Agent 协作的"主窗口原则"
一个窗口装不下的活儿,就得多开几个 Agent。
最常见的是接力模式: 一个做完交给下一个。
但这里有个大坑——新 Agent 天然倾向于觉得前面做的不对,想推翻重来。
所以要保留一个主窗口从头到尾不关,负责方案讨论和最终验收。
进阶一点是 Sub-Agent 模式: 让主 Agent 自己拆活儿派给临时工。用户只跟主 Agent 打交道。
还有一种场景是独立评审: 让写代码的 Agent 自己评自己的代码,那就是王婆卖瓜。必须新建一个独立 Agent 来审。
12 条速查表
| 条目 | 核心知识 |
|---|---|
| 01 | Agent 是直接帮你动手的 AI |
| 02 | 模型 + 工具 + 上下文,上下文是拉开差距的关键 |
| 03 | 记忆、知识库、规则、技能都是上下文 |
| 04 | 窗口装满 → 压缩 → 遗忘,这是死循环 |
| 05 | 窗口越满,每条消息越贵 |
| 06 | 记忆靠读写文件,不是靠脑子记 |
| 07 | 沟通用 WWH:What、Why、How |
| 08 | 上下文少即是多,新任务开新窗口 |
| 09 | 默认上下文要渐进加载 |
| 10 | 规则要具体 + 原因 + 反合理化 + 证据 |
| 11 | Skill 是操作手册 + 脚本,稳定压倒一切 |
| 12 | 多 Agent 协作要保留主窗口 |
最后
如果有哪些知识点感觉没讲清楚,或者你还想了解什么别的,可以告诉我。
工具会换,底层逻辑不变。
把这 12 条记住了,换什么 Agent 工具都不慌。
