Appearance
你缺的不是提示词而是Harness:让AI从个人助理变外包团队
记忆、验证、出错恢复、权限控制,这才是AI真正能干活的底层逻辑。你以为自己缺提示词,其实你缺的是Harness。
先说说AI本来是什么
说白了,一个LLM就是个单次响应机器。你问,它答,这次对话结束。它不记得昨天你们聊了什么,不知道这个任务上周做到哪一步了,更不会主动想"下一步应该干什么"。
但真实工作里需要的是什么?是连续的、有状态的、多步骤的一整件事。
- 写一篇推文:搜素材、确定角度、起稿、改稿、配图、排版、发布
- 做一期视频:策划、写脚本、录音、剪辑、包装、上传
这中间每一步都可能出错,每一步都需要上一步的结果作为输入……但AI本来只会回答"这一次"。
矛盾就在这里。Harness要解决的,就是这个矛盾:让原来只能做一次的AI,能跑完一整件事。
核心判断:Harness改变AI的组织形态
一句话:没有Harness,AI是"个人助理";有了Harness,AI是"外包团队"。
| 维度 | 个人助理 | 外包团队 |
|---|---|---|
| 监督 | 全程盯着 | 给需求自己跑 |
| 出错处理 | 等你喊停 | 自己想办法 |
| 下一步决策 | 等你指令 | 自己决定 |
| 边界管控 | 你手动管控 | 系统约束 |
2024年大家都在卷提示词,因为那时候AI基本上就是个人助理。但当你想把AI交给团队用、做成产品给别人用、让它自动跑通宵……提示词就管不住了。
Prompt管的是"这次对话的质量"。Harness管的是"这件任务的生命周期"。
外包团队的逻辑放到AI上怎么理解
当你找了一支外包团队来帮你做事,你不可能24小时坐在那里看他们操作,所以你们之间需要一套协作机制:
1. 项目文档(记忆)
干了什么、决定了什么、为什么这么决定,都要记下来。保证换个人能接上,隔几天能接上,出了问题能回溯定位。
2. 交付标准(验证)
代码要跑测试,设计要对齐品牌,文案要符合调性。不能光凭某个人的感觉,得有客观标准能检验。
3. 应急预案(出错恢复)
API挂了怎么办?格式解析失败怎么办?超时了怎么办?外包团队不能每个意外都来问你,他们要有自己的处理机制。
4. 权责合同(权限控制)
外包团队能读什么文件、能改什么数据、能删什么记录,边界要清楚。危险操作要有二次确认,不能给了把锁就乱开门。
以上4点搭起来,就是Harness。
Harness改变的不是AI有多聪明,改变的是AI要对多大范围的结果负责。
以前AI只对"这次回答"负责,现在AI要对"这件事做完了吗"负责。
实际该怎么用这个思路
常见误区
一看到Harness就想着一步到位搭一套超级复杂的系统,结果发现80%的任务根本用不上那么重的东西。
三步走策略
第一步:先拆流程,别急着搭
把你的工作流按任务类型分类。
第二步:从最痛的点入手,别一次上全套
问自己:现在最大的痛点到底是什么?
| 痛点 | 解决方案 | 复杂度 |
|---|---|---|
| AI老是忘事 | 先解决记忆——每次对话开头让它先复述上下文 | 最低 |
| AI老是瞎操作 | 先解决权限——危险操作加一个"请确认"步骤 | 低 |
| AI一出错就崩盘 | 先解决恢复——出错后自动重试或转人工 | 中 |
顺序:能用 > 好用 > 完美,不要搞反。
第三步:Harness要"先厚后薄"
这是一个反直觉的结论:一开始要把系统做重,等跑顺了再做减法。
原因是只有真正跑起来,你才知道哪些判断可以交给模型自己做、哪些必须人工管控。没有这段运行数据,你做出来的"轻量Harness"基本上是在猜。
Manus团队6个月重写了5次,每次都在删代码——只有项目跑起来才知道什么可以省掉。
自检清单(可直接拿去用)
如果你在评估一个AI工具或者自己搭的流程靠不靠谱,先问这8个问题:
记忆
- 它能记住之前的决策吗?
- 换一天、换一个人,能接上之前的进度吗?
验证
- 它怎么知道自己做得对不对?
- 有没有自动的检查机制?
出错恢复
- 出错了能自动恢复吗?
- 还是说每次都要人工介入?
权限控制
- 能做什么、不能做什么,边界清晰吗?
- 危险操作有二次确认吗?
哪个答不上来,就是下一个要补的Harness短板。
总结
| 要点 | 说明 |
|---|---|
| Harness的本质 | 让AI对"任务生命周期"负责,而不是只对"这次回答"负责 |
| 四大要素 | 记忆、验证、出错恢复、权限控制 |
| 三步走 | 先拆流程→从最痛点入手→先厚后薄 |
| 优先级 | 能用 > 好用 > 完美 |
一句话:Harness问的是一个很朴素的问题——你有没有真正把AI当一个需要管理的团队来对待,而不只是一个随叫随到的智能搜索框。想法上迈过去了,剩下的都是执行细节。
