Appearance
📰 概要
OpenAI干了一件挺有意思的事。
在最新开源的Codex CLI代码里,GPT-5.5的系统提示词被完整披露。3500多字的指令集,规定了模型该做什么、不该做什么。 其中一条禁令特别显眼:严禁讨论哥布林、小精灵、浣熊、巨魔、食人魔和鸽子。
这条禁令在提示词中出现了两次,跟"禁止使用表情符号""禁止执行破坏性命令"放在一起。 对比早期模型,没有类似规定——这是GPT-5.5特有的。
为什么?因为用户抱怨模型在无关对话中总是不自觉地聊起哥布林,而且频率出奇的高。
🔍 解读
这件事表面好笑,实际反映了大模型对齐的一个真实难题。
系统提示词就是AI的"行为守则"。 OpenAI给GPT-5.5写了一份比普通公司员工手册还长的指令集——3500个字。 这个守则决定了AI如何回应、什么能聊、什么不能聊。
但问题在于:你没法预测所有不该做的事。 你能写"禁止暴力""禁止歧视",但你很难想到"禁止聊哥布林"。 只有当模型真的开始频繁聊哥布林了,你才知道需要加这一条。
这个过程叫"对齐迭代"——模型的行为不是一次设计好的,而是在使用中发现偏差、修正偏差的循环。
OpenAI工程师Nick Pash特意强调:这不是营销噱头。 意思是:别多想,真的是模型出了bug。
💎 深挖
这件事有几个值得认真聊的侧面。
第一个是"系统提示词作为技术文档"的价值。 Codex CLI开源后,开发者在代码仓库里直接看到了GPT-5.5的完整提示词。 这在大模型行业很少见——通常提示词是黑盒,只有OpenAI内部知道。 这次开源等于给了外界一个难得的窗口:AI的"大脑说明书"长什么样。
第二个是"难以预测的失败模式"。 GPT-5.5不是故意聊哥布林的,而是在训练数据中某种模式被放大了。 可能是某个训练数据集中哥布林出现频率异常高,也可能是指令微调时某个权重跑偏了。 这种失败模式在发布前几乎不可能被发现——它太具体、太荒谬了。 OpenAI只有等几十万用户用上了,才通过用户投诉反推出来。
第三个是对AI安全的启示。 如果"聊哥布林"这种无害但奇怪的bug需要用户反馈才能发现,那么更隐蔽、更有害的模型偏差呢? 当前的对齐流程主要是"红队测试+RLHF"。 但GPT-5.5的哥布林问题说明,测试覆盖的盲区可能比想象中大。
什么情况不建议用GPT-5.5? 如果你是专业作家或内容创作者,模型偶尔跑偏到哥布林话题可能影响输出一致性。 不过OpenAI已经在补救——提示词里加了禁令。但禁令本身也是一个信号:这个模型需要被"管教"才能正常工作。
对开发者的启发:系统提示词的架构价值正在上升。 GPT-5.5有3500字的提示词,这个长度本身就是一种技术决策。 未来的AI应用开发,提示词工程可能不再是"调几句prompt"的事,而是一个跟产品需求、用户体验、安全合规并行的系统设计环节。
