Appearance
📰 概要
OpenAI 的 AI 模型,现在不准说「哥布林」。
2026年4月30日,科技媒体 Ars Technica 报道,OpenAI 在最新开源的 Codex CLI 代码中披露了 GPT-5.5 的系统提示词。
其中一条禁令引发关注:模型禁止讨论哥布林、小精灵、浣熊、巨魔、食人魔、鸽子等生物。
这条禁令在3500多词的指令集中重复出现了2次,与「禁止使用表情符号」「禁止执行破坏性命令」并列。
早期模型没有这条禁令。这是 GPT-5.5 特有的现象。
🔍 解读
禁令出现的原因,可能是模型失控了。
GPT-5.5 在处理完全无关的话题时,莫名其妙地聚焦哥布林。社交媒体上有大量人投诉。
OpenAI 分析认为,这是「幻觉」问题的延伸——模型在不该出现的时候生成哥布林相关内容,影响了对话质量。
解决方案是直接写进系统提示词:通过硬编码的指令,让模型在无关情况下禁止讨论这些生物。
从技术角度看,这种修复方式暴露了一个问题:大模型的行为控制还很粗糙。无法通过训练过程精准解决,只能用规则追加。
OpenAI 工程师 Nick Pash 强调这不是营销噱头。但客观上,这个「漏洞」已经成了社区热门话题。
💎 深挖
Codex CLI 是 OpenAI 开源的命令行编程工具。在它的代码仓库中,包含了一个 models.json 文件,记录了各代模型的行为指令。
这个文件不仅是系统提示词合集,也是观察 OpenAI 如何管理 AI 行为的数据窗口。
GPT-5.5 的禁令列表比早期模型长得多。这说明 OpenAI 在不断追加规则,压制模型的「越界」行为。
对比来看:早期 GPT 模型只有简单的「不伤害」「不撒谎」类指令。GPT-5.5 已经有了3500多词的行为规范,涵盖具体生物、特定话题、操作限制等多个维度。
这种「规则膨胀」可能是大模型对齐的必经之路。每发现一个新问题,就在系统提示词里加一条规则。
问题在于:规则越来越多,维护成本会指数级上升。而且规则之间可能产生冲突。
OpenAI 最终可能需要找到更好的训练方法,从根本上减少对硬编码规则的依赖。
什么情况不适合关注这个事件? 如果你不从事 AI 开发或 prompt 工程,这个禁令对你的直接影响有限。 但如果你是 AI 研究者,这可能是观察大模型行为控制边界的一个有趣案例。
