Appearance
📰 概要
你的ChatGPT有没有突然蹦出过"小妖精"(goblin)或"小恶魔"(gremlin)这样的奇怪比喻?
这真不是闹鬼。2026年4月29日,OpenAI官方博客发表了一篇技术文章,揭开了GPT-5.1到GPT-5.5里"生妖怪"的真相:一个RL奖励信号的失控扩散。
问题出在"Nerdy"人格上。OpenAI训练这个人格时,奖励信号意外偏爱带creature词的回答。
但强化学习没有边界——在一个条件下被奖励的风格,会悄悄扩散到其他条件里。
这就是AI模型的"小妖精问题"。
🔍 解读
RL训练没有隔离墙。
「Nerdy」人格在ChatGPT里只占2.5%的对话,但贡献了66.7%的goblin提及。
更关键的是:76.2%的训练数据集中,Nerdy的奖励信号给带creature词的回答打了更高分。
奖励了就有更多生成。生成的内容进了SFT数据。SFT让模型更爱生成。再进下一轮RL。
反馈循环一旦建立,行为就很难消除。GPT-5.5开始训练时还没找到根因,所以它带着这个习惯出生。
OpenAI的结论是:强化学习的奖励信号会"越界"。在一个子任务上被强化的东西,会以你意想不到的方式出现在其他地方。
这件事对所有AI开发者都是提醒:你以为在优化A,可能悄悄改变了B。
💎 深挖
具体数字
GPT-5.1上线后,「goblin」使用率涨了175%,「gremlin」涨了52%。
Nerdy人格只占2.5%对话,却贡献66.7%的goblin提及。
76.2%的训练数据集中,Nerdy奖励信号偏爱creature词回答。
根因链条
问题不是有人故意教AI说"小妖精",而是强化学习里一个奖励信号的设计失误。
OpenAI在"Nerdy"人格训练时,给"俏皮的语言风格"打了高分——但这个奖励信号同时也偏爱包含goblin/gremlin的回答。
之后发生的事:
- Nerdy回答中开始出现creature词
- 这些回答被放进SFT训练数据
- 模型整体学会了这个语言习惯
- 习惯扩散到没有Nerdy prompt的对话里
怎么修的
GPT-5.4发布后(2026年3月),OpenAI停用了"Nerdy"人格,同时过滤掉训练数据里的creature词。
GPT-5.4 Thinking版本中,goblin提及明显下降。但GPT-5.5已经在停用前开始训练,所以保留了部分习惯。
如果你现在打开Codex,可以自己体验:运行一条命令去掉goblin抑制指令,小妖精就回来了。
什么情况不建议用
如果你在构建对输出风格有严格要求的AI产品,要注意:RL信号可能在某个子场景偏爱某些词,这些词会悄悄扩散到全局。
为什么值得关注
这不是一个关于"小妖精"的搞笑故事。这是一个RL训练的工程警示:奖励信号会越界。一个看似局部优化,可能产生全局副作用。
OpenAI从这次事件中开发了新的行为审计工具,能更快定位模型异常行为的根因。这个能力,对整个行业都有价值。
