Skip to content

OpenAI模型里「生妖怪」真相:RL奖励信号失控扩散,Nerdy人格是元凶

2026年5月3日

📰 概要

你的ChatGPT有没有突然蹦出过"小妖精"(goblin)或"小恶魔"(gremlin)这样的奇怪比喻?

这真不是闹鬼。2026年4月29日,OpenAI官方博客发表了一篇技术文章,揭开了GPT-5.1到GPT-5.5里"生妖怪"的真相:一个RL奖励信号的失控扩散。

问题出在"Nerdy"人格上。OpenAI训练这个人格时,奖励信号意外偏爱带creature词的回答。

但强化学习没有边界——在一个条件下被奖励的风格,会悄悄扩散到其他条件里。

这就是AI模型的"小妖精问题"。


🔍 解读

RL训练没有隔离墙。

「Nerdy」人格在ChatGPT里只占2.5%的对话,但贡献了66.7%的goblin提及。

更关键的是:76.2%的训练数据集中,Nerdy的奖励信号给带creature词的回答打了更高分。

奖励了就有更多生成。生成的内容进了SFT数据。SFT让模型更爱生成。再进下一轮RL。

反馈循环一旦建立,行为就很难消除。GPT-5.5开始训练时还没找到根因,所以它带着这个习惯出生。

OpenAI的结论是:强化学习的奖励信号会"越界"。在一个子任务上被强化的东西,会以你意想不到的方式出现在其他地方。

这件事对所有AI开发者都是提醒:你以为在优化A,可能悄悄改变了B。


💎 深挖

具体数字

GPT-5.1上线后,「goblin」使用率涨了175%,「gremlin」涨了52%。

Nerdy人格只占2.5%对话,却贡献66.7%的goblin提及。

76.2%的训练数据集中,Nerdy奖励信号偏爱creature词回答。

根因链条

问题不是有人故意教AI说"小妖精",而是强化学习里一个奖励信号的设计失误。

OpenAI在"Nerdy"人格训练时,给"俏皮的语言风格"打了高分——但这个奖励信号同时也偏爱包含goblin/gremlin的回答。

之后发生的事:

  1. Nerdy回答中开始出现creature词
  2. 这些回答被放进SFT训练数据
  3. 模型整体学会了这个语言习惯
  4. 习惯扩散到没有Nerdy prompt的对话里

怎么修的

GPT-5.4发布后(2026年3月),OpenAI停用了"Nerdy"人格,同时过滤掉训练数据里的creature词。

GPT-5.4 Thinking版本中,goblin提及明显下降。但GPT-5.5已经在停用前开始训练,所以保留了部分习惯。

如果你现在打开Codex,可以自己体验:运行一条命令去掉goblin抑制指令,小妖精就回来了。

什么情况不建议用

如果你在构建对输出风格有严格要求的AI产品,要注意:RL信号可能在某个子场景偏爱某些词,这些词会悄悄扩散到全局。

为什么值得关注

这不是一个关于"小妖精"的搞笑故事。这是一个RL训练的工程警示:奖励信号会越界。一个看似局部优化,可能产生全局副作用。

OpenAI从这次事件中开发了新的行为审计工具,能更快定位模型异常行为的根因。这个能力,对整个行业都有价值。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来