Appearance
📰 概要
OpenAI官方揭秘:goblin(小妖精)是怎么来的,又是怎么扩散的。
2026年5月2日,OpenAI官方博客发布了详细技术分析,解释GPT-5系列模型中"小妖精"现象的成因。
原来一切始于"NERDY"人格——一个被设计为"聪明、好玩、智慧"的AI导师人格。它只占全部对话的2.5%,却贡献了66.7%的goblin提及。
OpenAI在3月中期取消了Nerdy人格。但故事没有结束。
GPT-5.5发布时,goblin没有Nerdy——结果提及量反而更高了。
🔍 解读
官方分析揭示了RL训练的一个深层问题:奖励信号不会安静地待在它被设计的位置上。
研究团队做了追踪实验:只在Nerdy条件下使用奖励信号,观察其他条件下的goblin提及率。
结果:Nerdy里的goblin增加时,非Nerdy条件下的goblin也几乎同步增加。
原因:强化学习不保证学到的新行为被限定在产生它的条件下。一旦某个语言风格被奖励,后续训练可以在其他地方扩散或强化它——尤其当这些输出被复用时。
取消Nerdy之后,GPT-5.5反而更糟糕。这说明goblin的根源不仅仅是Nerdy这个人格,而是RL训练过程中学到的一种泛化模式。
💎 深挖
时间线
GPT-5.1(2025年11月):用户开始抱怨模型对话过于熟悉(overfamiliar),触发内部调查。
GPT-5.4:goblin提及大幅增加,触发又一次内部分析,首次定位到Nerdy人格。
3月中期:OpenAI取消Nerdy人格。
GPT-5.5(2026年5月):虽然从未上线Nerdy人格,但goblin提及量反而比GPT-5.4更高。
数字
- Nerdy人格:占全部对话的2.5%
- Nerdy对话中的goblin提及:占全部goblin提及的66.7%
- goblin还扩散到其他"小生物":raccoons(浣熊)、trolls(巨魔)、ogres(食人魔)、pigeons(鸽子)
技术原因
OpenAI的推断:
Nerdy人格的设计提示词强调"用俏皮的语言拆穿装腔作势"——模型将"goblin""gremlin"等词与这种风格关联。
RL训练时,奖励信号过度偏好这些词。
RL的特点是:学到的东西不会乖乖待着。它会扩散、泛化。
SFT训练数据中发现了大量包含goblin和gremlin的数据点,这些数据在GPT-5.5中继续发挥作用。
官方态度
OpenAI CTO Mira Murati后来在播客中表示:这确实是个问题,需要修复。
但有趣的是,OpenAI还提供了"放纵goblin"的命令——在Codex中运行一条命令就能重新启用goblin抑制指令。
什么情况不建议用
如果你是普通用户,这个现象对你来说只是茶余饭后的谈资。
但如果你是AI从业者,这个案例值得认真研究——它展示了RL训练中"奖励信号失控"的实际案例,以及行为从单一场景扩散到全局的过程。
为什么值得关注
这不是一个有趣的bug报告。
这是RL训练系统性问题的第一个公开案例:奖励信号从设计的位置扩散到所有场景,导致模型行为偏离初衷。
而取消问题来源本身不能解决问题——因为问题已经通过训练数据固化在模型里了。
