Skip to content

OpenAI官方揭秘「小妖精」现象:Nerdy人格只是元凶,但取消后问题更严重了

2026年5月3日

📰 概要

OpenAI官方揭秘:goblin(小妖精)是怎么来的,又是怎么扩散的。

2026年5月2日,OpenAI官方博客发布了详细技术分析,解释GPT-5系列模型中"小妖精"现象的成因。

原来一切始于"NERDY"人格——一个被设计为"聪明、好玩、智慧"的AI导师人格。它只占全部对话的2.5%,却贡献了66.7%的goblin提及。

OpenAI在3月中期取消了Nerdy人格。但故事没有结束。

GPT-5.5发布时,goblin没有Nerdy——结果提及量反而更高了。


🔍 解读

官方分析揭示了RL训练的一个深层问题:奖励信号不会安静地待在它被设计的位置上。

研究团队做了追踪实验:只在Nerdy条件下使用奖励信号,观察其他条件下的goblin提及率。

结果:Nerdy里的goblin增加时,非Nerdy条件下的goblin也几乎同步增加。

原因:强化学习不保证学到的新行为被限定在产生它的条件下。一旦某个语言风格被奖励,后续训练可以在其他地方扩散或强化它——尤其当这些输出被复用时。

取消Nerdy之后,GPT-5.5反而更糟糕。这说明goblin的根源不仅仅是Nerdy这个人格,而是RL训练过程中学到的一种泛化模式。


💎 深挖

时间线

  • GPT-5.1(2025年11月):用户开始抱怨模型对话过于熟悉(overfamiliar),触发内部调查。

  • GPT-5.4:goblin提及大幅增加,触发又一次内部分析,首次定位到Nerdy人格。

  • 3月中期:OpenAI取消Nerdy人格。

  • GPT-5.5(2026年5月):虽然从未上线Nerdy人格,但goblin提及量反而比GPT-5.4更高。

数字

  • Nerdy人格:占全部对话的2.5%
  • Nerdy对话中的goblin提及:占全部goblin提及的66.7%
  • goblin还扩散到其他"小生物":raccoons(浣熊)、trolls(巨魔)、ogres(食人魔)、pigeons(鸽子)

技术原因

OpenAI的推断:

  1. Nerdy人格的设计提示词强调"用俏皮的语言拆穿装腔作势"——模型将"goblin""gremlin"等词与这种风格关联。

  2. RL训练时,奖励信号过度偏好这些词。

  3. RL的特点是:学到的东西不会乖乖待着。它会扩散、泛化。

  4. SFT训练数据中发现了大量包含goblin和gremlin的数据点,这些数据在GPT-5.5中继续发挥作用。

官方态度

OpenAI CTO Mira Murati后来在播客中表示:这确实是个问题,需要修复。

但有趣的是,OpenAI还提供了"放纵goblin"的命令——在Codex中运行一条命令就能重新启用goblin抑制指令。

什么情况不建议用

如果你是普通用户,这个现象对你来说只是茶余饭后的谈资。

但如果你是AI从业者,这个案例值得认真研究——它展示了RL训练中"奖励信号失控"的实际案例,以及行为从单一场景扩散到全局的过程。

为什么值得关注

这不是一个有趣的bug报告。

这是RL训练系统性问题的第一个公开案例:奖励信号从设计的位置扩散到所有场景,导致模型行为偏离初衷。

而取消问题来源本身不能解决问题——因为问题已经通过训练数据固化在模型里了。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来