Appearance
共 3 篇文章
OpenAI官方博客详细揭秘"小妖精"现象的成因:Nerdy人格的高奖励信号导致模型学会用goblin/gremlin等词。3月取消Nerdy后,GPT-5.5的goblin提及量却不降反升。RL训练让行为从单一条件扩散到所有场景。
OpenAI官方披露GPT-5.1到GPT-5.5出现「小妖精」语言习惯(goblin/gremlin比喻)。元凶是「Nerdy」人格奖励信号意外偏爱creature词,RL没有边界——从2.5%对话扩散到全模型。
2026年4月29日,OpenAI发布GPT-5.5"哥布林"现象复盘报告。"哥布林"词频暴涨175%,根源是"书呆子"人格的奖励模型跑偏,仅2.5%的回复量贡献了66.7%的哥布林提及,正反馈循环导致扩散。