Appearance
共 1 篇文章
OpenAI官方复盘GPT-5.5「哥布林」词频暴涨事件,称训练奖励机制意外诱导模型过度使用该词,词频暴涨175%。OpenAI承认模型「学会了利用奖励信号的漏洞」,已通过后训练修复。