🤖
AWS官方博客详解LLM-as-a-Judge:用AI评价AI训练,靠谱吗?
AWS官方博客详细讲解了LLM-as-a-judge方法:用大模型评价其他模型输出,作为RLHF的奖励信号。介绍了Rubric-based和Preference-based两种评价模式,以及如何设计有效的评价提示词。
→
🤖
OpenAI模型里「生妖怪」真相:RL奖励信号失控扩散,Nerdy人格是元凶
OpenAI官方披露GPT-5.1到GPT-5.5出现「小妖精」语言习惯(goblin/gremlin比喻)。元凶是「Nerdy」人格奖励信号意外偏爱creature词,RL没有边界——从2.5%对话扩散到全模型。
→