Appearance
AWS让Nova 2 Lite「自训练」:用LLM当裁判,强化微调比SFT聪明在哪
📰 概要
一个轻量模型靠「强化学习裁判」,打败了比它大几倍的模型。
2026年4月30日,AWS在官方博客上发布了一种叫 Reinforcement Fine-Tuning(RFT)的技术。
核心思路:用另一个LLM当裁判,给Nova 2 Lite的输出打分,基于奖励信号调整模型权重。
实测结果:RFT后的Nova 2 Lite在Agent任务上,从基线3.85分提升到4.33分(满分5)。
对比之下,它同时超越了Claude Sonnet 4.5和Claude Haiku 4.5的表现。
范式迁移:从「模仿正确答案」到「学会判断好坏」。
🔍 解读
传统的模型微调叫 SFT,喂给模型一堆「标准答案」,模型学会模仿。
RFT 不一样。你不给标准答案,而是给评判规则——让一个独立的LLM当裁判,给模型输出打分,模型基于分数调整自己的行为。
这个区别在Agent任务里意义重大。任务规划、数据生成、工具调用这些场景,正确的答案不止一种,过程比结果更重要。SFT无法捕捉这种灵活性,RFT可以。
AWS还发现,用 JSON schema 做正确性验证,RFT后模型的 schema 验证率达到了100%。这对构建可靠Agent系统是关键一步。
但RFT不是银弹。计算成本约是SFT的4-8倍,奖励函数设计需要大量迭代。简单任务上,SFT仍然更快、更稳定。
💎 深挖
这项技术的真正价值,不在于Nova 2 Lite赢了多少评测分,而在于它提供了一套可复制的工程路径。
过去,Agent系统的对齐和稳定问题一直是大坑:模型在Demo里表现很好,上线后输出飘忽不定,调试无从下手。
RFT 把「判断输出质量」外包给专门的裁判模型,开发者只需设计奖励规则,不需要标注数据。
对于你来说,这意味着:以后调教垂直领域Agent,可能不需要再喂大量标注数据了。设计好奖励函数,让模型自己学会什么是对的方向——成本比人工标注低得多。
什么情况不建议用?高度确定的单轮问答,比如FAQ问答、简单分类,RFT带来的提升不足以覆盖额外成本。
这类场景用SFT就够了。但多步推理、任务规划、复杂工具调用的Agent系统,RFT值得投入研究。
RFT 背后更大的信号:大模型的能力竞争,已经不只是「谁家模型更大」,而是「谁家训练范式更聪明」。
