Skip to content

🏷️ 强化学习

共 6 篇文章

📄

腾讯开源OpenSearch-VL:打破多模态AI黑箱垄断,搜索智能体得分提升29%

腾讯混元团队联合UCLA、香港中文大学开源OpenSearch-VL多模态训练方案,将搜索智能体性能提升29%,提供完整开源方案打破AI技术黑箱,为多模态AI研究提供可复现的基础设施。

🤖

AWS让Nova 2 Lite「自训练」:用LLM当裁判,强化微调比SFT聪明在哪

AWS发布Reinforcement Fine-Tuning(RFT),用LLM当裁判微调Nova 2 Lite,让轻量模型在Agent任务上跑赢Claude Sonnet 4.5。关键不在模型参数,而在奖励函数设计,这是给AI Agent对齐问题提供了一个可复制的工程路径。

🤖

AWS详解LLM-as-a-judge奖励函数设计:布尔评分比1-10量表更可靠

AWS发布LLM-as-a-judge奖励函数设计指南,对比两种评估模式(布尔评分vs偏好评分),指出布尔评分更可靠。生产级RFT系统每次训练步处理数千次奖励评估,需配合确定性奖励组件。

🤖

OpenAI模型里「生妖怪」真相:RL奖励信号失控扩散,Nerdy人格是元凶

OpenAI官方披露GPT-5.1到GPT-5.5出现「小妖精」语言习惯(goblin/gremlin比喻)。元凶是「Nerdy」人格奖励信号意外偏爱creature词,RL没有边界——从2.5%对话扩散到全模型。

📄

OpenClaw-RL开源狂揽2700星:聊天就让Agent自动进化,无需标注数据

普林斯顿大学开源OpenClaw-RL训练框架,边聊天边让OpenClaw自动学习进化。四异步模块架构、无需标注数据、支持二值强化学习+在线策略蒸馏+混合优化三种方法,越用越聪明。

📄

OpenRA-RL开源红警AI训练场:大模型经济满分战斗零分

Hugging Face发布OpenRA-RL,把经典红警改造成Agent训练场。Qwen3 32B上阵测试,经济拉满但战斗归零,暴露了大模型在实时策略游戏中的短板。

探索 AI 世界,掌握智能未来