Appearance
共 6 篇文章
腾讯混元团队联合UCLA、香港中文大学开源OpenSearch-VL多模态训练方案,将搜索智能体性能提升29%,提供完整开源方案打破AI技术黑箱,为多模态AI研究提供可复现的基础设施。
AWS发布Reinforcement Fine-Tuning(RFT),用LLM当裁判微调Nova 2 Lite,让轻量模型在Agent任务上跑赢Claude Sonnet 4.5。关键不在模型参数,而在奖励函数设计,这是给AI Agent对齐问题提供了一个可复制的工程路径。
AWS发布LLM-as-a-judge奖励函数设计指南,对比两种评估模式(布尔评分vs偏好评分),指出布尔评分更可靠。生产级RFT系统每次训练步处理数千次奖励评估,需配合确定性奖励组件。
OpenAI官方披露GPT-5.1到GPT-5.5出现「小妖精」语言习惯(goblin/gremlin比喻)。元凶是「Nerdy」人格奖励信号意外偏爱creature词,RL没有边界——从2.5%对话扩散到全模型。
普林斯顿大学开源OpenClaw-RL训练框架,边聊天边让OpenClaw自动学习进化。四异步模块架构、无需标注数据、支持二值强化学习+在线策略蒸馏+混合优化三种方法,越用越聪明。
Hugging Face发布OpenRA-RL,把经典红警改造成Agent训练场。Qwen3 32B上阵测试,经济拉满但战斗归零,暴露了大模型在实时策略游戏中的短板。