Appearance
📰 概要
2026年4月28日,具身智能赛道出现了一个里程碑事件。
银河通用发布 LDA-1B 跨本体世界-动作基础模型,1.6B 参数,已被 RSS 2026 录用。 RSS 2026 仅录用了 210 篇论文。
LDA-1B 最大的突破是:业界首次做到"吃数据不挑食"。 虚拟仿真、真实拍摄、人类视频、机器人记录、带标注教案、没标注的原始素材,全部混在一起训练,效果不减反增。
只需 1 小时后训练,模型就能学会操控各种不同形态的机器人身体。 这个时间从行业普遍需要的几天缩短到 1 小时,是数量级的差距。
🔍 解读
具身智能长期被数据问题卡住脖子。 高质量数据靠远程操控采集,成本高;仿真数据和真实场景有天然差距;大量人类视频、粗糙运动记录被当成"垃圾数据"浪费。
LDA-1B 的思路是:没有垃圾数据,只有被"错付"的数据。 把对的数据放到对的训练目标里,每一帧都有价值。
这是行业第一次有人系统性地解决异构数据问题。 过去各家都是挑数据、筛数据。LDA-1B 是第一个把数据"全吃下去"还能提升性能的方案。
💎 深挖
LDA-1B 的技术路线走的是第三条路:既不是纯 VLA,也不是纯世界模型,而是 WAM 世界-动作统一框架。
纯 VLA(代表:Physical Intelligence π0.7)擅长举一反三,但依赖高质量专家数据,难以规模化。 纯世界模型(代表:英伟达 DreamZero)能零样本适配,但难落地成实际动作。
LDA-1B 选了 MM-DiT 多模态扩散 Transformer 架构,在 DINO 潜空间建模动力学。 抓大放小,把注意力放在物体结构和动作本质上,而不是浪费在像素级细节。
性能数据是亮点:
- 复杂任务性能提升 48%,超过 GR00T-N1.6 和 π0.5
- 当有标注数据耗尽后,继续加入超过 10000 小时无标注人类视频,性能依然提升
- 对比:加入低质量数据后,基线模型性能明显退化
长程任务和灵巧操作是检验标准。 从锅里翻捡牛排撒胡椒粉、精准预判物理逻辑(推动扫帚带动纸团位移),这些任务 LDA-1B 都能完成。
什么情况不适合用 LDA-1B?如果你的机器人需要极致精细的力控操作(如手术机器人),扩散模型路线可能有局限。 LDA-1B 更适合分拣、搬运、家务这类感知-决策-交互闭环任务。
银河通用的估值已超 200 亿元,是国内估值最高的未上市具身智能企业。 LDA-1B 开源了公开数据训练的版本,代码和论文都已公开。 对想做具身智能的开发者来说,这是一个值得认真研究的底座模型。
