Appearance
📰 概要
具身智能行业有一个谁都不愿说破的尴尬:数据不够用,但到处都是数据。
高质量操作数据贵得离谱——远程操控采集、精细标注、动作空间统一,每一步都在烧钱。 低质量数据、人类视频、模糊影像到处都是,但传统模型吃不了。 结果就是大家都被高质量数据卡着脖子,规模上不去。
银河通用2026年4月28日发布的LDA-1B,专打这个痛点。 1.6B参数,走WAM(世界-动作融合)路线,2026年4月登顶RSS顶会。 核心能力就一句话:不挑食。
🔍 解读
LDA-1B最大的突破在数据层面。 之前纯VLA模型只能吃高质量标注数据,世界模型只能吃特定格式数据。 如果有100份数据,行业平均只能吃掉20-30份——剩下的全是浪费。
LDA-1B做了三层统一。 第一层是数据来源:仿真数据、真实拍摄、人类视频、机器人记录全收。 第二层是质量等级:高清、模糊、有标注、无标注一视同仁。 第三层是本体适配:只花1小时后训练,就能从Galbot G1迁移到宇树G1的22自由度灵巧手。
验证结果很有意思:团队在微调中加入大量失败和不稳定操作的遥操作数据。 π0.5性能下降,LDA-1B反而提升10%——别人眼里的垃圾数据,在LDA-1B这里成了训练燃料。
💎 深挖
LDA-1B的技术路线在行业里是第三条路。
纯VLA模型的代表是Physical Intelligence的π0.7,擅长举一反三但依赖专家数据。 纯世界模型的代表是英伟达的DreamZero,擅长预判未来但难转成实际动作。 LDA-1B在单一扩散模型框架内把两者融合——同时学动作策略和世界动力学。
技术架构的核心是MM-DiT(多模态扩散Transformer)。 跟传统世界模型在像素级消耗算力不同,LDA-1B在DINO潜空间建模动力学。 注意力放在物体结构和动作本质上,而不是纹理和光照。 这让它在灵巧操控和长程任务上性能提升48%。
规模化测试数据很有说服力。 训练数据从5000小时扩展到30000小时,LDA-1B动作预测误差持续下降。 传统基线模型在加入低质量数据后反而退化——LDA-1B却能继续改善。 这说明具身智能真正进入了类似大模型的Scaling阶段。
银河通用的数据基础设施"银河星数"是支撑这一切的底层。 五层金字塔结构,从原始数据到精标知识逐级递进。 不同质量的数据分配不同训练角色:高质量数据教"完美操作",低质量数据教"容错能力"。 没有垃圾数据,只有放错地方的数据。
银河通用目前估值超200亿元,是国内估值最高的未上市具身智能企业。 相比宇树偏消费级、星动纪元偏人形本体、魔法原子偏通用平台,银河通用的核心壁垒在数据底层的技术架构。
什么情况不建议用LDA-1B? 如果你的机器人场景极其单一(如固定工位焊接),一个简单的行为克隆模型可能就够了,LDA-1B的通用性优势用不上。 如果你的团队没有数据处理和模型微调的能力,预训练模型落地还需要额外的工程投入。 另外LDA-1B开源的版本基于公开数据训练,商业场景需要自行评估数据合规。
对开发者的启发:银河通用的选择验证了一个方向——在数据稀缺的领域,与其花大钱攒高质量数据,不如找到"消化低质量数据"的方法。 这个思路不仅仅适用于机器人,任何数据稀缺的AI场景都可以借鉴。
