Appearance
📰 概要
2026年4月21日,跨维智能发布 DexWorldModel,在 RoboTwin 榜单取得 94.00% 平均成功率,登顶第一。零样本 Sim2Real 结果:仅在仿真中训练,在真机上超过 π0、GR00T N1.5 和 Sim2Real-VLA——后者还用了真机示范微调。
四层协同架构:CLWM(因果潜空间世界模型)解决表示瓶颈,Dual-State TTT Memory 把长时任务内存压到 O(1),SAI 预去噪降低 50% 阻塞延迟,EmbodiChain 提供在线数据流。
VLA 路线正被行业自己抛弃:VLA 概念共同开创者 Pete Florence(Generalist AI CEO)公开宣布不再归类为 VLA。视觉质量与具身任务成功率 Pearson r 仅 0.360——画得最像的,最不懂交互。
🔍 解读
这篇文章最大的信号不是"又一个世界模型",而是行业对"世界模型该怎么评价"的集体反思。
清华 WorldArena 基准用 14 个模型做了系统测量:视觉质量与人类主观评分 r=0.825,但与动作规划成功率 r=0.360。Veo 3.1 视觉美学分最高,具身任务反而"提升有限"。这意味着视频生成榜单和具身任务榜单在评价完全不同的东西。
DexWorldModel 把"下一帧好不好看"换成"世界是否进入了可执行的状态"。CLWM 预测语义特征而非像素,TTT Memory 隔离真实历史与推测历史,SAI 把推理和执行深度重叠——每层设计都指向"真机可闭环"这一个目标。
💎 深挖
对比世界模型的技术路线演进:
| 维度 | 视频生成范式 | DexWorldModel |
|---|---|---|
| 预测目标 | RGB像素/低层隐空间 | 语义特征 |
| 内存占用 | O(T)线性膨胀 | O(1)常数 |
| 推理节奏 | 串行阻塞 | 异步预去噪 |
| 数据供给 | 静态离线数据集 | 在线流式注入 |
| 评价标准 | FVD/时序一致性 | 任务成功率 |
四层协同的收益叠加在同一条曲线上:消融实验显示,去掉 ODS 成功率肉眼可见地下滑——数据流不是可选加持,是直接参与上限提升。
零样本 Sim2Real 是最有说服力的一格。纯仿真训练 + 真机直接跑通 + 超过用了真机数据的基线,说明表示层(语义特征)和记忆层(因果隔离)的设计确实缩短了仿真与现实的差距。
EmbodiChain 已开源:资产生成、场景布局、Reachability-aware 采样、失败恢复、ODS 全部模块化开放。跨维智能的态度很明确——不和概念赛跑,和真实世界赛跑。对做具身智能部署的人来说,这套开源基建比任何论文数字都更值得关注。
