Appearance
📰 概要
一个做AI视频的公司,做出了目前最好的机器人大脑。
2026年4月29日,生数科技主动认领了神秘登顶模型MotuBrain。
4月中旬,它悄悄登顶WorldArena和RoboTwin2.0两个国际benchmark,让具身圈大佬们猜了三周。
生数科技就是做出Vidu视频模型的公司——央视动漫用AI拍西游的那家。
MotuBrain在WorldArena三项维度全部第一,在RoboTwin2.0两个场景下分别达到95.8和96.1,均排名第一。
过去几年,能把其中一个测试做到极致已属不易。生数科技说:一个MotuBrain就够了。
🔍 解读
为什么AI视频公司能做机器人大脑?
关键在于世界观一致:视频模型理解物理世界,机器人需要理解物理世界才能行动。两者是同一个能力在不同场景的应用。
具体来说,一段汽车漂移的视频,模型要看懂:车为什么拐弯、轮胎为什么冒烟、下一秒会往哪走。这正是视频模型最擅长的事——预测物理世界的未来状态。
MotuBrain是"世界动作模型"(World Action Model)。核心是:理解物理规律 → 预测下一步 → 输出行动。三者合一,不是分开的三步。
对比主流的VLA路线(视觉-语言-动作模型,如PI-0),MotuBrain走了另一条路:视频预测为基础,动作输出为终点。
💎 深挖
WorldArena测的是什么
WorldArena是业界公认的World Model能力测试场。它不看你生成的视频好不好看,而是看模型能不能真正理解物理世界。
MotuBrain在Motion Quality(动作真实性)、Flow Score(连续性)、Motion Smoothness(平滑性)三个维度全部第一。
这意味着它不是靠某个单项刷分,而是真正理解了物理规律。
RoboTwin2.0的硬核考验
RoboTwin2.0是Action Model的硬核考场。50个任务,覆盖抓取、放置、推、拉、旋转等多种操作类型。
分两种环境:Clean场景(标准实验室,物体位置固定)和Randomized场景(随机扰动——物体位置随机偏移,灯光颜色变化,桌子角度微调)。
MotuBrain在两个场景下分别达到95.8和96.1,均排名第一。关键是它在"没见过的条件"下依然表现稳定——泛化能力强。
什么情况不建议用
如果你关注的是机器人硬件控制、底层运动规划,MotuBrain帮不上忙——它是大脑,不是控制层。
如果你要做的是专用机器人(比如只做抓取),专用模型可能比通用世界模型更高效。
为什么值得持续关注
生数科技2025年12月开源了通用基座世界模型Motus,MotuBrain是商业化升级版。如果视频生成公司能持续跨界具身智能,AI视频的物理理解能力将进入机器人市场。
未来的机器人不需要从头训练物理直觉,只需要一个能"看懂世界"的视频模型作为大脑。生数正在验证这条路。
