Skip to content

AI视频公司造出机器人大脑:生数科技MotuBrain双榜登顶,左手机器人右手调酒

2026年5月1日

📰 概要

一家做AI视频的公司,造了个机器人大脑。

不是段子。2026年4月中旬,MotuBrain模型悄无声息地同时登顶两个国际具身智能benchmark。 WorldArena(世界模型)和RoboTwin2.0(动作模型),没人知道是谁做的。行业猜了三周。

2026年4月29日,生数科技主动认领了。 没错,就是那个做Vidu视频模型的生数科技。

MotuBrain在WorldArena的运动质量、流畅度、平滑度三个维度全拿第一。 在RoboTwin2.0上,50个任务九成超过90分,一半满分100,随机环境下唯一平均分超过95的模型。 同时登顶两个完全不同领域的benchmark,之前没人做到过。


🔍 解读

生数科技的路线跟行业主流不一样。

主流具身智能公司走的是"专用大脑"路线——一个模型管搬运、一个模型管开门、一个模型管叠衣服。 生数科技走的是"统一世界动作模型"路线:把"预判世界"和"驱动行动"放在同一个模型里。

Demo展示了三个不同型号的机器人做五件事:插花、整理沙发、火锅局服务、调酒、整理洗漱台。 一个细节很亮眼——火锅局场景中,机器人右手拿勺舀丸子,左手倒果汁,左右手同时干不同的事。 舀丸子时勺子一开始是空的,机器人通过视觉判断"勺里没东西",自主重新规划去锅里捞。 这个过程没有人干预,是模型自己"想"出来的。

生数科技跟阿里领投刚完成近20亿元B轮融资。这笔钱价值在于一个逻辑:视频模型理解物理世界,机器人大脑行动于物理世界,两个能力长在同一个底座上。


💎 深挖

生数科技的布局,可以拆成两条线。

第一条线是数字世界。Vidu视频模型在商业化上已经跑通——漫威《毒液3》水墨风宣传片、AI漫剧《明日周一》45天产出50集、播放量破500万。 这不仅是做视频,Vidu在生成视频时必须学习物理规律:重力、碰撞、光影、流体——这些知识恰好是机器人大脑需要的。

第二条线是物理世界。MotuBrain基于去年的Motus开源模型升级,核心架构U-ViT统一处理视觉和动作。底座打了四个月就出商业版,速度比同行快。

这种"双轨结构"有护城河。纯做机器人本体的公司没有视频数据基础,数据靠仿真和真人采集,成本高、规模小。纯做视频的公司没有机器人动作数据。生数科技两边都有。

技术选型上,MotuBrain走的是"边看边动"(World Action Model)。 区别于行业主流的"先看后动"(先World Model再VLA)。 推演和行动共享同一个表征空间,偏差不互相放大,响应更快。

什么情况不建议用? 如果你的机器人应用场景极其单一(如固定工位焊接),选通用大脑可能过剩。 另外生数科技是视频公司跨界,工业级部署经验还需验证。

对开发者的启发:视频模型公司跨界做机器人大脑,看起来跨界,逻辑上自洽。 "理解物理世界"和"行动于物理世界"之间的鸿沟,可能比想象中小。 关键在于底层架构是否统一——U-ViT架构的"统一建模"思路,比"分段串联"更接近通用智能的本质。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来