Skip to content

机器人不再比谁 Demo 好看:RoboChallenge 18 家联手建真机考场,具身智能终于有了尺子

2026年4月17日

📰 概要

2026年4月17日,具身智能评测平台 RoboChallenge 宣布第二批 8 家企业入驻,加上首批 10 家机构,成员已达 18 家。平台累计真机测试突破 4 万次,参与团队来自中美日新阿等多国。同步上线的 Table30 V2 任务集难度全面升级,长虹、中移杭研等新成员将拓展居家、餐厅等真实场景评测。


🔍 解读

具身智能这个领域有个老问题:各家都在放 Demo 视频,但没人能在同一个考场里比高下。你看到的机器人倒咖啡、叠衣服,可能是录了一百次才成功一次的剪辑。RoboChallenge 造的就是这个考场——用同一套机器人、同一套任务、同一套评分,看谁真行。

但有个前提:4 万次测试主要还在桌面级任务(拿东西、倒水),离家庭、工厂场景有距离。这次扩容,长虹要建 1:1 对标地产样板间的居家测试集,中移杭研要做无人餐厅场景——这是从"桌面考试"迈向"真实世界"的一步。


💎 深挖

具身智能正在经历编程 AI 去年走过的路:从"各家自吹"到"统一评测"。RoboChallenge 就像具身智能的 SWE-bench——把"代码"换成"物理动作"。

对比维度编程 AI 的 SWE-bench具身智能的 RoboChallenge
测试对象代码修复能力物理任务执行能力
测试方式真实 GitHub issue真实机器人操作
核心价值统一标准,横向对比统一标准,横向对比
当前阶段已成行业标准正在成为行业标准

18 家成员的构成有意思:从算力(算力自由)、仿真(光轮智能)、硬件(星动纪元)到应用场景(长虹、中移杭研)全链条覆盖。评测平台不能只有出题的,还得有提供考场的、出钱的、出设备的。时间节奏上看,今年 6 月是密集节点:地平线发布 AnyMove Benchmark,中移杭研开源 VLA-RAIL 推理框架。7 月有餐厅场景 Benchmark,年底长虹产出居家场景真机数据。

对做具身智能研发的人来说,你终于有一个不用自己搭的考场。以前测模型得买机器人、搭环境、写脚本,一套下来几万块、几个月。现在远程就能跑真机测试,结果还能横向对比。但有个风险:评测标准集中在一个联盟手里,18 家既当裁判又当运动员怎么避免?公信力打折扣就白搭。

这周去看一下 RoboChallenge 官网和 Table30 任务集,知道行业用什么标准衡量模型能力。评估具身智能项目时,要求对方提供 RoboChallenge 测试结果,别只看 Demo 视频。如果你只做大语言模型或图像生成,和物理机器人没交集,暂时不需要关注。

什么情况暂不急?消费者级机器人产品还不成熟,早期产品主要面向企业客户。普通人可以等待市场验证后再考虑购买。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来