Appearance
📰 概要
2026年4月17日,具身智能评测平台 RoboChallenge 宣布第二批 8 家企业入驻,加上首批 10 家机构,成员已达 18 家。平台累计真机测试突破 4 万次,参与团队来自中美日新阿等多国。同步上线的 Table30 V2 任务集难度全面升级,长虹、中移杭研等新成员将拓展居家、餐厅等真实场景评测。
🔍 解读
具身智能这个领域有个老问题:各家都在放 Demo 视频,但没人能在同一个考场里比高下。你看到的机器人倒咖啡、叠衣服,可能是录了一百次才成功一次的剪辑。RoboChallenge 造的就是这个考场——用同一套机器人、同一套任务、同一套评分,看谁真行。
但有个前提:4 万次测试主要还在桌面级任务(拿东西、倒水),离家庭、工厂场景有距离。这次扩容,长虹要建 1:1 对标地产样板间的居家测试集,中移杭研要做无人餐厅场景——这是从"桌面考试"迈向"真实世界"的一步。
💎 深挖
具身智能正在经历编程 AI 去年走过的路:从"各家自吹"到"统一评测"。RoboChallenge 就像具身智能的 SWE-bench——把"代码"换成"物理动作"。
| 对比维度 | 编程 AI 的 SWE-bench | 具身智能的 RoboChallenge |
|---|---|---|
| 测试对象 | 代码修复能力 | 物理任务执行能力 |
| 测试方式 | 真实 GitHub issue | 真实机器人操作 |
| 核心价值 | 统一标准,横向对比 | 统一标准,横向对比 |
| 当前阶段 | 已成行业标准 | 正在成为行业标准 |
18 家成员的构成有意思:从算力(算力自由)、仿真(光轮智能)、硬件(星动纪元)到应用场景(长虹、中移杭研)全链条覆盖。评测平台不能只有出题的,还得有提供考场的、出钱的、出设备的。时间节奏上看,今年 6 月是密集节点:地平线发布 AnyMove Benchmark,中移杭研开源 VLA-RAIL 推理框架。7 月有餐厅场景 Benchmark,年底长虹产出居家场景真机数据。
对做具身智能研发的人来说,你终于有一个不用自己搭的考场。以前测模型得买机器人、搭环境、写脚本,一套下来几万块、几个月。现在远程就能跑真机测试,结果还能横向对比。但有个风险:评测标准集中在一个联盟手里,18 家既当裁判又当运动员怎么避免?公信力打折扣就白搭。
这周去看一下 RoboChallenge 官网和 Table30 任务集,知道行业用什么标准衡量模型能力。评估具身智能项目时,要求对方提供 RoboChallenge 测试结果,别只看 Demo 视频。如果你只做大语言模型或图像生成,和物理机器人没交集,暂时不需要关注。
什么情况暂不急?消费者级机器人产品还不成熟,早期产品主要面向企业客户。普通人可以等待市场验证后再考虑购买。
