Appearance
📰 概要
2026年4月,具身智能数据战全面开打。京东上线具身智能数据交易平台,发动60万人采集1000万小时数据。
百度推出具身智能数据超市,解决数据质量参差不齐、格式标准不一、使用成本高等痛点。
群核科技建物理仿真道场,腾讯发布Tairos开放平台。表面是数据之争,实则是数据流动规则之争。
🔍 解读
具身智能和LLM的数据焦虑不同。LLM缺的是文本数据,具身智能缺的是物理世界交互数据。
行业喊了三年缺数据,但没人说清到底缺什么。现在分层清晰了:运动控制、场景理解、任务决策。
不同层级需要不同数据。京东做的是原始数据采集,百度做的是标准化超市,群核做的是仿真环境。路径不同,目标一致。
💎 深挖
来看各平台定位:
| 平台 | 数据策略 | 核心价值 |
|---|---|---|
| 京东 | 60万人采1000万小时 | 原始数据规模 |
| 百度 | 数据超市标准化 | 降低使用成本 |
| 群核 | 物理仿真道场 | 降低采集成本 |
| 腾讯Tairos | 开放平台 | 连接上下游 |
荣耀机器人跑半马50分26秒打破人类纪录,但评论指出这是工程能力而非AI能力突破。算法换到另一台机器人跑不出同样成绩。
这说明具身智能的数据需求分层明确:运动控制靠本体工程,场景理解靠环境数据,任务决策靠任务数据。
京东的策略最激进:发动60万人采集1000万小时数据。这是原始数据规模战,用人力换数据量。
百度的策略更务实:建数据超市,解决格式标准不一问题。标准化后的数据才有商业价值。
群核的策略是技术路径:用物理仿真替代真实采集。仿真道场可以反复运行,降低边际成本。
对行业的影响:数据基础设施正在形成。没有数据平台的玩家会丧失竞争力。
对用户的影响:如果你做人形机器人,需评估数据来源。自建数据平台成本高,接入现有平台可能是务实选择。
什么情况不建议盲目采数据:如果你没想清楚数据分层需求,大规模采集可能是浪费。运动控制数据、场景理解数据、任务决策数据各不相同。
