Appearance
📰 概要
2026年4月14日,Google DeepMind 发布 Gemini Robotics-ER 1.6——一个推理优先的机器人模型升级版,在指向精度、成功检测和全新"仪器读数"能力上全面超越前代 1.5。1.5 版本在细粒度识别上频繁出错(比如把 6 把钳子数成 3 把、幻觉出不存在的物品),1.6 基本解决了这些问题。最引人注目的是新增的仪器读数能力——机器人可以读取圆形压力表、液位指示器、数字读数器甚至化学视镜,达到子刻度精度。这项能力直接来自与 Boston Dynamics 的合作:Spot 机器狗在工业设施中巡检时,需要准确读取各类仪表数值。
🔍 解读
具身智能正在从"能看"走向"能看懂"。之前的机器人视觉模型擅长识别物体类别,但面对"这个压力表读数是多少""任务完成了吗"这类需要推理的问题就力不从心。1.6 的三大能力——指向、成功检测、仪器读数——本质上都在解决同一个问题:让机器人不只是看到画面,而是理解画面中的空间关系、状态变化和数值含义。
但说实话,"安全合规"和"真实工厂里不出事"之间还有很长的路。1.6 在安全维度确实有进步——文本场景伤害识别比 Gemini 3.0 Flash 高 6%,视频场景高 10%。目前模型通过 Gemini API 提供,实际部署到机器人上还需要 VLA 模型配合,端到端延迟和可靠性还需要验证。
💎 深挖
1.6 的三大能力相比 1.5 是全面升级:
| 能力维度 | 1.5 表现 | 1.6 改进 |
|---|---|---|
| 指向 | 精度不足,幻觉出不存在的物品 | 正确识别所有物体及数量,无幻觉 |
| 成功检测 | 单视角,遮挡/光照不足时失效 | 多视角推理,动态和遮挡环境下仍可工作 |
| 仪器读数 | ❌ 不支持 | ✅ 全新能力,支持压力表/液位计/数字读数器/视镜 |
与 Boston Dynamics 的合作聚焦于工业设施巡检场景。Spot 机器狗在化工厂、电站等环境中巡逻,需要读取各类仪表数值并判断是否异常。1.6 的仪器读数能力正是为此而生。仪器读数用了"代理视觉"——模型先放大图像看细节,再用代码执行估算刻度比例,最后结合世界知识解释含义。这不是简单的 OCR,而是把视觉推理和数值推理串起来。
对做机器人应用开发的人来说,1.6 的指向和仪器读数能力可以直接通过 Gemini API 调用,不需要自己训练视觉推理模型。Google 还提供了开发者 Colab 和提示词示例,上手门槛不高。但要注意——1.6 是推理层,不是动作层,要让机器人真正"动手",还需要搭配 VLA 模型,目前这部分还在早期阶段。工业场景对可靠性的要求极高,99% 的准确率意味着每 100 次巡检就有 1 次可能出错,这个容错空间很小。
如果你在做具身智能相关项目,去 Google AI Studio 体验 1.6 的指向和仪器读数能力,用开发者 Colab 跑几个示例。但如果你的机器人应用对实时性要求极高(毫秒级响应)、需要在完全离线环境运行,1.6 目前还不适合直接部署。
什么情况暂不急?消费者级机器人产品还不成熟,早期产品主要面向企业客户。普通人可以等待市场验证后再考虑购买。
