Skip to content

机器人终于能看仪表了:Gemini Robotics-ER 1.6 发布,具身推理再上一个台阶

2026年4月14日

📰 概要

2026年4月14日,Google DeepMind 发布 Gemini Robotics-ER 1.6——一个推理优先的机器人模型升级版,在指向精度、成功检测和全新"仪器读数"能力上全面超越前代 1.5。1.5 版本在细粒度识别上频繁出错(比如把 6 把钳子数成 3 把、幻觉出不存在的物品),1.6 基本解决了这些问题。最引人注目的是新增的仪器读数能力——机器人可以读取圆形压力表、液位指示器、数字读数器甚至化学视镜,达到子刻度精度。这项能力直接来自与 Boston Dynamics 的合作:Spot 机器狗在工业设施中巡检时,需要准确读取各类仪表数值。


🔍 解读

具身智能正在从"能看"走向"能看懂"。之前的机器人视觉模型擅长识别物体类别,但面对"这个压力表读数是多少""任务完成了吗"这类需要推理的问题就力不从心。1.6 的三大能力——指向、成功检测、仪器读数——本质上都在解决同一个问题:让机器人不只是看到画面,而是理解画面中的空间关系、状态变化和数值含义。

但说实话,"安全合规"和"真实工厂里不出事"之间还有很长的路。1.6 在安全维度确实有进步——文本场景伤害识别比 Gemini 3.0 Flash 高 6%,视频场景高 10%。目前模型通过 Gemini API 提供,实际部署到机器人上还需要 VLA 模型配合,端到端延迟和可靠性还需要验证。


💎 深挖

1.6 的三大能力相比 1.5 是全面升级:

能力维度1.5 表现1.6 改进
指向精度不足,幻觉出不存在的物品正确识别所有物体及数量,无幻觉
成功检测单视角,遮挡/光照不足时失效多视角推理,动态和遮挡环境下仍可工作
仪器读数❌ 不支持✅ 全新能力,支持压力表/液位计/数字读数器/视镜

与 Boston Dynamics 的合作聚焦于工业设施巡检场景。Spot 机器狗在化工厂、电站等环境中巡逻,需要读取各类仪表数值并判断是否异常。1.6 的仪器读数能力正是为此而生。仪器读数用了"代理视觉"——模型先放大图像看细节,再用代码执行估算刻度比例,最后结合世界知识解释含义。这不是简单的 OCR,而是把视觉推理和数值推理串起来。

对做机器人应用开发的人来说,1.6 的指向和仪器读数能力可以直接通过 Gemini API 调用,不需要自己训练视觉推理模型。Google 还提供了开发者 Colab 和提示词示例,上手门槛不高。但要注意——1.6 是推理层,不是动作层,要让机器人真正"动手",还需要搭配 VLA 模型,目前这部分还在早期阶段。工业场景对可靠性的要求极高,99% 的准确率意味着每 100 次巡检就有 1 次可能出错,这个容错空间很小。

如果你在做具身智能相关项目,去 Google AI Studio 体验 1.6 的指向和仪器读数能力,用开发者 Colab 跑几个示例。但如果你的机器人应用对实时性要求极高(毫秒级响应)、需要在完全离线环境运行,1.6 目前还不适合直接部署。

什么情况暂不急?消费者级机器人产品还不成熟,早期产品主要面向企业客户。普通人可以等待市场验证后再考虑购买。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来