Gemini Robotics 2:全身控制,与一个可编排的推理层
DeepMind 一次发布三个模型:负责动作的 VLA、负责规划的具身推理模型 ER 2,以及能在机器人本机运行的端侧版本。对这里的读者来说,值得看的不是机器人本身——ER 2 把 VLA 和导航 API 当作工具声明、用双向流接收视频、一边执行一边思考,是这个站点已经在跟踪的那套智能体架构换了一种执行器。真正的新东西是它开始能回答「这一步做完了没有」:时刻定位准确率 91.3%、平均误差 0.96 秒。ER 2 已经通过 Gemini API 公开可用,动作模型与端侧模型仍限早期合作伙伴。
基础信息较完整,适合持续跟踪并等待更多验证。
记录
信号正文
一次发布,三个模型
DeepMind 把 Gemini Robotics 2 描述成「下一代可适应机器人的智能层」,它实际上由三个分工不同的模型组成:
- Gemini Robotics 2:视觉-语言-动作模型(VLA),把视觉与语言输入转成电机控制。这一代第一次能控制整个人形机器人——从脚到指尖——而不只是桌面范围内的上半身,同时也支持双臂机器人。
- Gemini Robotics ER 2:具身推理模型(VLM),充当机器人的高层大脑,与人对话、理解物理环境、规划持续数分钟、包含数百个决策的多步任务,并把电机执行交给下层的 VLA。
- Gemini Robotics On-Device 2:为机器人本机运行优化的 VLA,在没有网络或不能容忍网络延迟的场景下工作。它继承了 Gemini Robotics 1.5 的动作迁移技术,适配一个全新的双臂形态只需要几小时、通常不到 200 条示例,即使新形态在外形、传感器和自由度上差异很大。
为什么它读起来是一条智能体信号
ER 2 的工作方式,和这个站点已经在跟踪的那套智能体架构是同一套,只是工具换成了执行器:开发者把底层控制接口——VLA 模型、导航 API——声明为工具,把视频、音频、文本作为多模态流直接送进模型;模型走 Gemini Live API 的双向流式端点,因此可以一边执行一边思考,不必在每一步之间停下来重新规划。它也能原生调用 Google 搜索或任何用户自定义函数。
官方给的演示是用 ER 2 编排 Boston Dynamics Spot 的导航与机械臂 API,代码在 GitHub 上公开。换句话说,读者手上那套关于工具声明、流式上下文、失败自纠的经验,在这里是直接可迁移的。
真正的新东西:判断「这一步做完了没有」
机器人最难的问题之一是知道任务何时结束。ER 2 在两项能力上给了可比的数字:
- 进度分级——把视频流的每一帧归入五档完成度(0-20%、20-40%……80-100%),准确率 57.4%。这让机器人具备实时的处境感知,能在中途调整或重试失败的某一步,而不必推倒整个流程重来。
- 时刻定位——找出关键事件发生的确切帧(例如什么时候该停止倒咖啡),准确率 91.3%,平均绝对误差 0.96 秒。官方声称它与体量大得多的模型接近,但只用其中一部分算力、执行速度是它们的 4 倍——而亚秒级延迟正是物理世界里安全操作的下限。
空间理解也一并往前推了一档:成功/失败检测改为在原始视频流而不是静态截图上进行,因此能抓住执行中途的洒落、打滑与错位;仪表读数从圆形表盘扩展到数字显示、线性刻度、直尺和液体温度计,覆盖 10 类仪表。
官方自己标出来的短板
同一张多形态评测图里,DeepMind 写明:全身任务和夹爪类灵巧操作达到中到高的成功率,而多指灵巧操作仍然困难。那张图用的是同一个模型检查点跨三种形态——装 SharpaWave 手的 Apollo 2、装 Inspire 手的 Apollo 2、装 Robotiq 夹爪的 Franka Duo。所以「同一个模型驱动不同身体」这件事是真的,「手已经好用了」这件事还不是。
可获得性分三档
- ER 2:已公开,通过 Gemini API 与 Google AI Studio 面向开发者提供,Gemini Enterprise Agent Platform 上是私有预览。
- VLA 与端侧模型:仅对早期合作伙伴开放。
也就是说,今天真正能上手的是那个推理与编排层,而不是动作层——这恰好也是三个模型里与非机器人开发者关系最大的一个。
安全被写成了可测的东西
随这一代发布的还有 ASIMOV-Agentic 基准,衡量具身推理智能体三件事:能否拒绝来自 VLA 的不安全工具调用、能否预判一个任务在物理上是否可行、以及在不确定时能否主动请求人介入。ER 2 在安全指令遵循与人体接近两项基准上是 DeepMind 迄今最好的模型:有人靠近时能让人形机器人停下,区域清空后自主恢复。
把「不确定时主动要人」写成基准指标,而不是留给上层应用去处理,是这次发布里值得单独记一笔的做法。
为什么是现在
为什么重要
这条信号的价值不在机器人本身,而在它把一个已经成熟的智能体架构接到了物理执行器上:工具声明、多模态流式上下文、执行中自纠、多智能体协作,全都是站内已有的概念。更值得注意的是它开始量化「任务完成度」——时刻定位 91.3%、平均误差 0.96 秒——这正是纯软件智能体一直缺的那个验证信号。而且今天真正开放的是推理编排层(ER 2 已在 Gemini API 上),不是动作层。
背景
技术背景
三个模型分工明确:VLA 把视觉与语言转成电机控制(首次覆盖整个人形,从脚到指尖);ER 2 是视觉语言模型,作为高层大脑规划持续数分钟、含数百个决策的任务,把执行交给下层 VLA;端侧版本在本机运行,靠继承自 Gemini Robotics 1.5 的动作迁移技术,用几小时、通常不到 200 条示例适配全新形态。ER 2 走 Gemini Live API 的双向流式端点,所以能在执行的同时思考,避免每步之间的停顿。
关注人群
谁该关注
下一步
学习路径
- 先读 ER 2 那半:把 VLA 和导航 API 声明为工具、用双向流送入视频,与你已经在写的工具调用循环逐点对照
- 重点看两个完成度指标(进度分级 57.4%、时刻定位 91.3% / 0.96 秒),思考同样的验证信号在你自己的智能体里由什么充当
- 再看端侧那半:几小时、不到 200 条示例适配新形态,是端侧部署里「换硬件要付多少代价」的一个具体标尺
- 最后读 ASIMOV-Agentic 的三项设定——拒绝不安全工具调用、预判可行性、不确定时主动要人——把它当作智能体安全评测的一个现成模板
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- 进度分级只有 57.4% 的准确率,在什么样的任务里这个数字已经够用,在什么任务里不够?
- 「一边执行一边思考」的双向流式设计,在纯软件智能体里对应的是什么,值不值得照搬?
- 多指灵巧操作官方自己标为仍然困难,这会把哪些应用场景推迟到下一代?
- 动作模型只对早期合作伙伴开放,只拿到 ER 2 的开发者实际能做出什么?
来源参考