一句话定位

Google DeepMind 把 Gemini 的「思考 + agentic」范式搬进物理世界的双模型系统:Gemini Robotics-ER 1.5(一个会「思考」、能原生调工具的具身推理 VLM,做高层大脑/orchestrator)+ Gemini Robotics 1.5(一个「先想后动」的多本体 VLA,靠 Motion Transfer 在 ALOHA / Bi-arm Franka / Apollo 三种机器人间零样本迁移技能)。

背景与定位

延续同团队 2025 年 3 月的 gemini-robotics(Gemini-Robotics-Team et al., 2025)与 Gemini Robotics On-Device(GRoD),本代把上一代 VLA 升级成两条主线:具身推理做到 frontier VLM 水平VLA 学会显式思考并跨本体共享技能,再把两者组成 agentic 系统解长程任务。

范式上有三个明确定位:

  • Thinking VLA / Embodied Thinking:给 VLA 加一条多层级自然语言「内心独白」(思路 → 短程步骤 → 原语动作),思想在动作之前生成并追加进上下文。同期相关工作包括 ThinkAct、MolmoAct、OneTwoVLA、RT-H 的 action hierarchy。
  • Motion Transfer(MT)跨本体:不做 per-robot 后训练,用统一 checkpoint 控制多本体,并实现「只在 A 机器人见过的任务在 B 机器人上零样本可用」。对标 Open X-Embodiment / RT-X 的多本体共训,但强调零样本技能迁移这一少见现象;同赛道有 GR00T N1、pi-0-5(π0.5)。
  • Agentic 双模型:orchestrator(GR-ER 1.5)+ action model(GR 1.5 作为工具被调用),对标 SayCan / Inner Monologue / Hi Robot 的分层 VLA。

两个模型都基于「最新一代 Gemini」(Comanici et al., 2025,即 Gemini 2.5)微调而来,共享其多模态世界知识、工具调用与代码执行能力。

模型架构

整体是一套 agentic 系统,由 VLM 与 VLA 分工:

  • Orchestrator = Gemini Robotics-ER 1.5(VLM):完整保留 Gemini 的推理、工具调用、代码执行、多模态能力,额外针对具身推理(任务规划、空间推理、进度估计)优化。处理用户输入与环境反馈,把复杂任务拆成 VLA 可执行的短指令,做 success detection 决定何时切下一步,并可调用外部工具(如 Google Search、第三方用户自定义函数)。
  • Action model = Gemini Robotics 1.5(VLA):把中/短程自然语言指令翻译成低层机器人动作。作为一个「专用工具」暴露给 orchestrator,通过开放词表自然语言接收指令。

Gemini Robotics 1.5(VLA)关键设计

  • 动作输出为连续数值(model card 明确:“generates continuous numerical values that represent robot actions”),thinking 开启时额外输出文本思路。动作头具体形式(扩散/flow/回归)、参数量、chunk 长度等未披露(Gemini 系列为闭源模型)。
  • Embodied Thinking / 多层级思考:输入侧含 proprioception + 多路相机图像 + 文本指令;输出侧交错「思考轨迹」与动作。思考分多个层级:Next step(预测完成指令要走的下一步)+ Motion description(预测低层运动轨迹),再可细化到「把夹爪往左移」「合爪」这类原语。思考把「高层多步语言 → 低层动作」的难映射拆成两段(先生成语言短程步骤,再学更简单的动作映射)。
  • Motion Transfer(MT)机制:一套新架构 + 训练配方,让模型从异构、多本体机器人数据中形成对「运动与物理交互效果」的统一理解,从而跨差异极大的本体迁移技能。
  • 多本体原生控制:同一 checkpoint 直接控制 ALOHA 2、Bi-arm Franka(Franka Research 3)、Apptronik Apollo 人形,无需 robot-specific 后训练,也无需显式 action space 对齐。

Gemini Robotics-ER 1.5(VLM)关键设计:thinking 模型,支持推理时算力扩展(thinking token budget 可调、可关),输出 2D 指点、轨迹预测、状态估计、分割掩码、物体检测、任务进度预测等一系列对机器人有用的信号。开发者侧模型名 gemini-robotics-er-1.5-preview,官方称其达到 “Gemini Flash 级低延迟”。

数据

  • 机器人数据:多本体真机数据,采自 ALOHA、Bi-arm Franka、Apollo 人形三个平台,覆盖「thousands of diverse tasks」的广泛操作技能与多样场景。具体小时数 / episode 数 / 轨迹数未披露
  • 网络数据:叠加公开的文本、图像、视频数据集。
  • 数据配比 / curation:未给出精确比例。model card 披露多阶段安全与质量过滤:① Sensitive Data Filtering(自动过滤个人信息等敏感数据);② Synthetic captions——每张图同时配原始 caption 与合成 caption,合成 caption 由 Gemini + FlexCap(Dwibedi et al., 2024)生成,帮助模型学到图像细节。
  • sim vs real:评测阶段 >90% 的开发期评测 episode 在 MuJoCo 仿真中完成,通过对齐视觉与物理参数使 sim 与真机评测排序一致(rank consistency),真机只做最终质量确认。
  • 动作标注 / co-training:VLA 与网络多模态数据共训;blog 明确两个模型「built on the core Gemini family, fine-tuned with different datasets to specialize in their respective roles」。团队在展望里指出,GR 1.5 的架构改动已使其能从无动作标注的人类视频 / 合成视频中学习(未来方向)。

训练方法

  • 多本体预训练 + Motion Transfer 配方:核心训练目标是让单一 checkpoint 从异构本体数据学统一运动表征。消融(Fig. 4)显示:加入其他本体数据本身有增益,而 MT 配方进一步放大跨本体正迁移;MT 收益依赖各平台初始数据量——ALOHA(数据多)单纯加数据收益小、MT 放大对齐收益;Bi-arm Franka(中等)加跨本体数据 + MT 都有效;人形(数据稀缺)加外部数据收益最大,但 MT 对齐作用因本体差异过大而减弱。
  • 无 robot-specific 后训练即可多本体控制;但在长程 agentic 评测中,为提升 Bi-arm Franka 的长程成功率,对其做了额外后训练(ALOHA 仍用预训练 checkpoint)。
  • Thinking VLA 训练:让 VLA 显式对指令与感知做推理,生成自然语言思考轨迹并追加进上下文再出动作;带来可解释性、隐式子任务成功感知(无需显式 success detector)、以及自纠恢复行为(如水瓶滑落后思路自动变为「用左手捡起水瓶」)。
  • GR-ER 1.5:在 Gemini thinking + 工具使用基础上强化物理世界理解;支持推理时算力扩展,可自适应调节 thinking token 数(指点任务用得最少、视频 QA 最多)。thinking 默认开启,可通过 thinking_config 设 budget 或关闭。
  • 安全后训练:GR-ER 1.5 可针对 “Thinking about Safety” 微调,在受安全约束的指点任务上取得 SOTA;对齐 Gemini Safety Policies;并引入 Auto-Red-Teaming(ART)(Attacker / Target / Autorater 三方博弈)自动发现幻觉、指令混淆、内容安全等漏洞,并用其生成数据缓解漏洞。
  • 关键超参(学习率、batch、训练步数、思考轨迹标注方式等)未披露

Infra(训练 / 推理工程)

  • 硬件:TPU v4、v5p、v6e(model card)。GPU/TPU 数量、训练 chip-hours、并行策略、精度均未披露
  • 软件栈:JAX(Bradbury et al., 2018)+ ML Pathways(Dean, 2021)。
  • 评测工程:MuJoCo 仿真承担 >90% 评测 episode;真机采用 A/B/n interleaved 测试(同一 work cell 交错测所有对比模型以降方差)。
  • 推理 / 边缘:GR-ER 1.5 官方定位「Gemini Flash 级低延迟」,并提供可调 thinking budget 做「延迟 vs 准确率」权衡;success detection 实时评测按 5Hz 采样并模拟推理延迟。VLA 控制频率、端上算力、具体延迟数值未披露。GR-ER 1.5 以 preview 形式经 Gemini API + Google AI Studio 开放(gemini-robotics-er-1.5-preview);GR 1.5 仅对 select partners 开放。

评测 benchmark

具身推理(15 个学术 benchmark,Table 19,ER Score = 50% 空间 + 50% QA)

模型ER ScoreSpatial avgQA avgOverall avg
GR-ER 1.5 (Thinking)59.652.666.562.8
GR-ER 1.5 (No thinking)53.747.160.256.7
GR-ER(上一代)52.649.156.154.2
Gemini 2.5 Pro (Thinking)51.735.468.059.3
Gemini 2.5 Flash (Thinking)51.239.762.756.5
GPT-5 (Thinking)51.130.871.460.6
GPT-5-mini (Thinking)47.727.168.257.3

GR-ER 1.5 在 ER Score 上 SOTA,且在空间类子项(Point-Bench 71.6 / RefSpatial 48.5 / RoboSpatial-Pointing 31.1 / Where2Place 59.0)大幅领先 GPT-5、Gemini 2.5(GPT-5 空间均值仅 30.8)。

通用能力(Table 20,保持 frontier 通用性):GR-ER 1.5 (Thinking) MMMU 80.7 / GPQA 83.3 / Aider Polyglot 57.3(均值 73.8),与同级模型可比——即扩展了「通用性 × 具身推理」的 Pareto 前沿。

复杂指点(Fig. 10,5 个 benchmark:Point-Bench / RefSpatial / RoboSpatial / Where2Place / PixMo Count):GR-ER 1.5 在 Average / Spatial / Steerable Pointing / Point-to-Count 上均为 SOTA,显著超过 GR-ER、Gemini 2.5、GPT-5。

思考帮助推理(Fig. 16):GR-ER 1.5 性能随 thinking token budget 单调上升,且比 Gemini 2.5 Flash 的推理时扩展曲线更陡(Flash 扩展几乎平坦)。

VLA 泛化(Fig. 3,progress score):GR 1.5 在 ALOHA / Bi-arm Franka / Apollo 三本体、In-distribution 基线 + 四类泛化(Instruction / Action / Visual / Task)上一致超过 Gemini Robotics 与 GRoD,指令、动作、任务泛化增益尤为显著。

跨本体零样本迁移(Fig. 5):单本体训练的模型在「仅另一机器人见过的任务」上表现很差,而多本体 + MT 显著更好,且报告成功率证明是真正完成任务而非仅部分进度。

Thinking VLA 多步任务(Fig. 6,multi-step progress score):开启 thinking 后 ALOHA / Bi-arm Franka / Humanoid 三本体均提升,柱值区间约 0.26–0.67,thinking-on 始终更高(如 ALOHA 顶格 0.67),Bi-arm Franka 增益最大。

长程 agentic(8 任务,Fig. 17 + Table 1):三方对比 —— 单独 Thinking VLA(progress 上限 ~44%)< Gemini 2.5 Flash orchestrator + GR 1.5 < GR-ER 1.5 orchestrator + GR 1.5(常近 80%)。失败率拆解:

失败类型Gemini 2.5 Flash 编排GR-ER 1.5 编排
Planning25.5%9%
Success detection6%4%
Action13%9%
总失败率44.5%22%

即用 GR-ER 1.5 做编排,总失败率减半,规划失败降幅最大——印证「强具身推理 + 通用低层控制」是物理 agent 的关键路径。

安全(ASIMOV-2.0,Fig. 19):GR-ER 1.5 在风险识别、动作安全后果理解、干预预测上优于 GR-ER;经 Thinking-about-Safety 微调后在安全约束指点任务上 SOTA。

创新点与影响

三大贡献(团队自述):

  1. Thinking VLA:让 VLA 通过多层级内心独白「先想后动」,显著提升复杂多步任务能力,并带来可解释性、隐式子任务成功感知与自纠恢复。
  2. 跨本体学习(Motion Transfer):单模型从异构多平台数据学习并零样本迁移技能,直面机器人数据稀缺瓶颈,为吸纳全社区数据(乃至无标注人类/合成视频)铺路。
  3. SOTA 具身推理(GR-ER 1.5):在空间/时间推理、任务规划、进度估计、success detection 上确立新 SOTA,且保持 frontier VLM 通用性,是首个面向具身推理优化的 thinking 模型,并首次向开发者开放(Gemini API preview)。

影响:把「orchestrator(会思考、调工具的 ER VLM)+ action model(跨本体 VLA)」确立为物理 agent 的参考架构,验证了「提升 VLA 执行 ≠ 解长程;关键在高层具身推理」。

作者自陈局限:① GR 1.5 的灵巧度仍与上一代持平,需靠新架构 / RL 提升;② 更可扩展的数据源(真实人类视频、合成视频、低质量公开视频语料)尚待利用;③ 论文对底层架构、参数量、训练/推理具体数字披露有限(闭源)。

原始链接

一手源存档(sources/)

  • gemini-robotics-1-5—blog — DeepMind 研究博客快照(sources/embodied/2025/gemini-robotics-1-5--blog.md
  • gemini-robotics-1-5—developer-blog — Google Developers 开发者博客快照(sources/embodied/2025/gemini-robotics-1-5--developer-blog.md
  • 技术报告全文见上方 arXiv / DeepMind PDF 链接(arXiv 原文 PDF,不入 git)