一句话定位

Google DeepMind 把一整层”具身推理”能力接进机器人:以前沿多模态大模型 Gemini 2.0 为底座训出两个模型——Gemini Robotics-ER(Embodied Reasoning,增强空间/时序理解的 VLM,可零样本/少样本控制机器人)与 Gemini Robotics(端到端 VLA,直接输出机器人动作),首次证明”从冻结前沿 VLM 继承的开放词表泛化 + 语言可操控性 + 跨本体迁移”可以带进真实灵巧操作,并给出”云端 backbone + 机载 action decoder”的低延迟实时控制架构(50Hz)。

背景与定位

这是”前沿通用 VLM → 机器人基础模型”路线的代表作,属于 VLA(Vision-Language-Action)范式,直接对标同期开源 VLA:pi0(PaliGemma + diffusion action expert)、openvlaoctordt-1b、以及 DeepMind 自家早期的 rt-2/rt-1

论文的核心论点:机器人要有用,先要有人类级具身推理(embodied reasoning,ER)——理解 3D 结构、物体间关系、直觉物理——再把这套推理”接地”到动作。它的做法不是从零训一个动作模型,而是先验证 Gemini 2.0 本身已具备强 ER,再分两步:(1) 训 Gemini Robotics-ER,把 ER 能力放大到 SOTA,且不损失基础模型能力,可直接零样本(写机器人代码)/少样本(in-context learning)驱动机器人;(2) 在 ER 基础上加机器人动作数据微调出 Gemini Robotics VLA,做端到端高频灵巧控制。

saycan 等”多模型编排”路线不同,Gemini 2.0 把感知、状态估计、空间推理、规划、控制代码生成统一在单个模型里。数据主平台是双臂 ALOHA 2,动作分块(action chunking)继承自 aloha-act。diffusion 基线来自 diffusion-policy(ALOHA Unleashed 变体)。ERQA 基准的图片取材自 OXEUMI 等。整体属于 DeepMind Gemini Robotics 系列的第一代(后续有 On-Device 版、GR 1.5)。相关综述见 vla-survey-embodied-ai

模型架构

两个模型。

① Gemini Robotics-ER(VLM) — Gemini 2.0 Flash 的增强 ER 版本,输入文本(问题/坐标)+ 图像,输出文本(含数值坐标)。开放词表的具身感知能力集合:

  • 2D 目标检测:边界框记为 [y0,x0,y1,x1],坐标归一化为 0–1000 整数;支持显式(物名)、隐式(类别/属性/功能/affordance)查询。
  • 2D 指点(pointing):点记为 [y,x],输出 JSON list(键 in_frame/point/label),可指物体、部件、空闲空间、affordance。
  • 2D 轨迹预测:串联多个点生成运动轨迹(不做避障级运动规划)。
  • Top-down 抓取预测(ER 新增能力):y, x, θ,旋转角 θ ∈ [−90°, 90°] 整数。
  • 多视角对应(multi-view correspondence):跨相机视角对齐 2D 点。
  • 3D 检测:从单目图像预测度量级 3D 框 [x,y,z,w,h,l,r1,r2,r3](r 为欧拉角,截断到 2 位小数的文本 token),开放词表。

② Gemini Robotics(VLA) — Gemini 的微调衍生模型,输入”当前场景多图 + 任务文本指令”,输出被机器人执行的 action chunk。为解决大 VLM 推理慢、机载跑不动、延迟不满足实时控制的问题,拆成两块:

  • Gemini Robotics backbone(云端):Gemini Robotics-ER 的蒸馏版本,query→response 延迟从”数秒”优化到 <160ms
  • Gemini Robotics decoder(机载,跑在机器人本机计算单元):本地 action decoder,用来补偿 backbone 的延迟。

两者合起来:从原始观测到底层 action chunk 的端到端延迟 ≈250ms;配合 action chunk 内多个动作(承 aloha-act 的 action chunking),有效控制频率 50Hz。该架构在承受 backbone 延迟的同时既产生平滑反应式动作,又保留 backbone 的泛化能力。骨干用到 Gemini 2.0 的 SOTA 视觉编码器。

reasoning-enhanced 变体(Sec 4.2):在重新标注(re-labeled)的动作数据上微调,把动作预测拉近到 ER 的轨迹理解/生成能力;机载 action decoder 被扩展为”把推理中间量转成连续底层动作”。模型内部会输出可解释的 embodied CoT——如左臂(红)/右臂(蓝)未来 1 秒的关键点轨迹。

数据

主动作数据集:在一支 ALOHA 2 机器人集群上采集的大规模遥操作(teleoperated)真实机器人动作数据,历时 12 个月,累计数千小时真实专家演示;覆盖数千个多样任务(不同操作技能、物体、难度、episode 时长、灵巧度要求)。论文未披露精确 episode/帧数量级(仅”thousands of hours / thousands of tasks”)。

非动作数据(co-training):网页文档、代码、多模态内容(图像/音频/视频)、以及具身推理与 VQA 数据——用来提升模型理解/推理/跨任务泛化。

数据预处理(Model Card):多阶段安全与质量过滤;敏感数据过滤(自动剔除个人信息等);合成 caption——每张图配”原始 caption + 合成 caption”,合成 caption 由 Gemini 与 FlexCap 生成。

专门化/适配的数据量(具体数字):

  • 长时程灵巧任务专门化:每任务 curate 2000–5000 条高质量演示。
  • 快速适配新任务:至多 100 条演示(依复杂度约 15 分钟–1 小时演示量)。
  • 跨本体适配:ALOHA 2 数据训出后,用少量目标平台数据微调到 bi-arm Franka、Apollo 人形。

sim vs real:主结果基于真实机器人 A/B 测试与统计分析;另有 ALOHA 2 仿真任务套件用于 ER 的零/少样本评测。

训练方法

  • 底座:Gemini 2.0(Flash / Pro Experimental 02-05)。先验证其原生 ER,再训 Gemini Robotics-ER 放大 ER;Gemini Robotics = 在 ER 蒸馏 backbone 上加机器人动作数据微调而成的 VLA。
  • 目标:直接预测机器人动作(action chunk);backbone 保留 Gemini 的多模态/语言能力,因此能跟随开放词表指令并把 ER 先验带进动作。
  • 动作分块:action chunking(一次输出多步动作),配合机载 decoder 实现 50Hz 实时控制。
  • 专门化(Sec 4.1):从 Sec 3 的 Gemini Robotics checkpoint 出发,用每任务 2000–5000 条高质量数据微调成 specialist。消融关键结论:若直接从零训 Gemini Robotics specialist(不从 Sec 3 checkpoint 出发),6 个长时程任务全部 0% 成功——说明多样机器人动作数据学到的”物理常识/表征”是能专门化到高难长时程任务的必要前提。
  • reasoning-enhanced 训练(Sec 4.2):在 re-labeled 动作数据上微调,把动作预测接到 ER 的轨迹理解/生成,机载 decoder 扩展为把推理中间量解码成连续动作;带来 OOD 泛化提升 + 可解释 CoT。
  • 快速适配(Sec 4.3):从 Sec 3 checkpoint 微调,≤100 条演示即可。
  • 安全后训练(Sec 5):对 Gemini 2.0 与 Gemini Robotics-ER 做内容安全 SFT(教模型何时不该做超出图像证据的泛化)——bias-inducing pointing 查询拒答率从基线 20% 提到 96%;ER 还在 ASIMOV 语义安全数据上后训,并用 constitutional AI(数据驱动的自然语言”机器人宪法”)缓解对抗提示下的退化。
  • 超参(仅基线披露):π0 re-implement batch 2048、训 300K step(专门化再微调 50K);multi-task diffusion batch 512、训 2M step(专门化 1M);single-task diffusion batch 512、2M step。Gemini Robotics 自身的训练超参未披露。

Infra(训练 / 推理工程)

  • 训练硬件:TPU v4、v5p、v6e(Model Card)。软件栈:JAX + ML Pathways。GPU 数量 / GPU-hours / 并行策略 / 精度均未披露。
  • 推理架构:Gemini Robotics 主要跑在云端 backbone + 机载 action decoder;backbone query→response 延迟 <160ms,端到端 raw-obs→action ≈250ms,有效控制频率 50Hz
  • 对照的基线部署:π0 re-implement 与 multi-task diffusion 两个基线跑在装 Nvidia RTX 4090 的本地工作站(本机推理),以此对比 Gemini Robotics 的云端 backbone 方案。
  • Gemini Robotics-ER(未蒸馏的大 VLM)推理慢、需专用硬件,这正是设计 backbone 蒸馏 + 机载 decoder 的动机。

评测 benchmark

全部数字取自本技术报告(一手)。

ERQA(新开源基准,github.com/embodiedreasoning/ERQA):400 道多选 VQA,7 类(空间/轨迹/动作/状态估计/指点/多视角/任务推理),28% 为多图题。无 CoT 时(2025-02 结果):Gemini 2.0 Flash 46.3、Gemini 2.0 Pro Exp 48.3、GPT-4o 47.0、GPT-4o-mini 37.3、Claude 3.5 Sonnet 35.5。加 CoT:2.0 Flash 50.3、2.0 Pro Exp 54.8(Flash+CoT 已超 Pro 无 CoT)。RealworldQA、BLINK 同为各自档位 SOTA。

2D 指点(准确率,点落在 GT mask 内):Gemini Robotics-ER 在 Paco-LVIS 71.3 / Pixmo-Point 49.5 / Where2Place 45.0,三项中两项超过专用指点模型 Molmo-72B(47.1 / 12.5 / 63.8)。

3D 检测 SUN-RGBD AP@15:Gemini Robotics-ER 48.3,刷新 SOTA(专家模型 ImVoxelNet 43.7*、Implicit3D 24.1、Total3DU 14.3;*ImVoxelNet 在更易的 10 类上测)。

ALOHA 2 仿真零/少样本控制(50 次试验均值,Table 5):零样本代码生成——Gemini 2.0 Flash 平均 27%,Gemini Robotics-ER 平均 53%(近 2×);10 条示例 ICL——2.0 Flash 51%、ER 65%。真实 ALOHA 2(Table 6):零样本 ER 平均 25%,ICL 平均 65%(banana handover 70、fold dress 56、wiping 67)。

Gemini Robotics VLA 开箱(20 个采样任务,Fig 16):约一半任务成功率 >80%;在最难任务(open pink folder、insert red block、wrap wire around headphone)上是唯一非零成功的方法;可变形物操作(fold cloth、绕线)显著超基线。

泛化基准(85 个任务:20% in-dist / 28% 视觉 / 28% 指令 / 24% 动作):Gemini Robotics 在三类变化上均一致超基线;即便基线灾难性失败(如换语言指令),它仍非零。官方口径:在综合泛化基准上平均成绩是其它 SOTA VLA 的 2 倍以上(“more than doubles”)。

长时程专门化(6 任务,Fig 23):specialist 平均 79%;lunch-box 全流程(>2 分钟)100%;spelling game 能拼对 6 个未见手绘草图中的 4 个;从零训的 Gemini Robotics specialist 0%

快速适配(Fig 26):8 个任务中 7 个用 ≤100 条演示达 >70%,其中 2 个 100%。

跨本体(Sec 4.4):bi-arm Franka in-distribution 平均 63%,视觉/动作泛化上大幅超 single-task diffusion;Apollo 人形(Apptronik)演示 lunch bag 打包等。

基线:π0 re-implement(DeepMind 对开源 pi0 的复现,在同一数据混合上训,优于官方 openpi checkpoint)、multi-task diffusion(diffusion-policy/ALOHA Unleashed 加 CLIP 文本编码器的任务条件版)、single-task diffusion。

创新点与影响

贡献

  1. 首个把**前沿通用多模态大模型(Gemini 2.0)**作为底座的 VLA 家族,证明”从冻结前沿 VLM 继承的开放词表语义泛化 + 语言可操控性”可迁到真实灵巧操作——泛化基准 2×+ 于同期开源 VLA。
  2. 明确拆出 Gemini Robotics-ER 这一”具身推理 VLM”层,把指点/3D 检测/抓取/多视角/轨迹统一进单模型,并给出零样本(写代码)/少样本(ICL)直接驱动机器人的两条路径(ER 端到端成功率 2×–3× 于 Gemini 2.0)。
  3. 云端 backbone(蒸馏,<160ms)+ 机载 action decoder 的低延迟架构,让大模型也能 50Hz 实时控制。
  4. ERQA 开源具身推理基准(400 题,超越”原子能力”评测)。
  5. reasoning-enhanced VLA:把 embodied CoT(关键点轨迹)接进动作预测,提升 OOD 泛化与可解释性。
  6. 跨本体:ALOHA 2 → bi-arm Franka / Apollo 人形,且泛化鲁棒性可随之迁移。
  7. 安全:内容安全 SFT(pointing 拒答 20%→96%)+ ASIMOV 数据集 + 数据驱动”机器人宪法”(constitutional AI)。

改变了什么:把”机器人基础模型”的起点从”专用小策略/多模型编排”推到”前沿 VLM 直接当底座”,语言可操控性、开放词表泛化、跨本体成为一等能力;也把 embodied reasoning 作为可单独评测/放大的能力剥离出来。

论文自述局限:Gemini 2.0 在长视频里 grounding 空间关系仍吃力;点/框等数值预测精度不足以支撑更精细的动作(真实 banana handover、dress folding 零样本成功率低正源于抓取不够精准);多步推理与精细灵巧执行的无缝融合仍待解;计划更多依赖仿真生成视觉多样、富接触数据并迁移到真实;扩大多本体实验,目标是零样本跨本体迁移。(合作/受托测试方:Apptronik,及 Agile Robots、Agility Robotics、Boston Dynamics、Enchanted Tools。)

原始链接

一手源存档(sources/)

  • gemini-robotics—blog — 官方博客快照(sources/embodied/2025/gemini-robotics—blog.md)
  • 技术报告全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)