一句话定位
Google DeepMind 把 Gemini 的「思考 + agentic」范式搬进物理世界的双模型系统:Gemini Robotics-ER 1.5(一个会「思考」、能原生调工具的具身推理 VLM,做高层大脑/orchestrator)+ Gemini Robotics 1.5(一个「先想后动」的多本体 VLA,靠 Motion Transfer 在 ALOHA / Bi-arm Franka / Apollo 三种机器人间零样本迁移技能)。
背景与定位
延续同团队 2025 年 3 月的 gemini-robotics(Gemini-Robotics-Team et al., 2025)与 Gemini Robotics On-Device(GRoD),本代把上一代 VLA 升级成两条主线:具身推理做到 frontier VLM 水平、VLA 学会显式思考并跨本体共享技能,再把两者组成 agentic 系统解长程任务。
范式上有三个明确定位:
- Thinking VLA / Embodied Thinking:给 VLA 加一条多层级自然语言「内心独白」(思路 → 短程步骤 → 原语动作),思想在动作之前生成并追加进上下文。同期相关工作包括 ThinkAct、MolmoAct、OneTwoVLA、RT-H 的 action hierarchy。
- Motion Transfer(MT)跨本体:不做 per-robot 后训练,用统一 checkpoint 控制多本体,并实现「只在 A 机器人见过的任务在 B 机器人上零样本可用」。对标 Open X-Embodiment / RT-X 的多本体共训,但强调零样本技能迁移这一少见现象;同赛道有 GR00T N1、pi-0-5(π0.5)。
- Agentic 双模型:orchestrator(GR-ER 1.5)+ action model(GR 1.5 作为工具被调用),对标 SayCan / Inner Monologue / Hi Robot 的分层 VLA。
两个模型都基于「最新一代 Gemini」(Comanici et al., 2025,即 Gemini 2.5)微调而来,共享其多模态世界知识、工具调用与代码执行能力。
模型架构
整体是一套 agentic 系统,由 VLM 与 VLA 分工:
- Orchestrator = Gemini Robotics-ER 1.5(VLM):完整保留 Gemini 的推理、工具调用、代码执行、多模态能力,额外针对具身推理(任务规划、空间推理、进度估计)优化。处理用户输入与环境反馈,把复杂任务拆成 VLA 可执行的短指令,做 success detection 决定何时切下一步,并可调用外部工具(如 Google Search、第三方用户自定义函数)。
- Action model = Gemini Robotics 1.5(VLA):把中/短程自然语言指令翻译成低层机器人动作。作为一个「专用工具」暴露给 orchestrator,通过开放词表自然语言接收指令。
Gemini Robotics 1.5(VLA)关键设计:
- 动作输出为连续数值(model card 明确:“generates continuous numerical values that represent robot actions”),thinking 开启时额外输出文本思路。动作头具体形式(扩散/flow/回归)、参数量、chunk 长度等未披露(Gemini 系列为闭源模型)。
- Embodied Thinking / 多层级思考:输入侧含 proprioception + 多路相机图像 + 文本指令;输出侧交错「思考轨迹」与动作。思考分多个层级:
Next step(预测完成指令要走的下一步)+Motion description(预测低层运动轨迹),再可细化到「把夹爪往左移」「合爪」这类原语。思考把「高层多步语言 → 低层动作」的难映射拆成两段(先生成语言短程步骤,再学更简单的动作映射)。 - Motion Transfer(MT)机制:一套新架构 + 训练配方,让模型从异构、多本体机器人数据中形成对「运动与物理交互效果」的统一理解,从而跨差异极大的本体迁移技能。
- 多本体原生控制:同一 checkpoint 直接控制 ALOHA 2、Bi-arm Franka(Franka Research 3)、Apptronik Apollo 人形,无需 robot-specific 后训练,也无需显式 action space 对齐。
Gemini Robotics-ER 1.5(VLM)关键设计:thinking 模型,支持推理时算力扩展(thinking token budget 可调、可关),输出 2D 指点、轨迹预测、状态估计、分割掩码、物体检测、任务进度预测等一系列对机器人有用的信号。开发者侧模型名 gemini-robotics-er-1.5-preview,官方称其达到 “Gemini Flash 级低延迟”。
数据
- 机器人数据:多本体真机数据,采自 ALOHA、Bi-arm Franka、Apollo 人形三个平台,覆盖「thousands of diverse tasks」的广泛操作技能与多样场景。具体小时数 / episode 数 / 轨迹数未披露。
- 网络数据:叠加公开的文本、图像、视频数据集。
- 数据配比 / curation:未给出精确比例。model card 披露多阶段安全与质量过滤:① Sensitive Data Filtering(自动过滤个人信息等敏感数据);② Synthetic captions——每张图同时配原始 caption 与合成 caption,合成 caption 由 Gemini + FlexCap(Dwibedi et al., 2024)生成,帮助模型学到图像细节。
- sim vs real:评测阶段 >90% 的开发期评测 episode 在 MuJoCo 仿真中完成,通过对齐视觉与物理参数使 sim 与真机评测排序一致(rank consistency),真机只做最终质量确认。
- 动作标注 / co-training:VLA 与网络多模态数据共训;blog 明确两个模型「built on the core Gemini family, fine-tuned with different datasets to specialize in their respective roles」。团队在展望里指出,GR 1.5 的架构改动已使其能从无动作标注的人类视频 / 合成视频中学习(未来方向)。
训练方法
- 多本体预训练 + Motion Transfer 配方:核心训练目标是让单一 checkpoint 从异构本体数据学统一运动表征。消融(Fig. 4)显示:加入其他本体数据本身有增益,而 MT 配方进一步放大跨本体正迁移;MT 收益依赖各平台初始数据量——ALOHA(数据多)单纯加数据收益小、MT 放大对齐收益;Bi-arm Franka(中等)加跨本体数据 + MT 都有效;人形(数据稀缺)加外部数据收益最大,但 MT 对齐作用因本体差异过大而减弱。
- 无 robot-specific 后训练即可多本体控制;但在长程 agentic 评测中,为提升 Bi-arm Franka 的长程成功率,对其做了额外后训练(ALOHA 仍用预训练 checkpoint)。
- Thinking VLA 训练:让 VLA 显式对指令与感知做推理,生成自然语言思考轨迹并追加进上下文再出动作;带来可解释性、隐式子任务成功感知(无需显式 success detector)、以及自纠恢复行为(如水瓶滑落后思路自动变为「用左手捡起水瓶」)。
- GR-ER 1.5:在 Gemini thinking + 工具使用基础上强化物理世界理解;支持推理时算力扩展,可自适应调节 thinking token 数(指点任务用得最少、视频 QA 最多)。thinking 默认开启,可通过
thinking_config设 budget 或关闭。 - 安全后训练:GR-ER 1.5 可针对 “Thinking about Safety” 微调,在受安全约束的指点任务上取得 SOTA;对齐 Gemini Safety Policies;并引入 Auto-Red-Teaming(ART)(Attacker / Target / Autorater 三方博弈)自动发现幻觉、指令混淆、内容安全等漏洞,并用其生成数据缓解漏洞。
- 关键超参(学习率、batch、训练步数、思考轨迹标注方式等)未披露。
Infra(训练 / 推理工程)
- 硬件:TPU v4、v5p、v6e(model card)。GPU/TPU 数量、训练 chip-hours、并行策略、精度均未披露。
- 软件栈:JAX(Bradbury et al., 2018)+ ML Pathways(Dean, 2021)。
- 评测工程:MuJoCo 仿真承担 >90% 评测 episode;真机采用 A/B/n interleaved 测试(同一 work cell 交错测所有对比模型以降方差)。
- 推理 / 边缘:GR-ER 1.5 官方定位「Gemini Flash 级低延迟」,并提供可调 thinking budget 做「延迟 vs 准确率」权衡;success detection 实时评测按 5Hz 采样并模拟推理延迟。VLA 控制频率、端上算力、具体延迟数值未披露。GR-ER 1.5 以 preview 形式经 Gemini API + Google AI Studio 开放(
gemini-robotics-er-1.5-preview);GR 1.5 仅对 select partners 开放。
评测 benchmark
具身推理(15 个学术 benchmark,Table 19,ER Score = 50% 空间 + 50% QA):
| 模型 | ER Score | Spatial avg | QA avg | Overall avg |
|---|---|---|---|---|
| GR-ER 1.5 (Thinking) | 59.6 | 52.6 | 66.5 | 62.8 |
| GR-ER 1.5 (No thinking) | 53.7 | 47.1 | 60.2 | 56.7 |
| GR-ER(上一代) | 52.6 | 49.1 | 56.1 | 54.2 |
| Gemini 2.5 Pro (Thinking) | 51.7 | 35.4 | 68.0 | 59.3 |
| Gemini 2.5 Flash (Thinking) | 51.2 | 39.7 | 62.7 | 56.5 |
| GPT-5 (Thinking) | 51.1 | 30.8 | 71.4 | 60.6 |
| GPT-5-mini (Thinking) | 47.7 | 27.1 | 68.2 | 57.3 |
GR-ER 1.5 在 ER Score 上 SOTA,且在空间类子项(Point-Bench 71.6 / RefSpatial 48.5 / RoboSpatial-Pointing 31.1 / Where2Place 59.0)大幅领先 GPT-5、Gemini 2.5(GPT-5 空间均值仅 30.8)。
通用能力(Table 20,保持 frontier 通用性):GR-ER 1.5 (Thinking) MMMU 80.7 / GPQA 83.3 / Aider Polyglot 57.3(均值 73.8),与同级模型可比——即扩展了「通用性 × 具身推理」的 Pareto 前沿。
复杂指点(Fig. 10,5 个 benchmark:Point-Bench / RefSpatial / RoboSpatial / Where2Place / PixMo Count):GR-ER 1.5 在 Average / Spatial / Steerable Pointing / Point-to-Count 上均为 SOTA,显著超过 GR-ER、Gemini 2.5、GPT-5。
思考帮助推理(Fig. 16):GR-ER 1.5 性能随 thinking token budget 单调上升,且比 Gemini 2.5 Flash 的推理时扩展曲线更陡(Flash 扩展几乎平坦)。
VLA 泛化(Fig. 3,progress score):GR 1.5 在 ALOHA / Bi-arm Franka / Apollo 三本体、In-distribution 基线 + 四类泛化(Instruction / Action / Visual / Task)上一致超过 Gemini Robotics 与 GRoD,指令、动作、任务泛化增益尤为显著。
跨本体零样本迁移(Fig. 5):单本体训练的模型在「仅另一机器人见过的任务」上表现很差,而多本体 + MT 显著更好,且报告成功率证明是真正完成任务而非仅部分进度。
Thinking VLA 多步任务(Fig. 6,multi-step progress score):开启 thinking 后 ALOHA / Bi-arm Franka / Humanoid 三本体均提升,柱值区间约 0.26–0.67,thinking-on 始终更高(如 ALOHA 顶格 0.67),Bi-arm Franka 增益最大。
长程 agentic(8 任务,Fig. 17 + Table 1):三方对比 —— 单独 Thinking VLA(progress 上限 ~44%)< Gemini 2.5 Flash orchestrator + GR 1.5 < GR-ER 1.5 orchestrator + GR 1.5(常近 80%)。失败率拆解:
| 失败类型 | Gemini 2.5 Flash 编排 | GR-ER 1.5 编排 |
|---|---|---|
| Planning | 25.5% | 9% |
| Success detection | 6% | 4% |
| Action | 13% | 9% |
| 总失败率 | 44.5% | 22% |
即用 GR-ER 1.5 做编排,总失败率减半,规划失败降幅最大——印证「强具身推理 + 通用低层控制」是物理 agent 的关键路径。
安全(ASIMOV-2.0,Fig. 19):GR-ER 1.5 在风险识别、动作安全后果理解、干预预测上优于 GR-ER;经 Thinking-about-Safety 微调后在安全约束指点任务上 SOTA。
创新点与影响
三大贡献(团队自述):
- Thinking VLA:让 VLA 通过多层级内心独白「先想后动」,显著提升复杂多步任务能力,并带来可解释性、隐式子任务成功感知与自纠恢复。
- 跨本体学习(Motion Transfer):单模型从异构多平台数据学习并零样本迁移技能,直面机器人数据稀缺瓶颈,为吸纳全社区数据(乃至无标注人类/合成视频)铺路。
- SOTA 具身推理(GR-ER 1.5):在空间/时间推理、任务规划、进度估计、success detection 上确立新 SOTA,且保持 frontier VLM 通用性,是首个面向具身推理优化的 thinking 模型,并首次向开发者开放(Gemini API preview)。
影响:把「orchestrator(会思考、调工具的 ER VLM)+ action model(跨本体 VLA)」确立为物理 agent 的参考架构,验证了「提升 VLA 执行 ≠ 解长程;关键在高层具身推理」。
作者自陈局限:① GR 1.5 的灵巧度仍与上一代持平,需靠新架构 / RL 提升;② 更可扩展的数据源(真实人类视频、合成视频、低质量公开视频语料)尚待利用;③ 论文对底层架构、参数量、训练/推理具体数字披露有限(闭源)。
原始链接
- arXiv 摘要页:https://arxiv.org/abs/2510.03342 (v3, 2025-11-28;tech report)
- DeepMind 官方 tech report PDF:https://storage.googleapis.com/deepmind-media/gemini-robotics/Gemini-Robotics-1-5-Tech-Report.pdf
- 研究博客(DeepMind):https://deepmind.google/blog/gemini-robotics-15-brings-ai-agents-into-the-physical-world/
- 开发者博客(Google Developers):https://developers.googleblog.com/en/building-the-next-generation-of-physical-agents-with-gemini-robotics-er-1-5/
- 产品页 / 模型页:https://deepmind.google/models/gemini-robotics/
- 开发者文档:https://ai.google.dev/gemini-api/docs/robotics-overview
- 相关:ASIMOV-2.0 安全 benchmark(Jindal et al., 2025, arXiv:2509.21651);上一代 gemini-robotics(arXiv:2503.20020)
一手源存档(sources/)
- gemini-robotics-1-5—blog — DeepMind 研究博客快照(
sources/embodied/2025/gemini-robotics-1-5--blog.md) - gemini-robotics-1-5—developer-blog — Google Developers 开发者博客快照(
sources/embodied/2025/gemini-robotics-1-5--developer-blog.md) - 技术报告全文见上方 arXiv / DeepMind PDF 链接(arXiv 原文 PDF,不入 git)