一句话定位
把一个互联网规模预训练的大 VLM(PaLI-X 5B/55B 或 PaLM-E-12B)直接拿来,把 6-DoF 机器人动作离散化成 256 个整数 bin、再当成普通文本 token 塞进模型词表,与原始网页 VQA/caption 数据 co-fine-tune(联合微调),得到一个不加任何动作专用参数、权重完全共享的视觉-语言-动作模型(VLA)——RT-2。它把 web 预训练的语义泛化与推理迁移进闭环底层控制,未见物体/背景/环境的泛化成功率从 rt-1 的 32% 提到 62%,并涌现出”把可乐罐放到 Taylor Swift 旁""捡出能当锤子的石头”等机器人数据里从没出现过的能力。这是”VLA”这一术语与范式的奠基与命名之作。
背景与定位
RT-2 出自 Google DeepMind(作者按字母序排列,通讯 Yevgen Chebotar / Tianhe Yu / Karol Hausman),2023-07-28 首发 arXiv(2307.15818),配 2023-07-28 的 DeepMind 博客与 robotics-transformer2.github.io 项目页。它是 Google 机器人 Transformer 线的第二代,紧接 rt-1(2022,35M 参数的机器人专用 transformer)与 palm-e(2023,把连续传感器投影进 LLM 做高层规划)。
要解决的核心矛盾:最强的语言/视觉-语言模型在 web 上吃了数十亿 token 与图像,但它们只会推理语义、标签、文本 prompt,不会输出机器人要的低层 grounded 动作(如笛卡尔末端指令);而机器人数据不可能在近期堆到 web 那个量级。此前把 LLM/VLM 塞进机器人的做法(saycan、palm-e、ChatGPT-for-Robotics)大多只做高层规划——像状态机把指令解析成”拿起/放下”等原语,再交给本身完全不吃 web 语义的低层控制器执行。
RT-2 的破题是”简单到令人意外”:直接训一个开放词表 VQA/视觉对话的 VLM 去输出低层机器人动作,把动作 tokenize 成文本 token、拼成”多模态句子”(延续 palm-e 的思路),让 VLM 直接充当指令跟随策略。与从零设计新 VLA 架构(Gato)或给策略硬塞结构(CLIPort、MOO)不同,RT-2 不引入任何新参数、复用已摊销的巨额预训练算力,输出空间统一使得语言任务与动作任务的权重完全共享。论文把这一类模型命名为 vision-language-action (VLA) model。它是后续 open-x-embodiment(RT-2-X)以及整条 VLA 路线(foundation-models-in-robotics 综述归入此脉)的直接源头。
模型架构
核心思想:动作即语言。 把动作表示成模型输出里的 token,与语言 token 同等对待;推理时 de-tokenize 回连续动作,实现闭环控制。
动作空间与离散化(沿用 rt-1):
- 6-DoF 末端位姿增量(Δpos_x/y/z、Δrot_x/y/z)+ 夹爪张合度 + 一个离散的 episode 终止指令(策略自己触发表示任务成功完成)。
- 除终止指令外的连续维度均匀离散化成 256 个 bin;于是一个动作 = 8 个整数,拼成字符串(各维用空格连接),如
"terminate Δposx Δposy Δposz Δrotx Δroty Δrotz gripper_extension",一个实例"1 128 91 241 5 101 127"。 - 动作 token 与词表的绑定方式因 VLM 而异:
- PaLI-X:0–1000 的整数各自有唯一 token,直接把 256 个 bin 映射到对应整数 token。
- PaLM-E:数字没有这种便利表示,于是覆盖词表里最不常用的 256 个 token 当动作词——这正是 symbol tuning(Wei 2023)的一种,在 VLM 上被证明有效。
两个 VLM backbone(Appendix D):
- RT-2-PaLI-X(5B 与 55B):图像用 ViT-22B(Dehghani 2023)处理,可接受 n 张图 → n×k token(k = 每图 patch 数);图像 token 过投影层后,喂进一个 32B 参数、50 层的 encoder-decoder backbone(类 UL2),自回归生成输出 token。最大模型 = 55B。
- RT-2-PaLM-E-12B:基于 decoder-only LLM,把图像/文本等投影进语言 token 空间;视觉模型用 ViT-4B(PaLI 的 ViT)把图像投到语言嵌入空间。因 PaLM-E 结构限制,RT-2-PaLM-E 只能取特定 PaLM/ViT 尺寸。
- RT-2-PaLI-3B(仅用于 Language-Table 仿真):更小的 ViT-G/14(2B) + UL2-3B encoder-decoder。
输入格式:机器人相机图 + 文本任务描述,用标准 VQA 格式 "Q: what action should the robot take to [task instruction]? A:",输出即上面那串数字/最不常用 token。
输出约束(Output Constraint):区别于普通 VLM——当 prompt 是机器人动作任务时,解码只从合法动作 token 里采样,保证输出可在真机执行;而处理标准视觉-语言任务时仍允许输出全部自然语言 token。
数据
Web 视觉-语言数据(来自 PaLI-X / PaLM-E 的混合):
- 主体是 WebLI:约 10B 图文对、覆盖 109 种语言,按跨模态相似度过滤到前 10% → 得到 1B 训练样本;另含大量 captioning 与 VQA 数据集。
- co-fine-tune RT-2-PaLI-X 时不使用 PaLI-X 原文里的 Episodic WebLI 数据。
机器人数据(来自 rt-1,Brohan 2022):
- 用移动机械臂采集的演示 episode,13 台机器人、跨 17 个月、在办公室厨房环境采集。
- 每条演示配一句自然语言指令,来自若干技能:Pick Object / Move Object Near Object / Place Object Upright / Knock Object Over / Open Drawer / Close Drawer / Place Object into Receptacle / Pick from Receptacle。指令 = 动词(技能)+ 一个或多个名词(物体,如 “7up can” “drawer” “napkin”)。
混合配比(Co-Fine-Tuning 的关键旋钮):
- RT-2-PaLI-X:机器人数据约占训练混合的 50%。
- RT-2-PaLM-E:机器人数据约占 66%。
- 通过提高机器人数据集的采样权重来平衡每个 batch 里 robot/web 的比例。
Language-Table 数据(Lynch 2022):RT-2 在其上 co-fine-tune 了 5 个预测任务——(1) 给两帧连续图+文本指令预测动作;(2) 给图帧预测指令;(3) 给图帧预测机械臂位置;(4) 给两帧预测中间时步数;(5) 给图帧+指令预测任务是否成功。此处动作编码为 "X Y",X/Y ∈ {-10,…,+10},表示末端 2D 笛卡尔 setpoint 增量。
训练方法
Co-Fine-Tuning(本文主方法,也是最关键的技术细节):不是只在机器人数据上朴素微调,而是把原始 web 数据一直留在微调过程里与机器人数据一起训。作用是让策略同时暴露于 web 抽象视觉概念与低层动作,从而更泛化、并不遗忘预训练学到的概念。消融证明 co-fine-tuning > 纯 fine-tuning > from-scratch。
目标函数:next-token prediction(下一 token 预测),在机器人侧即等价于 behavior cloning(行为克隆)损失。所有 RT-2 训练沿用原 PaLI-X / PaLM-E 论文的超参(含学习率调度与正则)。
各模型的具体超参(Appendix E):
| 模型 | learning rate | batch size | gradient steps |
|---|---|---|---|
| RT-2-PaLI-X-55B | 1e-3 | 2048 | 80K |
| RT-2-PaLI-X-5B | 1e-3 | 2048 | 270K |
| RT-2-PaLM-E-12B | 4e-4 | 512 | 1M |
| RT-2-PaLI-3B(Language-Table) | 1e-3 | 128 | 300K |
Chain-of-Thought 变体:在 RT-2-PaLM-E 上只再训几百步梯度,数据增广加一个 “Plan” 步——先用自然语言描述将要执行动作的目的,再接真正的动作 token,例如 "Instruction: I'm hungry. Plan: pick rxbar chocolate. Action: 1 128 124 136 121 158 111 255."。这充当 VQA(视觉推理)与操作数据(生成动作)之间的桥梁,让模型能先规划再行动、应对更复杂命令。
Infra(训练 / 推理工程)
- 训练硬件/GPU-hours:论文未披露 GPU/TPU 数量与训练 GPU-hours(仅说沿用 PaLI-X/PaLM-E 的训练配方)。
- 模型规模:最大 55B 参数,作者称这是已知用于直接闭环机器人控制的最大模型,比此前大一个数量级以上。
- 推理部署:这么大的模型无法直接跑在桌面机或车载 GPU 上;作者的方案是把 RT-2 部署在多 TPU 云服务上、机器人通过网络查询该服务,既达到可用控制频率、又能用同一云服务同时服务多台机器人。
- 控制频率(真机 / 仿真):
- RT-2-PaLI-X-55B:1–3 Hz。
- RT-2-PaLI-X-5B:约 5 Hz。
- RT-2-PaLI-3B(Language-Table 仿真):5 Hz(与其他基线同速)。
- 精度/并行策略:未披露。
评测 benchmark
全部约 6,000 次真机评测轨迹;除特别说明外用 7-DoF 移动机械臂。涌现能力评测用 A/B testing 框架(四个模型在完全相同条件下依次评),降低方差。
① 总体泛化(Table 4,成功率 %)——seen 任务用 RT-1 的 200+ 指令集;unseen 分物体/背景/环境,各再分 easy/hard:
| 模型 | Seen | Unseen 平均 |
|---|---|---|
| R3M | 45 | 12 |
| VC-1 | 63 | 10 |
| rt-1 | 92 | 32 |
| MOO | 75 | 35 |
| RT-2-PaLI-X-55B | 91 | 62 |
| RT-2-PaLM-E-12B | 93 | 62 |
- seen 任务上 RT-2 与 RT-1 相当(91/93 vs 92),其它基线更低。
- unseen 上两个 RT-2 平均约为次优基线(RT-1/MOO)的 2 倍、其它基线(R3M/VC-1)的约 6 倍。PaLM-E 版在更难的泛化场景更强、easy 场景略弱,平均打平 PaLI-X 版。
② 涌现能力(Table 5,成功率 %,三类 = 符号理解 / 推理 / 人物识别):
| 模型 | 符号理解 | 推理 | 人物识别 | 总平均 |
|---|---|---|---|---|
| VC-1 | 11 | 10 | 13 | 11 |
| rt-1 | 16 | 16 | 20 | 17 |
| RT-2-PaLI-X-55B | 82 | 46 | 53 | 60 |
| RT-2-PaLM-E-12B | 36 | 43 | 43 | 40 |
- 最佳 RT-2-PaLI-X 的平均成功率是次优基线 RT-1 的 3 倍以上(60 vs 17)。PaLI-X 版在符号理解/推理/人物识别整体更强,但 PaLM-E 版在”数学推理”子项更好(作者归因于 PaLM-E 预训练混合里数学计算能力更强)。
③ 开源 Language-Table 仿真(Table 1,成功率 %):
| 模型 | 成功率 |
|---|---|
| BC-Zero | 72 ± 3 |
| rt-1 | 74 ± 13 |
| LAVA | 77 ± 4 |
| RT-2-PaLI-3B | 90 ± 10 |
④ 尺寸 × 训练策略消融(Table 6,unseen 平均 %,RT-2-PaLI-X):
| 配置 | 平均 |
|---|---|
| 5B, from scratch | 9 |
| 5B, fine-tuning | 42 |
| 5B, co-fine-tuning | 44 |
| 55B, fine-tuning | 52 |
| 55B, co-fine-tuning | 63 |
结论:从零训超大模型即便 5B 也很差(故直接跳过 55B from-scratch);co-fine-tuning > fine-tuning(保留原数据避免遗忘);模型越大泛化越好。
基线(都用完全相同的机器人数据):rt-1(35M)、VC-1(ViT-L 视觉表征 + Universal Sentence Encoder 语言 + token learner + RT-1 decoder)、R3M(Ego4D 上学的 ResNet50 表征)、MOO(VLM 生成语义 map 额外通道再喂 RT-1)。
创新点与影响
- 命名并奠基 VLA 范式:把”动作当文本 token、与 web 数据同池 co-fine-tune”这一极简配方立成 vision-language-action model;输出空间统一使得语言与动作权重完全共享、不加任何动作专用层,与 CLIPort/MOO(给策略塞结构、受限 2D 动作空间、需标定相机)形成对照——RT-2 不依赖受限 2D 动作空间、不需标定相机。
- web 知识向底层控制的迁移:语义/视觉概念(关系、名词、多语言、符号、人物、数学)能迁移进闭环控制,涌现出机器人数据里没有的能力;并首次展示 CoT 让单个 VLA 同时做高层规划 + 低层控制。
- co-fine-tuning 的价值被量化:保留 web 数据显著优于纯机器人微调,且规模律在机器人控制上成立。
- 作者自述局限:
- 不会获得新的物理动作——技能仍限于机器人数据分布,只是学会用新方式部署已有技能;作者认为需靠更多样的数据采集范式(如人类视频)。
- 算力成本高,高频控制下实时推理会成瓶颈;期待量化/蒸馏让其跑更快或上更廉价硬件。
- 可用的 VLM 太少——能拿来造 RT-2 的通用 VLM 屈指可数,期待更多开源模型(如 LLaVA)与开放微调 API。
- 具体失败模式:按特定部位(如把手)抓取、机器人数据外的新动作(擦拭、用工具)、精细/灵巧动作(叠毛巾)、多层间接的长链推理,均表现差;Language-Table 里对未见物体动力学(笔滚下桌、香蕉质心偏移)泛化不佳。
原始链接
- arXiv 论文:https://arxiv.org/abs/2307.15818 (PDF https://arxiv.org/pdf/2307.15818)
- DeepMind 博客:https://deepmind.google/discover/blog/rt-2-new-model-translates-vision-and-language-into-action/
- 项目页(demo/视频/论文 PDF):https://robotics-transformer2.github.io/
- 前作 rt-1:https://robotics-transformer1.github.io/
一手源存档(sources/)
- rt-2—blog.md — DeepMind 官方博客正文快照
- rt-2—project-page.md — 项目页 abstract/approach/results 文本快照(已剔除逐帧动作 token 噪声)
- arXiv 全文 PDF(2307.15818)见上方链接,原文 PDF 不入 git。