一句话定位

Google 用 13 台 Everyday Robots 移动机械臂、历时 17 个月遥操作攒出 ~13 万条 / 700+ 任务的真机演示数据集,配一个 35M 参数、能在真机上以 3Hz 实时跑的 Transformer 策略,证明”大规模多样真机数据 + 高容量可实时架构”能带来跨任务/物体/环境的零样本泛化——这套数据资产与配方,正是后续 RT-2、RT-X / Open X-Embodiment 整条 VLA 线的地基。

背景与定位

RT-1(Robotics Transformer 1)出自 Robotics at Google 与 Everyday Robots(EDR)联合团队(作者按字母序署名,Brohan、Finn、Hausman、Levine、Vanhoucke 等 40+ 人),2022 年 12 月挂 arXiv。它要回答的问题很直接:CV/NLP 靠”大而多样的任务无关数据 + 能吸收全部数据的高容量模型”实现了泛化,机器人能不能照搬?作者的判断是能,但机器人有两道独特的坎——数据既贵又碎(要么靠工程量巨大的自主采集,要么靠昂贵的人类遥操作),模型还得快到能在真机上实时闭环

论文明确把自己和两类先行工作对照:一类是 gato-a-generalist-agent(DeepMind Gato,1.2B 通才模型),但 Gato 在真机上实际只学了单一的彩色积木堆叠、不评估对新任务的泛化;另一类是 BC-Z、behavior-transformer-bet 这类”单模型学一堆演示”的工作,真机任务面窄或泛化弱。RT-1 的两大主张是:(1) 好的泛化来自既有规模又有广度的数据集,且任务之间要”结构相连”到能让模型发现共性;(2) 架构要在高容量与实时推理之间取得平衡——为此把图像、指令、电机指令全部压成紧凑 token 交给 Transformer。

这条路线上,RT-1 与同期语言条件操作策略(peract 的体素动作、implicit-bc-ibc 的隐式 BC、calvin 的长程语言操作 benchmark)同属”把机器人控制当序列建模”的探索,但 RT-1 独特之处在于把数据规模真正拉到十万级真机演示、并把评测拉到 3000+ 次真机 rollout。本条目归在 data 类:RT-1 论文本身贡献的是模型 + 数据配方,但它最持久的遗产是那份 130k 真机遥操作数据集(已开源到 gs://gresearch/rt-1-data-release),后来成为 RT-2 微调底座、并整合进 Open X-Embodiment。

模型架构

RT-1 是一个 decoder-only Transformer 策略,总计 35M 参数,输入”6 帧历史图像 + 自然语言指令”,直接输出离散化的动作 token。按 Fig.3 自顶向下:

  • 图像 + 语言 tokenizer(FiLM-EfficientNet-B3,16M 参数,26 层 MBConv+FiLM):6 帧 300×300 图像过 ImageNet 预训练的 EfficientNet-B3,末层卷积输出 9×9×512 特征图,展平成 81 个 vision-language token(不像 Gato 那样先切 patch)。语言指令先用 Universal Sentence Encoder (USE) 编码,再喂给插入到 EfficientNet 内部的 identity-initialized FiLM 层做早期语言融合——FiLM 的仿射变换 dense 层(fc、hC)权重初始化为 0,让 FiLM 一开始等价于恒等映射,从而不破坏预训练激活。这种”早融合”让图像 token 早早只关注与指令相关的特征。
  • TokenLearner(token 压缩):element-wise 注意力模块,把每帧的 81 个 token 软选择压到 8 个,专为加速推理。
  • Transformer 主干(19M 参数,8 层 self-attention,decoder-only):每帧 8 token × 6 帧 = 48 个 token(加位置编码)送入,输出动作 token。
  • 动作 tokenization11 个动作维度、每维离散成 256 个 bin——7 维手臂(x, y, z, roll, pitch, yaw, 夹爪开合)+ 3 维底盘(x, y, yaw)+ 1 维模式切换(控臂 / 控底盘 / 终止 episode)。每维 target 均匀映射到 256 bin 之一。
  • 损失:标准 categorical cross-entropy + causal masking(与 Gato、Multi-Game Decision Transformer 同款)。
  • 控制:闭环 3Hz,直到输出 “terminate” 或到达预设步数上限。最终版不做动作自回归(消融显示自回归慢 2x 且无收益)。

设计目标是”人类执行这些指令约 2–4 秒 → 至少 3Hz 控制 → 给模型的推理预算 <100ms”,这直接卡死了模型尺寸上限。

数据

RT-1 论文最核心的资产就是这份真机遥操作数据集(category=data 的由来):

  • 规模:~130k(13 万)条人类演示 episode,覆盖 700+ 条语言指令 / 任务(Table 1 明细合计 744 个任务),用 13 台 Everyday Robots 移动机械臂、历时 17 个月采集。
  • 本体:EDR 移动机械臂 = 7-DOF 手臂 + 两指夹爪 + 移动底盘
  • 采集方式人类遥操作(demonstrator 与机器人直接目视,用 2 个 VR 遥控器:3D 平移/旋转位移映射到工具 6D 位移,摇杆 x/y 映射到底盘转角与行驶距离)。全部为成功演示(reward=1,做行为克隆)。
  • 场景:在若干”robot classroom”(办公室厨房片段)里采,有专门的软件模块负责采样待演示指令 + 随机化背景以保证数据平衡与场景多样;评测环境含训练 classroom + 两个真实办公室厨房 Kitchen1/Kitchen2(Kitchen1 是 classroom 建模对象,Kitchen2 泛化更难)。
  • 12 类技能的任务数配比(Table 1):Pick 130、Move Object Near Object 337、Place Upright 8、Knock Over 8、Open Drawer 3、Close Drawer 3、Place into Receptacle 84、Pick-from-Receptacle-and-Place 162、长程/额外指令 9 → 合计 744。“pick” 技能刻意扩了大量物体以测物体泛化。
  • 标注:每条 episode 事后标一句自然语言指令(一个动词 + 一/多个名词),按动词归为”技能”。

异构数据(Sec 6.3,用于扩展实验)

  • 仿真数据:用 real2sim(RetinaGAN + 多任务 RL)自举出仿真策略,抽取 518k 条”抓取新物体”的成功轨迹,与真机数据混训;这些仿真物体真机从未见过。
  • 跨本体数据(Kuka):QT-Opt 项目里 Kuka IIWA 固定臂自主 bin-picking 的全部成功样本 = 209k episode,标签统一为 “pick anything”(Kuka 数据无物体标签),先把 4-DOF 动作空间对齐到 RT-1(roll/pitch 置 0),再按 EDR:Kuka = 2:1 的比例在每个 batch 内混合,以控制原 EDR 技能不退化。

数据集已开源(gs://gresearch/rt-1-data-release)。

训练方法

  • 范式:纯模仿学习 / 行为克隆——在成功演示集上最小化动作的负对数似然,即对 256-bin 离散动作 token 做 categorical cross-entropy + causal masking。主模型不用 RL(RL 只出现在生成仿真数据的 real2sim 环节)。
  • 动作表示:逐维离散化(每维 256 bin)是关键设计——消融证明它远优于连续高斯(离散能表达多峰动作分布,高斯只能单峰)。
  • 不自回归:动作 token 不按 Gato/Decision-Transformer 那样自回归生成,因为消融显示自回归慢 2x 且无性能收益。
  • 大规模模型选择(real2sim):真机评测太贵,作者把训练好的真机策略直接丢进扩展后的仿真环境(支持 551 个任务),每步用 RetinaGAN 把仿真图转成逼真图像来跑 rollout。真机高分策略的仿真成功率也更高——仿真成功率的排序与真机排序方向一致,因此可作为选 checkpoint 的近似代理(不要求 sim-real 绝对值接近)。

Infra(训练 / 推理工程)

  • 训练算力:论文与博客均未披露 GPU 型号 / 卡数 / GPU-hours(未披露)。
  • 推理(真机实时性是第一约束):目标 3Hz 控制、单模型网络推理预算 <100ms;Table 13 实测 RT-1 网络推理 15 ms(对比 Gato 129 ms、BC-Z 5.3 ms、BC-Z XL 5.9 ms——RT-1 比同参数量 Gato 快近一个数量级,但比 ResNet 的 BC-Z 慢)。
  • 两项提速手段:(i) 用 TokenLearner 把 EfficientNet 的 81 token 压到 8,加速 2.4x;(ii) 重叠推理窗口间复用已算的 token(只算一次),加速 1.7x
  • 消抖动:引入固定等待机制——在采集到用于算动作的状态后、施加动作前等待固定 280ms(各组件观测到的最大延迟),保证输出频率稳定不 jitter。

评测 benchmark

全部结果来自论文,共 3000+ 次真机 rollout(号称当时最大规模的机器人学习评测之一)。

主表(Table 2,四类能力,成功率 %)

模型SeenUnseenDistractorsBackgrounds
Gato (37M,从 1.2B 缩)65524335
BC-Z72194741
BC-Z XL56432335
RT-197768359

RT-1 在 200+ 条 seen 指令上 97% 成功(比 BC-Z 高 25%、比 Gato 高 32%);unseen 指令 76%(比次优高 24%);干扰物/背景鲁棒性分别 83% / 59%(比次优高 36% / 18%)。所有 baseline 都用 RT-1 的同一套数据训练,比较的是架构而非数据。

真实厨房多重分布漂移(Table 3,%):RT-1 All 70(L1 88 / L2 75 / L3 50),Gato 30、BC-Z 45、BC-Z XL 55。

吸收仿真数据(Table 4,%):Real+Sim = 92→90(仅真物体 -2) / 23→87(仅仿真见过的物体 +64) / 7→33(未见技能×仿真物体 +26),即加仿真数据不伤真机原任务、还大幅提升仅在仿真见过物体的真机表现。

吸收跨本体数据(Table 5,%):EDR+Kuka 混训 → Classroom 90(-2)、Bin-picking 39(+17,比只用 EDR 的 22 近乎翻倍);只用 Kuka 数据评 EDR bin-picking = 0%(证明跨本体行为难直接迁移,但混训能让 RT-1 在 Kuka 观测状态下推出 EDR 正确动作)。

长程 SayCan(Table 6,%):SayCan-RT1 在 Kitchen1 执行成功率 67%、Kitchen2 仍 67%(planning 均 87);对比 Gato 33/0、BC-Z 53/13。15 条长程指令平均 9.6 步、含 2.4 个操作技能;视频里演示了最长 50 步的超长程任务。

数据规模 vs 多样性消融(Table 7):把每任务样本上限砍到 200/100/50(对应 51%/37%/22.5% 数据)→ seen 从 97 掉到 71/55/59;而”砍掉数据最少的任务、保留 97% 数据但只剩 75% 任务”→ seen 掉到 86。结论:去掉 25% 任务(仅丢 3% 数据)造成的泛化损失,相当于砍掉 49% 数据量——数据多样性比数据量更关键。

模型消融(Table 13,Δ vs 满血 RT-1):改连续动作 seen -29 / unseen -33(最伤);去 ImageNet 预训练 unseen -33;去历史 seen -15、distractor 明显退化;去 Transformer seen -13;缩小模型(31M→25M)seen -8;自回归动作性能几乎不变但推理慢 2x(36ms)。

创新点与影响

  • 贡献:(1) 一份十万级、700+ 任务、17 个月 13 机采集的真机遥操作数据集,把机器人模仿学习的数据规模拉高一个量级并开源;(2) RT-1 架构——FiLM 早融合 + TokenLearner 压缩,让 35M Transformer 能在真机 3Hz 实时跑,同时保持高容量;(3) 系统性证明了机器人上的”数据吸收”性质:能无损吸收仿真数据、甚至异构本体(Kuka)数据并借此提升泛化。
  • 改变了什么:RT-1 把”大规模多样真机数据 + 可实时高容量策略 = 泛化”这条 recipe 坐实,直接催生 RT-2(把 VLM 接上机器人动作)、以及 RT-X / Open X-Embodiment(把 RT-1 数据与 22 个机构数据合并成跨本体大数据集)。它是当代 VLA(vision-language-action)范式的直接前身。几个被反复引用的判断——离散动作 token >> 连续高斯早期语言融合(FiLM)优于晚融合数据多样性 > 数据量——都成了后续 VLA 工作的默认设计。
  • 作者自陈的局限:(1) 纯模仿学习,性能上限受演示者约束、无法超越 demonstrator;(2) 对新指令的泛化仅限于已见概念的新组合,学不会一个全新的、从未见过的运动;(3) 任务面虽广但不算灵巧(dexterity 有限)。作者还提到希望让非专家也能通过定向采数据 + prompting 更快扩展技能、并用可扩展注意力/记忆改善反应速度与上下文保持。

原始链接

一手源存档(sources/)

  • rt-1—blog — Google Research 博客正文(含 EDR:Kuka = 2:1 混合比例、2.4x 提速等)
  • rt-1—project-page — 项目主页(摘要、方法、结果表、引用、数据/代码开源链接)
  • rt-1—github-readme — GitHub README(三个 checkpoint 说明)
  • arXiv 原文 PDF(2212.06817,不入 git):见上方 arXiv 链接