一句话定位

rt-2 的”任务语言 → 动作”单层映射中间插入一层语言运动(language motion)——“move arm forward""close gripper”这类从机器人本体感受自动抠出的细粒度动作描述——用同一个 PaLI-X 55B VLM 先预测语言运动、再据此预测动作,构成一个显式的动作层级(action hierarchy);语言运动层级不仅让语义迥异的任务(“捡可乐罐” vs “倒杯子”)在动作层面共享结构,带来 Diverse+Kitchen 上比 RT-2 高 15% 的平均成功率,还让人类可以用语言直接纠正执行中的机器人(而非遥操作),基于语言运动纠正数据微调后把成功率从 40% 拉到 63%,比同数据量下遥操作纠正(IWR)高出 50%。

背景与定位

RT-H 出自 Google DeepMind(一作 Suneel Belkhale,通讯 Yevgen Chebotar / Debidatta Dwibedi / Dorsa Sadigh),2024-03-04 挂 arXiv(2403.01823),配 rt-hierarchy.github.io 项目页(无代码/模型开源,论文中也未提及 GitHub 或 Hugging Face 发布)。

它直接站在 rt-2 的问题设定上:RT-2 把”高层任务语言 → 底层动作”训成一步到位的映射,靠 VLM 的 web 预训练知识做语义泛化,但当多任务数据集里的任务语言本身语义差异很大时(“pick coke can” vs “pour cup”),任务层面几乎无法共享结构,模型只能死记硬背每个任务各自的动作分布,需要成倍的演示数据。RT-H 的洞察是:语言不仅能描述”做什么”(任务),还能描述”怎么做”(动作序列的细粒度阶段)——把这层”怎么做”显式建成一个中间预测目标,就能在动作层面重新找回不同任务间的共享结构(“倒杯子”和”捡可乐罐”在抓取物体之前的动作序列几乎完全重合)。

与既往层级模仿学习工作相比:此前的”skill/primitive”层级化方法(学习参数化技能库或聚类得到的动作 embedding)大多计算复杂、对超参敏感;用 LLM 把长程指令拆解成任务序列的方法(如 saycan 一脉)停留在任务层级之上再调度独立训练的策略,扩展性受限;Hu & Clune 那类”先预测语言任务再预测动作”的方法与 RT-H 相似但停在更高一级,不学习细粒度语言运动;Sharma et al. 用 LLM 把任务拆成运动基元,但基元是硬编码、缺乏场景情境性。RT-H 的语言运动是从数据里自动抽取、且预测时以任务和场景为条件的,因此保留了情境性(同一句”move arm left”在不同任务下对应不同的实际动作)。这一层级设计也让 RT-H 天然获得一种此前遥操作纠正(如 bc-z 提到的 IWR 范式)不具备的能力:用语言直接对执行中的机器人做纠正,且可以只用纠正数据微调”语言运动”这一浅层查询、无需重训整个动作空间。

模型架构

Backbone:与 rt-2 相同的 PaLI-X 55B 多模态 Encoder-Decoder Transformer——22B ViT 编码图像为 token(在 PaLI-X 预训练阶段学得,机器人数据 co-training 时冻结),图像 token 与文本 prompt 一起进 Encoder,Decoder 自回归解出目标 token 串。单个模型同时承担语言运动预测与动作预测两级任务,以复用 web 规模预训练的先验知识。

两级查询(action hierarchy 的核心实现)

  • 语言运动查询(π_h)Q: What skill should the robot do to [task]? A:——Encoder 输入任务语言 g 与图像 o,Decoder 自回归输出语言运动 z(如 “move arm forward”)。
  • 动作查询(π_l)Q: What action should the robot do to [task], with current skill: [motion]? A:——Encoder 输入 g、o 与刚预测出的语言运动 z,Decoder 输出动作 token 串。语言运动作为 Encoder 输入(而非 Decoder 输入)传给动作查询,是 RT-H 相对 RT-H-Joint 变体的关键设计差异。

动作 tokenization:延续 RT-2/RT-1 的方案——末端执行器 Δ位置、Δ轴角旋转、夹爪开合、终止标志,每个动作维度离散化成 256 个 bin,编码为整数 token。

推理时序问题与两种解法:两级查询顺序执行会使推理时延翻倍,55B 规模下延迟不可忽略。RT-H 提出:(1) 异步查询(asynchronous querying,实验采用)——语言运动查询训练为预测下一步(未来一步)的语言运动,推理时用上一时刻已推理出的语言运动去查动作、同时预测下一步的语言运动,从而可以把两次查询打包并行,达到与 RT-2 几乎相同的查询时延;(2) 固定频率——每 H 步才查一次语言运动查询,摊薄时延,但因语言运动切换的时刻往往不规则,论文最终未采用。

变体(消融,均为离线实现)

  • RT-H-Joint:单一查询 Q: What skill and action should the robot do to [task]? A:,输出 skill: [skill], action: [action] 拼接串(语言运动经 Decoder 而非 Encoder 传入动作预测)。
  • RT-H-Cluster:将自动抽取的语言运动替换为对归一化动作做 K-means(256 个簇心) 得到的整数簇标签,测试”语言运动”相对”任意中间动作 embedding”的价值。
  • RT-H-OneHot:将每条唯一语言运动替换成一个整数 one-hot 标签(按出现频率编号),去掉语言的组合结构(如”move arm forward”与”move arm forward and left”应有的相似性)。

数据

训练数据集:Diverse+Kitchen(D+K),共 100K 演示:

  • Kitchen(沿用 rt-1/rt-2 的数据):6 个语义任务类别、70K 演示、542 条唯一指令,涵盖 knock over / drawer place / move / pick / open-close drawer / place upright。
  • Diverse(本文新采集):24 个新语义任务类别、仅 30K 演示、165 条唯一指令,任务包括从料理架拔餐巾纸、开合开心果罐、移动碗到麦片机出料口下方/移开、把燕麦包放入碗中、抓取/放回量勺舀勺、把香蕉油倒入碗中等,任务间数据量分布严重不均衡。

语言运动的自动抽取(无需人工标注):把机器人末端 9 个动作维度(3 维 Δ位置、3 维 Δ姿态、2 维底座移动、1 维夹爪)各自映射到一个空间方向词(如位置 z 轴 → 上/下),过滤掉幅度低于阈值的维度,再按幅度从大到小把剩余维度组合成一句话(如”move arm forward and close gripper”)。该流程对所有任务/数据集固定不变,一次性抽取出超过 2500 条不同的语言运动,论文指出人工离线标注反而会因标注者判断相机视角失误、技能切换时刻标注不一致而降低质量。

纠正(correction)数据(用于 §V-C 的 RT-H-Intervene):对 D+K 上评测的 8 个最难任务,各采集 30 条(过滤失败 episode 后)语言运动纠正演示,用 RT-H(在 D+K 上训练)作为基础策略在线滚动采集;对照组 RT-2-IWR 用同样方式为每个任务采集 30 条**遥操作(VR teleoperation)**纠正演示,基础策略换成 RT-2。纠正数据集大小与原演示数据集之比约为 1:300

泛化评测数据:仅用 Kitchen 数据训练的 RT-H,评测于新建筑(新光照/背景/地面)与训练时未见过的物体(梨、椰子水、奥利奥等),共 50 次评测/任务。

训练方法

目标函数:next-token prediction(自回归),机器人侧等价于行为克隆(imitation learning)损失,两级查询各自独立地对 z 和 a 做交叉熵。

训练流程:先在与 RT-2 相同的大规模 web 视觉-语言数据集上预训练(PaLI-X 预训练权重起步),然后用语言运动 + 动作两个查询以相同采样率替换 RT-2 中的动作查询做 co-training——50% 采样原 PaLI-X 预训练混合,50% 采样机器人数据(语言运动查询 25% / 动作查询 25%)。ViT 编码器在此阶段冻结。超参:学习率 1e-3、线性 warmup + 平方根归一化衰减、batch size 1024

纠正数据的训练(RT-H-Intervene):不重训动作查询(因为动作查询已经知道如何把语言运动映射到成功动作),只更新语言运动查询去学习被纠正后的更准确语言运动;同时与原始数据集共同训练以防止过拟合纠正样本、维持动作查询性能。采样权重:预训练查询 50%、演示数据语言运动查询 23%、演示数据动作查询 23%、纠正数据语言运动查询 4%(即单条纠正样本相对单条演示样本被上采样约 50 倍)。消融变体 RT-H-InterveneAction 额外把纠正数据的动作查询也纳入训练(等采样率)。RT-2-IWR 用同一套流程但把语言运动训练查询换成 IWR 风格的动作查询训练。

关键超参(对比表,见架构节):无额外 RL 阶段,纯模仿学习;蒸馏不涉及。

Infra(训练 / 推理工程)

  • GPU/TPU 数量与训练 GPU-hours:论文未披露;仅说明沿用 PaLI-X/RT-2 的训练配方与超参。
  • 推理延迟应对:因两级查询顺序执行会使 55B 模型的查询时延翻倍,RT-H 用异步查询(语言运动查询提前一步预测未来运动)把两次查询打包,使总时延与单级查询的 RT-2 基本持平(论文未给出具体 Hz/ms 数字,仅描述该机制的作用效果)。
  • 控制频率、精度、并行策略:论文未披露具体数值。

评测 benchmark

① Diverse+Kitchen 在线评测(Fig. 3,8 个高难度任务 × 10 次试验 = 80 次/方法)

  • RT-H 平均比 RT-2 高 15%,8 个任务中 6 个更优;RT-2 仅在 4/8 任务上非零成功,RT-H 在 6/8、RT-H-Joint 在全部 8/8 任务上非零成功。
  • RT-H-Cluster 平均略逊于 RT-H,但在最难的开/合开心果罐任务上反超(作者归因于聚类比自动语言运动标注提供更细粒度的动作情境,但缺少语言结构使其在更广泛任务集上预测更难)。
  • RT-H-OneHot 显著逊于 RT-H,说明去掉语言的组合结构会大幅损害性能,即便底层语言运动标签完全相同。

② 离线动作预测 MSE(Table I,验证集)

训练集评测集RT-2RT-H-JointRT-HRT-H (用真值语言运动)
KitchenKitchen30.228.2224.917.9
D+KDiverse27.725.4423.617.8

RT-H 比 RT-2 低约 20% MSE,RT-H-Joint 比 RT-2 低 5–10%;用真值语言运动(而非模型自己预测的)作为动作查询输入时,MSE 再降约 40%,说明正确的语言运动标签对动作预测本身高度informative。

③ 语言运动纠正 vs 遥操作纠正(Fig. 6,同一 8 任务,各 30 episode 纠正数据)

  • RT-H + Human Intervention(纯在线人工纠正、不训练)在最难任务上也能拿到很高成功率,说明语言运动预测本身常是性能瓶颈。
  • RT-2-IWR:平均成功率从 25% 退化到 13%(数据量偏小、单轮纠正、遥操作纠正引入的动作分布与训练分布差异过大)。
  • RT-H-Intervene:平均成功率从 40% 提升到 63%(在开/合开心果罐等高难任务上提升 60–70%),显著优于 RT-2-IWR;在”把燕麦包放进碗”任务上退化,作者归因于纠正数据里对”close gripper”纠正的轻微偏置。
  • RT-H-InterveneAction(额外训练动作查询)比 RT-H 高 9%,但因策略退化(动作分布偏向基础策略自身生成、有时次优)表现不及 RT-H-Intervene。

④ 泛化(Q4,均训练于 Kitchen 数据集)

  • 新场景(Fig. 7,新建筑/光照/地面):RT-H 与 RT-H-Joint 均比 RT-2 更稳健,尤以 place upright 与 open/close drawer 任务差距最大。
  • 新物体(Table II,pick / move 任务,共 50 次评测):
方法pickmove平均
RT-2605055
RT-H706065
  • 新任务(少量纠正):零样本在全新任务(拆叠杯、把苹果放入罐子)上不可行,但在训练于 D+K 的 RT-H 上,picking 阶段可零样本泛化(共享的语言运动结构),后续阶段配合”仅几次精准纠正”即可完成任务。

基线:RT-2(同架构无层级)、RT-2-IWR(bc-z 提到的 Intervention Weighted Regression 范式,用于遥操作纠正对照)。

创新点与影响

  • 首次把”语言运动”作为无需人工标注、可自动从本体感受抽取的中间动作层级插入 VLA 的任务-动作映射之间,量化证明其比”无层级""聚类中间层""one-hot 中间层”都更有效,尤其在语义高度多样的多任务数据集上。
  • 把语言纠正的作用面从”高层任务重述”下沉到”细粒度动作层”,使得人类纠正与遥操作纠正相比对基础策略动作分布的扰动更小、因而更易学、样本效率更高(30 episode 纠正即可把成功率提升 23 个百分点,超过遥操作方案 50%)。
  • 单模型、双查询、复用整套 RT-2 co-training 流程——无需新增参数或独立训练的层级模块,异步查询设计把两级推理的额外时延几乎抵消。
  • 作者自述局限:(1) 在大规模多样数据集上仍未达到高绝对成功率,纠正后仍有提升空间;(2) 本文只验证了单一层级(语言运动),更多层级(如”长程指令 → 任务 → 语言运动 → 动作”)与不同抽象粒度(如物体指代型语言而非运动型语言)留待未来;(3) 语言运动作为压缩动作空间用于 RL 探索、以及跨具身(如 open-x-embodiment)或从人类视频学习动作语言,均为未来方向。

原始链接

一手源存档(sources/)

  • rt-h—project-page.md — 项目页 abstract/method/experiments 文本快照
  • arXiv 全文(2403.01823)见上方链接,原文 PDF 不入 git。