一句话定位

把机器人动作的每一维离散化成独立的时间步、逐维自回归地预测 Q 值,从而让 rt-1 同款的高容量 Transformer 策略可以直接用离线 TD 学习(而非模仿学习)在混合质量的真机数据(人类演示 + 自主收集的失败轨迹)上训练,在 72 个真机任务上比模仿学习(RT-1)和先前离线 RL/Transformer 方法(Decision Transformer、IQL)平均成功率高出约 70%。

背景与定位

Q-Transformer 由 Google DeepMind 团队(Chebotar、Vuong 等 25 人,通讯作者 Chebotar 和 Vuong)在 2023 年 9 月发布,后录用于 CoRL 2023(7th Annual Conference on Robot Learning)。它要解决的问题接在 rt-1 之后:RT-1 证明大容量 Transformer 能吃下十万级真机演示做模仿学习,但模仿学习的天花板是人类演示者的水平,且不能利用自主收集的失败数据来自我改进。论文的诉求是把 TD 式的 Q-learning 搬到 Transformer 上,让策略既能从演示学习、又能从失败经验中做动态规划式的价值传播,从而超越演示者本身。

把 Transformer 接入 Q-learning 有两个结构性障碍:(1) Transformer 要处理离散 token,而机器人动作是连续/高维的,需要离散化;(2) 离散化整个动作空间会导致 bin 数随维度指数爆炸,使得 Bellman 更新里的 max 操作无法穷举。论文的解法是把动作的每一维当作一个独立的自回归”时间步”:给定 8 维动作空间,推理时逐维预测、每维只需在该维的 bin 集合里取 max,从而把维度灾难变成序列长度问题。这一自回归离散化思路承袭自 Metz et al. 提出的 MDP 层级分解 + LSTM 方案,但作者去掉了层级结构、直接把每维当序列步,并将其扩展到离线 RL + 真机大规模场景。

与同期把 Transformer 用于机器人控制的工作相比,此前多数(如 rt-1、Gato)是监督学习/模仿学习框架;Decision Transformer 虽然引入了 reward conditioning,但本质仍是条件模仿,不具备用 TD 学习”重组数据、超越演示”的能力。Q-Transformer 与 saycan 也有直接关联——论文在附录中把训练出的 Q 函数直接替换 SayCan 框架里 QT-Opt 训练的 affordance 模型,验证其可作为长程任务规划的价值函数用,且不需要 QT-Opt 依赖的 sim-to-real 迁移训练。

模型架构

骨干沿用 RT-1 的多任务语言条件操作架构(RT-1 原文参数量 35M,参见 rt-1;本文未重新报告参数量):自然语言指令先经 Universal Sentence Encoder 编码为向量,与机器人相机图像一起送入 FiLM EfficientNet,转换成输入 token 序列,再由 Transformer 处理并输出每个动作维度、每个离散 bin 的 Q 值 logits。

核心改动是把标准 RT-1 的”每维输出离散动作 logits + softmax 分类”换成”每维输出 Q 值”:

  • 动作空间:8 维——3D 位置(相对当前位姿)、3D 姿态(轴角表示,相对当前位姿)、夹爪开合量(绝对值)、一个终止位(episode 是否结束,策略须主动触发终止才能拿到成功奖励)。除终止位外,其余 7 维连续动作各自在其完整取值范围内均匀离散化为 N=256 个 bin;终止位是二值,但为了权重维度一致而 padding 到与其他维相同的 bin 数。
  • 输出与自回归:Transformer 输出经 sigmoid 归一化到 [0,1] 作为每个 bin 的 Q 值(而非 RT-1 的 softmax logits);取全部 bin 的 argmax 构造 one-hot 动作向量,再喂回网络去预测下一个动作维度的 Q 值,如此逐维自回归 8 次得到完整动作。
  • Bellman 更新的时间步展开:把动作的第 i 维到第 i+1 维之间的转移也当作一步 Bellman 更新——对前 dA−1 维,目标是”同一时间步下一维度”的 max Q 值(折扣因子设 1.0,不重复打折);只有第 8 维(最后一维)的目标才是”下一实际时间步第 1 维”的 max Q 值 + 环境奖励,并在此处应用折扣因子 γ=0.98
  • 目标网络:用 Q 网络权重的指数滑动平均(EMA)计算目标 Q 值,平均常数 0.01
  • 保守正则化(D.2):未在数据集中观测到的动作 bin,其 Q 值被正则化拉向”该任务下可达到的最小累计奖励”(本文稀疏奖励设定下等于 0),而非像标准 CQL 那样用 softmax + 交叉熵去压低分布外动作——这一区别是本文的关键设计,详见”训练方法”。保守项权重 α=1.0,未做额外调参。计算保守项需要在 N−1=255 个未采样 bin 上取期望(等价于对所有未观测 action 值取平均)。
  • Monte Carlo 融合:把轨迹内实际累计回报(MC 回报)与当前 Bellman 目标取 max,因为 MC 回报是最优 Q 函数的下界,取 max 不改变收敛点但能加速训练前期的梯度传播。
  • n-step 回报:选取 n 使得”下一时间步最后一维的 Q 值”直接作为目标(即跳过同一时间步内部逐维 max 的中间步骤),减少中间奖励恒为 0 带来的传播延迟。

数据

真实机器人实验数据来自 13 台机器人组成的车队,是 RT-1 论文所用演示数据集的子集,叠加额外自主收集的低质量数据:

  • 人类遥操作演示:覆盖 700+ 个独立任务(每个任务对应一句独立的语言描述),每任务最多取 100 条演示,共约 38,000 条成功演示,奖励均为 1.0。
  • 自主收集数据:用行为克隆策略跑机器人自主收集。为了与模仿学习基线公平比较,训练 Q-Transformer 时丢弃了自主数据里全部成功的 episode,只保留约 20,000 条失败 episode(奖励 0.0)。
  • 最终训练集规模约 58,000 episode,平均每条 35 个时间步
  • 大规模扩展实验(5.4 节):使用车队采集的全部数据,含 RT-1 使用过的演示 + 全部自主成功 episode,共约 115,000 条成功轨迹,再加约 185,000 条失败自主 episode,总计约 300,000 条轨迹;该实验模型结构和超参数与主实验完全一致(计算成本过高,只训练一次,未做额外调参)。
  • 仿真基准(5.2 节):一个视觉引导的仿真抓取任务,约 8% 数据为位置控制的人类演示,其余约 92% 为对演示加噪声重放生成的轨迹。
  • 奖励结构:全任务均为稀疏二值奖励(episode 末尾成功记 1.0、失败记 0.0),不依赖奖励塑形。

训练方法

训练目标是式 (2) 的联合损失:(i) 标准 TD 误差项,对数据集中实际出现的 (s,a) 做 Bellman 回归;(ii) 保守正则化项 ℒ_C,把数据集之外(即 π_β 密度很低)的动作 Q 值拉向 0。作者强调:选择”往最小可达累计奖励回归”而非标准 CQL 的 softmax-交叉熵形式,是因为在稀疏二值奖励下,标准 CQL 的正则化会让 Q 值变成负数(即便瞬时奖励非负),且 softmax 形式”压低分布外动作”的同时会连带”抬高已观测动作”,导致难以区分数据集内的次优动作。

三个关键组件的消融(5.3 节,仿真任务,附录 F 用 5 个随机种子验证统计显著性):

  • 把保守项换成 softmax(标准 CQL 风格)后,性能塌陷到接近演示数据占比(约 8%),作者认为这是策略坍缩回行为策略分布的表现。
  • 完全去掉保守项,性能整体塌陷——数据集中稀少的动作会被高估 Q 值,该高估值会不断传播并拖垮整个 Q 函数。
  • 去掉 Monte Carlo 回报融合,性能同样塌陷,说明 MC 回报对大容量 Transformer 的早期梯度传播至关重要。

n-step 回报的效果在真机数据上验证(附录 D.3 环境,Figure 6 右上表格):使用 n-step 回报达到与 1-step 回报相当的性能,只需约 137,480 次梯度更新、训练 32 小时;而 1-step 版本训练满 582,960 次梯度更新(163 小时)才达到可比性能(pick object 94% vs 97%,move object near target 88% vs 80%,n-step 在长时程任务上反而更优);若把 1-step 也限制在与 n-step 相近的梯度步数(约 136,920 步、40 小时),其成功率明显更低(pick object 92%,move object near target 67%),说明 n-step 带来的加速不是”减配”而是真实的训练效率提升。n-step 引入的偏差(off-policy 场景下 n-step 回报固有的偏差)在实验中影响很小。

附录 A/B 给出了”逐维展开的 Bellman 更新等价于原 MDP 最优化”的理论证明,以及表格化设定下的收敛性证明。

Infra(训练 / 推理工程)

  • 训练加速器型号与数量:论文未披露(不同于 RT-1,本文未提及具体 TPU/GPU 型号)。
  • 已披露的训练规模数据点仅限 n-step 消融实验的真机训练:n-step 版本 137,480 梯度步 / 32 小时;1-step 版本 582,960 梯度步 / 163 小时(见”训练方法”)。
  • 推理侧:策略以 3 Hz 的控制频率运行,动作异步执行(沿用 RT-1 的异步推理机制)。
  • 模型骨干推理开销(参数量、单步延迟等)论文未重新披露,继承自 RT-1 架构(见 rt-1)。

评测 benchmark

真机语言条件操作评测(5.1 节):在 3 类任务、共 72 个独立任务实例上评测(drawer pick and place 18 个、open and close drawer 7 个、move object near target 47 个),对比 Q-Transformer(Q-T)、Decision Transformer(DT)、Implicit Q-learning(IQL)、RT-1(纯模仿学习基线):

任务类别任务数Q-TDTIQLRT-1
drawer pick and place1864%49%11%17%
open and close drawer733%11%11%0%
move object near target4771%40%60%58%
平均成功率7256%33%27%25%

(原文正文写”move object near target”有 48 个任务实例,但表格该行给出 47、且总数明确写”72 个任务”的平均——18+7+47=72 与正文总数一致,18+7+48=73 则不一致,此处按表格与总数取 47,系原文自身的数字不一致。)

Q-Transformer 平均成功率比最强基线(DT)高约 70%(56% vs 33%)。

仿真基准(5.2 节):在视觉抓取任务上与 QT-Opt+CQL、IQL、AW-Opt、Decision Transformer、RT-1(BC)对比,文中以图表(Figure 5)呈现,未给出可提取的具体数值;定性结论为能做 TD 学习融合正负样本的方法(Q-Transformer、QT-Opt)优于纯模仿学习(RT-1 BC)和不能有效利用次优数据的方法(Decision Transformer)。

大规模扩展数据集(5.4 节,300,000 条轨迹):

方法平均成功率
Q-Transformer88%
Decision Transformer78%
RT-1(BC)82%

即便 RT-1 在如此大规模的成功演示上做纯模仿学习已达到 82% 的高成功率,Q-Transformer 仍能进一步改进到 88%。

SayCan 式长程任务规划 + 执行(附录 G):把 Q-Transformer 训练出的 Q 函数替换 SayCan 框架中 QT-Opt(sim-to-real)训练的 affordance 模型。

任务可行性(affordance)估计,Precision/Recall/F1:

模型PrecisionRecallF1
QT-Opt(sim-to-real)0.610.680.64
Q-T(不加 relabel)0.580.930.71
Q-T(加 relabel)0.760.890.82

长程任务规划 + 执行成功率:

方法(规划模型 / 执行模型)PlanningExecution
Q-T(加 relabel) / Q-T93%93%
QT-Opt(sim-to-real) / RT-187%67%

创新点与影响

  • 提出了把 Transformer 用于离线 Q-learning 的逐维自回归离散化方案,把 d 维动作空间的指数级离散化问题转化为 d 个可穷举 max 的一维子问题,并给出了理论上等价于原 MDP 最优化的证明。
  • 针对稀疏二值奖励场景设计了新的保守正则化目标(往最小可达奖励 0 回归,而非标准 CQL 的 softmax-交叉熵),解决了标准 CQL 在稀疏奖励下 Q 值变负的问题。
  • 证明了在真实机器人这种”少量高质量演示 + 大量低质量自主数据”的典型场景下,TD 式离线 RL(Q-Transformer)可以显著超越模仿学习(RT-1),并优于其他能利用次优数据的方法(Decision Transformer、IQL)——真机 72 任务上平均成功率领先最强基线约 70%。
  • 验证了训练出的 Q 函数可直接作为 SayCan 式长程任务规划的 affordance 模型,且不依赖 QT-Opt 所需的 sim-to-real 训练管线。
  • 作者自述的局限(第 6 节):(1) 只处理稀疏二值(成功/失败)奖励,更一般的奖励结构留待未来扩展;(2) 逐维离散化方案在动作维度更高时(如人形机器人)会导致序列长度和推理时间线性增长,n-step 回报只能部分缓解;均匀离散化也难以同时兼顾粗粒度和精细动作,可能需要自适应离散化(如训练离散自编码器降维);(3) 本文只研究离线 RL 设定,把 Q-Transformer 扩展到在线微调是未来方向。

原始链接

一手源存档(sources/)