一句话定位
RT-Trajectory 是 Google DeepMind 提出的一种策略条件化方法:不再用语言或目标图像描述任务,而是用一张叠加在初始观测图像上的粗粒度 2D 末端执行器轨迹草图(红色曲线 + 绿/蓝色抓握标记,可选高度通道)来指定”怎么做”,并可从人类演示中自动、无需人工标注地提炼出这类”事后(hindsight)轨迹标签”用于训练;在 7 个训练中未见过的新技能上,RT-Trajectory (2.5D) 达到 67% 成功率,是同数据训练的 RT-1(16.7%)、RT-2(11.1%)、RT-1-Goal(26%)中最强基线的 2.6 倍以上,且轨迹草图可由人工画图、人类演示视频、Code as Policies(GPT-4 生成路点)或图像生成模型自动产出。
背景与定位
论文 2023-11 发布于 arXiv(2311.01977),后被 ICLR 2024 接收为 Spotlight,作者包含 Jiayuan Gu、Sean Kirmani、Paul Wohlhart 等 17 人,来自 Google DeepMind、UC San Diego、Stanford、Intrinsic。它直接建立在 rt-1(Brohan et al., 2023b,35M 参数专用 transformer + FiLM 语言条件)之上——RT-Trajectory 复用 RT-1 的 transformer 骨架和同一份 RT-1 演示数据集,只是把”语言条件”换成”轨迹草图条件”。论文的核心论点是:任务的表征方式本身决定了策略能泛化到什么类型的新任务。语言条件(如 rt-1、rt-2)擅长泛化到新的语言措辞,但语言空间中”叠毛巾”和”拿取放置”看起来毫不相关,即使两者的手臂运动轨迹其实很相似,语言条件策略也无法把这种运动相似性利用起来;目标图像条件(goal-image conditioning,如 Lynch et al. 2019 的 Play/LMP)则对末端状态”过度指定”(over-specified),容易被背景等任务无关因素干扰,且在新场景下获取目标图像本身就很麻烦。RT-Trajectory 把 2D 轨迹草图定位为语言条件与整段视频条件之间的”中间层表征”:既包含足够的低层运动信息,又足够粗糙以便策略结合当前视觉观测做出适应性调整。
论文明确对比/引用的相关工作包括:CLIPort、PerAct(2D/3D 物体中心表征)、VIMA(多模态 prompt)、Code as Policies(Liang et al. 2022,LLM 生成代码控制机器人)、PaLM-E(Driess et al. 2023,本文用其架构做轨迹生成的图像生成模型)、RoboCat(自我提升的目标条件基础智能体)。它是 Google 机器人这条 rt-1 → rt-2 → palm-e 主线之外,专门解决”任务泛化”(而非语义/视觉泛化)问题的一支;2024-01-04 DeepMind 官方博客将其与同期发布的 AutoRT(大模型驱动的自主数据采集,77,000 次轨迹/6,650 个独特任务)、SARA-RT(把 RT 系列 transformer 的二次复杂度注意力线性化,SARA-RT-2 比 RT-2 快 14%、准确率高 10.6%)并列为”下一代机器人的三块基石”。
模型架构
Backbone:直接沿用 rt-1 的 transformer 架构(Vaswani et al. 2017),图像 tokenizer 为 ImageNet 预训练的 EfficientNet-B3,历史窗口为 6 帧图像。关键改动两处:
- 轨迹草图
c_traj(一张 RGB 图像)沿特征维度与每一帧 RGB 图像拼接(concatenate)后再送入图像 tokenizer;tokenizer 第一层卷积新增的输入通道权重初始化为全零,使模型初期行为与原始 RT-1 一致。 - 由于不再使用语言指令,移除了原始 RT-1 中的 FiLM 层(FiLM 原本用于注入语言条件)。
条件输入(轨迹草图)的构造(hindsight labeling,训练时从演示数据集自动提取,无需人工标注):
- 2D Trajectory:从每条演示 episode 的本体感觉(proprioception)中取末端执行器在机器人基座坐标系下的 3D 位置,用已知相机内外参投影到相机像素空间,再把相邻时间步的 2D 点用直线连接画成一条曲线(画在空白图像上)。
- Color Grading:红色通道编码归一化时间步
(t+1)/T(表达速度/方向等时序信息);绿色通道编码归一化高度(h_{t+1}-h_min)/(h_max-h_min)(可选,仅 2.5D 版本使用)。 - Interaction Markers:通过比较目标夹爪关节位置
p̂_t与实测位置p_t的差值δ_t = p̂_t - p_t判断夹爪开合状态变化的关键时间步,在对应 2D 末端点画绿色圆圈(抓取/闭合)或蓝色圆圈(松开/打开)。 - 两种最终表征:RT-Trajectory (2D)(2D 轨迹 + 时序信息 + 交互标记)与 RT-Trajectory (2.5D)(在 2D 版本基础上叠加高度通道)。
推理时轨迹草图的 4 种生成方式:人工用 GUI 画图(human-drawn sketches);第一人称人类演示视频(用 MediaPipe 提取 21 个手部关键点中拇指+食指共 4 个点代表平行夹爪,结合深度图提升到 3D,人工标注抓取/释放关键帧);Prompting LLM with Code as Policies(沿用 Gonzalez Arenas et al. 2023 的做法,用 VLM 检测场景物体,构造 prompt 让 GPT-4 输出一串 3D 位姿路点,原本供运动规划器执行,这里改为直接画成轨迹草图);图像生成模型(一个 PaLM-E 风格模型,输出源自 ViT-VQGAN 的向量量化 token,解 token 化后得到轨迹图像)。
Baselines 网络结构:RT-1-Goal 与 RT-Trajectory 网络结构完全相同,只是把轨迹草图换成目标图像(用 episode 最后一帧作为训练时的目标条件)。
数据
训练数据(Seen Skills):复用 rt-1 的真实机器人演示数据集,由 Everyday Robots 的移动操作机器人(7 自由度机械臂 + 两指夹爪 + 移动底座)人工遥操作采集。论文正文/Table 2 给出 约 73K 条真实机器人演示、覆盖 542 个”seen tasks”(8 类操作技能 × 17 种厨房物品的组合,技能类别为 Pick Object / Move Object Near Object / Place Object Upright / Knock Object Over / Open Drawer / Close Drawer / Place Object into Receptacle / Pick from Receptacle and Place on Counter,各类别任务数分别为 17/337/8/8/3/3/84/82);项目页给出的口径略有差异——73,334 条演示、551 条训练指令。轨迹标签完全通过 hindsight labeling 从这批已有演示中自动提取,不需要额外人工标注。
评测数据(Unseen Skills):论文新提出 7 个训练中完全未见的评测技能(App. A.2,共 58 个评测场景:Place Fruit 12、Upright and Move 6、Move within Drawer 6、Restock Drawer 12、Pick from Chair 8、Fold Towel 4、Swivel Chair 10),涉及未见物体、未见操作空间与未见高度;正文 4.2 节的定量对比统一固定为每个 policy 在 7 个场景上共 64 次试验。
其它推理条件数据:18 段 + 4 段第一人称人类演示视频(分别对应 Pick 与 Fold Towel 两个任务);LLM(GPT-4)生成轨迹的评测覆盖 Pick 与 Open Drawer 两个已见技能。
Sim-vs-real:全程真实机器人数据,无仿真组件。
训练方法
目标函数:标准模仿学习 / 行为克隆(Behavior Cloning, Pomerleau 1988),在给定输入图像与轨迹草图条件下最大化预测动作的对数似然,沿用 RT-1 的训练流程与损失,未引入额外的 RL 或蒸馏阶段。
动作 tokenization:与 RT-1 一致(论文未重新展开描述,直接沿用原始 RT-1 的离散动作 token 化方案)。
评测协议(4.1 节):对每个待评测技能,先收集一组场景(每个场景用机器人头部相机拍摄的初始 RGB 图像定义初始状态),评测前先把相关物体摆放回原始场景布局再运行策略,以尽量保证不同 conditioning 方法之间的公平比较。RT-Trajectory 用人工画的草图评测 unseen skills(4.2 节),其余生成方式(人类视频、LLM 路点、图像生成模型)在 4.3 节单独评测。
Prompt engineering 数据收集流程(App. B.2):对每个评测场景,先用一个 held-out 的 RT-Trajectory (2.5D) 策略在给定试验预算内尝试不同轨迹”prompt”,保存第一次成功试验的轨迹草图;若全部失败则保存最后一次的草图。正式评测用的 RT-Trajectory 策略用不同随机种子单独训练,再用保存下来的草图条件做评测——即评测用的轨迹草图与被评测的策略权重是分离的,避免”自己生成条件、自己执行”造成的过拟合式泄漏。
超参数:论文正文与附录未披露 batch size、学习率、优化器、训练步数/epoch 数等具体训练超参数(仅说明沿用 RT-1 的 Transformer 架构与 BC 训练框架)。
Infra(训练 / 推理工程)
论文未披露训练所用 GPU 型号、数量、总 GPU-hours 或分布式并行策略。推理侧的控制频率(control-Hz)、单步延迟、边缘硬件型号同样未披露;论文仅说明实验机器人为 Everyday Robots 移动操作平台(7 自由度机械臂 + 两指夹爪 + 移动底座),且假设机器人基座与相机在单条 episode 内保持静止(适用于固定式操作场景)。
评测 benchmark
4.2 节 未见任务泛化(人工画轨迹草图条件,7 个技能 × 共 64 次试验,Table 4 / Fig. 5):
| 技能 | RT-Traj (2D) | RT-Traj (2.5D) | RT-1 | RT-2 | RT-1-Goal |
|---|---|---|---|---|---|
| Place Fruit | 75% | 75% | 0% | 33% | 8% |
| Upright and Move | 33% | 50% | 17% | 0% | 0% |
| Move within Drawer | 67% | 100% | 33% | 0% | 17% |
| Restock Drawer | 92% | 67% | 42% | 17% | 42% |
| Pick from Chair | 0% | 38% | 0% | 0% | 17% |
| Fold Towel | 75% | 75% | 0% | 0% | 0% |
| Swivel Chair | 0% | 70% | 17% | 0% | 50% |
| Overall | 50% | 67% | 16.7%(≈17%) | 11.1%(≈11%) | 26% |
RT-Trajectory (2.5D) 整体成功率 67%,显著优于最强基线 RT-1-Goal(26%)——正文摘要口径下约为 2.6 倍;RT-Trajectory (2.5D) 相对 RT-Trajectory (2D) 在依赖高度信息消歧的任务(如 Pick from Chair、Swivel Chair)上优势明显,因为纯 2D 轨迹难以推断正确的抓取高度。
4.3 节 多样化轨迹生成方式对比(Table 1):
人类演示视频条件(Pick / Fold Towel):
| 方法 | Pick | Fold Towel |
|---|---|---|
| IK Planner | 42% | 25% |
| Ours (2D) | 94% | 75% |
| Ours (2.5D) | 100% | 75% |
LLM (Code as Policies) 生成路点条件(Pick / Open Drawer):
| 方法 | Pick | Open Drawer |
|---|---|---|
| IK Planner | 83% | 71% |
| Ours (2D) | 89% | 60% |
| Ours (2.5D) | 89% | 60% |
图像生成模型(PaLM-E 风格 + ViT-VQGAN)条件:仅给出定性结果,未给出成功率数字(论文原文说明生成的轨迹草图”noisy 且与训练时的 hindsight 轨迹草图差异较大”,但 RT-Trajectory 仍能”合理执行”)。
4.5 节 运动泛化度量:用离散 Fréchet 距离(Fréchet, 1906; Eiter & Mannila, 1994)衡量评测轨迹与训练集中最相似轨迹之间的运动相似度,发现 unseen 技能的查询轨迹与训练集中最相似轨迹之间的 Fréchet 距离普遍显著大于同域(in-distribution)技能,且即使形状相近,关键的 z 轴抓取高度或语义类别也常常不同——用于定量论证”提出的新技能确实需要混合插值已见运动与泛化到全新运动”。
官方博客口径(2024-01-04,独立于 arXiv 正文数字,疑似对应 ICLR camera-ready 或扩展评测):在 41 个训练未见任务上,RT-Trajectory 达到 63% 成功率,对比 RT-2 的 29%(“more than doubled the performance”)。此数字未见于本文所读 arXiv v2 正文,两套数字分别标注来源,不做合并。
创新点与影响
创新点:(1) 提出用粗粒度 2D 轨迹草图(而非语言或目标图像)作为策略条件,恰好处于”过度指定”(整段视频/目标图像)与”欠指定”(语言)之间的中间层表征,兼顾运动细节表达力与视觉观测的情境适应性;(2) hindsight trajectory labeling——训练标签完全从已有演示的本体感觉+相机外参自动重建,无需额外人工标注,可直接复用任何已有演示数据集;(3) 统一的轨迹草图接口可对接 4 种截然不同的推理时生成来源(人工画图、人类演示视频、LLM/Code as Policies、图像生成模型),首次把”visual prompt engineering”这一 LLM 领域的概念类比到机器人策略——同一场景下换一条轨迹草图就能让策略切换行为模式(4.4 节),无需重新训练或收集数据;(4) 展示了 retry behavior(策略在轨迹引导失败后自主换一种抓取方式重试)等涌现能力,以及在全新建筑/房间(背景、光照、物体、家具几何同时变化)中的鲁棒性。
论文自述的局限性(Conclusion and Limitations 节):(1) 假设机器人基座静止、仅用末端执行器完成操作,未扩展到移动操作/全身控制场景;(2) 策略只是”尽力”跟随轨迹草图引导,无法表达”哪些空间区域必须严格遵守约束”(如避开易碎物体)这类强制性规则,作者将其列为未来方向。
原始链接
- arXiv: https://arxiv.org/abs/2311.01977
- PDF: https://arxiv.org/pdf/2311.01977
- 项目页: https://rt-trajectory.github.io/
- 官方博客(DeepMind, 2024-01-04): https://deepmind.google/discover/blog/shaping-the-future-of-advanced-robotics/
一手源存档(sources/)
- 论文全文 PDF:
/tmp/p_rt-trajectory.pdf(arXiv 原文 PDF,不入 git;来源 https://arxiv.org/pdf/2311.01977) - rt-trajectory—project-page.md — 项目页快照(摘要、方法图解、训练/评测技能列表、定量结果说明)
- rt-trajectory—blog.md — DeepMind 官方博客快照(“Shaping the future of advanced robotics”,与 AutoRT / SARA-RT 并列发布)