一句话定位
Stanford / Google DeepMind / Google Intrinsic 提出 RT-Sketch:把手绘草图(sketch)作为目标条件(goal specification)模态引入操作策略学习——相比语言目标常常有歧义、图像目标又过度指定(over-specified)细节,草图介于两者之间,既能像语言一样随手给出,又保留图像的空间结构,同时能过滤掉视觉干扰物等无关细节;用 Pix2Pix 条件 GAN 把 rt-1 的 80K 真机数据集自动转成图文-草图配对数据,微调 RT-1 架构(去掉 FiLM 语言条件、改吃草图/图像作为视觉输入)训练出的策略,在 6 个操作技能上与语言/图像条件策略打平,遇视觉干扰物或语言歧义时空间/语义对齐 Likert 评分提升约 1.5-2.8 倍。
背景与定位
目标条件模仿学习(goal-conditioned IL)长期在两种目标表征之间取舍:自然语言指令直觉但容易歧义(例如”把叉子放盘子右边”到底多远算对),rt-1、rt-2 等语言条件策略即属此类;目标图像(goal image)则空间信息完整但”过度指定”——一张具体的目标末态图片会绑死到特定环境/光照/背景,泛化性差,且策略容易过度关注像素级细节而非任务相关结构。RT-Sketch 的定位是在这两极之间插入手绘草图作为第三种目标模态:像语言一样可以随手勾画、无需预先录制目标图像,又像图像一样保留空间结构,且草图的选择性勾勒(画什么、不画什么)天然帮策略区分任务相关和无关的场景元素。
与 RT-Sketch 同期相关的是同组的 rt-trajectory(Gu et al., RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches, arXiv:2311.01977)——RT-Trajectory 的”草图”画的是机器人应走的 2D 轨迹路径(motion-centric),而 RT-Sketch 的草图画的是期望的场景终态(scene-centric),两者代表草图在机器人学习中两种不同的用法。论文也明确区分自己与 Cui et al.([14],Can foundation models perform zero-shot task specification for robot manipulation?)的结论:后者认为场景图像比草图图像更适合做目标指定,但未真正训练一个草图条件策略;RT-Sketch 训练后发现结论相反——在有视觉干扰物时,草图条件策略在空间/语义对齐 Likert 评分上分别领先图像条件策略 1.63 倍和 1.5 倍。
模型架构
RT-Sketch 直接在 rt-1 的 Transformer 架构上做改造,而非提出全新网络:
- RT-1 原始架构回顾:D=6 帧历史图像经 EfficientNet-B3 编码为图像 token,语言指令经 FiLM 层与 TokenLearner 抽取为额外条件 token,二者一起送入 Transformer,输出离散化(bucketized)动作。动作输出维度为末端执行器 7 维(x, y, z, roll, pitch, yaw, gripper width)+ 移动底座 3 维(x, y, yaw)+ 1 维模式标志位(在底座移动 / 手臂移动 / 终止之间选择)。
- RT-Sketch 的改动:完全去掉 FiLM 语言 token 化分支,改为把目标草图(或目标图像)与历史观测图像在送入 EfficientNet 之前直接拼接,从拼接后的输出中抽取视觉 token,其余 Transformer 结构与动作输出不变。同一架构只训练草图作为目标时称 RT-Sketch,只训练目标图像时称 RT-Goal-Image(论文自建的图像条件基线,架构与 RT-Sketch 完全相同,仅目标模态不同)。
- 辅助模块——image-to-sketch 翻译网络 𝒯:基于 Pix2Pix 条件 GAN(cGAN,Isola et al. 2017)架构,由生成器 G_𝒯(输入图像 + 随机噪声 → 输出草图)和判别器 D_𝒯(判别生成草图 vs 真实草图)组成,训练目标为 cGAN 对抗损失 + L1 对齐损失(对同一图像的多个人工标注草图取最小 L1,避免因风格差异误罚合理但不完全匹配某一份标注的生成草图)。
- 目标表征增强函数 𝒜:为让策略适应不同细节程度的草图输入,训练数据的目标表征由随机增强函数 𝒜 生成,在以下四种之间随机选择:(1) 𝒯 直接输出的黑白线条草图;(2) 𝒯 输出 + 上色后处理(叠加一层模糊化的真实 RGB 图像做着色);(3) Sobel 算子边缘检测图;(4) 不做任何处理,保留原始目标 RGB 图像。RT-Sketch 在这四种表征上联合训练(co-training),使其能够处理从极简线稿到接近真实图像的一整个细节谱系。
数据
- 底层轨迹数据:复用 rt-1 论文收集的 ~80K 条真机 VR 遥操作演示轨迹,覆盖移物靠近(move X near Y)、罐/瓶子摆正或放倒、开关抽屉、台面与抽屉间拾放等多任务厨房/办公场景技能;机器人平台为 Google Everyday Robot(移动底座 + 头顶相机 + 7 自由度机械臂 + 平行夹爪)。
- 目标草图的生成:不对全部 80K 条轨迹人工画草图(不可扩展),而是训练 image-to-sketch 翻译网络 𝒯 自动把每条轨迹的终止帧(hindsight-relabeled 的目标图像,做法沿用标准的 hindsight goal relabeling)转成草图,再用增强函数 𝒜 生成最终训练用目标表征。
- 𝒯 的训练数据(两阶段):
- 预训练阶段:借用 Li et al. 的 Contour Drawing Dataset 𝒟_CD——1000 张 Adobe Stock 互联网图片(含物体/人物/动物),每张配 5 份 Amazon Mechanical Turk 众包黑白线稿(L=5),即 5000 组图像-草图对,先训练出预训练网络 𝒯_CD。
- 微调阶段:作者本人用自建数字触控笔标注界面,对 RT-1 数据集中随机采样的 500 张终止帧图像,每张亲手画 1 份(L=1)黑白线稿草图,构成 𝒟_𝒯,用以微调 𝒯_CD 得到最终的 𝒯(不含机械臂本体,只画台面/抽屉/任务相关物体轮廓)。
- 数据假设:草图需忠实保留图像的任务相关轮廓(台面边缘、抽屉把手、相关物体须可辨认),不要求像素/边缘对齐,允许省略无关细节,但不允许包含图像中不存在的信息(幻觉物体、涂鸦、文字标注)。
- 未使用仿真数据或跨本体(cross-embodiment)数据;全部真机单一本体(Everyday Robot)。
训练方法
- 目标函数:与 rt-1 完全一致的行为克隆(behavior cloning)目标,最大化在给定目标(草图/图像)与历史观测条件下动作的对数似然(negative log-likelihood 最小化);RT-Sketch 的训练流程沿用 RT-1 原始训练流程,仅将输入表征从语言替换为草图/图像。
- image-to-sketch 网络 𝒯 训练:cGAN 对抗损失 + λ 加权的多份草图最小 L1 对齐损失(公式 (1)(2)),两阶段训练——先在 𝒟_CD(5000 对,互联网图片)上预训练,再在 𝒟_𝒯(500 对,机器人场景图片)上微调。
- 目标表征随机增强 𝒜:训练时对每条轨迹的目标表征在【纯黑白草图 / 上色草图 / Sobel 边缘图 / 原始目标图像】四者间随机采样,实现单一策略网络对多种细节层级(specificity)的联合训练(co-training),而非分别训练四个模型。
- 论文未涉及强化学习,纯模仿学习(IL)+ 行为克隆,单阶段(策略)+ 前置一次性(𝒯 翻译网络)两段式流水线:先训 𝒯 生成数据,再用生成数据训 RT-Sketch 策略。
Infra(训练 / 推理工程)
- 论文正文与附录(Appendix A-D)均未披露 GPU/TPU 型号、卡数、训练时长、batch size、学习率等具体训练超参数与算力配置——训练流程只笼统声明”沿用 RT-1 的训练流程”,未重新给出数字。
- 推理:论文未披露闭环控制频率(Hz)、单步推理延迟等具体数字;真机评测在 Everyday Robot 平台上进行,草图/图像输入通过自建数字触控笔标注界面采集。
- 动作离散化:延续 RT-1 的 bucketized(离散分箱)动作输出设计,但本文未重新说明具体分箱数量。
评测 benchmark
评测覆盖 6 个真机操作技能(move near、place upright、knock over、open drawer、close drawer、pick from drawer),每技能 15 个人工设定的评测场景(catalog scenarios,共涉及 16 种不同物体及摆放方式);采用两类指标:(a) 基于人工关键点标注的物体质心像素距离 RMSE(spatial precision);(b) 62 位非专业人工评审(每技能分配 8-12 人)给出的 1-7 分 Likert 评分,分别评估语义对齐(Q1:机器人是否达成给定目标的语义要求)与空间对齐(Q2:机器人是否在空间上摆放到位)。
Table I(H1 主结果,Spatial Precision RMSE 单位像素 / Failure Occurrence 过度重试发生率):
| Skill | RT-1 RMSE | RT-Sketch RMSE | RT-Goal-Image RMSE | RT-1 重试率 | RT-Sketch 重试率 | RT-Goal-Image 重试率 |
|---|---|---|---|---|---|---|
| Move Near | 5.43±2.15 | 3.49±1.38 | 3.89±1.16 | 0.00 | 0.06 | 0.33 |
| Pick Drawer | 5.69±2.90 | 4.77±2.78 | 4.74±2.01 | 0.00 | 0.13 | 0.20 |
| Drawer Open | 4.51±1.55 | 3.34±1.08 | 4.98±1.16 | 0.00 | 0.00 | 0.07 |
| Drawer Close | 2.69±0.93 | 3.02±1.35 | 3.71±1.67 | 0.00 | 0.00 | 0.07 |
| Knock | 7.39±1.77 | 5.36±2.74 | 5.63±2.60 | 0.00 | 0.13 | 0.40 |
| Upright | 7.84±2.37 | 5.08±2.08 | 4.18±1.54 | 0.06 | 0.00 | 0.27 |
| Visual Distractors (H3) | – | 4.78±2.17 | 7.95±2.86 | – | 0.13 | 0.67 |
| Language Ambiguity (H4) | 8.03±2.52 | 4.45±1.54 | – | 0.40 | 0.13 | – |
H1(基础可行性):6 个基础技能上 RT-Sketch 语义/空间 Likert 评分普遍落在”Agree”到”Strongly Agree”区间,与 RT-1/RT-Goal-Image 相当;唯一明显例外是 upright 任务,RT-Sketch 语义上基本失败——常把罐/瓶放到正确位置后就提前终止,不会像 RT-1 那样再做翻正动作(因此其 RMSE 反而更低但语义未达成)。过度重试失败模式上 RT-Goal-Image 最严重(因过度关注像素级细节反复尝试对齐),RT-Sketch 与 RT-1 都远不易受此影响。
Table II(H2,草图细节程度消融,move near 与 drawer open 各 5 次试验,RMSE 单位像素):
| Skill | Free-Hand | Line Sketch | Color Sketch | Sobel Edges |
|---|---|---|---|---|
| Move Near | 7.21±2.76 | 3.49±1.38 | 3.45±1.03 | 3.36±0.66 |
| Drawer Open | 3.75±1.63 | 3.34±1.08 | 2.48±0.50 | 2.13±0.25 |
Sobel 边缘图(上界基准)误差最低,但即便是不保证透视一致的自由手绘草图,误差也并不算离谱;Likert 评分上自由手绘约得 4 分(中等),而 line sketch 就能提升到接近 7 分,与边缘检测图相当;额外上色不再进一步提升表现。另外收集 6 位不同标注者对 5 个 move-near 场景各画的线稿共 30 份,22 位评审对结果 rollout 评分,发现不同标注者画的草图之间性能无显著差异。
H3(视觉干扰物鲁棒性):复用 15 个 move-near 场景,额外加入 5-9 个干扰物体(对标 RT-1 论文的 medium-high 难度泛化设置)。RT-Sketch 误差远低于 RT-Goal-Image(见 Table I 倒数第二行),且在空间/语义 Likert 上分别领先图像条件策略 1.63 倍和 1.5 倍;RT-Goal-Image 容易被干扰物体分布偏移搞混,反复在拿起/放下错误物体间摇摆。
H4(语言歧义鲁棒性):设计 15 个场景涵盖三类语言歧义——实例歧义 T1(如场上有多个橙子时说”move apple near orange”)、轻度分布外语言 T2(如”move left apple near orange”)、重度分布外语言 T3(如”complete the rainbow”,RT-1 训练时从未见过此类指令)。RT-Sketch 误差约为 RT-1 的一半,语义/空间 Likert 评分分别提升 2.39 倍和 2.79 倍。
创新点与影响
- 首次系统性地训练(而非仅测试时讨论)一个以手绘草图为目标条件的操作策略,并给出一条可扩展的数据生成路线:用 Pix2Pix cGAN 微调出的 image-to-sketch 网络,对已有大规模真机数据集(RT-1 的 80K 轨迹)做 hindsight 自动转标注,避免了人工为每条轨迹画草图的不可扩展性。
- 与 Cui et al. 认为”场景图像比草图更适合目标指定”的结论相反:RT-Sketch 实验证明专门训练的草图条件策略在有视觉干扰物时反而优于图像条件策略(1.63x/1.5x 空间/语义对齐),证明结论差异的关键在于”是否真的训练了一个草图条件策略”而非仅在测试时对比原始草图图像。
- 揭示草图作为目标表征的独特优势区间:在直白场景中与语言/图像条件策略打平(H1),但在视觉干扰物存在(H3)或语言指令有歧义(H4)时体现出明显鲁棒性优势,且能适应从自由手绘到精细上色的完整细节谱系(H2),无需为每种细节层级单独训练模型。
- 作者自陈局限:(a) image-to-sketch 翻译网络仅在单一标注者绘制的 500 张草图上微调,尚未验证大规模、多标注者风格草图训练下的效果;(b) RT-Sketch 对某些训练技能存在固有偏好,偶尔会执行错误的技能;(c) 失败模式包括过度重试导致场景被扰乱、方向/位置精度不足(如 upright 任务不会主动翻正物体)、以及因 GAN 生成草图偶发几何细节错误/幻觉而导致操作错误物体(附录 Fig. 15 详述,最不常见的失败模式是操作错误物体且送到错误位置,在自由手绘草图输入时最常见)。
原始链接
- 论文(arXiv abs):https://arxiv.org/abs/2403.02709
- 论文 PDF:https://arxiv.org/pdf/2403.02709
- 论文 HTML 全文:https://arxiv.org/html/2403.02709v1
- 项目主页:https://rt-sketch.github.io/
一手源存档(sources/)
- rt-sketch—project-page — 项目主页快照(摘要、作者列表、数据生成与训练流程图说明、失败模式总结)
- arXiv 原文 PDF(不入 git):https://arxiv.org/pdf/2403.02709