一句话定位

ROSIE 不采集一条新的真实机器人轨迹,而是把 rt-1 已有的 13 万条操作演示喂给开放词汇分割模型 OWL-ViT + 文生图 inpainting 模型 Imagen Editor,用自然语言指令替换画面里的物体、背景、干扰物,“凭空”造出策略从未见过的任务和场景,再把这批合成数据混入原始数据微调 RT-1——用文生图基础模型的互联网先验去补机器人数据的稀缺性。

背景与定位

论文开篇即引用一个具体数字倒逼动机:rt-1 采集 13 万条演示用了 17 个月、13 台机器人;同期 MT-Opt 用 7 台机器人、16 个月采集 80 万条自主 episode——真实机器人数据扩量极其昂贵。仿真是另一条路,但存在仿真真实感和 sim-to-real 迁移两大老问题。ROSIE 选择第三条路:不新增任何机器人时段,而是用 DALL-E 2、imagen、Stable Diffusion 这一代文生图扩散模型的 inpainting 能力,对已经采集好的真实轨迹做语义级数据增强——只改画面里与任务语义相关的局部区域(如换一个抓取目标、换一个背景、加一个干扰物),动作标签保持不变,从而”免费”生成大量新的 (观测, 动作, 指令) 三元组。

论文将其定位为与同期 CACTI、GenAug(instructpix2pix 同源的文本引导图像编辑路线)并列的并发工作,但强调自己的两点差异:(1) 不需要深度信息或人工提供的 mask/物体网格,自动通过开放词汇检测生成 mask;(2) 同时覆盖”新干扰物”和”全新任务”两类增强,而非局限于加干扰物。这条”用生成模型扩增真实机器人数据”的思路后来在 open-x-embodiment 等跨本体数据整合工作的叙事里被反复提及,是”数据稀缺性”与”生成模型先验蒸馏”这条支线的早期代表作。

模型架构

ROSIE 本身不是一个新策略网络,而是一条三段式的数据增强流水线(Fig. 2),下游仍训练标准的 rt-1 策略架构:

第一段:增强区域定位(开放词汇分割)

  • 用 OWL-ViT(开放词汇目标检测器)+ 额外训练的实例分割头(Mask R-CNN 风格,输出每个检测框的固定分辨率 mask)。
  • OWL-ViT 主干冻结,只微调分割头,训练数据为 Open-Images-V5 实例分割标注。
  • 对每条 episode,先按语言指令 ` 识别目标物体(如”coke can”)得到操作对象 mask;如需生成干扰物,则额外检测桌面/抽屉整体区域,减去已有物体(含机器人臂、抓取物这些”passthrough objects”)的 mask,得到可插入干扰物的空白区域。

第二段:增强文本生成(可人工指定 / LLM 生成两种模式)

  • 人工指定:适合需要严格分布外(OOD)物体的场景(如论文明确选择训练集外的物体以确保数据支撑扩展)。
  • LLM 生成(论文最终采用):用 GPT-31-shot 提示,输入”原任务 / 目标任务”对,让 LLM 输出三元组——ViT 区域 prompt(要检测的区域)、passthrough object prompt(要排除的物体)、inpainting prompt(要生成什么)。论文明确指出零样本提示下 GPT-3 会”幻觉”出不可用的 prompt,必须靠 1-shot 示例才稳定(Appendix C 展示了具体失败案例)。

第三段:文本引导 inpainting

  • Imagen Editorimagen 微调而来的级联扩散 inpainting 模型),架构为 64×64 base 扩散模型 + 256×256 超分(SR)模型级联,两个模型均接受高分辨率 1024×1024 图像/mask 输入,并新增了卷积图像编码器(Fig. 2 右下角)。Imagen Editor 直接复用 [59] 论文(Wang et al., arXiv:2212.06909)已训练好的 checkpoint 做推理,ROSIE 不对 Imagen Editor 本身做任何微调
  • 对 episode 内每一帧 oᵢ,用同一个 mask m 和同一段增强文本 `_aug 逐帧迭代查询 Imagen Editor,保证同一条轨迹里生成的物体/背景在时间上语义一致;动作标签 aᵢ 保持完全不变。

下游策略:RT-1(沿用 rt-1 原架构,未作改动)

  • FiLM 条件化 EfficientNet 图像编码器 + TokenLearner(自适应时空 tokenizer)+ decoder-only Transformer 输出离散动作 token。
  • 预训练规模:35M 参数,预训练 315k 步,学习率 1×10⁻⁴
  • ROSIE 微调:在预训练 checkpoint 基础上,用原始 130k 集 : ROSIE 生成集 = 1:1 混合比例继续训练 85k 步,学习率降为 1×10⁻⁶(其余超参与 RT-1 原论文一致)。

数据

  • 底座数据集:沿用 rt-1 论文采集的多任务机器人数据集,约 13 万条演示744 条语言指令,采集于办公室/厨房实验环境,覆盖抓取、放置、开关抽屉、物体移近容器、抽屉内外整理等技能。
  • 各实验的增强子集规模(均为从上述底座中筛出的子任务片段,1:1 混合原始+增强后微调):
    • 移近新容器 / 放入新容器:源任务 “move/place {object} near/into white bowl / paper bowl”,共 254 条 episode,替换目标为 {便当盒、编织篮、陶罐、玻璃梅森罐、橙色纸盘} 等 5 类容器。
    • 抓取全新可变形物体:源任务 “pick green chip bag”,共 1309 条 episode,用 Imagen Editor 把绿色薯片袋替换为黑/蓝两色的超细纤维布。
    • 放入未见水槽(全新背景):源任务 “place can into top drawer”,共 779 条 episode,把开抽屉替换为金属水槽。
    • 背景鲁棒性(桌布/水槽):源任务 “pick coke/pepsi can”,共 1222 条 episode;用 GPT-3 生成约 30 种桌布配色描述(例:藏青白条纹、白粉波点、薄荷绿方格等)做多样化背景替换。
    • 干扰物鲁棒性:源任务 “pick coke can”,615 条训练 episode,增强等量的”桌上多个可乐罐”场景;另一组”放入抽屉”任务增强等量的”抽屉内已有干扰物”场景。
    • 高层推理(成功检测):复用 Xiao et al. [71](Instruction Augmentation 论文)的放入抽屉数据集,增强 22764 条 episode,分别生成”抽屉内有干扰薯片袋”(数据集 A)和”抽屉内有干扰易拉罐”(数据集 B)两组、各与原始集等量。
  • 无新真实机器人数据:全流程未增加任何新的真机采集时段——这是论文核心卖点,数据全部来自对既有 130k 数据集的图像空间重标注/重渲染。
  • 动作标签不变:因为只做局部 inpainting、不改变机器人动作序列,增强 episode 复用原始动作标签,无需重新标注。
  • OWL-ViT mask 置信度阈值(因任务而异,Appendix A.1):RQ1(学新任务/新容器/新物体)实验用 0.07 检测目标物体/容器、0.05 检测 passthrough 物体(机械臂/夹爪);水槽与背景实验用 0.04 检测桌面整体、0.03 检测 passthrough 物体(机械臂、夹爪、可乐/百事罐);RQ2/RQ3 干扰物实验用 0.3 检测桌面/抽屉整体区域。

训练方法

  • 两条基线对照:(1) NoAug——直接用 rt-1 预训练 checkpoint,未见过增强文本或增强图像;(2) InstructionAug——参照 Xiao et al. [71],只把原始 episode 的语言指令重标注为增强后的新指令,图像保持不变(用于分离”文本增强”与”图像增强”各自的贡献)。
  • 微调目标:标准行为克隆(behavior cloning,负对数似然),与 RT-1 原论文一致。
  • 数据混合:每个实验场景下,取该任务对应的原始子集 + 同等数量的 ROSIE 增强子集,1:1 混入,与全量 130k 集一起继续微调 RT-1(并非只用子集单独训练)。
  • 超参:学习率从预训练的 1×10⁻⁴ 降到微调用的 1×10⁻⁶,训练 85k 步;其余(batch size、优化器等)沿用 [2] RT-1 原论文设置(论文未在本文重复列出)。
  • 成功检测微调:基于 CLIP 的成功检测器,训练流程沿用 Xiao et al. [71],仅将训练集替换为原始集 / ROSIE 增强集 A / A+B 三种配置对照。

Infra(训练 / 推理工程)

  • 策略训练:RT-1 微调用 16 个 TPU,训练 1 天(Appendix A.2)。
  • 分割推理:OWL-ViT 检测+分割推理用 1 个 TPU、1 小时生成 1000 条 episode 的 mask。
  • 增强图像生成推理:Imagen Editor(64×64 base 模型与 256×256 超分模型分别用 4 个 TPU)推理 2 小时生成 1000 条 episode 的增强图像(原文原话,未进一步拆分两阶段各自的 TPU-小时占比)。
  • 控制频率 / 实机部署:未披露具体推理延迟或控制 Hz 数字(论文聚焦离线数据增强与真机 rollout 成功率评测,未给出闭环推理延迟表)。
  • 效率讨论:作者在 Discussion 中明确指出扩散模型推理”计算开销大,限制了实时增强能力”,并提到 Mask Transformer 类架构(如 Muse)理论上快 10 倍,作为未来加速方向,但本文未实现。

评测 benchmark

真机评测覆盖 243 次 policy rollout(7 类任务族,Table 1),成功率对比 NoAug / InstructionAug / ROSIE 三种配置(”-” 表示该任务族未跑 InstructionAug 基线):

  • 移近新容器(50 次 rollout):NoAug 0.86 → InstructionAug 0.78 → ROSIE 0.94
  • 抓取全新可变形物体(微纤维布,20 次 rollout):NoAug 0.25 → InstructionAug 0.30 → ROSIE 0.75,原文称”至少提升 150%”。
  • 放入新容器(16 次 rollout):NoAug 0.13 → ROSIE 0.44,原文称”至少提升 75%“(InstructionAug 数值因表格提取存在歧义,本文不作转述,仅标 未披露 以避免误引)。
  • 放入未见水槽(10 次 rollout):NoAug 0.0(完全找不到目标,0% 成功) → ROSIE 0.6(可乐罐 0.8、百事罐 0.4)。
  • 新背景下抓取(桌布/水槽旁,80 次 rollout):NoAug 均值 0.33 → ROSIE 均值 0.71,即约 +115%(原文明确写”overall 115% improvement”,8 项子任务里 7 项显著提升、1 项持平)。
  • 放入有干扰物的抽屉(40 次 rollout):NoAug 均值 0.38 → ROSIE 均值 0.55
  • 已知任务 + OOD 干扰物(桌上多个可乐罐,27 次 rollout):NoAug 0.33 → ROSIE 0.37

成功检测(Table 2,CLIP-based 检测器,F1@0.5 阈值)

评测集NoAugROSIE Aug(A)ROSIE Aug(A+B)
Overall0.430.560.62
In-Distribution0.660.670.66
OOD(抽屉内有未见干扰物)0.190.450.57

OOD 集上从 0.19 提升到 0.57,同时 In-Distribution 精度基本不掉(0.66→0.66),说明 ROSIE 增强对分布内任务无损、对分布外鲁棒性有明显收益。论文没有与 CACTI / GenAug 做直接数值对比(仅文字层面区分方法差异)。

创新点与影响

  • 贡献:(1) 首次证明可以完全不采集新的真机数据,仅靠对现有轨迹做语义级 inpainting 增强,就让策略学会全新任务(如把抽屉换成金属水槽后学会”往水槽里放罐子”,真实场景 0%→60% 成功率);(2) 提出开放词汇分割(OWL-ViT)+ LLM 生成 prompt + 文生图 inpainting(Imagen Editor)的完整自动化流水线,无需人工提供 mask 或物体网格(区别于同期 CACTI/GenAug);(3) 首次把这类扩散增强扩展到高层具身推理任务(CLIP 成功检测器),证明其价值不局限于底层操作策略。
  • 改变了什么:把”用互联网规模文生图模型的先验蒸馏进机器人数据”这一思路系统化、流水线化,是”扩散模型作为机器人数据引擎”这条支线的早期代表作之一,后续 GenAug/CACTI 同期工作及更晚的生成式数据增强、世界模型合成数据路线均可视为这一方向的延伸。
  • 作者自陈局限(Discussion 原文):(1) 只增强外观(物体/背景/纹理),不生成新的运动/物理交互,因此无法教会真正新的操作动作,只能扩展”看到什么”而非”怎么动”;(2) 逐帧独立做 inpainting,可能损失时间一致性(作者称在 RT-1 架构下未观察到明显性能下降,但承认这是权衡点);(3) 扩散模型推理开销大,限制了实时/在线增强的可行性,作者提出未来可探索约 10 倍更快的 Mask Transformer(Muse)类架构替代。

原始链接

一手源存档(sources/)

  • rosie-scaling-robot-learning—project-page — 项目主页(作者名单、架构图讲解、方法步骤复述、Related work 提及并发工作 GenAug、结果表格摘要索引)
  • arXiv 原文 PDF(2302.11550,不入 git):见上方 arXiv 链接