一句话定位
CMU + Meta AI 用 7,500 条遥操作轨迹训练出能执行 12 类操作技能、38 个任务的语言条件通用策略 RoboAgent,核心是两级方案——用 SAM 自动分割 + 图像修复做”语义数据增强”把小数据集离线扩容,再配合把 ALOHA/ACT 的 action chunking + CVAE 架构改造为多任务版本的 MT-ACT 策略——在未见场景下平均比基线高 40% 以上,同步开源了当时最大规模的商用硬件机器人数据集之一 RoboSet。
背景与定位
2022-2023 年机器人操作数据规模化有两条路线:一是砸大量数据(rt-1 13.5 万条演示,bridgedata-v2 6 万条);二是本文的路线——在数据预算固定且远小于前者(7,500 条,比 RT-1 少 18 倍)的前提下,靠”数据增强”和”高效动作表示”两个杠杆挖掘泛化能力。方法论上直接合并了作者团队此前三条独立工作的思路:GenAug、CACTI 提供语义场景增强的雏形(但两者都需要人工 mask 或物体网格模板),斯坦福 aloha-act 提供 action chunking + CVAE 的策略骨干。论文明确对标 RT-1、CACTI、ROSIE(Scaling Robot Learning with Semantically Imagined Experience)等同期工作,强调自己的语义增强是全自动的——用 SegmentAnything 自动出 mask,不需要人工标注或物体三维模板。论文本体贡献是数据集(RoboSet)+ 策略架构(MT-ACT)+ 语义增强流水线三者的组合验证,因此归入 data 类。2023 年 9 月投 arXiv,后获 NeurIPS 2023 机器人学习工作坊 Outstanding Presentation Award,并被 ICRA 2024 接收。
模型架构
Policy backbone:MT-ACT(Multi-Task Action Chunking Transformer)= CVAE + Transformer。CVAE encoder 把一段动作序列编码为隐变量 z,用于隐式识别多峰动作分布中的模式;CVAE 的 decoder 就是以 z 为条件的 Transformer 策略本体(encoder 4 层 + decoder 7 层)。
ACTION 头:连续动作 + chunking——每个时间步预测未来 H=20 步(chunk size)的动作序列,而非单步动作;执行时对相邻时间步重叠预测的动作窗口做 temporal aggregation(加权平均),以获得平滑的时序一致行为、缓解模仿学习中的 covariate shift(沿用 aloha-act 的 ACT 设计,从单任务扩展到多任务)。
编码器与条件化:4 路相机视角(top / left / right 固定视角 + 1 个手腕相机,均为 RealSense D455)经 CNN 编码为图像 token;语言指令经预训练语言编码器得到固定 embedding T(维度 384,论文未进一步点名具体编码器型号);图像 token 与语言 embedding 通过 FiLM 层(Perez et al. 2018)做条件化调制,而非简单拼接——这样即便同一场景存在多个可行任务,策略也不会 task confusion。Transformer encoder 输入为 4 路图像 token + 机器人关节位姿 j_t + CVAE 隐变量 z + 语言 embedding T,decoder 输出当前时间步的动作 chunk。
动作空间:8 维——7 个关节角位置 + 1 维夹爪开合(joint-space 控制,非末端执行器笛卡尔位姿)。
Config(Table 3,论文披露的超参数):learning rate 1e-5,batch size 8,feedforward size 3200,attention heads 8,chunk size 20,dropout 0.1,transformer encoder 层数 4,decoder 层数 7,language embedding 维度 384。(注:GitHub 官方仓库 README 给出的示例训练命令用的是 batch_size 64、hidden_dim 512,与论文 Table 3 的 batch size 8 不一致——推测是仓库默认脚本示例参数而非论文实际训练用值,本页数值以论文 Table 3 为准。)
数据
RoboSet(MT-ACT)(用于训练 RoboAgent 的子集):7,500 条轨迹,人类遥操作采集(Oculus Quest 2 VR 手柄),历时 2 个月,横跨 4 个不同物理场地(厨房桌面场景),控制频率 5Hz,每条轨迹 40 个时间步,HDF5 格式存储。覆盖 12 个技能——Slide-Open、Slide-Close、Flap-Open、Flap-Close、Cap、Uncap、Pick、Place、Wipe、Plunge、Slide-in、Slide-out;38 个任务,归入 6 个高层活动(Heat Soup / Serve Soup / Baking Prep / Making Tea / Cleaning Up / Stow Bowl)。Pick-Place 类技能占数据量约 40%,同时刻意纳入 contact-rich 技能(Wipe、Cap)和铰接物体技能(Flap-Open、Flap-Close)以增加多样性。
RoboSet 全集(论文 Table 1,投稿时点 2023-09 的快照)含四个子集:RoboSet(MT-ACT) 7,500 条 / 38 任务 / 12 技能 / 10 场景(TeleOp);RoboSet(kitchen) 30,050 条 / 38 任务 / 12 技能 / 10 场景(TeleOp);RoboSet(bin) 70,000 条 / 10 任务 / 4 技能 / 1 场景(启发式脚本);RoboSet(full) 合计 98,050 条 / 48 任务 / 12 技能 / 11 场景(TeleOp + Heuristics)。(项目页面 robopen.github.io/roboset 后续快照给出的是 28,500 条——9,500 遥操作 + 19,000 kinesthetic——与论文脚注”9,500 遥操作 + 20,500 kinesthetic + 70,000 bin 启发式”的口径不完全一致,属于数据集持续更新导致的版本差异,本页以论文 Table 1 的固定数字为准。)
与同期开源数据集对比(论文 Table 1):BridgeData 33,200 条 / 72 任务 / 8 技能 / 10 场景;BC-Z 25,000 条 / 100 任务 / 9 技能;RoboTurk 2,100 条 / 3 技能 / 1 场景;Amazon Pick-Place 100,000 条(启发式,1 场景);RoboNet 162,000 条(启发式,2 本体 / 7 场景)。
语义数据增强:对每条轨迹的每一帧做两类自动增强——(1) 交互物体增强:用机器人正向运动学定位末端执行器位置,据此 prompt SegmentAnything 得到被操作物体的 mask,再用文本 prompt 做图像修复(inpainting)替换物体外观,并用 TrackAnything 在时间轴上保持替换结果一致;(2) 背景增强:用 SegmentAnything 随机挑选场景中不与机器人/交互物体重叠的背景物体做 mask 并修复其外观。全程全自动,不需要 CACTI 式的人工指定 mask,也不需要 GenAug 式的物体三维网格模板。消融显示每帧增强数量与 L2/L3 泛化性能正相关。
训练方法
两阶段流水线:(1) 离线语义增强——对 7,500 条真实轨迹逐帧做 SAM 自动分割 + 文本引导图像修复,把数据集在语义层面成倍扩容,全程离线完成、不产生额外机器人/人力成本;(2) MT-ACT 策略学习——用 CVAE 重建目标(KL 正则 + 动作重建)+ action chunking + FiLM 语言条件训练单一多任务策略(即 RoboAgent),训练 2000 个 epoch。
Baseline 对比:Single-Task ACT(每任务单独训练,近似 oracle 上限)、VIL(常规语言条件多任务视觉模仿学习)、CACTI(此前的多任务多场景增强框架)、RT-1(作者复现版,用 google-research/robotics_transformer 参考实现)、BeT(Behavior Transformer,魔改加语言条件后多任务训练,参考 notmahi/bet)。RT-1 复现超参(Table 4):lr 1e-4,离散动作 token 数 256,batch size 64,feedforward size 1024,attention heads 8,dropout 0.1,transformer 层数 6,language embedding 384。
Infra(训练 / 推理工程)
训练算力:单张消费级 RTX 2080Ti GPU,batch size 8,训练 2000 epoch 耗时约 48 小时——这是论文(Appendix B.2)披露的唯一算力数字,未披露具体 GPU-hours 总量、是否用多卡,也未披露数据增强阶段(SAM 分割 + inpainting + TrackAnything)的算力开销。
推理:机械臂闭环控制频率 5Hz(与数据采集帧率一致);未披露具体推理延迟或 FPS 数字。
硬件平台:Franka Emika Panda 机械臂 + 两指 Robotiq 夹爪(装有 Festo Adaptive Fingers),4 路 RealSense D455 相机(3 固定 + 1 手腕)。
评测 benchmark
摘要给出的核心结论:RoboAgent 在未见场景下平均比基线方法高 40% 以上,同时更样本高效。
L1 泛化(物体位姿/光照变化,主流模仿学习通用设定):MT-ACT 显著超过所有 baseline;RT-1 类逐步态预测方法在低数据量下表现差,BeT 类动作聚类方法在多技能场景下明显更差(无 具体数值表,仅图示对比)。
语义增强的相对增益(跨 L1/L2/L3;L2 = 新背景 + 干扰物,L3 = 未见技能-物体组合):对 L1 提升约 30%(相对),对 L2 提升约 100%(相对),对 L3 提升约 400%(相对)——增强收益随泛化难度上升而放大。
L4 强泛化(全新厨房环境,3 个任务):仅 MT-ACT 取得平均 25% 成功率;包括去掉语义增强的 MT-ACT 变体在内的所有其余方法均为 0%。
消融(Fig.10):
- FiLM vs 简单拼接语言条件:去掉 FiLM 后性能下降 5-10%。
- Chunk size {10, 20, 40}:20 最优;10 比 20 低 0-5%;40 比 20 低超过 20%(chunk 过长时策略难以纠错)。
- 每帧增强数量:越多越好,尤其在 L2/L3 上收益更显著。
- 鲁棒性测试:手动扰动场景、遮挡 1/2/3 个相机视角,20 次评测中平均约 70% 成功率。
- Plasticity(可塑性微调):用 50 条新任务(烤箱放吐司)轨迹、增强 4 倍至 250 条,混合原数据的 1/10 微调已训练好的 38 任务通用 policy——新任务可学会,且对原有 6 个 activity 性能无明显下降;L2/L3 上还略优于仅用新任务增强数据从头训练的单任务对照。
逐任务成功率(Table 5,universal policy 在 6 个 activity 下 28 个代表任务上的实测成功率):范围 40%(Pick Tea)到 100%(Cleaning Up 中的 Cap Lid),多数技能落在 70-90% 区间;抓取小型可变形物体(Pick Tea 40%、Pick Lid 50%)明显更难。(注:论文摘要/Fig.1 称系统覆盖 38 个任务,但 Table 5 仅逐一披露了 28 个任务的成功率数字,其余任务未在可读到的正文/附录表格中单独列出。)
创新点与影响
贡献:(1) 提出全自动(无需人工 mask / 物体模板)的语义数据增强流水线,把 SAM + 图像修复 + TrackAnything 接入机器人模仿学习的数据管线;(2) 把单任务的 ACT(action chunking + CVAE)成功扩展为多任务版本 MT-ACT,证明该架构在数据预算受限时显著优于逐步态动作预测(RT-1 类)或动作聚类(BeT 类)方法;(3) 开源 RoboSet——用商用硬件(Franka Panda)采集的、当时最大规模开源机器人数据集之一,推动后续研究复用低成本机械臂 + 语义增强这条路线。
作者自陈局限:(1) 所有任务都是独立技能,尚未探索技能自动组合完成长程任务;(2) 未探索语言泛化维度——直接使用预训练语言编码器给出的固定 embedding,未针对任务描述的措辞变化做适配。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2309.01918
- arXiv PDF:https://arxiv.org/pdf/2309.01918
- 项目主页(RoboAgent):https://robopen.github.io/
- 数据集主页(RoboSet):https://robopen.github.io/roboset/
- 代码:https://github.com/robopen/roboagent/
- 预训练权重(作者 HF 仓库):https://huggingface.co/jdvakil/RoboAgent
- 数据集镜像(作者 HF 仓库):https://huggingface.co/datasets/jdvakil/RoboSet-Teleoperation
一手源存档(sources/)
- roboagent-mt-act—project-page — RoboAgent 项目主页(架构图、生成结果图、媒体报道索引)
- roboagent-mt-act—roboset-page — RoboSet 数据集主页(数据构成、采集方式、HDF5 schema)
- roboagent-mt-act—github-readme — GitHub README(训练/评测命令、超参数 flag、权重与数据下载链接)
- arXiv 原文 PDF(2309.01918,不入 git):见上方 arXiv 链接