一句话定位
DexMimicGen 把 mimicgen 的”少量人类示范 → 物体中心子任务切分 → 刚体变换回放 → 只留成功轨迹”数据倍增流水线,从单臂平行爪扩展到双臂灵巧手(含人形机器人):引入并行/协同/顺序三类子任务分类与对应的异步执行、同步等待、顺序约束机制,在 3 种本体、9 个任务上从 60 条人类源示范生成 21K 条仿真示范,并通过 real-to-sim-to-real 流水线把 Can Sorting 任务迁移到真实 GR-1 人形机器人,成功率从 0% 提升到 90%。
背景与定位
范式属于”合成示范数据倍增”路线,直接建立在 mimicgen 之上。MimicGen 只处理单臂 + 平行爪场景,假设整条任务只有一个全局子任务序列;DexMimicGen 指出双臂灵巧操作打破了这个假设——两只手臂可能需要独立完成不同目标(并行子任务,如 Piece Assembly 里两臂各抓一个物体)、需要在关键时刻严格对齐(协同子任务,如 Box Cleanup 里两臂共同放置盒盖)、或者必须遵守先后顺序(顺序子任务,如 Pouring 里必须先倒球再移动碗)。论文的核心贡献就是把 MimicGen 的单一子任务分割扩展成”每臂独立分割 + 三种协调机制”的框架。
对比同期人形/双臂遥操作路线:bunny-visionpro、Open-TeleVision、h2o-human2humanoid、omnih2o、humanplus 等工作解决的是”如何把人类动作实时映射到人形机器人”的遥操作接口问题,靠人力现场采集数据;DexMimicGen 则是遥操作之后的”数据倍增”环节——先用这些遥操作接口(iPhone 遥操作、Apple Vision Pro + OmniH2O 手指重定向)采集少量源示范,再用仿真回放自动扩增。真机侧还借用了 diffusion-policy 做策略架构消融,并把生成的数据集应用到 bigym 这一独立的双臂移动操作基准上验证跨仿真框架的可迁移性;仿真任务本身构建在 robocasa 同源的 RoboSuite/MuJoCo 栈上。
模型架构
DexMimicGen 本身不是神经网络,是一条几何数据生成流水线;下游策略才是被训练的模型(与 MimicGen 一致)。
动作空间假设(沿用 MimicGen A1–A3):每条机械臂的动作 = 末端位姿指令(操作空间控制)+ 手部驱动指令(平行爪 1 维开合,或灵巧手 6 维关节指令)。
三类子任务与对应机制(论文核心设计):
- 并行子任务(Parallel Subtasks):两臂各自维护一个动作队列,子任务分割相互独立、允许不同时开始/结束;哪只手的队列空了就补入该臂下一子任务的变换轨迹,不要求两臂对齐。
- 协同子任务(Coordination Subtasks):要求两臂末端相对位姿在执行期间与源示范保持一致。做法是(1)两臂用同一个变换矩阵、(2)执行时用同步策略——哪只手先完成就等待另一只手,直到两臂剩余步数相同,从而让执行结束的时刻与子任务切分对齐。变换矩阵获取提供两种方案:Transform(用当前物体位姿与源示范物体位姿计算刚体变换 $T^{o_i’}_W(T^{o_i}_W)^{-1}$)和 Replay(直接重放源轨迹、不做变换,更适合交接/handover 这类需要保持运动学可行性的场景)。
- 顺序子任务(Sequential Subtasks):指定前置/后置子任务对,后置子任务所在的手臂必须等另一臂完成前置子任务才能继续执行(ordering constraint mechanism)。
手指动作:始终通过重放源示范里的手指关节动作生成(手指相对末端执行器的运动天然一致,不需要单独做刚体变换)。
3 种本体(embodiment)配置:
- 双臂 Panda + 平行爪(parallel-jaw gripper)
- 双臂 Panda + 灵巧手(dexterous hand)
- GR-1 人形 + 灵巧手
控制器:Panda 臂用 Operational Space Control(OSC),把 delta 末端位姿转成关节力矩;GR-1 人形用基于 mink 库实现的逆运动学(IK)控制器,把全局末端目标位姿转成机器人关节位置(用于处理双臂共享单一躯干这一运动学树的复杂性);手指统一用关节位置控制。
仿真栈:RoboSuite + MuJoCo 物理引擎。
遥操作系统(用于采集源示范):平行爪场景用 RoboTurk 提出的 iPhone 遥操作接口采集人类手腕与夹爪动作;灵巧手场景用 Apple Vision Pro(VisionProTeleop 软件)采集手腕与手指位姿,先做一次性人-机标定(固定姿势起始 + 自动计算相对变换矩阵,同时适配双臂 Panda 灵巧手与 GR-1 人形),手指位姿到机器人手指关节的重定向复用 OmniH2O 的重定向方法。
数据
- 源人类示范:平行爪任务每任务 10 条,灵巧手任务(含人形,因操作负担更大)每任务 5 条,9 个任务共计 60 条源示范。
- 生成规模:论文摘要与项目主页口径为总计生成 21K(摘要原文)/ “over 20,000”(项目页表述)条示范;主实验对每个任务各生成 1000 条用于策略训练与比较(9 任务 × 1000 = 9000,即 Table I 用的数据集),此外还有面向更广初始分布的 D1/D2 变体数据集、100/500/1000/5000 的规模消融数据集,以及应用到 BiGym 的额外数据集(见下)——这些合计构成摘要里的 21K,但论文正文没有逐项列出各子集的确切条数拆分,此处不强行拼总数。
- 9 个仿真任务(RoboSuite/MuJoCo,3 种本体各 3 个任务):Piece Assembly、Threading、Transport、Box Cleanup、Drawer Cleanup、Tray Lift、Pouring、Coffee、Can Sorting。覆盖高精度操作(Threading、Piece Assembly、Box Packing、Coffee)、铰接物体操作(Drawer)、长时程任务(Transport);部分任务需要协同(Threading、Transport、Box Packing、Tray Lift、Can Sorting),部分需要顺序执行(Piece Assembly、Drawer Cleanup、Pouring、Coffee)。具体哪 3 个任务对应哪种本体,论文仅在 Fig. 4 中以图示给出,正文未用文字逐一标注。
- 初始分布变体:与 MimicGen 一样,部分任务额外定义了更广的重置分布 D1、D2(如 Pouring 的 D1 扩大物体初始范围,D2 交换碗与绿垫的重置位置)。
- 跨基准迁移:把 DexMimicGen 应用到 bigym(另一个人形移动双臂基准)的 3 个任务(FlipCup、DishwasherLoadPlates、CupBoardsCloseAll),各生成 1000 条目标示范,数据生成成功率分别为 29.1%、43.6%、76.4%。
- 真实世界数据:Can Sorting 任务先采集 4 条真机源示范,在与真实场景对齐的数字孪生(digital twin,物体位姿由头戴相机 RGB-D + GroundingDINO 分割估计)中用 DexMimicGen 生成新示范、仿真中验证成功后再把动作序列发送到真机执行,共生成 40 条真实世界成功示范。
- 数据格式与获取:HDF5;官方数据集通过 HuggingFace
MimicGen/dexmimicgen_datasets发布,数据集页标注许可为 CC-BY-NC-SA 4.0,但 GitHub README 又写”数据集以 CC-BY 4.0 发布”,两处许可表述不一致,未核实哪个是准确版本。
训练方法
- 数据生成算法(继承并扩展 MimicGen):先对每条源示范按每臂独立切分成物体中心子任务段;生成新示范时,随机化场景、选一条源示范,再对每个子任务按其类型(并行/协同/顺序)分别用对应机制生成并执行动作序列;执行完全部子任务后检查任务是否成功,只保留成功轨迹,失败的丢弃、重复该过程直到生成足量数据——是在线生成、物理一致的方式,而非离线数据增强。
- 下游策略学习:用生成的数据集训练三种基于图像观测的行为克隆(Behavioral Cloning)视觉运动策略:BC-RNN、BC-RNN-GMM(带高斯混合动作头)、Diffusion Policy(DP);每个实验跑 3 个随机种子,取每个种子的最大成功率(与 MimicGen/RoboMimic 的评测流程一致)。
- 真实世界的 real-to-sim-to-real 流水线:头戴相机拍摄 RGB-D 帧,用 GroundingDINO 分割目标物体的 RGB mask、以 mask 内深度均值估计物体真实世界 x/y 坐标,据此初始化仿真数字孪生中的物体位姿;在数字孪生中用 DexMimicGen 生成新示范并在仿真里验证安全/成功后,才把动作序列发送到真机执行;最终用 Diffusion Policy 在 40 条生成示范上训练真机视觉运动策略。
Infra(训练 / 推理工程)
- 仿真硬件/软件栈:RoboSuite + MuJoCo;数据生成所用 GPU 型号/数量、生成吞吐量(条/秒)、策略训练所用 GPU 型号与卡时,论文均未披露。
- 真实机器人硬件:Fourier GR1 人形机器人 + 2 个 6 自由度 Inspire 灵巧手;视觉传感器为 2 个 Intel RealSense D435i(一个头戴第一人称视角,一个第三人称正面视角)。
- 控制频率 / 推理时延 / FPS:论文正文未给出具体数值,未披露。
评测 benchmark
Table I — 源示范 vs DexMimicGen(1000 条/任务)数据集训练出的图像策略成功率(3 seed,数值为均值±标准差 %):
| 任务 | Source-Demo DP | BC-RNN-GMM | BC-RNN | DP |
|---|---|---|---|---|
| Piece Assembly | 3.3±0.9 | 74.0±2.8 | 74.7±2.5 | 80.7±0.9 |
| Threading | 1.3±0.9 | 54.0±4.3 | 55.3±5.0 | 69.3±1.9 |
| Transport | 52.7±7.7 | 64.0±3.3 | 60.0±0.0 | 83.3±0.9 |
| Box Cleanup | 62.0±1.6 | 64.0±10.0 | 96.7±2.5 | 92.0±4.3 |
| Drawer Cleanup | 0.7±0.9 | 30.7±5.0 | 56.7±4.1 | 76.0±0.0 |
| Tray Lift | 3.3±0.9 | 66.0±8.2 | 75.3±7.5 | 88.7±0.9 |
| Pouring | 0.7±0.9 | 74.0±8.6 | 86.0±3.3 | 79.3±0.9 |
| Coffee | 14.7±0.9 | 12.0±1.6 | 73.3±12.3 | 77.3±0.9 |
| Can Sorting | 0.7±0.9 | 75.3±1.9 | 96.0±1.6 | 97.3±0.9 |
粗体为该任务最佳架构;DexMimicGen 数据集训练的策略在全部 9 个任务上都显著优于只用源示范训练,例如 Drawer Cleanup 从 0.7% 升到 76.0%、Threading 从 1.3% 升到 69.3%、Piece Assembly 从 3.3% 升到 80.7%。
更广初始分布(Table II,用同分布评测):Piece Assembly(BC-RNN-GMM)D0 74.0±2.8 → D1 67.3±0.9 → D2 44.0±3.3;Box Cleanup(BC-RNN)D0 96.7±2.5 → D1 88.0±5.9 → D2 78.7±2.5;Pouring(DP)D0 79.3±0.9 → D1 82.0±2.0 → D2 71.3±2.5。
对比 Demo-Noise 基线(Table III,对源示范加动作噪声重放):Piece Assembly(BC-RNN+GMM)12.7±3.4 vs DexMimicGen 74.0±2.8;Tray Lift(BC-RNN)16.7±2.5 vs 75.3±7.5;Pouring(DP)26.7±2.5 vs 79.3±0.9——论文称 DexMimicGen 在所有任务上比 Demo-Noise 基线高出 58% 以上,且 Demo-Noise 无法在 D1/D2 上生成结果(只能重放源示范的初始配置)。
数据规模消融:在 100/500/1000/5000 条生成示范上训练策略,100→500→1000 有明显提升,但 1000→5000 在部分任务上出现收益递减(具体曲线数值见论文 Figure 5,正文未给出数值表,此处不编造)。
协同子任务方案对比(Replay vs Transform):Transport(BC-RNN+GMM,handover 协同)Replay 63.3% vs Transform 46.0%,Replay 明显更优;Can Sorting(Diffusion Policy)Replay 97.3% vs Transform 98.6%,两者相当——因此 Replay 是论文对 handover 类协同子任务的默认选择。
顺序子任务约束消融:Drawer Cleanup(BC-RNN)加顺序约束 50.7% vs 不加 48.0%,两臂用同一条源示范(天然满足顺序、无需约束)56.7%;Pouring(DP)加约束 88.7% vs 不加 76.7%,同源示范 79.3%——带顺序约束的双源示范设置始终优于不带约束的设置。
跨基准迁移(BiGym):FlipCup / DishwasherLoadPlates / CupBoardsCloseAll 的数据生成成功率分别为 29.1% / 43.6% / 76.4%(各 1000 条目标生成量),下游策略成功率论文没有给出数值表,只在项目页展示了可视化演示。
真实世界(Can Sorting,Fourier GR1):用 40 条 DexMimicGen 生成的真机示范训练 Diffusion Policy,红/蓝杯各跑 10 次试验,成功率 90%;只用 4 条源示范训练的策略成功率 0%。
创新点与影响
- 贡献:把 MimicGen「单一子任务序列」的假设,拆解为并行/协同/顺序三类子任务及各自的执行机制(跨臂异步动作队列、同步等待、顺序约束),使示范倍增方法首次系统性覆盖双臂(含灵巧手、含人形)协调场景;开源 9 个跨 3 种本体的仿真环境与对应数据集,并验证了对 BiGym 这一独立基准的可迁移性;给出一条完整的 real-to-sim-to-real 流水线,把仿真生成的数据直接迁移到真实人形机器人任务并取得 90% 成功率(源示范策略为 0%)。
- 对社区的影响:为双臂灵巧/人形操作的模仿学习研究提供了低成本(60 条源示范起步)获取大规模训练数据的标准工具与基准环境,后续人形操作/协同抓取研究可直接复用其环境与数据集,省去自建遥操作与数据采集流水线的成本。
- 论文自陈局限:(1)数据规模消融显示 1000→5000 条并非所有任务都能持续提升,收益递减程度因任务而异,倍增规模需要按任务调整而非一味加大;(2)Replay 与 Transform 两种协同变换方案孰优依任务而定(Transport 上 Replay 明显更好,Can Sorting 上二者相当),没有一个方案能通用地最优;(3)灵巧手任务上 BC-RNN-GMM 普遍不如 BC-RNN 和 Diffusion Policy,与 RoboMimic 研究里”GMM 头有益”的结论相反,论文指出这提示模仿学习架构选择在双臂灵巧操作场景下可能需要重新审视,但未深入解释原因;(4)论文未披露数据生成的计算成本(GPU 卡时、生成吞吐量)与真机控制频率/时延,可复现性上留有空白。
原始链接
- arXiv: https://arxiv.org/abs/2410.24185
- arXiv PDF: https://arxiv.org/pdf/2410.24185
- GitHub(官方代码/环境): https://github.com/NVlabs/dexmimicgen
- 项目主页: https://dexmimicgen.github.io/
- HuggingFace 数据集: https://huggingface.co/datasets/MimicGen/dexmimicgen_datasets
- ICRA 2025
一手源存档(sources/)
- dexmimicgen—github-readme — GitHub README 快照(安装、数据集下载/回放脚本、robomimic 训练复现流程、许可、bibtex)
- dexmimicgen—project-page — dexmimicgen.github.io 项目页快照(各任务策略成功率标注、D0/D1/D2 与 BiGym 可视化说明)
- dexmimicgen—hf-card — HuggingFace 数据集卡快照(许可、任务分类)
- arXiv 原文 PDF(2410.24185),不入 git,见上方 arXiv 链接