一句话定位

RoboTwin 2.0 把 robotwin(RoboTwin 1.0,CVPR 2025 Highlight)从”14 个任务的数字孪生基准”扩成”可自动扩产的双臂操作数据生成器”:用 DeepSeek-V3(代码生成 agent)+ moonshot-v1-32k-vision-preview(多模态观察 agent)组成的仿真闭环反馈流水线自动合成专家轨迹代码,配合五轴域随机化(杂物 clutter、光照、背景/桌面材质、桌面高度、语言指令)与逐本体的 grasp 适配,在 731 件物体(147 类)资产库 RoboTwin-OD 上跑出 50 个双臂任务 × 5 种机械臂本体,预采集超 10 万条轨迹。代码生成成功率较 1.0 版提升 10.9 个百分点;RDT 微调后在”未见场景+杂乱”真机测试上,10 条真机 demo + 1000 条合成数据相对仅 10 条真机 demo 取得 367% 相对提升(42.0% vs 9.0%),纯合成数据零样本训练也取得 228% 相对增益(29.5% vs 9.0%)。

背景与定位

仿真数据合成是弥补真机遥操数据”贵、慢、难覆盖”这一瓶颈的主流路线,但作者指出既有流水线(包括其前作 RoboTwin 1.0 与 GraspVLA 等)有三点系统性短板:(1) 缺乏专家级质检闭环,生成轨迹常带执行失败/次优抓取;(2) 域随机化流于表面,场景过于干净同质,缺少真实世界的杂物、光照变化、模糊语言指令;(3) 忽视跨本体差异——不同双臂平台的运动学能力与抓取策略差异很大(低自由度 Piper 依赖侧向抓取,高自由度 Franka 可用顶向精确抓取),但既有合成数据很少编码这种 embodiment-specific affordance。

RoboTwin 2.0 的方法论延续同一作者组此前 RoboCodeX、RoboScript 等”LLM/MLLM 生成机器人可执行代码”的路线,并把它工程化成一个带仿真闭环反馈的自我修正系统。相较 liberocalvinmaniskill2 等固定任务集基准,RoboTwin 2.0 强调任务/资产/轨迹的自动化可扩展生成;相较 agibot-world-colosseoopen-x-embodiment 等真机采集数据集,RoboTwin 2.0 走纯仿真+强域随机化路线,定位为 rdt-1bpi0graspvla 等 VLA 基座模型的预训练/微调数据源与统一评测平台。物理与渲染引擎沿用 RoboTwin 1.0 所依赖的 SAPIEN(Vulkan 渲染),跨本体运动规划改用 GPU 加速的 cuRobo

模型架构

RoboTwin 2.0 本身不是一个可学习的策略模型,而是”资产库 + 自动代码生成流水线 + 域随机化引擎 + embodiment 适配层 + 基线策略评测”的完整框架:

  • RoboTwin-OD 资产标注:每个物体标注 placement point(放置点)、functional point(功能点)、grasping point(抓取点)与 grasp axis 方向,显式编码物体可供性(affordance);每个物体额外生成 15 条语言描述(覆盖已见/未见描述粒度)。
  • 专家代码生成闭环(两个 AI agent):code-generation agent 用 DeepSeek-V3 做程序合成,以任务名+自然语言目标、通用 API 列表、few-shot 函数调用示例、层级约束规范为输入生成 Python 控制代码;VLM observer 用 moonshot-v1-32k-vision-preview(Kimi 视觉模型)逐帧检查执行录像,定位失败发生的时间点并诊断失败是逻辑错误/API 误用/系统性问题。每轮迭代生成的代码在仿真中执行 10 次,统计成功率与失败原因日志;code-gen agent 融合”量化执行日志 + VLM 定位诊断”两路反馈重写代码。终止条件:单轮 10 次执行成功率超过 50%,或连续 5 轮仍未达标则强制终止。
  • Embodiment-aware grasp adaptation:对每个物体生成一组跨抓取轴/接近方向的候选抓取,结合偏好操作方向、随机位姿扰动、并行化运动规划尝试(底层调用 cuRoboGPU 运动规划器),并对高可达性方向做角度扰动扩展可行抓取姿态空间,专门缓解低自由度机械臂(如 Piper)的规划受限问题。
  • 本体支持:object-centric、embodiment-agnostic 设计,当前支持 Franka、Piper、UR5、ARX-X5、Aloha-AgileX 共 5 种机械臂 + Panda gripper / WSG gripper 等多种夹爪,支持任意双臂异构组合与相对臂位配置。
  • 基线策略(评测用,非本文提出):ACT、Diffusion Policy(DP)、DP3、rdt-1b(RDT)、pi0(Pi0)。

数据

  • RoboTwin-OD 物体库:731 个实例 / 147 类别,其中 534 实例(111 类)经 Rodin 平台 RGB→3D 重建+凸分解+网格合并自建;153 个物体(27 类)取自 Objaverse;44 个关节物体(9 类)取自 SAPIEN PartNet-Mobility。Objaverse 物体额外用于丰富杂乱场景中干扰物的视觉/语义多样性。
  • 背景/桌面材质库:LLM + 网络爬取收集 1,000 条真实表面外观文本提示 → Stable Diffusion v2 按每条提示生成 20 张材质样本(共 2 万候选)→ 人工在环筛选 → 净化为 12,000 张高质量材质。
  • 任务规模:50 个双臂协作任务,覆盖 5 种机械臂本体。
  • 预采集轨迹数据集:超过 100,000 条双臂操作轨迹,覆盖 50 任务 × 5 本体;每个 task-embodiment 组合提供 100 条 clean(非随机化)+ 400 条域随机化轨迹(合计 500/组合)。
  • 域随机化五轴的具体设定:(1) clutter——基于碰撞体积做碰撞感知放置,并按 RoboTwin-OD 标注的类内相似度组限制干扰物与任务物体的视觉/语义混淆;(2) 光照——随机化光源颜色、类型(点光/面光)、强度、数量与位置;(3) 背景/桌面材质——从 12k 材质库采样;(4) 桌面高度——均匀随机采样,Appendix C 给出变化幅度上限 3 cm;(5) 语言指令——60 条任务指令模板(50 训练/10 评估)与 15 条物体描述(12 训练/3 评估)组合式采样,一个物体的 episode 数 = 任务指令数 × 物体描述数。
  • 真机迁移的姿态扰动:sim-to-real 实验中对模拟物体/机器人位姿施加随机 3D 空间扰动,总位移量上限 1 cm,用于对齐真实抖动与标定误差。
  • 消融数据子集:策略鲁棒性消融单独采集 9,600 条轨迹(32 任务 × 300 条/任务),分别在”RoboTwin 2.0 域随机化”与”RoboTwin 1.0(即 RoboTwin 2.0 关闭随机化)“两种设定下独立采集。

训练方法

本文核心贡献是数据生成方法而非某个可训练模型,训练相关内容分两部分:

  • 代码生成闭环的”训练”实为推理时迭代修正:初始程序由 DeepSeek-V3 一次性合成(Vanilla);FB 设定引入执行日志反馈迭代修正;MM FB 设定进一步引入 moonshot-v1-32k-vision-preview 的多模态诊断反馈。
  • Grasp 候选生成:偏好操作方向 + 随机位姿扰动 + cuRobo 并行运动规划尝试 + 面向高可达性方向的角度扰动,共同构成 embodiment-aware 的候选抓取空间。
  • 下游策略训练超参(Appendix D,用于评测/消融的基线策略,非 RoboTwin 自身训练):
    • RDT:预训练 100,000 步,batch size 16/GPU × 8 GPU;随后微调 10,000 步,batch size 16/GPU × 4 GPU。
    • Pi0:预训练 100,000 步,batch size 32;微调 30,000 步,同 batch size。
    • ACT:chunk size 50,batch size 8,单 GPU 训练 6,000 步;部署时用 temporal_agg 做时序聚合。
    • DP:600 步,batch size 128,规划视野 8。
    • DP3:3,000 步,batch size 256,规划视野 8,点云分辨率 1,024。

Infra(训练 / 推理工程)

  • 仿真/渲染引擎:SAPIEN(Vulkan 渲染,需 GPU + Vulkan 驱动,官方文档明确安装依赖 libvulkan1 mesa-vulkan-drivers vulkan-tools)。
  • 跨本体运动规划:cuRobo(GPU 加速运动规划器),用于在不同机械臂运动学约束下求解高成功率轨迹。
  • 代码生成 MLLM 调用方式:DeepSeek-V3(程序合成)+ moonshot-v1-32k-vision-preview(多模态错误定位/校验),均走 API 调用,论文未披露对应的 GPU 卡时/推理延迟。
  • 下游策略训练卡数:仅 RDT 披露卡数(预训练 8 GPU、微调 4 GPU,未披露具体 GPU 型号与总卡时);Pi0/ACT/DP/DP3 训练 GPU 规模未披露。
  • 推理 FPS / 控制频率 / 边缘硬件:未披露。

评测 benchmark

论文给出四组独立实验,均为原文实测数据:

  1. 代码生成自动化评测(10 个任务,10 候选程序 × 10 次执行):ASR(平均成功率)从 R1.0 Vanilla 47.4% 提升到 R1.0+FB 60.4%、R1.0+MM FB 63.9%;R2.0 Vanilla 62.1%、R2.0+FB 66.7%、R2.0+MM FB 71.3%(摘要口径”10.9% 提升”)。R2.0 收敛更快:MM FB 设定下平均迭代数 R1.0 为 2.42 轮、R2.0 为 1.76 轮;Vanilla 设定下 token 开销 R1.0 为 1236.6、R2.0 仅 569.4。R2.0+MM FB 全 50 任务平均成功率 43.34%,Open Laptop/Shake Bottle 等关节物体/动态交互任务为 0%。
  2. Embodiment-aware 抓取消融(50 任务 × 5 本体,对比有/无抓取适配):平均成功率 RoboTwin 1.0 52.2% → RoboTwin 2.0 60.5%(+8.3%);低自由度平台增益显著——Piper 2.4%→25.1%(+22.7%)、Aloha-AgileX 65.1%→78.8%(+13.7%)、ARX-X5 68.6%→74.2%(+5.6%);高自由度 Franka(-0.1%)、UR5(-0.5%)基本持平。Appendix H 给出全部 50 任务 × 5 本体的逐任务成功率表。
  3. 域随机化对策略鲁棒性的影响(9,600 条轨迹 / 32 任务,RDT 微调 10,000 步、Pi0 微调 30,000 步,评测 5 个未见任务共 50 条真机 clean 演示):RDT 基线 14.8% → +R1.0 数据 16.6% → +R2.0 数据 25.4%(较基线绝对 +10.6%,相对 +71.6%);Pi0 基线 21.0% → +R1.0 20.6% → +R2.0 29.8%(绝对 +8.8%,相对 +41.9%);ACT/DP 无预训练版本均为 0.0%。
  4. 真机 sim-to-real 迁移(4 个双臂任务:Stack Bowls、Handover Block、Pick Bottle、Click Bell,RDT 骨干,COBOT-Magic 平台,4 种测试条件 × 3 种训练设定):加入 1,000 条 RoboTwin 2.0 合成轨迹后,4 种测试条件成功率分别提升 +13.5%(seen/clean)、+27.5%(seen/cluttered)、+23.5%(unseen/clean)、+33.0%(unseen/cluttered:9.0%→42.0%,即摘要 367% 相对提升的来源);纯合成数据零样本训练在 unseen/clean 达 36.5%(+21.0%)、unseen/cluttered 达 29.5%(+20.5%,即摘要 228% 相对增益的来源)。
  5. RoboTwin 2.0 基准榜单(全部 50 任务,Aloha AgileX 本体,每任务 50 条 clean 演示训练,100 次 rollout 评测 Easy/Hard 两档):平均成功率 ACT 9.4%/2.0%、DP 35.1%/1.4%、DP3 31.8%/2.2%、RDT 47.8%/19.6%、Pi0 64.9%/24.6%(Hard 相对 Easy 分别下降 28.2 与 40.3 个百分点,显示预训练 VLA 在域偏移下仍有明显退化)。

对照实验(Appendix B):与 Meta-World(50 任务,无域随机化/无自动生成/不支持 VLA 训练评测)、RoboCasa(25 任务,有 DR 但无自动生成)、ManiSkill2(20 任务,无 DR)、RoboTwin 1.0(14 任务,无 DR)相比,RoboTwin 2.0 是唯一同时满足 50 任务规模 + 域随机化 + 自动数据生成 + VLA 训练评测四项的基准。

创新点与影响

  • 贡献:(1) 首个把 MLLM 程序合成与仿真闭环反馈结合的自动化专家数据生成框架,显著降低人工工程量;(2) 系统性的五轴域随机化方案(clutter/lighting/background/tabletop-height/language),并给出量化的策略鲁棒性收益;(3) embodiment-aware 抓取适配机制,专门解决低自由度平台的规划受限问题;(4) 开源 RoboTwin-OD 资产库、10 万+ 域随机化轨迹数据集、50 任务基准与排行榜。
  • 生态影响(GitHub changelog 记录,晚于论文发表):已被 StarVLA(VLA 开发代码库)采用;新增 IsaacLab-Arena 分支与 RLinf(强化学习框架)支持;2026-03 衍生出建立在 RoboTwin 2.0 之上的记忆依赖操作基准 RMBench。
  • 论文自陈局限:代码生成在关节物体(如 Open Laptop)、精确位姿约束、动态交互类任务上仍为 0% 成功率,反映当前动作抽象与多模态记忆不足以处理这类任务;真机验证仅覆盖 4 个任务;结论部分明确把”真实世界部署”与”多物体任务复杂度”列为未来工作方向,暗示当前版本在这两方面仍有限。

原始链接

一手源存档(sources/)

  • robotwin-2—github-readme — GitHub README 快照(sources/embodied/2025/robotwin-2—github-readme.md)
  • robotwin-2—project-page — 项目主页摘要/结论快照(sources/embodied/2025/robotwin-2—project-page.md)
  • robotwin-2—doc-install — 官方文档安装页节选,确认仿真引擎为 SAPIEN(sources/embodied/2025/robotwin-2—doc-install.md)
  • arXiv 原文 PDF(2506.18088),不入 git