一句话定位
RoboTwin 是港大(HKU)联合 AgileX Robotics、上海人工智能实验室等提出的双臂机器人操作基准:用 3D 生成基础模型(Deemos Rodin)+ GPT-4V/LLM 从单张 2D 图片自动生成多样化数字孪生资产,再用 LLM 结合空间标注自动生成可执行的专家轨迹代码,覆盖 15 个双臂协作任务;仿真预训练 + 20 条真机数据微调,可将单臂任务真机成功率从 1.2% 提升到 72%、双臂任务从 20% 提升到 62%。CVPR 2025 Highlight(前身是 ECCV 2024 workshop 最佳论文 arXiv:2409.02920,后续该团队演进为更大规模的 RoboTwin 2.0,arXiv:2506.18088)。
背景与定位
本文的问题定位是双臂协作操作长期缺乏”多样、高质量示教数据 + 真实对齐评测基准”。相较人工遥操(昂贵、难扩展)与传统仿真轨迹生成器(依赖任务特定手工设计),以及 mimicgen、robocasa 依赖固定 3D 资产、只能在预定义场景内做数据增广的局限,RoboTwin 走”generative digital twin”路线:从单张真实 2D 图片直接生成新的 3D 资产实例,配合 LLM 做任务分解与空间约束推理,自动生成专家级双臂操作代码。相较 PerAct2(分离双臂 bimanual benchmark)、humanoidbench、bigym(依赖 VR 遥操、扩展性受限于人工采集),RoboTwin 强调”自动化 + 可扩展 + sim-real 对齐”的双臂协作数据/评测闭环。物理引擎基于 maniskill3(ManiSkill3,基于 SAPIEN 的 GPU 并行仿真)。本文是 RoboTwin 系列的正式版(CVPR 2025 Highlight),前身是 2024 年 ECCV workshop 最佳论文 early version(arXiv:2409.02920,任务与流程更简化);该团队后续把框架进一步扩展为 RoboTwin 2.0(arXiv:2506.18088,更强域随机化与更大规模数据集),属于本文之后的独立后续工作,不在本页讨论范围内。
模型架构
RoboTwin 本身不是一个学习模型,而是”仿真本体 + 数字孪生资产生成 pipeline + 专家轨迹代码生成框架 + 基线策略”的完整基准套件。
- 3D 资产生成 pipeline:GPT-4V 分析真实物体的 2D 图片生成文字描述 → LLM 改写生成多样但类别一致的描述变体 → SDXL-Turbo 依描述生成一批多样化的 2D 图像 → Deemos Rodin(image-conditioned 3D 生成模型)把每张 2D 图转成含几何、法线、贴图的完整 3D 资产。资产质量用 UCLIP-I 相似度做定量筛选 + GPT-4V 做定性视觉校验,未达标的资产自动进入重生成流程;GPT-4V 还负责为资产分类材质并分配物理参数(±5% 随机扰动增强物理鲁棒性)。
- 空间标注框架:为每类工具标注 2 类关键点(Point for Function 功能点、Point for Contact 接触点)与 3 条轴(Function Axis 功能轴、Approach Axis 接近轴、Lateral Axis 侧向轴);同类不同实例间通过 Stable Diffusion 编码器做扩散特征点匹配(feature point matching)迁移标注,避免逐实例重复标注。
- 专家轨迹代码生成:LLM 先做任务分解(Task Decomposition)→ 逐子任务做空间/时间约束推理(Constraint Inference)→ 调用预定义 API 生成行为代码;底层用 MPlib 轨迹优化库 + screw motion planner 求解满足运动学约束
Tee = fFK(θ(t))、位置对齐Pee = Po − d·a⃗o、朝向对齐n⃗ee = a⃗o、避碰θ(t) ∈ C的最优关节轨迹 θ(t);执行报错、轨迹规划失败或终态偏差会被反馈给 LLM 做自我纠错迭代(Iterative Refinement),直至通过成功评估。 - 机器人本体:开源 Cobot Magic(AgileX)平台——4 条机械臂(左右各 1 master + 1 puppet)+ Tracer AGV 底盘 + 4 个 Intel RealSense D-435 RGBD 相机(前部高位 1 个广角、双臂腕部各 1 个、底部备用 1 个可选),front/left/right 三相机以 30Hz 同步采集。
- 基线策略架构(非 RoboTwin 自身贡献,用于跑基准评测):2D Diffusion Policy(DP)与 3D Diffusion Policy(DP3,XYZ 及 XYZ+RGB 两种点云输入变体),均为条件去噪扩散视觉运动策略。
数据
- 任务规模:全套 15 个双臂协作任务,其中 Table 5 详细列出 14 个(Table 1 仿真基准也覆盖这 14 个),另有一个 Sweep Ball/Block Sweep 任务未列入 Table 5 描述表,但用于真机双臂评测(Table 3)。任务涵盖单臂/双臂混合任务(如 Container Place、Empty Cup Place 按物体初始位置自动选臂)、需要双臂交接的任务(Block Handover、Mug Hanging)、需要双臂避碰精细协调的任务(Shoe Place、Dual Shoes Place——两臂需在鞋盒有限空间内协调摆放一双鞋)。所有任务目标物体初始位置/姿态随机,场景加载前先做机械动力学可行性检查。
- 每任务数据量:预采集 100 组仿真数据 + 20 组真机数据;真机硬件设置与仿真严格对齐。每帧包含 3 个相机(前/左腕/右腕)各自的 RGB+Depth 图像,另提供由深度图转换的点云与彩色点云,以及主从(master/slave)双臂的关节角与末端位姿。
- 物体多样性:如 Dual Bottles Pick / Diverse Bottles Pick 任务中,可乐瓶、雪碧瓶、矿泉水瓶等多种瓶型均由真实 2D 图片经上述 pipeline 生成为不同 3D 实例;场景中物体尺寸也在一定阈值内随机化。
- 观测规格:2D 观测图像分辨率 320×240;3D 观测点云通过 FPS(最远点采样)下采样至 1024 点。
- sim2real 混合规模:单臂/双臂 sim2real 实验统一采用”300 条仿真数据预训练 + 20 条真机数据微调”的组合;300 这一仿真数据量是通过 Fig. 7 的数据规模扫描——对比 20/50/100/150/300 条纯真机数据的表现——确定为与 300 条纯真机数据性能相当的等效点后选出。
- 无跨具身(cross-embodiment)数据混合,全部真机数据来自同一 Cobot Magic 平台。
训练方法
- 目标:模仿学习(行为克隆变体,Diffusion Policy 系),不涉及在线 RL。
- 专家数据生成三阶段流程:① 空间约束推理 → ② LLM 代码生成(调用 MPlib 优化库生成可执行代码)→ ③ 执行校验;执行失败时把错误信息、原任务描述、物体标注、旧版代码一并反馈给 LLM 重新生成,循环至通过。
- 策略训练超参(Table 6,DP 与 DP3 均直接沿用各自原论文默认设置):两者 horizon=8、n_obs_steps=3、n_action_steps=6;DP 的 num_inference_steps=100、batch=128、300 epoch;DP3 的 num_inference_steps=10、batch=256(8 workers)、3000 epoch;均用 AdamW(lr 1e-4, betas [0.95, 0.999], eps 1e-8, weight decay 1e-6)+ cosine 学习率调度(warmup 500 步)+ EMA。
- sim2real 两阶段训练:Step 1 用 300 条仿真数据预训练 Diffusion Policy 网络;Step 2 用 20 条真机数据微调(真机图像预先做亮度增强
cv2.convertScaleAbs(src, alpha=1.5, beta=0),以缩小 sim-real 视觉域差)。 - 未使用蒸馏;动作表示为连续(continuous)末端位姿轨迹序列,非离散 token。
Infra(训练 / 推理工程)
- 仿真引擎:maniskill3(ManiSkill3,基于 SAPIEN 的 GPU 加速并行仿真与数据采集),论文未披露具体仿真 FPS 或并行环境数量。
- 真机采集频率:前/左/右三相机同步 30Hz。
- 训练 GPU 型号/数量、GPU-hours:论文正文与附录均未披露(仅致谢 D-Robotics 提供云计算资源支持,无具体规格)。
- 推理/控制频率、真机部署延迟:未披露具体 Hz 数值。
- 算力/生成支持方:D-Robotics(云计算资源)、Deemos(3D 生成模型 Rodin)。
评测 benchmark
仿真基准(Table 1,D435 相机设定,14 个任务 × DP3(XYZ) / DP3(XYZ+RGB) / DP,20/50/100 条示教,3 个随机种子,成功率 % ± std):
| 任务 | 算法 | 20 条 | 50 条 | 100 条 |
|---|---|---|---|---|
| Block Handover | DP3 (XYZ+RGB) | 86.0±1.0 | 94.0±0.0 | 85.3±14.5 |
| Dual Bottles Pick (Easy) | DP | 1.7±0.6 | 38.3±6.7 | 85.7±6.7 |
| Empty Cup Place | DP | 0.0±0.0 | 25.0±2.6 | 87.7±0.6 |
| Diverse Bottles Pick | DP3 (XYZ) | 11.3±2.1 | 32.3±10.1 | 37.0±10.0 |
| Dual Shoes Place(最难任务) | DP3 (XYZ) | 4.0±1.0 | 7.7±2.1 | 12.0±1.7 |
论文自述发现:① DP3 在少样本(20 条)下普遍领先(几何先验强),但样本增至 100 条时提升有限甚至下降;② DP 反而随数据增多显著提升,在 Dual Bottles Pick (Easy) 上从 20 条的 1.7±0.6% 提升到 100 条的 85.7±6.7%,反超同设定 DP3;③ RGB 与点云融合(DP3 XYZ+RGB vs XYZ)收益不稳定——在 Pick Apple Messy 等杂乱场景大幅提升,但在 Container Place 等任务反而下降;④ Dual Shoes Place(需双臂在鞋盒内高精度协调)是全部方法、全部数据量下成功率最低的任务(均 <15%),凸显现有模仿学习算法在复杂双臂协调上的短板。附录 Table 4 报告了同一组基线在 L515 相机设定下的重复实验,结论一致。
代码生成成功率以 Fig. 5 的图表形式报告了各任务的 LLM 专家代码执行成功率(正文未给出可引用的聚合文字数字,仅有可视化图)。
真机单臂评测(Table 2,5 个任务各 50 次试验,随机初始物体位置/姿态):
| 任务 | 20 条真机 | 300 仿真 + 20 条真机 |
|---|---|---|
| Bottle Pick (Easy) | 0/50 | 42/50 |
| Bottle Pick (Hard) | 0/50 | 16/50 |
| Container Place | 0/50 | 49/50 |
| Cup Place | 1/50 | 39/50 |
| Hammer Beat | 2/50 | 37/50 |
| 平均 | 1.2% | 72% |
真机双臂评测(Table 3,5 个任务各 50 次试验):
| 任务 | 20 条真机 | 300 仿真 + 20 条真机 |
|---|---|---|
| Dual Bottle Pick (Easy) | 0/50 | 31/50 |
| Dual Bottle Pick (Hard) | 0/50 | 11/50 |
| Container Place | 25/50 | 44/50 |
| Cup Place | 0/50 | 26/50 |
| Sweep Ball | 25/50 | 43/50 |
| 平均 | 20% | 62% |
单臂平均提升 72%−1.2%≈70.8 个百分点,双臂平均提升 62%−20%=42 个百分点,对应摘要所述”单臂任务提升超过 70%、双臂任务提升超过 40%”。
数据规模扫描(Fig. 7):以 Bottle Pick、Cup Place 两个任务对比”纯真机数据(20/50/100/150/300 条)“与”300 条仿真 + 20 条真机”两条曲线,发现后者与 300 条纯真机数据性能相当,验证仿真数据可大幅节省真机采集成本。
相关工作部分对比了 mimicgen、robocasa(固定场景/资产,泛化性受限)、PerAct2(仅分离双臂)、humanoidbench、bigym(VR 遥操限制扩展性)等基准的定性差异,但未给出跨基准的量化成功率对比表。
创新点与影响
- 提出”从单张 RGB 图片到多样 3D 数字孪生资产”的 real-to-sim 流程,用 3D 生成基础模型(Deemos Rodin)+ VLM/LLM 大幅降低数据多样性获取成本,避免了依赖固定 3D 资产库的传统仿真数据生成方法(如 mimicgen)的局限。
- 提出空间标注(功能/接触关键点 + 功能/接近/侧向三轴)+ LLM 代码生成框架,把复杂双臂任务分解为可自动求解的空间约束优化问题(screw motion planner + MPlib),首次将双臂同步、独立、动态避碰三种协作模式系统性纳入 LLM 驱动的代码生成。
- 首个在同一硬件配置(Cobot Magic 平台)下把真机遥操数据与生成式仿真专家数据统一起来的双臂 benchmark,用真机实验定量证明”仿真预训练 + 少量真机微调”可分别带来单臂 >70%、双臂 >40% 的成功率提升,验证了 sim-to-real 数据增强路线对双臂操作的有效性。
- 作者自陈局限:Dual Shoes Place 等高协调双臂任务成功率全线偏低(<15%),说明当前模仿学习算法在复杂双臂协调上仍有明显缺口;RGB 与点云表示的融合收益不稳定(部分任务大幅提升、部分任务反而下降),作者认为需要更好的 RGB-点云融合表示;论文未讨论跨具身迁移。该团队后续工作 RoboTwin 2.0(arXiv:2506.18088)针对域随机化不足与数据规模做了进一步扩展。
原始链接
- 论文 arXiv:https://arxiv.org/abs/2504.13059 (PDF:https://arxiv.org/pdf/2504.13059,v1 提交于 2025-04-17;CVPR 2025 Highlight,正式版 pages 27649–27660)
- 代码:https://github.com/robotwin-Platform/RoboTwin (注意:
main分支现已是 RoboTwin 2.0;本文对应的 1.0 版本代码见仓库的RoboTwin-1.0分支) - 项目主页(原):https://robotwin-benchmark.github.io/ (现已重定向至 RoboTwin 2.0 站点 robotwin-platform.github.io)
- 前身(ECCV 2024 workshop 最佳论文,early version):https://arxiv.org/abs/2409.02920
- 后续工作(RoboTwin 2.0):https://arxiv.org/abs/2506.18088
一手源存档(sources/)
- robotwin—github-readme — GitHub README 快照(版本分支列表、更新日志、三版论文引用信息)
- robotwin—project-page — 原项目主页快照(已迁移说明)
- arXiv 全文 PDF(arXiv 原文 PDF,不入 git):https://arxiv.org/pdf/2504.13059