一句话定位
RoboVerse 是 UC Berkeley、PKU、USC 等 9 家机构联合发布的机器人仿真基础设施:核心是 MetaSim(把 IsaacSim/IsaacGym/MuJoCo/PyBullet/SAPIEN/CoppeliaSim/Genesis 七种仿真器统一到一套 simulator-agnostic 配置系统与 Handler API 之下),在此之上迁移聚合了 Table I 列出的 15 个既有 benchmark 来源,得到 276 个操作任务类别、510.5k 条轨迹、5.5k 个资产(外加导航与人形数据集),并定义了一套 4 级泛化程度的模仿学习评测协议 + 强化学习评测协议。论文本身不训练新策略,而是用 ACT/Diffusion Policy/OpenVLA/Octo 等既有基线验证这套平台/数据/评测三件套的有效性,2025-04-10 被 RSS 2025 接收。
背景与定位
范式上属于”仿真基础设施统一层”这一支线:不像 robocasa(自建 MuJoCo + MimicGen + LLM 场景生成的单一仿真数据集)或 genesis-physics-engine(自研新物理引擎)那样从头造一个仿真器/数据集,RoboVerse 的核心诉求是解决”仿真生态碎片化”——同一批研究者在 Related Work 里指出:maniskill/maniskill3、rlbench、calvin、libero 等 benchmark 各自绑定不同仿真器(SAPIEN、CoppeliaSim、PyBullet、MuJoCo)、不同资产格式(MJCF/URDF/USD)、不同任务定义方式,导致想跨 benchmark 训练/评测策略时,必须为每个仿真器单独适配代码。MetaSim 通过一个三层架构(通用配置系统 MetaConfig → 对齐的仿真器后端 Handler → 用户友好的 Gym 环境包装)把这些差异抽象掉,从而实现 (1) 跨仿真器无缝切换、(2) 混合仿真(一个仿真器管物理、另一个管渲染,如用 MuJoCo 算物理 + IsaacSim 渲染)、(3) 跨具身迁移(把末端执行器轨迹在不同机械臂间重定向)三项能力。
数据层面对标 open-x-embodiment(真实数据聚合,1M+ 轨迹/22 种具身)、droid(7.6 万条真实演示)等真实数据集,以及 robocasa、DexGraspNet-2.0 等合成数据集;论文的定位是”仿真数据集不该因为仿真器选择而碎片化”,用统一格式把 maniskill、rlbench、calvin、Meta-World、libero、robosuite/mimicgen、GAPartNet、Open6DOR、ARNOLD、SimplerEnv、GraspNet、GarmentLab、UniDoorManip、GAPartManip、RLAfford 十五个来源(Table I)的任务/资产/轨迹迁移进同一套体系(其中论文 IV-B 正文列举的迁移来源为前 14 个,RLAfford 与 GAPartManip 见于 Table I 但未见于该处正文列举)。基线策略侧用到 openvla、Octo(octo)、Diffusion Policy、ACT 四个既有模型,人形侧复用 humanoidbench、Humanoid-X、SkillBlender,运动规划侧复用 curobo 做逆运动学求解器。
模型架构
RoboVerse 不是一个训练出的模型,而是”仿真基础设施 + 数据 + 基线策略编排”的平台型工作。核心组件 MetaSim 采用三层架构:
- 通用配置系统(MetaConfig):一个嵌套 Python dataclass,把任意仿真场景抽象为 agents(智能体)、objects(物体)、tasks(含指令/成功判据/奖励)、sensors(观测方式)、physics parameters(物理参数)五类 simulator-agnostic 组件;同时保留可选的仿真器专属超参(如 solver type)供用户按需定制。配置风格借鉴 Hydra,每一项都可从命令行覆写。
- 对齐的仿真器后端(Handler 接口):每个仿真器实现同一套 Handler 接口,核心方法只有三个——
get_states()、set_states()、step(),覆盖场景初始化、加载物体、步进物理、取观测、判定成功等全生命周期操作。当前对齐了 Isaac Sim、Isaac Gym、MuJoCo、PyBullet、SAPIEN(版本 2.2)、CoppeliaSim(经 PyRep)、Genesis 七个后端。 - 用户友好环境包装(Env):在 Handler 之上包一层 Gymnasium 风格接口(
step/reset/render/close),伪代码见论文 Code III-B-2,是标准 gym.Env 到 Handler 调用的直接映射。 - 混合仿真(Hybrid Simulation):
HybridEnv类允许一个进程内同时跑两个仿真器实例(env_physic管物理、env_render管渲染),典型命令python collect_demo.py --sim=mujoco --renderer=isaaclab --task=$task,核心是把物理状态作为两个仿真环境间的统一表征来同步。 - 资产转换管线:因为渲染管线以 Isaac Sim 为主但很多资产原始格式是 MJCF,采用两段式转换 MJCF → URDF → USD(自研 MJCF→URDF 转换器,先用 MuJoCo 的 MJCF 解析器读取,再导出纹理/碰撞网格/关节信息到 URDF,再交给 Isaac Sim 成熟的 URDF 导入能力转 USD)。
- AI 辅助任务生成:用大生成模型(结合示例物体摆放学习空间/语义约束)自动排布来自不同 benchmark 的物体到物理合理场景,产出统一格式配置文件,经”格式校验 + 人工可行性检查(遥操作员判定任务是否合理)“两级过滤。
- Real2Sim 资产重建:COLMAP 初始化结构 → 3D Gaussian Splatting 渲染 → VLM(结合语义/原始图像)推断物理属性 → 从视频估计表面法线 + surfel splatting + TSDF 动态滤波重建网格 → 语义掩码抠取组件 → 从视频推断物体运动学 → 最终精修坐标系/朝向/轴对齐/尺度/6-DoF 相对位姿/PD 控制参数,生成 URDF。
策略侧基线(非本文自研,而是复用+微调既有模型做平台验证):specialist 模型 ACT、Diffusion Policy(ResNet18 提取图像特征 + 3 层 MLP 提取关节状态特征拼接作为条件,DDPM 去噪训练,推理用 200 步去噪);generalist 模型 OpenVLA、Octo,均在单任务设定下微调,动作预处理为相对末端执行器位姿(delta end-effector position)+ 二值化夹爪(0/+1),评测时用 cuRobo 做逆运动学把动作转回关节空间。
数据
- 操作数据集(迁移聚合,论文 Table I):共 15 个来源 benchmark 迁移进统一格式,总计 276 个任务类别、510.5k 条轨迹、5.5k 个资产。逐来源拆分(任务类别数/轨迹数/资产数):ManiSkill(SAPIEN) 6/19k/1.7k;RLBench(CoppeliaSim) 80/150k/100;CALVIN(PyBullet) 7/20k/7;Meta-World(MuJoCo) 5/5k/6;robosuite&MimicGen(MuJoCo) 6/6k/12;GAPartNet(IsaacGym) 4/4k/151;Open6DOR(IsaacGym) 69/10k/207;ARNOLD(IsaacSim) 6/3k/30;LIBERO(MuJoCo) 10/15k/15;SimplerEnv(SAPIEN) 6/30k/52;RLAfford(IsaacGym) 4/40k/40;GraspNet 58/200k/42;GarmentLab(IsaacSim) 6/6k/3k;UniDoorManip(IsaacGym) 7/1k/140;GAPartManip(IsaacSim) 2/1.5k/42。
- 摘要与正文口径为约 500k 条独特高保真轨迹、5.5k 资产、超过 5000 万条(50M+)高质量状态转移;而 Figure 1 图注给出的是”超过 1,000 个任务、超过 1000 万(10M+)转移”这个更粗略的总口径(可能把导航/人形任务并入总任务数后超过 1,000)——两处数字口径不完全一致,论文本身未做显式对账,此处如实并陈。
- 迁移方式:直接迁移(有完整轨迹的 benchmark,重写环境配置 + 转换轨迹/资产格式)、运动规划 + RL rollout(只有关键点/抓取姿态或部分数据时,用运动规划补全轨迹,或用既有/新训 RL 策略 rollout 采集,再严格过滤)。
- 数据增强:(1) 轨迹增强——沿用 MimicGen 思路,把任务拆解为以物体为中心的子任务序列,对每个子任务做初始/目标状态分布变化重放,在 4 个代表性任务上比较 50 条源演示 vs 200/1000/3000 条增强演示训练 Diffusion Policy,成功率随生成数据量单调提升(Fig. 10)。(2) 域随机化——在 Isaac Sim handler 中实现,含桌面/地面/墙面材质(桌面约 300 种材质、墙面与地面各约 150 种,来自 ARNOLD 与 NVIDIA vMaterials 子集)、光照(远方光/圆柱光阵列,强度与色温随机)、59 个候选相机位姿、表面粗糙度/高光/金属度随机化。
- 导航数据集:整合 Matterport3D 场景(90 个场景)+ VLN-CE 的 R2R(10k episodes)与 RxR(20k episodes)指令,支持 Unitree 四足狗与 JetBot 轮式机器人两种移动具身。
- 人形数据集:迁移 HumanoidBench 任务,并整合 Humanoid-X 与 SkillBlender 的任务/策略/数据样本,复现了 UH-1 推理管线,验证预训练策略可在多个仿真器上跨平台维持稳定 locomotion。
- 世界模型实验数据(附录 XIX-B):从 DROID 中筛选 20
60 帧长度的 episode(原始 120360 帧,每 6 帧跳采,帧率降到 4fps),得到约 50,000 条独特 DROID episode;RoboVerse 侧受限于时间/算力也只生成 50,000 条独特 episode(论文明确说明完整规模的 RoboVerse 留待未来训练更强世界模型);左右相机视角各自算一个样本(排除手部相机视角,因大幅相机位姿变化会导致生成质量差),故两个数据集各自”翻倍”为 100,000 个样本,用于 DROID-50K / RoboVerse-50K / DROID-RoboVerse-100K 三组对照实验。
训练方法
- 模仿学习基线训练:specialist 模型(ACT、Diffusion Policy)从零训练,动作空间为 9 维机器人关节状态;generalist 模型(OpenVLA、Octo)在单任务设定下微调,动作预处理为相对末端执行器位姿 + 二值化夹爪。所有实验遵循 90/10 的训练/验证切分协议(90% 训练、10% 用于评估泛化),每个 step 输入 256×256×3 RGB 图像 + 简短语言描述;评测时从训练集与验证集各随机抽 10 个任务设置,成功率取 3 个随机种子的平均。
- 强化学习基线训练:用 Stable-Baselines3 与 rsl_rl 两套实现的 PPO 在 IsaacLab 迁移任务上训练(保持超参一致);人形/灵巧手等额外任务复用同一 PPO 流程;通过对 rsl_rl 接口的扩展进一步支持了 TD-MPC2 算法,在所有环境中展现出稳健的训练动态。
- 世界模型训练方法:基于 Latte(transformer 驱动的隐空间扩散视频生成框架,交替空间/时间注意力块);动作条件通过 frame-level AdaLN(逐帧自适应层归一化)注入(参考 IRASim,frame-level 条件比 video-level 条件能更精确控制夹爪);原始视频帧先经冻结的 Stable Diffusion 自编码器编码到隐空间,首帧作为初始条件,后续帧隐变量加噪训练;动作条件(笛卡尔位姿+朝向,或关节位置)与噪声调度各自经独立 MLP 编码后相加;推理用 DDIM,200 步采样。消融发现用关节位置做动作条件比笛卡尔位姿+朝向能生成更精确的夹爪运动(归因于关节位置作为状态表征歧义更小)。
- 数据增强 API 的轨迹分解假设:假设每个任务的子任务顺序预先给定,基于此用最少人工标注把源演示切成以物体为中心的连续片段,再用 MimicGen 风格方法为不同初始/目标状态分布批量生成增强轨迹。
Infra(训练 / 推理工程)
- ACT 训练:batch size 由原论文设置提升到 512,学习率相应放大到 1e-4 以加速收敛,在 1 张 A100 GPU 上训练 2000 epoch,用验证集最优 checkpoint 评估。
- Diffusion Policy 训练:按原框架实现,搜索观测/预测长度等关键超参,未披露具体 GPU 数量/训练时长。
- OpenVLA 微调:LoRA 微调(rank=32),用官方设置在 8 张 A100 GPU 上训练至收敛,动作 token 准确率达 95%+。
- 世界模型训练(附录 XIX-C):DROID-50K / RoboVerse-50K / DROID-RoboVerse-100K 三个数据集均在 8 张 NVIDIA H100 GPU 上训练;空间分辨率 240×320,每 episode 16 帧;起始模型 100M 参数、batch size 16,训练约 100K step 在 RoboVerse 上收敛、约 200K step 在 DROID 上收敛;进一步把模型规模扩大到 500M 参数、batch size 降到 8,能更好保留物体几何形状与机械臂运动预测的准确性。
- 仿真器 GPU 加速支持情况(论文 Table VI 对比):支持 GPU 加速的是 SAPIEN(PhysX-5/Warp)、MuJoCo、Isaac Sim(PhysX-5)、Isaac Gym(PhysX-5/Flex)、Genesis 五个;不支持 GPU 加速的是 PyBullet 与 CoppeliaSim(ODE/Newton/Vortex)。开源性上则是另一条轴线:SAPIEN、PyBullet、MuJoCo、CoppeliaSim、Genesis 均为开源,Isaac Sim 与 Isaac Gym 不开源。Isaac Sim 与 Genesis 支持光线追踪渲染与软体/流体动力学。
- 平台自身的推理 FPS / 控制频率(control-Hz) / 边缘端延迟:论文未披露具体数值(仅在人形 sim-to-sim-to-real 实验中提及”下半身 RL 策略 + 上半身 PD 控制”的架构,未给延迟数字)。
- RL 基准训练的并行环境数 / GPU 数量 / 总 GPU-hours:论文正文未披露具体数字,声明相关细节见补充材料(未随本次抓取的 arXiv HTML 版本一并提供)。
评测 benchmark
模仿学习基线(Table II,6 个代表性任务,90/10 切分,3 seed 均值,单位:成功率 %):
| 方法 | 参数量 | PickCube | StackCube | CloseBox | MoveSliderLeft | PickChocolatePudding | NutAssembly | 平均 |
|---|---|---|---|---|---|---|---|---|
| Diffusion Policy | 78M | 52.7 | 53.8 | 51.5 | 76.5 | 50.0 | 7.1 | 48.6 |
| ACT | 84M | 31.7 | 36.7 | 68.3 | 85.0 | 78.3 | 0.0 | 50.0 |
四级泛化评测(Table III,MoveSliderLeft / CloseBox / PickCube 三任务,Level 0~3 依次为任务空间/环境随机化/相机随机化/光照反射随机化):Diffusion Policy 在 PickCube 上从 Level 0 的 52.7% 骤降到 Level 1 的 11.1%、Level 2/3 均为 0;ACT 在 CloseBox 上 Level 0→1 反而从 68.3% 升到 73.3%,但 Level 2 骤降到 0;OpenVLA(受限资源仅采样 20 个测试场景)在 PickCube 上从 40.0% 一路降到 Level 3 的 0;整体上三个模型都表现出随随机化程度提升成功率显著下降的模式,验证了该 benchmark 具备区分度。
语言条件抓取(Table III 附表,3 个物体难度集):OpenVLA 在 Object Set 1/2/3 上分别为 46.0/33.3/14.4,Octo 为 42.0/14.4/2.2,难度递增(几何复杂度上升)时两者成功率均单调下降。
VLA 模型结果(Table IV,GraspNet 58 个物体分三组难度):同上,OpenVLA 相比 Octo 在两个简单任务(PickCube 40.0 vs 50.0、MoveSliderLeft 45.0 vs 30.0)互有胜负,抓取任务上 OpenVLA 全面领先。
强化学习基准:成功把 HumanoidBench 任务从 MuJoCo 迁移到 RoboVerse,在 Isaac Sim 与 MuJoCo 两种后端上都能稳定收敛,达到与原生 MuJoCo baseline 相当的性能;TD-MPC2 在所有环境中训练动态稳健(定性结论,未给数值曲线)。
Sim-to-Real(Table V,GraspNet 改编的语言引导抓取任务,满分 10,部分接触给 0.5 分):Octo 在 Pick up Wash Soap / Lift Mouth Rinse / Grasp Green Dish 三任务上得分 5.0/3.0/6.0(满分 10);OpenVLA 得分 7.0/8.0/5.0 —— 微调于 RoboVerse 数据集的策略可直接零样本迁移到真实世界抓取未见过的物体。
Sim-to-Sim-to-Real(定性):下半身 RL 策略 + 上半身 PD 控制的人形全身控制策略,展示了 in-the-wild 泛化能力(Fig. 13,未给量化成功率)。
世界模型消融(定性,Fig. 11):仅用 50,000 条 DROID episode 训练时,模型基本遵循动作条件但难以准确刻画夹爪与目标物体的接触物理(物体在接触时出现”变形”伪影);加入 50,000 条 RoboVerse 合成 episode(合计 100,000 episode)后,物体几何形状保留明显改善;但仅”看视频”仍不足以学到 DROID 中复杂的物理交互——训练于纯 RoboVerse-50K 或 DROID-RoboVerse-100K 并在 RoboVerse 样本上验证时生成帧在多数场景中物理上更真实,论文将此归因于 RoboVerse 更干净的背景、更完整的机械臂视野覆盖以及丰富的随机化/增强。
创新点与影响
贡献:(1) MetaSim——一套三层(通用配置系统 + 对齐仿真器后端 + Gym 环境包装)的 simulator-agnostic 抽象层,首次把 IsaacSim/IsaacGym/MuJoCo/PyBullet/SAPIEN/CoppeliaSim/Genesis 七个主流仿真器统一到同一接口下,支持跨仿真器集成、混合仿真、跨具身迁移三项此前需要人工大量适配才能做到的能力;(2) 迄今最大规模的统一格式合成机器人数据集之一——276 个任务类别/510.5k 条轨迹/5.5k 资产,来自 15 个既有 benchmark 来源(Table I)的系统性迁移聚合,外加导航与人形数据;(3) 一套标准化的 4 级泛化程度模仿学习评测协议 + 强化学习评测协议,使跨 benchmark 的策略比较第一次具备可复现的统一口径;(4) 用受控实验证明合成数据能缓解真实世界世界模型训练中的接触物理伪影问题,并直接支撑 sim-to-real 与 sim-to-sim-to-real 迁移。
论文自陈局限:① 非刚体(如布料、可变形物体)的统一格式集成尚未完全支持,留待未来工作;② 尽管大规模数据集对预训练基础模型潜力巨大,受限于算力本文并未探索这一方向;③ 尽管尽力重新实现并优化了平台内全部基线方法,部分实现仍可能非最优——论文强调本研究的首要目标不是直接比较策略性能优劣,而是证明该系统的综合性、对多样策略的支持能力,以及仿真与真实世界表现之间的强对齐;④ 论文在附录中额外做了三个仿真器(SAPIEN/Isaac Gym/PyBullet)上动量守恒/角动量守恒/动能守恒的基础物理实验,发现三者均未能保持基本守恒律,论文将此列为对”直接 sim-to-real 迁移更复杂机器人行为”这一期望的悲观信号,并强调这正是需要一个能让用户跨仿真器切换的工具的原因。
生态延续:GitHub 于 2025-04-03 随论文一同开源(Apache 2.0 许可),2025-04-10 被 RSS 2025 接收;截至本次抓取,metasim 核心包已拆分为独立的 RoboVerseOrg/MetaSim 仓库,RoboVerse 仓库本体转为下游 roboverse-py 包(任务/机器人/场景/资产/学习代码),另建有独立文档站 roboverse.wiki 与 HuggingFace 数据集仓库。
原始链接
- arXiv:https://arxiv.org/abs/2504.18904
- PDF:https://arxiv.org/pdf/2504.18904
- GitHub:https://github.com/RoboVerseOrg/RoboVerse
- MetaSim 核心包(拆分仓库):https://github.com/RoboVerseOrg/MetaSim
- 官方项目主页:https://roboverseorg.github.io/
- 文档站:https://roboverse.wiki/
- HuggingFace 数据集:https://huggingface.co/datasets/RoboVerseOrg/roboverse_data
一手源存档(sources/)
- roboverse—github-readme — GitHub README 快照(安装方式、News、依赖仓库清单、许可证、引用信息)
- roboverse—project-page — 官方项目主页快照(作者列表、摘要、各版块图注)
- roboverse—hf-card — HuggingFace 数据集卡快照(许可证、任务类别)
- arXiv 原文:https://arxiv.org/abs/2504.18904 (arXiv 原文 PDF,不入 git)