一句话定位
ManiSkill3 是一套全 GPU 并行的机器人仿真+渲染框架:在单张 RTX 4090 上同时仿真+渲染 RGB/深度/分割可达 30,000+ FPS,比其它平台快 10–1000×、省 2–3× 显存;覆盖 12 大类任务、20+ 机器人本体,内建异构并行仿真、sim2real / real2sim 数字孪生(含 SIMPLER 4 环境的 GPU 移植)与成套 RL/IL baseline,是当前开源生态里最快的”状态+视觉”机器人仿真器之一。论文发表于 RSS 2025。
背景与定位
机器人操作缺少像视觉/语言那样可直接训练的大规模数据集。两条已有路线各有痛点:真实世界遥操作+模仿学习(如 ALOHA、HumanPlus)需要海量人工采集、成功率却偏低;真实世界 RL 需要在物理环境里制造 reward/reset,工程量极大。GPU 并行仿真(Isaac Gym / Isaac Lab、Mujoco MJX / Brax)让数据”白菜价”,但主要在 locomotion 上成功,操作任务通常局限窄、且依赖强状态估计替代视觉输入——因为现有 GPU 仿真器缺少快速并行渲染,视觉 RL 训练太慢不实用,也不支持异构仿真(每个并行环境跑不同场景)。
ManiSkill3 的定位就是补齐这两块短板:它是 ManiSkill2(此前最快的仿真+渲染框架)的 GPU 并行后继,底座换成开源的 genesis-physics-engine 同类角色——SAPIEN 并行渲染 + PhysX GPU 物理。相比之下 Isaac Lab 依赖闭源 Isaac Sim,Brax/MJX 当时没有并行渲染。它把 SIMPLER 的 real2sim 评测、behavior-1k/AI2-THOR 的房间级场景、droid/Open-X 的真实相机设置都纳入同一 GPU 并行框架,服务 dp3-3d-diffusion-policy、Diffusion Policy、Octo/RT-1X 等策略的训练与评测。范式上属于”compute-scalable 机器人学习基础设施”。
模型架构
这是一篇仿真基础设施论文,“架构”指仿真器/渲染器与任务构建栈:
- 物理后端:PhysX GPU 仿真(与 Isaac Lab 同款 PhysX,保证对比公平)。
- 渲染后端:SAPIEN 并行光栅化渲染器(rasterization),同时输出 RGB、深度、分割;另支持非并行的光线追踪(ray-tracing)模式做高质量渲染。对比中 Isaac Lab 用并行 ray-tracing,故作者明确说明”非严格 apples-to-apples”。支持并行渲染 voxel / pointcloud 格式以服务 3D 机器人学习。
- 异构 GPU 仿真(独有):每个并行环境可以是不同几何、不同物体数量、不同 DOF 的 articulation。例如 Open Cabinet Drawer 每个环境是不同 DOF 的柜子、随机抽一个抽屉;Pick Clutter YCB 每个环境采样不同数量 YCB 物体。靠数据导向(data-oriented)的系统设计管理 GPU 显存。
- 统一任务构建 API:唯一提供从高层 articulation/actor 到 link/joint/mesh 的完整面向对象 API,消除复杂张量索引;pose 存为 batched
Pose对象,支持 method-chaining。相比之下 IsaacGymEnvs 要手动实例化 GPU buffer,Isaac Lab 只有部分面向对象。 - 机器人与控制器:原生支持 URDF 与 Mujoco MJCF 两种定义;每个机器人配 GPU 并行的关节位置控制与 IK 控制(基于 PyTorch Kinematics);20+ 机器人开箱即用(四足、浮动夹爪、人形、灵巧手、移动操作臂等)。
- 低开销设计:极少 python/pytorch 开销 + GPU 上仿真 + SAPIEN 并行渲染,是 30k+ FPS 的三大来源。
数据
ManiSkill3 本身是”数据生产工厂”而非数据集,其 demonstration 与资产来源:
- 演示数据规模:官方称提供 millions of demonstration frames(数百万演示帧);项目页给出 40+ 技能/任务、10+ 类别、2,000+ 物体、“millions of frames of demonstrations”。
- 演示生成管线(分难度):
- 简单任务 → 开源**运动规划(motion planning)**脚本生成;
- 有易定义 dense reward 的任务 → 训练收敛的 RL 策略回放生成;
- 难任务 → 约 10 条遥操作演示(Meta-Quest VR 等),再用 RFCL / RLPD 做快速在线模仿学习,收敛后 rollout 出更大数据集(“few demos → 泛化神经网络策略 → 海量 rollout”)。
- 资产来源:YCB 物体集、PartNet-Mobility 柜子、ReplicaCAD(Habitat)、全部 AI2-THOR 场景(用 HSSD-200 编译资产)。对 AI2-THOR 场景用 CoACD 凸分解生成可仿真非凸碰撞网格,并人工标注哪些物体 kinematic(桌子/电视/时钟不可动)、哪些 dynamic(苹果/球棒/杯子可抓)。
- 真实相机配比:benchmark 对齐真实数据集设置——Open-X(Google RT 数据集)单个 640×480 RGB 相机;DROID 3×320×180 RGB 相机。
- 轨迹回放工具:从 ManiSkill2 移植并适配 CPU/GPU,支持改观测(state↔rgbd)、改动作(关节位置↔delta 末端位姿),把 motion-planning 的关节动作转成末端控制等。
训练方法
框架不训练单一模型,而是提供成套 baseline + 明确评测规范,覆盖 4 类:
- Wall-time 高效 RL:torch 向量化的 PPO、SAC,以及 model-based 的 TD-MPC2;配置只求训练墙钟时间最短、不管样本效率。
- 样本高效 RL:同套算法,调向更多梯度更新、更少环境步。
- 离线模仿学习:Behavior Cloning、offline SAC、Diffusion Policy。
- 在线模仿学习:RLPD 与 RFCL(RFCL 利用仿真 state reset)。
评测规范上的关键工程:作者指出过去仿真器在 episode 截断/终止与成功/失败上报上不一致(如 Isaac Lab 默认训练时提前终止、且不同环境里 termination 含义不统一)。ManiSkill3 提供 wrapper,评测时永不提前终止,并统一记录 return、length,以及 success/fail once(过程中出现过一次)与 success/fail at end(最后一步状态)四个指标,全部汇入统一的 Weights & Biases 看板,并明确标注每个 run 用的是 sample-efficient 还是 wall-time-efficient 配置。IL baseline 额外强制记录”用了多少条、什么类型(神经网络/运动规划/人类)、具体来源”的演示元数据。
代表性训练结果:PPO 在 PickCube 上,GPU 仿真+渲染相比 ManiSkill2 CPU 仿真,state 与 vision 训练均约 5× 加速(作者指出换更 scalable 的 RL 算法可更大,因 PPO 在高并行环境数下样本效率变差)。
Infra(训练 / 推理工程)
- 硬件:全部 benchmark 在单张 RTX 4090 上完成。
- 仿真+渲染吞吐:benchmark 环境中最高 30,000+ FPS(同时渲 RGB+深度+分割,单 128×128 相机、每 2 个物理步渲一次);比其它平台快 10–1000×,显存低 2–3×。
- 显存对比(Cartpole 640×480,128 并行环境):ManiSkill3 仅 4.4 GB vs Isaac Lab 14.1 GB;Isaac Lab 超过 128 环境即 OOM。仅开相机的最小显存占用:1.7 GB(MS3)vs 4.8 GB(Isaac Lab)。
- 纯仿真 benchmark(Cartpole):MS3 始终略快、显存低 1.5–2×。
- 真实相机设置(单 640×480 / 3×320×180):MS3 显存优 2–3×、速度快约 2×。
- 相机分辨率消融:小分辨率(如 128×128)+ 高并行环境数时,Isaac Lab 最多快 ~1.2×;但大分辨率下 MS3 快至 2×、省显存 3×;小并行环境数时 MS3 稳定快 2–4×、省显存 2–3×。作者结论:视觉 RL baseline 一般不超过 256 并行环境(超过后 FPS 边际收益小、显存代价大)。
- 对比基准:Isaac Lab v1.2.0(2024-09-20 发布);统一 sim 频率 120、control 频率 60、solver position iter 4、velocity iter 0。
- 房间级场景:复杂 ReplicaCAD 带渲染可达 2000+ FPS(Robocasa CPU 约 25 FPS)。
- 数字孪生推理:SIMPLER 数字孪生可以 60×–100× 真实世界速度、~10× 快于原 SIMPLER 实现评测 Octo 等模型,无需人工监督(得益于 640×480 大分辨率并行渲染)。
- 系统支持:GPU 仿真+渲染仅 Linux+NVIDIA;Windows/AMD/WSL/MacOS 仅部分(多受 SAPIEN 限制)。
- 训练/推理可全程留在单 GPU、无需把数据放 CPU;显存效率对 TD-MPC2/SAC 这类维持 10⁵–10⁶ replay buffer 的 off-policy 算法尤其关键。
- GPU-hours / 并行/精度:论文未系统披露具体 GPU-hours 或并行/混精度细节,多以”分钟级”定性表述(“过去要数小时的训练现在几分钟”)。
评测 benchmark
- sim2real(cube picking):仅用仿真数据、分割物体喂 PointNet + PPO 训练,真实世界 95% 成功率(50cm×50cm 工作区)。
- sim2real(vision-tactile 键插入):软体仿真硅胶触觉传感器,真实世界 95.08% 成功率(源自 Chen et al. 2024 的 marker-based visuotactile sim2real 工作)。
- real2sim(SIMPLER 4 任务):在 GPU 并行移植版上评 Octo 与 RT-1X,真实成功率与仿真成功率相关系数 0.9284、MMRV 0.0147,接近原 SIMPLER 报告值。
- 框架特性对比(Table 1):ManiSkill3 在 GPU 并行仿真、GPU 并行渲染、异构 GPU 并行仿真(独有)、大规模演示、真实物体物理、真实感渲染、房间级场景、视觉 RL baseline、轨迹回放/转换、任务类别数 12(Isaac Lab 5 / RoboCasa 2 / RLBench 1 / OmniGibson 2 / Habitat 1 / AI2THOR 1)、交互 GUI 等维度上覆盖最全。
- 训练速度:PPO PickCube state/vision 均约 5× 加速(GPU vs CPU,见上)。
- 论文明确 baseline 的 W&B 看板”仍在陆续上传中”,未给出跨算法成功率总表。
创新点与影响
贡献:
- SOTA GPU 并行仿真+渲染:首个在复杂操作任务上支持快速视觉 RL 的 benchmark(Isaac Lab 后来才加类似能力),30k+ FPS、低显存。
- 最全任务覆盖:12 类任务、20+ 机器人开箱即用,全部 GPU 并行且可并行渲染(含 drawing/cleaning、vision-tactile 等其它框架没有的类别)。
- 异构 GPU 仿真:唯一支持每个并行环境跑完全不同物体/articulation/DOF 的框架,让 RL 能同时在整套 YCB 或 PartNet-Mobility 上训练,直指泛化。
- 简洁统一 API:完整面向对象、消除张量索引,配套 domain randomization(相机位姿/控制器)、轨迹回放、动作空间转换等工具。
- 少样本可扩展数据生成管线:~10 条演示 → RFCL/RLPD 在线模仿学习 → 海量 rollout,比 RoboCasa 依赖的 MimicGen 假设更少(不假设末端动作空间、无几何变化、人工 stage 指标)。
- 统一评测规范:明确 success/fail once vs at-end,避免各仿真器 termination 语义混乱。
影响:作为 SimplerEnv 宿主与开源 GPU 仿真平台,被广泛用于机器人策略训练/评测(项目页称 100+ 组织采用、39k+ 下载、1100+ star),并支持 Octo、RDT-1B、RT-x 等 VLA 的评估。
作者自陈局限:
- 与 Isaac Lab 的渲染对比非严格 apples-to-apples(光栅化 vs 光追,视觉输出有差异);
- benchmark 精确数据当时只有 Cartpole 一个环境齐全,其它环境的数字/趋势不保证普适(速度受物体数、几何复杂度、仿真/渲染配置影响很大);
- 部分任务为加速做了简化(四足去掉大部分碰撞网格、收紧关节限位;人形/双足操作固定腿;移动底盘不驱动轮子而用一前后一旋转两关节建模);
- baseline 的 W&B 结果与更多任务的演示”仍在生成/上传中”。
原始链接
- arXiv abstract:https://arxiv.org/abs/2410.00425
- arXiv PDF:https://arxiv.org/pdf/2410.00425
- GitHub(haosulab/ManiSkill,亦 mani-skill/ManiSkill 镜像):https://github.com/haosulab/ManiSkill
- 项目主页:https://www.maniskill.ai/
- 文档:https://maniskill.readthedocs.io/en/latest/
- 发表:Robotics: Science and Systems (RSS) 2025
一手源存档(sources/)
- maniskill3—github-readme — GitHub README 快照(sources/embodied/2024/maniskill3—github-readme.md)
- maniskill3—project-page — maniskill.ai 项目主页快照(sources/embodied/2024/maniskill3—project-page.md)
- arXiv 全文(2410.00425,HTML/PDF)为 arXiv 原文,不入 git,见上方 arXiv 链接