一句话定位
Orbit 是 NVIDIA 与 ETH Zurich 基于 Isaac Sim(PhysX 5.1 + RTX 光追)搭的统一、模块化机器人学习框架:一套「World / Agent」抽象把刚体与可变形体仿真、多频率传感器、执行器模型、运动生成器、遥操作和四大 RL/IL 库封装打通,开箱带 16 个机器人平台、4 类传感器、10 个运动生成器、20+ 标准任务;GPU 并行下刚体任务吞吐比同类框架快约 10×、可变形体约 3×。它后来更名为 Isaac Lab,成为 Isaac Gym 的官方接班栈。
背景与定位
论文要解决的是机器人仿真器长期的「顾此失彼」:偏视觉的 Habitat / ManipulaTHOR 渲染吞吐尚可但简化了抓取等底层交互;偏物理的 Isaac Gym / SAPIEN 刚体接触快而准,却缺少物理级渲染(PBR)、可变形体、开箱即用的 ROS 支持。NVIDIA 新出的 Omniverse Isaac Sim 用 GPU 实时 PBR + 先进物理引擎补齐了这些缺口,但只给了底层仿真器,缺一层把它用于机器人学习的统一工装。Orbit 就是这层工装。
定位上它明确是 NVIDIA 自家 GPU 仿真谱系的「集大成者」:Isaac Gym 是只做刚体、只为展示 PhysX GPU 能力的 preview release;配套的 IsaacGymEnvs / OmniIsaacGymEnvs 只绑 RL-Games、模块化差、不支持 RL 之外的范式。正是这些不足催生了 Orbit——它把 Isaac Gym 的能力并入 Isaac Sim,再补上可变形体、高保真渲染、ROS、多学习库封装与可扩展的任务设计。范式上它把「仿真基础设施 + 标准任务基准 + 多范式工作流(RL / 模仿学习 / 运动规划 / sim-to-real)」收敛进单一平台。作者含 Mayank Mittal、Nikita Rudin、David Hoeller、Animesh Garg、Marco Hutter、Gavriel State 等。相关工作可参见 isaac-gym、Learning to walk in minutes(RSL-RL)、diffusion-policy、aloha-act 等模仿学习工作。
模型架构
这是一套仿真框架而非模型,核心是「World / Agent」两层抽象与计算图设计。
World(对应真实世界):机器人、传感器、静/动态物体、可视化 marker 同处一个 stage。场景可脚本化程序生成、扫描网格(Replica 等)导入、或 Isaac Sim 游戏式 GUI 交互搭建,三者可混用。
- Robots:由 articulation + 执行器模型 + 底层关节控制器组成。单一接口(如
LeggedRobot)覆盖同类多款机器人(ANYmal C / Unitree A1)。模型从 USD 文件加载,Orbit 自带把 URDF/obj/stl 转 USD 的命令行脚本并自动补 collider、摩擦材质等物理属性。执行器模型把真实特性(延迟、力矩饱和)注入仿真,内置 DC 电机与 Series Elastic Actuator(SEA) 两类,用户可按辨识出的动力学接入自定义模型。关节控制器把输入命令经执行器模型转成位置/速度/力矩下发。复杂系统(腿式移动机械臂)用 actuator groups 分解为子组、各自定义传动模型。 - Sensors:本体感 / 外部感均支持,统一在一个接口下。区别于 Isaac Sim「传感器写进 USD、每个仿真步全部更新」的推荐做法——并行场景下会因无关传感器更新产生巨大开销;Orbit 用统一的 sensor 管理系统按任务只配所需传感器,且每个传感器实例有自己的内部计时器控制读取频率,帧间返回上一次值,从而支持多频率传感。
- Objects / Markers:物体是被动实体,支持纹理与物理属性(摩擦、关节参数)随机化,还可为主动运动部件建模(如冰箱铰链因磁封先紧后松的混合模型)。marker 允许程序化往 GUI 加坐标轴、球、网格等原语用于调试可视化。
Agent(决策「智能」):由若干 node 组成计算图,node 分两类——感知类(如 RGB-D → 点云/TSDF)与动作类(如任务级命令 → 关节命令),各带内部计时器控制更新频率,节点间用 Python 同步交换数据以避免 service-client 协议开销。
Learning task = 对计算图的 graph-cut:任务模块负责指定目标、算奖励、管 reset;通过在 Agent 计算图上做「图切」并指定外在目标,就能在同一 World 定义上派生不同任务。示例:学「任务空间」而非底层关节动作时,IK 任务空间控制器跑 50 Hz、关节控制器要 1000 Hz——这类多频率、可切换运动生成器(IK / OSC / 反应式规划器)的能力被封装进任务设计。
关键 feature 配置数:4 个移动平台(1 全向底盘 + 3 四足)、7 个机械臂(2 个 6-DoF + 5 个 7-DoF)、6 个末端执行器(4 平行夹爪 + 2 灵巧手);I/O 设备 3 种(键盘、Xbox 手柄、Spacemouse);运动生成器含 GPU 实现的差分 IK、操作空间控制(OSC)、关节级控制,CPU 实现的 RMPFlow(定臂)与 OCS2(移动机械臂全身控制),外加预训练腿式locomotion 策略。物理引擎 PhysX SDK 5.1,渲染 Omniverse RTX;可变形体用 FEM solver(stable neo-Hookean),布料用 PBD solver,并支持 SDF 碰撞检测。
数据
框架侧的「数据」= 资产、标准任务与演示轨迹。
- 资产/任务规模:开箱 16 个机器人平台、4 类传感器模态、10 个运动生成器、20+ 基准任务、4 个学习库封装。任务细分为 11 个刚体操作 + 13 个可变形体操作 + 2 个 locomotion,涵盖抓取、拧螺丝、堆叠、推拉、倒水、折叠、行走等技能;每个任务内可自由切换机器人、物体、观测与动作空间、域随机化。
- 演示轨迹(模仿学习用):以
Franka-LiftCube为例,对「初始/目标位置固定或随机」的 4 种设定各采集 2000 条轨迹。数据采集接口类 roboturk,存储格式对齐 robomimic 以直接训 IL 模型。 - 数据形式:框架内部主要以 tensor 存数据,再按各 RL 框架的数据类型格式化转换。资产以 USD 承载,支持从物体数据集程序化生成多样场景。
训练方法
Orbit 不训练单一策略,而是提供多条端到端工作流,均可在同一 World 上运行。
- 强化学习:提供到 rl-games、RSL-RL、stable-baselines3 三个库的 wrapper,使底层环境与 RL 框架解耦。示例用 PPO 训
Franka-Reach与Franka-Cabinet-Opening,并可一键切换动作空间(关节位置 / 关节速度)。曲线为 5 个种子均值。 - 遥操作 + 模仿学习:用 I/O 设备收集演示,训 Behavior Cloning(BC) 与 BC-RNN(robomimic)。
- 运动规划:支持程序化与 GUI 交互两种。手写状态机做 Sense-Model-Plan-Act 顺序规划(也可作为专家采难例演示,如布料操作);交互式规划把 grasp 生成、遥操作、任务空间控制、运动预览组成节点系统,用户从 GUI 选物体→看 RMP 生成的抓取与运动序列→确认后执行。
- sim-to-real 部署:两条链路。① ZMQ:把 Orbit 的 60 Hz 关节命令用五次多项式插值上采样到 1000 Hz,下发给跑实时内核的 Franka Emika(含 Allegro 手的双物体抓取,展示接触仿真真实感)。② ROS:把仿真训好的策略导出部署到 ANYbotics 四足 ANYmal-D。locomotion 策略用 actuator network 训练腿式底座,为鲁棒性把 base mass 随机化到 22 ± 5 kg 并加随机推力,用 contact reporter 取接触力做奖励;部署时策略跑 50 Hz、actuator net 跑 200 Hz。
Infra(训练 / 推理工程)
- RL 吞吐:GPU 优化的 RSL-RL / rl-games 在 2048 个并行环境下达 50,000–75,000 FPS;stable-baselines3 为 6,000–18,000 FPS。
- 物理仿真峰值:最高约 125,000 FPS。
- 渲染瓶颈(作者自陈短板):10 个相机渲染 640×480 图像时总计仅约 270 FPS(RTX 3090),正通过 GPU 加速改进。
- 吞吐对比硬件:16 核 AMD Ryzen 5950X + 64 GB RAM + NVIDIA RTX 3090;对比版本 robosuite v1.4、ManiSkill2 v0.4、Isaac Gym Preview 4、Isaac Sim 2022.1(刚体),DEDO v0.1、Isaac Sim 2022.2(布料)。
- 并行:CPU 向量化在约 200–300 个环境即因内存不足崩溃;GPU 并行随环境数扩展良好。Orbit 与 Isaac Gym 因共用 PhysX 引擎,刚体吞吐持平。
评测 benchmark
全部来自论文一手实验:
- 仿真吞吐:相比同类框架,刚体操作任务吞吐快约 ~10×(对比 robosuite / ManiSkill2 / IsaacGymEnvs),可变形体任务快约 ~3×(对比 DEDO,用 PBD solver)。布料网格分辨率越高越准但越慢:测了 294 / 574 / 2203 / 8623 点四档,点数增大显著拖慢并触及显存上限。
- 模仿学习成功率(
Franka-LiftCube,100 次试验,BC | BC-RNN):No Change 1.00 | 1.00;仅变目标 G 0.89 | 1.00;仅变初始 I 0.47 | 0.88;初始+目标都变 Both 0.43 | 0.87。BC-RNN 在分布偏移下明显更稳;平均轨迹长度 234–324(BC)/ 249–293(BC-RNN)。 - 可变形体精度:夹持硅胶弹性梁在重力下的阻尼振荡,仿真(Isaac Sim FEM solver,不同六面体网格分辨率)与动捕采集的真实数据吻合良好,佐证 solver 精度与可变形体 sim-to-real 潜力。
- 刚体 sim-to-real:Franka(ZMQ)与 ANYmal-D(ROS)两套真机部署成功,验证接触动力学真实性。
创新点与影响
贡献:① 首个把 Isaac Sim 的最新仿真能力(PhysX 5.1 GPU 刚体+可变形体、RTX 光追、多模态传感)系统封装成统一、模块化、开源的机器人学习框架,兼顾程序化与 GUI 交互式任务设计;② batteries-included——现成的机器人、传感器、执行器/噪声模型开箱可用,降低入门门槛;③ 标准化任务基准(11 刚体 + 13 可变形体 + 2 locomotion),任务内可切机器人/物体/传感器;④ 用 World/Agent + 计算图 graph-cut 的抽象支持多频率传感与执行、把运动生成器编进任务设计,是它区别于 IsaacGymEnvs 的核心。
作者自陈的局限:渲染是主要瓶颈(10 相机 640×480 仅 ~270 FPS);可变形体高分辨率网格受显存限制;整器(渲染+传感+物理)保真度的定量刻画仍是未来工作;ManiSkill2 那类 Warp MPM 软体切割/塑性变形当时仍在开发中;计划支持直接加载 URDF/OBJ 原生格式(免转 USD)、并加触觉与六轴力矩传感器。
影响与演进:Orbit 在 2023–2024 年更名为 Isaac Lab(GitHub 迁至 isaac-sim/IsaacLab,BSD-3 许可,isaaclab_mimic 扩展为 Apache-2.0),成为 NVIDIA 官方力推的机器人学习栈、Isaac Gym 的正式接班者。2025-11 发布的 Isaac Lab 技术报告(arXiv:2511.04831)把它定位为「Isaac Gym 的自然继承者」,扩展到大规模多模态学习:whole-body control、跨形态移动、接触丰富与灵巧操作、人类演示整合,并预告接入可微、GPU 加速的 Newton 物理引擎。当前 Isaac Lab 已支持 16+ 机器人、30+ 训练环境,兼容 RSL-RL / SKRL / RL-Games / Stable Baselines 及多智能体 RL,可本地或云上分布式运行。
原始链接
- 论文(Orbit, arXiv 2301.04195v2):https://arxiv.org/abs/2301.04195
- Orbit 原始项目页(视频/文档/代码):https://isaac-orbit.github.io/
- GitHub(现 Isaac Lab):https://github.com/isaac-sim/IsaacLab
- Isaac Lab 文档:https://isaac-sim.github.io/IsaacLab/
- Isaac Lab 2025 技术报告(继任者,arXiv 2511.04831):https://arxiv.org/abs/2511.04831
一手源存档(sources/)
- isaac-lab-orbit—github-readme — Isaac Lab GitHub README 快照(含 key features、Isaac Sim 版本依赖表、2025 技术报告 citation)
- Orbit 论文全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)