一句话定位

南京大学团队领衔(联合香港大学、中南大学、地平线机器人、中科院计算所、上海交大、慕尼黑工业大学、清华大学)的具身智能综述:把”物理仿真器”与”世界模型”定位为驱动具身智能的两大互补引擎——前者是外部、可控、高保真的显式物理环境,后者是内部、生成式的环境表征——并在此之上提出 IR-L0~IR-L4 五级机器人智能分级标准,逐项对比 10 款主流仿真器的物理/渲染/传感器能力,梳理世界模型五大架构谱系与”神经仿真器/动力学模型/奖励模型”三重角色,最终分别用两张大表盘点自动驾驶与关节式机器人(机械臂/四足/人形)两个应用领域的世界模型文献。

背景与定位

作者:Xiaoxiao Long、Qingrui Zhao、Kaiwen Zhang、Zihao Zhang、Dingrui Wang、Yumeng Liu、Zhengjie Shu、Yi Lu、Shouzheng Wang、Xinzhe Wei(前十位注明共同一作)、Wei Li、Wei Yin、Yao Yao、Jia Pan、Qiu Shen、Ruigang Yang、Xun Cao(通讯作者)、Qionghai Dai。机构横跨南京大学、香港大学、中南大学、地平线机器人、中科院计算技术研究所(ICT)、上海交通大学、慕尼黑工业大学、清华大学。配套 GitHub 仓库 NJU3DV-LoongGroup/Embodied-World-Models-Survey 持续维护文献列表与开源项目索引。2025-07-01 提交 arXiv v1。

覆盖范围:聚焦 2018–2025 年间机器人控制算法、物理仿真器、世界模型三者的交互关系,同时覆盖传统物理仿真器与新兴世界模型,重点落在自动驾驶与机器人两大应用场景。论文自陈与既有综述的差异:以往综述通常只聚焦单一组件——机器人仿真器综述或世界模型综述——本文首次系统梳理”仿真器 × 世界模型”在具身智能发展中的互补关系。

四点自陈贡献

  1. 智能机器人分级标准:提出 IR-L0 到 IR-L4 的五级人形机器人自主性评估框架,覆盖自主性、任务处理能力、环境适应性、社会认知能力四个维度。
  2. 机器人学习技术综述:系统梳理腿式运动(双足行走、跌倒恢复)、操作(灵巧控制、双臂协同)、人机交互(认知协作、社会嵌入)领域的近期进展。
  3. 主流物理仿真器分析:对 Webots、Gazebo、MuJoCo、Isaac Gym/Sim/Lab 等主流仿真器做物理仿真能力、渲染质量、传感器支持的综合对比。
  4. 世界模型进展:先梳理世界模型的主要架构谱系与潜在角色(可控仿真器/动力学模型/奖励模型),再分别深入自动驾驶与关节式机器人两个具体应用领域。

与本库其他工作的关联:文中把 NVIDIA Cosmos 系列(cosmos-predictnvidia-cosmos-transfer1cosmos-predict2)作为”世界模型即神经仿真器”的旗舰案例;把 Wayve 的 gaia-1-wayve/gaia-2-wayvedrivedreamer/drivedreamer-2/drivedreamer4dvista-driving-world-modelrecondreamer 作为自动驾驶世界模型的代表;把 Dreamer 系列(dreamer-v1/dreamer-v2/dreamer-v3/daydreamer/transdreamer)、v-jepa/v-jepa-2 作为动力学模型/JEPA 架构的核心脉络;仿真器一章逐一点评 isaac-gymisaac-simisaac-lab-orbitgenesis-generative-physicsnewton-physics-enginemujoco-playground;机器人应用侧引用 robodreamerenerverse。属于”仿真器 taxonomy + 世界模型 taxonomy + 双领域文献表”范式,不提出新模型,可与同类综述 embodied-benchmark-survey 互相参照。

模型架构

本文是纯综述,其”架构性”贡献体现为三套并列的分类学,而非单一模型设计。

(1) IR-L0~IR-L4 机器人智能分级标准(Table I,§2):按自主性(Autonomy)、任务处理能力(Task Handling Ability)、环境适应性(Environmental Adaptability)、社会认知能力(Societal Cognition Ability)四个维度划分五级:

  • IR-L0 基础执行级:完全依赖预定义程序或遥操作,“低感知-高执行”单向闭环,无环境反馈;硬件为高精度伺服电机+刚性机械结构,控制基于 PLC/MCU 预定义脚本。
  • IR-L1 程序化响应级:具备有限规则式反应能力(清洁/接待机器人),依赖红外/超声/压力等基础传感器触发预设行为模式,“有限感知-有限执行”。
  • IR-L2 基础感知与适应级:引入初步环境感知与多任务模式切换能力(如服务机器人依语音指令在”送水”与”导航引导”间切换并同步避障),依赖相机/麦克风阵列/LiDAR 等多模态传感器与有限状态机/行为树。
  • IR-L3 类人认知与协作级:在复杂动态环境中具备自主决策能力,支持多模态人机交互与意图推断(如养老场景中通过语音+表情识别情绪变化并做出安抚/报警响应),依赖 CNN/Transformer 深度学习架构+强化学习自适应策略优化。
  • IR-L4 完全自主级:感知-决策-执行全自主,具备自我演化的伦理推理、长期自适应学习能力,支持多轮自然语言对话、情感理解、文化适应与多智能体协作,依赖 AGI 级框架(元学习+生成式 AI+具身智能)与云-边-端协同分布式架构。

(2) 世界模型五大架构谱系(§5.1,Fig. 17):

  • RSSM(Recurrent State Space Model)——最早也是最广泛采用的架构,用紧凑潜空间编码环境状态并以循环结构建模时序动态,由 Dreamer 系列(dreamer-v1/dreamer-v2/dreamer-v3/daydreamer)确立范式。
  • JEPA(Joint-Embedding Predictive Architecture)——由 Yann LeCun 提出,训练目标是在抽象层面预测缺失内容的表征而非重建像素,摆脱显式生成式解码器;I-JEPA 面向静态图像、v-jepa 扩展到时空结构。
  • Transformer-based State Space Model——用注意力机制替代 RNN 建模长程依赖,代表工作 transdreamer、TWM、Google DeepMind 的 Genie。
  • 自回归生成式世界模型——把世界建模视为对分词化视觉观测的序列预测任务,代表工作 CogVideo、NUWA、VideoPoet,在具体域应用中演化为 gaia-1-wayve、OccWorld;局限是离散 token 量化会损失高频细节。
  • 扩散式生成式世界模型——从像素空间扩散(VDM)演化到潜空间扩散(Imagen Video、VideoLDM、SVD),Sora、Veo3 展示了扩散模型建模 3D 结构与物理动态的能力,具体应用如 drivedreamervista-driving-world-modelgaia-2-wayve。近期工作(Vid2World、Epona)探索融合扩散的视觉表现力与自回归的时序建模能力。

(3) 世界模型三重角色框架(§5.2,作为组织第 6 章两大应用领域文献表的主轴):神经仿真器(生成可控高保真合成数据,代表 cosmos-predictnvidia-cosmos-transfer1)、动力学模型(模型式强化学习 MBRL 中学习环境动态供想象式 rollout,代表 Dreamer 系列)、奖励模型(用预测似然隐式推断奖励信号,代表 VIPER)。

仿真器技术路线对比(§4.1,主流仿真器逐一点评):Webots/Gazebo(传统 ROS 生态,缺乏 GPU 并行)→ MuJoCo(凸优化接触约束,2021 年被 Google DeepMind 收购,长于接触动力学但渲染弱)→ PyBullet(轻量 Python 封装 Bullet)→ CoppeliaSim(分布式控制架构)→ NVIDIA Isaac 系列(isaac-gym 2021 年首创 GPU 并行大规模物理仿真 → isaac-sim 集成 Omniverse + PhysX 5 + RTX 光追,2025 版 Isaac Sim 5.0 把机械臂抓取精度做到 0.1 mm → isaac-lab-orbit 模块化 RL 框架,tiled rendering 把多相机训练吞吐提升约 1.2 倍)→ SAPIEN(配套 ManiSkill/ManiSkill3 基准)→ genesis-generative-physics(统一刚体/MPM/SPH/FEM/PBD/流体求解器,生成式数据引擎,吞吐比 Isaac Gym 高 2.70×–11.79×,批量规模 512–32,768 环境区间实测)→ newton-physics-engine(NVIDIA/Google DeepMind/Disney Research 2025 联合开发,基于 NVIDIA Warp,GPU 加速带来 70 倍以上仿真加速,兼容 mujoco-playground 与 Isaac Lab 生态)。

数据

本文不训练新模型,“数据”维度体现为对领域数据瓶颈的诊断 + 对被综述工作数据规模的转述。

具身智能数据采集的两大瓶颈(§4 引言):(1) 成本与安全问题——基于遥操作或通用操作接口(UMI)的数据采集对硬件和操作员熟练度有较高要求,且真实实验存在危险场景的安全风险;(2) 可控性与可复现问题——光照、背景、传感器噪声等因素影响数据质量,场景难以完全可控导致实验难以在相同设置下复现。Sim2Real 范式被定位为应对这些瓶颈的关键路径:GPU 加速物理引擎+分布式渲染可低成本、安全地大批量生成数据;仿真器可直接输出像素级真值标注(语义分割、深度图、6D 物体位姿)。

仿真器物理/渲染/传感器能力对比表(Table II–IV,10 款仿真器:Webots、Gazebo、MuJoCo、CoppeliaSim、PyBullet、Isaac Gym、Isaac Sim、Isaac Lab、SAPIEN、Genesis):

物理属性支持较好的仿真器不支持/弱支持
吸附(Suction)Webots / CoppeliaSim / Isaac Sim(原生模块)PyBullet / Isaac Lab / SAPIEN / Genesis
可形变物体MuJoCo / PyBullet(基础);Isaac Gym/Sim/Lab(GPU/PhysX FEM);Genesis(多求解器高精度)Webots / Gazebo / CoppeliaSim / SAPIEN
流体机制Webots / Gazebo(基础浮力/阻力模拟,精度有限);Isaac Sim(粒子法,更复杂流体行为);Genesis(原生高保真,综合最强)MuJoCo / CoppeliaSim / PyBullet / Isaac Gym / Isaac Lab / SAPIEN 均不原生支持
DEM 离散元仿真Gazebo(标记支持,但靠插件间接实现,如 NASA OceanWATERS 项目,非真正颗粒级仿真)其余 9 款均不支持
可微物理MuJoCo(MJX/JAX)、PyBullet(Tiny Differentiable Simulator 子项目)、Genesis(MPM 求解器已实现,规划扩展到刚体/关节体求解器)CoppeliaSim / Isaac Gym / Isaac Sim / Isaac Lab / SAPIEN

渲染能力(Table III):Isaac Sim/Lab(Omniverse RTX 渲染器)、SAPIEN(SapienRenderer,Vulkan)、Genesis(PyRender+LuisaRender)三家同时支持光线追踪、基于物理的渲染(PBR)与可扩展并行渲染;ManiSkill3(基于 SAPIEN)实测在高端 GPU 上可达 30,000+ FPS 的并行渲染吞吐。传感器/关节类型(Table IV):IMU/力/RGB 相机为大多数平台标配;LiDAR 缺失于 Isaac Gym 与 SAPIEN;GPS 缺失于 MuJoCo/PyBullet/SAPIEN;螺旋关节(Helical joint)仅 Gazebo 与 CoppeliaSim 原生支持。

被综述工作中的具体数据规模(散见于第 6 章文献表,按论文原文转述):GAIA-1 使用 90 亿参数自回归 Transformer,训练于 4,700 小时专有驾驶数据;V-JEPA 2 是 12 亿参数联合嵌入预测模型,两阶段训练——先在 100 万+小时无动作视频上预训练获得物理直觉,再用仅 62 小时机器人数据做动作条件微调;Whale-X 是 4.14 亿参数模型;SWIM 在人类视频上预训练、仅需极少机器人数据微调即可在 30 分钟内掌握新技能;GAIA-2 训练数据覆盖英国/美国/德国等多地理环境的专有驾驶模型隐向量。

训练方法

本文不提出新训练方法,“训练方法”维度体现为对被综述工作训练范式的系统归类。

世界模型三重角色对应的三类训练范式(§5.2 / §6):

  1. 作为神经仿真器——直接学习生成可控合成视频/3D 场景用于下游感知/策略训练的数据增强,典型如 cosmos-predict 的”视频过滤→分词→预训练→下游适配”全栈流水线,DreamGen 提出 4 阶段流水线合成跨行为/跨环境的照片级真实数据并从生成视频中反推伪动作标签,实现零样本泛化。
  2. 作为动力学模型(MBRL)——智能体学习动态模型+奖励模型,在想象 rollout 中做规划/策略优化而非依赖真实交互;Dreamer 系列用变分自编码+RSSM 编码高维观测为紧凑潜在轨迹;iVideoGPT 用 VQ-VAE 把视频/动作/奖励token化后用 Transformer 自回归预测;ContextWM 在真实世界视频上预训练获得可迁移视觉动态先验。
  3. 作为奖励模型——VIPER 在专家演示上训练自回归视频预测模型,用在线智能体行为的预测似然作为奖励信号,越符合模型预期的轨迹奖励越高,从而摆脱人工设计奖励函数,并支持跨具身泛化(不同机械臂/场景布局间迁移)。

关节式机器人世界模型文献表(Table,§6.2,按”神经仿真器/动力学模型/奖励模型”三分类横跨 2018–2025 年约 40 篇工作,逐条标注输入模态[图像/本体感知/文本/动作/几何/触觉]、架构[RSSM/JEPA/Diffusion/DiT/Transformer/GRU+MLP/TD-MPC 等]、实验平台与代码开放情况)中的代表性训练细节:DreamGen 4 阶段流水线;EnerVerse 用自回归视频扩散+Free Anchor Views 做 4D 世界建模,EnerVerse-D 融合 4D 高斯泼溅缩小 sim2real 差距;TWIST 用”状态特权教师模型监督图像学生模型”的师生蒸馏加速 sim2real;MoDem-V2 首次实现无需额外仪器的真实世界视觉 MBRL 直接训练;PIN-WM 用可微仿真+高斯泼溅观测损失做物理信息世界模型端到端学习。

自动驾驶世界模型文献表(Table,§6.1,约 30+ 篇工作)中的代表性训练范式:DriveDreamer 采用两阶段训练(第一阶段学习结构化交通约束,第二阶段做未来状态预测);DriveDreamer-2 首次实现”LLM 文本查询→轨迹生成→HDMap 生成→UniMVM 视频合成”的自然语言驱动场景生成流水线;MagicDrive-V2 用三阶段渐进式自举训练策略支持 848×1600 分辨率、241 帧的长时视频合成;DriveDreamer4D 提出”表亲数据训练策略”融合真实与合成数据优化 4D 高斯泼溅重建。

Infra(训练 / 推理工程)

综述本身不训练模型,未披露任何自有 GPU 数量、GPU-hours、并行策略或训练精度数字。“Infra”维度的实质内容是仿真器工程能力对比与个别被综述工作的推理性能数字:

仿真器 GPU 工程能力:Isaac Gym 率先在单 GPU 上并行仿真+渲染数千个环境(含相机传感器);Isaac Sim/Lab 支持多 GPU 训练(每进程独立 Isaac Sim 实例)及多 GPU 渲染复杂场景/多相机;Genesis 吞吐比 Isaac Gym 高 2.70×–11.79×(批量规模 512–32,768 环境);NVIDIA Newton 基于 NVIDIA Warp 框架实现 GPU 加速带来 70 倍以上仿真加速;ManiSkill3(SAPIEN 生态)GPU 并行视觉数据采集在高端 GPU 上可达 30,000+ FPS;Isaac Sim 5.0(2025)把机械臂抓取精度做到 0.1 mm 级;Isaac Lab 的 tiled rendering 技术把多相机训练吞吐提升约 1.2×

被综述工作的推理侧数字:SSWM 通过并行化动态模型训练+特权信息利用,实现世界模型训练加速 10 倍、MBRL 整体加速 4 倍(四旋翼飞行任务);PIVOT-R 相比基线效率提升 28×;HWM 通过参数共享策略把模型体积压缩 33%–53%,适配资源受限的学术级部署环境。除此之外,论文未披露任何具体的控制频率(Hz)、边缘硬件型号或统一的推理延迟基准。

评测 benchmark

本文不构建统一新基准,其”评测”维度体现为对被综述工作分散评测结果的转述汇编,以及仿真器能力对比表本身。

仿真器能力对比表(Table II/III/IV,详见”数据”一节)——这是全文唯一由作者自己”评测”(横向打分)产出的表格,覆盖 10 款仿真器 × 7 项物理属性 + 4 项渲染能力 + 5 类传感器 + 6 类关节类型。

关节式机器人世界模型文献表中转述的具体成功率/指标(§6.2.1–6.2.3,均为原论文中被引用工作的原始报告数字,非本综述自测):

  • Surfer 在 SeaWave 基准上达到 54.74% 成功率,超越基线;
  • PIVOT-R 在 SeaWave 基准上取得 19.45% 相对提升,同时效率提升 28×
  • GAS(外科手术机器人操作)在处理未见物体与干扰时达到 69% 成功率;
  • HarmonyDream 在多个视觉机器人任务上取得 10%–69% 的性能提升,并刷新 Atari 100K 基准记录;
  • V-JEPA 2 通过视觉子目标规划实现模型预测控制,在新环境中达到 65%–80% 成功率,并配套发布 3 个评估物理推理能力的新基准;
  • WMR(盲人形机器人运动)通过 3.2 公里跨冰面/雪地/可形变地形的实地徒步验证鲁棒性;
  • DreamerV3 在 150+ 种多样化任务上以单一配置达到 SOTA,并首次实现无人类数据/无课程学习下在 Minecraft 中采集钻石;
  • Puppeteer 在 8 个任务上为 56 自由度人形机器人实现高性能全身运动合成,无需简化假设或奖励工程。

自动驾驶世界模型文献表中转述的具体数字:ReconDreamer 是首个能有效渲染跨越 6 米多车道变换等大幅度机动的方法;MagicDrive-V2 支持合成 848×1600 分辨率、241 帧的长时视频;OccSora 生成 16 秒长的 3D 占据栅格视频。

论文强调传统的均方误差(MSE)等预测精度指标不足以衡量世界模型对下游任务的实际效用,呼吁开发能评估规划效用、安全鲁棒性、因果相关性的新评测框架(详见”创新点与影响”中的挑战列表)。

创新点与影响

贡献

  1. 首次提出融合”智能认知”与”自主行为”两个维度的机器人能力分级标准(IR-L0~IR-L4),填补 DARPA Robotics Challenge、ISO 13482 等既有框架的空白。
  2. 首次系统梳理”物理仿真器 × 世界模型”在具身智能发展中的互补关系,而非像既有综述那样只聚焦单一组件。
  3. 对 10 款主流物理仿真器做物理仿真能力(吸附/外力/可形变/软体接触/流体/DEM/可微)、渲染能力(渲染引擎/光追/PBR/并行渲染)、传感器与关节类型支持的三维系统对比。
  4. 梳理世界模型五大架构谱系(RSSM/JEPA/Transformer-SSM/自回归生成式/扩散生成式)与三重角色(神经仿真器/动力学模型/奖励模型),并分别用两张大表盘点自动驾驶(30+ 篇)与关节式机器人(40 篇)两个应用领域的世界模型文献。

它改变了什么:把此前分散的机器人仿真器综述(如 [19,20,21])与世界模型综述(如 [22,23,24])统一到同一套分析框架下,用”外部显式仿真 vs. 内部生成式建模”的对立统一视角组织全文,并首次把 IR-L0~IR-L4 分级标准与仿真器/世界模型的技术演进直接挂钩,为后续工作提供了跨仿真器选型、跨世界模型架构选型的横向对照表。

作者自陈的挑战与未来方向(§6.3,九项):

  1. 高维度与部分可观测性——相机/LiDAR/雷达等高维观测带来巨大计算负担,且智能体永远无法感知环境完整状态,需要鲁棒的状态估计或信念状态维护。
  2. 因果推理 vs. 相关性学习——当前世界模型擅长学习相关性(如刹车灯与减速的相关)而非真正的因果/物理理解,阻碍反事实推理与分布外泛化。
  3. 抽象与语义理解——有效的世界模型需要超越低层信号预测,融合精细物理预测与交通规则/行人意图/物体功能可供性等抽象概念推理。
  4. 系统性评测与基准——传统 MSE 等指标不足以反映下游任务性能,需要评估规划效用、安全鲁棒性、因果相关性的新评测框架。
  5. 记忆架构与长期依赖——长期预测因误差累积和环境随机性而困难,需要 Transformer/SSM 等架构管理长期依赖(如记住几分钟前看到的”前方施工”路牌)。
  6. 人机交互与可预测性——面向人类中心环境的智能体行为须”合法可读、可预测、符合社会规范”,技术最优但行为怪异的动作可能使人类困惑甚至导致不安全交互。
  7. 可解释性与可验证性——深度学习世界模型是”黑箱”,安全关键场景(自动驾驶事故复盘)需要审计其内部决策逻辑,形式化验证(如证明模型永不产生危险障碍物幻觉)仍是巨大挑战。
  8. 组合泛化与抽象——sim-to-real gap 之外更深层的挑战是组合泛化:人类能把”杯子”和”桌子”组合成”桌上的杯子”并立即泛化,而当前模型往往需要大量特定组合样例的曝光。
  9. 数据管理与偏差——世界模型的表现从根本上受训练数据质量与构成制约,会继承甚至放大数据中的偏差(如某地区数据训练的模型在道路规则不同的另一地区表现不佳),长尾罕见但安全关键事件的系统性识别与采集是核心难题。

原始链接

一手源存档(sources/)