一句话定位

南开大学、天津理工大学、电子科技大学(UESTC)联合团队的具身智能世界模型综述:提出”功能耦合(Decision-Coupled vs. General-Purpose)× 时序建模(Sequential Simulation and Inference vs. Global Difference Prediction)× 空间表示(Global Latent Vector / Token Feature Sequence / Spatial Latent Grid / Decomposed Rendering Representation)“三轴统一分类法,用两张大表把约 50 篇机器人世界模型工作与约 31 篇自动驾驶世界模型工作逐一归位,并系统汇总数据资源、评测指标与跨方法量化对比。

背景与定位

作者 Xinqing Li、Xin He、Le Zhang、Yun Liu(通讯作者)。机构:Xinqing Li 与 Yun Liu 来自南开大学计算机学院(天津);Xin He 来自天津理工大学计算机科学与工程学院;Le Zhang 来自电子科技大学(UESTC)信息与通信工程学院(成都)。2025-10-19 提交 arXiv(LaTeXML 生成时间戳 2025-10-19),配套维护 GitHub 仓库 Li-Zn-H/AwesomeWorldModels 作为持续更新的文献索引(截至抓取时已收录 2026 年新条目,如 LeWorldModel)。

与既有综述的差异:论文自陈此前综述走两条路线——功能导向路线(如 Ding et al. 按”理解 vs. 预测”两大核心功能分类,见 understanding-world-or-predicting-future-survey;Zhu et al. 按核心能力分类)与应用导向路线(如 Guan et al.、Feng et al. 聚焦自动驾驶领域的世界模型综述,见 survey-world-models-autonomous-driving)。本文认为具身智能领域缺乏统一分类法,遂提出以”功能耦合、时序建模、空间表示”三轴为核心的统一框架,同时覆盖机器人(操作/导航/腿式运动)与自动驾驶两大应用域。可与同期综述 embodied-intelligence-simulators-world-models-survey(侧重”仿真器×世界模型”互补关系)互相参照——本文更聚焦世界模型自身的架构谱系与量化对比,不涉及物理仿真器工程对比。

范式定位:世界模型被定义为具身智能体的”内部模拟器”,通过前向和反事实 rollout 支持感知、预测与决策;文章将其与静态场景描述器、不具备可控动态的纯生成式视觉模型(如无条件视频生成)明确区分开。

模型架构

本文是纯综述,其”架构性”贡献是一套形式化 + 三轴分类法,而非单一模型设计。

(1) 统一数学形式化(§2.2):把环境交互建模为 POMDP,定义 null 初始动作 $a_0$ 使动态可统一书写。在每个时间步,智能体接收观测 $o_t$、执行动作 $a_t$,真实状态 $s_t$ 不可观测;世界模型用一步滤波后验推断潜状态 $z_t$:

  • Dynamics Prior: $p_\theta(z_t \mid z_{t-1}, a_{t-1})$
  • Filtered Posterior: $q_\phi(z_t \mid z_{t-1}, a_{t-1}, o_t)$
  • Reconstruction: $p_\theta(o_t \mid z_t)$

直接最大化对数似然不可解,转而优化 ELBO,在 Markov 分解假设下分解为「重建项」+「KL 正则项」(对齐滤波后验与动态先验)。文章指出,现代世界模型无论用 RNN、Transformer 还是扩散解码器实例化,本质上都遵循这一”重建-正则化”训练范式,潜轨迹 $z_{1:T}$ 作为下游策略优化/MPC/反事实推理的紧凑记忆。

(2) 三轴分类法(§3):

  • 轴一·功能耦合:Decision-Coupled(任务特定,为特定决策任务优化动态)vs. General-Purpose(任务无关的通用仿真器,如 Sora、v-jepa-2)。
  • 轴二·时序建模:Sequential Simulation and Inference(自回归逐步展开)vs. Global Difference Prediction(并行直接估计整段未来,效率更高但时序连贯性可能下降)。
  • 轴三·空间表示(4 类):Global Latent Vector(压缩向量,支持实时计算,如 RSSM)、Token Feature Sequence(离散 token 序列,支持因果推理/多模态融合/LLM 复用)、Spatial Latent Grid(BEV/voxel 等几何先验网格)、Decomposed Rendering Representation(3DGS/NeRF 等可渲染基元 + 可微渲染)。

(3) 两张分类总表:Table I 用”分类法标签/骨干特征/数据平台/输入模态/是否真机验证”六维度逐条归位约 50 篇机器人世界模型工作(从 planet(PlaNet, RSSM 开创者)、dreamer-v1/dreamer-v2/dreamer-v3transdreamer(TSSM)、iris(Token Transformer)一路到 2025 年的 v-jepa-2(JEPA,15 个数据平台,规模最大)、dino-wm(DINOv2 特征空间动态)、mineworldadaworldyume、villa-X);Table II 用同样维度归位约 31 篇自动驾驶世界模型工作(occworlddrivedreamer/drivedreamer-2/drivedreamer4dvista-driving-world-modeldome-occupancy-world-modelrecondreamercopilot4d-waabigenad-generalized-predictive-modelhermes-driving-world-modelepona-autoregressive-diffusion 等)。

代表性骨干映射(按空间表示轴举例,非穷尽):Global Latent Vector→RSSM/TSSM(dreamer-v3/transdreamer)、Mamba(GLAM);Token Feature Sequence→Transformer/LLM/DiT(iris、DrivingWorld、Epona);Spatial Latent Grid→BEV/occupancy Transformer 或扩散(occworlddome-occupancy-world-model、BEVWorld);Decomposed Rendering Representation→3DGS/NeRF(ManiGaussian、recondreamer、GaussianWorld、InfiniCube)。

数据

本文不训练新模型,“数据”维度体现为对 4 类数据资源的系统盘点(Table III,§4.1)及后文文献表中转述的规模数字:

仿真平台:MuJoCo(2012,物理引擎)、CARLA(2017,Unreal Engine 城市驾驶仿真,含闭环评测协议)、Habitat(2019,光真实感室内导航)、Isaac Gym(2021)/Isaac Lab(2023,GPU 加速大规模机器人学习)。

交互式基准:Atari(2013,55+ 款游戏)、DMC(2018,30+ 项连续控制任务)、Meta-World(2019,50 项多任务操作,Sawyer 臂)、RLBench(2020,100 项桌面操作任务)、nuPlan(2021,超 1,500 小时真实驾驶日志)、LIBERO(2023,130 项终身学习操作任务)。

离线数据集(原文披露的具体规模)

  • RT-1:17 个月采集周期,13 台 Everyday Robots 移动操作臂,130,000 条示范,覆盖 700+ 任务,11-DoF 离散化动作 + 语言指令。
  • Open X-Embodiment (OXE):聚合 60 个来源、21 家机构、22 种机器人本体、527 项技能、超 100 万条轨迹的跨具身统一格式语料。
  • HM3D:1,000 个室内重建场景,112,500 m² 可导航面积。
  • nuScenes:360° 传感器套件(6 相机/5 雷达/1 LiDAR/GPS-IMU),1,000 个 20 秒场景(波士顿+新加坡),23 类密集 3D 标注 + HDMaps,官方切分 700/150/150。
  • Waymo:1,150 个 20 秒场景(10Hz),旧金山/凤凰城/山景城,5 LiDAR + 5 相机,约 1,200 万条 2D/3D 标注,切分 798/202/150。
  • Occ3D:Occ3D-nuScenes 约 40,000 帧(0.4m 分辨率);Occ3D-Waymo 约 200,000 帧(0.05m 分辨率)。
  • Something-Something v2 (SSv2):220,847 条片段,174 类动作,切分 168,913/24,777/27,157。
  • OpenDV:GenAD 提出,2,059 小时6,510 万帧,来自 YouTube + 7 个公开数据集,覆盖 40+ 国家 244 座城市,附带指令/上下文标注。
  • VideoMix22M:V-JEPA 2 引入,从 200 万扩展到 2,200 万样本,来源 YT-Temporal-1B(检索式过滤降噪)、HowTo100M、Kinetics、SSv2、ImageNet(静态图转视频片段)。

真机平台:Franka Emika(7-DoF,1 kHz 力矩控制)、Unitree Go1(全景深度感知,机载算力 1.5 TFLOPS,最高时速 4.7 m/s)、Unitree G1(43-DoF,膝关节扭矩 120 N·m,集成 3D LiDAR + 深度相机)。

训练方法

本文不提出新训练方法,其方法论贡献体现在两处:(1) §2.2 给出的”重建-正则化”统一形式化目标(见”模型架构”节公式),指出无论具体架构是 RNN、Transformer 还是扩散解码器,本质上都在优化同一 ELBO;(2) §3 逐条归纳被综述工作按”功能耦合×时序建模”分组后的训练范式差异:

  • Decision-Coupled + Sequential:以 Dreamer 系列的想象式 rollout(在潜空间中展开策略优化)为范式基石;IDM(Inverse Dynamics Modeling)分支(如 GLAMOR、Iso-Dream)通过推断初末状态间所需动作来训练,用于分解可控/不可控成分。
  • Decision-Coupled + Global:villa-X、VidMan 等将扩散模型与 IDM 耦合,villa-X 推断潜动作并与自我中心前向动态对齐,VidMan 用自注意力适配器把预训练视频扩散模型改造为 IDM。
  • General-Purpose + Sequential:视频扩散模型自回归化(如 Vid2World 通过因果化改造),或两阶段训练(GenAD 先做通用视频预测预训练、再做文本/动作条件微调)。
  • General-Purpose + Global:JEPA 范式(v-jepa 预测被遮挡时空区域的潜特征而非重建像素;v-jepa-2 在大规模互联网视频上预训练后用有限机器人交互数据做动作条件后训练)与掩码视觉序列预测(WorldDreamer)并行发展。

Infra(训练 / 推理工程)

本文是综述,不训练自有模型,未披露任何自身的 GPU 数量、GPU-hours、并行策略或训练精度。“Infra”维度的实质内容限于数据资源表中披露的真机/仿真平台工程规格:

  • Franka Emika 支持 1 kHz 力矩控制,适配接触密集型任务。
  • Unitree Go1 机载算力 1.5 TFLOPS,最高速度 4.7 m/s
  • Unitree G1 具备 43-DoF、膝关节扭矩 120 N·m,集成 3D LiDAR 与深度相机、可更换电池。
  • NVIDIA Isaac 技术栈(Isaac Sim/Gym/Lab)定位为”端到端 GPU 加速仿真栈”,提供光真实感渲染与大规模 RL 能力,但本文未给出具体加速倍数或吞吐数字(不同于姊妹综述 embodied-intelligence-simulators-world-models-survey 中对仿真器的量化对比)。
  • 推理侧:论文在”挑战与趋势”中明确指出 Transformer/扩散网络虽性能强但推理成本高,与机器人实时控制需求冲突,因而 RNN/全局潜向量类方法仍被广泛使用;未给出具体的控制频率(Hz)或延迟基准数字。

评测 benchmark

§5 按任务目标组织跨方法量化对比,全部为转述自各原始论文的已发表数字(非本综述自测):

像素生成(Table IV,nuScenes 验证集,17 种方法):DrivePhysica 视觉保真度最佳(FID 4.0,分辨率 256×448),MiLA 时序一致性最佳(FVD 14.9,分辨率 360×640);对比 DriveDreamer(FID 52.6 / FVD 452.0,128×192,早期基线)与 Vista(FID 6.9 / FVD 89.4,576×1024,高分辨率代表)。

4D 占据预测(Table V,Occ3D-nuScenes,给定过去 2s 预测未来 3s):占据输入(Occ)方法整体优于纯相机方法;加入 GT 自车轨迹辅助监督可进一步缓解 2–3s 处的性能衰减。COME(GT 自车轨迹版本)取得最佳平均 mIoU 34.23% / 平均 IoU 44.13%;不使用辅助监督、纯预测轨迹的 Occ 输入方法中 DTT-O 表现最佳(平均 mIoU 30.85% / 平均 IoU 74.58%)。

评测指标本身按三层抽象组织(§4.2):像素生成质量(FID、FVD、SSIM、PSNR、LPIPS,以及覆盖 16 个维度的 VBench)、状态级理解(mIoU、mAP、ADE/FDE 位移误差、Chamfer Distance)、任务表现(Success Rate、Sample Efficiency、累积奖励/Reward、Collision Rate),体现”从低层信号保真度到高层目标达成”的递进。

控制任务

  • DMC(Table VI,像素输入 64×64×3,Episode Return 满分 1000):Dreamer 在 5M 步预算下,于 Reacher Easy/Cheetah Run/Finger Spin/Walker Walk 四项子任务分别取得 935/895/499/962,其 Avg/Total 列报告在 20 项任务上的整体均值为 823;HRSSM 仅用 500k 步在 3 项任务上均值达 938,显示数据效率的持续提升。论文脚注同时提醒:不同方法评测的任务子集、步数预算并不统一,Avg 仅作粗略参考,不能作严格的跨方法比较。
  • RLBench(Table VII,Success Rate %,5 种方法在不同任务集/分辨率/episode 预算下评测):VidMan(IDM 架构)在其 18 项任务上平均成功率 67% 为最高,其中 Slide Block 98%、Open Drawer 94%、Sweep to Dustpan 93%;TesserAct(DiT 架构,10 项任务)均值 63%;ManiGaussian(3DGS,10 项任务)均值 45%
  • nuScenes 开环规划(Table VIII,观测过去 2s 预测未来 3s 的 BEV 轨迹,L2 误差 + 碰撞率):UniAD+DriveWorld 在大量辅助监督下取得最低平均 L2 0.69m;SSR 在无额外监督条件下取得最佳平均碰撞率 0.15%(同时 L2 0.75m 具竞争力),显示纯相机输入的端到端规划方法已能超越依赖特权占据信息的方法。

创新点与影响

贡献

  1. 提出”功能耦合 × 时序建模 × 空间表示”三轴统一分类法,弥合此前 RL / 视频生成 / 自动驾驶 / 机器人操作等子社区在术语和分类上的不一致。
  2. 用两张系统性大表(约 50 篇机器人工作 + 约 31 篇驾驶工作)首次把如此规模的世界模型文献按统一维度(分类标签/骨干特征/数据平台/输入模态/真机验证)横向对齐。
  3. 系统整理 4 类数据资源(仿真平台/交互式基准/离线数据集/真机平台)与 3 个抽象层级的评测指标(像素生成质量/状态级理解/任务表现),为跨领域评估提供统一基础。
  4. 提供四张量化对比表(像素生成、4D 占据预测、DMC 控制、RLBench 操作、nuScenes 规划),把分散在各论文中的数字汇编成可直接横向比较的表格。

它改变了什么:把此前按”理解 vs. 预测”(Ding et al.)或按单一应用域(自动驾驶)组织的世界模型文献,重新组织进一套显式区分”任务耦合程度、时序展开方式、空间编码策略”的正交坐标系,使得跨子领域(游戏 RL、机器人操作、自动驾驶、通用视频生成)的方法可以被放进同一张表格比较架构选择的得失。

论文自陈的局限/挑战(§6,对应三个维度):

  1. 数据与评估——具身智能横跨导航/操作/驾驶等多个领域,仍缺乏统一大规模数据集,碎片化制约世界模型的泛化能力;FID/FVD 等指标只衡量像素保真度,忽视物理一致性、动态因果性,即便 EWM-Bench 等新基准也仍是任务特定的,缺乏跨域标准。
  2. 计算效率——Transformer 和扩散网络性能强但推理成本高,与机器人实时控制的需求相冲突,因此 RNN、全局潜向量等传统方法尽管长程建模能力有限,仍因计算效率优势被广泛沿用。
  3. 建模策略——长时程时序动态与高效空间表示之间存在结构性权衡:自回归设计紧凑高效但会累积误差,全局预测提升多步连贯性但计算重、闭环交互性弱;潜向量/token 序列/空间网格在效率与表达力之间各有取舍,3DGS/NeRF 等分解渲染表示保真度高但在动态场景中扩展性差。论文认为 SSM(如 Mamba)、JEPA 式掩码方法,以及融合自回归与全局预测优势的混合架构(显式记忆/分层规划/CoT 式任务分解)是有前景的方向。

原始链接

一手源存档(sources/)