一句话定位
华中科技大学(Xiang Bai 组:Sifan Tu、Xin Zhou、Dingkang Liang、Xingyu Jiang)联合百度的驾驶世界模型(Driving World Model,DWM)纲领性综述:把 DWM 按预测场景的模态——2D 图像 / 3D(occupancy、点云)/ 无场景(scene-free:隐状态、多智能体行为)——系统归类到一张 47 个代表方法的总表(Table 1,Core Architecture × Scene Modality × Condition × Response 四栏),再从仿真、数据生成、前瞻式驾驶(anticipative driving)、4D 预训练四个应用维度总结 DWM 对自动驾驶的贡献,并汇编数据集与评测指标补足该领域”无统一 benchmark”的空白。2025-02 首发 arXiv,配套 GitHub 仓库 Awesome-World-Model 持续追加论文,截至存档时已收录到 2026 年中的条目(HERMES、UniFuture、HERMES++ 等均由同一作者团队后续产出)。本页正文以 2025-02 的 arXiv v1 为准。
背景与定位
Driving World Model 这一提法直接继承 Ha & Schmidhuber world-models-ha-schmidhuber 对世界模型的原始定义——依据历史观测与动作预测未来观测——并把这条思路落到自动驾驶的场景演化预测任务上。论文开篇指出此前 DWM 相关综述存在两类缺陷:一类聚焦通用世界模型而未细分驾驶场景下的具体应用类别(如 understanding-world-or-predicting-future-survey);另一类虽讨论自动驾驶但对 DWM 的应用缺乏细致分类。本文的定位是首次按”预测场景模态”系统分类 DWM 方法,同时补上”DWM 究竟如何服务自动驾驶”这条应用线(仿真/数据生成/前瞻式驾驶/4D 预训练)。
技术脉络上大量交叉引用同期代表性工作:gaia-1-wayve(把场景演化预测形式化为 next-token prediction + 扩散解码器,是该领域的开创性工作)、drivedreamer/drivedreamer-2(条件扩散多模态可控生成,DriveDreamer-2 用 LLM 把高层文本指令转成低层控制条件)、vista-driving-world-model(stable video diffusion + 新损失函数实现高保真高分辨率生成)、drive-wm-driving-into-the-future(分解联合建模提升多视角一致性,并把 DWM 预测接入规划)、occworld/occsora/dome-occupancy-world-model(occupancy 栅格演化预测)、copilot4d-waabi(VQ-VAE + 并行化离散扩散做点云生成)、vidar-visual-point-cloud-forecasting(视觉点云预测式可扩展预训练)、hermes-driving-world-model(结合视觉点云预测与语言任务,显著超过 ViDAR)、infinitydrive、drivingworld-gpt、doe-1、gaussianworld-occupancy、gaia-2-wayve、drivedreamer4d、drive-occworld 等。
模型架构
本文不提出新架构,“架构”贡献是把 47 个 DWM 代表方法(Table 1)系统列表并归纳为三条技术路线:
2.1 2D Scene Evolution(图像空间):GAIA-1 首创把场景演化预测形式化为 next-token prediction 任务并用扩散解码器捕捉时空动态与高层结构;DriveDreamer 推进条件扩散框架实现多模态控制并延伸到合成数据生成。后续工作分三个方向改进:① 保真度——Vista 用 stable video diffusion + 新损失函数、多参考帧确保动态行为与结构完整性;② 3D 一致性——Drive-WM 通过”以相邻视角为条件预测中间视角”的分解联合建模显著提升多视角一致性,DrivePhysica 引入 3D 边界框坐标条件强化遮挡结构理解,WoVoGen 预测显式世界体积(world volume)指导多视角生成以保证 intra-world/inter-sensor 一致性,NeMo/GEM 把 3D 预测任务并入框架,BEVWorld 进一步整合多传感器输入;③ 时序一致性——InfinityDrive 提出多分辨率时空建模框架、训练中渐进扩展时间感受野并引入记忆机制保留长程依赖,DrivingWorld 提出时序感知 tokenization、next-state prediction、随机 token dropout、平衡注意力策略组合解决自回归方法的时序连贯性问题。控制条件分两类:低层条件(action/trajectory/layout,精确规定自车运动与物体位置)与高层条件(text/destination,需模型自行生成合理的中间步骤);GEM 能同时平衡两类条件,DriveDreamer-2 用 LLM 从高层文本推导多样化低层条件。
2.2 3D Scene Evolution(occupancy / 点云):Occupancy 分支——OccWorld 用时空 Transformer 从历史观测生成未来场景与自车位姿 token,通过空间混合实现全局一致的场景预测;OccLLaMA 把多模态大语言模型作为核心架构;RenderWorld 对”空气栅格”与”非空气栅格”分别 tokenize 做细粒度 3D 场景建模;OccSora(扩散)支持基于任意轨迹预测 4D occupancy 演化;DOME 用连续 VAE-like tokenizer 保留精细空间信息;针对 occupancy 计算开销大的问题,DFIT-OccWorld 只预测动态体素流、静态体素通过位姿变换直接计算,GaussianWorld 显式在高斯空间建模场景变化(只关注变化量而非重建整个场景)。Occupancy 无法直接从传感器获取,因此从图像重建 occupancy 是关键:DriveWorld 分别传播静态空间上下文与预测动态时序变化,从多视角视频学习时空表征实现精确 occupancy 预测;Drive-OccWorld 用运动感知 BEV 序列作为中介,结合规划器直接从多视角图像预测 occupancy 和 flow。也有方法从点云自监督生成 occupancy 伪标签:UnO 从未来 LiDAR 扫描采样正负样本生成连续 occupancy 场;UniWorld/NeMo 通过体素化点云生成伪标签,NeMo 进一步融合图像预测与运动流模块。点云分支——Copilot4D 用 VQ-VAE tokenizer 处理复杂观测并采用并行化推理加速的改进离散扩散;LidarDM 结合静态场景与运动物体实现 layout-aware 点云视频生成。视觉点云预测(不直接输入点云、仅用历史图像预测未来点云演化)——ViDAR 把此任务作为可扩展预训练任务,探索语义/3D 结构/时序动态的融合;HERMES 结合视觉点云预测与语言任务,尽管 ViDAR 用了更长历史窗口和更先进的隐式渲染模块,HERMES 仍显著超过它。多传感器融合——MUVO 把多模态数据整合进传感器无关的几何表征,联合建模图像/occupancy/点云;BEVWorld 把图像与点云融合进统一 BEV 表征、用扩散预测未来表征、再用基于渲染的方法重建多传感器数据实现自监督;HoloDrive 用两个独立模型对齐联合生成多相机数据与 LiDAR 数据。
2.3 Scene-free Paradigms(无显式场景):隐状态——RL 规划器常依赖隐空间 DWM 获得精确稠密奖励、高效并行训练与可解释输出;LatentDriver 把预测的隐状态与可能动作建模为混合分布捕捉决策的随机性;LAW 用自监督隐特征增强端到端驾驶并提升效率。多智能体行为——TrafficBots 以目的地为条件让每个 agent 学习独特”个性”并从 BEV 视角预测动作;CarFormer 把每个物体建模为自监督 slot 表征;AdaptiveDriver 预测周围智能体的独特行为模式,再展开对应 DWM 模拟其行为。
具体网络层数/隐维度/分辨率等 config 数字本综述未逐一披露(属跨方法归纳性质),需回溯各自原始论文核实。
数据
本文是纯文献综述,不训练模型、无自有数据集,但系统汇编了自动驾驶领域高影响力数据集的规模指标(Table 2,均转引自各数据集原始发布,非本文实验产出):
| 数据集 | 模态(2D/3D/Text) | # 城市 | # 场景 | 时长(h) |
|---|---|---|---|---|
| CARLA (2017) | ✓/✓/✗ | - | - | - |
| KITTI (2013) | ✓/✓/✗ | 1 | 22 | 1.5 |
| KITTI-360 (2022) | ✓/✓/✗ | 1 | 366 | 2.5 |
| Waymo Open (2020) | ✓/✓/✗ | 3 | 1k | 6.4 |
| nuScenes (2020) | ✓/✓/✗ | 2 | 1k | 5.5 |
| Argoverse2 Sensor (2021) | ✓/✓/✗ | 6 | 1k | 4 |
| Argoverse2 LiDAR (2021) | ✗/✓/✗ | 6 | 20k | 167 |
| OpenScenes (2023) | ✓/✓/✗ | 4 | - | 120 |
| OpenDV-2K (2024) | ✓/✗/✓ | ≥244 | - | 2,059 |
| DrivingDojo (2024) | ✓/✗/✓ | 9 | 18k | 150 |
文中特别指出 DrivingDojo 是专为训练 DWM 而设计(覆盖复杂驾驶动态场景);OpenDV-2K 以其 ≥244 个城市、2,059 小时的规模成为纯图像+文本模态数据里覆盖面最广的一支;Argoverse2 LiDAR 是唯一以点云规模(20k 场景、167 小时)取胜但不含 2D/文本标注的数据集。
训练方法
本文把”训练方法”呈现为对既有范式的应用分类(Sec 3),而非自有方法:
- 仿真(3.1):DWM 作为数据驱动的生成式模拟器,弥补传统仿真器(如 CARLA)多样性有限、仿真-真实域差距大的短板。Vista 提供高保真高可控视频仿真支持动作评估;GEM 进一步提升仿真质量并可精确控制物体动力学/轨迹/人体姿态;ACT-Bench 提出动作保真度评测框架并给出与动作指令强对齐的基线;TrafficBots 研究 bot agent 行为真实性。RL 方法尤其受益于 DWM 仿真的灵活性:Think2Drive 在隐状态空间 rollout,无需与重型物理仿真器交互即可高效并行训练;Imagine-2-Drive 用高保真 DWM 模拟并评估多步轨迹,显著提升规划性能。
- 数据生成(3.2):相较仿真侧重”忠实复现条件”,数据生成侧重”多样性与保真度”以扩大场景覆盖、缩小与真实数据的差距。DrivePhysica 可合成无限量高保真多样驾驶视频,LidarDM 生成高质量 LiDAR 数据,HoloDrive 展示对齐多模态数据合成的潜力,这些合成数据可提升下游任务(如 3D 检测)表现。DriveDreamer4D、ReconDreamer 等新方法进一步合成新轨迹(非真实采集轨迹)驾驶视频,缓解真实数据集的分布不均衡问题。
- 前瞻式驾驶 / Anticipative Driving(3.3):DWM 预测多个候选动作的结果,再评估选出最优动作。Drive-WM 结合 DWM 预测与奖励函数选择最优轨迹;Drive-OccWorld 把 BEV embedding 引入规划器进一步细化;ADriver-I 结合多模态大语言模型与视频扩散模型联合预测 vision-action 对(图像+描述自车信息的文本),展示长时程规划潜力;OccLLaMA、DrivingGPT、DrivingWorld 等把预测与规划整合进统一模型以获得更强性能与更高灵活性。另一条路线是约束预测与未来观测对齐以提升性能(LAW、Covariate Shift),AdaWM 用预测状态与真实未来状态的差异指导微调,提升对陌生环境的适应性。
- 4D 预训练(3.4):DWM 预测场景演化的目标天然适配自监督大规模预训练。以视觉为中心——UniWorld 从点云生成 occupancy 伪标签用于 4D 预训练;ViDAR 提出隐式渲染算子消除对伪标签的依赖,同时保留学习到的 BEV 表征的判别性 3D 几何、无缝对接下游任务;NeMo 结合 RGB 重建与 occupancy 预测联合学习保留 3D 几何与语义信息的 4D 体积表征;DriveWorld 分别处理时序动态与静态场景,并用任务提示(task prompt)适配多种下游任务。以点云为中心——UnO 通过预测连续 4D occupancy 场(伪标签来自未来点云)学习几何结构/动态/语义;AD-L-JEPA 通过重建掩码嵌入做预训练(JEPA 范式),实现更简单的实现和更强的学习表征;BEVWorld 探索多传感器数据上的预训练,把图像与点云编码进统一 BEV 表征。
Infra(训练 / 推理工程)
未披露——本文是纯文献综述,无自身训练/推理实验,不含 GPU 型号/卡数/GPU-hours/并行策略/精度信息,也无推理 FPS/延迟数字。第 5 节把”效率(Efficiency)“列为该领域的核心限制之一:生成式任务对 DWM 的推理效率构成挑战,增加计算成本与延迟,阻碍实时驾驶应用;精细的 4D 场景表征进一步放大计算与内存需求。文中引用 DFIT-OccWorld 的”解耦场景”(只预测动态体素流、静态体素直接用位姿变换计算)作为已被验证有效的策略,并指出探索更高效的表征是切实可行的研究方向。
评测 benchmark
本文明确指出该领域缺乏标准化 benchmark,其”评测”章节(Sec 4)是对既有数据集与指标的系统汇编,不含本文自身的实验或消融:
常用指标(Table 3):
- Fréchet Inception Distance(FID)↓ — 图像,预测图像与真值图像的特征分布距离
- Fréchet Video Distance(FVD)↓ — 视频,预测视频与真值视频的特征分布距离
- Chamfer Distance(CD)↓ — 点云,预测与真值点云间双向最近邻平均距离
- Intersection over Union(IoU)↑ / mean IoU(mIoU)↑ — occupancy,预测与真值 occupancy 的交并比 / 各类别 IoU 均值
- Displacement Error(L2)↓ — 开环规划,预测轨迹与真值轨迹的 L2 距离
- Collision Rate(Col.)↓ — 开环规划,沿预测轨迹行驶发生碰撞的比率
- Route Completion(RC)↑ — 闭环规划,自车完成路线的百分比
- Infraction Score(IS)↑ — 闭环规划,初始为 1.0,每次违规按惩罚系数递减
- Driving Score(DS)↑ — 闭环规划,RC 与 IS 的乘积
针对”一致性”与”可控性”这两项被认为仍待深入探索的维度,文中汇编了若干专门指标:可控性评估——一种做法是比较训练好的检测器在生成数据上的输出与对应条件的一致性(DriveDreamer4D、ReconDreamer 一脉),另一种是与同一检测器在真值数据上的预测做比较(Drive-WM、GEM、DrivePhysica 一脉);一致性评估——Key Points Matching(KPM,Drive-WM、WoVoGen 采用)评估多相机视频一致性,average point-to-plane energy(LidarDM 采用)评估 LiDAR 视频一致性。
需明确说明:本综述不对 47 个代表方法给出统一 leaderboard 或跨方法可比的数值结果——各方法在各自论文中使用上述指标的不同子集,本文只做指标含义与适用场景的系统整理。
创新点与影响
贡献:(1) 首次按”预测场景模态”(2D 图像 / 3D occupancy-点云 / scene-free 隐状态-多智能体)对 47 个 DWM 代表方法做系统分类,用 Core Architecture × Scene Modality(历史/预测)× Condition × Response 四栏总表(Table 1)呈现;(2) 首次把 DWM 的应用价值拆分为仿真、数据生成、前瞻式驾驶、4D 预训练四个维度,纠正此前”DWM 等同于视频生成”的窄化理解;(3) 系统汇编高影响力数据集(Table 2)与常用/新提出指标(Table 3),直接回应该领域”缺乏标准化 benchmark”的痛点;(4) 配套 GitHub 仓库 Awesome-World-Model 持续追踪领域进展——存档时已收录同一作者团队后续产出的 HERMES(ICCV’25)、UniFuture(ICRA’26)、HERMES++(arXiv 26.5)等工作,以及 2026 年中大量新方法(WorldRFT、X-World、Drive-JEPA 等),是这条研究线索的活跃索引。
本文自陈的局限(第 5 节):① 数据稀缺——长尾但安全攸关场景的采集成本高,数据集规模有限且分布不均;已有工作(DrivingDojo、OpenDV-2K)推进了规模化多样驾驶视频数据集,但高质量 3D 数据与对齐的多传感器数据集仍稀缺,“用 DWM 合成数据反哺 DWM 自身训练”仍是开放问题;② 效率——生成式任务的推理开销与延迟阻碍实时驾驶应用,精细 4D 表征进一步加重计算/内存负担;③ 可靠仿真——长时程 rollout、剧烈视角变化、多样交通与天气下性能显著退化,鲁棒性与泛化能力面临挑战;幻觉与不合理物理(如车辆凭空出现、速度估计错误)可能在正常场景下导致危险决策,DrivePhysica 通过引入额外条件缓解,多模态场景输出配合跨模态校验被认为是另一可行方向;④ 统一任务——现有 DWM 主要靠预测场景演化隐式理解场景,缺乏显式监督;引入图像描述/问答等语言任务、因果推理,以及预测与规划无缝整合的端到端 DWM 被认为是有前景的方向;⑤ 多传感器建模——单模态场景 DWM 不适配依赖多传感器的真实系统,尽管已有多模态融合进展(MUVO、BEVWorld、HoloDrive),利用广泛存在的未对齐甚至非配对多传感器数据仍是有价值的研究方向;⑥ 攻防——对抗攻击可能导致严重事故,但目前几乎没有专门针对 DWM 的对抗攻击研究,被认为是安全部署前必须补齐的空白。
原始链接
- arXiv 摘要页(canonical):https://arxiv.org/abs/2502.10498
- 论文全文 HTML(v1,本页正文主要依据):https://arxiv.org/html/2502.10498v1
- 论文 PDF:https://arxiv.org/pdf/2502.10498
- 配套 GitHub 仓库(Awesome-World-Model,论文索引,持续更新至 2026):https://github.com/LMD0311/Awesome-World-Model
- Hugging Face Papers 页:https://huggingface.co/papers/2502.10498
一手源存档(sources/)
- survey-world-models-autonomous-driving—github-readme — GitHub 仓库 README 快照(Awesome-World-Model,含 Survey/2026/2025 分年论文索引),sources/world-model/2025/
- 论文全文 PDF(arXiv 2502.10498,不入 git):见上方链接重取