这一族是什么
「自动驾驶世界模型」(driving world model, DWM)是把「预测世界如何演化」这件事落到真实道路上的一整条研究线。它的共同任务定义很朴素——给定过去观测和一个动作(或轨迹/指令),生成未来的观测——但「观测」用什么表征、用什么生成范式、为谁服务,在 2023–2026 三年里分化出至少八个子范式。本库 driving-wm 类目下共 46 篇一手复核过的工作,本页把它们串成一条谱系,抠出可比的数字,并指出这一族正往哪走。
一句话概括这三年的主线:从「造像素」到「造几何」再到「造决策」。2023 年大家忙着把 Stable Diffusion / GPT 搬进驾驶域生成能看的视频;2024 年重心转向占据(occupancy)/点云这类 3D 表征以求几何一致,并开始把世界模型当「数据引擎」反哺感知;2025–2026 年则收敛到两个方向:一是实时闭环仿真(把扩散蒸馏到 2–4 步、自回归 rollout 到分钟级),二是世界模型与规划/VLA 的深度耦合(世界模型不再只是仿真器,而是直接进决策链路、甚至直接当 policy)。
谱系与时间线
按首次公开时间(arXiv/技术报告)排布,标注每篇的范式归属:
| 时间 | 工作 | 子范式 | 一句话贡献 |
|---|---|---|---|
| 2023-09 | gaia-1-wayve (GAIA-1) | 前视视频·AR | 首个规模化真实驾驶生成式 WM,首次验证 LLM scaling law |
| 2023-09 | drivedreamer (DriveDreamer) | 多路条件·扩散 | 首个真实道路驱动 WM,HDMap+3D框+文本结构化条件模板 |
| 2023-10 | magicdrive (MagicDrive) | 多视角图像 | scene/box/map 三路独立编码 + 跨相邻视角注意力 |
| 2023-10 | drivingdiffusion (DrivingDiffusion) | 多视角视频 | 三阶段级联做「多视角+多帧+3D布局可控」 |
| 2023-11 | occworld (OccWorld) | 占据·AR | 首个 3D 语义占据 WM,定义 4D 占据预测任务 |
| 2023-11 | panacea-driving-video (Panacea) | 多视角视频 | 分解式 4D 注意力,首验多视角视频对下游检测增益 |
| 2023-11 | adriver-i (ADriver-I) | 前视·MLLM+扩散 | interleaved vision-action,首提 infinite driving 闭环 |
| 2023-11 | copilot4d-waabi (Copilot4D) | 点云预测·离散扩散 | MaskGIT→吸收-均匀离散扩散,点云预测 Chamfer 砍 65–75% |
| 2023-11 | cam4docc-benchmark (Cam4DOcc) | 占据·基准 | 首个纯相机 4D 占据预测基准 + 3D 反向向心流 |
| 2023-11 | drive-wm-driving-into-the-future (Drive-WM) | 多视角视频·规划 | 首个多视角 WM,首次接真实端到端规划器做 tree-rollout |
| 2023-12 | wovogen (WoVoGen) | 多视角视频·体素 | 显式 4D 世界体做扩散条件,panoptic diffusion |
| 2023-12 | vidar-visual-point-cloud-forecasting (ViDAR) | 跨模态·预训练 | 视觉进-点云出,视觉点云预测做自监督预训练 |
| 2024-03 | genad-generalized-predictive-model (GenAD) | 前视视频·扩散 | 首个互联网规模 WM(OpenDV-2K 2059h),Temporal Reasoning Block |
| 2024-03 | drivedreamer-2 (DriveDreamer-2) | 多视角视频·LLM | 首个文本直接定制 WM,LLM 生轨迹 + UniMVM |
| 2024-05 | vista-driving-world-model (Vista) | 前视视频·扩散 | SVD 改造高保真长时程(10Hz/576×1024/15s),预测不确定性当奖励 |
| 2024-05 | occsora (OccSora) | 占据·扩散 | 首个扩散式 4D 占据生成,DiT 替自回归 |
| 2024-05 | driveworld-4d-pretraining (DriveWorld) | 占据·4D 预训练 | Memory State-Space Model,WM 当预训练目标涨六下游任务 |
| 2024-05 | magicdrive3d (MagicDrive3D) | 生成→重建 | 生成多视角视频再容错 3DGS 重建,任意视角渲染 |
| 2024-06 | delphi-driving-video (Delphi) | 多视角视频·数据引擎 | 40 帧长视频 + 失败案例驱动,首证生成数据提升规划 |
| 2024-08 | drive-occworld (Drive-OccWorld) | 占据·规划 | 动作可控占据 WM + 占据代价规划器闭环 |
| 2024-10 | dome-occupancy-world-model (DOME) | 占据·扩散 | 连续 Occ-VAE + 时空 DiT,占据 WM「能预测」 |
| 2024-10 | drivedreamer4d (DriveDreamer4D) | 重建·数据机器 | WM 当 4DGS 数据机器,改善换道/加减速渲染 |
| 2024-11 | recondreamer (ReconDreamer) | 重建·在线修复 | DriveRestorer 在线修复 + 渐进数据更新,撑 6m 大机动 |
| 2024-11 | magicdrivedit (MagicDrive-V2) | 多视角视频·DiT | DiT+3D VAE 时空对齐控制,848×1600×241 帧 |
| 2024-12 | drivingworld-gpt (DrivingWorld) | 前视视频·AR | 纯 GPT 时空解耦,40s+ 长时程 |
| 2024-12 | infinitydrive (InfinityDrive) | 前视视频·扩散 | 记忆机制 + 时空协同建模,~2min 一致生成 |
| 2024-12 | doe-1 (Doe-1) | 统一·AR | 观测→描述→动作一条 token 序列,闭环生成式驾驶 |
| 2024-12 | gaussianworld-occupancy (GaussianWorld) | 占据·3D高斯 | 流式占据预测,3D 高斯 + 场景演化三因子分解 |
| 2025-01 | hermes-driving-world-model (HERMES) | 统一·BEV+LLM | 首个统一 3D 理解与生成,world queries 迁移文本世界知识 |
| 2025-02 | semisup-vision-centric-occ-world-model (PreWorld) | 占据·半监督 | 2D 渲染自监督预训练 + 3D 微调,两层 MLP 预测模块 |
| 2025-03 | gaia-2-wayve (GAIA-2) | 多视角视频·flow | 多视角隐扩散 8.4B,结构化条件 + 四推理模式 |
| 2025-06 | epona-autoregressive-diffusion (Epona) | 前视·AR扩散+规划 | 时空解耦自回归扩散,2min 生成 + 单独当 20Hz 规划器 |
| 2025-06 | cosmos-drive-dreams (Cosmos-Drive-Dreams) | 多视角·数据引擎 | Cosmos WFM 后训练成 AV 专用套件 + SDG 长尾数据流水线 |
| 2025-07 | world4drive (World4Drive) | 规划·隐空间 WM | 感知标注免费,意图感知隐空间 WM 选轨迹 |
| 2025-09 | worldsplat (WorldSplat) | 重建·前馈 4D 高斯 | 扩散吐可解码为 3D 高斯的隐变量,生成+重建单次前馈 |
| 2025-10 | policy-world-model-forecasting-planning (PWM) | 规划·协同 SA | collaborative state-action,先想未来再决策 |
| 2025-10 | rethinking-dwm-synthetic-data-generator (Dream4Drive) | 数据引擎·反思 | 揭穿合成数据涨点的 epoch 不公平,3D-aware 场景编辑 |
| 2025-10 | sparseworld-4d-occupancy (SparseWorld) | 占据·稀疏 query | 1040 个动态 query 替稠密体素,范围自适应 |
| 2025-11 | sparseworld-tc (SparseWorld-TC) | 占据·稀疏前馈 | 稀疏锚点纯前馈,纯相机超真值占据输入方法 |
| 2025-12 | gaussiandwm (GaussianDWM) | 统一·语言 3D 高斯 | 语言特征挂在 3D 高斯上,理解+生成显式空间对齐 |
| 2025-12 | geniedrive (GenieDrive) | 占据引导视频 | tri-plane 轻量占据 WM (3.47M) 引导 Wan2.1 视频生成 |
| 2026-02 | driveworld-vla (DriveWorld-VLA) | 规划·VLA+WM | 共享潜空间,action-conditioned what-if 前瞻优化 |
| 2026-03 | worlddrive-scene-gen-planning (WorldDrive) | 规划·表征继承 | 世界模型编码器权重级迁移给规划器,FAR 53ms 重排 |
| 2026-04 | hermes-plus-plus (HERMES++) | 统一·联合几何 | HERMES 期刊版,显式+隐式几何联合优化 + 文本注入 |
| 2026-05 | xiaomi-auto-world-model (Xiaomi Joint WM) | 重建+生成融合 | WorldRec 稀疏查询前馈重建 + WorldGen 双向预训练因果微调 |
| 2026-06 | nvidia-omnidreams (OmniDreams) | 实时闭环仿真 | Cosmos-Predict 2.5 蒸馏成 2 步实时 WM,WAM 直接当 policy |
两条开山线并行(2023-09):Wayve 的 gaia-1-wayve 走「纯自监督、无结构化标注、离散 token 自回归」路线,靠 4700h 私有数据规模化;GigaAI/清华的 drivedreamer 走「扩散主干 + HDMap/3D框结构化条件」路线,靠 nuScenes 标注驱动。这两套思路——规模换泛化 vs 结构条件换可控——各自繁衍出一整条子树,至今仍是这一族最根本的张力。
子范式一:前视单目视频生成(AR ↔ 扩散之争)
这是最「纯」的世界模型——前视单相机、图像进图像出,核心问题只有两个:保真度和长时程一致性。技术上分裂成 GPT 式离散自回归与扩散两条路,2025 年被自回归扩散(flow matching)缝合。
nuScenes 验证集横评(FID/FVD 均越低越好,均为各工作自报口径;「最长时长」指单次可用生成长度):
| 工作 | 时间 | 骨干/范式 | 分辨率×帧率 | 训练数据 | FID↓ | FVD↓ | 最长时长 |
|---|---|---|---|---|---|---|---|
| DriveGAN (基线) | 2021 | GAN | 256²/8Hz | 160h | 73.4 | 502.3 | — |
| drivedreamer | 2023-09 | SD1.4 扩散 | 448×256/12Hz | nuScenes 1M帧 | 52.6 / 14.9† | 452 / 340.8† | 4s/48 |
| adriver-i | 2023-11 | MLLM+VDM | 256×512/2Hz | 1.4M私有+23K | 5.5 | 97.0 | 无限(闭环) |
| genad-generalized-predictive-model | 2024-03 | SDXL 扩散 | 256×448/2Hz | OpenDV-2K 2059h | 15.4 | 184.0 | 4s/8 |
| vista-driving-world-model | 2024-05 | SVD+LoRA | 576×1024/10Hz | OpenDV 1740h | 6.9 | 89.4 | 15s/150 |
| drivingworld-gpt | 2024-12 | 纯 GPT AR | 512×1024/10Hz | 3456h(前视) | 7.4 | 90.9 | 40s/400 |
| infinitydrive | 2024-12 | DiT 扩散 | 576×1024/10Hz | 1745h | 10.93 | 70.06 | ~2min/1500+ |
| epona-autoregressive-diffusion | 2025-06 | AR + rectified-flow | 512×1024/10Hz | nuPlan+nuScenes | 7.5 | 82.8 | 120s/600 |
† DriveDreamer 带首帧多视角图像条件时。ADriver-I 的 5.5/97.0 是 4帧→4帧、无 box/map 先验设定,与其余不完全同口径。
技术演进的三个拐点:
- 规模拐点(GenAD):genad-generalized-predictive-model 从 YouTube 抓 2059h(比 nuScenes 大 374×,40+ 国、244+ 城),首证「互联网驾驶视频当通用接口」,OpenDV 数据集成了后续 vista-driving-world-model 等的标准底座。
- 保真度拐点(Vista):vista-driving-world-model 用 latent replacement 三帧动态先验 + 动态增强/结构保持双损失,把 SVD 打成 10Hz/576×1024/15s 的高保真预测器,nuScenes FID 6.9/FVD 89.4 长期是标杆;并首创用模型自身预测方差当无需真值动作的奖励。
- 长时程拐点(DrivingWorld→Epona):drivingworld-gpt 用时空解耦两级注意力(跨帧因果 + 帧内双向 + 帧内 AR)避开经典 GPT 显存二次增长,把可用时长推到 40s;epona-autoregressive-diffusion 进一步用「时序因果 AR + 单步连续扩散」缝合两条路线,chain-of-forward 压漂移,做到 2min(600 帧),且能脱离视觉生成单独当 20Hz 实时规划器。infinitydrive 则靠记忆注入/保留 + 记忆曲线自适应损失把一致生成推到 ~2min(但未开源、未验证多视角/下游增益)。
AR vs 扩散的当下答案:扩散保真度更高但推理慢、随机性大、长时程需 rollout;AR 变长天然、但离散量化损画质。2025 年后共识倒向自回归扩散/flow matching(Epona、GAIA-2、MagicDrive-V2、Xiaomi WorldGen 都是),既要变长又要连续隐空间保画质。
子范式二:多视角图像/视频生成(「数据引擎」派)
这一支的立身之本不是「预测未来」而是「批量造带标注的多视角数据喂下游感知/规划」,因此几乎都强调结构化布局可控 + 多摄像头一致 + 下游涨点。核心工程挑战是多视角一致性——被 MagicDrive 的「只 attend 相邻视角」一招定调,后续几乎人人沿用。
nuScenes 上的横评(多视角,FID/FVD + 下游增益):
| 工作 | 时间 | 骨干 | 视角×帧 | 一致性机制 | FID↓ | FVD↓ | 下游关键增益 |
|---|---|---|---|---|---|---|---|
| magicdrive | 2023-10 | SD1.5 冻结 | 6视角图像 | 跨相邻视角注意力 | 16.20 | — | BEVFusion mAP +2.66 |
| drivingdiffusion | 2023-10 | SD1.4 | 6×多帧 | 跨视角+跨帧一致注意力 | 15.83 | 332 | BEVFusion NDS +2.2% |
| panacea-driving-video | 2023-11 | SD2.1 | 6×8 | 分解式 4D 注意力 | 16.96 | 139 | StreamPETR NDS +2.3 |
| wovogen | 2023-12 | SD2.1+ControlNet | 6视角视频 | 显式 4D 世界体 | 27.6 | 417.7 | BEVDet mAP +1.3 |
| drive-wm-driving-into-the-future | 2023-11 | SD 视频扩散 | 6×8 | 参考视角因子化(KPM 45.8→94.4) | 15.8 | 122.7 | tree-rollout 规划 L2 0.80 |
| drivedreamer-2 | 2024-03 | SVD | 6×8 | UniMVM 统一 mask | 11.2 | 55.7 | StreamPETR mAP +2.8~3.8% |
| delphi-driving-video | 2024-06 | 扩散 UNet | 6×40 | NRM+FTCM | 15.08 | 275.6@40帧 | UniAD 碰撞率 0.33→0.27 |
| magicdrivedit (V2) | 2024-11 | DiT+3D VAE | 6×241 | MVDiT block+时空对齐 | 20.91 | 94.84 | BEVFormer mAP 18.17 |
| gaia-2-wayve | 2025-03 | flow-matching 8.4B | ≤5×48 | 空间-时间分解 transformer | (FDD/FVMD) | — | 英/美/德三地长尾合成 |
| cosmos-drive-dreams | 2025-06 | Cosmos-7B DiT | ≤7视角 | Single2Multiview | — | — | 1K真实+SDG≈93K真实 |
| worldsplat | 2025-09 | DiT+前馈高斯 | 多视角 | 4D 高斯聚合 | 8.78 | 74.13 | Real+Ours mAP +4.0 |
| rethinking-dwm-synthetic-data-generator (Dream4Drive) | 2025-10 | DiT ControlNet | 6×33 | 空间视角注意力 | 5.80 | 31.84 | 同epoch首超纯真实 |
这一支的演进逻辑:
- 可控性模板(DriveDreamer→MagicDrive):drivedreamer 定下「HDMap 走空间拼接 / 3D框走门控自注意力 / 文本走交叉注意力 / 时序走时序注意力」的多异构条件分路接入模板;magicdrive 提炼成 scene/box/map 三级独立编码,并证明把物体压进单张 BEV 图会让 Vehicle mIoU 从 27 暴跌到 5.5(小物体编不进去)。
- 多视角一致性攻坚(Drive-WM):drive-wm-driving-into-the-future 的因子化生成把重叠区一致性指标 KPM 从 45.8% 拉到 94.4%(质量不降),并首次把想象的多种未来接进真实规划器(tree-rollout + 图像奖励,OOD 横移 0.5m 后微调可从碰撞 1.59 恢复到 0.91)。
- 从 UNet 到 DiT(MagicDrive-V2):magicdrivedit 处理 3D VAE 时间压缩后几何条件与 latent 逐帧对齐失配的核心难题,用与压缩比对齐的下采样模块消除轨迹拖影,把可控多视角视频推到 848×1600×241 帧、完全从零训练(不复用文生视频权重)。
- 数据引擎的两次反思:delphi-driving-video 首证「失败案例驱动」的 972 条(<4%)定向数据比随机 50%/100% 更能降 UniAD 碰撞率,还发现随机采样下「数据越多越好」并不成立;rethinking-dwm-synthetic-data-generator (Dream4Drive) 更釜底抽薪——指出既往「合成预训练+真实微调」隐含把 epoch 翻倍,对齐 epoch 后旧方法的合成增益几乎消失甚至为负,并用 <2%(420 张)3D-aware 插入样本首次在同 epoch 下超过纯真实数据。这条反思对整条「WM as data engine」研究线是直接质疑。
- 基础模型下放(GAIA-2/Cosmos):gaia-2-wayve 把 ego 动作/3D bbox agent/metadata/CLIP/专有 scenario 嵌入 + 四推理模式(从零生成/续推/inpainting/编辑)合进单一 8.4B 隐扩散,覆盖英美德三地;cosmos-drive-dreams 把 NVIDIA 通用 WFM 后训练成 6 个 AV 专用模型 + 完整 SDG 流水线(HDMap 渲染→LLM 改天气→生成→多视扩展→VLM 拒绝采样),量化出「1K 真实 + SDG ≈ 93K 真实」。
子范式三:占据(occupancy)世界模型
选 3D 语义占据而非像素/框做场景表征,occworld 给了三条理由:表达力(细粒度 3D 结构)、可得性(可从稀疏 LiDAR 便宜得到甚至自监督)、模态无关(同时适配相机与 LiDAR)。这一支的技术主轴是表征本身的演化:稠密体素 → 连续 VAE → 3D 高斯 → 稀疏 query,以及生成范式:离散 AR → 扩散 → 纯前馈。
Occ3D-nuScenes 上的横评(GT-Occ 输入为主,重建/4D 预测 mIoU·IoU 越高越好,1s/2s/3s 平均):
| 工作 | 时间 | 表征 | 生成范式 | 压缩率 | 重建 mIoU/IoU | 4D预测 mIoU/IoU | FPS |
|---|---|---|---|---|---|---|---|
| occworld | 2023-11 | VQ-VAE 离散 token | GPT 自回归 | 16× | 66.38/62.29 | 17.14/26.63 | 18.0 |
| occsora | 2024-05 | 3D VQ-VAE | DiT 扩散(生成) | 512× | 27.4/37.0 | (FID 8.35) | 20.0 |
| dome-occupancy-world-model | 2024-10 | 连续 Occ-VAE | 时空 DiT 扩散 | 64× | 83.08/77.25 | 27.10/36.36 | 6.54 |
| geniedrive | 2025-12 | tri-plane VAE | 自回归 | 58% latent | 86.15/75.53 | 42.59/51.80 | 41.38 |
| gaussianworld-occupancy | 2024-12 | 3D 高斯 | 流式(单帧历史) | — | (SurroundOcc) 22.13 | — | 228ms/帧 |
相机输入的 4D 占据预测(更难、更实用;1-3s 平均 mIoU/IoU):
| 工作 | 时间 | 关键设计 | mIoU avg | IoU avg | 规划 L2 avg(ego) |
|---|---|---|---|---|---|
| cam4docc-benchmark (OCFNet) | 2023-11 | 首个纯相机基准 + 3D反向向心流 | (IoU 27.98) | — | — |
| occworld-D | 2023-11 | 相机→占据→AR | 8.62 | 16.53 | 1.40 |
| drive-occworld | 2024-08 | 语义-运动条件归一化 | (mIoU~f 37.4) | — | 0.85(NoAvg) |
| semisup-vision-centric-occ-world-model (PreWorld) | 2025-02 | 2D渲染自监督预训练+3D微调 | 9.55 | 21.62 | 0.31 |
| sparseworld-4d-occupancy | 2025-10 | 1040 稀疏动态 query | 13.20 | 22.03 | 0.27 |
| sparseworld-tc | 2025-11 | 稀疏锚点纯前馈 | 26.42 | 49.21 | — |
演进主线:
- 开山(OccWorld):VQ-VAE 场景 tokenizer + GPT 式时空自回归,不用框/地图就把规划做到 L2 1.17(接近 UniAD 1.03),并揭示「重建好≠世界建模好」(空间分辨率 100² 重建飙到 78 但预测/规划反而更差)。
- 扩散替 AR 的代价(OccSora→DOME):occsora 首把 Sora 思路搬进占据(DiT 整段去噪替逐帧 AR),但 512× 压缩把重建 mIoU 打到 27(约 OccWorld 四折),且「只能生成不能预测」;dome-occupancy-world-model 用连续 Occ-VAE(不压时间)+ 帧级条件掩码解决「能预测」,重建 mIoU 83.08、4D 预测 27.10,且轨迹重采样数据增强解决 nuScenes 87% 直行偏置。
- 表征轻量化竞赛(GaussianWorld→GenieDrive→SparseWorld):gaussianworld-occupancy 换显式 3D 高斯,把占据预测重述为流式 4D 预测,只用上一帧历史几乎不增推理开销(228ms vs 单帧 225ms);geniedrive 用 tri-plane VAE 把 latent 压到 BEV 方案 58%,占据 WM 仅 3.47M 参数、41.38 FPS,且首次系统验证「只有连续(非 VQ 离散)表征才能吃 E2E 训练红利」(DOME+E2E 直接崩到 0.43);sparseworld-4d-occupancy 与 sparseworld-tc 两支独立团队撞名,均收敛到「稀疏 query/锚点替稠密体素」——后者纯前馈、纯相机输入的 IoU(49.21)竟反超用真值占据输入的方法。
- 半监督降标注(PreWorld):semisup-vision-centric-occ-world-model 用便宜的 2D 渲染标签自监督预训练、贵的 3D 占据标签微调,两层 MLP 的预测模块端到端替掉「冻结占据模型+tokenizer+AR+解码器」的间接路径;150 scenes 稀缺标注时预训练能把 mIoU 从 18.66 拉到 25.02。
- 占据当预训练目标(DriveWorld):driveworld-4d-pretraining 不做生成,把 WM 纯当 4D 预训练——Memory State-Space Model(动态记忆库 + 静态场景传播)替标准 RSSM(后者压 1D 丢空间上下文,预训练反把检测拖到比不预训练还差),在 nuScenes 六下游任务全面涨点(规划 L2 降 0.34m)。
子范式四:点云预测(自监督感知的世界模型)
用未标注 LiDAR 点云做「给过去点云+未来 ego 位姿→预测未来点云」,本质是最纯的无监督世界模型。样本少但影响大——它把驾驶预测从「需框/分割监督」推向「GPT 式无监督」。
| 工作 | 时间 | 输入→输出 | 方法 | nuScenes Chamfer 1s/3s↓ | 定位 |
|---|---|---|---|---|---|
| 4D-Occ (基线) | 2023 | LiDAR→点云 | 可微光线投射 | 1.41 / 1.40 | 前 SOTA |
| copilot4d-waabi | 2023-11 | LiDAR→点云 | VQVAE + 吸收-均匀离散扩散 | 0.36 / 0.58 | 首把 MaskGIT 严格 recast 成离散扩散 |
| vidar-visual-point-cloud-forecasting | 2023-12 | 相机→点云 | BEV + Latent Rendering | 1.25 / 1.73 | 首个跨模态 WM,做预训练 |
- copilot4d-waabi(Waabi)证明「tokenize everything + discrete diffusion」配方可跨域,两个极小模型(tokenizer 13M、WM 39M)把点云预测 SOTA 的 Chamfer 砍 65–75%(1s)、跨数据集迁移 >4×;核心方法贡献是只需「非 mask 位加均匀噪声 + loss 覆盖全部位置」两处改动,就让采样时能迭代修正已解码 token(MaskGIT 做不到)。
- vidar-visual-point-cloud-forecasting(OpenDriveLab)反其道——视觉进、点云出,把它当自监督预训练任务同时压满语义+3D几何+时序三种监督,关键 Latent Rendering 算子解决「直接接可微光线投射反而掉点」的射线状特征坑(+3.47 NDS),让 UniAD 全栈涨点(检测 +3.1 NDS、规划碰撞率降 ~15%)。它直接催生了 CVPR 2024 Predictive World Model 挑战赛。
值得注意的是,点云预测后来被统一模型吸收:hermes-driving-world-model/hermes-plus-plus 把「未来点云生成」当统一 WM 的生成分支,仅用当前帧多视角图像就把 3s Chamfer 从 ViDAR 的 1.73 降到 1.17(HERMES)、再降到 1.01/0.97(HERMES++ 1.8B/3.8B)。
子范式五:4D 重建 × 生成融合(前馈高斯的崛起)
这一支解决「生成能造但 3D 一致性弱、重建一致但不能无中生有」的分裂,把生成能力内嵌进显式 3D/4D 表征。演进从「生成视频再重建」的两阶段,走向「扩散直接吐可解码为高斯的隐变量」的单次前馈。
| 工作 | 时间 | 思路 | 骨干 | 关键数字 |
|---|---|---|---|---|
| magicdrive3d | 2024-05 | 生成多视角视频→容错 3DGS(FTGS) | MagicDrive | 逐场景优化 ~30min,NVS FID 34.45(vs 3DGS 145.72) |
| drivedreamer4d | 2024-10 | WM 当 4DGS 数据机器 | DriveDreamer-2 | NTA-IoU +15~44%,换道用户胜率 >80% |
| recondreamer | 2024-11 | 在线修复(DriveRestorer)+渐进更新 | DriveDreamer-2 | 撑 6m 大机动,vs DD4D +196~471% |
| worldsplat | 2025-09 | 扩散吐隐变量→前馈高斯解码,单次前馈 | OpenSora STDiT2 | NVS ±4m FID 13.38(vs DiST-4D 17.57),Rectified Flow 8 步 |
| gaussiandwm | 2025-12 | 语言特征挂 3D 高斯,理解+生成 | Qwen3-8B+扩散 | 理解 Avg 57.14,生成 ±1m FVD 44.5 |
| xiaomi-auto-world-model | 2026-05 | WorldRec 前馈重建 + WorldGen 因果生成 | DiT | 重建 10s clip≈10s(vs ~4h),WorldGen FVD 64.97/81帧 |
- drivedreamer4d→recondreamer 是同队(GigaAI)的递进:前者「训练无关」直接用 WM 生成新轨迹视频混进 4DGS,后者把它升级为可训练的在线修复模型 DriveRestorer + 渐进数据更新(PDUS),把可渲染的机动幅度从轻微偏移推到 6m 跨车道(消融证明一次性大偏移=关闭 PDUS 效果最差,渐进本身是关键)。
- worldsplat(Xiaomi EV)把「先生成后重建」两阶段合并成单次前馈——扩散不吐像素而吐可被 3DGS 解码的多模态隐变量,动静分解的前馈高斯解码器支持 48+ 路视角,增强扩散模块专补 3DGS 的未观测空洞与运动模糊;Rectified Flow 仅 8 步采样使含两个扩散模块的管线反而比单扩散基线更快。
- xiaomi-auto-world-model(Joint WM 技术报告)把重建(WorldRec,稀疏查询前馈,10s clip 从小时级压到 ~10s)与生成(WorldGen,双向预训练→Teacher Forcing→ODE Distillation→DMD 三级因果微调,50→4 步)耦合,几何约束抑制生成漂移、生成填补重建盲区;作为自回归模型 FVD 64.97 反超表中全部双向模型(但缺 Joint WM 本体的量化消融)。
子范式六:统一理解-生成(LLM/VLM 骨架)
把「看懂场景(VQA/描述/定位)」和「预测未来(点云/占据/图像)」收进同一个 LLM 前向。此前 DWM 与驾驶 VLM 是两条互不相交的线,这一支把它们缝起来。
| 工作 | 时间 | 骨架 | 场景表征 | 理解 CIDEr↑ | 生成 3s Chamfer↓ | 特色 |
|---|---|---|---|---|---|---|
| doe-1 | 2024-12 | Lumina-mGPT 7B | 无中间表征(纯 token) | (VQA) | (FID 15.9) | 观测→描述→动作一条 AR 序列,闭环 |
| hermes-driving-world-model | 2025-01 | InternVL2-1.8B | BEV | 0.741 | 1.17 | world queries 迁移文本世界知识 |
| gaussiandwm | 2025-12 | Qwen3-8B | 语言 3D 高斯 | (Avg 57.14) | (生成 RGB-D) | 文本-3D 显式空间对齐 |
| hermes-plus-plus | 2026-04 | InternVL2-1.8B/3.8B | BEV | 0.749/0.772 | 1.01/0.97 | 显式+隐式几何联合优化 |
- doe-1 最激进——不用任何手工中间表征(BEV/占据/3D高斯),把感知/预测/规划统一成一条多模态 token 序列(
观测→描述→动作→观测…),单模型不微调即可切三任务;用非可学习正弦位置编码离散化浮点数、训练-推理一致的动作 mask 抑制多步误差累积。 - hermes-driving-world-model→hermes-plus-plus 是同队(HUST)会议→期刊的加固:会议版用从 BEV max-pool 出的 world queries 在 LLM 因果注意力里「偷听」文本世界知识再驱动未来 BEV 生成;期刊版把单靠显式点云监督换成显式(渲染)+ 隐式(冻结几何提取器的余弦/Gram 损失)联合优化,加 Textual Injection(文本嵌入直接进 Current-to-Future Link 的 Key/Value)与 Ego Modulation(FiLM 式解耦自车运动),3s 生成误差再降 13.7%。
- gaussiandwm 换表征——把 CLIP 语言特征直接挂在每个 3D 高斯上(LangSplat 式),实现文本-3D 的显式空间对齐(相对 HERMES 的 BEV 特征级对齐更精确),任务感知混合采样把百万高斯压到 4096 token 喂 Qwen3-8B。
子范式七:世界模型 × 规划(从仿真器到决策引擎)
这是 2025–2026 最活跃的方向,主线是世界模型与规划器耦合方式的逐级加深:外部仿真器 → 隐空间辅助表征 → 特征共享 → 权重级表征继承 → action-conditioned 反事实想象。核心争论是「世界模型的未来预见性能否、以及如何真正进决策链路」。
nuScenes 开环规划(L2/碰撞率)+ NAVSIM PDMS 横评:
| 工作 | 时间 | 输入 | 耦合方式 | L2 avg↓ | Coll avg↓ | NAVSIM PDMS↑ |
|---|---|---|---|---|---|---|
| UniAD (基线) | 2023 | 环视 | 无 WM | 1.03 | 0.31 | 83.4 |
| drive-occworld | 2024-08 | 环视 | 占据 WM+代价规划器 | 0.85(NoAvg) | 0.29 | — |
| doe-1 | 2024-12 | 单前视 | 统一 AR(自身) | 1.26 | 0.53 | — |
| epona-autoregressive-diffusion | 2025-06 | 单前视 | 共享隐表示分支 | 1.25 | 0.36 | 86.2 |
| world4drive | 2025-07 | 相机 | 隐空间 WM 选轨迹(无感知标注) | 0.50 | 0.16 | 85.1 |
| policy-world-model-forecasting-planning (PWM) | 2025-10 | 单前视 | collaborative state-action | 0.78 | 0.07 | 88.1 |
| worlddrive-scene-gen-planning (WorldDrive) | 2026-03 | 单前视 | 表征继承(权重级) | 0.42 | 0.16 | 88.1/89.0 |
| driveworld-vla (DriveWorld-VLA) | 2026-02 | 多视角 | VLA+WM 共享潜空间 what-if | 0.61 | 0.16 | 91.3(v1) |
- world4drive 走「感知标注免费」——用视觉基础模型(Metric3D v2 深度 + Grounded-SAM 语义)给隐空间 WM 注入空间-语义先验,让 WM 对多模态意图分别「想象」未来并挑最合理轨迹;相对前作 LAW 收敛快 3.75×,夜间/雨天碰撞率降 60%+。
- policy-world-model-forecasting-planning (PWM) 的核心是协同而非仅架构统一——让动作预测显式依赖预测出的未来帧(
P(A|D_{1:t+n})而非P(A|D_{1:t})),并证明这带来规划增益;context-guided tokenizer 把单帧压到 28 token 使前瞻生成 ~40 FPS 不拖慢决策。 - worlddrive-scene-gen-planning 把耦合升级为显式权重迁移——轨迹词表条件化的世界模型(TA-DWM)预训练的视觉/运动编码器直接冻结初始化规划器,Future-aware Rewarder 蒸馏未来隐特征在 53ms 内重排候选(比同类 WM 基线 PWM 的 570–850ms 快一个数量级)。
- driveworld-vla 走得最远——VLA 与 WM 绑在同一 LLM 隐藏状态构成的共享潜空间里,用两支路 flow-matching DiT 做 action-conditioned「what-if」推理(针对不同候选动作分别想象后果再回头修正),三阶段递进训练;NAVSIMv1 PDMS 91.3、v2 EPDMS 86.8。
一个反复出现的诚实观察:开环 nuScenes 的 L2/碰撞率对 ego-status 极敏感(AD-MLP 早已把该榜刷饱和),多篇(DriveDreamer、PreWorld、SparseWorld、DriveWorld-VLA)都点出这一评测缺陷,NAVSIM/闭环指标更可信是共识。
子范式八:实时闭环仿真(终局形态)
闭环仿真要求策略动作实时改变仿真状态、进而改变下一步观测。生成式 WM 相对重建式(NeRF/3DGS)能外推到未采集视角/天气/agent 行为,但此前都太慢。nvidia-omnidreams(NVIDIA,2026-06)是这一族目前的终局形态展示:
- 从 Cosmos-Predict 2.5 mid/post-train 出 2B 动作条件化 causal diffusion WM,streaming KV cache 维持长时一致,Self Forcing + DMD 蒸馏到 2 步扩散;单卡 GB300 单视角 68 effective FPS(720p),16 卡四视角 105 FPS/相机。
- 训练数据横跨 15 国、RDS 16,600h + RDS-HQ-1M 4,944h;progressive long-context teacher 把 20s rollout 的漂移(末窗 FVD)从 409 降到 268。
- 最惊人的是 World-Action Model (WAM):同一 backbone fine-tune 成 policy,~2B 参数在碰撞率上超过 ~10B 的 VLA 基线 Alpamayo 1.5(All Collision 6.9%→4.2%)——即世界模型可直接后训练成优于专用 VLA 的驾驶策略。配套开源 FlashDreams 通用流式推理框架。
这与 cosmos-drive-dreams 同属 Cosmos 生态,但后者面向离线 SDG 数据生成、前者面向实时闭环交互,代表 WFM 在驾驶垂域的两种落地形态。
全族共享的设计模式
跨越八个子范式,反复出现的工程范式:
-
冻结预训练底座 + 只训新增模块。从 SD1.4/1.5(drivedreamer/magicdrive)、SD2.1(wovogen/panacea-driving-video)、SVD(vista-driving-world-model LoRA / drivedreamer-2)、SDXL(genad-generalized-predictive-model 两阶段)、到 Cosmos(cosmos-drive-dreams/nvidia-omnidreams 冻结基座训 ControlNet)、CogVideoX(worlddrive-scene-gen-planning)、Wan2.1(geniedrive)。例外是 magicdrivedit 与 gaia-2-wayve 的从零训练,代价是更大算力。
-
结构化条件分路注入。DriveDreamer 定的模板延续至今:空间对齐条件(HDMap/深度)走通道拼接或 additive branch,物体条件(3D框)走门控/交叉注意力,语义条件(文本)走 CLIP 交叉注意力,动作条件走 Fourier embedding。动作的注入方式本身是个小战场:cross-attention(vista-driving-world-model/drive-occworld)、adaLN(gaia-2-wayve 实测比 cross-attn 更准)、token 序列内 AR(doe-1/drivingworld-gpt)、latent replacement(vista-driving-world-model)。
-
多视角一致性=只 attend 相邻视角。magicdrive 证明 attend 全部 5 视角反而掉点、取 2 个相邻视角最优;drivingdiffusion/panacea-driving-video/drive-wm-driving-into-the-future/magicdrivedit 全沿用。
-
语义化 tokenizer。gaia-1-wayve 把 DINO 特征蒸馏进 VQ token 提升语义、简化 WM 输入空间;gaia-2-wayve 用 DINOv2-Large 隐空间蒸馏。占据侧则是 occworld 的「重建好≠世界建模好」教训——tokenizer 要学高层概念而非死磕重建。
-
长时程一致性的四种解法:latent replacement 动态先验(vista-driving-world-model)、记忆注入/曲线自适应损失(infinitydrive)、随机掩码+平衡注意力(drivingworld-gpt)、chain-of-forward 一步速度场模拟推理噪声(epona-autoregressive-diffusion)、Self-Forcing+DMD+progressive teacher(nvidia-omnidreams)。本质都是缩小 train/inference 分布差(exposure bias)。
-
世界模型作为数据引擎。几乎每篇多视角生成工作都验证合成数据涨下游(magicdrive/panacea-driving-video/drivedreamer-2/delphi-driving-video/worldsplat/cosmos-drive-dreams),但 rethinking-dwm-synthetic-data-generator 的公平性反思提醒:epoch 对齐后旧增益可能消失,真增益要靠 3D-aware 定向编辑或长尾定向采样。
-
共同的失效模式与自陈局限。几乎全族都承认:(a) 扩散/AR 推理慢、非实时(除已蒸馏的 Epona/OmniDreams/GenieDrive);(b) 学不会「幻想视野外新驶入的车」(occworld/copilot4d-waabi/cam4docc-benchmark 明确点出);(c) 长时程随多样化生成偏离 GT,3s 规划反不如短时;(d) nuScenes 开环指标对 ego-status 敏感。
这一族在往哪走
综合 2025–2026 的走向,六个清晰趋势:
-
实时化与蒸馏。few-step 扩散成标配:nvidia-omnidreams 2 步、xiaomi-auto-world-model WorldGen 4 步、worldsplat 8 步、geniedrive 占据 WM 41 FPS/3.47M。世界模型正从「离线数据引擎」变成「在线可交互仿真器/策略」。
-
从开环走向闭环。nvidia-omnidreams + AlpaSim 是第一个把生成式 WM 做进真实闭环仿真栈并证明其对策略排名是 faithful proxy 的系统;drive-occworld/drive-wm-driving-into-the-future 已在探索占据/图像奖励的规划闭环。
-
统一理解-生成-规划。三条子线(统一 VLM 的 hermes-plus-plus/gaussiandwm/doe-1、VLA 耦合的 driveworld-vla/worlddrive-scene-gen-planning/policy-world-model-forecasting-planning、WM 直接当 policy 的 nvidia-omnidreams WAM)正在合流——世界模型不再是独立仿真器,而是决策引擎的一部分甚至就是 policy。
-
生成与重建的融合。前馈 3D/4D 高斯(worldsplat/xiaomi-auto-world-model/gaussiandwm)把「能造」与「3D 一致」统一进单次前馈,避开「先生成视频再离线重建」的两阶段误差叠加,把逐场景优化从小时压到秒。
-
表征的稀疏化/高效化。占据侧从稠密体素卷向稀疏 query(sparseworld-4d-occupancy/sparseworld-tc)与超轻量 VAE(geniedrive 3.47M),几何约束(geniedrive 的占据中间层、hermes-plus-plus 的隐式几何正则)被用来对抗生成漂移。
-
数据方法论的成熟与反思。从盲目堆合成数据,到 delphi-driving-video 的失败案例驱动、cosmos-drive-dreams 的长尾 SDG 流水线、再到 rethinking-dwm-synthetic-data-generator 对评测公平性的釜底抽薪——「世界模型造数据到底有没有用、怎么用才真有用」正在从口号变成可证伪的科学问题。
一条未解的主线张力依旧贯穿全族:可控性(结构条件、显式几何、离散表征)与规模泛化(互联网数据、连续隐空间、大基础模型)之间的取舍,正是 2023 年 drivedreamer 与 gaia-1-wayve 分道的那道题——三年过去,答案越来越像是「两者都要」,而 flow-matching 连续隐空间 + 结构化 ControlNet + 大 WFM 后训练,是目前最被看好的收敛点。