这一族是什么

「自动驾驶世界模型」(driving world model, DWM)是把「预测世界如何演化」这件事落到真实道路上的一整条研究线。它的共同任务定义很朴素——给定过去观测和一个动作(或轨迹/指令),生成未来的观测——但「观测」用什么表征、用什么生成范式、为谁服务,在 2023–2026 三年里分化出至少八个子范式。本库 driving-wm 类目下共 46 篇一手复核过的工作,本页把它们串成一条谱系,抠出可比的数字,并指出这一族正往哪走。

一句话概括这三年的主线:从「造像素」到「造几何」再到「造决策」。2023 年大家忙着把 Stable Diffusion / GPT 搬进驾驶域生成能看的视频;2024 年重心转向占据(occupancy)/点云这类 3D 表征以求几何一致,并开始把世界模型当「数据引擎」反哺感知;2025–2026 年则收敛到两个方向:一是实时闭环仿真(把扩散蒸馏到 2–4 步、自回归 rollout 到分钟级),二是世界模型与规划/VLA 的深度耦合(世界模型不再只是仿真器,而是直接进决策链路、甚至直接当 policy)。


谱系与时间线

按首次公开时间(arXiv/技术报告)排布,标注每篇的范式归属:

时间工作子范式一句话贡献
2023-09gaia-1-wayve (GAIA-1)前视视频·AR首个规模化真实驾驶生成式 WM,首次验证 LLM scaling law
2023-09drivedreamer (DriveDreamer)多路条件·扩散首个真实道路驱动 WM,HDMap+3D框+文本结构化条件模板
2023-10magicdrive (MagicDrive)多视角图像scene/box/map 三路独立编码 + 跨相邻视角注意力
2023-10drivingdiffusion (DrivingDiffusion)多视角视频三阶段级联做「多视角+多帧+3D布局可控」
2023-11occworld (OccWorld)占据·AR首个 3D 语义占据 WM,定义 4D 占据预测任务
2023-11panacea-driving-video (Panacea)多视角视频分解式 4D 注意力,首验多视角视频对下游检测增益
2023-11adriver-i (ADriver-I)前视·MLLM+扩散interleaved vision-action,首提 infinite driving 闭环
2023-11copilot4d-waabi (Copilot4D)点云预测·离散扩散MaskGIT→吸收-均匀离散扩散,点云预测 Chamfer 砍 65–75%
2023-11cam4docc-benchmark (Cam4DOcc)占据·基准首个纯相机 4D 占据预测基准 + 3D 反向向心流
2023-11drive-wm-driving-into-the-future (Drive-WM)多视角视频·规划首个多视角 WM,首次接真实端到端规划器做 tree-rollout
2023-12wovogen (WoVoGen)多视角视频·体素显式 4D 世界体做扩散条件,panoptic diffusion
2023-12vidar-visual-point-cloud-forecasting (ViDAR)跨模态·预训练视觉进-点云出,视觉点云预测做自监督预训练
2024-03genad-generalized-predictive-model (GenAD)前视视频·扩散首个互联网规模 WM(OpenDV-2K 2059h),Temporal Reasoning Block
2024-03drivedreamer-2 (DriveDreamer-2)多视角视频·LLM首个文本直接定制 WM,LLM 生轨迹 + UniMVM
2024-05vista-driving-world-model (Vista)前视视频·扩散SVD 改造高保真长时程(10Hz/576×1024/15s),预测不确定性当奖励
2024-05occsora (OccSora)占据·扩散首个扩散式 4D 占据生成,DiT 替自回归
2024-05driveworld-4d-pretraining (DriveWorld)占据·4D 预训练Memory State-Space Model,WM 当预训练目标涨六下游任务
2024-05magicdrive3d (MagicDrive3D)生成→重建生成多视角视频再容错 3DGS 重建,任意视角渲染
2024-06delphi-driving-video (Delphi)多视角视频·数据引擎40 帧长视频 + 失败案例驱动,首证生成数据提升规划
2024-08drive-occworld (Drive-OccWorld)占据·规划动作可控占据 WM + 占据代价规划器闭环
2024-10dome-occupancy-world-model (DOME)占据·扩散连续 Occ-VAE + 时空 DiT,占据 WM「能预测」
2024-10drivedreamer4d (DriveDreamer4D)重建·数据机器WM 当 4DGS 数据机器,改善换道/加减速渲染
2024-11recondreamer (ReconDreamer)重建·在线修复DriveRestorer 在线修复 + 渐进数据更新,撑 6m 大机动
2024-11magicdrivedit (MagicDrive-V2)多视角视频·DiTDiT+3D VAE 时空对齐控制,848×1600×241 帧
2024-12drivingworld-gpt (DrivingWorld)前视视频·AR纯 GPT 时空解耦,40s+ 长时程
2024-12infinitydrive (InfinityDrive)前视视频·扩散记忆机制 + 时空协同建模,~2min 一致生成
2024-12doe-1 (Doe-1)统一·AR观测→描述→动作一条 token 序列,闭环生成式驾驶
2024-12gaussianworld-occupancy (GaussianWorld)占据·3D高斯流式占据预测,3D 高斯 + 场景演化三因子分解
2025-01hermes-driving-world-model (HERMES)统一·BEV+LLM首个统一 3D 理解与生成,world queries 迁移文本世界知识
2025-02semisup-vision-centric-occ-world-model (PreWorld)占据·半监督2D 渲染自监督预训练 + 3D 微调,两层 MLP 预测模块
2025-03gaia-2-wayve (GAIA-2)多视角视频·flow多视角隐扩散 8.4B,结构化条件 + 四推理模式
2025-06epona-autoregressive-diffusion (Epona)前视·AR扩散+规划时空解耦自回归扩散,2min 生成 + 单独当 20Hz 规划器
2025-06cosmos-drive-dreams (Cosmos-Drive-Dreams)多视角·数据引擎Cosmos WFM 后训练成 AV 专用套件 + SDG 长尾数据流水线
2025-07world4drive (World4Drive)规划·隐空间 WM感知标注免费,意图感知隐空间 WM 选轨迹
2025-09worldsplat (WorldSplat)重建·前馈 4D 高斯扩散吐可解码为 3D 高斯的隐变量,生成+重建单次前馈
2025-10policy-world-model-forecasting-planning (PWM)规划·协同 SAcollaborative state-action,先想未来再决策
2025-10rethinking-dwm-synthetic-data-generator (Dream4Drive)数据引擎·反思揭穿合成数据涨点的 epoch 不公平,3D-aware 场景编辑
2025-10sparseworld-4d-occupancy (SparseWorld)占据·稀疏 query1040 个动态 query 替稠密体素,范围自适应
2025-11sparseworld-tc (SparseWorld-TC)占据·稀疏前馈稀疏锚点纯前馈,纯相机超真值占据输入方法
2025-12gaussiandwm (GaussianDWM)统一·语言 3D 高斯语言特征挂在 3D 高斯上,理解+生成显式空间对齐
2025-12geniedrive (GenieDrive)占据引导视频tri-plane 轻量占据 WM (3.47M) 引导 Wan2.1 视频生成
2026-02driveworld-vla (DriveWorld-VLA)规划·VLA+WM共享潜空间,action-conditioned what-if 前瞻优化
2026-03worlddrive-scene-gen-planning (WorldDrive)规划·表征继承世界模型编码器权重级迁移给规划器,FAR 53ms 重排
2026-04hermes-plus-plus (HERMES++)统一·联合几何HERMES 期刊版,显式+隐式几何联合优化 + 文本注入
2026-05xiaomi-auto-world-model (Xiaomi Joint WM)重建+生成融合WorldRec 稀疏查询前馈重建 + WorldGen 双向预训练因果微调
2026-06nvidia-omnidreams (OmniDreams)实时闭环仿真Cosmos-Predict 2.5 蒸馏成 2 步实时 WM,WAM 直接当 policy

两条开山线并行(2023-09):Wayve 的 gaia-1-wayve 走「纯自监督、无结构化标注、离散 token 自回归」路线,靠 4700h 私有数据规模化;GigaAI/清华的 drivedreamer 走「扩散主干 + HDMap/3D框结构化条件」路线,靠 nuScenes 标注驱动。这两套思路——规模换泛化 vs 结构条件换可控——各自繁衍出一整条子树,至今仍是这一族最根本的张力。


子范式一:前视单目视频生成(AR ↔ 扩散之争)

这是最「纯」的世界模型——前视单相机、图像进图像出,核心问题只有两个:保真度长时程一致性。技术上分裂成 GPT 式离散自回归与扩散两条路,2025 年被自回归扩散(flow matching)缝合。

nuScenes 验证集横评(FID/FVD 均越低越好,均为各工作自报口径;「最长时长」指单次可用生成长度):

工作时间骨干/范式分辨率×帧率训练数据FID↓FVD↓最长时长
DriveGAN (基线)2021GAN256²/8Hz160h73.4502.3
drivedreamer2023-09SD1.4 扩散448×256/12HznuScenes 1M帧52.6 / 14.9†452 / 340.8†4s/48
adriver-i2023-11MLLM+VDM256×512/2Hz1.4M私有+23K5.597.0无限(闭环)
genad-generalized-predictive-model2024-03SDXL 扩散256×448/2HzOpenDV-2K 2059h15.4184.04s/8
vista-driving-world-model2024-05SVD+LoRA576×1024/10HzOpenDV 1740h6.989.415s/150
drivingworld-gpt2024-12纯 GPT AR512×1024/10Hz3456h(前视)7.490.940s/400
infinitydrive2024-12DiT 扩散576×1024/10Hz1745h10.9370.06~2min/1500+
epona-autoregressive-diffusion2025-06AR + rectified-flow512×1024/10HznuPlan+nuScenes7.582.8120s/600

† DriveDreamer 带首帧多视角图像条件时。ADriver-I 的 5.5/97.0 是 4帧→4帧、无 box/map 先验设定,与其余不完全同口径。

技术演进的三个拐点

  • 规模拐点(GenAD)genad-generalized-predictive-model 从 YouTube 抓 2059h(比 nuScenes 大 374×,40+ 国、244+ 城),首证「互联网驾驶视频当通用接口」,OpenDV 数据集成了后续 vista-driving-world-model 等的标准底座。
  • 保真度拐点(Vista)vista-driving-world-model 用 latent replacement 三帧动态先验 + 动态增强/结构保持双损失,把 SVD 打成 10Hz/576×1024/15s 的高保真预测器,nuScenes FID 6.9/FVD 89.4 长期是标杆;并首创用模型自身预测方差当无需真值动作的奖励。
  • 长时程拐点(DrivingWorld→Epona)drivingworld-gpt 用时空解耦两级注意力(跨帧因果 + 帧内双向 + 帧内 AR)避开经典 GPT 显存二次增长,把可用时长推到 40s;epona-autoregressive-diffusion 进一步用「时序因果 AR + 单步连续扩散」缝合两条路线,chain-of-forward 压漂移,做到 2min(600 帧),且能脱离视觉生成单独当 20Hz 实时规划器。infinitydrive 则靠记忆注入/保留 + 记忆曲线自适应损失把一致生成推到 ~2min(但未开源、未验证多视角/下游增益)。

AR vs 扩散的当下答案:扩散保真度更高但推理慢、随机性大、长时程需 rollout;AR 变长天然、但离散量化损画质。2025 年后共识倒向自回归扩散/flow matching(Epona、GAIA-2、MagicDrive-V2、Xiaomi WorldGen 都是),既要变长又要连续隐空间保画质。


子范式二:多视角图像/视频生成(「数据引擎」派)

这一支的立身之本不是「预测未来」而是「批量造带标注的多视角数据喂下游感知/规划」,因此几乎都强调结构化布局可控 + 多摄像头一致 + 下游涨点。核心工程挑战是多视角一致性——被 MagicDrive 的「只 attend 相邻视角」一招定调,后续几乎人人沿用。

nuScenes 上的横评(多视角,FID/FVD + 下游增益):

工作时间骨干视角×帧一致性机制FID↓FVD↓下游关键增益
magicdrive2023-10SD1.5 冻结6视角图像跨相邻视角注意力16.20BEVFusion mAP +2.66
drivingdiffusion2023-10SD1.46×多帧跨视角+跨帧一致注意力15.83332BEVFusion NDS +2.2%
panacea-driving-video2023-11SD2.16×8分解式 4D 注意力16.96139StreamPETR NDS +2.3
wovogen2023-12SD2.1+ControlNet6视角视频显式 4D 世界体27.6417.7BEVDet mAP +1.3
drive-wm-driving-into-the-future2023-11SD 视频扩散6×8参考视角因子化(KPM 45.8→94.4)15.8122.7tree-rollout 规划 L2 0.80
drivedreamer-22024-03SVD6×8UniMVM 统一 mask11.255.7StreamPETR mAP +2.8~3.8%
delphi-driving-video2024-06扩散 UNet6×40NRM+FTCM15.08275.6@40帧UniAD 碰撞率 0.33→0.27
magicdrivedit (V2)2024-11DiT+3D VAE241MVDiT block+时空对齐20.9194.84BEVFormer mAP 18.17
gaia-2-wayve2025-03flow-matching 8.4B≤5×48空间-时间分解 transformer(FDD/FVMD)英/美/德三地长尾合成
cosmos-drive-dreams2025-06Cosmos-7B DiT≤7视角Single2Multiview1K真实+SDG≈93K真实
worldsplat2025-09DiT+前馈高斯多视角4D 高斯聚合8.7874.13Real+Ours mAP +4.0
rethinking-dwm-synthetic-data-generator (Dream4Drive)2025-10DiT ControlNet6×33空间视角注意力5.8031.84同epoch首超纯真实

这一支的演进逻辑

  • 可控性模板(DriveDreamer→MagicDrive)drivedreamer 定下「HDMap 走空间拼接 / 3D框走门控自注意力 / 文本走交叉注意力 / 时序走时序注意力」的多异构条件分路接入模板;magicdrive 提炼成 scene/box/map 三级独立编码,并证明把物体压进单张 BEV 图会让 Vehicle mIoU 从 27 暴跌到 5.5(小物体编不进去)。
  • 多视角一致性攻坚(Drive-WM)drive-wm-driving-into-the-future 的因子化生成把重叠区一致性指标 KPM 从 45.8% 拉到 94.4%(质量不降),并首次把想象的多种未来接进真实规划器(tree-rollout + 图像奖励,OOD 横移 0.5m 后微调可从碰撞 1.59 恢复到 0.91)。
  • 从 UNet 到 DiT(MagicDrive-V2)magicdrivedit 处理 3D VAE 时间压缩后几何条件与 latent 逐帧对齐失配的核心难题,用与压缩比对齐的下采样模块消除轨迹拖影,把可控多视角视频推到 848×1600×241 帧、完全从零训练(不复用文生视频权重)。
  • 数据引擎的两次反思delphi-driving-video 首证「失败案例驱动」的 972 条(<4%)定向数据比随机 50%/100% 更能降 UniAD 碰撞率,还发现随机采样下「数据越多越好」并不成立;rethinking-dwm-synthetic-data-generator (Dream4Drive) 更釜底抽薪——指出既往「合成预训练+真实微调」隐含把 epoch 翻倍,对齐 epoch 后旧方法的合成增益几乎消失甚至为负,并用 <2%(420 张)3D-aware 插入样本首次在同 epoch 下超过纯真实数据。这条反思对整条「WM as data engine」研究线是直接质疑。
  • 基础模型下放(GAIA-2/Cosmos)gaia-2-wayve 把 ego 动作/3D bbox agent/metadata/CLIP/专有 scenario 嵌入 + 四推理模式(从零生成/续推/inpainting/编辑)合进单一 8.4B 隐扩散,覆盖英美德三地;cosmos-drive-dreams 把 NVIDIA 通用 WFM 后训练成 6 个 AV 专用模型 + 完整 SDG 流水线(HDMap 渲染→LLM 改天气→生成→多视扩展→VLM 拒绝采样),量化出「1K 真实 + SDG ≈ 93K 真实」。

子范式三:占据(occupancy)世界模型

选 3D 语义占据而非像素/框做场景表征,occworld 给了三条理由:表达力(细粒度 3D 结构)、可得性(可从稀疏 LiDAR 便宜得到甚至自监督)、模态无关(同时适配相机与 LiDAR)。这一支的技术主轴是表征本身的演化:稠密体素 → 连续 VAE → 3D 高斯 → 稀疏 query,以及生成范式:离散 AR → 扩散 → 纯前馈。

Occ3D-nuScenes 上的横评(GT-Occ 输入为主,重建/4D 预测 mIoU·IoU 越高越好,1s/2s/3s 平均):

工作时间表征生成范式压缩率重建 mIoU/IoU4D预测 mIoU/IoUFPS
occworld2023-11VQ-VAE 离散 tokenGPT 自回归16×66.38/62.2917.14/26.6318.0
occsora2024-053D VQ-VAEDiT 扩散(生成)512×27.4/37.0(FID 8.35)20.0
dome-occupancy-world-model2024-10连续 Occ-VAE时空 DiT 扩散64×83.08/77.2527.10/36.366.54
geniedrive2025-12tri-plane VAE自回归58% latent86.15/75.5342.59/51.8041.38
gaussianworld-occupancy2024-123D 高斯流式(单帧历史)(SurroundOcc) 22.13228ms/帧

相机输入的 4D 占据预测(更难、更实用;1-3s 平均 mIoU/IoU):

工作时间关键设计mIoU avgIoU avg规划 L2 avg(ego)
cam4docc-benchmark (OCFNet)2023-11首个纯相机基准 + 3D反向向心流(IoU 27.98)
occworld-D2023-11相机→占据→AR8.6216.531.40
drive-occworld2024-08语义-运动条件归一化(mIoU~f 37.4)0.85(NoAvg)
semisup-vision-centric-occ-world-model (PreWorld)2025-022D渲染自监督预训练+3D微调9.5521.620.31
sparseworld-4d-occupancy2025-101040 稀疏动态 query13.2022.030.27
sparseworld-tc2025-11稀疏锚点纯前馈26.4249.21

演进主线

  • 开山(OccWorld):VQ-VAE 场景 tokenizer + GPT 式时空自回归,不用框/地图就把规划做到 L2 1.17(接近 UniAD 1.03),并揭示「重建好≠世界建模好」(空间分辨率 100² 重建飙到 78 但预测/规划反而更差)。
  • 扩散替 AR 的代价(OccSora→DOME)occsora 首把 Sora 思路搬进占据(DiT 整段去噪替逐帧 AR),但 512× 压缩把重建 mIoU 打到 27(约 OccWorld 四折),且「只能生成不能预测」;dome-occupancy-world-model 用连续 Occ-VAE(不压时间)+ 帧级条件掩码解决「能预测」,重建 mIoU 83.08、4D 预测 27.10,且轨迹重采样数据增强解决 nuScenes 87% 直行偏置。
  • 表征轻量化竞赛(GaussianWorld→GenieDrive→SparseWorld)gaussianworld-occupancy 换显式 3D 高斯,把占据预测重述为流式 4D 预测,只用上一帧历史几乎不增推理开销(228ms vs 单帧 225ms);geniedrive 用 tri-plane VAE 把 latent 压到 BEV 方案 58%,占据 WM 仅 3.47M 参数、41.38 FPS,且首次系统验证「只有连续(非 VQ 离散)表征才能吃 E2E 训练红利」(DOME+E2E 直接崩到 0.43);sparseworld-4d-occupancysparseworld-tc 两支独立团队撞名,均收敛到「稀疏 query/锚点替稠密体素」——后者纯前馈、纯相机输入的 IoU(49.21)竟反超用真值占据输入的方法。
  • 半监督降标注(PreWorld)semisup-vision-centric-occ-world-model 用便宜的 2D 渲染标签自监督预训练、贵的 3D 占据标签微调,两层 MLP 的预测模块端到端替掉「冻结占据模型+tokenizer+AR+解码器」的间接路径;150 scenes 稀缺标注时预训练能把 mIoU 从 18.66 拉到 25.02。
  • 占据当预训练目标(DriveWorld)driveworld-4d-pretraining 不做生成,把 WM 纯当 4D 预训练——Memory State-Space Model(动态记忆库 + 静态场景传播)替标准 RSSM(后者压 1D 丢空间上下文,预训练反把检测拖到比不预训练还差),在 nuScenes 六下游任务全面涨点(规划 L2 降 0.34m)。

子范式四:点云预测(自监督感知的世界模型)

用未标注 LiDAR 点云做「给过去点云+未来 ego 位姿→预测未来点云」,本质是最纯的无监督世界模型。样本少但影响大——它把驾驶预测从「需框/分割监督」推向「GPT 式无监督」。

工作时间输入→输出方法nuScenes Chamfer 1s/3s↓定位
4D-Occ (基线)2023LiDAR→点云可微光线投射1.41 / 1.40前 SOTA
copilot4d-waabi2023-11LiDAR→点云VQVAE + 吸收-均匀离散扩散0.36 / 0.58首把 MaskGIT 严格 recast 成离散扩散
vidar-visual-point-cloud-forecasting2023-12相机→点云BEV + Latent Rendering1.25 / 1.73首个跨模态 WM,做预训练
  • copilot4d-waabi(Waabi)证明「tokenize everything + discrete diffusion」配方可跨域,两个极小模型(tokenizer 13M、WM 39M)把点云预测 SOTA 的 Chamfer 砍 65–75%(1s)、跨数据集迁移 >4×;核心方法贡献是只需「非 mask 位加均匀噪声 + loss 覆盖全部位置」两处改动,就让采样时能迭代修正已解码 token(MaskGIT 做不到)。
  • vidar-visual-point-cloud-forecasting(OpenDriveLab)反其道——视觉进、点云出,把它当自监督预训练任务同时压满语义+3D几何+时序三种监督,关键 Latent Rendering 算子解决「直接接可微光线投射反而掉点」的射线状特征坑(+3.47 NDS),让 UniAD 全栈涨点(检测 +3.1 NDS、规划碰撞率降 ~15%)。它直接催生了 CVPR 2024 Predictive World Model 挑战赛。

值得注意的是,点云预测后来被统一模型吸收hermes-driving-world-model/hermes-plus-plus 把「未来点云生成」当统一 WM 的生成分支,仅用当前帧多视角图像就把 3s Chamfer 从 ViDAR 的 1.73 降到 1.17(HERMES)、再降到 1.01/0.97(HERMES++ 1.8B/3.8B)。


子范式五:4D 重建 × 生成融合(前馈高斯的崛起)

这一支解决「生成能造但 3D 一致性弱、重建一致但不能无中生有」的分裂,把生成能力内嵌进显式 3D/4D 表征。演进从「生成视频再重建」的两阶段,走向「扩散直接吐可解码为高斯的隐变量」的单次前馈。

工作时间思路骨干关键数字
magicdrive3d2024-05生成多视角视频→容错 3DGS(FTGS)MagicDrive逐场景优化 ~30min,NVS FID 34.45(vs 3DGS 145.72)
drivedreamer4d2024-10WM 当 4DGS 数据机器DriveDreamer-2NTA-IoU +15~44%,换道用户胜率 >80%
recondreamer2024-11在线修复(DriveRestorer)+渐进更新DriveDreamer-2撑 6m 大机动,vs DD4D +196~471%
worldsplat2025-09扩散吐隐变量→前馈高斯解码,单次前馈OpenSora STDiT2NVS ±4m FID 13.38(vs DiST-4D 17.57),Rectified Flow 8 步
gaussiandwm2025-12语言特征挂 3D 高斯,理解+生成Qwen3-8B+扩散理解 Avg 57.14,生成 ±1m FVD 44.5
xiaomi-auto-world-model2026-05WorldRec 前馈重建 + WorldGen 因果生成DiT重建 10s clip≈10s(vs ~4h),WorldGen FVD 64.97/81帧
  • drivedreamer4drecondreamer 是同队(GigaAI)的递进:前者「训练无关」直接用 WM 生成新轨迹视频混进 4DGS,后者把它升级为可训练的在线修复模型 DriveRestorer + 渐进数据更新(PDUS),把可渲染的机动幅度从轻微偏移推到 6m 跨车道(消融证明一次性大偏移=关闭 PDUS 效果最差,渐进本身是关键)。
  • worldsplat(Xiaomi EV)把「先生成后重建」两阶段合并成单次前馈——扩散不吐像素而吐可被 3DGS 解码的多模态隐变量,动静分解的前馈高斯解码器支持 48+ 路视角,增强扩散模块专补 3DGS 的未观测空洞与运动模糊;Rectified Flow 仅 8 步采样使含两个扩散模块的管线反而比单扩散基线更快。
  • xiaomi-auto-world-model(Joint WM 技术报告)把重建(WorldRec,稀疏查询前馈,10s clip 从小时级压到 ~10s)与生成(WorldGen,双向预训练→Teacher Forcing→ODE Distillation→DMD 三级因果微调,50→4 步)耦合,几何约束抑制生成漂移、生成填补重建盲区;作为自回归模型 FVD 64.97 反超表中全部双向模型(但缺 Joint WM 本体的量化消融)。

子范式六:统一理解-生成(LLM/VLM 骨架)

把「看懂场景(VQA/描述/定位)」和「预测未来(点云/占据/图像)」收进同一个 LLM 前向。此前 DWM 与驾驶 VLM 是两条互不相交的线,这一支把它们缝起来。

工作时间骨架场景表征理解 CIDEr↑生成 3s Chamfer↓特色
doe-12024-12Lumina-mGPT 7B无中间表征(纯 token)(VQA)(FID 15.9)观测→描述→动作一条 AR 序列,闭环
hermes-driving-world-model2025-01InternVL2-1.8BBEV0.7411.17world queries 迁移文本世界知识
gaussiandwm2025-12Qwen3-8B语言 3D 高斯(Avg 57.14)(生成 RGB-D)文本-3D 显式空间对齐
hermes-plus-plus2026-04InternVL2-1.8B/3.8BBEV0.749/0.7721.01/0.97显式+隐式几何联合优化
  • doe-1 最激进——不用任何手工中间表征(BEV/占据/3D高斯),把感知/预测/规划统一成一条多模态 token 序列(观测→描述→动作→观测…),单模型不微调即可切三任务;用非可学习正弦位置编码离散化浮点数、训练-推理一致的动作 mask 抑制多步误差累积。
  • hermes-driving-world-modelhermes-plus-plus 是同队(HUST)会议→期刊的加固:会议版用从 BEV max-pool 出的 world queries 在 LLM 因果注意力里「偷听」文本世界知识再驱动未来 BEV 生成;期刊版把单靠显式点云监督换成显式(渲染)+ 隐式(冻结几何提取器的余弦/Gram 损失)联合优化,加 Textual Injection(文本嵌入直接进 Current-to-Future Link 的 Key/Value)与 Ego Modulation(FiLM 式解耦自车运动),3s 生成误差再降 13.7%。
  • gaussiandwm 换表征——把 CLIP 语言特征直接挂在每个 3D 高斯上(LangSplat 式),实现文本-3D 的显式空间对齐(相对 HERMES 的 BEV 特征级对齐更精确),任务感知混合采样把百万高斯压到 4096 token 喂 Qwen3-8B。

子范式七:世界模型 × 规划(从仿真器到决策引擎)

这是 2025–2026 最活跃的方向,主线是世界模型与规划器耦合方式的逐级加深:外部仿真器 → 隐空间辅助表征 → 特征共享 → 权重级表征继承 → action-conditioned 反事实想象。核心争论是「世界模型的未来预见性能否、以及如何真正进决策链路」。

nuScenes 开环规划(L2/碰撞率)+ NAVSIM PDMS 横评:

工作时间输入耦合方式L2 avg↓Coll avg↓NAVSIM PDMS↑
UniAD (基线)2023环视无 WM1.030.3183.4
drive-occworld2024-08环视占据 WM+代价规划器0.85(NoAvg)0.29
doe-12024-12单前视统一 AR(自身)1.260.53
epona-autoregressive-diffusion2025-06单前视共享隐表示分支1.250.3686.2
world4drive2025-07相机隐空间 WM 选轨迹(无感知标注)0.500.1685.1
policy-world-model-forecasting-planning (PWM)2025-10单前视collaborative state-action0.780.0788.1
worlddrive-scene-gen-planning (WorldDrive)2026-03单前视表征继承(权重级)0.420.1688.1/89.0
driveworld-vla (DriveWorld-VLA)2026-02多视角VLA+WM 共享潜空间 what-if0.610.1691.3(v1)
  • world4drive 走「感知标注免费」——用视觉基础模型(Metric3D v2 深度 + Grounded-SAM 语义)给隐空间 WM 注入空间-语义先验,让 WM 对多模态意图分别「想象」未来并挑最合理轨迹;相对前作 LAW 收敛快 3.75×,夜间/雨天碰撞率降 60%+。
  • policy-world-model-forecasting-planning (PWM) 的核心是协同而非仅架构统一——让动作预测显式依赖预测出的未来帧(P(A|D_{1:t+n}) 而非 P(A|D_{1:t})),并证明这带来规划增益;context-guided tokenizer 把单帧压到 28 token 使前瞻生成 ~40 FPS 不拖慢决策。
  • worlddrive-scene-gen-planning 把耦合升级为显式权重迁移——轨迹词表条件化的世界模型(TA-DWM)预训练的视觉/运动编码器直接冻结初始化规划器,Future-aware Rewarder 蒸馏未来隐特征在 53ms 内重排候选(比同类 WM 基线 PWM 的 570–850ms 快一个数量级)。
  • driveworld-vla 走得最远——VLA 与 WM 绑在同一 LLM 隐藏状态构成的共享潜空间里,用两支路 flow-matching DiT 做 action-conditioned「what-if」推理(针对不同候选动作分别想象后果再回头修正),三阶段递进训练;NAVSIMv1 PDMS 91.3、v2 EPDMS 86.8。

一个反复出现的诚实观察:开环 nuScenes 的 L2/碰撞率对 ego-status 极敏感(AD-MLP 早已把该榜刷饱和),多篇(DriveDreamer、PreWorld、SparseWorld、DriveWorld-VLA)都点出这一评测缺陷,NAVSIM/闭环指标更可信是共识。


子范式八:实时闭环仿真(终局形态)

闭环仿真要求策略动作实时改变仿真状态、进而改变下一步观测。生成式 WM 相对重建式(NeRF/3DGS)能外推到未采集视角/天气/agent 行为,但此前都太慢。nvidia-omnidreams(NVIDIA,2026-06)是这一族目前的终局形态展示:

  • 从 Cosmos-Predict 2.5 mid/post-train 出 2B 动作条件化 causal diffusion WM,streaming KV cache 维持长时一致,Self Forcing + DMD 蒸馏到 2 步扩散;单卡 GB300 单视角 68 effective FPS(720p),16 卡四视角 105 FPS/相机。
  • 训练数据横跨 15 国、RDS 16,600h + RDS-HQ-1M 4,944h;progressive long-context teacher 把 20s rollout 的漂移(末窗 FVD)从 409 降到 268。
  • 最惊人的是 World-Action Model (WAM):同一 backbone fine-tune 成 policy,~2B 参数在碰撞率上超过 ~10B 的 VLA 基线 Alpamayo 1.5(All Collision 6.9%→4.2%)——即世界模型可直接后训练成优于专用 VLA 的驾驶策略。配套开源 FlashDreams 通用流式推理框架。

这与 cosmos-drive-dreams 同属 Cosmos 生态,但后者面向离线 SDG 数据生成、前者面向实时闭环交互,代表 WFM 在驾驶垂域的两种落地形态。


全族共享的设计模式

跨越八个子范式,反复出现的工程范式:

  1. 冻结预训练底座 + 只训新增模块。从 SD1.4/1.5(drivedreamer/magicdrive)、SD2.1(wovogen/panacea-driving-video)、SVD(vista-driving-world-model LoRA / drivedreamer-2)、SDXL(genad-generalized-predictive-model 两阶段)、到 Cosmos(cosmos-drive-dreams/nvidia-omnidreams 冻结基座训 ControlNet)、CogVideoX(worlddrive-scene-gen-planning)、Wan2.1(geniedrive)。例外是 magicdriveditgaia-2-wayve 的从零训练,代价是更大算力。

  2. 结构化条件分路注入。DriveDreamer 定的模板延续至今:空间对齐条件(HDMap/深度)走通道拼接或 additive branch,物体条件(3D框)走门控/交叉注意力,语义条件(文本)走 CLIP 交叉注意力,动作条件走 Fourier embedding。动作的注入方式本身是个小战场:cross-attention(vista-driving-world-model/drive-occworld)、adaLN(gaia-2-wayve 实测比 cross-attn 更准)、token 序列内 AR(doe-1/drivingworld-gpt)、latent replacement(vista-driving-world-model)。

  3. 多视角一致性=只 attend 相邻视角magicdrive 证明 attend 全部 5 视角反而掉点、取 2 个相邻视角最优;drivingdiffusion/panacea-driving-video/drive-wm-driving-into-the-future/magicdrivedit 全沿用。

  4. 语义化 tokenizergaia-1-wayve 把 DINO 特征蒸馏进 VQ token 提升语义、简化 WM 输入空间;gaia-2-wayve 用 DINOv2-Large 隐空间蒸馏。占据侧则是 occworld 的「重建好≠世界建模好」教训——tokenizer 要学高层概念而非死磕重建。

  5. 长时程一致性的四种解法:latent replacement 动态先验(vista-driving-world-model)、记忆注入/曲线自适应损失(infinitydrive)、随机掩码+平衡注意力(drivingworld-gpt)、chain-of-forward 一步速度场模拟推理噪声(epona-autoregressive-diffusion)、Self-Forcing+DMD+progressive teacher(nvidia-omnidreams)。本质都是缩小 train/inference 分布差(exposure bias)。

  6. 世界模型作为数据引擎。几乎每篇多视角生成工作都验证合成数据涨下游(magicdrive/panacea-driving-video/drivedreamer-2/delphi-driving-video/worldsplat/cosmos-drive-dreams),但 rethinking-dwm-synthetic-data-generator 的公平性反思提醒:epoch 对齐后旧增益可能消失,真增益要靠 3D-aware 定向编辑或长尾定向采样。

  7. 共同的失效模式与自陈局限。几乎全族都承认:(a) 扩散/AR 推理慢、非实时(除已蒸馏的 Epona/OmniDreams/GenieDrive);(b) 学不会「幻想视野外新驶入的车」(occworld/copilot4d-waabi/cam4docc-benchmark 明确点出);(c) 长时程随多样化生成偏离 GT,3s 规划反不如短时;(d) nuScenes 开环指标对 ego-status 敏感。


这一族在往哪走

综合 2025–2026 的走向,六个清晰趋势:

一条未解的主线张力依旧贯穿全族:可控性(结构条件、显式几何、离散表征)与规模泛化(互联网数据、连续隐空间、大基础模型)之间的取舍,正是 2023 年 drivedreamergaia-1-wayve 分道的那道题——三年过去,答案越来越像是「两者都要」,而 flow-matching 连续隐空间 + 结构化 ControlNet + 大 WFM 后训练,是目前最被看好的收敛点。