一句话定位

GenieDrive(HKU + 华为诺亚方舟实验室 + 华中科大,CVPR 2026)是一个两阶段驾驶世界模型:先用一个仅 3.47M 参数、41.38 FPS 的轻量占用(occupancy)世界模型自回归预测未来 4D 占用,再用占用溅射(splatting)出的多视角语义图去引导一个基于 Wan2.1-1.3B 微调的视频扩散模型生成多视角驾驶视频;相比把动作直接映射到视频的”黑盒”扩散驾驶世界模型(如 vista-driving-world-modelepona-autoregressive-diffusion),把 4D 占用作为显式物理约束插在中间,用以对抗训练数据中”几乎都是直行”带来的分布偏置。

背景与定位

论文开篇指出一个具体失效模式:现有视频扩散类驾驶世界模型(vista-driving-world-modelepona-autoregressive-diffusionmagicdrivedit 等)直接学习”驾驶动作 → 视频”的去噪过程,由于 NuScenes 等公开驾驶视频数据集里绝大多数片段是直行,模型容易过拟合这种分布——命令右转时,Vista 会原地不动,Epona 会生成直行视频(论文 Figure 2 定性对比)。GenieDrive 的定位是插入一个中间的物理表征层:4D 占用天然编码 3D 结构与动力学,用它做”控制 → 占用 → 视频”的两段式生成,占用阶段承担物理一致性,视频阶段只负责把占用渲染成逼真像素。这与既有的占用引导视频生成工作(UniScene、InfiniCube、wovogen)不同:UniScene/InfiniCube 需要 BEV 地图作为占用生成的输入(更像”翻译器”),wovogen 虽能预测占用但序列长度只有 6 帧;GenieDrive 的占用世界模型仅依赖历史观测和驾驶控制做自回归生成,且支持生成长达 241 帧的占用序列。占用预测部分沿用了 I2-World 的编码器-解码器范式并在其基础上改造(三平面表征 + 端到端训练)。

模型架构

两阶段流水线(对应 Figure 1):

第一阶段——轻量占用世界模型

  • Tri-plane VAE:把占用 $O\in\mathbb{R}^{H\times W\times D}$(Occ3D-NuScenes 上 $H=W=200, D=16$)先用 3D 卷积 $g_\phi$ 下采样 4× 得体素特征 $S\in\mathbb{R}^{50\times 50\times 4\times 64}$($C=64$),再用三个独立 transformer、借鉴 BERT [CLS] token 的做法(拼接可学习 token 后做自注意力,取输出 token 为投影结果)把 $S$ 分别沿 XY/YZ/XZ 三个方向压成三张隐平面:$Z_{xy}\in\mathbb{R}^{50\times50\times64}$,$Z_{yz}\in\mathbb{R}^{50\times4\times64}$,$Z_{xz}\in\mathbb{R}^{50\times4\times64}$,拼接后统一表征 $Z\in\mathbb{R}^{50\times58\times64}$,仅为此前 BEV 方案(OccWorld/DOME/I2-World 通常压成 $\mathbb{R}^{50\times50\times128}$)latent 尺寸的 58%($\frac{50\times58\times64}{50\times50\times128}\times100%=58%$)。解码时对三张隐平面做 Hadamard 积 + 可学习位置编码,再经 3D 反卷积 $f_\psi$ 还原占用。VAE 损失 = 交叉熵 + Lovász-softmax + KL 散度。
  • Mutual Control Attention(MCA):每层依次做三步注意力——占用隐 $Z^l$ 查询控制隐 $c^l$(Q=Z, K=V=c)、$Z$ 自注意力、控制隐 $c^l$ 反过来查询更新后的 $Z^{l+1}$(Q=c, K=V=Z),使占用与控制(指令/轨迹)双向影响;并借鉴 I2-World 的中间变换监督,用一个 MLP 头 $f_{trans}$ 把某中间层的控制隐解码成位姿变换矩阵,用真值变换矩阵 $T$ 做回归监督(权重 $\lambda$,具体数值论文未披露)。融合后的隐平面经空间-时间 transformer 块(spatial=平面内自注意力;temporal=将过去 $k$ 帧隐平面沿通道拼接后用 MLP 从 $(k+1)C$ 投影回 $C$,$k$ 的具体取值论文未披露)自回归预测下一时刻 $\hat Z_{t+1}$。

第二阶段——占用引导的物理感知视频生成

  • 先用溅射(splatting)算法把预测占用投影渲染成多视角语义图 $\mathbf{M}$(对每个占用体素的语义 one-hot 按不透明度加权累积,argmax 取每像素语义),作为物理条件。
  • 在预训练视频生成模型 Wan2.1-1.3B(flow-matching/rectified-flow 视频 DiT)上微调,v-prediction 流匹配损失。
  • 新增 Multi-View Attention(MVA):把 DiT 输出的隐 $Z$ 从 $n(thw)C$ 重排为 $(th)(nw)C$,只在同一高度、跨视角的位置上做自注意力(而非对时间×空间×视角做全量 flatten 自注意力,避免二次复杂度爆炸),插在每个 DiT block 之后。
  • 归一化(Normalized MVA):新模块未经训练,直接叠加会破坏预训练先验;引入交叉归一化 $Z’=Z+\eta\left(\frac{M-\mu_M}{\sigma_M}\sigma_Z+\mu_Z\right)$(先把 MVA 输出 $M$ 标准化,再重缩放到 $Z$ 的均值/方差分布),$\eta$ 为强度超参(具体数值未披露),使新模块可被渐进优化而不坍塌预训练先验。

数据

  • 数据集:NuScenes(700 训练场景 / 150 验证场景),占用真值用 Occ3D-NuScenes 的 2Hz 标注(体素分辨率 $200\times200\times16$)。
  • 视频生成帧率:多视角驾驶视频生成/评测帧率 12Hz;六视角输出分辨率 $6\times256\times512$(对比 Vista 单视角 $576\times1024$、Epona 单视角 $512\times1024$、MagicDrive-V2 六视角 $6\times848\times1600$,分辨率明显更低,是效率-画质的权衡)。
  • 三档视频长度:S(8 帧,约 0.7s)、M(37 帧,约 3s)、L(81 帧,约 7s);L 模型通过 rollout 可外推到 241 帧(约 20s),是 NuScenes 数据集里能达到的最长视频长度。
  • Sim-to-real 补充实验:用 CARLA 模拟器生成的占用作为条件,迁移出真实感多视角视频(仅定性展示,论文未给量化指标)。
  • 未见预训练视频数据规模、额外中国场景 in-house 数据等披露(此文重点是驾驶数据集 NuScenes 上的训练/评测,未像部分同类工作那样额外引入私有车队数据)。

训练方法

占用世界模型两步走

  1. Tri-plane VAE 单独训练 210 epoch(dropout 0.5),第 140 epoch 已达 83.34 mIoU;整个 VAE 训练仅需 6 小时(8×NVIDIA L40 GPU)
  2. 预测模块训练:先冻结 VAE,训练预测模块 48 epoch;再解冻 VAE+预测模块做端到端(E2E)联合训练 24 epoch(共 72 epoch)。E2E 目标 $\mathcal{L}{E2E}=\sum_t\beta_t|O{t+1}-f_\theta(\mathcal{F}{pred}(\mathcal{F}{{xy,yz,xz}}\circ g_\phi(O_t),c))|^2$,同时保留 $\mathcal{L}_{reg}$。论文用 Table 6 逐 epoch 展示这一权衡:重建 mIoU/IoU 从 E2E 前的 86.15/75.53 单调降到 epoch24 的 67.89/62.33,而预测 mIoU/IoU 从 39.79/50.46 先升到 epoch16 峰值 42.59/51.80,此后因过拟合略微回落(epoch24: 42.43/51.80)。
  3. 视频生成阶段:在 Wan2.1-1.3B 基础上做 v-prediction 流匹配微调,条件是占用溅射出的多视角语义图;MVA 模块通过归一化逐步引入,避免破坏预训练先验(消融见下)。

关键发现——并非所有方法都能吃 E2E 训练红利:论文额外对比方法 DOME、I2-World 做 E2E 训练做对照实验(Table 3):DOME + E2E 直接崩溃(forecasting mIoU 从 27.10 掉到 0.43),I2-World + E2E 也显著下降(39.73→10.09);论文归因为扩散损失鼓励更简单的隐空间(DOME 的情况)以及离散表征(I2-World 用 VQ 编码)与 E2E 训练不兼容。为验证这一点,作者做了 “w/o CR”(把自家 tri-plane VAE 换成带向量量化的离散版本)消融:E2E 前 CR/无 CR 性能接近,E2E 后连续表征(Full method)从 39.79→42.59 提升,而离散版(w/o CR)从 39.09 反而降到 35.24(w/o CR & E2E 行),证明连续表征是 E2E 训练能生效的前提

Infra(训练 / 推理工程)

  • 训练硬件:全部实验在单台 8×NVIDIA L40S(48GB 显存/卡) 服务器上完成;VAE 单独训练 6 小时。
  • 总训练时长:约一周,其中占用世界模型(VAE+预测模块)训练 3 天,视频生成模型微调 4 天,全程只用 8 张 GPU。对比基线 Vista/Epona/MagicDrive-V2 需要 32–128 张 GPU、训练 192–1080 小时(论文 Figure 6 效率对比),凸显”基于预训练视频模型微调 + 轻量占用世界模型”相对于从头训练视频世界模型的成本优势。
  • 推理效率
    • 占用世界模型:41.38 FPS(论文摘要四舍五入为 41 FPS),仅 3.47M 参数(含 VAE + 预测模块)。
    • 视频生成:平均 4.36 秒/帧,显存占用 11.72GB,单卡即可推理;对比 MagicDrive-V2 需要 8 卡序列并行、占用 39.76GB 显存。
  • 未披露:具体学习率、batch size、优化器类型、MCA 中间监督权重 $\lambda$、MVA 强度 $\eta$、时序窗口 $k$ 的取值。

评测 benchmark

4D 占用预测(Occ3D-NuScenes,4 帧历史预测 6 帧未来,即 1s/2s/3s),Table 1(重建/预测 mIoU、IoU,FPS,参数量):

方法输入重建 mIoU预测 mIoU(avg)重建 IoU预测 IoU(avg)FPS参数量
OccWorldOcc66.3817.1462.2926.6318.0072.39M
OccSoraOcc66.9723.0768.7835.0120.00174.19M
OccLLaMAOcc&Text75.2019.9363.7929.17->7B
Occ-LLMOcc&Text-20.99-32.52->7B
DFITOcc&Camera-22.71-32.27--
DOMEOcc83.0827.1077.2536.366.54397.55M
UniSceneOcc&Box&Map72.9031.7664.1034.841.7269.47M
COMEOcc83.0834.2377.2544.130.30692.97M
I2-WorldOcc81.2239.7368.3049.8037.0422.71M
GenieDriveOcc86.1542.5975.5351.8041.383.47M

相比最强基线 I2-World,预测 mIoU 相对提升 7.2%(42.59 vs 39.73),预测 IoU 相对提升 4.0%(51.80 vs 49.80),同时参数量仅为其 15%。更长时程预测(4s/5s/6s,Table 2,不额外训练):GenieDrive 6s 时的 mIoU/IoU(23.66/35.60)仍高于 DOME/UniScene 在 4s 时的水平,OccWorld/DOME/UniScene 随时程急剧退化,GenieDrive 平均 mIoU/IoU(27.33/39.14)领先第二名 I2-World(25.49/38.54)。

多视角驾驶视频生成(Table 4,FVD/mIoU/mAP)

方法帧数条件FVD↓mIoU↑mAP↑
Panacea8BEV139.00--
Vista*25Action112.65--
MagicDrive60BEV&3DBox217.9418.2711.86
MagicDrive-V2241BEV&3DBox94.8420.4018.17
WoVoGen6Occ417.70--
UniScene8Occ70.5221.7510.32
GenieDrive-S8Occ55.9331.0021.23
UniScene-Rollout32Occ610.1518.696.24
GenieDrive-M37Occ98.0631.4419.84
GenieDrive-L81Occ92.7831.0318.89
GenieDrive-L Rollout241Occ137.2531.0318.89

同为 8 帧对比 UniScene,FVD 相对下降 20.7%(55.93 vs 70.52);mIoU/mAP 全面超过此前最强的 MagicDrive-V2(20.40/18.17)。消融(Table 5):去掉 Normalized MVA(仅保留朴素 MVA)FVD 从 98.06 恶化到 120.16;进一步去掉归一化(w/o Normalization)FVD 恶化到 212.67 且产生明显网格伪影,证明归一化是稳定微调的关键,而非 MVA 本身。占用预测侧的消融(Table 3):去掉 MCA(用朴素自注意力替代)预测 mIoU/IoU 从 42.59/51.80 降到 38.96/48.68,在 3s 处降幅最大,说明 MCA 主要贡献在长时程控制建模。

创新点与影响

  • 贡献:(1) tri-plane VAE 把占用压缩到 BEV 方案 58% 的 latent 尺寸、同时重建质量更好;(2) Mutual Control Attention + 端到端训练的占用世界模型,3.47M 参数达到 SOTA 预测精度(41.38 FPS);(3) Normalized Multi-View Attention 把单视角预训练视频扩散模型(Wan2.1-1.3B)低成本微调成多视角占用引导生成器,FVD 相对 SOTA 占用类方法降 20.7%;(4) 首次系统性验证”端到端训练对占用世界模型是否总有效”——发现只有连续(非离散/VQ)表征才能从 E2E 训练中获益,扩散类方法(DOME)反而会因隐空间坍塌而崩溃。
  • 对比同类工作的实证意义:论文用 Figure 2 的定性对比直接展示视频扩散黑盒模型(Vista、Epona)对”转弯”控制信号的失效(原地不动 / 变成直行),为”需要显式物理中间表征”提供了具体证据,而不只是理论论证。
  • 可编辑性:因为中间产物是占用而非隐视频特征,可以在 3D/4D 空间直接增删物体(如移除车辆/插入卡车)再重新渲染视频,论文将其定位为分布外(OOD)驾驶数据合成的实用能力。
  • 论文未设专门 Limitations 小节,但从披露的数字可读出隐含权衡:(a) 输出分辨率(6×256×512)明显低于同为多视角的 MagicDrive-V2(6×848×1600),是”轻量/快速”与”高分辨率”之间的取舍;(b) sim-to-real(CARLA→真实感视频)部分只有定性展示、无量化指标;(c) E2E 训练存在过拟合窗口——预测精度在 epoch16 见顶后随继续训练略微回落(Table 6),需要早停;(d) 两阶段流水线意味着误差可能在占用预测→溅射→视频生成之间累积,论文未给出针对该复合误差的专门分析。

原始链接

一手源存档(sources/)

  • geniedrive—project-page — 项目页快照(sources/world-model/2025/geniedrive—project-page.md,fetched 2026-07-16;摘要、方法图注、视频结果小节结构)
  • geniedrive—github-readme — GitHub README 快照(sources/world-model/2025/geniedrive—github-readme.md,fetched 2026-07-16;三阶段流水线 occ_gen/occ_rasterizer/occ_render、发布时间线、CVPR 2026 录用信息、HF 模型权重卡片内容)
  • arXiv 2512.12751 全文 PDF/HTML:见上「原始链接」(arXiv 原文,不入 git;本页正文数字取自 arXiv HTML 全文 2512.12751v1 的正文 Section 1–5 与附录 Section 6–11)