一句话定位

DrivingDiffusion 是百度提出的多视角驾驶场景视频生成框架:把单帧多视角图像生成、单视角时序视频生成、长视频后处理三阶段级联,用跨视角/跨帧一致性注意力 + 局部 prompt 解决多相机一致性与实例质量问题,在 nuScenes 上取得当时最优的 FID/FVD,并验证了合成数据能直接提升下游 3D 检测指标。

背景与定位

BEV 感知需要大规模、标注精确的多视角视频数据,但真实采集与标注成本高昂。此前的驾驶场景生成工作要么局限于单视角视频(如 drivedreamer,用 HDMap/3D 框/文本条件生成单相机视频并联动预测未来驾驶动作),要么局限于多视角图像而不涉及时序(如 BEVGen 用 VQ-VAE 从 BEV 分割布局生成多视角城市街景图,是本文最直接的对比对象)。DrivingDiffusion 把任务往复杂方向推进一步:多视角 + 多帧 + 复杂城市场景 + 3D 层级布局可控,这四点叠加此前没有工作同时做到。

论文将其定位为”multi-view video data generation from 3D layout”这一新任务的开创工作,直接服务于两个下游目标:(1) 作为 BEV 检测/分割模型的数据增强源;(2) 通过编辑 3D 布局模拟碰撞等稀有场景,服务仿真测试。

与同期工作的坐标:gaia-1-wayve 是同期自回归驾驶世界模型(单视角、无 3D 布局控制);drive-wm-driving-into-the-future(Drive-WM,2023-11,晚于本文)进一步把多视角一致视频接上真实端到端规划器;本文与 DriveDreamer 互为同代竞品,DriveDreamer 论文将本文归类为”多视角图像布局生成,无时序视频”一类(注:DriveDreamer 论文写作/投稿早于 DrivingDiffusion 的多视角视频版本更新,二者后续均扩展到多视角视频)。

模型架构

基础主干:基于 Stable Diffusion 官方代码库与公开的 1.4B 参数 T2I 模型(SD v1.4),冻结图像自编码器,每个视角/每帧单独编码为潜表示。视频/多视角维度扩展沿用 VDM 的做法:把 2D 卷积层扩展为 1×3×3 伪 3D 卷积(保留预训练 2D 参数),并在每个 transformer block 内加入时间自注意力层做跨维度信息交换。

3D 布局控制器(3D Layout Controller):把道路结构信息(车道等)、目标类别、目标实例 ID 编码进 RGB 值,用相机参数把 3D 层级布局投影到像面,再用一个 ResNet-like 编码器在 U-Net 的四个分辨率级 64×64、32×32、16×16、8×8 上通过残差连接注入控制信息 —— 效果类似 ControlNet 的可训练副本,但参数量更省。

多视角模型(Multi-View Model):输入所有视角的 3D 布局 + 场景文本描述,只用一个 3D 布局控制器生成高度对齐的多视角单帧图像。

跨视角一致性注意力:对第 i 个视角的潜表示 z_v^i,仅与左右相邻视角 z_v^{i-1}、z_v^{i+1} 做 cross-attention(Q 来自 z_v^i,K/V 来自相邻视角的拼接),只建模相邻视角而非全部视角对,控制计算量。

时序模型(Temporal Model):输入单视角全部帧的 3D 布局、视频首帧图像、该相机的光流先验。新增维度从”多视角”换成”多帧”。引入 Key-Frame Controller:用多视角视频序列的首帧作为控制条件保证跨帧一致性;为避免给每个相机单独训一个视频生成模型,把逐相机统计得到的光流趋势(固定值先验)编码成 token,以类似 time embedding 的方式注入网络。

跨帧一致性注意力:对第 j 帧(j>1)的潜表示 z_t^j,与首帧 z_t^1 和前一帧 z_t^{j-1} 的拼接做 cross-attention,结构与跨视角注意力对称。

一致性损失(Consistency Loss):用一个预训练的图像匹配/相对位姿回归网络 F(训练时冻结参数)监督生成结果的几何一致性——多视角模型监督相邻视角间位姿,时序模型监督时序相邻帧间位姿,以真实相对位姿为 ground truth。

局部 prompt(Local Prompt):预存每个类别 k 的文本 T_k,用 CLIP 编码器 φ 得到类别 embedding F_k=φ(T_k);用 3D 布局投影后的最小外接矩形作为该类别的注意力 mask M_k,让 cross-attention 只在实例局部区域内对齐类别文本,与全局 prompt 共享同一套参数结构(未单独训练新参数)。

后处理 / 长视频微调模型:复用跨视角模型的结构与参数,额外加一个控制器接收时序模型生成的后续帧,把”生成帧 + 首帧”作为条件微调提升多视角一致性;训练时用时序模型对数据集原始多视角图像生成的大量后续帧作输入、原始真值图像作监督。

多阶段长视频推理流程(Fig.3):① 多视角模型生成首帧全景图 → ② 时序模型对每个视角并行生成后续序列 → ③ 微调模型对后续帧做并行精修 → ④ 用新关键帧滑动窗口延展视频长度。

训练分辨率与批次:512×512,选取六组六相机(six groups of six cameras)用于训练。

数据

  • 数据集:nuScenes(六路环视相机)。论文未重述具体的 train/val 场景数或视频总时长/总帧数,训练与评测均在 nuScenes 标准 train/val 划分上进行。
  • 合成数据增强实验(Table 3,用于验证生成数据对下游检测的价值):在原始训练集之外补充生成的合成帧,聚焦长尾类别——(a) 不加合成数据(baseline);(b) 补充 2,000 帧合成数据,聚焦改善障碍物朝向角分布;(c) 补充 6,000 帧合成数据,聚焦稀有场景(小目标、近距离车辆、朝向角)。论文未说明这批合成帧的具体生成分辨率(正文训练分辨率统一为 512×512)。
  • 条件标注:3D 布局条件(道路结构 + 目标类别 + 实例 ID 编码为 RGB)与场景文本描述均来自 nuScenes 自带标注/相机参数投影,论文未说明是否借助额外的预训练感知模型补齐标注频率(这一做法在同期 DriveDreamer 论文中出现,但本文未明确提及)。
  • 仿真 vs 真实:全部为真实 nuScenes 采集数据,无仿真数据参与训练;生成的合成数据用于反哺下游感知模型训练(数据增强),而非训练本身的世界模型。

训练方法

  • 目标函数:标准 LDM/DDPM 去噪目标(预测噪声 ε_θ 的 L2 损失),在此基础上叠加一致性损失(跨视角/跨帧几何位姿监督)。
  • 三阶段训练:① 跨视角(多视角单帧)模型训 50,000 步;② 时序模型训 40,000 步;③ 长视频微调模型训 10,000 步
  • 参数复用策略:跨视角模型与时序模型结构高度相似(仅新增维度处理模块不同),微调模型直接复用跨视角模型的结构与参数再加一个控制器,最大化利用预训练 SD 权重与已训练模块,减少从零学习的成本。
  • 推理采样:使用 DDIM sampler 采样生成 3D 布局引导的多视角视频。
  • 未披露:优化器类型、学习率、batch size 的精确取值(仅知训练分辨率 512×512、“六组六相机”选取方式)、noise schedule 具体参数。

Infra(训练 / 推理工程)

  • 训练硬件8× NVIDIA Tesla A100 40GB
  • 训练时长:跨视角模型 + 时序模型(cross-view model and cross-frame model)合计可在 36 小时内完成训练;微调模型训练时长未单独披露。
  • 推理:DDIM 采样,多阶段级联(多视角 → 时序 → 微调 → 滑动窗口延展);推理 FPS / 单帧延迟 / 端上部署硬件均未披露——论文定位是离线数据生成引擎,不追求实时性。
  • 并行策略 / 训练精度(fp16/bf16):未披露。

评测 benchmark

全部为论文一手结果,均在 nuScenes 验证集上评测。

① 图像/视频生成质量(Table 1,FID↓ / FVD↓)

方法多视角多帧FID↓FVD↓
BEVGen25.54-
DriveDreamer52.6452
DrivingDiffusion(仅多视角)15.89-
DrivingDiffusion(仅多帧)15.85335
DrivingDiffusion(完整)15.83332

完整模型与单独多视角/单独多帧版本的指标接近,说明方法的稳定性;相较 BEVGen(图像)与 DriveDreamer(视频)均有明显优势。

② 下游检测/分割一致性(Table 2,全部 6 视角,绿色为相对真实验证集的下降幅度)

方法Road mIoU↑Vehicle mIoU↑Drivable mIoU↑Object NDS↑
Baseline(真实数据)71.336.081.741.2
BEVGen50.2 (-21.1%)5.9 (-39.1%)--
Sparse BEVGen50.9 (-20.4%)6.7 (-29.4%)--
DrivingDiffusion63.2 (-8.1%)31.6 (-4.4%)67.8 (-13.9%)33.1 (-8.1%)

Road mIoU / Vehicle mIoU 由 CVT 分割模型评测,Drivable mIoU / Object NDS 由 BEVFusion 多任务模型评测。DrivingDiffusion 相对真实数据的下降幅度远小于 BEVGen 系(道路 -8.1% vs -21.1%;实例 -4.4% vs -39.1%),说明生成图像与真实分布/布局的一致性显著更好。

③ 合成数据对感知任务的增益(Table 3,BEVFusion 为基线)

设置额外合成数据量Object NDS↑mAOE↓
(a)00.4120.5613
(b)2,000 帧0.4180.5295 (-3.18%)
(c)6,000 帧0.434 (+2.2%)0.5130 (-4.83%)

聚焦稀有场景的 6,000 帧合成数据带来 NDS +2.2%、朝向角误差 mAOE -4.83% 的实测收益,验证了合成数据增强对真实感知任务的价值。

④ 消融:一致性模块 + 局部 prompt(Table 4)

设置一致性模块局部 promptFID↓FVD↓Object NDS↑
(a)17.3042028.1
(b)16.6736528.9
(c)17.6240932.6
(d)15.8333233.1

一致性模块主要拉低 FVD(对时序连贯性影响更直接:420→365,-55),局部 prompt 主要拉高实例质量 NDS(28.1→32.6),二者组合达到最优(15.83 / 332 / 33.1),验证两个设计彼此独立且互补。

创新点与影响

  • 首个多视角 + 多帧 + 3D 布局可控的驾驶场景视频生成框架,把此前”多视角图像”(BEVGen)与”单视角视频”(DriveDreamer)两条线合流。
  • 级联三阶段架构(多视角单帧 → 单视角时序 → 长视频微调后处理)配合跨视角/跨帧一致性注意力,用较低的架构代价(新增极少参数)解决了跨视角、跨帧一致性两大挑战。
  • 局部 prompt 用类别文本 + 布局 bbox mask 的局部 cross-attention,专门针对性提升实例(车辆/行人/锥桶等长尾类别)生成质量,消融显示对 NDS 提升尤为显著(28.1→32.6)。
  • 验证了生成数据反哺真实感知任务的可行性:6,000 帧合成数据即带来 BEVFusion 检测器 NDS +2.2%、mAOE -4.83% 的实测提升,为数据稀缺/长尾场景提供了低成本增强路径。
  • 论文自述的局限与展望:作者在结论中提出该范式可扩展到深度图、点云、occupancy、渲染资产等更多控制信号;并展望用自回归方式在大规模视频(尤其数据挖掘获取的视频)上训练,得到能预测未来视频、同时可作下游任务预训练基座的模型——这一方向后续被 GenAD、Vista 等工作沿着”大规模视频预训练驾驶世界模型”路线推进。论文本身未设专门的 Limitation 章节,也未披露推理延迟/FPS 等实时性指标,定位偏离线数据生成与仿真增强而非在线决策。

原始链接

一手源存档(sources/)