一句话定位

DriveDreamer-2 在 drivedreamer 框架上加了一个微调过的 LLM(GPT-3.5)当”交通导演”:用户一句文本 → LLM 生成智能体轨迹 → 扩散模型按轨迹生成合规 HDMap → 新提出的 UniMVM 统一多视角一致性生成驾驶视频,从而第一次做到用自然语言直接定制(含插队、行人横穿等罕见场景)多视角驾驶视频;nuScenes 上 FID/FVD 达 11.2/55.7,相对此前最优方法提升约 30%/50%(AAAI 2025)。

背景与定位

驾驶世界模型这条线此前普遍依赖结构化条件(3D 框、HDMap、光流)或真实图像帧驱动生成——drivedreamerdrive-wm-driving-into-the-future(Drive-WM)、magicdrivepanacea-driving-video(Panacea)、gaia-1-wayve(GAIA-1)、ADriver-I 皆如此。这类条件要么来自特定数据集标注,要么需要复杂的人工规则/prompt 设计(如 CTG、CTG++ 用 GPT-4 把用户描述转成损失函数去引导场景级扩散模型),交互门槛高、生成多样性受限。

DriveDreamer-2 的定位是”第一个以用户友好方式生成定制化驾驶视频的世界模型”:把交通仿真拆成前景(智能体轨迹)和背景(HDMap)两部分,前景靠微调 LLM 把自然语言转成轨迹,背景靠扩散模型以轨迹为条件生成合规路网;再复用 drivedreamer 的视频生成框架产出多视角视频。与同期用 LLM 做轨迹层面交通仿真的 LCTGen、TrafficGen、CTG++ 不同,DriveDreamer-2 只需要简单文本而非详细速度/朝向参数,也不需要人工设计 loss。本文同时提出 UniMVM 改进多视角一致性,直接对标 drivedreamer 的跨视角注意力和 Drive-WM / Panacea / DrivingDiffusion 用图像或视频条件换一致性的做法。后续项目 DriveDreamer4D、ReconDreamer 由同团队延续。

模型架构

三段流水线:LLM 轨迹生成 → HDMap 扩散生成 → UniMVM 多视角视频生成。

① 轨迹生成 LLM:构建一个含 18 个函数的轨迹生成函数库,覆盖智能体函数(转向、匀速、加速、刹车)、行人函数(行走方向与速度)以及保存轨迹等工具函数。人工编写 Text-to-Python-Script 语料对这些函数做示范(涵盖变道、超车、跟车、掉头等常规场景,以及行人突然横穿、车辆强行插队等罕见场景),用其微调 GPT-3.5,推理时把用户输入套进预定义模板,LLM 直接输出轨迹数组。

② HDMap 生成器:构建在 SD2.1 图像扩散模型上,用 ControlNet(仅 ControlNet 参数可训、SD 主干冻结)接入 BEV 轨迹图条件 T_b ∈ R^{3×H_b×W_b}(不同颜色区分智能体类别),生成 3 通道 BEV HDMap H_b ∈ R^{3×H_b×W_b}(车道边界、车道分隔、人行横道)。轨迹图先过若干层 2D 卷积编码为特征 C_T,再用 ControlNet 的方式注入扩散网络;训练目标是标准 DDPM 噪声预测损失(公式 1)。与此前依赖轮廓类条件(边缘/深度/框/分割图)的条件图像生成方法不同,该生成器显式学习前景轨迹与背景路网的关联。

③ UniMVM(多视角视频生成):底座换成 SVD(Stable Video Diffusion),全部参数微调。相对 drivedreamer,3D 框条件不再走位置/类别 embedding,而是直接投影到图像平面作为控制条件(省掉额外控制参数)。三个独立编码器把 HDMap、3D 框、图像帧编码到潜空间得 y_Hy_By_I,y_Hy_B 与前向扩散得到的噪声潜特征 Z_t 拼接送入 UNet。

核心创新 UniMVM 的公式化:把 K 个视角按 {FL, F, FR, BR, B, BL} 顺序在空间维拼接成一张”大图” x' ∈ R^{T×3×H×KW},用掩码 m 把多视角视频联合分布重写为 p(x') = p(x'·m)·p(x'·(1-m)|x'·m)——即”看到的视角(mask=1)条件生成没看到的视角”,一次生成完成、不需要像 Drive-WM 那样逐视角自回归展开、也不引入额外的跨视角参数。通过调整 mask,同一 UniMVM 可切换三种任务:mask 掉未来 T-1 帧 → 单帧条件的视频预测;mask 掉除前视图外的 5 个视角 → 前视视频条件下的多视角外插;mask 全部帧 → 无图像条件的纯文本/结构条件生成。

数据

  • 训练集:nuScenes,700 训练视频 + 150 验证视频,每段约 20 秒、6 路环视相机,原始帧率 12 Hz,累计约 100 万帧。沿用 drivedreamer 的做法把 HDMap 与 3D 框标注插值/投影到 12 Hz、并转换到像面坐标。
  • HDMap 生成器训练数据:从 nuScenes 构造轨迹-HDMap 配对数据集 D = {T_b, H_b}
  • 视频生成器训练:直接复用 nuScenes 全部结构化条件(HDMap、3D 框、轨迹)训练,未额外引入其他真实数据源;数据全部来自真实道路(无仿真数据混入)。
  • 下游数据增强实验:用全部结构化条件在 nuScenes 训练集上生成对应视频,与真实视频混合训练 3D 检测/跟踪模型(StreamPETR)。

训练方法

  • 轨迹 LLM:对 GPT-3.5 做指令微调(具体微调超参未披露),训练数据即上述人工构造的 Text-to-Python-Script 语料。
  • HDMap 生成器:SD2.1 + ControlNet,55K 迭代,batch size 24,分辨率 512×512
  • 视频生成器:SVD 底座,全参数微调,200K 迭代,batch size 1,帧长 N=8,视角数 K=6,分辨率 256×448。优化器 AdamW,学习率 5×10⁻⁵
  • 训练目标均为标准扩散去噪分数匹配(denoising score matching / DDPM 噪声预测损失)。

Infra(训练 / 推理工程)

  • 硬件:全部实验在 NVIDIA A800(80GB) GPU 上完成。GPU 数量、总 GPU-hours、并行策略(data/model parallel)、训练精度(fp16/bf16/fp32)均未披露。
  • 推理:论文未给出推理 FPS、控制频率或端到端延迟等实时性指标;定位是离线视频生成 + 下游感知数据增强,而非实时闭环控制。
  • 代码开放节奏:项目页 2024-03 上线,GitHub 仓库(f1yfisher/DriveDreamer2)长期只放占位说明,直到 2024-12-18 才放出视频生成部分的推理代码与模型权重(训练代码据 README 仍”即将发布”);同期(2024-12-10)论文被 AAAI 2025 接收。

评测 benchmark

全部为论文一手结果,nuScenes 验证集。

① 生成质量对比(Table 1,FID↓/FVD↓,按条件设置分组)

方法条件FID↓FVD↓
DriveDreamer无图像条件26.8353.2
DriveDreamer-2无图像条件25.0105.1
Drive-WM3 视角视频条件15.8122.7
DriveDreamer-2单视角视频条件18.474.9
DriveDreamer首帧多视角图像14.9340.8
DrivingDiffusion首帧多视角图像15.8332.0
Panacea首帧多视角图像16.9139.0
DriveDreamer-2首帧多视角图像11.255.7

在首帧多视角图像条件下达到最优 FID 11.2 / FVD 55.7;即便只用单视角视频条件,FVD(74.9)也相对 Drive-WM 的 3 视角视频条件(122.7)有约 39% 的相对改进。

② 下游 3D 检测数据增强(Table 2,StreamPETR + ResNet-50,256×448)

初始帧真实数据生成数据mAP↑mAOE↓mAVE↓NDS↑
--31.767.933.043.5
32.661.729.745.2
-32.961.530.445.4

用首帧条件生成的视频做增强,mAP/NDS 相对提升约 2.8%/3.9%;去掉图像条件(生成多样性更高)时提升到约 3.8%/4.4%。

③ 下游多目标跟踪数据增强(Table 3,StreamPETR)

初始帧真实数据生成数据AMOTA↑AMOTP↓IDS↓
--28.91.419687
31.21.396542
-31.31.387593

跟踪指标 AMOTA/AMOTP 相对提升约 8.0%/1.6%(首帧条件)、约 8.3%/2.3%(无图像条件)。

④ 消融(Table 4,backbone 与 UniMVM)

方法Backbone跨视角注意力UniMVMFID↓FVD↓
DriveDreamerSD1.4-14.9340.8
DriveDreamer-2SVD-17.294.6
DriveDreamer-2SVD-11.255.7

仅把 backbone 从 SD1.4 换成 SVD,FVD 已获得约 70% 的提升(且引入跨视角注意力模块反而使 FID 略微变差,作者猜测是跨视角模块干扰了 SVD 本身的空间特征学习能力);再换上 UniMVM 后 FID/FVD 相对 drivedreamer 分别提升约 30%/80%。

⑤ 条件类型消融(Table 5):确认首帧多视角图像条件生成结果与 GT 最接近(FID/FVD 最优,11.2/55.7);前视视频条件次之(17.2/94.6,多样性提升);无图像条件多样性最高(25.0/105.1,车辆外观与街景与 GT 差异显著)。

创新点与影响

  • 首个”文本直接定制”驾驶世界模型:此前的驾驶世界模型都依赖结构化条件或复杂 loss/参数设计,DriveDreamer-2 让用户用一句自然语言就能生成包括插队、行人横穿等长尾场景在内的定制化驾驶视频。
  • 轨迹生成函数库 + LLM 微调范式:用可解释的 18 函数库构造 Text-to-Script 语料微调 GPT-3.5,避开了 CTG++ 那种”LLM 生成损失函数引导扩散模型”的复杂设计,也不需要 LCTGen 式的详细速度/朝向描述。
  • HDMap 生成器:首次显式建模”前景轨迹 → 背景路网”的关联,同一轨迹输入可生成多样但均合规(车道边界贴合车道分隔两侧、人行横道位于路口)的 HDMap。
  • UniMVM:用统一 mask 建模把多视角一致性生成、首帧条件视频预测、前视视频外插三类任务收进同一套框架,不引入额外跨视角参数,兼顾一致性与生成效率/多样性,是本文相对 drivedreamer 的核心架构改进。
  • 量化收益:生成质量 FID/FVD 相对此前最优方法提升约 30%/50%;用生成视频做数据增强,3D 检测 mAP/NDS 提升约 2.8–3.8%/3.9–4.4%,多目标跟踪 AMOTA/AMOTP 提升约 8%/1.6–2.3%。
  • 论文自述局限:未给出实时性(推理 FPS/延迟)指标,定位偏离线数据引擎;HDMap/轨迹生成仍以 nuScenes 结构化标注为训练基础,场景仍局限在 nuScenes 覆盖的地理与路况分布;论文正文未设独立 Limitation 小节。工程上,代码/权重比论文发表晚了近 9 个月才放出(2024-12),且训练代码在权重发布时仍未开放。

原始链接

一手源存档(sources/)