一句话定位
DriveDreamer-2 在 drivedreamer 框架上加了一个微调过的 LLM(GPT-3.5)当”交通导演”:用户一句文本 → LLM 生成智能体轨迹 → 扩散模型按轨迹生成合规 HDMap → 新提出的 UniMVM 统一多视角一致性生成驾驶视频,从而第一次做到用自然语言直接定制(含插队、行人横穿等罕见场景)多视角驾驶视频;nuScenes 上 FID/FVD 达 11.2/55.7,相对此前最优方法提升约 30%/50%(AAAI 2025)。
背景与定位
驾驶世界模型这条线此前普遍依赖结构化条件(3D 框、HDMap、光流)或真实图像帧驱动生成——drivedreamer、drive-wm-driving-into-the-future(Drive-WM)、magicdrive、panacea-driving-video(Panacea)、gaia-1-wayve(GAIA-1)、ADriver-I 皆如此。这类条件要么来自特定数据集标注,要么需要复杂的人工规则/prompt 设计(如 CTG、CTG++ 用 GPT-4 把用户描述转成损失函数去引导场景级扩散模型),交互门槛高、生成多样性受限。
DriveDreamer-2 的定位是”第一个以用户友好方式生成定制化驾驶视频的世界模型”:把交通仿真拆成前景(智能体轨迹)和背景(HDMap)两部分,前景靠微调 LLM 把自然语言转成轨迹,背景靠扩散模型以轨迹为条件生成合规路网;再复用 drivedreamer 的视频生成框架产出多视角视频。与同期用 LLM 做轨迹层面交通仿真的 LCTGen、TrafficGen、CTG++ 不同,DriveDreamer-2 只需要简单文本而非详细速度/朝向参数,也不需要人工设计 loss。本文同时提出 UniMVM 改进多视角一致性,直接对标 drivedreamer 的跨视角注意力和 Drive-WM / Panacea / DrivingDiffusion 用图像或视频条件换一致性的做法。后续项目 DriveDreamer4D、ReconDreamer 由同团队延续。
模型架构
三段流水线:LLM 轨迹生成 → HDMap 扩散生成 → UniMVM 多视角视频生成。
① 轨迹生成 LLM:构建一个含 18 个函数的轨迹生成函数库,覆盖智能体函数(转向、匀速、加速、刹车)、行人函数(行走方向与速度)以及保存轨迹等工具函数。人工编写 Text-to-Python-Script 语料对这些函数做示范(涵盖变道、超车、跟车、掉头等常规场景,以及行人突然横穿、车辆强行插队等罕见场景),用其微调 GPT-3.5,推理时把用户输入套进预定义模板,LLM 直接输出轨迹数组。
② HDMap 生成器:构建在 SD2.1 图像扩散模型上,用 ControlNet(仅 ControlNet 参数可训、SD 主干冻结)接入 BEV 轨迹图条件 T_b ∈ R^{3×H_b×W_b}(不同颜色区分智能体类别),生成 3 通道 BEV HDMap H_b ∈ R^{3×H_b×W_b}(车道边界、车道分隔、人行横道)。轨迹图先过若干层 2D 卷积编码为特征 C_T,再用 ControlNet 的方式注入扩散网络;训练目标是标准 DDPM 噪声预测损失(公式 1)。与此前依赖轮廓类条件(边缘/深度/框/分割图)的条件图像生成方法不同,该生成器显式学习前景轨迹与背景路网的关联。
③ UniMVM(多视角视频生成):底座换成 SVD(Stable Video Diffusion),全部参数微调。相对 drivedreamer,3D 框条件不再走位置/类别 embedding,而是直接投影到图像平面作为控制条件(省掉额外控制参数)。三个独立编码器把 HDMap、3D 框、图像帧编码到潜空间得 y_H、y_B、y_I,y_H、y_B 与前向扩散得到的噪声潜特征 Z_t 拼接送入 UNet。
核心创新 UniMVM 的公式化:把 K 个视角按 {FL, F, FR, BR, B, BL} 顺序在空间维拼接成一张”大图” x' ∈ R^{T×3×H×KW},用掩码 m 把多视角视频联合分布重写为 p(x') = p(x'·m)·p(x'·(1-m)|x'·m)——即”看到的视角(mask=1)条件生成没看到的视角”,一次生成完成、不需要像 Drive-WM 那样逐视角自回归展开、也不引入额外的跨视角参数。通过调整 mask,同一 UniMVM 可切换三种任务:mask 掉未来 T-1 帧 → 单帧条件的视频预测;mask 掉除前视图外的 5 个视角 → 前视视频条件下的多视角外插;mask 全部帧 → 无图像条件的纯文本/结构条件生成。
数据
- 训练集:nuScenes,700 训练视频 + 150 验证视频,每段约 20 秒、6 路环视相机,原始帧率 12 Hz,累计约 100 万帧。沿用 drivedreamer 的做法把 HDMap 与 3D 框标注插值/投影到 12 Hz、并转换到像面坐标。
- HDMap 生成器训练数据:从 nuScenes 构造轨迹-HDMap 配对数据集
D = {T_b, H_b}。 - 视频生成器训练:直接复用 nuScenes 全部结构化条件(HDMap、3D 框、轨迹)训练,未额外引入其他真实数据源;数据全部来自真实道路(无仿真数据混入)。
- 下游数据增强实验:用全部结构化条件在 nuScenes 训练集上生成对应视频,与真实视频混合训练 3D 检测/跟踪模型(StreamPETR)。
训练方法
- 轨迹 LLM:对 GPT-3.5 做指令微调(具体微调超参未披露),训练数据即上述人工构造的 Text-to-Python-Script 语料。
- HDMap 生成器:SD2.1 + ControlNet,55K 迭代,batch size 24,分辨率 512×512。
- 视频生成器:SVD 底座,全参数微调,200K 迭代,batch size 1,帧长 N=8,视角数 K=6,分辨率 256×448。优化器 AdamW,学习率 5×10⁻⁵。
- 训练目标均为标准扩散去噪分数匹配(denoising score matching / DDPM 噪声预测损失)。
Infra(训练 / 推理工程)
- 硬件:全部实验在 NVIDIA A800(80GB) GPU 上完成。GPU 数量、总 GPU-hours、并行策略(data/model parallel)、训练精度(fp16/bf16/fp32)均未披露。
- 推理:论文未给出推理 FPS、控制频率或端到端延迟等实时性指标;定位是离线视频生成 + 下游感知数据增强,而非实时闭环控制。
- 代码开放节奏:项目页 2024-03 上线,GitHub 仓库(f1yfisher/DriveDreamer2)长期只放占位说明,直到 2024-12-18 才放出视频生成部分的推理代码与模型权重(训练代码据 README 仍”即将发布”);同期(2024-12-10)论文被 AAAI 2025 接收。
评测 benchmark
全部为论文一手结果,nuScenes 验证集。
① 生成质量对比(Table 1,FID↓/FVD↓,按条件设置分组)
| 方法 | 条件 | FID↓ | FVD↓ |
|---|---|---|---|
| DriveDreamer | 无图像条件 | 26.8 | 353.2 |
| DriveDreamer-2 | 无图像条件 | 25.0 | 105.1 |
| Drive-WM | 3 视角视频条件 | 15.8 | 122.7 |
| DriveDreamer-2 | 单视角视频条件 | 18.4 | 74.9 |
| DriveDreamer | 首帧多视角图像 | 14.9 | 340.8 |
| DrivingDiffusion | 首帧多视角图像 | 15.8 | 332.0 |
| Panacea | 首帧多视角图像 | 16.9 | 139.0 |
| DriveDreamer-2 | 首帧多视角图像 | 11.2 | 55.7 |
在首帧多视角图像条件下达到最优 FID 11.2 / FVD 55.7;即便只用单视角视频条件,FVD(74.9)也相对 Drive-WM 的 3 视角视频条件(122.7)有约 39% 的相对改进。
② 下游 3D 检测数据增强(Table 2,StreamPETR + ResNet-50,256×448)
| 初始帧 | 真实数据 | 生成数据 | mAP↑ | mAOE↓ | mAVE↓ | NDS↑ |
|---|---|---|---|---|---|---|
| - | ✓ | - | 31.7 | 67.9 | 33.0 | 43.5 |
| ✓ | ✓ | ✓ | 32.6 | 61.7 | 29.7 | 45.2 |
| - | ✓ | ✓ | 32.9 | 61.5 | 30.4 | 45.4 |
用首帧条件生成的视频做增强,mAP/NDS 相对提升约 2.8%/3.9%;去掉图像条件(生成多样性更高)时提升到约 3.8%/4.4%。
③ 下游多目标跟踪数据增强(Table 3,StreamPETR)
| 初始帧 | 真实数据 | 生成数据 | AMOTA↑ | AMOTP↓ | IDS↓ |
|---|---|---|---|---|---|
| - | ✓ | - | 28.9 | 1.419 | 687 |
| ✓ | ✓ | ✓ | 31.2 | 1.396 | 542 |
| - | ✓ | ✓ | 31.3 | 1.387 | 593 |
跟踪指标 AMOTA/AMOTP 相对提升约 8.0%/1.6%(首帧条件)、约 8.3%/2.3%(无图像条件)。
④ 消融(Table 4,backbone 与 UniMVM)
| 方法 | Backbone | 跨视角注意力 | UniMVM | FID↓ | FVD↓ |
|---|---|---|---|---|---|
| DriveDreamer | SD1.4 | ✓ | - | 14.9 | 340.8 |
| DriveDreamer-2 | SVD | ✓ | - | 17.2 | 94.6 |
| DriveDreamer-2 | SVD | - | ✓ | 11.2 | 55.7 |
仅把 backbone 从 SD1.4 换成 SVD,FVD 已获得约 70% 的提升(且引入跨视角注意力模块反而使 FID 略微变差,作者猜测是跨视角模块干扰了 SVD 本身的空间特征学习能力);再换上 UniMVM 后 FID/FVD 相对 drivedreamer 分别提升约 30%/80%。
⑤ 条件类型消融(Table 5):确认首帧多视角图像条件生成结果与 GT 最接近(FID/FVD 最优,11.2/55.7);前视视频条件次之(17.2/94.6,多样性提升);无图像条件多样性最高(25.0/105.1,车辆外观与街景与 GT 差异显著)。
创新点与影响
- 首个”文本直接定制”驾驶世界模型:此前的驾驶世界模型都依赖结构化条件或复杂 loss/参数设计,DriveDreamer-2 让用户用一句自然语言就能生成包括插队、行人横穿等长尾场景在内的定制化驾驶视频。
- 轨迹生成函数库 + LLM 微调范式:用可解释的 18 函数库构造 Text-to-Script 语料微调 GPT-3.5,避开了 CTG++ 那种”LLM 生成损失函数引导扩散模型”的复杂设计,也不需要 LCTGen 式的详细速度/朝向描述。
- HDMap 生成器:首次显式建模”前景轨迹 → 背景路网”的关联,同一轨迹输入可生成多样但均合规(车道边界贴合车道分隔两侧、人行横道位于路口)的 HDMap。
- UniMVM:用统一 mask 建模把多视角一致性生成、首帧条件视频预测、前视视频外插三类任务收进同一套框架,不引入额外跨视角参数,兼顾一致性与生成效率/多样性,是本文相对 drivedreamer 的核心架构改进。
- 量化收益:生成质量 FID/FVD 相对此前最优方法提升约 30%/50%;用生成视频做数据增强,3D 检测 mAP/NDS 提升约 2.8–3.8%/3.9–4.4%,多目标跟踪 AMOTA/AMOTP 提升约 8%/1.6–2.3%。
- 论文自述局限:未给出实时性(推理 FPS/延迟)指标,定位偏离线数据引擎;HDMap/轨迹生成仍以 nuScenes 结构化标注为训练基础,场景仍局限在 nuScenes 覆盖的地理与路况分布;论文正文未设独立 Limitation 小节。工程上,代码/权重比论文发表晚了近 9 个月才放出(2024-12),且训练代码在权重发布时仍未开放。
原始链接
- arXiv abstract:https://arxiv.org/abs/2403.06845
- arXiv PDF:https://arxiv.org/pdf/2403.06845
- 项目主页(含全部演示视频):https://drivedreamer2.github.io/
- 代码:https://github.com/f1yfisher/DriveDreamer2
一手源存档(sources/)
- drivedreamer-2—project-page — 项目主页快照(作者/摘要/方法图/演示 prompt 清单/BibTeX),来源 https://drivedreamer2.github.io/
- drivedreamer-2—github-readme — GitHub README(News 时间线含 AAAI’25 收录、2024-12-18 推理代码放出、DOCS/trainval.md 配置字段说明),来源 https://github.com/f1yfisher/DriveDreamer2
- 论文全文:arXiv:2403.06845(arXiv 原文 PDF,不入 git;正文数字均取自此,通过 arxiv.org/html/2403.06845v1 全文抓取核对)