一句话定位
Delphi 是一个把驾驶场景多视角视频生成从”8 帧”推到”40 帧(12 秒)“的扩散世界模型:靠跨帧/跨视角共享噪声(NRM)+ 同深度特征对齐的场景级/实例级跨帧注意力(FTCM)解决长视频的时空一致性坍缩问题,再用它驱动一个”评估失败案例→VLM 归因→检索相似场景→生成针对性数据→回炼模型”的失败案例驱动数据引擎,仅生成训练集 4% 规模的数据(972 条)即把 UniAD 的碰撞率降低 25%(0.33→0.27),是较早证明生成视频能直接提升端到端规划性能(而非止步于感知指标)的工作。
背景与定位
此前的驾驶场景生成路线(drivedreamer、magicdrive、panacea-driving-video、drive-wm-driving-into-the-future、gaia-1-wayve 等,彼此并行发展、非承继关系)都止步于短视频:Panacea 8 帧、MagicDrive 7 帧,本质原因是现有方法对多视角/多帧独立加噪、且跨帧一致性只靠简单跨注意力,帧数一长时空一致性就会坍缩。Delphi 的定位有两层:
- 生成侧:把可生成的一致视频长度做到 40 帧(5 倍于当时 SOTA),核心是重新设计噪声建模(跨视角/跨帧共享噪声)与跨帧特征交互(按网络深度对齐,而不是只用最后一层特征做跨注意力)。
- 应用侧:作者观察到,之前的生成式数据增强方法(含 Panacea、MagicDrive)只验证了对感知/预测模型(3D 检测等)的增益,从未验证过对端到端规划模型的增益——论文称这是”第一次”把生成式数据引擎的效果延展到规划任务,配套提出失败案例驱动(failure-case driven)的采样框架以降低生成/标注成本。
论文 Related Work 提到的同期工作 DriveDreamer-2(2024-03,arXiv:2403.06845)提出一套仅用文本提示驱动的交通仿真流水线,可生成多样交通状况的驾驶视频,但需要一帧图像输入作为条件,且(据 Delphi 原文转引)不适用于”提升规划性能”的场景。cosmos-drive-dreams(2025,NVIDIA)在其 Related Work 中把 Delphi 与 Panacea、Drive-WM、MagicDrive、GAIA-1/2、Vista、DriveDreamer 一并归入”生成式仿真”一派,并指出这条路线共同受训练分布约束、难以凭空覆盖真正的长尾场景。
模型架构
主干:扩散 U-Net(论文称”diffusion U-Net”,基于预训练图像扩散模型的一般潜在扩散范式,具体预训练权重版本未披露)。输入为多视角视频潜变量 z(N 帧 × V 视角)与对应的 BEV 布局序列。
布局条件注入:BEV 布局序列先按相机参数投影到相机空间,得到前景/背景两类相机布局:
- 前景布局:物体包围框角点坐标、朝向(heading)、实例 id、密集描述(dense caption);
- 背景布局:不同颜色的线条表示道路走向。 布局嵌入经编码器处理后,通过交叉注意力注入 U-Net,实现细粒度布局控制;同时用 VLM(GPT-4,Achiam et al. 2023)为输入场景抽取密集描述,经 Long-CLIP 编码为文本嵌入,再经文本交叉注意力注入 U-Net,实现文本级控制(天气、场景风格、物体外观属性等)。
两个核心一致性模块:
- 噪声重初始化模块(Noise Reinitialization Module, NRM):不同于既有方法对各视角独立加噪,NRM 引入跨视角共享的”运动噪声” m(∈ R^{V×1×h×w})与跨帧共享的”全景噪声” p(∈ R^{1×N×h×w}),噪声化公式为 z_n^v = √α̂·x_n^v + √(1-α̂)·(r_n^v + m^v + p_n),使多视角视频的噪声在时间和视角两个维度上都保持相关。
- 特征对齐时序一致性模块(Feature-aligned Temporal Consistency Module, FTCM):既有方法只用简单跨帧注意力融合前一帧信息,忽略了网络不同深度的特征具有不同感受野这一事实。FTCM 在相邻帧同一网络深度 i 上做特征交互,包含两类注意力:
- 场景级注意力(Scene-aware Attention):对当前帧 Q 与前一帧同深度 K/V 做标准 softmax 注意力,传递前一帧的全局风格信息。
- 实例级注意力(Instance-aware Attention):用前景包围框掩码 M 限定 Q/K/V 只在物体局部区域内做交互(Q·M_n 与 K/V·M_{n-1}),零卷积(Zero-initialized conv)残差接入,专门增强运动物体的连贯性。
训练/推理配置(正文 Hyperparameters):图像从 1600×900 resize 到 512×512;训练时视频长度设为 10 帧,以流式(streaming)方式顺序生成;推理用 PLMS 采样器、50 步;推理时空间分辨率仍为 512×512,帧长设为 40(且不设上限,可以更长)。跨视角(cross-view)模型训练 50,000 步,时序(temporal)模型训练 20,000 步,优化器 AdamW,学习率 5e-5。
模型规模(Table 6):论文实际给出两个模型变体——多视角单帧(跨视角)模型 0.5B 参数;多视角多帧(时序)模型 1.1B 参数。
数据
- 评测数据集:nuScenes 验证集,150 个驾驶场景,每场景约 40 帧,密集交通与复杂街道场景。
- 训练集规模:从 Table 2 的随机采样设置可推得训练集全量为 28,130 个样本(“28130 (100%)“一行)。
- BEV 布局类别:正文写”十类前景类别(即 bus、car、bicycle、truck、trailer、motorcycle)“——但列出的只有 6 类,原文表述如此,未进一步展开(可能为笔误或类别细分未完整列出);背景布局用地图扩展包(map expansion pack)得到的 4 类背景要素生成。
- 失败案例驱动数据规模:仅从训练集检索/生成 972 条(约训练集 4%)新数据即可将 UniAD 碰撞率从 0.33 降到 0.27;若同时纳入验证集布局做检索(不使用验证集视频本身,只用其布局与文本描述),仅需 429 条(约 1.5%)即可把碰撞率降到 0.26。
- 数据来源:全部生成条件来自 nuScenes 训练集的真实标注/布局,未涉及仿真环境数据;论文强调所有失败案例挖掘/生成操作只在训练集上进行,以避免验证集信息泄漏。
- 规模化实验(仅见于项目主页,非论文正文/附录):作者在 Li Auto 内部私有多视角驾驶数据集(约为 nuScenes 的 50 倍规模)上训练 Delphi,展示了生成长达 120 帧时空一致视频的能力,用于说明方法的可扩展性——这一结果未经同行评审论文披露具体数字,仅有演示视频。
训练方法
生成模型训练:标准扩散去噪目标(U-Net 噪声预测),叠加 NRM 的跨维度共享噪声与 FTCM 的跨帧特征交互模块;训练分两个模型(跨视角/时序)分别优化 50,000/20,000 步(见”模型架构”)。
失败案例驱动框架(Failure-case Driven Framework,四步流水线,Sec 3.2 + Appendix A.1):
- 收集失败案例:在验证集上跑基线端到端模型(UniAD),以”3 秒内轨迹发生碰撞”为失败判据,收集失败场景并可视化其 3D 检测框与规划轨迹。
- 分析数据模式:用 VLM(GPT-4)做多轮问询——先判断失败源于感知还是规划:感知类失败进一步归因为夜间光照不足、临近大物体识别难、稀有类别识别不到;规划类失败归因为遮挡或低频交互(闯红灯、横穿马路等);最终让 VLM 给出导致失败的具体因素描述。
- 检索相似场景:用 BLIP-2 计算图像/文本嵌入的余弦相似度,从训练集中检索与失败原因描述最相关的 top-k 场景。
- 更新模型:用 VLM 给出的场景描述配合 LLM 改写 caption(引入晴/雨/多云/夜晚/郊区、车辆换色等场景与实例条件变化)驱动 Delphi 生成多样化新数据;作者发现若只用失败场景数据微调会导致过拟合(失败案例上表现变好但原本成功的案例性能下降),因此把生成数据与完整训练集混合后再微调,作为下一轮迭代的起点。
下游模型微调设置:以 UniAD 官方开源权重为起点微调第二阶段,学习率降低 10 倍至 2e-5,其余超参数与 UniAD 官方仓库一致。
Infra(训练 / 推理工程)
- 训练硬件:正文声明”我们在 8 张 A800 80GB GPU 上训练模型”;Table 6(Appendix B.2)进一步给出两个模型变体的具体训练配置——多视角单帧模型:8×A100,24 小时;多视角多帧模型:8×A800,72 小时(两处表述存在 A800/A100 的轻微不一致,原文如此,未作调和)。
- 推理硬件与延迟(Table 6):多视角单帧模型推理显存 22GB(RTX 3090),耗时 4 秒/样本;多视角多帧模型推理显存 39GB(A100 40G),耗时同为 4 秒/样本。未披露推理 FPS/控制频率等实时化指标——Delphi 定位是离线数据生成引擎,不追求车载实时推理。
- 代码/权重发布:官方仓库
westlake-autolab/Delphi截至本次抓取仅有占位 README(“Code will be coming later. Stay tuned.“),未发布训练/推理代码或权重。
评测 benchmark
均为论文一手结果(nuScenes 验证集),标 * 为作者用官方开源代码/渲染视频复现,其余取自原论文。
① 生成质量与可控性对比(Table 1)——含按帧长(4/8/40 帧)分别评估的 FVD,“Fail”表示该方法无法在该帧长下生成/维持一致性:
| 方法 | FID↓ | CLIP↑ | FVD@4帧↓ | FVD@8帧↓ | FVD@40帧↓ | NDS↑ | Avg.Col.Rate↓ |
|---|---|---|---|---|---|---|---|
| BEVGen | 25.54 | 71.23 | N/A | N/A | Fail | N/A | N/A |
| BEVControl | 24.85 | 82.70 | N/A | N/A | Fail | N/A | N/A |
| DriveDreamer | 26.8 | N/A | N/A | 353.2 | Fail | N/A | N/A |
| MagicDrive | 16.20 | N/A | N/A | N/A | Fail | N/A | N/A |
| MagicDrive* | 46.18 | 82.47 | 617.2 | N/A | Fail | 34.56 | 3.87 |
| Panacea | 16.96 | N/A | N/A | 139.0 | Fail | 32.10 | N/A |
| Panacea* | 55.32 | 84.23 | – | 446.9 | Fail | 29.41 | 1.35 |
| Drive-WM | 15.8 | N/A | N/A | 122.7 | Fail | N/A | N/A |
| Delphi(本文) | 15.08 | 86.73 | – | 113.5 | 275.6 | 36.58 | 0.29 |
关键结论:Delphi 是表中唯一能在 40 帧给出非”Fail”FVD 数值(275.6)的方法,其余方法均在更长帧数下崩溃,验证了”5 倍长视频且不牺牲一致性”的核心声明;FID/CLIP/NDS/碰撞率也同时全面优于对比方法。
② 失败案例驱动框架对 UniAD 规划性能的提升(Table 2,UniAD 碰撞率 Col. Rate%):
| 采样策略 | 数据量 | 数据引擎 | 数据来源 | 1s | 2s | 3s | Avg. |
|---|---|---|---|---|---|---|---|
| 基线(UniAD) | – | – | – | 0.10 | 0.18 | 0.71 | 0.33 |
| 随机采样 | 14065(50%) | Panacea | 训练集 | 0.03 | 0.23 | 0.79 | 0.35 |
| 随机采样 | 14065(50%) | Delphi | 训练集 | 0.08 | 0.20 | 0.58 | 0.29 |
| 随机采样 | 28130(100%) | Panacea | 训练集 | 0.08 | 0.22 | 0.98 | 0.43 |
| 随机采样 | 28130(100%) | Delphi | 训练集 | 0.07 | 0.29 | 0.65 | 0.33 |
| 失败案例驱动 | 972(4%) | Panacea | 训练集 | 0.05 | 0.18 | 0.81 | 0.35 |
| 失败案例驱动 | 972(4%) | Delphi | 训练集 | 0.08 | 0.18 | 0.56 | 0.27 |
| 失败案例驱动 | 429(1.5%) | Delphi | 验证集(仅布局/文本) | 0.07 | 0.10 | 0.61 | 0.26 |
反直觉发现:随机采样下数据量从 50%(14065 条)增至 100%(28130 条)反而使碰撞率上升(Delphi: 0.29→0.33,Panacea: 0.35→0.43)——说明”更多风格相近的合成数据”帮助有限;失败案例驱动的定向采样以远少的数据量(4%/1.5%)取得更好效果,且 Delphi 在同等设置下始终优于 Panacea。
③ 消融——真实/生成数据比例(Table 3):纯真实数据增量微调(Real+Real)碰撞率从 0.34 升到 0.38(更差);纯生成数据训练碰撞率 0.50(sim-to-real 差距明显);真实+Delphi 生成数据混合(Real+Generated)碰撞率降到 0.27,为最优设置。
④ 消融——场景/实例编辑(Table 4):无编辑 0.34 → 仅场景编辑 0.31 → 仅实例编辑 0.29 → 场景+实例同时编辑 0.27(最优)。
⑤ 消融——NRM / FTCM(Table 5,生成质量指标):完整 Delphi FID 15.08 / FVD 275.6 / CLIP 86.73;去掉 NRM:FID 19.81 / FVD 291.5 / CLIP 85.22;去掉 NRM 和 FTCM:FID 22.85 / FVD 346.96 / CLIP 82.91——两个模块均对生成质量有正向贡献,FTCM 贡献更大(22.85→19.81),NRM 在此基础上进一步提升。
创新点与影响
- 首次把生成式数据引擎的验证范围从感知/预测扩展到端到端规划:论文自称”to the best of our knowledge, 首次”证明纯合成视频数据能直接提升端到端模型(UniAD)的规划性能,而不止步于 3D 检测/BEV 感知指标。
- 噪声重初始化 + 特征对齐时序一致性:用跨视角/跨帧共享噪声(NRM)和按网络深度对齐的场景级/实例级跨帧注意力(FTCM)解决了此前方法”独立加噪+粗糙跨帧注意力”导致的长视频时空一致性坍缩问题,把可生成的一致视频长度从约 8 帧推到 40 帧(约 12 秒),是当时的 5 倍。
- 失败案例驱动的采样框架:用 VLM 多轮问询定位失败原因、BLIP-2 检索相似场景、LLM 改写 caption 生成针对性数据,相比随机采样在数据量少一个数量级(4% vs 50%/100%)的情况下取得更好效果,且验证了”数据量越大越好”在随机采样设置下并不成立。
- 官方自陈局限(正文 Limitation and Societal Impact):Delphi 以 BEV 布局为输入实现可控性,只能丰富外观、无法在合成过程中改变布局本身,因此框架只能用于**开环(open-loop)**评测,不能用于闭环;此外当端到端模型在训练集上已经表现完美时,失败案例驱动采样将不再起作用。(注:项目主页后续展示了一个闭环评测 demo,用 Delphi 做视觉渲染器接入 UniAD 闭环评测,这与论文正文陈述的”仅支持开环”局限存在张力,可能是论文之后的扩展工作,未见对应论文文本佐证。)
- 论文代码/权重尚未开源(仓库仅占位 README),实际可复现性目前依赖作者规划中的后续发布。
原始链接
- arXiv abstract:https://arxiv.org/abs/2406.01349
- arXiv PDF:https://arxiv.org/pdf/2406.01349
- 项目主页(含演示视频/GIF、规模化实验、闭环评测 demo):https://westlake-autolab.github.io/delphi.github.io/
- 代码仓库(占位,未发布代码):https://github.com/westlake-autolab/Delphi
- (Hugging Face 论文聚合页 huggingface.co/papers/2406.01349 返回 404,该 arXiv ID 未被任何 HF 仓库 README 引用,故未收录)
一手源存档(sources/)
- delphi-driving-video—project-page — 项目主页快照(作者/摘要/演示视频分区说明、规模化实验、闭环评测 demo 描述),来源 https://westlake-autolab.github.io/delphi.github.io/
- delphi-driving-video—github-readme — GitHub README 快照(确认代码尚未发布),来源 https://github.com/westlake-autolab/Delphi
- 论文全文:arXiv:2406.01349(arXiv 原文 PDF,不入 git;正文 Table 1–5 与 Appendix A/B 数字均取自此,含 HTML 全文版 https://arxiv.org/html/2406.01349v1)