一句话定位

Delphi 是一个把驾驶场景多视角视频生成从”8 帧”推到”40 帧(12 秒)“的扩散世界模型:靠跨帧/跨视角共享噪声(NRM)+ 同深度特征对齐的场景级/实例级跨帧注意力(FTCM)解决长视频的时空一致性坍缩问题,再用它驱动一个”评估失败案例→VLM 归因→检索相似场景→生成针对性数据→回炼模型”的失败案例驱动数据引擎,仅生成训练集 4% 规模的数据(972 条)即把 UniAD 的碰撞率降低 25%(0.33→0.27),是较早证明生成视频能直接提升端到端规划性能(而非止步于感知指标)的工作。

背景与定位

此前的驾驶场景生成路线(drivedreamermagicdrivepanacea-driving-videodrive-wm-driving-into-the-futuregaia-1-wayve 等,彼此并行发展、非承继关系)都止步于短视频:Panacea 8 帧、MagicDrive 7 帧,本质原因是现有方法对多视角/多帧独立加噪、且跨帧一致性只靠简单跨注意力,帧数一长时空一致性就会坍缩。Delphi 的定位有两层:

  1. 生成侧:把可生成的一致视频长度做到 40 帧(5 倍于当时 SOTA),核心是重新设计噪声建模(跨视角/跨帧共享噪声)与跨帧特征交互(按网络深度对齐,而不是只用最后一层特征做跨注意力)。
  2. 应用侧:作者观察到,之前的生成式数据增强方法(含 Panacea、MagicDrive)只验证了对感知/预测模型(3D 检测等)的增益,从未验证过对端到端规划模型的增益——论文称这是”第一次”把生成式数据引擎的效果延展到规划任务,配套提出失败案例驱动(failure-case driven)的采样框架以降低生成/标注成本。

论文 Related Work 提到的同期工作 DriveDreamer-2(2024-03,arXiv:2403.06845)提出一套仅用文本提示驱动的交通仿真流水线,可生成多样交通状况的驾驶视频,但需要一帧图像输入作为条件,且(据 Delphi 原文转引)不适用于”提升规划性能”的场景。cosmos-drive-dreams(2025,NVIDIA)在其 Related Work 中把 Delphi 与 Panacea、Drive-WM、MagicDrive、GAIA-1/2、Vista、DriveDreamer 一并归入”生成式仿真”一派,并指出这条路线共同受训练分布约束、难以凭空覆盖真正的长尾场景。

模型架构

主干:扩散 U-Net(论文称”diffusion U-Net”,基于预训练图像扩散模型的一般潜在扩散范式,具体预训练权重版本未披露)。输入为多视角视频潜变量 z(N 帧 × V 视角)与对应的 BEV 布局序列。

布局条件注入:BEV 布局序列先按相机参数投影到相机空间,得到前景/背景两类相机布局:

  • 前景布局:物体包围框角点坐标、朝向(heading)、实例 id、密集描述(dense caption);
  • 背景布局:不同颜色的线条表示道路走向。 布局嵌入经编码器处理后,通过交叉注意力注入 U-Net,实现细粒度布局控制;同时用 VLM(GPT-4,Achiam et al. 2023)为输入场景抽取密集描述,经 Long-CLIP 编码为文本嵌入,再经文本交叉注意力注入 U-Net,实现文本级控制(天气、场景风格、物体外观属性等)。

两个核心一致性模块

  • 噪声重初始化模块(Noise Reinitialization Module, NRM):不同于既有方法对各视角独立加噪,NRM 引入跨视角共享的”运动噪声” m(∈ R^{V×1×h×w})与跨帧共享的”全景噪声” p(∈ R^{1×N×h×w}),噪声化公式为 z_n^v = √α̂·x_n^v + √(1-α̂)·(r_n^v + m^v + p_n),使多视角视频的噪声在时间和视角两个维度上都保持相关。
  • 特征对齐时序一致性模块(Feature-aligned Temporal Consistency Module, FTCM):既有方法只用简单跨帧注意力融合前一帧信息,忽略了网络不同深度的特征具有不同感受野这一事实。FTCM 在相邻帧同一网络深度 i 上做特征交互,包含两类注意力:
    • 场景级注意力(Scene-aware Attention):对当前帧 Q 与前一帧同深度 K/V 做标准 softmax 注意力,传递前一帧的全局风格信息。
    • 实例级注意力(Instance-aware Attention):用前景包围框掩码 M 限定 Q/K/V 只在物体局部区域内做交互(Q·M_n 与 K/V·M_{n-1}),零卷积(Zero-initialized conv)残差接入,专门增强运动物体的连贯性。

训练/推理配置(正文 Hyperparameters):图像从 1600×900 resize 到 512×512;训练时视频长度设为 10 帧,以流式(streaming)方式顺序生成;推理用 PLMS 采样器、50 步;推理时空间分辨率仍为 512×512,帧长设为 40(且不设上限,可以更长)。跨视角(cross-view)模型训练 50,000 步,时序(temporal)模型训练 20,000 步,优化器 AdamW,学习率 5e-5。

模型规模(Table 6):论文实际给出两个模型变体——多视角单帧(跨视角)模型 0.5B 参数;多视角多帧(时序)模型 1.1B 参数

数据

  • 评测数据集:nuScenes 验证集,150 个驾驶场景,每场景约 40 帧,密集交通与复杂街道场景。
  • 训练集规模:从 Table 2 的随机采样设置可推得训练集全量为 28,130 个样本(“28130 (100%)“一行)。
  • BEV 布局类别:正文写”十类前景类别(即 bus、car、bicycle、truck、trailer、motorcycle)“——但列出的只有 6 类,原文表述如此,未进一步展开(可能为笔误或类别细分未完整列出);背景布局用地图扩展包(map expansion pack)得到的 4 类背景要素生成。
  • 失败案例驱动数据规模:仅从训练集检索/生成 972 条(约训练集 4%)新数据即可将 UniAD 碰撞率从 0.33 降到 0.27;若同时纳入验证集布局做检索(不使用验证集视频本身,只用其布局与文本描述),仅需 429 条(约 1.5%)即可把碰撞率降到 0.26。
  • 数据来源:全部生成条件来自 nuScenes 训练集的真实标注/布局,未涉及仿真环境数据;论文强调所有失败案例挖掘/生成操作只在训练集上进行,以避免验证集信息泄漏。
  • 规模化实验(仅见于项目主页,非论文正文/附录):作者在 Li Auto 内部私有多视角驾驶数据集(约为 nuScenes 的 50 倍规模)上训练 Delphi,展示了生成长达 120 帧时空一致视频的能力,用于说明方法的可扩展性——这一结果未经同行评审论文披露具体数字,仅有演示视频。

训练方法

生成模型训练:标准扩散去噪目标(U-Net 噪声预测),叠加 NRM 的跨维度共享噪声与 FTCM 的跨帧特征交互模块;训练分两个模型(跨视角/时序)分别优化 50,000/20,000 步(见”模型架构”)。

失败案例驱动框架(Failure-case Driven Framework,四步流水线,Sec 3.2 + Appendix A.1)

  1. 收集失败案例:在验证集上跑基线端到端模型(UniAD),以”3 秒内轨迹发生碰撞”为失败判据,收集失败场景并可视化其 3D 检测框与规划轨迹。
  2. 分析数据模式:用 VLM(GPT-4)做多轮问询——先判断失败源于感知还是规划:感知类失败进一步归因为夜间光照不足、临近大物体识别难、稀有类别识别不到;规划类失败归因为遮挡或低频交互(闯红灯、横穿马路等);最终让 VLM 给出导致失败的具体因素描述。
  3. 检索相似场景:用 BLIP-2 计算图像/文本嵌入的余弦相似度,从训练集中检索与失败原因描述最相关的 top-k 场景。
  4. 更新模型:用 VLM 给出的场景描述配合 LLM 改写 caption(引入晴/雨/多云/夜晚/郊区、车辆换色等场景与实例条件变化)驱动 Delphi 生成多样化新数据;作者发现若只用失败场景数据微调会导致过拟合(失败案例上表现变好但原本成功的案例性能下降),因此把生成数据与完整训练集混合后再微调,作为下一轮迭代的起点。

下游模型微调设置:以 UniAD 官方开源权重为起点微调第二阶段,学习率降低 10 倍至 2e-5,其余超参数与 UniAD 官方仓库一致。

Infra(训练 / 推理工程)

  • 训练硬件:正文声明”我们在 8 张 A800 80GB GPU 上训练模型”;Table 6(Appendix B.2)进一步给出两个模型变体的具体训练配置——多视角单帧模型:8×A100,24 小时;多视角多帧模型:8×A800,72 小时(两处表述存在 A800/A100 的轻微不一致,原文如此,未作调和)。
  • 推理硬件与延迟(Table 6):多视角单帧模型推理显存 22GB(RTX 3090),耗时 4 秒/样本;多视角多帧模型推理显存 39GB(A100 40G),耗时同为 4 秒/样本。未披露推理 FPS/控制频率等实时化指标——Delphi 定位是离线数据生成引擎,不追求车载实时推理。
  • 代码/权重发布:官方仓库 westlake-autolab/Delphi 截至本次抓取仅有占位 README(“Code will be coming later. Stay tuned.“),未发布训练/推理代码或权重。

评测 benchmark

均为论文一手结果(nuScenes 验证集),标 * 为作者用官方开源代码/渲染视频复现,其余取自原论文。

① 生成质量与可控性对比(Table 1)——含按帧长(4/8/40 帧)分别评估的 FVD,“Fail”表示该方法无法在该帧长下生成/维持一致性:

方法FID↓CLIP↑FVD@4帧↓FVD@8帧↓FVD@40帧↓NDS↑Avg.Col.Rate↓
BEVGen25.5471.23N/AN/AFailN/AN/A
BEVControl24.8582.70N/AN/AFailN/AN/A
DriveDreamer26.8N/AN/A353.2FailN/AN/A
MagicDrive16.20N/AN/AN/AFailN/AN/A
MagicDrive*46.1882.47617.2N/AFail34.563.87
Panacea16.96N/AN/A139.0Fail32.10N/A
Panacea*55.3284.23446.9Fail29.411.35
Drive-WM15.8N/AN/A122.7FailN/AN/A
Delphi(本文)15.0886.73113.5275.636.580.29

关键结论:Delphi 是表中唯一能在 40 帧给出非”Fail”FVD 数值(275.6)的方法,其余方法均在更长帧数下崩溃,验证了”5 倍长视频且不牺牲一致性”的核心声明;FID/CLIP/NDS/碰撞率也同时全面优于对比方法。

② 失败案例驱动框架对 UniAD 规划性能的提升(Table 2,UniAD 碰撞率 Col. Rate%)

采样策略数据量数据引擎数据来源1s2s3sAvg.
基线(UniAD)0.100.180.710.33
随机采样14065(50%)Panacea训练集0.030.230.790.35
随机采样14065(50%)Delphi训练集0.080.200.580.29
随机采样28130(100%)Panacea训练集0.080.220.980.43
随机采样28130(100%)Delphi训练集0.070.290.650.33
失败案例驱动972(4%)Panacea训练集0.050.180.810.35
失败案例驱动972(4%)Delphi训练集0.080.180.560.27
失败案例驱动429(1.5%)Delphi验证集(仅布局/文本)0.070.100.610.26

反直觉发现:随机采样下数据量从 50%(14065 条)增至 100%(28130 条)反而使碰撞率上升(Delphi: 0.29→0.33,Panacea: 0.35→0.43)——说明”更多风格相近的合成数据”帮助有限;失败案例驱动的定向采样以远少的数据量(4%/1.5%)取得更好效果,且 Delphi 在同等设置下始终优于 Panacea。

③ 消融——真实/生成数据比例(Table 3):纯真实数据增量微调(Real+Real)碰撞率从 0.34 升到 0.38(更差);纯生成数据训练碰撞率 0.50(sim-to-real 差距明显);真实+Delphi 生成数据混合(Real+Generated)碰撞率降到 0.27,为最优设置。

④ 消融——场景/实例编辑(Table 4):无编辑 0.34 → 仅场景编辑 0.31 → 仅实例编辑 0.29 → 场景+实例同时编辑 0.27(最优)。

⑤ 消融——NRM / FTCM(Table 5,生成质量指标):完整 Delphi FID 15.08 / FVD 275.6 / CLIP 86.73;去掉 NRM:FID 19.81 / FVD 291.5 / CLIP 85.22;去掉 NRM 和 FTCM:FID 22.85 / FVD 346.96 / CLIP 82.91——两个模块均对生成质量有正向贡献,FTCM 贡献更大(22.85→19.81),NRM 在此基础上进一步提升。

创新点与影响

  • 首次把生成式数据引擎的验证范围从感知/预测扩展到端到端规划:论文自称”to the best of our knowledge, 首次”证明纯合成视频数据能直接提升端到端模型(UniAD)的规划性能,而不止步于 3D 检测/BEV 感知指标。
  • 噪声重初始化 + 特征对齐时序一致性:用跨视角/跨帧共享噪声(NRM)和按网络深度对齐的场景级/实例级跨帧注意力(FTCM)解决了此前方法”独立加噪+粗糙跨帧注意力”导致的长视频时空一致性坍缩问题,把可生成的一致视频长度从约 8 帧推到 40 帧(约 12 秒),是当时的 5 倍。
  • 失败案例驱动的采样框架:用 VLM 多轮问询定位失败原因、BLIP-2 检索相似场景、LLM 改写 caption 生成针对性数据,相比随机采样在数据量少一个数量级(4% vs 50%/100%)的情况下取得更好效果,且验证了”数据量越大越好”在随机采样设置下并不成立。
  • 官方自陈局限(正文 Limitation and Societal Impact):Delphi 以 BEV 布局为输入实现可控性,只能丰富外观、无法在合成过程中改变布局本身,因此框架只能用于**开环(open-loop)**评测,不能用于闭环;此外当端到端模型在训练集上已经表现完美时,失败案例驱动采样将不再起作用。(注:项目主页后续展示了一个闭环评测 demo,用 Delphi 做视觉渲染器接入 UniAD 闭环评测,这与论文正文陈述的”仅支持开环”局限存在张力,可能是论文之后的扩展工作,未见对应论文文本佐证。)
  • 论文代码/权重尚未开源(仓库仅占位 README),实际可复现性目前依赖作者规划中的后续发布。

原始链接

一手源存档(sources/)