一句话定位

Waymo/Google DeepMind 提出 Drive&Gen 框架,让驾驶视频生成模型和端到端(E2E)驾驶模型互为评测工具:把生成视频喂给 E2E 规划器、比较其行为响应与真实视频下的响应是否一致,用一个新提出的统计检验——行为置换检验(Behavior Permutation Test, BPT)——去衡量”生成视频能否在行为层面骗过规划器”,并进一步用可控生成的天气/时段变化视频做规划器的诊断与分布外(OOD)数据增强,在真实雨天/夜间验证集上把 ADE@5s 分别从 0.8536/0.7372 降到 0.8382/0.7101。

背景与定位

此前的驾驶场景生成工作(gaia-1-wayvevista-driving-world-modeldrivedreamerdrivingdiffusionmagicdrivepanacea-driving-videodrive-wm-driving-into-the-future 等)持续把生成视频的视觉质量做得越来越逼真,但论文指出一个此前被忽视的问题:视觉逼真不等于对下游规划器行为逼真——正如对抗样本文献所示,人眼几乎不可察觉的图像扰动也能让下游模型输出发生剧烈变化(如把熊猫误判为狒狒),因此生成视频”看起来像真的”并不能保证 E2E 规划器”表现得像面对真实数据一样”。论文将自己定位为”较早系统研究驾驶视频生成模型之于 E2E 规划器的真实性”的工作。

论文明确提到并行工作 delphi-driving-video(2024,“Concurrent work Delphi [20] also uses world models to improve E2E driving models”),但强调 Drive&Gen 的覆盖面不同:Delphi 主要验证生成数据对规划性能的提升效果(数据增强侧),而 Drive&Gen 更系统地覆盖了 AV 软件开发的三个环节——生成视频真实性评测规划器在不同 ODD(操作设计域)下的诊断分析、以及用生成数据做 OOD 泛化增强——三者由同一套可控生成模型和同一套统计检验串联。

视频生成侧基于 Google 自家的 walt-photorealistic-video-diffusion(W.A.L.T,潜在视频扩散 Transformer)扩展;E2E 规划侧基于预训练视觉语言模型 PaLI-X(Chen et al. 2023)搭建,方法上沿用 Waymo 的 EMMA(Hwang et al. 2024, arXiv:2410.23262)路线——即把 E2E 规划建模为视觉问答(VQA)任务,输出文本化的路点轨迹。行为评测参照 Waymo Open Sim Agents Challenge(Montali et al. 2023)“场景布局决定行为、视觉外观基本无关”的核心假设,作为 BPT 检验的理论前提。

模型架构

视频生成模型(Sec III-B):以预训练 walt-photorealistic-video-diffusion 为骨干的潜在扩散 Transformer,扩展支持以下控制模态:

  • 包围框(bounding box):每个框编码为 8 维向量(位置 x,y,z、尺寸 宽/高/长、朝向角、类别),朝向角用正弦函数编码,类别用 one-hot;经 MLP 投影到 256 维空间;每帧最多 256 个框,超出截断/不足补齐;坐标从世界系转换到自车(ego-vehicle)坐标系。
  • 道路地图(road map):仿照 Wayformer(Nayakanti et al. 2023)用线段表示,每帧最多 4,096 条线段,每条线段含起点、终点、类型三个属性;坐标同样转换到自车系;经 MLP 投影到 256 维,并用 latent query attention(类 Perceiver IO)压缩 token 数以降低显存/计算。
  • 自车位姿(ego-car pose):展平为 12 维向量(3×3 旋转矩阵 + 3 维平移),MLP 投影到 256 维。
  • 时段(time-of-day):核心创新之一——不直接用本地时间编码,而是根据本地时间 t_d、年内日期 t_y、地理位置 l_geo(经纬度)计算太阳方位角 θ 与仰角 φ,用不同频率的正弦函数编码后经 MLP 投影,理由是同一钟点在不同季节/地理位置光照条件差异很大,太阳角度是更本质的光照信号;由此可实现”06:41""20:25”级别的精细时段控制与平滑的昼夜过渡。
  • 天气(weather):雨/无雨等状态用 one-hot 编码后 MLP 投影。

上述所有条件嵌入拼接为统一序列 z,经一个 Transformer 编码器得到特征 f_z;f_z 通过交叉注意力注入扩散 Transformer 的中间特征;同时仿照 W.A.L.T 的做法,对 f_z 做池化后经 MLP 得到调制向量,通过 AdaLN 方式对自注意力/前馈层做自适应缩放和偏移,实现更精细的可控生成。

E2E 规划模型(Sec III-C):基于预训练 VLM PaLI(PaLI-X, Chen et al. 2023)微调,方法沿用 EMMA。为高效处理时序帧,采用”拼贴图像(collaged-image)“表示——将 3×3 网格的多帧图像按从左到右、从上到下排列(最早帧在左上角),整个拼贴图编码为 1,536 个 token,与文本 token(含自车历史状态如位置/速度、路由指令如”turn left”/“go straight”)拼接后送入编码器-解码器模型;输出为路点序列,以浮点数文本形式表示轨迹,将规划任务建模为视觉问答(VQA)。训练时用预训练权重初始化,只微调语言解码器、冻结视觉编码器,用交叉熵损失训练。

数据

  • 视频生成模型训练集:约 一千万(10M)条驾驶片段,留出 1% 作测试集,其余用于训练;每条片段 17 帧、10Hz 采样、128×128 像素分辨率,附带多种特征:智能体包围框、道路地图、自车轨迹、本地时间、地理位置、天气;每帧最多 256 个包围框。
  • 条件 dropout:训练时以 0.1 的概率随机丢弃每种条件(独立丢弃),目的是提升模型对缺失条件的泛化能力,使推理时可以只用部分条件生成。
  • FVD 评测采样:从日志数据集与合成输出中各随机采样 5,000 段视频计算 FVD。
  • E2E 数据增强实验(Sec IV-C):生成 100 万(1M)条与真实视频条件相同、真值未来轨迹相同的合成视频,用于微调规划器;额外在真实验证集中划出雨天与夜间(22:00–04:00)子集,专门评测 OOD 泛化效果。
  • 论文未披露训练数据的具体地理覆盖范围、传感器配置(单目/环视)等细节。

训练方法

  • 视频生成模型:在上述 10M 片段数据集上训练 700k 步,batch size 64(标准扩散训练目标,未在正文进一步展开具体噪声调度/损失形式)。
  • E2E 规划器微调:基于预训练 PaLI 微调 120k 步,仅更新语言解码器、视觉编码器冻结,交叉熵损失。
  • 协同评测方法(Behavior Permutation Test, BPT,Sec III-A)——本文最主要的方法贡献:
    1. 对每个驾驶场景,先用规划器在真实视频上采样 M 条轨迹 {τ_i^real}(i=1..M),再用视频生成模型按相同条件生成视频、规划器在生成视频上采样 N 条轨迹 {τ_j^gen}(j=1..N);实验中取 M=N=10
    2. 零假设 H₀:两组轨迹分布相同。检验统计量 T 为两组轨迹间的广义 Chamfer 距离:T = (1/2M)Σ_i min_j‖τ_i−τ_j‖₂ + (1/2N)Σ_j min_i‖τ_i−τ_j‖₂。
    3. 1,000 次随机置换重新划分两个新集合并重算 T′,得到 T₀(真实 vs 生成两组各自完整、未打乱时的 T);计算 p 值 = P(T′ > T₀)。p < 0.05 视为该场景 BPT 检验失败(即生成视频显著改变了规划器行为)。
    4. 在整个验证集上统计”未能拒绝零假设”(fail-to-reject)的比例作为整体指标;由于显著性水平设为 0.05,理论期望上限为 95%(不可能所有场景都通过检验)。
  • OOD 数据增强微调(Sec IV-C):对比两种微调方案——(a) 仅用真实视频微调 40K 步;(b) 先用 100 万条合成视频微调 20K 步,再用真实视频微调 20K 步(合计 40K 步,与 (a) 步数对齐以公平对比)。

Infra(训练 / 推理工程)

  • 训练硬件:论文正文未披露训练视频生成模型与 E2E 规划器所用的 GPU/TPU 型号、数量或总训练时长(GPU-hours)。
  • 推理性能:未披露生成模型或规划器的推理 FPS、控制频率(control-Hz)或延迟等实时化指标;论文性质为离线评测框架,不涉及车载实时部署。
  • 代码/权重发布:截至本次调研,未发现官方 GitHub 仓库、项目主页或 HF 模型卡;Hugging Face 论文聚合页确认”0 个模型 / 0 个数据集 / 0 个 Space”引用此论文,无开源产物。论文作者本人在 HF 论文页评论中注明该文已发表于 IROS 2025(此信息未见于 arXiv 页面本身)。

评测 benchmark

以下数据均取自论文正文 Fig. 4、Table I–VII(nuScenes 之外的 Waymo 内部驾驶数据集,规模与地理范围未披露具体名称)。

① 可控视频生成评测(Fig. 4,5,000 个随机样本,FVD / ADE@5s / BPT 未拒绝率)

条件FVD↓ADE@5s↓BPT 未拒绝率↑
Real(真实视频,仅作参照)0.7548
Same Cond.(相同条件生成)39.890.859469.62%
w/o Box(去掉包围框条件)38.971.121655.28%
Rain(改天气为雨)151.250.873669.28%
Night(改时段为夜)493.370.876067.66%

关键结论:FVD 无法区分”视觉质量”与”分布偏移”——雨/夜场景在训练集中较稀少,FVD 因分布偏移而暴涨(151/493),但视觉逼真度与相同条件生成相近;FVD 也无法反映可控性——去掉包围框后车辆位置发生显著变化,FVD 却几乎不变(38.97 vs 39.89)。而 ADE 与 BPT 不受这类分布偏移影响,且能敏感捕捉可控性缺失:去掉包围框后 ADE@5s 从 0.86 升到 1.12、BPT 未拒绝率从 69.62% 骤降到 55.28%。

② 时段编码消融(Table I):太阳角度编码 vs 本地时间编码——

时段编码方式FVD↓ADE@5s↓BPT↑
本地时间45.540.873968.46%
太阳角度(本文)39.890.859469.62%

③ 条件消融对规划器 ADE 的影响(Table II,1s/3s/5s)

输入视频ADE@1sADE@3sADE@5s
Real0.02880.26060.7548
Gen(相同条件)0.03000.28590.8594
Gen w/o bbox0.04370.38141.1216
Gen w/o road map0.03480.30590.9111
Gen w/o weather0.02990.28570.8593
Gen w/o time-of-day0.02990.28860.8751

结论:去掉场景布局条件(包围框、道路地图)对 ADE 影响远大于去掉操作条件(天气、时段),说明规划器的轨迹预测主要由几何布局驱动。

④ 天气/时段对规划器性能的影响(Table III / IV):无雨 ADE@5s 0.8580 vs 有雨 0.8736(雨天略差);时段上 00:00 0.8760、06:00 0.8744、12:00 0.8653、18:00 0.8747——正午表现相对最好,午夜/傍晚略差(数值差异不大,原文如此)。

⑤ 合成数据微调对真实世界性能的提升(Table V / VI / VII,ADE@1s/3s/5s)

数据集 / 模型ADE@1sADE@3sADE@5s
全部验证集 · Train on real0.02880.26060.7548
全部验证集 · Fine-tune on real0.02870.25910.7469
全部验证集 · Fine-tune on gen+real0.02820.25430.7333
雨天验证集 · Train on real0.03180.28930.8536
雨天验证集 · Fine-tune on real0.03280.29200.8482
雨天验证集 · Fine-tune on gen+real0.03180.28910.8382
夜间验证集 (22:00–04:00) · Train on real0.02750.24700.7372
夜间验证集 · Fine-tune on real0.02840.25050.7328
夜间验证集 · Fine-tune on gen+real0.02780.24470.7101

结论:仅用真实数据微调(Fine-tune on real)在全量/雨天/夜间三个切片上收益都很有限甚至(雨天 ADE@1s/3s 上)出现轻微退化;加入 100 万条同条件合成视频(Fine-tune on gen+real)在全部三个切片上都取得最优 ADE,其中雨天 ADE@5s 从 0.8536 降到 0.8382,夜间 ADE@5s 从 0.7372 降到 0.7101,验证了合成数据对 OOD 泛化的实际增益。论文同时提醒:真实世界夜间数据本身混杂了交通密度更低等因素(可能反而降低 ADE),这正说明单靠真实数据难以干净地隔离单一因素的影响,凸显了可控生成 + 协同评测框架的价值。

创新点与影响

  • 首次提出行为置换检验(BPT):把”生成视频是否足够真实”的问题转化为”下游规划器在真实/生成视频上的行为分布是否可区分”的统计假设检验,绕开了 FVD 等分布匹配指标既怕分布偏移、又测不出可控性缺失的两个缺陷。论文自称”据我们所知,这是首次尝试用基于 VLM 的驾驶模型评测驾驶视频生成”。
  • 系统性协同评测框架:把视频生成模型评测、E2E 规划器在不同 ODD 下的诊断分析、以及用生成数据做 OOD 数据增强,统一到同一套可控视频生成模型 + 同一套统计检验之下,覆盖了此前工作(如 Delphi)只聚焦其中一环(数据增强)的局限。
  • 实际验证合成数据对 OOD 泛化的收益:在雨天/夜间等分布外场景上用生成视频微调可稳定提升规划器 ADE,为”用生成式仿真扩展 AV 运营设计域(ODD)“提供了直接证据。
  • 论文自陈局限(Sec V):BPT 建立在”不同环境条件下真值轨迹保持不变”的假设上,本质只衡量规划器行为分布是否一致,并不直接评估生成视频的物理真实性或道路安全含义,作者将其列为未来工作方向;此外正文也说明本工作的重点是协同评测框架而非刷新视频生成 SOTA,因此未做详细的 FVD/分辨率对比,且当前方法(包括本文自己的模型)都缺乏本文所需的分钟级时段/太阳角度精细控制能力;UniAD 式确定性轨迹预测与 BPT 不兼容,故未能纳入本框架对比。

原始链接

一手源存档(sources/)

  • 论文全文:arXiv:2510.06209(arXiv 原文 PDF,不入 git;正文 Fig. 4、Table I–VII 及 Sec III-A/B/C 的数字均取自此,含 HTML 全文版 https://arxiv.org/html/2510.06209v1)
  • 未发现可归档的官方博客 / GitHub README / HF 模型卡 / 项目主页快照——本文无开源代码/权重发布,HF 论文聚合页仅为摘要聚合,不含超出 arXiv 摘要的信息,故未单独存档。