一句话定位

Vista 是把 Stable Video Diffusion(SVD)改造成的通用驾驶世界模型:在最大公开驾驶视频集 OpenDV-YouTube(约 1740 小时)上训练,能以 10 Hz、576×1024 高分辨率预测最长 15 秒 的连贯未来,支持角度/速度/轨迹/命令/目标点五种动作条件,并首次用模型自身的预测不确定性构造出无需真值动作的通用奖励函数。NeurIPS 2024。

背景与定位

驾驶世界模型的一贯痛点是三条同时受限:泛化(受数据规模与地理覆盖束缚)、保真度(帧率/分辨率低,丢失关键细节)、可控性(多数只支持单一动作模态如转角/速度,且无法对接主流规划器的输出格式)。作者把这三点作为系统性诊断的靶子。

范式上 Vista 属于 image-to-video 潜变量扩散型视觉世界模型(不同于 BEV/点云世界模型),以 SVD 为骨干,走”大规模真实驾驶视频预训练 + 动作可控性后训练”的两阶段路线。它直接对标并超越同期的驾驶世界模型 drive-wm-driving-into-the-futuredrivedreamergaia-1-wayve(GAIA-1)以及本组自己的 GenAD(Generalized Predictive Model, CVPR 2024,OpenDV 数据集的提出者)。相较通用视频生成模型(SVD 等),Vista 的关键差异是”从条件帧严格起始的预测性 + 真实驾驶动力学 + 可自回归长程外推 + 动作可控”。与 diffusion-forcinggamengen 等交互式世界模型相比,Vista 面向真实道路的开放域泛化而非游戏/仿真闭环。

模型架构

  • 骨干:直接采用 SVD(Stable Video Diffusion)框架 —— 连续时间步(continuous-timestep)的潜变量扩散 I2V 模型,UNet 去噪器。总参数 2.5B,其中 UNet 1.6B。EDM 训练框架。
  • 潜空间 / tokenizer:SVD 的图像编码器把帧编码为 clean latent;每段处理 K=25 帧噪声潜变量 n ∈ R^{K×C×H×W},生成 25 帧视频(10 Hz ≈ 2.5 秒/段)。
  • 预测性改造(Basic Setup):把 SVD 改成”从条件帧严格起始”的预测模型 —— 用第一帧作条件图像,训练时丢弃 noise augmentation 以保留条件帧细节。长程预测靠迭代:预测短段 → 用末段重置条件图像 → 继续。
  • 动态先验注入(latent replacement,一致性核心):连贯未来至少需要位置、速度、加速度三个先验,可由三帧连续观测导出(速度/加速度是位置的一/二阶导)。用帧级掩码 m ∈ {0,1}^K(最多 3 个 1)标记条件帧位置,不做通道拼接,而是把对应位置的噪声潜变量 n_i 直接替换成 clean latent z_in̂ = m·z + (1−m)·n。为区分 clean latent,从预训练权重复制一份新的 timestep embedding 专供条件帧,条件帧与预测帧的 timestep embedding 分开训练。作者发现 latent replacement 比通道拼接更有效、更灵活地吸收可变数量的条件帧,且直接施加于 SVD 不损原有生成质量。自回归时用上一段预测的最后 3 帧作下一步先验。
  • 动作条件(ACTION-conditioning):五种异质动作统一转成数值序列,再编码为 128 通道的 Fourier embedding 拼接;通过在 UNet 的 cross-attention 层扩展输入维度注入(新投影层零初始化以从预训练态平滑学习)。作者实测经 cross-attention 注入比 additive embedding 收敛更快、可控性更强。五种动作:(1) 角度 & 速度(最细粒度,角度归一化到 [−1,1],速度用 km/h,按时间顺序拼接);(2) 轨迹(ego 坐标系 2D 位移序列,单位米,展平);(3) 命令(最高层意图,四类:前进/右转/左转/停,类别索引);(4) 目标点(短期终点投影到初始帧的 2D 坐标,按图像尺寸归一化,作交互接口)。
  • 一致性/记忆:靠 latent replacement 的三帧动态先验 + 自回归 rollout 维持长程一致性;采样端用**三角形 CFG(triangular classifier-free guidance)**缓解长程颜色/饱和度漂移。

数据

  • 主数据 OpenDV-YouTube(GenAD 提出的最大公开驾驶视频集):人工剔除 15 小时无关内容后,得到约 1735 小时无标注驾驶视频(Table 1 记为 1740h),全球范围、含 geofenced 区域,用于第一阶段高保真预测训练。
  • 动作标注数据 nuScenes 训练集:只在第二阶段(动作可控性)引入,用于导出角度/速度/轨迹/命令/目标点等条件。nuScenes 分布偏斜严重,故按命令类别做重平衡以学习稀有动作。
  • 采样规格:视频段统一 25 帧 @ 10 Hz;nuScenes 原为 12 Hz,作者发现当作 10 Hz 处理无负面影响。输入通过裁剪+缩放到目标分辨率。
  • 命令定义:沿用规划惯例 —— ego 在垂直初始朝向方向位移 > 2 米记为”右转/左转”;前向行驶距离 < 2 米记为”停”。
  • 协同训练配比(Collaborative Training):OpenDV-YouTube 无动作标注(其动作条件全置零作 unconditional),nuScenes 有标注;第二阶段两数据集按 1:1 采样联合训练,使可控性能零样本泛化到新数据集。作者强调这一策略避免了 GenAD 那种给 OpenDV 打命令/文本标签带来的累积噪声与冲突。

训练方法

两阶段流水线

阶段一:高保真未来预测(训练全部 UNet 参数)。目标是三项损失的加权和 L_final = L_diffusion + λ1·L_dynamics + λ2·L_structure

  • L_diffusion:标准扩散损失,但用掩码 (1−m_i) 排除条件帧(无需预测已观测帧)。
  • L_dynamics(动态增强损失):驾驶视频里远景/单调背景占主导、前景运动实例小而随机。用”相邻帧预测差 vs 真值差”的 L2 构造 dynamics-aware 权重 w_i(clip 内归一化,stop-gradient),自适应地把损失集中到大运动区域(动车、路沿),而非均匀监督。
  • L_structure(结构保持损失):高分辨率下移动物体轮廓易过平滑/破碎。用 2D FFT + 理想高通滤波器 H + IFFT 提取预测与真值 latent 的高频分量并最小化其差异,保住边缘/纹理/车道线。
  • 关键超参:128×A100,576×1024 分辨率,20K 迭代,约 8 天;梯度累积 2 步 → 有效 batch size 256;AdamW,lr 1e-5,空间层 lr 打 0.1 折扣;λ1=1.0,λ2=0.1;offset noise 强度 0.02(提升时序平滑);动态先验按 1/15, 2/15, 4/15, 8/15 概率随机采样 0/1/2/3 个条件帧;关闭 noise augmentation。

阶段二:动作可控性(高效 + 协同学习)。

  • 冻结预训练 UNet,给所有 attention block 加 LoRA(rank=16)+ 投影层;训练后低秩矩阵可合并进冻结权重,推理零额外延迟。作者验证:直接在低分辨率调 UNet 会损保真度,而只训投影层不加 LoRA 又会质量崩坏(Fig. 15),故 LoRA 是必需的。
  • 两段式分辨率:先在 320×576(吞吐比原分辨率高 3.5×)训 120K 迭代(batch 8,lr 5e-5,占大部分迭代);再解冻在 576×1024 微调 10K 迭代
  • 动作独立约束(action independence):每个训练样本只激活一种动作模态,其余置零。避免为覆盖所有动作组合而付出高昂训练成本,最大化单模态学习效率(Table 4 验证)。
  • 每种激活动作以 15% 概率 dropout 以支持 classifier-free guidance;OpenDV:nuScenes = 1:1 采样。
  • 阶段二总耗时 约 10 天 / 8×A100(低分辨率约 8 天 + 高分辨率约 2 天)。
  • 损失函数消融各变体:OpenDV 上 10K steps、576×1024、8×A100,均从 SVD 预训练权重初始化。

奖励函数(3.3):基于”OOD 条件 → 生成多样性增大”的观察,用 Vista 自身的预测不确定性(条件方差)当奖励。对同一条件帧 c 与动作 a 用不同随机噪声去噪 M 轮,奖励 R(c,a) = exp[avg(−conditional variance)]。不利动作方差大→奖励低。设计满足 Kolmogorov 公理(非负、样本空间测度 [0,1]),且不需真值动作即可评估。默认 M=5 集成、每样本仅 10 步去噪,correlating 系数 β=0.5。

采样:DDIM 50 步,σmax=700;三角形 CFG(smin=1.0, smax=2.5)沿帧轴分配 guidance scale 缓解饱和漂移;解码前把 latent 切成重叠 3 帧的子段送 video-aware decoder,解码后重叠帧像素级平均以提升连续性。

Infra(训练 / 推理工程)

  • 训练算力:阶段一 128×NVIDIA A100,约 8 天(20K iter,effective batch 256);阶段二 8×A100,约 10 天;损失/其他消融均在 8×A100 上跑。总 GPU-hours 未逐项披露,但阶段一约 128×8×24 ≈ 2.5 万 A100·小时 量级(据披露天数估算)。
  • 精度/并行:未显式披露张量/流水并行方案;EDM 框架 + 梯度累积 2 步。
  • 参数高效:阶段二 LoRA rank=16 合并后零额外推理延迟。
  • 推理端:论文未给出具体 FPS / 端侧硬件 / 时延数字(未披露)。作者在局限性中明确承认,因预测分辨率极高,计算开销大,扩散框架带来非可忽略延迟与随机性,直接上车有安全风险;建议用更快采样器或蒸馏加速(属未来工作)。控制频率对应生成帧率 10 Hz

评测 benchmark

nuScenes 验证集预测保真度(Table 2,均越低越好):

MetricDriveGANDriveDreamerWoVoGenDrive-WMGenADVista
FID↓73.452.627.615.815.46.9
FVD↓502.3452.0417.7122.7184.089.4

相对最强驾驶世界模型,FID 提升 55%、FVD 提升 27%(摘要口径)。

人类评测(2AFC):33 名参与者、共 2640 份答案,覆盖从 OpenDV-YouTube-val / nuScenes / Waymo / CODA 四数据集精选的 60 个场景(含 Waymo 独立域、CODA 极端 corner case)。对比三个 web 规模通用视频生成器(SVD 等),Vista 在视觉质量运动合理性两项上均胜出,逾 70% 对比中胜出

长程预测:可外推 15 秒 高分辨率未来而无明显退化(SVD 自回归则崩坏,Fig. 6)。

动作可控性:按命令类别切分 nuScenes 与未见的 Waymo,用不同模态真值动作生成后测子集平均 FVD —— 施加动作控制使预测更贴近真值分布(Fig. 8);可控性零样本迁移到 Waymo/OpenDV-val。

奖励建模:把真值轨迹按 nuScenes 训练集 waypoint 标准差抖动成不同 L2 误差的劣质轨迹,在未训练过的 Waymo(1500 例)上,奖励随偏离真值增大而单调下降(Fig. 10),可弥补 L2 误差评价的失真。命令奖励(Table 3):真值命令 0.892 > 随机命令 0.878(−0.014),可用于命令选择。动作独立约束(Table 4,以轨迹为例):加约束后 forth/right/left/stop 各子集 FVD 全面更低(如 stop 从 132.3 → 118.9)。

创新点与影响

  • 贡献:(1) 用两个新损失(动态增强 + 结构保持)+ latent replacement 三帧动态先验,把通用 SVD 打造成能长程连贯外推的高时空分辨率(10 Hz / 576×1024 / 15s)驾驶预测模型;(2) 统一 cross-attention 接口 + LoRA + 动作独立约束 + 双数据集协同训练,集成五种动作模态并零样本泛化动作可控性到未见域;(3) 首次用世界模型自身预测不确定性构造无需真值动作的通用奖励,超越 Drive-WM 依赖外部检测器的方案。
  • 改变了什么:把驾驶世界模型从”绑定单一数据集/单一控制模态/低分辨率”推向”开放域泛化 + 多模态动作 + 高保真长程”,并树立 nuScenes 新 SOTA(FID 6.9 / FVD 89.4);权重与代码 Apache-2.0 开源,成为后续可控驾驶世界模型的常用基座。
  • 作者自陈局限:(1) 极高时空分辨率导致计算昂贵,扩散采样有延迟与随机性,直接上车有安全隐患,需更快采样/蒸馏;(2) 长程 rollout 或剧烈视角切换时预测可能明显退化,需额外精修或更可扩展架构(如 GAIA-1 式);(3) 动作控制仍会失败,尤其命令/目标点这类模糊意图,需引入更多带动作标注数据或组合式 CFG;(4) 训练数据虽基于最大公开集,仍远非全部互联网驾驶数据,扩展潜力巨大。

原始链接

一手源存档(sources/)