一句话定位
GAIA-2 是 Wayve 面向自动驾驶的多视角可控隐空间扩散世界模型:用一个高压缩(32× 空间 / 8× 时间、64 通道连续隐空间)视频 tokenizer + 一个 8.4B 参数、flow-matching 训练的空间-时间分解 transformer,在 448×960 分辨率、最多 5 路环视相机上生成时空一致的驾驶视频。它把 ego 动作(速度 / 曲率)、动态 agent(3D bbox)、场景 metadata(国家 / 天气 / 车道 / 红绿灯…)、相机几何、CLIP 文本 / 图像嵌入以及一个专有驾驶模型的 scenario 嵌入,统一成结构化条件注入,支持从零生成、上下文续推、时空 inpainting、真实场景编辑四种推理模式,用于批量合成常见与长尾安全关键场景。相较前作 gaia-1-wayve 从离散自回归 token 换成连续隐空间扩散,覆盖英 / 美 / 德三地。
背景与定位
自动驾驶的训练 / 验证需要海量、多样、含安全关键长尾的场景,但纯靠真车采集受成本与时间限制,罕见事件(cut-in、行人异常、极端天气)难以采足。生成式世界模型的价值是可扩展、可复现地造合成数据。但通用文生视频 / 图生视频(Sora、MovieGen、cosmos-predict 等)只重视觉真实与时序连贯,缺乏驾驶域要求的细粒度结构控制、多相机一致性、agent 级操控。
驾驶域已有一批世界模型各自解决了部分需求:gaia-1-wayve(文本 + ego 动作、离散世界模型 + 视频扩散解码器,单相机)、drivedreamer(3D bbox + HD map + ego 动作的隐扩散)、drive-wm-driving-into-the-future(扩展到最多 6 路环视多相机 + 环境条件)、vista-driving-world-model(高分辨率长时长)等。论文自陈这些工作多只覆盖子集:或单相机、或缺 agent 级结构控制、或不支持 inpainting / 场景编辑。GAIA-2 的定位就是把「多相机生成 + 结构化 & 语义条件 + 灵活推理模式 + 外部隐空间(CLIP / 专有 scenario 嵌入)」并进一个统一的隐扩散框架,属驾驶专用的可控世界模型范式。
模型架构
GAIA-2 由两个独立训练的组件组成:视频 tokenizer 与 隐空间世界模型。整体思路(论文 Fig.2)是每路相机独立编码成隐 token,多相机隐 token 拼接后与采样噪声线性插值,加上相机参数与位置编码,过空间-时间分解 transformer,条件经 cross-attention 与 adaLN 注入,去噪后再由 tokenizer 解码回像素。
视频 tokenizer(非对称 encoder-decoder,连续隐空间)
空间-时间分解 transformer 的非对称结构:encoder 85M 参数、decoder 200M 参数。核心设计是「高空间压缩率 + 高通道维度」——不同于常见 8× 空间压缩、16 通道,GAIA-2 用 32× 空间 + 8× 时间下采样、64 通道(L=64) 的连续隐空间,得到更少但语义更丰富的 token(灵感来自 DC-AE / LTX-Video 一类紧凑隐表示)。
- 压缩关系:输入 $(T_v,H_v,W_v)=(24,448,960)$ → 隐 $(T_L,H,W)=(3,14,30)$,总压缩率 $\frac{24\times448\times960\times3}{3\times14\times30\times64}\simeq 384$(论文另一处四舍五入写 ~400)。
- Encoder:先对输入帧时间 2× stride,再经下采样卷积块 stride 2×8×8 + 卷积块 stride 2×2×2(嵌入维 512)→ 24 个空间 transformer 块(维度 512、16 heads)→ 末尾卷积 stride 1×2×2 + 线性投到 2L 通道(预测高斯分布的均值 / 标准差,训练与推理均从该分布采样)。每路相机独立编码,且 encoder 把 8 帧独立映射为 1 个时间隐(时间独立)。
- Decoder:线性投回嵌入维 + 上采样卷积块 stride 1×2×2(depth-to-space)→ 16 个空间-时间分解 transformer 块(512、16 heads)→ 上采样卷积 stride 2×2×2 + 8 个分解块 → 末尾上采样卷积 stride 2×8×8 到 RGB。与 encoder 不同,decoder 联合把 $T_L{=}3$ 个时间隐解码为 $T_v{=}24$ 帧以保时序一致;长序列推理用滑窗(rolling)机制,用过去 + 未来上下文解当前隐。
隐空间世界模型(8.4B,flow matching)
空间-时间分解 transformer,8.4B 参数,用 flow matching(Lipman 等)训练以求稳定与样本效率。输入隐 $\mathbf{x}_{1:T}\in\mathbb{R}^{T\times N\times H\times W\times L}$,$T$ 为时间窗、$N$ 为相机数。
- 22 个空间-时间分解 transformer 块,隐维 $C=4096$、32 heads。每块含:spatial attention(跨空间与相机)+ temporal attention + cross-attention + 带 adaLN 的 MLP。每个 attention 前用 query-key normalization 提升训练稳定性。
- 位置编码分三路独立:(i) 空间 token 位置(sinusoidal)、(ii) 相机时间戳(sinusoidal + 小 MLP)、(iii) 相机几何(畸变 / 内参 / 外参,learnable linear),在每个 transformer 块开头加到输入隐上。
- 条件注入方式:flow-matching 时间 $\tau$ 与 action 走 adaLN(论文发现 action 用 adaLN 比 cross-attention 更准,因为 action 影响每个空间 token,adaLN 提供显式信息门);相机几何 / 时间戳走 additive;其余条件(agent、metadata、CLIP、scenario)走 cross-attention。
结构化条件(conditioning)
- 相机参数:内参(焦距 + 主点)、外参、畸变分别编码后求和成统一相机编码,以适配真实多样的相机 rig。
- 视频频率:时间戳相对当前时刻归一化到 [-1,1] → Fourier 特征 → MLP,兼容不同帧率。
- Action:ego 动作 = 速度 + 曲率,用对称 log(symlog)归一化到 [-1,1]。曲率单位 m⁻¹、范围 0.0001–0.1,scale $s{=}1000$ 放大小值;速度单位 m/s、范围 0–75,scale $s{=}3.6$(即换算 km/h)。
- 动态 agent:用一个在自有数据上重训的 3D 检测器给出 3D bbox(位置 / 朝向 / 尺寸 / 类别),投到 2D 图像面归一化,得 $f_i\in\mathbb{R}^{T\times N\times B\times 13}$($B$ 为最大 bbox 数、零填充)。特征维 dropout $p{=}0.3$、实例级 dropout(每相机采一帧、采条件实例数 $n$),使推理时可只给 2D 投影框、省略朝向、变数量 agent。不做实例 tracking。
- Metadata:类别型,各自 learnable embedding。含国家 / 天气 / 时段、限速、车道数与类型(公交 / 自行车道)、斑马线、红绿灯及其状态、单行道、路口类型。
- CLIP 嵌入:训练时用 CLIP 图像编码器抽帧特征,推理时可换成 CLIP 文本编码器输出,实现自然语言 / 视觉相似度的零样本语义控制。
- Scenario 嵌入:来自 Wayve 内部专有驾驶模型的驾驶专用隐表示,紧凑编码 ego 动作与场景上下文(路布局 / agent 配置),可从抽象嵌入生成高层 scenario 变体。
数据
- 规模:约 2500 万条视频序列,每条 2 秒,采集于 2019–2024。
- 地域:英国、美国、德国三国,覆盖地理与环境多样性;评测用地理围栏 held-out(某些区域完全排除出训练集)以严格检验泛化。
- 平台 / 传感器:多车型采集——3 种车型 + 2 种厢式货车;每车装 5 或 6 路相机做 360° 环视;采集频率 20 / 25 / 30 Hz 混合。采集期内相机位置与标定多次调整,带来广谱空间配置,为跨相机 rig 泛化提供强训练信号。
- 采样策略:按特征的联合概率分布做平衡(而非单特征独立平衡),以建模真实共现(如特定地理下的光照 + 天气);并强制序列间最小时间 stride 防重复。
- action 标注 / agent 标注:ego action(速度 / 曲率)来自车辆信号;3D bbox 由重训的 3D 检测器自动标注(弱标注 / 模型标注,非人工)。全部为真实数据(无仿真数据混训披露)。
训练方法
两组件分开训练。
Flow-matching 目标(世界模型):训练时随机采上下文帧数 $t\in{0,…,T{-}1}$($t{=}0$ 即从零生成)与 flow-matching 时间 $\tau\in[0,1]$;未来隐与高斯噪声线性插值 $\mathbf{x}^{\tau}{t+1:T}=\tau\mathbf{x}{t+1:T}+(1-\tau)\boldsymbol{\epsilon}$,模型预测速度 $\mathbf{v}=\mathbf{x}-\boldsymbol{\epsilon}$,用 L2 损失。$\tau$ 采样用双峰 logit-normal:主峰 $\mu{=}0.5,\sigma{=}1.4$($p{=}0.8$,学中低噪)+ 次峰 $\mu{=}-3.0,\sigma{=}1.0$($p{=}0.2$,聚焦近纯噪区学空间结构与低层动态)。输入隐按固定 $\mu_x{=}0.0,\sigma_x{=}0.32$ 归一化以匹配噪声尺度。
多任务采样(世界模型):70% 从零生成 + 20% 上下文预测 + 10% 空间 inpainting。为支持 classifier-free guidance,条件随机 drop:每个条件变量独立以 80% drop、全部同时以 10% drop;相机视角以 10% drop 增强对部分可观测的鲁棒性。
Tokenizer 训练:300,000 步、batch 128、128× H100。输入 $T_v{=}24$ 帧(原生 20/25/30 Hz),随机 448×960 空间裁剪,每样本从 N=5 视角随机选一路(各相机独立编码)。损失 = DINOv2-Large 隐空间蒸馏(cos 相似,权 0.1)+ KL 到单位高斯(权 1e-6)+ 像素 L1(0.2)/ L2(2.0)/ LPIPS(0.1)。EMA 衰减 0.9999。AdamW:2500 步 warm-up 到 LR 1e-4、5000 步 cooldown 到 1e-5,betas [0.9,0.95],wd 0.1,grad clip 1.0。之后冻结 encoder、用 GAN 损失(权 0.1)微调 decoder 20,000 步(3D 卷积判别器:base 64、时空 stride 2 + 3D blur pooling、通道倍数 [2,4,8,8]、3D instance norm、LeakyReLU 0.2、spectral norm、softplus GAN loss;判别器 LR 1e-5)。
世界模型训练:460,000 步、batch 256、256× H100。输入 48 帧、448×960、N=5 相机 → 编码后 $T\times N\times H\times W=6\times5\times14\times30=12{,}600$ 个输入 token。EMA 0.9999。AdamW:2500 步 warm-up 到 5e-5、cosine 衰减到 6.5e-6,betas [0.9,0.99],wd 0.1,grad clip 1.0。
推理:四模式——从零生成 / 自回归预测(初始 $k{=}3$ 时间隐上下文、滑窗长时 rollout,可超训练窗时长)/ inpainting / 场景编辑(对真实视频部分加噪再以改后条件去噪)。噪声调度用线性-二次(MovieGen 引入)固定 50 步去噪。CFG 默认不用;对罕见 / OOD 场景才开,guidance scale 2–20;对 agent 条件用空间选择性 CFG(只在 bbox 影响的空间位置施加引导)。
Infra(训练 / 推理工程)
- 训练硬件:tokenizer 用 128× NVIDIA H100(300k 步);世界模型用 256× H100(460k 步)。GPU-hours 未披露。
- 并行 / 精度:并行策略与数值精度未披露;只说各组件「用大规模计算基础设施独立训练」。
- 推理工程:固定 50 步去噪 + 线性-二次噪声调度;tokenizer 解码用滑窗 rolling 机制支持长序列。FPS / 控制频率 / 单帧时延 / 边缘硬件均未披露——论文将「实时 / 近实时合成仍计算密集」列为未来工作,拟用蒸馏、高效 transformer 变体、推理加速改善部署可行性。
评测 benchmark
GAIA-2 以定性示例 + 定量指标评估,未提供与其他驾驶世界模型的头对头数字对比表(论文明确说其贡献是统一框架而非 SOTA 打榜)。定量指标定义如下,趋势见论文 Fig.13(在「从零生成」任务、$n{=}1024$ 样本上评):
- 视觉保真:Fréchet DINO Distance(FDD)与 FID。特征编码器用 DINOv2 ViT-L/14,图像双线性放大到 448×952(对比 FID 的 InceptionV3 299×299)。论文观察 FDD 比 FID 噪声更小、在训练中饱和更晚。
- 时序一致性:Fréchet Video Motion Distance(FVMD),比对生成 vs 真值的显式关键点运动特征分布;论文称其比 FVD 更贴合人类对时序一致性的偏好。
- 动态 agent 保真:把作为条件的 3D bbox 投影,与用 OneFormer 在生成视频上得到的分割 mask 比,算按类 IoU,衡量模型对 agent 空间 / 类别规格的遵从。
- 论文报告:所有指标在训练中均呈正向趋势;且 validation loss 与人类偏好相关性最强,可作感知质量的有效代理。
定性能力(配官方视频):跨英 / 美 / 德三地、多天气 / 时段 / 路型的多样生成;partial-noise/denoise 把一条真实序列的同一 ego 轨迹改成晴 / 雨 / 日落 / 夜 / 雪多版;纯 action(速度 + 曲率)生成场景(英式红绿灯变绿、跟停伦敦出租、美式路口 U-turn);安全关键场景(ego 诱发:转向驶入对向车道;他车诱发:急刹 / 危险超车 / 抢行);极端泛化(高速 + 强曲率外推到驶入田野 / 森林 / 沙丘等 OOD);agent inpainting(把动态 agent 无缝插入 mask 区且保背景一致);多 rig(跑车 / SUV / 大厢货不同相机布置)的时空一致。
创新点与影响
- 贡献:首个把「多相机(≤5 路)生成 + ego 动作 / 3D bbox agent / 场景 metadata 结构化条件 + CLIP & 专有 scenario 外部隐空间 + 从零生成 / 上下文续推 / inpainting / 场景编辑四模式」统一进单一隐扩散世界模型的驾驶专用框架,覆盖英 / 美 / 德三地。
- 改变了什么:相较 gaia-1-wayve 的逐帧离散自回归 token,改为「连续隐空间 tokenizer + 隐扩散」,消除时序断裂、提升运动平滑与多相机空间一致;用「高空间压缩 + 高通道」的紧凑隐空间换更快推理与更强时序建模;action 用 adaLN 而非 cross-attention 提升可控性。相对 drive-wm-driving-into-the-future / vista-driving-world-model 等,把 agent 级操控、语义嵌入、编辑 / inpainting 一次性合进同框架,主打「可复现地造安全关键长尾数据」以扩大自动驾驶验证覆盖。
- 作者自陈局限:(i) 与所有生成模型一样偶发时序 / 语义不一致,尤其长时或复杂场景,需更好的失败检测 / 精修模型 / 约束采样;(ii) 虽支持并行生成,实时 / 近实时合成仍计算密集,待蒸馏与高效变体;(iii) 条件虽丰富,仍需更丰富的 agent 行为、更细的环境条件、开放式自然语言控制,及补足含人类 agent / 复杂基础设施 / 社交交互的罕见安全关键事件。
- 开放度:无开源代码 / 权重(专有),官方以论文 + 博客 + 视频 demo 形式披露。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2503.20523
- arXiv PDF:https://arxiv.org/pdf/2503.20523
- arXiv HTML 全文:https://arxiv.org/html/2503.20523v1
- 官方博客 / 项目页(Wayve):https://wayve.ai/thinking/gaia-2/
- HF Papers 聚合页:https://huggingface.co/papers/2503.20523
- 前作 GAIA-1:https://wayve.ai/thinking/scaling-gaia-1/ | gaia-1-wayve
一手源存档(sources/)
- gaia-2-wayve—blog — Wayve 官方博客快照(sources/world-model/2025/gaia-2-wayve—blog.md,fetched 2026-07-16)
- arXiv 2503.20523 全文 PDF / HTML:见上「原始链接」(arXiv 原文,不入 git)