一句话定位
GAIA-1 是首个把生成式世界模型规模化搬到真实自动驾驶的工作:把 video / text / action 全部离散化成 token,用一个 6.5B 的自回归 Transformer 做「下一个 image token 预测」(world model),再接一个 2.6B 的多任务视频扩散解码器把预测的 latent token 渲染回高分辨率视频;在伦敦 4700 小时真实驾驶数据上自监督训练,能做视频续演、动作条件、文本条件三类可控未来生成,并首次验证 LLM 式 scaling law 在驾驶世界模型上成立。
背景与定位
此前世界模型的成功几乎都在游戏 / 仿真或低维状态空间里(Dreamer 系列 dreamer-v3、DayDreamer、MuZero、IRIS/TWM 这类「transformer 当 sample-efficient world model」)。这些方法要么依赖标注、要么用低维表征导致生成样本不够真实,难以覆盖真实道路的非结构化复杂度。另一条线是生成式视频模型(Imagen Video、Structure-and-Content、扩散 / 自回归视频),画面逼真但学不到「捕捉预期未来事件」的表征,缺少 world model 的预测语义。
GAIA-1 的定位是把两者优点合并:用世界模型学”未来会怎么演化”的语义表征 + 用视频扩散模型保”生成的真实度”。它把世界建模明确 cast 成「无监督序列建模 / next-token prediction」,从而直接继承 LLM 的 scaling 属性。这属于 driving world model / platform-foundation world model 范式。
同期与后续坐标:
- drivedreamer(DriveDreamer,GigaAI/清华,2023-09):同期真实道路驾驶世界模型,走扩散主干 + HDMap/3D 框结构化条件,在 nuScenes 上验证;GAIA-1 相反走纯自监督、无结构化标注的自回归 token 路线,靠 4700h 私有数据规模化。
- drive-wm-driving-into-the-future(Drive-WM,CVPR 2024):把驾驶视频世界模型推进到多视角一致并接真实端到端规划器。
- copilot4d-waabi(Copilot4D,Waabi):同思路把 LiDAR 点云离散化 + 自回归 + 扩散,做 4D 占据预测世界模型。
- GAIA-1 的核心贡献是首次在真实驾驶上证明生成式世界模型可以像 LLM 一样按 scaling law 稳定放大,并把它当作「神经仿真器」用于自动驾驶训练 / 验证。
模型架构
GAIA-1 由三个可训练组件构成(论文 Fig. 2):image tokenizer → world model(自回归 Transformer)→ video diffusion decoder。前两者在 latent token 空间推理,解码器把 token 渲染回像素并做时序超分。
输入编码(三模态 → 共享 d 维空间,d = 4096)
- Image tokens:每帧用预训练 image tokenizer 离散化成 n = 576 个 token(18×32 网格),经可训练 embedding 层映射到 d 维。
- Text tokens:用预训练 T5-large 编码,每时间步得 m = 32 个文本 token,经线性层映射到 d 维。
- Action tokens:只用 l = 2 个标量(speed 速度 + curvature 曲率),各自过线性层升到 d 维。
- 每个时间步 token 交错顺序固定为 text — image — action,整段输入为 (c₁,z₁,a₁, …, c_T,z_T,a_T)。位置编码是因子化时空:一个跨该时间步所有 token 共享的可学习 temporal embedding(共 T 个),加一个可学习 spatial embedding(每步 m+n+l = 610 个位置)。
Image Tokenizer(0.3B,离散自编码器)
- 全卷积 2D U-Net,编码器 E_θ 用最近邻查表量化(VQ-GAN 式),空间下采样 D = 16,288×512 图 → n = 18×32 = 576 token,vocab K = 8192,比特压缩率 ≈ 470×。
- 关键创新:DINO 蒸馏做归纳偏置——量化特征用 cosine 相似度回归到预训练 DINO 特征,把语义(车 / 路 / 天空同类 token embedding 相近)压进 token,让世界模型的输入空间更语义、少高频噪声(论文 Fig. 3 用 top-3 PCA 可视化验证)。
- 损失 = 图像重建(L1+L2+perceptual+GAN)+ 量化损失(embedding + commitment,加 [Yu et al.] 的线性投影 + L2 归一化提升码本利用率)+ DINO 归纳偏置损失。解码器只用于训练 tokenizer,最终 GAIA-1 只保留离散编码器 E_θ。
World Model(6.5B,自回归 Transformer)
- 因果掩码的 next-image-token 预测:L = −Σ_t Σ_i log p(z_{t,i} | z_{<t}, z_{t,j<i}, c_{≤t}, a_{<t})(式 1)。
- 训练时随机 dropout 条件 token,使同一个模型能做 (i) 无条件、(ii) action-conditioned、(iii) text-conditioned 三种生成。
- 为压序列长度,视频从 25Hz 时序下采样到 6.25Hz,模型可覆盖更长时间跨度;全帧率由解码器做时序超分补回。
- 用 FlashAttention v2。序列长度 = T×(m+n+l) = 26×610 = 15860。
Video Decoder(2.6B,多任务视频扩散)
- 3D U-Net + 因子化空间/时序注意力(沿用 Video Diffusion Models)。训练时以 image token 为条件;推理时以 world model 预测出的 token 为条件。
- 单模型联合做 4 类任务(等概率采样):image generation、video generation、autoregressive decoding(前向+后向)、video interpolation——通过 mask 不同帧/条件 token 来定义任务,多任务训练互相增益。
- 用 v-parameterization 噪声预测(避免颜色漂移、保长时一致性),实际用 L1/L2 加权平均损失。条件 dropout p = 0.15(随机 mask 条件 token,提升泛化与时序一致)。图像任务时关闭时序层。
数据
- 训练集:4700 小时 @ 25Hz 的自有驾驶数据,采集自 英国伦敦,2019–2023,约 420M 张唯一图像。
- 主动特征平衡采样:按特征的(分箱、预计算)经验分布的倒数加权采样,取所有平衡特征的联合概率,随机决定纳入/丢弃;平衡强度由把采样权重取指数 e 控制(e=0 = 经验分布不平衡,e=1 = 完全均衡),全部特征用 e = 0.5 折中。
- tokenizer 平衡维度:(纬度, 经度, weather category)——保证地理与天气多样。
- world model + 扩散解码器平衡维度:(纬度, 经度, weather, steering behavior, speed behavior)——额外把转向/速度行为纳入,保证不同动力学被充分建模。
- 验证集:400 小时,取自训练集之外的 run。进一步按 geofence 拆分:严格 geofence(训练从未见过的路)+ 主采集路线周边 geofence(训练见过的路),用于同时监控泛化与过拟合。
- weather category 含 Clear / Cloudy / Rain / Snow / Fog / Night / Indoor(论文 Fig. 5)。
训练方法
三个组件分开训练,硬件均为 A100 80GB,分布式统一用 DeepSpeed ZeRO-2 + activation checkpointing。
| 组件 | 参数 | 目标/数据 | 优化器与调度 | 硬件 · 时长 |
|---|---|---|---|---|
| Image Tokenizer | 0.3B | 288×512 图, D=16, K=8192 | AdamW, lr 1e-4→1e-5, wd 0.01, β(0.5,0.9); 5k warmup + 10k cosine; bs 160 | 32×A100, 200k steps, 4 天 |
| World Model | 6.5B | T=26 帧 @6.25Hz (4s 视频), seq len 15860 | AdamW, lr 1e-4, wd 0.1, β(0.9,0.95), grad clip 1.0; 2.5k warmup + 97.5k cosine(lr 降 10×); bs 128 | 64×A100, 100k steps, 15 天 |
| Video Decoder | 2.6B | T′=7 帧 288×512 @6.25/12.5/25Hz | AdamW, lr 5e-5→1e-6, wd 0.01, β(0.9,0.99), grad clip 1.0; 2.5k warmup+5k cosine; EMA 0.999; bs 64 | 32×A100, 300k steps, 15 天 |
- World model 条件模式比例:无条件 / action / text = 20% / 40% / 40%。
- 推理采样:argmax 会陷入重复循环(同 LLM 的 degeneration),全分布采样又会采到不可靠长尾把模型带偏(论文 Fig. 6 用 perplexity 曲线论证);最终用 top-k = 50 采样,其 perplexity 分布最接近真实图像 token。长视频超过上下文时用 sliding window。
- 文本条件用 classifier-free guidance:l_final = (1+t)·l_conditioned − t·l_unconditioned(式 3);换成另一条 prompt 即可做 negative prompting。guidance scale 需同时按 token 调度(部分 token 高 guidance 贴 prompt、部分低 guidance 保多样)和按 frame 调度(cosine 衰减,缓解逐帧 guidance 叠加)。
- 解码流程:先解 T′=7 帧 → 每次用 2 帧重叠上下文自回归解下 5 帧 → 6.25Hz 补齐 N 帧 → 时序超分 6.25→12.5→25Hz;用 DDIM 50 步。经验发现从序列末端往回(backward)自回归解码物体更稳、地平线闪烁更少,故整体采用倒序解码。逐帧-整段联合去噪按 p=0.25、w=0.5 加权切换时序层。
Infra(训练 / 推理工程)
- 训练算力:三组件合计约 64×A100(world model)+ 32×A100(tokenizer)+ 32×A100(decoder),world model 与 decoder 各训 15 天。全部 A100 80GB。
- 并行/精度:DeepSpeed ZeRO-2 + activation checkpointing;world model 用 FlashAttention v2 省显存并提速。论文未披露 GPU-hours 总量与训练精度(fp16/bf16)——未披露。
- 推理:论文明确承认自回归生成当前达不到实时(“does not yet run at real-time”),但天然可并行同时生成多个 sample;具体 FPS / control-Hz / 延迟 / 边缘硬件——未披露。
评测 benchmark
GAIA-1 的评测以定性能力展示 + scaling law 定量拟合为主,没有给出与其它驾驶世界模型(如 DriveDreamer/nuScenes FVD 那类)的横向定量表格:
- Scaling law(论文 Fig. 8,核心定量结果):把世界建模当 next-token prediction 后,观察到 LLM 式 scaling law 成立。用参数量从 0.65M 到 650M(即比 GAIA-1 小 10000× 到 10× 的一系列模型)在 held-out geofenced 验证集上测 cross-entropy,拟合幂律 f(x)=c+(x/a)^b;结论是 6.5B GAIA-1 的最终 cross-entropy 可用 < 20× compute 的小模型高精度外推预测。compute 估计沿用 Kaplan:C=6N × 训练 token 数。作者据此判断继续放大 data/compute 仍有大幅提升空间。
- 涌现能力(论文 §7,定性):① 学到高层结构与场景动态(交通灯、让行、道路规则);② 泛化与创造性(生成训练集里没有的物体组合/场景,能外推到驶出路面等 OOD 行为);③ 上下文感知与 3D 几何理解(正确捕捉减速带引起的 pitch/roll 交互);④ 多可能未来(同一 context 采样出让行/不让行、直行/环岛转弯、不同交通密度等多模态未来);⑤ 纯想象生成数分钟稳定长视频(末帧与首帧场景已完全不同);⑥ 其它 agent 对 ego 动作的反应式行为(被迫右转时对向车做规避)。
- 采样策略验证(Fig. 6)、guidance 调度(Fig. 7) 属方法级消融,非跨模型 benchmark。
创新点与影响
- 首个规模化真实驾驶生成式世界模型:把 video+text+action 统一离散化 + next-token 自回归 + 视频扩散解码,两组件都可「复合 scaling」。
- 首次在驾驶世界模型上验证 LLM scaling law,把「世界建模 = 无监督序列建模」这一范式落到真实自动驾驶,指明放大 data/compute 的路线。
- DINO 蒸馏进 VQ token 提升 token 语义、简化世界模型输入空间——后续多个驾驶/通用世界模型沿用「语义化 tokenizer」思路。
- 可控多模态未来生成 + OOD 外推:靠 action/text 条件把 ego 动力学从环境解耦,能生成训练分布外(驶上人行道、强行左右转)的场景,作为「神经仿真器」批量造训练/验证数据(含对抗、边缘 case),服务自动驾驶安全评估。
- 作者自陈局限:① 自回归生成尚未实时(可并行缓解);② 文本来源(在线叙述 + 离线 metadata)本身不完美,需靠 CFG 强对齐;③ 论文只给单一大模型能力展示与 scaling 外推,未做与外部方法的定量对标。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2309.17080
- arXiv PDF:https://arxiv.org/pdf/2309.17080
- 官方博客(发布页 / project):https://wayve.ai/thinking/introducing-gaia1/
- Wayve GAIA 项目页:https://wayve.ai/labs/gaia/
- HuggingFace papers:https://huggingface.co/papers/2309.17080
一手源存档(sources/)
- gaia-1-wayve—blog — Wayve 官方发布博客快照(sources/world-model/2023/gaia-1-wayve—blog.md)
- arXiv 2309.17080 全文 PDF:见上方 arXiv 链接(arXiv 原文 PDF,不入 git)