一句话定位
DrivingWorld 是一个纯 GPT 风格自回归的驾驶世界模型:通过时序感知 tokenizer + 时空解耦的”先跨帧、再帧内”两级注意力 + 随机 token dropout / 注意力配平,把自回归视频生成的可用时长从此前最长 15 秒(vista-driving-world-model)推到 40 秒以上(10 Hz、512×1024),同时联合预测车辆自身轨迹(ego trajectory)。
背景与定位
自回归(AR)范式在语言(GPT 系列)上的成功,催生了把同一思路搬到视觉世界模型的尝试,gaia-1-wayve(GAIA-1)是这条路线的开创者:把 4D 时空关联的帧序列拉平成 1D token 序列做 next-token 预测。但论文指出经典 GPT 结构专为处理 1D 语境(文本)设计,缺乏对视频空间-时间动态的内在建模能力,导致 GAIA-1 生成质量偏低、伪影明显;同时 1D 序列长度随条件帧数线性增长,计算/显存开销随之上升。
同期的另一条路线是把预训练视频扩散模型(Stable Video Diffusion)改造成驾驶世界模型,代表是 vista-driving-world-model(Vista)与更早的 drive-wm-driving-into-the-future(Drive-WM)、drivedreamer(DriveDreamer)、wovogen(WoVoGen);这类扩散路线可控性和保真度不错,但作者认为扩散过程的随机性使其难以做到”精确控制”。DrivingWorld 的定位是在保持纯 AR 范式(继承 GAIA-1 的可扩展性优势)的前提下,通过时空解耦架构解决 GAIA-1 的画质与效率短板,同时超越扩散路线在长时长生成上的表现(40s+ vs Vista 的 15s)。其 VQ tokenizer 直接基于 llamagen-autoregressive-image-generation(LlamaGen)开源的 taming-transformers-vqgan(VQGAN)实现改造。对比对象还包括 genad-generalized-predictive-model(GenAD)与 adriver-i(ADriver-I)等驾驶世界模型基线。
模型架构
- 总体设定:状态定义为
[θ_t, (x_t, y_t), I_t](车辆朝向、位置、前视图像),以 15 帧历史状态为条件,自回归逐步预测未来状态,10 Hz 下可外推 640 帧(64 秒,论文摘要与结论口径为”40 秒以上”,长时演示中最长达 600+ 帧)。 - 时序感知 VQ tokenizer(Temporal-aware Vector Quantized Tokenizer):在 VQGAN 量化前后各插入一层沿时间维的自注意力
ℋ(·),使离散码本索引对时间连贯,缓解单帧 VQ 常见的逐帧闪烁问题;基于 LlamaGen 开源 VQGAN 实现微调而成。70M 参数,码本大小 16,384,图像 256×512 编码为 512 个图像 token。 - 车辆位姿 tokenizer:以自车为中心的相对坐标系,对相邻时间步的相对朝向
Δθ_t与相对位移(Δx_t, Δy_t)做离散化——朝向离散为 α 个类别,X/Y 平面离散为 β×γ 个格子(具体 α/β/γ 取值未在正文披露),位姿占用 2 个 token(朝向 1 + 位置联合 1),故每个状态共 512+2=514 个 token。 - 世界模型(Temporal-multimodal Fusion Module + Internal-state Autoregressive Module,1B 参数):不采用把全部历史/全部模态拉平成单一 1D 序列的”经典 GPT next-token”方式(作者用 GPT-2 结构做了对照实验,见评测),而是拆成两级:
- 时序层
ℱ_a:因果注意力,但只在”同一相对位置的跨帧 token”之间做注意力(如所有帧的第 i 个 token互相看),充分利用时间信息又不必展开成过长序列; - 多模态层
ℱ_b:同一帧内所有 token(位姿 token + 图像 token)之间做双向注意力,融合帧内跨模态信息; - 时序层与多模态层交替堆叠 N 层(N 值未披露)构成 Fusion Module;
- 内部状态自回归模块
ℱ_c:在 Fusion Module 输出的基础上,对下一状态的 514 个 token 再做一次帧内因果自回归(类似 LlamaGen 的图像内自回归),逐 token 生成位姿与图像内容,而非一次性并行预测整帧(消融见下)。
- 时序层
- 长程可控生成策略:
- Token Dropout(随机掩码策略 RMS):训练时以 30% 概率对整段条件图像序列施加扰动,扰动内每个 token 有 50% 概率被替换为随机 token,模拟推理时条件帧不完美的情形,缓解自回归长程 drift;
- 平衡注意力(Balanced Attention):512 个图像 token vs 仅 2 个位姿 token 的数量失衡会让模型”看不见”位姿信号,因此在注意力 map(softmax 前)人为给朝向 token 和位置 token 分别加 +0.4 / +0.2 的常数权重;
- 另引入 QK-norm 与 **2D 旋转位置编码(RoPE)**稳定训练。
- 解码:位姿 token 通过离散化公式的逆运算还原为
Δθ̂/Δx̂/Δŷ;图像 token 通过码本查表取回特征,再经量化后插入的时序自注意力增强时间一致性后解码为图像。
数据
- Tokenizer 训练数据:两阶段——阶段一用 OpenImages + COCO,共 600 万张单帧图像(学习空间信息);阶段二用 YouTubeDV + NuPlan,共 900 万段 15 帧视频(学习时间信息)。
- 世界模型训练数据:合计 3,456 小时 人类驾驶数据——
- 120 小时来自公开 NuPlan 数据集;
- 3,336 小时私有数据,采集自中国四座城市:北京(约 1,668 小时,占约一半)、南京、合肥、天津(三城合计约 1,668 小时,均分约各 556 小时);约 2/3 场景为城市道路,1/3 为高速/乡村道路;全部在白天、晴天条件下采集;原始分辨率 2160×3840,降采样+中心裁剪到 512×1024;原始采集 6 个视角(前视、左前、左后、后视、右前、右后),当前版本仅用前视;每帧记录世界坐标系下车辆中心位置
(tx,ty,tz)与四元数姿态(qx,qy,qz,qw),据此推算相对位姿;标注由离线感知系统自动生成(非人工标注)。
- 评测数据:NuPlan 测试集 200 段视频 + NuScenes 测试集 150 段视频(跟随 Vista 的评测协议,NuScenes 对本模型是 zero-shot)。
- 消融数据:因训练成本高,消融实验单独用 NuPlan 12 小时子集训练、20 段视频测试。
- 横向数据规模对比(论文 Table 1,Model Setups):DriveSim 7h/5Hz/80×160;DriveGAN 160h/8Hz/256×256;DriveDreamer 5h/12Hz/128×192;Drive-WM 5h/2Hz/192×384;WoVoGen 5h/2Hz/256×448;ADriver-I 300h/2Hz/256×512;GenAD 2000h/2Hz/256×448;gaia-1-wayve 4700h/25Hz/288×512;vista-driving-world-model 1740h/10Hz/576×1024;DrivingWorld(本文)120h+3336h/10Hz/512×1024(512×1024 为经 SVD 精修后的最终输出分辨率,世界模型本体在 256×512 生成,见训练方法)。
训练方法
- 目标:next-state prediction(帧间)+ next-token prediction(帧内)的混合策略,用交叉熵损失
L_WM = -Σ_t Σ_j log P(r̂_t^j | r_<t, r_t^1,...,r_t^{j-1})联合监督位姿与图像 token;训练中同时对帧级和内部状态级都做 teacher-forcing。 - Tokenizer 训练:charbonnier loss + LPIPS 感知损失 + VQ codebook loss 加权和(权重 λ1=3, λ2=1, λ3=1);AdamW,无 weight decay,β=(0.9, 0.95),固定学习率 1e-5;两阶段各 500K 步(合计 1,000K 步),batch size 128。
- 世界模型训练:条件帧数固定为 15 帧预测第 16 帧;AdamW,无 weight decay,β=(0.9, 0.95),固定学习率 1e-4;450K 迭代,batch size 64。
- SVD 精修(后处理,非主模型):受显存限制,世界模型本身只生成 256×512 分辨率;用现有开源 SVD 权重微调出一个精修模型,把序列上采样到 512×1024。训练时用 p=15% 比例把图像序列中的 token 替换为 VQVAE 处理后的版本以模拟世界模型的生成误差;AdamW,无 weight decay,β=(0.9,0.999),1000 步 warmup 到 lr=1e-5;序列长度 25 帧;单日内在 8×A100 上收敛。
Infra(训练 / 推理工程)
- Tokenizer:32×NVIDIA 4090,batch 128,两阶段各 500K 步,总耗时约 7 天。
- 世界模型:64×NVIDIA A100,batch 64,450K 迭代,总耗时约 12 天。
- 消融实验:32×NVIDIA A100,batch 32,每个模型从零训练 50K 迭代,约需 32 GPU 小时。
- 精度/并行:论文未披露具体的混合精度设置、张量/流水并行方案(未披露)。
- 显存对比(Table 6,相对 GPT-2 基线,条件帧数 5→15):本模型显存占用从 5 帧的 21.927 平稳增长到 15 帧的 45.873(单位未标注,推测 GB),而 vanilla GPT-2 结构从 31.555 增至 15 帧时 OOM(77.559 对应 10 帧),验证了时空解耦架构避免了显存随序列长度二次增长。
- 推理端:论文未给出具体 FPS / 端到端时延 / 部署硬件数字(未披露);生成帧率对应训练帧率 10 Hz。
评测 benchmark
NuScenes 定量对比(Table 2,↓越好,权威指标为 FID/FVD,及最长可生成时长/帧数):
| 方法 | FID↓ | FVD↓ | 最长时长/帧数 |
|---|---|---|---|
| DriveGAN | 73.4 | 502.3 | N/A |
| DriveDreamer | 52.6 | 452.0 | 4s / 48 |
| WoVoGen | 27.6 | 417.7 | 2.5s / 5 |
| Drive-WM | 15.8 | 122.7 | 8s / 16 |
| GenAD (OpenDV) | 15.4 | 184.0 | 4s / 8 |
| Vista | 6.9 | 89.4 | 15s / 150 |
| DrivingWorld (w/o P) | 16.4 | 174.4 | 30s / 300 |
| DrivingWorld | 7.4 | 90.9 | 40s / 400 |
注:论文未明确定义 “w/o P” 中 P 的具体含义(正文未展开),仅按原表数据呈现;NuScenes 对 DrivingWorld 属 zero-shot(未在 NuScenes 上训练)。作者强调多数基线依赖已在数十亿图像上预训练的 Stable Video Diffusion,而 DrivingWorld 的 GPT 式框架是从零训练,同时生成时长显著更长。
VQVAE / 图像 tokenizer 对比(Table 3,NuPlan 数据集):
| 方法 | FVD₁₂↓ | FID↓ | PSNR↑ | LPIPS↓ |
|---|---|---|---|---|
| VAR | 164.66 | 11.75 | 22.35 | 0.2018 |
| VQGAN | 156.58 | 8.46 | 21.52 | 0.2602 |
| LlamaGen | 57.78 | 5.99 | 22.31 | 0.2054 |
| LlamaGen(微调后) | 20.33 | 5.19 | 22.71 | 0.1909 |
| 时序感知(本文) | 14.66 | 4.29 | 23.82 | 0.1828 |
RMS(随机掩码)消融(NuPlan 12h 子集,Table 4):
| FVD₁₀↓ | FVD₂₅↓ | FVD₄₀↓ | |
|---|---|---|---|
| w/o Masking | 449.40 | 595.49 | 662.60 |
| Ours | 445.22 | 574.57 | 637.60 |
去掉掩码策略后,长时长(FVD₄₀)指标恶化幅度达 4%~32%,说明该策略对长程鲁棒性影响随时长增大而放大。
vs 经典 GPT-2 结构(Table 5,同数据/同规模对照):GPT-2 结构 FVD₁₀/₂₅/₄₀ = 2976.97 / 3505.22 / 4017.15,本文结构为 445.22 / 574.57 / 637.60,验证时空解耦设计对生成质量的显著提升(非仅效率)。
附录消融(32×A100,50K 迭代,NuPlan/NuScenes 测试集):
- 条件帧数(Table 7):5/10/15/25 帧条件下 FVD 单调下降,例如 NuPlan FVD₄₀ 从 5 帧的 679.05 降到 25 帧的 580.10,验证更长时序上下文带来更好长程一致性;
- 内部状态自回归模块(Table 8):去掉该模块(“w/o AR”,同参数量)后 FVD 指标全面恶化,NuScenes/NuPlan 上 FVD₁₀→FVD₄₀ 增幅达 18%~71%;
- 规模定律(Table 9):10M → 100M → 1B 参数,FVD 持续下降(如 NuPlan FVD₄₀ 从 1262.31 → 915.01 → 637.60),长程生成的收益随规模增大更明显。
创新点与影响
- 贡献:(1) 提出时序感知 VQ tokenizer,通过量化前后插入时间维自注意力解决单帧 VQ 导致的时序不连贯问题;(2) 提出时空解耦的两级注意力(跨帧因果层 + 帧内双向层 + 帧内自回归层)替代”1D 拉平后单一因果注意力”的经典 GPT 结构,同时提升生成质量与效率(显存不再随条件帧数二次增长);(3) 提出 RMS 随机掩码 + 平衡注意力两个训练期技巧,缓解自回归长程 drift 并强化对稀疏位姿 token 的关注,使模型可控生成超过 40 秒视频(约为此前 SOTA Vista 15 秒的 2 倍以上)并联合预测 ego 轨迹。
- 改变了什么:证明纯 GPT 式自回归路线(相对扩散路线)在长时长驾驶视频生成上具备可行性和优势,为 GAIA-1 开创的 AR 驾驶世界模型路线提供了具体的架构改进方案;代码与推理脚本开源(训练代码未开源,见 TODO)。
- 作者自陈局限 / 未来工作:目前仅使用前视单目相机(数据集实际采集了 6 视角但当前版本未用);未来计划融合更多模态信息并接入多视角输入,以提升动作可控性与视频生成精度,进一步增强模型对复杂驾驶场景的理解能力。生成分辨率受限于显存(世界模型本身只在 256×512 生成,512×1024 需额外的 SVD 精修模型补偿,说明端到端高分辨率长时生成仍有工程代价)。
原始链接
- arXiv 论文:https://arxiv.org/abs/2412.19505
- PDF:https://arxiv.org/pdf/2412.19505
- GitHub(官方实现,含推理代码,训练代码未发布):https://github.com/YvanYin/DrivingWorld
- HuggingFace 论文页:https://huggingface.co/papers/2412.19505
- HuggingFace 模型权重(VQVAE + World Model checkpoint):https://huggingface.co/huxiaotaostasy/DrivingWorld
- 项目主页:https://huxiaotaostasy.github.io/DrivingWorld/index.html
- YouTube 演示视频:https://youtu.be/5QJRAxnjX0k
一手源存档(sources/)
- drivingworld-gpt—github-readme — GitHub README 快照(https://github.com/YvanYin/DrivingWorld,fetched 2026-07-16)
- drivingworld-gpt—project-page — 项目主页快照(https://huxiaotaostasy.github.io/DrivingWorld/index.html,fetched 2026-07-16)
- arXiv 全文(HTML)见上方 arXiv 链接(arXiv 原文,不入 git)