一句话定位
WorldDrive(University of Macau + Afari Intelligent Drive,2026年3月)用「轨迹感知世界模型 → 表征继承 → 未来感知奖励器」三段式把驾驶场景生成和轨迹规划缝合成一个共享表征的框架:先训一个以轨迹词表为条件的视频扩散世界模型(TA-DWM),把它学到的视觉编码器和运动编码器原封不动地迁给下游多模态规划器做初始化,再用一个从冻结世界模型蒸馏未来隐特征的轻量奖励器(FAR)在 53ms 内对候选轨迹重排序;单目视觉方案在 NAVSIM navtest 上 PDMS 88.1(用 navtrain 全量微调后 89.0),推理延迟仅为同类世界模型基线 PWM 的约 1/16-1/10。
背景与定位
端到端自动驾驶把驾驶世界模型(Driving World Model, DWM)接入规划器目前分两条路线,各有系统性缺陷:一条是用高保真模型显式生成未来场景喂给下游规划器(如 Drive-WM),计算开销高昂;另一条是完全在隐空间里跑的 latent world model(如 World4Drive、LAW),效率更高但放弃了可解释的场景仿真、也失去安全关键决策所需的显式视觉校验。论文指出两条路线共享同一个病根——表征错位与任务割裂:场景仿真器为感知重建而优化、强调视觉表征;规划器为动作回归单独训练、编码运动表征;二者没有共享一致的表征,导致规划器无法充分利用世界模型学到的动力学和运动先验。WorldDrive 的解法是”表征统一”:能生成未来(场景生成)的隐特征,应该就是用来决定未来(规划)的隐特征——把 Epona、Policy World Model (PWM)、DriveVLA-W0 这类”世界模型耦合规划”路线进一步推进为显式的跨阶段权重迁移(representation inheritance),而非仅共享训练目标或隐空间。轨迹条件化的思路上承接 Vista(运动损失)和 DriVerse(轨迹文本提示 + 运动对齐模块),但 WorldDrive 用结构化的”锚点+残差”轨迹词表编码替代了纯文本/连续轨迹条件。
模型架构
WorldDrive 分两个阶段共用一套表征,核心由三个模块组成:
- Trajectory-aware Driving World Model(TA-DWM):backbone 是从 CogVideoX 预训练权重初始化的 3D Causal VAE + Diffusion Transformer(CogVideoX)。VAE 编码历史观测 x∈R^(T×3×H×W) 得到时空隐特征,再经一个轻量可训练的**视觉适配器(Visual Adapter)**对齐到驾驶域,得到 f=E_vis(x)。
- Multi-modal Trajectory Encoder(轨迹条件):先用 K-means 聚类驾驶日志构建轨迹词表 V∈R^(N×F×3),锚点数 N=256(沿用 WoTE 的设定),每条专家轨迹 Y 检索 top-K 最近锚点 V_K,再用锚点编码器 E_a 和偏移编码器 E_o 融合锚点嵌入与残差得到运动嵌入 c = E_a(V_K) + E_o(Y − V_K),作为 TA-DiT 的条件(注入方式类比 CogVideoX 原框架里文本 prompt 的条件注入)。
- TA-DiT(Trajectory-aware Diffusion Transformer):标准隐扩散训练,噪声预测网络 ε_θ(z_t; f, t, c) 同时以历史视觉隐 f、时间步 t、运动嵌入 c 为条件,生成的未来场景既视觉一致又运动合理。
- 表征继承(Representation Inheritance):Phase 2 把 TA-DWM 的视觉编码器和轨迹编码器直接冻结迁移到下游 Multi-modal Trajectory Planner。规划器额外用一个轻量 MLP 编码 ego 状态(速度、加速度、驾驶指令)得到 e∈R^(1×C);把完整预定义锚点嵌入 Q_a=E_a(V) 当 query,拼接冻结视觉隐 f 与 ego 嵌入 e 做 key/value,经规划 Transformer 解码器 D_plan(Q_a, [f,e], [f,e]) 得到增强轨迹特征 Q_p。沿用 WoTE 的打分范式:一个模仿奖励模型 D_im、一个仿真奖励模型 D_sim 打分全部锚点,一个回归网络 D_reg 预测细粒度偏移,输出 top-K 轨迹候选(经消融确定 K=5 为默认)。
- Future-aware Rewarder(FAR):为避免对每个候选都跑一次完整扩散去噪,FAR 引入可学习的 Future Scene Queries Q_s∈R^(M×C) 作为信息瓶颈,用 Future-scene Decoder 交叉注意历史视觉隐 f 与轨迹候选嵌入 c^k 蒸馏出未来隐 ẑ^k = D_scene(Q_s, [f,c^k], [f,c^k]);再用 Future-aware Decoder 以轨迹嵌入查询蒸馏特征 h_f^k = D_future(c^k, ẑ^k, ẑ^k),最后 MLP 映射为标量奖励 r_k,选最高奖励的轨迹作为最终输出——推理时完全绕开扩散采样。
数据
- TA-DWM 预训练:nuPlan(训练集)+ nuScenes 的驾驶视频,两阶段分辨率均为 256×512,输入 8 帧历史预测 17 帧未来,视频采样率 10Hz。
- 规划器/FAR 训练:NAVSIM navtrain split;representation 微调阶段用 512×1024 更高分辨率,输入 **4 帧历史(2s)**预测 9 帧未来(4.5s 时长),为满足 3D Causal VAE 的空间约束做了 padding。
- 动作标注:轨迹词表由 K-means 聚类大规模驾驶日志构建(256 个锚点),专家轨迹相对锚点的残差作为细粒度动作标注,无需额外人工标注。
- FAR 偏好对构造:对每个场景先用规划器推理生成 top-16 候选轨迹,取规划器打分最高的 1 条为正样本,仿真得分最低的 3 条为难负样本,另随机采样 3 条增加多样性,组成偏好对用 Bradley–Terry loss 优化。
- 未使用仿真数据混训,也未做额外的多相机/多传感器融合;Table 1/2/3 中 WorldDrive 均标注为 **SV(单目相机)**方案,与依赖多视角(MV)或多视角+激光雷达(MV&L)的基线区分。
训练方法
- 两阶段解耦训练curriculum:Stage 1 只训 TA-DWM,标准隐扩散目标 L_world = E_{z₀,t,ε}[‖ε − ε_θ(z_t; f,t,c)‖²];Stage 2 冻结世界模型只训规划器,L_plan 由交叉熵模仿损失 + 二元交叉熵仿真损失 + L1 偏移回归损失(针对正样本锚点)加权组合,权重 ω₁=0.1(模仿)、ω₂=ω₃=0.5(NC/DAC 仿真子项)、ω₄=1(TTC/Comf/EP 加权和项)。
- TA-DWM 预训练:第一阶段在 nuPlan 上训 200,000 迭代(256×512、10Hz),第二阶段在 nuScenes 上继续微调 100k 迭代(同分辨率同帧率),全程恒定学习率 1×10⁻⁴。
- 表征微调 + 规划器训练:先在 NAVSIM 上以 512×1024、学习率 5×10⁻⁵ 继续微调 TA-DWM 视觉/轨迹编码器 100k 迭代(沿用 Epona 的设置);随后冻结这些编码器,Multi-modal Planner 用余弦学习率调度、峰值学习率 6×10⁻⁴ 在 NAVSIM navtrain 上训 50 epoch。
- FAR 训练:冻结规划器,FAR 单独训 10 epoch,学习率 3×10⁻⁴,用 PDMS 作为偏好监督的 oracle;损失为特征蒸馏损失 L_align(预测未来隐 ẑ^k 与冻结 TA-DWM 目标 z^k 的 L2 距离,stop-gradient)与 Bradley–Terry 偏好排序损失 L_reward 的组合。
Infra(训练 / 推理工程)
- TA-DWM 预训练:16× NVIDIA A100,batch size 32。
- 规划器训练:8× NVIDIA 3090,batch size 256,50 epoch。
- 表征微调阶段 / FAR 训练阶段的具体 GPU 数量与并行策略:未披露;精度(FP16/BF16 等)也未披露。
- 推理延迟(batch size 1,FAR 候选数 K=5,Table 9):Encoders 17.9ms + Planner 18.9ms + FAR 16.2ms = 总计 53ms——推理阶段完全不做显式未来场景生成,只在需要可视化时才选择性调用 TA-DiT。
- 对比同类世界模型基线 PWM 的延迟:PWM†(弱配置)570ms,PWM(强配置)850ms,均比 WorldDrive 慢一个数量级。
评测 benchmark
NAVSIM navtest(Table 1,PDMS 及五个子指标 NC/DAC/TTC/Comf/EP):
| 方法 | 传感器 | WM | NC | DAC | TTC | Comf | EP | PDMS |
|---|---|---|---|---|---|---|---|---|
| TransFuser | MV&L | × | 97.7 | 92.8 | 92.8 | 100.0 | 79.2 | 84.0 |
| DiffusionDrive | MV&L | × | 98.2 | 96.2 | 94.7 | 100.0 | 82.2 | 88.1 |
| WoTE | MV&L | ✓ | 98.5 | 96.8 | 94.9 | 99.9 | 81.9 | 88.3 |
| World4Drive | MV | ✓ | 97.4 | 94.3 | 92.8 | 100.0 | 79.9 | 85.1 |
| Epona | SV | ✓ | 97.9 | 95.1 | 93.8 | 99.9 | 80.4 | 86.2 |
| ImagiDrive | SV | ✓ | 98.6 | 96.2 | 94.5 | 100.0 | 80.5 | 87.4 |
| WorldDrive | SV | ✓ | 98.4 | 96.2 | 95.1 | 100.0 | 81.9 | 88.1 |
| PWM†(Policy World Model) | SV | ✓ | 98.6 | 95.9 | 95.4 | 100.0 | 81.8 | 88.1 |
| DriveVLA-W0† | SV | ✓ | 98.7 | 96.2 | 95.5 | 100.0 | 82.2 | 88.4 |
| WorldDrive†(navtrain 全量) | SV | ✓ | 98.4 | 96.8 | 95.2 | 100.0 | 83.3 | 89.0 |
| DriveVLA-W0‡(best-of-N) | SV | ✓ | 99.3 | 97.4 | 97.0 | 100.0 | 88.3 | 93.0 |
| WorldDrive‡(best-of-N,oracle 上界) | SV | ✓ | 99.3 | 98.8 | 97.9 | 100.0 | 88.3 | 93.6 |
单目 vision-only 方案中 WorldDrive 88.1 超过 Epona(86.2)、ImagiDrive(87.4);navtrain 全量微调后 89.0 超过世界模型强基线 PWM(88.1)和 DriveVLA-W0(88.4);best-of-N 上界仅用于验证多模态候选质量、不用于实际推理。
NAVSIM-v2 navhard split(Table 2,EPDMS 及 reactive traffic/伪闭环仿真下的子指标):LTF EPDMS 23.1,DiffusionDrive EPDMS 27.5,WorldDrive(单目)EPDMS 34.9,在多数安全/合规子指标上领先多视角基线,但部分舒适性(Comf 相关)指标仍有挑战。
nuScenes 开环规划(Table 3,L2 误差/碰撞率,3s 及平均):
| 方法 | 传感器 | L2@3s | L2@avg | CR@3s(%) | CR@avg(%) |
|---|---|---|---|---|---|
| World4Drive | V | 0.81 | 0.50 | 0.33 | 0.16 |
| Epona | SV | 1.98 | 1.25 | 0.85 | 0.36 |
| WorldDrive | SV | 0.68 | 0.42 | 0.38 | 0.16 |
场景生成质量(Table 7,nuScenes 验证集,FID/FVD/分辨率):DriveDreamer 128×192/FID 52.6/FVD 452.0;Vista 480×832/FID 18.2/FVD 158.0;Driverse 480×832/FID 20.1/FVD 143.5;WorldDrive 256×512/FID 12.8/FVD 131.7——在不依赖 Vista 式海量数据或 DriVerse 式额外运动对齐模块的前提下取得最优 FID。
消融:(1) 预训练策略(Table 4):无任何预训练 PDMS 仅 31.4;仅 VAE 预训练跃升到 84.9;加入 TA-DWM 视觉表征继承 +0.9 到 85.8;再加运动表征继承 +1.1 到 86.9。(2) FAR 输入消融(Table 5):无 FAR 86.9 → 仅轨迹特征 87.0(安全指标略降)→ 轨迹+未来蒸馏特征(完整 FAR)88.1。(3) FAR 候选数 K(Table 8):K=1 时 86.9,K=3 时 87.9,K=5 时最优 88.1,K=10 时反降到 87.6(候选过多引入低质量轨迹干扰奖励器)。
创新点与影响
- 贡献:把”世界模型学到的表征”与”规划器使用的表征”从此前的松耦合(共享训练目标或隐空间)升级为显式的权重级迁移——用轨迹词表条件化的 TA-DWM 预训练视觉/运动编码器,直接冻结初始化下游规划器;并提出 FAR 把”用世界模型的未来预见性做决策”和”避免显式生成的高延迟”这一对矛盾用蒸馏未来隐特征的方式解开,使规划推理端到端仅需 53ms。
- 改变了什么:证明了”场景生成任务预训练出的表征”可以直接提升规划性能而非仅仅是并行辅助任务(Table 4 的逐步涨点即为证据);同时验证了在不牺牲高保真视频生成能力的前提下,规划性能可以做到与依赖显式生成或更大计算开销的世界模型基线(PWM、DriveVLA-W0)相当甚至更优,且延迟低一个数量级。
- 作者自陈局限:NAVSIM-v2 navhard 上部分舒适性相关子指标(如 EP、HC/EC)仍落后于同类多视角基线,论文承认”进一步提升长时域效率同时保持安全性”仍需努力;论文未讨论多相机/环视扩展,也未披露表征微调与 FAR 训练阶段具体使用的 GPU 数量与精度设置。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2603.14948
- arXiv PDF:https://arxiv.org/pdf/2603.14948
- arXiv HTML 全文:https://arxiv.org/html/2603.14948v1
- GitHub 代码:https://github.com/TabGuigui/WorldDrive
- HuggingFace 模型/检查点仓库:https://huggingface.co/tabguigui/WorldDrive
- HF Papers 聚合页:https://huggingface.co/papers/2603.14948
一手源存档(sources/)
- worlddrive-scene-gen-planning—github-readme — GitHub README 快照(sources/world-model/2026/worlddrive-scene-gen-planning—github-readme.md,fetched 2026-07-16)
- worlddrive-scene-gen-planning—hf-card — HuggingFace 模型卡快照(sources/world-model/2026/worlddrive-scene-gen-planning—hf-card.md,fetched 2026-07-16)
- arXiv 2603.14948 全文 PDF/HTML:见上「原始链接」(arXiv 原文,不入 git)