一句话定位
DriveWorld-VLA 把 VLA 规划器和世界模型绑死在同一个”共享潜空间”里:一个 VLM(InternVL 式 tokenization)融合多视角图像、BEV 特征、历史动作、文本指令后产出的隐藏状态 H_t,同时喂给一个两支路 flow-matching DiT 去噪器(history-conditioned 分支做未来 BEV 想象、action-conditioned 分支做”给定动作→想象其后果”)和一个轻量动作解码器;再用三阶段递进训练——① VLA/WM 联合表征对齐 → ② 动作可控性 flow-matching 微调 → ③ 想象引导的奖励重加权闭环——把”预测动作→想象后果→按想象结果反向修正动作”串成闭环,在 NAVSIMv1 拿到 PDMS 91.3、NAVSIMv2 拿到 EPDMS 86.8、nuScenes 3 秒平均碰撞率 0.16%。
背景与定位
论文把”VLA + 世界模型”的既有整合方式归纳为两类都不够紧密的耦合策略:
- Disentangled Interaction(解耦交互):世界模型只是外部模拟器/数据源(如 ReSim、AD-R1),VLA 与 WM 结构上隔离,无法把物理规律内化进决策链路。
- Feature-Sharing(特征共享):如 Epona、HERMES、DriveVLA-W0,用共享表征做联合预测,但缺少”动作条件化”的因果推理——模型看得到未来,却不能针对不同候选动作分别想象各自的后果,因此仍停留在反应式规划(reactive planning),而非借助反事实想象做前瞻优化。
DriveWorld-VLA 认为要同时做到”表征级共享”与”决策级共享”:用 LLM 隐藏状态同时承载想象与动作预测(Feature-Level Sharing),并用 DiT 对多个候选动作做前瞻 rollout(Action-Conditioned “What-If” Reasoning),使模型能评估”如果这样开会怎样”再回头修正动作。相关基线还包括 LAW(ICLR 2024,隐空间世界模型规划开山之作)、WoTE(BEV 世界模型在线轨迹评估)、AutoVLA、RecogDrive;论文中引用的另一篇同名工作 DriveWorld(CVPR 2024,4D 预训练场景理解)是不同团队的另一项工作,仅共享”DriveWorld”这个名字前缀,方法与本文无关。
论文全文(含 GitHub README)均未披露作者机构隶属;但从引用/依赖关系看存在几条值得记录的关联线索(均为旁证,非论文自陈):GitHub 仓库明确要求”参照 xiaomi-research/recogdrive 仓库下载 InternVL checkpoint”;作者 Xiaoshuai Hao 同时是小米 MiMo-embodied 技术报告的第一作者;作者 Ziying Song / Lin Liu / Caiyan Jia / Hangjun Ye 也共同出现在同一批 2025 年 E2E 驾驶工作(GuideFlow、DIVER、MomAD)的作者列表中,指向一个持续产出端到端驾驶规划论文的稳定研究小组。
模型架构
多模态输入与统一 tokenization:模型接收多视角图像 I_t、文本提示 T_t、历史动作 A_{t-1}、BEV 表征 B_t 四路模态。图像/文本 tokenization 遵循 InternVL(Zhu et al., 2025,即 InternVL3):图像先按 448×448 做自适应切片(adaptive tiling),多 patch 时额外拼接一张 448×448 缩略图提供全局视野,每个 patch 分配 K=256 个 <IMG_CONTEXT> 占位 token;BEV 特征 B_t∈R^{H×W×C} 由 BEVFormer 抽取、展平后投影为 BEV token;历史动作序列化为自然语言后用与 InternVL 相同的文本 tokenizer 编码。
共享潜空间 H_t:四路 token 一起送入 VLM,取最后一层隐藏状态作为共享表征 H_t,同时供”未来想象”和”动作预测”使用。附录进一步给出这条表征的压缩细节:VLM 隐藏维度 D=1536,先线性投影到 d=256,再用 N_L=700 个可学习 latent query 对投影后的序列做 cross-attention,聚合成固定长度的紧凑向量 Z∈R^{B×700×256},作为下游任务实际使用的视觉-语言表征。
两支路 flow-matching 去噪器(DeNoIsEr):
- 分支 1(history-conditioned,Stage1 激活):B’t = CrossAttn(B_t, H_t, H_t);B{t+Δt} = DeNoIsEr¹(H_t, B’t, A{t-1}),只依赖历史观测做未来 BEV 预测,提供稠密监督信号,同时训练 image→BEV tokenizer。
- 分支 2(action-conditioned,即 DiT,Stage2 训练):以 GT 未来动作 A_{t+Δt} 为条件做 flow-matching 去噪,损失 L_FM = ‖DiT(B’t, A{t+Δt}, x_k, k/N) − (B’{t+Δt} − x_0)‖²,x_0∼N(0,I);推理/Stage3 时用 Euler 采样、步数 N=25 生成动作条件化的想象未来 B’{t+Δt}。
分割头 SeG:轻量头,把 B’t、B{t+Δt} 解码为语义 BEV 图 S_t、S_{t+Δt},提供任务级(task-level)监督。
动作解码器 AcT:轻量头,输入 (H_t, B_t, A_{t-1}),输出预测未来动作序列 A’_{t+Δt},以轨迹预测的形式监督。
奖励模型 R(Stage3):对动作条件化想象 B’{t+Δt} 与历史条件化/真实未来 B{t+Δt}、预测动作 A’{t+Δt} 三者联合打分 r̂{t+Δt}=R(B’{t+Δt}, B{t+Δt}, A’{t+Δt});GT 奖励来自把预测轨迹放进仿真器执行并在线评测。奖励加权的动作损失 L’act = r̂·‖A’{t+Δt} − A{t+Δt}‖²,让训练偏向高预测奖励的轨迹。
BEV 编码器:NAVSIM 用 ResNet-34(He et al., 2016);nuScenes 用 Swin-T(Liu et al., 2021)初始化、按 BEV-Planner 方案编码 BEV 特征图。
图像输入拼接:NAVSIM 把左前/前/右前三视角图像按顺序拼接为 256×1024 的合成图;nuScenes 用 6 视角图像,缩放到 640×384。
数据
论文没有独立的大规模预训练语料,“数据”就是三套评测基准本身的训练集(用于模仿学习式监督)+ 测试集(用于评测):
- NAVSIMv1(Dauner et al., 2024):基于 OpenScene 构建,120 小时驾驶数据,2Hz 标注,多相机 + 融合 LiDAR;非反应式(non-reactive)开环仿真协议,核心指标 PDMS。
- NAVSIMv2(Cao et al., 2025):两阶段伪仿真(pseudo-simulation)评测协议,核心指标 EPDMS(在 v1 的 NC/DAC/TTC/EP/C 基础上增加 DDC、TLC、LK、HC、EC 等维度)。
- nuScenes(Caesar et al., 2020):1000 个多模态场景,每段 20 秒、2Hz 标注,6 相机同步 + LiDAR;开环评测,用 L2 与碰撞率(CR)作指标;为公平比较,nuScenes 实验明确禁用了 ego-state 信息。
动作标签直接来自这些数据集的 GT 自车轨迹(模仿学习);论文未披露任何额外数据混合比例、sim-to-real 配比或专门的动作标注流程——世界模型部分完全基于这些真实相机/BEV 数据训练,不涉及仿真数据。
训练方法
三阶段递进训练(Progressive Training),每阶段解锁一项能力:
- Stage1(VLA & WM Joint Training):只激活 history-conditioned 去噪分支,联合训练 VLM、BEV tokenizer、动作解码器;损失 L_{s1}=L_seg+L_act(语义 BEV 分割 + 动作模仿)。目的是让 H_t 成为想象与动作预测的共享特征空间。
- Stage2(Action Controllability Fine-Tuning):复用 Stage1 编码流程把未来真实多视角图像编码为 GT 未来 BEV 潜表征,作为 flow-matching 的目标;只训练 DiT(分支2),损失 L_{s2}=L_FM,纯特征级监督(区别于 WoTE/LAW 用下游任务信号做监督)。
- Stage3(Future-Guided Evaluation & Refinement):VLM 与去噪器(DeNoIsEr)冻结,只训练奖励模型 R 与动作头;先预测动作、经分支1生成想象,再用预测动作条件化分支2(Euler 采样 N=25 步)生成想象未来,奖励模型对想象-真实一致性打分,反过来重加权动作模仿损失;损失 L_{s3}=L’_act+L_seg+L_rew(两分支融合的 BEV 潜表征喂给分割解码器做监督)。
优化器与超参:NAVSIM 用 AdamW,初始学习率 1e-4,batch size 16;nuScenes 用 AdamW,初始学习率 7e-5,batch size 1;两者均每阶段训练 20/24 个 epoch(NAVSIM 20 epoch/stage,nuScenes 24 epoch/stage)。
消融验证了递进训练的必要性:把 Stage2+3 合并同时训练(“Non-progressive”,为公平比较训练时长翻倍)PDMS 掉到 83.6,比递进策略的 91.3 低 7.7 分,说明模型必须先在 Stage1 里从 GT 动作学好、强化潜特征空间,才能在动作预测阶段获益。特征级监督(去噪损失)相对纯任务级监督(仅 L_seg+L_act)贡献 +3.4 PDMS(87.9→91.3,消融时在推理阶段的潜变量里注入 N(0,5) 噪声以削弱特征级监督的约束效果,验证其贡献)。VLM 策略消融:完全冻结+无预训练 87.2、冻结+RecogDrive 式预训练(3 epoch SFT)87.6、不冻结+预训练最优 88.3——VLM 参数必须在 Stage1 中参与优化,才能准确建模共享空间特征。
Infra(训练 / 推理工程)
- 训练算力:NAVSIM 与 nuScenes 均在 8× NVIDIA H20 GPU 上训练。NAVSIM 每阶段 20 epoch、三阶段总训练时长约 120 小时(论文 §4.1);nuScenes 每阶段 24 epoch、三阶段总训练时长约 93 小时(论文 §4.1)。GitHub README 的结果表另给出一组数字——“Training Time: 24 hrs / GPU Memory: 80GB”(针对已发布的 NAVSIM checkpoint)——与论文正文的 ~120 小时总训练时长存在明显出入,两者出处不同(论文正文 vs. 仓库结果表),推测 README 的 24 小时可能只对应某一阶段或不同的统计口径,此处两个数字都如实记录,不做调和。
- 并行策略 / 训练精度:论文和 GitHub 均未披露具体并行方案(数据/模型并行)与训练精度(fp16/bf16/fp32)。
- 推理:Stage3 动作条件化想象使用 Euler flow-matching 采样,N=25 步;论文和仓库均未披露推理端到端延迟、control-Hz 或 FPS 数字。
评测 benchmark
NAVSIMv1(闭环,PDMS,Table 1):DriveWorld-VLA PDMS 91.3(NC 99.1、DAC 98.2、TTC 96.1、C 100.0、EP 85.9),优于 DriveVLA-W0 90.2、RecogDrive 89.6、AutoVLA 89.1、WoTE 88.3、DiffusionDrive 88.1、Hydra-MDP 86.5、Epona 86.2、LAW 84.6、PARA-Drive/TransFuser 84.0、DrivingGPT 82.4;人类水平 94.8。
NAVSIMv2(EPDMS,Table 2):DriveWorld-VLA EPDMS 86.8,优于 DriveVLA-W0 86.1、DiffusionDrive 84.5、ARTEMIS/Drivesuprim 83.1、HydraMDP++ 81.4、TransFuser 76.7;子指标中 LK=97.0 为所有方法中最高,EC=78.6 明显高于 DriveVLA-W0 的 58.9,DDC=99.6、TLC=99.8 同样领先。
nuScenes(开环,L2/CR,Table 3):DriveWorld-VLA 平均 L2=0.61m、CR=0.16%(@1s/2s/3s 分别 L2: 0.28/0.58/0.99,CR: 0.00/0.10/0.38)。对比 HERMES-p(L2 0.36 更优,但 CR 0.32 更差)、FSDrive(L2 0.53,CR 0.17,是 CR 上最接近的对手)、Epona(L2 1.25,CR 0.36)、LAW*(复现版,L2 0.65,CR 0.34)、UniAD(L2 1.03,CR 0.31)、VAD(L2 0.72,CR 0.22)——DriveWorld-VLA 在碰撞率上取得所列方法中最低值,但 L2 轨迹误差不是最优(HERMES-p、FSDrive 均更低)。
消融(Table 4-7):训练阶段消融(Stage1 only 87.6 → +Stage2 89.5 → +Stage3 91.3,逐阶段 +1.9/+1.8 PDMS);训练策略消融(Progressive 91.3 vs Non-progressive 83.6,−7.7);VLM 策略消融(不冻结+预训练 88.3 最优);监督方式消融(任务+特征级 91.3 vs 仅任务级 87.9,+3.4)。所有数值均来自论文自报,未见第三方复现(LAW* 一项标注为”用官方 checkpoint 复现”)。
创新点与影响
- 三点核心贡献:① Feature-Level Sharing——用 LLM 隐藏状态同时承载想象与动作预测的共享潜空间,把物理规律内化进核心推理引擎;② Action-Conditioned “What-If” Reasoning——用 DiT 对多个候选动作做前瞻 rollout,把规划从反应式推向前瞻优化;③ 三阶段递进训练稳定联合优化。
- 作者自陈的局限:Stage3(奖励驱动的想象-动作闭环)对 nuScenes 开环短时规划几乎没有帮助甚至轻微变差(2s/3s CR 变化仅 −0.01/−0.02)。作者给出两个假设——开环规划任务未必总能从生成式监督中获益;奖励模型对闭环规划的影响大于开环规划——并从工程角度指出两套 benchmark 使用了不同的基线架构和奖励模型,这一差异未被彻底厘清,是论文明确承认的局限。
- 开源现状:GitHub 仓库(liulin815/DriveWorld-VLA)已开源 NAVSIM 训练/评测代码与 checkpoint(2026-02-01 发布,抓取时 107 星/12 fork);nuScenes 训练/评测框架在仓库路线图中标注为尚未发布;BibTeX 引用条目本身仍是占位符(“update soon”),与其 2026 年 2 月刚挂出的新预印本身份一致。
原始链接
- arXiv abs:https://arxiv.org/abs/2602.06521
- arXiv PDF:https://arxiv.org/pdf/2602.06521
- HuggingFace Papers:https://huggingface.co/papers/2602.06521
- GitHub:https://github.com/liulin815/DriveWorld-VLA
一手源存档(sources/)
- driveworld-vla—hf-card — HuggingFace Papers 页面快照(fetched 2026-07-16)
- driveworld-vla—github-readme — GitHub README 快照(fetched 2026-07-16)
- arXiv 2602.06521 全文(arXiv 原文 HTML,不入 git,见上方链接)