一句话定位
World4Drive(ICCV 2025)是一个感知标注免费的端到端自动驾驶框架:用视觉基础模型(度量深度模型 + 视觉语言模型)给潜空间世界模型注入空间-语义先验,再让世界模型在潜空间里对多模态驾驶意图分别”想象”未来场景、通过对比预测潜特征与真实潜特征来自监督训练并挑选最合理的规划轨迹。
背景与定位
端到端自动驾驶把感知与规划整合进一个可微网络,但主流方法(UniAD、VAD、SparseDrive、VADv2、Hydra-MDP 等)依赖昂贵的 3D 框/高精地图等感知标注,限制了可扩展性。近期出现两条去标注化路线:VaVAM 用自回归视频生成模型的表征直接产出轨迹;LAW(Enhancing End-to-End Autonomous Driving with Latent World Model, ICLR 2025)提出潜空间世界模型,从原始图像构造单模态潜特征、靠时序自监督学习获得场景表征,从而摆脱感知标注——是 World4Drive 直接对标的前作与 baseline。但 LAW 的单模态潜特征既缺乏物理世界的空间-语义理解,也无法建模驾驶意图的多模态不确定性,导致训练收敛慢、性能欠佳。
World4Drive 的定位:在同一条”去标注化潜空间世界模型”路线上,同时补上(1)来自视觉基础模型的空间-语义先验和(2)多模态驾驶意图建模,用世界模型去生成、评估、挑选多模态轨迹——功能上呼应人类驾驶员”预判不同意图下世界如何演化”的决策过程。与 gaia-1-wayve、gaia-2-wayve、Vista、DriveDreamer 等显式生成未来图像/占据/点云的驾驶世界模型不同,World4Drive 全程在潜空间里做预测和比较,不重建像素级未来观测。
模型架构
两大模块:Driving World Encoding(提取场景表征)+ Intention-aware World Model(预测未来、评分选轨迹)。
Intention Encoder(意图编码):输入随机初始化的 ego query $Q_{ego}$ 与轨迹词表 $\mathcal{V}\in\mathbb{R}^{N\times S\times 2}$(沿用 VADv2 的词表设计),对词表终点做 k-means 聚类得到意图点 $P_I\in\mathbb{R}^{3\times K\times 2}$(3 类指令:左/右/直行,每类 $K$ 个意图);意图点经正弦位置编码得到意图 query $Q_I$,与 $Q_{ego}$ 相加后过自注意力得到多模态规划 query $Q_{plan}$。默认 N=8192,K=6。
Physical World Latent Encoding(物理世界潜编码):
- Context Encoder — 语义理解:用 Grounded-SAM(视觉语言模型)对图像特征产生伪语义标签(2D 框 + 语义 mask),仅保留高置信度标签,用交叉熵损失 $\mathcal{L}_{sem}$ 监督。
- Context Encoder — 3D 空间编码:用**度量深度模型 Metric3D v2(giant 版)**估计多视角深度图,前向投影到 ego 坐标系得到 3D 位置图,再经正弦位置编码 + 可学习 MLP 得到位置嵌入,加到图像特征上得到语义-空间感知的视觉特征 $\hat{F_t}$(区别于 PETR 的后向投影 3D 网格方案)。
- 时序聚合:不同于 LAW 用随机初始化 query 获取潜表征,World4Drive 用交叉注意力把上一帧特征 $\hat{F}_{t-1}$ 的历史信息聚合进当前帧,得到富含时序上下文的世界潜表征 $L_t\in\mathbb{R}^{M\times h\times w\times D}$。
Intention-aware World Model Dreamer(意图感知世界模型):
- 动作编码:$Q_{plan}$ 先交叉注意力聚合场景上下文,MLP 得到 K 条多模态轨迹 $T={T^1,…,T^K}\in\mathbb{R}^{K\times S\times 2}$,再经动作编码器(MLP)得到意图感知动作 token $A\in\mathbb{R}^{K\times D}$(连续嵌入,非离散 token)。
- 未来潜预测:随机初始化可学习 query $Q_{future}$,把动作 token $A$ 与当前世界潜 $L$ 沿通道拼接后,用多层交叉注意力预测 $n$ 步后每个意图对应的未来世界潜 $L_{t+n}={L_{t+n}^1,…,L_{t+n}^K}$。默认时间步长 n=3。
World Model Selector(世界模型选择器):对比每个意图预测的未来潜 $L_{t+n}^k$ 与真实未来潜 $\hat{L}{t+n}$ 的特征距离(MSE),取距离最小的意图 $j$ 作为自监督重建目标($\mathcal{L}{recon}$)与最终规划轨迹 $T^j$;同时训练一个 ScoreNet 分类头 $\mathcal{C}$(softmax 输出 K 个意图的得分 $\mathbb{S}$),用 focal loss 拟合”哪个意图被选中”这一标签($\mathcal{L}_{score}$);推理时直接取得分最高的意图对应轨迹作为最终输出,无需真实未来观测。
训练总损失:$\mathcal{L}=\alpha\mathcal{L}{sem}+\beta\mathcal{L}{recon}+\gamma\mathcal{L}{score}+\eta\mathcal{L}{traj}$,默认 α=0.2, β=0.2, γ=0.5, η=1.0;$\mathcal{L}_{traj}$ 为选中轨迹 $T^j$ 与专家轨迹的 L1 损失。
数据
- nuScenes(开环规划评测):1000 段真实驾驶视频,6 路环视相机,输入分辨率 360×640,训练用 ResNet-50 骨干;训练/评测轨迹以 2Hz 采样、预测时域 3 秒。驾驶指令沿用既有工作分为左/右/直行三类。
- NavSim(闭环规划评测,构建于 OpenScene 之上):1192 个训练场景 / 136 个测试场景,总计超过 10 万个关键帧;输入为拼接的前/左前/右前三路相机图像,resize 到 256×1024,用 ResNet-34 骨干;轨迹以 2Hz 采样、预测时域 4 秒,用 LQR 控制器插值。
- 伪标注/先验来源:语义伪标签来自 Grounded-SAM(视觉语言模型,非人工标注);深度先验来自 Metric3D v2(giant 版,度量单目深度基础模型),均为推理时的现成基础模型,不产生新的人工标注成本——这正是论文所称”perception annotation-free”的含义:不依赖人工 3D 框/高精地图标注,但仍消费预训练视觉基础模型的知识。
- 无额外仿真数据:全部实验基于 nuScenes 与 NavSim/OpenScene 真实采集数据,未使用仿真合成数据做预训练或联合训练。
- LAW 官方未开源,NavSim 上的 LAW 结果由作者在相同实验设置下自行复现得到。
训练方法
- 目标函数:单阶段端到端联合训练,四项损失加权求和(见上),无多阶段预训练-微调流程,无强化学习环节。
- 监督信号:轨迹层面用模仿学习(L1 对齐专家轨迹);场景表征层面用自监督(预测未来潜特征 vs 真实未来潜特征的对比/重建),不需要人工感知标注;语义先验用 Grounded-SAM 伪标签做辅助监督。
- 动作表示:连续轨迹词表(k-means 聚类意图点)+ MLP 编码为连续动作 token,不使用离散动作 token 化。
- 关键超参:nuScenes 训练 12 epochs、8× NVIDIA 3090、总 batch size 8、初始学习率 5e-5;NavSim 训练 60 epochs、8× NVIDIA 3090、总 batch size 64;损失权重 α=0.2/β=0.2/γ=0.5/η=1.0;未来预测时间步长 n=3(对 n 的消融见补充材料,正文未展开数字)。
Infra(训练 / 推理工程)
- 训练硬件:nuScenes 与 NavSim 均在 8× NVIDIA 3090 GPU 上训练,未使用更高端 A100/H100 集群。
- GPU-hours / 并行策略 / 数值精度:论文未披露具体 GPU-hours、分布式并行策略(如数据/模型并行)与训练精度(FP16/BF16/FP32)。
- 收敛速度:相对 LAW,World4Drive 在 nuScenes 上实现约 3.75× 更快的训练收敛(同等迭代数下归一化性能对比,见论文 Fig.1),作者将其归因于视觉基础模型先验带来的更强初始场景理解。
- 推理侧:论文未报告 FPS、控制频率、单帧延迟或边缘硬件部署数据。
评测 benchmark
nuScenes 开环规划(Tab.1,L2 误差 / 碰撞率,1s/2s/3s/平均):
- World4Drive:L2 均值 0.50m(1s 0.23 / 2s 0.47 / 3s 0.81),碰撞率均值 0.16%(1s 0.02 / 2s 0.12 / 3s 0.33)。
- 对比 LAW(Perception-free,前 SOTA 无标注方法):L2 均值 0.61m、碰撞率均值 0.30%——World4Drive 相对降低 L2 误差(论文三处表述不完全一致:摘要称 18.1%,引言称 18.2%/“0.61→0.50m”,4.3 节称 18.0%,均约等于 (0.61-0.50)/0.61≈18.0%),碰撞率降低 46.7%。
- 对比 LAW(Perception-based 版本,用 Swin-Tiny 骨干、依赖感知监督):L2 均值 0.49m、碰撞率均值 0.19%——World4Drive(无感知标注)L2 误差仅高出不到 2%,碰撞率反而更低,是全表碰撞率最低的方法。
- 也优于 UniAD(1.03/0.31)、VAD(0.72/0.23)、PPAD(0.58/0.19)、GenAD(0.52/0.19)等依赖感知标注的方法。
NavSim 闭环规划(Tab.2,PDMS 及子指标 NC/DAC/TTC/Comf./EP):World4Drive(仅相机输入):NC 97.4、DAC 94.3、TTC 92.8、Comf. 100.0、EP 79.9、PDMS 85.1;对比 LAW(Perception-free,同实验设置下作者复现):PDMS 83.8;DiffusionDrive(相机+激光雷达,依赖标注):PDMS 88.1,是全表最高——论文承认闭环指标上 World4Drive 优于除 DiffusionDrive 外的所有方法(含依赖感知标注的 UniAD 83.4、PARA-Drive 84.0、Transfuser 84.0、Hydra-MDP 83.0 等)。
消融——各组件贡献(Tab.3,nuScenes,L2/碰撞率均为 3 秒均值):仅 LAW 式单模态世界模型(baseline)0.61/0.30 → 加意图建模 0.55/0.25 → 再加空间先验(深度)0.51/0.29 → 空间+语义+世界模型(无意图)0.49/0.26 → 仅深度+语义+意图(无世界模型评分)0.61/0.36(L2 与 baseline 持平,但碰撞率反而高于 baseline(0.30%),说明纯加意图而无世界模型评分不但无益,碰撞安全性还会退化) → 全量(深度+语义+世界模型+意图)0.50/0.16。作者据此论证:意图与世界模型必须配对使用,单独加意图反而有害。
消融——不同驾驶条件(Tab.4):对比 LAW,World4Drive 在夜间碰撞率降低 63.7%(LAW 0.22% → World4Drive 0.08%),雨天碰撞率降低 68.8%(LAW 0.16% → World4Drive 0.05%),体现视觉基础模型先验对光照/天气鲁棒性的贡献。
消融——不同转向动作(Tab.5):左转 L2 0.63/碰撞 0.40%,右转 0.69/0.20%,直行 0.48/0.14%(World4Drive),均优于 LAW 对应值(0.67/0.54%,0.71/0.23%,0.58/0.29%)。
消融——可扩展性(Tab.6):图像骨干从 ResNet-34→ResNet-50→ResNet-101,隐藏维度从 128→256→384,L2/碰撞率均单调改善(ResNet-101/dim256 达 0.47/0.14,ResNet-50/dim384 达 0.49/0.10),作者指出该架构对骨干规模和隐藏维度同等敏感,不同于以往工作里”扩大隐藏维度收益通常大于扩大骨干”的规律。
创新点与影响
- 贡献:提出首个把”多模态驾驶意图”与”潜空间世界模型”紧耦合的端到端规划框架——世界模型不仅生成未来潜表征,还直接充当多模态轨迹的评估/选择器;设计了利用视觉基础模型(度量深度模型 + Grounded-SAM)注入空间-语义先验的物理世界潜编码模块,在不引入人工感知标注的前提下增强世界模型对物理世界的理解;在 nuScenes(开环)与 NavSim(闭环)上取得感知标注免费方法中的 SOTA,同时训练收敛速度提升约 3.75 倍。
- 改变了什么:相对 LAW(单模态潜特征、无空间语义先验),证明”多模态意图 + 世界模型选择器”配对使用是关键(单独加意图反而退化,见 Tab.3 消融),且视觉基础模型先验显著提升复杂光照/天气下的鲁棒性(夜间/雨天碰撞率降 60%+)。
- 作者自陈局限:论文正文未设独立 Limitations 段落;从消融数据看,该方法目前仅在中等规模骨干(ResNet-34/50/101)与 8×3090 训练配置下验证,未展示更大规模数据/骨干下的扩展性上限;闭环 PDMS 仍落后于使用相机+激光雷达融合输入并依赖感知蒸馏监督的 DiffusionDrive(88.1 vs 85.1),作者未在正文讨论该差距的成因。
- 开放度:论文声明代码将开源于 GitHub
ucaszyp/World4Drive;截至本次核实,仓库已公开且 README 提供了完整的 conda 环境搭建、nuScenes 数据准备、训练(tools/nusc_my_train.sh)与测试(tools/dist_test)脚本说明,预训练权重/配置文件的完整发布状态未逐一核实。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2507.00603
- arXiv PDF:https://arxiv.org/pdf/2507.00603
- arXiv HTML 全文(v1,ICCV 2025 first version):https://arxiv.org/html/2507.00603v1
- GitHub:https://github.com/ucaszyp/World4Drive
- 直接对标前作 LAW(Enhancing End-to-End Autonomous Driving with Latent World Model, ICLR 2025,未开源,本 wiki 暂无独立页面):arXiv 引用见论文 Reference “Li et al. [2025]”
- 相关驾驶世界模型:gaia-1-wayve、gaia-2-wayve、hermes-driving-world-model
一手源存档(sources/)
- world4drive—github-readme — GitHub README 快照(sources/world-model/2025/world4drive—github-readme.md,fetched 2026-07-16,含环境搭建与训练/测试脚本说明)
- arXiv 2507.00603 全文(v1 HTML,用于逐字核对方法/公式/表格数字):见上「原始链接」(arXiv 原文,不入 git)