一句话定位
Policy World Model(PWM,大连理工大学,NeurIPS 2025 poster)用一个端到端自回归 Transformer 把”世界建模”和”轨迹规划”接成因果链条而非两条并行任务:先在无标注驾驶视频上做 action-free 的未来帧预训练,微调阶段再让模型先生成场景/动作文字描述、滚出未来帧、最后把预测出的未来状态和文字一并作为多模态依据去预测轨迹(collaborative state-action prediction);仅用前视单目相机即可在 nuScenes/NAVSIM 上匹配或超过依赖多视角、多模态(相机+LiDAR)输入的方法。
背景与定位
论文把既有驾驶世界模型分成三类范式(对应论文 Figure 1):(a) 传统世界模型(gaia-1-wayve、vista-driving-world-model、drive-occworld 等)只做”世界模拟”——预测下一状态/占据/奖励,规划仍由独立的策略模型完成,世界模型的预测能力没有直接进入决策;(b) 近期的统一架构(如 DrivingGPT、doe-1、VaVim/VaVam)把世界建模和规划塞进同一个自回归/多模态模型,但两个任务仍各自独立预测——即 P_θ(D_{t+1:t+n}|D_{1:t}) 与 P_θ(A_{1:m}|D_{1:t}) 互不依赖,只是架构层面统一,机制上并无协同;(c) PWM 的定位是让动作预测显式依赖预测出的未来状态:P_θ(D_{t+1:t+n}|D_{1:t})·P_θ(A_{1:m}|D_{1:t+n}) → P_θ(D_{t+1:t+n}A_{1:m}|D_{1:t}),即先算出未来帧再据此出动作,模拟人类驾驶时”预判后续路况再决策”的 anticipatory perception。为了让视频预测足够快、不拖慢决策链条,论文同时把视频生成从传统的逐 token 自回归(如 gaia-1-wayve、drivingworld-gpt)换成”逐帧并行生成”,代价是需要一个能把单帧压到极少 token 数的分支式 tokenizer。
模型架构
Image Tokenizer(context-guided compression):双分支编码器-解码器,初始化自 show-o(ICLR 2025 统一理解-生成 Transformer)的 tokenizer。
- 高分辨率分支 Q_h(冻结,直接复用 Show-o 预训练权重):处理首帧
I_1,输入分辨率 256×448,编码为 448 token/帧;同时输出多尺度中间特征F_e/F_d作为引导信号。 - 低分辨率分支 Q_l(可训练,结构镜像 Q_h 并新增随机初始化的交叉注意力+下采样模块):处理 128×224 分辨率的后续帧,编码到 4×7 的紧凑特征图,得到 L′=28 token/帧,比 Q_h 压缩到约 6.25%(28/448)。两分支通过交叉注意力横向连接——编码器在 8×14 分辨率、解码器在 8×14 与 16×28 分辨率上做跨分支注意力,Q_l 以 Q_h 的多尺度特征为 K/V,从而把”提取上下文信息”的负担转移给冻结分支,让 Q_l 专注建模时序变化。两分支各自独立 codebook,大小均为 8192。训练遵循标准 VQ-GAN 优化流程(L1 重建 + 感知损失权重 2.0 + 判别器损失权重 1.0,并对越靠后的未来帧施加更大重建损失权重)。
Policy World Model(自回归 Transformer,初始化自 show-o):
- 预训练目标——action-free 视频自回归生成:
P(D_{1:N};Z_1)=∏_{t=2}^N P_θ(D_t|D_{<t};Z_1)。得益于逐帧 token 数压缩到 28,PWM 可以把传统的逐 token next-token 生成换成逐帧并行生成(next-frame prediction),帧内 token 之间用双向注意力建模空间关系,帧间仍是自回归。特殊 token:高分辨率帧用<|soi|>/<|eoi|>(沿用 Show-o 惯例),低分辨率压缩帧用新增的<|sod|>/<|eod|>。 - Dynamic Focal Loss(DFL):训练中观察到相邻帧间最多 50% 的 token 不变,模型容易偷懒预测静态 token。DFL 按 token 是否随时间变化动态加权:
ω(d_t^i, d_{t-1}^i)=α·𝕀[d_t^i≠d_{t-1}^i]+β·𝕀[d_t^i=d_{t-1}^i],α>β,附录消融给出最优取值 α=1.0(固定), β=0.4(β 过小如 0.1 会导致预测任务过拟合而规划任务未收敛;α≤β 时 DFL 失效)。 - 微调阶段——collaborative state-action prediction:每条微调样本是多模态序列
{D_{1:t}, E_t, X_t, D_{t+1:t+n}, A_{1:m}}:给定历史帧 tokenD_{1:t}和导航指令+自车状态E_t,模型先自回归生成描述当前场景/动作的文本 tokenX_t,再滚出未来帧 tokenD_{t+1:t+n}(复用预训练的世界建模能力),最后m个可学习动作 token 与已生成的文本、未来帧隐特征交互,经轻量 MLP(SiLU 激活)动作头解码出轨迹坐标A_{1:m}。文本/未来帧用交叉熵监督,轨迹用 L1 损失。导航指令编码为 3 个随机初始化的可学习 embedding(直行/左转/右转),ego status(若使用)经两层 SiLU MLP 投影进模型隐空间,用专门的<|act|>token 提示轨迹预测。
数据
- OpenDV-YouTube(tokenizer 与 PWM 预训练数据):1747 小时前视相机视频,10Hz,覆盖 244 个城市,场景描述由 BLIP2 自动生成;抽样为 40 帧(4 秒)互不重叠的片段,1% 划为验证集。tokenizer 训练时每个样本随机取 30 帧连续片段,其中 2 帧作高分辨率上下文帧、8 帧作低分辨率未来帧;PWM 预训练时每片段随机裁出 24 帧连续片段定义预测时程,且每秒只实际输入一帧高分辨率帧(不做监督),以缩短序列长度。
- 辅助防遗忘数据:CC12M(图文配对,image captioning 任务)+ FineWeb(纯文本,语言建模任务),与视频预测任务按 3:1:1 的 batch 比例混合,对应损失权重 1.0 : 0.5 : 0.5。
- nuScenes(微调/评测):1000 个场景共 5.5 小时,六视角相机,但 PWM 只用前视图,帧率按数据集标注对齐为 12Hz;标注含 6 个 3 秒 waypoint 与文本描述。微调时用 1 秒历史预测 11 帧 + 6 个 waypoint(3 秒时程)。
- NAVSIM(微调/评测):基于 OpenScene 构建,103k 训练 / 12k 测试样本,前视 10Hz;微调时用 2 秒历史预测 10 帧 + 8 个 waypoint(4 秒时程)。数据集本身缺失部分预测所需帧,论文从原始 nuPlan 数据集重新采样补全;不含文本标注,故 NAVSIM 微调不含语言建模任务。
- 无额外仿真数据、无跨模态 co-training(单一前视相机输入贯穿始终);action 标签直接来自各数据集自带的自车位姿/waypoint 标注,论文未详述具体提取脚本。
训练方法
三阶段流水线:
- Tokenizer 训练:AdamW,8×10⁵ 步,学习率 2×10⁻⁴,6×NVIDIA A800 GPU;训练完成后冻结整个 tokenizer。
- PWM 预训练(action-free 视频生成 + 防遗忘任务):OpenDV-YouTube 上 AdamW,3×10⁵ 步,学习率 1×10⁻⁴,warm-up 1000 步;GPU 数量论文未披露。
- PWM 微调(collaborative state-action prediction):
- nuScenes:16 epoch,2×A800,batch size 8,学习率 3×10⁻⁵;训练集手动剔除每个场景最后 1 秒(缺未来帧监督),验证集计算视频指标时同样剔除,但计算规划指标时保留以与既有工作公平对比。
- NAVSIM:20 epoch,batch size 14(GPU 数量未披露)。
- 两个下游任务全程使用 Dynamic Focal Loss,且不做任何数据增强。
消融(Table 3, Table 5)证实:不预训练直接微调时,加入未来帧预测任务反而损害规划性能(nuScenes Avg.L2 从 1.62m 恶化到 2.95m);随着预训练数据规模从 0%→50%→100%,L2/碰撞率持续改善(100% 时 Avg.L2 0.78m、Avg.Col 0.07%),说明大规模 action-free 视频预训练是”预测未来帧能反哺规划”这一效应成立的前提,而非天然成立。
Infra(训练 / 推理工程)
- 训练硬件:tokenizer 训练 6×NVIDIA A800;nuScenes 微调 2×A800;PWM 预训练阶段、NAVSIM 微调阶段的 GPU 数量未披露。GPU-hours、并行策略(DP/DDP/FSDP)、训练精度(fp16/bf16/fp32)均未披露。
- 推理效率(单张 NVIDIA A800,batch size 1,Table 4):
- 预测 0 帧(zero-horizon,即无视觉前瞻的规划基线)延迟:nuScenes 0.88s、NAVSIM 0.57s。
- 预测 10 帧(论文最终选用配置)延迟:nuScenes 1.13s(+0.25s)、NAVSIM 0.85s(+0.28s)。
- 帧 token 前瞻生成本身(不含像素空间解码)约 40 FPS,额外延迟相对 zero-horizon 基线增量有限。
- 预测 5/15 帧的延迟增量分别为 nuScenes +0.13s/+0.38s、NAVSIM +0.12s/+0.40s(Table 4 完整数据)。
- 论文未做实车/边缘硬件部署实验。
评测 benchmark
nuScenes 验证集(Table 1,协议对齐 VAD):不使用 ego status 时,PWM 平均碰撞率 0.07%(1s/2s/3s 分别 0.01/0.01/0.18),低于 Drive-OccWorld(0.11%)与 LAW(0.19%)等此前最优方法;平均 L2 0.78m,高于 LAW(0.49m)/Drive-OccWorld(0.47m)(论文承认这一权衡)。使用 ego status 时(†),PWM 平均碰撞率 0.04%(1s/2s/3s:0.01/0.02/0.09),优于 DiffusionDrive†(0.08%)、Omni-Q†(0.30%);平均 L2 0.41m,与 UniAD†(0.46m)、RDA-Driver†(0.41m) 相当。
NAVSIM NavTest 集(Table 2):PWM 仅用单前视相机(SC)取得 PDMS 88.1,与使用相机+LiDAR 的 DiffusionDrive(88.1,同分)持平,超过同为纯相机方案的 UniAD(83.4)、LAW(84.6)、以及同属”世界模型+规划”范式、单目相机输入的 DrivingGPT(82.4)。子指标:NC 98.6、DAC 95.9、EP 81.8、TTC 95.4、Comf. 100.0——其中 TTC(95.4) 与 NC(98.6) 高于 DiffusionDrive 的 94.7/98.2。
关键消融(Table 3(a)(b)):预训练 + 双阶段 DFL 的完整配置在 nuScenes 上把 FVD 从无预训练的 826.15 降到 67.13,Avg.L2 从 3.34m 降到 0.78m,Avg.Col 从 1.51% 降到 0.07%;NAVSIM 上 PDMS 从 77.8 升到 88.1。预测时程消融(Table 4):预测 10 帧在两个数据集上都是最优点(更短时程时序动态信息不足,更长时程会引入幻觉、损害决策,尤其在单前视相机感知受限的情况下)。文本生成任务消融(附录 Table 2):加入场景/动作文本生成任务对预测质量和规划指标影响很小(None/Scene/Action 三组 Avg.Col 分别为 0.09%/0.08%/0.07%),论文认为在当前设定下效果有限。
创新点与影响
- 协同式状态-动作预测(collaborative state-action prediction):不同于此前”世界模型与策略模型分离”或”统一架构但预测独立”的两类范式,PWM 让动作预测显式条件于预测出的未来帧(
P_θ(A|D_{1:t+n})而非P_θ(A|D_{1:t})),并通过消融证明这种协同确实带来规划增益(碰撞率下降),而非仅有架构层面的统一。 - 逐帧并行生成 + context-guided tokenizer:把单帧压缩到 28 token(相对高分辨率分支 448 token 压缩约 94%),使视频前瞻生成能以约 40 FPS 运行、且不显著拖慢端到端决策延迟(+0.25~0.28s),这是让”预测未来再决策”在实践中可行的工程前提。
- action-free 预训练摆脱动作标注依赖:世界建模阶段完全在无标注驾驶视频上训练,不依赖动作条件视频生成常见的动作标注数据,训练可扩展性更强。
- 实证发现——预测带来更保守但更安全的规划:论文定性分析(Figure 5)指出,加入未来帧预测会让模型在 NAVSIM 上牺牲部分行驶进度(EP)换取更高的碰撞规避与可行驶区域合规性(NC/TTC/DAC),即预测未来状态会诱导更保守的驾驶策略。
- 作者自述局限:仅依赖单目前视输入,在能见度差等场景下鲁棒性可能受限;规划时程较短(3-4 秒),难以直接扩展到长时程场景;论文将多视角输入融合与更长时程前瞻列为未来工作方向。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2510.19654
- arXiv PDF:https://arxiv.org/pdf/2510.19654
- arXiv HTML 全文:https://arxiv.org/html/2510.19654v1
- 项目页:https://6550zhao.github.io/Policy-World-Model/
- GitHub 代码:https://github.com/6550Zhao/Policy-World-Model
- HuggingFace 模型权重:https://huggingface.co/zzzz12334/Policy_World_Model
- HuggingFace 数据集(补充文件):https://huggingface.co/datasets/talas/pwm_datasets
- HF Papers 聚合页:https://huggingface.co/papers/2510.19654
- NeurIPS 2025 海报页:https://neurips.cc/virtual/2025/poster/115790
一手源存档(sources/)
- policy-world-model-forecasting-planning—github-readme — GitHub README 快照(sources/world-model/2025/policy-world-model-forecasting-planning—github-readme.md,fetched 2026-07-16;作者/单位、NeurIPS 2025 录用、安装与数据准备文档、三阶段模型权重下载链接与对应指标表)
- policy-world-model-forecasting-planning—project-page — 项目页快照(sources/world-model/2025/policy-world-model-forecasting-planning—project-page.md,fetched 2026-07-16;Highlights、方法对比图说明、Abstract、Method Overview)
- 论文全文:arXiv:2510.19654(arXiv 原文 HTML/PDF,不入 git;本页正文数字取自 arXiv HTML 全文 v1 的正文 Section 1–5 与附录 Section A–C)