一句话定位
Navigation World Models(NWM)是 Meta FAIR + NYU + Berkeley(一作 Amir Bar,末位 Yann LeCun)提出的面向导航的可控视频世界模型:给定过去的第一视角观测和一段导航动作(平移 + 偏航 + 时间跳变),用一个条件扩散 Transformer(CDiT)自回归预测未来的第一视角图像,从而把”导航”变成”在世界模型里想象轨迹、再验证是否到达目标”。它在同一个模型里跨多种机器人本体(轮式、腿式、ATV、扫地机器人)和人类第一视角视频训练,规模拉到 1B 参数;既能独立用 MPC/交叉熵法(CEM)从零规划,又能给外部策略(NoMaD)采样的轨迹打分排序,在 RECON 上把目标条件导航的 ATE 从 NoMaD 的 1.93 压到 1.13。CVPR 2025 Oral,Best Paper Honorable Mention,被视为”导航世界模型”的参照工作。
背景与定位
NWM 属于**“扩散视频世界模型 + 想象中规划(planning in imagination)“这一范式(Ha & Schmidhuber 2018 的 world model 概念 + 图像/视频扩散模型),但把落点从游戏/RL 挪到了真实世界机器人导航**。
它要解决的是当时监督式视觉导航策略(v-jepa 之外的 NoMaD、GNM/ViNT 这一系)的两个硬伤:(1) 训完后行为”写死”,无法动态注入新约束(如”不许左转""别靠悬崖边”);(2) 无法对难题动态分配更多算力。NWM 的思路是学一个世界模型 F,而不是学一个策略——世界模型能模拟环境、评分不同动作序列,于是规划时可以任意加约束、任意加采样预算。
谱系上,NWM 明确把自己接在两条线之间:
- 扩散世界模型 / 神经游戏引擎:diamond(DIAMOND,Atari/CS:GO)、gamengen(GameNGen,DOOM)、deepmind-genie2 / Genie(潜动作)、decart-oasis(Minecraft)。NWM 与它们的关键差异是跨大量环境与本体训练单一大扩散 Transformer,而非单一游戏引擎。
- 新视角合成(NVS):NeRF、Zero-1-to-3、GDC。NWM 从中取灵感,但不用任何 3D 先验,只从自然视频学时间动力学。
同期同组的 dino-wm(DINO-WM,Zhou et al. 2024,与 NWM 共享二作 Gaoyue Zhou)走的是”在冻结 DINO 特征上建世界模型 + CEM 零样本规划”的路子;NWM 可看作把这套规划哲学搬到像素级可解码的扩散生成上,并放大到真实导航数据。范式命名:navigation world model(导航世界模型)。
模型架构
NWM 的世界模型 F_θ 是一个时间自回归的条件扩散 Transformer(CDiT),在 VAE 潜空间里对”下一帧潜表示”做去噪,条件是过去若干帧潜表示 + 当前动作。
问题形式化
- 数据是第一视角视频 + 导航动作序列 D = {(x₀,a₀,…,x_T,a_T)}。动作 a=(u,φ):平移 u∈ℝ²(控制前后 / 左右),偏航角 φ∈ℝ。假设在平面上导航、俯仰/横滚固定(可自然扩展到 6-DOF:u∈ℝ³ + roll/pitch/yaw)。
- 用预训练 VAE(Stable Video Diffusion 的 VAE,Blattmann 2023) 把每帧编码成潜 s_i = enc_θ(x_i),好处是压缩潜 + 可解码回像素做可视化 / 打分。
- 目标:学随机映射 F_θ(s_{τ+1} | s_τ, a_τ),其中 sτ = (s_τ,…,s{τ−m}) 是过去 m 帧潜观测。
- 时间跳变 k:把动作扩展成 a_τ=(u,φ,k),k∈[T_min,T_max] 指定要往未来(或过去)走多少步。跨 τ→τ+k 的动作用累加近似:u_{τ→τ+k}=Σuₜ,φ_{τ→τ+k}=Σφₜ mod 2π。实践中允许 ±16 秒的时间跳变。引入 k 既学动作、也学环境时间动力学。
- 动作/时间解耦:担心”到某地总在某时刻”导致模型只用时间忽略动作(或反之),训练时**给每个状态采多个目标(up to 4)**制造自然反事实(同一地点不同时刻到达)。
CDiT Block(核心创新)
- 标准 DiT 会把所有 context token 一起塞进自注意力,复杂度被注意力项 O(m²·n²·d) 主导(m=帧数,n=每帧 token 数,d=维度),随 context 长度二次增长。
- CDiT 只对正在去噪的目标帧 token做第一层(自)注意力;要用过去帧信息时,加一层交叉注意力:目标帧的每个 query token 去 attend 过去帧 token(作为 key/value),再用 skip connection 把上下文并回来。这样复杂度被交叉注意力项 O(m·n²·d) 主导,对 context 帧数线性,可以用更长 context。
- 效果:训到 1B 参数区间,CDiT 比同规模 DiT 省约 4× FLOPs 且预测更好;甚至 CDiT-L 打过 DiT-XL 还快 4×(“capacity 比全自注意力更重要”)。
- 动作条件注入:对连续标量 u、φ、k 以及扩散时间步 t,各自先做 sine-cosine 特征 → 2 层 MLP G:ℝ→ℝ^d,四者求和成单一条件向量 ξ = G_u(ψ(u)) + G_θ(ψ(θ)) + G_k(ψ(k)) + G_t(ψ(t));ξ 送进 AdaLN,生成 scale/shift 系数去调制 LayerNorm 输出和各注意力层输出。训练无标注数据时,直接从 ξ 里省掉导航动作项(只保留时间跳变),从而能吃 Ego4D。
扩散训练细节:前向 s^{(t)}{τ+1}=√α_t·s{τ+1}+√(1−α_t)·ϵ,反向由 F_θ 预测噪声,噪声调度与超参照搬 DiT(Peebles & Xie 2023);patchify 用 DiT-*/2 设置(patch size 2)。
模型家族(HF 发布,均在 4 个机器人数据集上训 100k 步;XL 另有 +Ego4D 的 200k 版):CDiT/S 50M、CDiT/B 200M、CDiT/L 700M、CDiT/XL 1B。默认实验用 CDiT-XL(1B),context = 4 帧。
数据
有标注机器人数据集(有位姿/旋转,动作 = 相对当前位置的位移+旋转 delta;跨本体用”距离 ÷ 平均步长(米)“标准化步长;按 NoMaD 惯例滤掉后退运动):
| 数据集 | 时长/规模 | 本体 & 场景 | 训练/测试片段 |
|---|---|---|---|
| SCAND | 8.7 小时、138 条轨迹、25 英里 | 轮式 Clearpath Jackal + 腿式 Boston Dynamics Spot;UT Austin 社交合规导航、室内外 | 484 / 121 |
| TartanDrive | 5 小时、630 条轨迹 | 改装 Yamaha Viking ATV;匹兹堡越野驾驶 | 1000 / 251 |
| RECON | 40 小时、9 个开放世界环境 | Clearpath Jackal UGV | 9468 / 2367 |
| HuRoN (SACSon) | 75+ 小时、5 个环境、4000 次人机交互 | Roomba 室内、UC Berkeley 社交交互 | 2451 / 613 |
无标注数据:Ego4D 取导航相关场景(走路 / 慢跑 / 徒步 / 骑行 / 逛超市 / 遛狗等 28 类),1619 段视频、908+ 小时(原库 3670 小时 / 74 地点的子集),只用时间跳变作为动作、仅用于训练。
OOD 评测集:GO Stanford(≥27 栋 Stanford 楼、约 25 小时、两台遥操作机器人的鱼眼视频)——因分辨率低只做未知环境评测,不参与训练。
其他 curation:预处理分辨率从 (160,120) 提到 (320,240);构造导航评测集时发现”前进”动作过度主导,于是按”仅靠前进就能预测的难度”排序,挑最难预测的 100 个样本/数据集做评测;时间预测评测集每数据集随机取 500 个样本。HF 发布权重均在训练数据上做过 EgoBlur 人脸模糊重训(结果与论文可能略有出入)。
训练方法
- 目标函数:扩散去噪 MSE,ℒ = 𝔼[‖s_{τ+1} − F_θ(s^{(t)}_{τ+1} | s_τ, a_τ, t)‖²],t 随机采样覆盖各噪声水平。
- 单阶段训练(非多阶段 pipeline):直接在混合数据上训 CDiT;有标注机器人数据学”动作+时间”条件,无标注 Ego4D 学”仅时间”条件,混在一起。
- 默认超参:CDiT-XL 1B、context 4 帧、batch size 1024 × 4 个目标 = 有效 batch 4096;AdamW,lr 8e-5;bfloat16;300 epochs(README);checkpoint 取 100k 迭代(+Ego4D 版 200k)。推理时对每个模型采样 5 次报均值/方差。torch.compile 可提速约 40%(但可能不稳,选用)。
- 规划(planning)用法(推理期,不改权重):把规划写成 MPC,最小化能量函数 ℰ = −𝒮(s_T,s*) + 约束惩罚项(动作 ∉ 𝒜_valid、状态 ∉ 𝒮_safe 各加大惩罚),其中相似度 𝒮 = 把 s_T 和目标 s* 解码回像素后算感知相似度(LPIPS / DreamSim)。用**交叉熵法(CEM,无梯度)**优化:
- Standalone 规划:轨迹设为直线,只优化终点 3 变量 (Δx, Δy, φ),映射成 8 个等距 delta 步、末步施加偏航;步间隔 k=0.25s;每轮采 N=120 候选、每候选评估 M=3 次取平均、选 top-k=5、更新高斯分布;短程(2 秒)规划跑 1 次迭代即可。
- 加约束:把对应动作分量置零即可(如 left-right first 前 3 步前进置零,只优化其余)。
- Ranking:对 NoMaD 采 n∈{16,32} 条长度 8 的轨迹,用 NWM 自回归模拟、按末帧与目标的 LPIPS 排序选最优。
Infra(训练 / 推理工程)
- 训练硬件:XL(1B)在 8 台 H100 机器 × 每台 8 卡 = 64 张 H100 上训练;跑法为 torchrun 或 submitit+slurm,8 节点 × 8 GPU/节点。
- 精度/并行:bfloat16;数据并行(torchrun
--nproc-per-node=8,多节点 c10d rendezvous)。未披露张量/流水并行或具体 GPU-hours。GPU-hours 未披露。 - 推理 / 生成:自回归生成,评测在 1 FPS 和 4 FPS 两档下做(1 FPS 前 8 秒更准,8 秒后因误差累积被 4 FPS 反超);视频最长生成到 16 秒。规划评测(CEM 采 120 条轨迹)在 8 GPU 上跑。
- 控制频率 / 端侧延迟 / 边缘硬件:论文未给实时控制 Hz、单步延迟或部署硬件数字,未披露(这是一个偏研究性质的世界模型,非现场部署系统)。
评测 benchmark
全部数字取自论文(arXiv 2412.03572),指标:LPIPS↓ / DreamSim↓ / PSNR↑(感知/像素),ATE↓ / RPE(RTE)↓(轨迹),FID↓ / FVD↓(生成质量)。
消融(Table 1,RECON,预测 4 秒后单步)
| 变量 | LPIPS↓ | DreamSim↓ | PSNR↑ |
|---|---|---|---|
| goals=1 | 0.312 | 0.098 | 15.044 |
| goals=2 | 0.305 | 0.096 | 15.154 |
| goals=4 | 0.296 | 0.091 | 15.331 |
| context=1 | 0.304 | 0.097 | 15.223 |
| context=2 | 0.302 | 0.095 | 15.274 |
| context=4 | 0.296 | 0.091 | 15.331 |
| time only | 0.760 | 0.783 | 7.839 |
| action only | 0.318 | 0.100 | 14.858 |
| action + time | 0.295 | 0.091 | 15.343 |
→ 结论:4 个目标 > 1 个(反事实有效);context 越多越好(context 短会”跟丢”);action 和 time 都有用,只用 time 崩盘。
CDiT vs DiT(Fig 5/6):1B 参数区间 CDiT 全面更优且 <2× FLOPs;CDiT-L 比 DiT-XL 快 4× 还更准。
视频合成质量 FVD(Table 7,16s @ 4FPS,NWM vs DIAMOND)
| 数据集 | DIAMOND | NWM |
|---|---|---|
| RECON | 762.7 | 200.97 |
| HuRoN | 881.98 | 276.93 |
| TartanDrive | 2289.69 | 494.25 |
| SCAND | 1945.09 | 401.70 |
目标条件视觉导航(Table 2,RECON,2 秒轨迹)
| 方法 | ATE↓ | RPE↓ |
|---|---|---|
| GNM | 1.87 | 0.73 |
| NoMaD | 1.93 | 0.52 |
| NWM + NoMaD (×16) | 1.83 | 0.50 |
| NWM + NoMaD (×32) | 1.78 | 0.48 |
| NWM (planning) | 1.13 | 0.35 |
全量 in-domain(Table 5)NWM-only 的 ATE:RECON 1.13、SCAND 1.28、TartanDrive 5.63(均为最优),HuRoN 4.12(此数据集上 NWM+NoMaD 排序更优)。
带约束规划(Table 3,相对无约束基线的终点位置差 δu / 偏航差 δφ):forward-first (+0.36 / +0.61)、left-right first (−0.03 / +0.20)、straight-then-forward (+0.08 / +0.22)——所有约束都满足,规划性能只有小幅下降,证明世界模型规划可动态注入硬约束。
OOD 泛化 + Ego4D(Table 4/6,LPIPS 4 秒后):未知环境 Go Stanford 0.658 → +Ego4D 0.652(改善,且各指标全面变好);已知环境 RECON 0.295 → 0.368、HuRoN 0.250 → 0.377(退化,说明已知环境仍是纯 in-domain 更贴分布),唯 SCAND 0.403 → 0.398 略升(因场景含行人等动态物体,无标注多样数据反而帮上忙)。
创新点与影响
- 第一个把”世界模型 + 想象中规划”系统性落到真实机器人导航的工作:单一大扩散 Transformer 跨轮式/腿式/ATV/扫地机器人 + 人类第一视角视频统一训练,用同一模型做从零规划和给外部策略排序,并在 RECON 上把 ATE 从 1.93 打到 1.13。
- CDiT 架构:把 context 帧从自注意力挪到交叉注意力,复杂度对 context 帧数从二次降到线性,1B 规模下省 4× FLOPs 还更准——一个可复用的”条件扩散生成”高效骨干。
- 规划期动态约束:相对写死的监督策略,NWM 能在推理时任意加动作/状态约束(“只先左右转再直行""避开悬崖”),并按需加采样预算——把导航从”策略推理”变成”可搜索的能量最小化”。
- 吃无标注视频:通过”只保留时间跳变”的条件方式,把 Ego4D 这种无动作/无奖励的第一视角视频纳入训练,改善未知环境的想象质量。
- 影响力:CVPR 2025 Oral + Best Paper Honorable Mention;代码/权重(S/B/L/XL + Ego4D 版)开源在 facebook/nwm,成为后续”导航/具身世界模型”对照基线。
- 论文自陈局限:(1) OOD 时模式坍缩——生成会慢慢漂回训练数据分布;(2) 难以模拟行人等时间动力学(偶尔能);(3) 目前只有 3-DOF(平移 u∈ℝ² + 偏航),扩到 6-DOF 乃至控制机械臂关节留作未来工作。前两条作者认为可靠更长 context + 更多数据缓解。
原始链接
- 论文(arXiv 2412.03572,CVPR 2025 Oral):https://arxiv.org/abs/2412.03572
- PDF:https://arxiv.org/pdf/2412.03572
- 项目页(视频 demo,Best Paper Honorable Mention):https://www.amirbar.net/nwm/
- 代码(官方 PyTorch,CDiT 训练/评测/规划):https://github.com/facebookresearch/nwm
- 预训练权重(gated,S/B/L/XL + Ego4D 版):https://huggingface.co/facebook/nwm
一手源存档(sources/)
- navigation-world-models—github-readme — GitHub README 快照(训练/评测/规划命令、8×8 GPU 配置、依赖、CC BY-NC 4.0)
- navigation-world-models—project-page — 项目页快照(作者归属、摘要、各类视频 demo 说明、CVPR 2025 Best Paper Honorable Mention)
- navigation-world-models—hf-card — HF model card 快照(CDiT S/B/L/XL 参数量与训练步数表、+Ego4D 版、EgoBlur 重训说明)
- arXiv 全文(HTML/PDF)已通读,未入 git —— 见上方 arXiv 链接(arXiv 原文 PDF,不入 git)