一句话定位

Navigation World Models(NWM)是 Meta FAIR + NYU + Berkeley(一作 Amir Bar,末位 Yann LeCun)提出的面向导航的可控视频世界模型:给定过去的第一视角观测和一段导航动作(平移 + 偏航 + 时间跳变),用一个条件扩散 Transformer(CDiT)自回归预测未来的第一视角图像,从而把”导航”变成”在世界模型里想象轨迹、再验证是否到达目标”。它在同一个模型里跨多种机器人本体(轮式、腿式、ATV、扫地机器人)和人类第一视角视频训练,规模拉到 1B 参数;既能独立用 MPC/交叉熵法(CEM)从零规划,又能给外部策略(NoMaD)采样的轨迹打分排序,在 RECON 上把目标条件导航的 ATE 从 NoMaD 的 1.93 压到 1.13。CVPR 2025 Oral,Best Paper Honorable Mention,被视为”导航世界模型”的参照工作。

背景与定位

NWM 属于**“扩散视频世界模型 + 想象中规划(planning in imagination)“这一范式(Ha & Schmidhuber 2018 的 world model 概念 + 图像/视频扩散模型),但把落点从游戏/RL 挪到了真实世界机器人导航**。

它要解决的是当时监督式视觉导航策略(v-jepa 之外的 NoMaD、GNM/ViNT 这一系)的两个硬伤:(1) 训完后行为”写死”,无法动态注入新约束(如”不许左转""别靠悬崖边”);(2) 无法对难题动态分配更多算力。NWM 的思路是学一个世界模型 F,而不是学一个策略——世界模型能模拟环境、评分不同动作序列,于是规划时可以任意加约束、任意加采样预算。

谱系上,NWM 明确把自己接在两条线之间:

  • 扩散世界模型 / 神经游戏引擎diamond(DIAMOND,Atari/CS:GO)、gamengen(GameNGen,DOOM)、deepmind-genie2 / Genie(潜动作)、decart-oasis(Minecraft)。NWM 与它们的关键差异是跨大量环境与本体训练单一大扩散 Transformer,而非单一游戏引擎。
  • 新视角合成(NVS):NeRF、Zero-1-to-3、GDC。NWM 从中取灵感,但不用任何 3D 先验,只从自然视频学时间动力学。

同期同组的 dino-wm(DINO-WM,Zhou et al. 2024,与 NWM 共享二作 Gaoyue Zhou)走的是”在冻结 DINO 特征上建世界模型 + CEM 零样本规划”的路子;NWM 可看作把这套规划哲学搬到像素级可解码的扩散生成上,并放大到真实导航数据。范式命名:navigation world model(导航世界模型)

模型架构

NWM 的世界模型 F_θ 是一个时间自回归的条件扩散 Transformer(CDiT),在 VAE 潜空间里对”下一帧潜表示”做去噪,条件是过去若干帧潜表示 + 当前动作。

问题形式化

  • 数据是第一视角视频 + 导航动作序列 D = {(x₀,a₀,…,x_T,a_T)}。动作 a=(u,φ):平移 u∈ℝ²(控制前后 / 左右),偏航角 φ∈ℝ。假设在平面上导航、俯仰/横滚固定(可自然扩展到 6-DOF:u∈ℝ³ + roll/pitch/yaw)。
  • 用预训练 VAE(Stable Video Diffusion 的 VAE,Blattmann 2023) 把每帧编码成潜 s_i = enc_θ(x_i),好处是压缩潜 + 可解码回像素做可视化 / 打分。
  • 目标:学随机映射 F_θ(s_{τ+1} | s_τ, a_τ),其中 sτ = (s_τ,…,s{τ−m}) 是过去 m 帧潜观测。
  • 时间跳变 k:把动作扩展成 a_τ=(u,φ,k),k∈[T_min,T_max] 指定要往未来(或过去)走多少步。跨 τ→τ+k 的动作用累加近似:u_{τ→τ+k}=Σuₜ,φ_{τ→τ+k}=Σφₜ mod 2π。实践中允许 ±16 秒的时间跳变。引入 k 既学动作、也学环境时间动力学。
  • 动作/时间解耦:担心”到某地总在某时刻”导致模型只用时间忽略动作(或反之),训练时**给每个状态采多个目标(up to 4)**制造自然反事实(同一地点不同时刻到达)。

CDiT Block(核心创新)

  • 标准 DiT 会把所有 context token 一起塞进自注意力,复杂度被注意力项 O(m²·n²·d) 主导(m=帧数,n=每帧 token 数,d=维度),随 context 长度二次增长。
  • CDiT 只对正在去噪的目标帧 token做第一层(自)注意力;要用过去帧信息时,加一层交叉注意力:目标帧的每个 query token 去 attend 过去帧 token(作为 key/value),再用 skip connection 把上下文并回来。这样复杂度被交叉注意力项 O(m·n²·d) 主导,对 context 帧数线性,可以用更长 context。
  • 效果:训到 1B 参数区间,CDiT 比同规模 DiT 省约 4× FLOPs 且预测更好;甚至 CDiT-L 打过 DiT-XL 还快 4×(“capacity 比全自注意力更重要”)。
  • 动作条件注入:对连续标量 u、φ、k 以及扩散时间步 t,各自先做 sine-cosine 特征 → 2 层 MLP G:ℝ→ℝ^d,四者求和成单一条件向量 ξ = G_u(ψ(u)) + G_θ(ψ(θ)) + G_k(ψ(k)) + G_t(ψ(t));ξ 送进 AdaLN,生成 scale/shift 系数去调制 LayerNorm 输出和各注意力层输出。训练无标注数据时,直接从 ξ 里省掉导航动作项(只保留时间跳变),从而能吃 Ego4D。

扩散训练细节:前向 s^{(t)}{τ+1}=√α_t·s{τ+1}+√(1−α_t)·ϵ,反向由 F_θ 预测噪声,噪声调度与超参照搬 DiT(Peebles & Xie 2023);patchify 用 DiT-*/2 设置(patch size 2)。

模型家族(HF 发布,均在 4 个机器人数据集上训 100k 步;XL 另有 +Ego4D 的 200k 版):CDiT/S 50M、CDiT/B 200M、CDiT/L 700M、CDiT/XL 1B。默认实验用 CDiT-XL(1B),context = 4 帧

数据

有标注机器人数据集(有位姿/旋转,动作 = 相对当前位置的位移+旋转 delta;跨本体用”距离 ÷ 平均步长(米)“标准化步长;按 NoMaD 惯例滤掉后退运动):

数据集时长/规模本体 & 场景训练/测试片段
SCAND8.7 小时、138 条轨迹、25 英里轮式 Clearpath Jackal + 腿式 Boston Dynamics Spot;UT Austin 社交合规导航、室内外484 / 121
TartanDrive5 小时、630 条轨迹改装 Yamaha Viking ATV;匹兹堡越野驾驶1000 / 251
RECON40 小时、9 个开放世界环境Clearpath Jackal UGV9468 / 2367
HuRoN (SACSon)75+ 小时、5 个环境、4000 次人机交互Roomba 室内、UC Berkeley 社交交互2451 / 613

无标注数据Ego4D 取导航相关场景(走路 / 慢跑 / 徒步 / 骑行 / 逛超市 / 遛狗等 28 类),1619 段视频、908+ 小时(原库 3670 小时 / 74 地点的子集),只用时间跳变作为动作、仅用于训练。

OOD 评测集GO Stanford(≥27 栋 Stanford 楼、约 25 小时、两台遥操作机器人的鱼眼视频)——因分辨率低只做未知环境评测,不参与训练。

其他 curation:预处理分辨率从 (160,120) 提到 (320,240);构造导航评测集时发现”前进”动作过度主导,于是按”仅靠前进就能预测的难度”排序,挑最难预测的 100 个样本/数据集做评测;时间预测评测集每数据集随机取 500 个样本。HF 发布权重均在训练数据上做过 EgoBlur 人脸模糊重训(结果与论文可能略有出入)。

训练方法

  • 目标函数:扩散去噪 MSE,ℒ = 𝔼[‖s_{τ+1} − F_θ(s^{(t)}_{τ+1} | s_τ, a_τ, t)‖²],t 随机采样覆盖各噪声水平。
  • 单阶段训练(非多阶段 pipeline):直接在混合数据上训 CDiT;有标注机器人数据学”动作+时间”条件,无标注 Ego4D 学”仅时间”条件,混在一起。
  • 默认超参:CDiT-XL 1B、context 4 帧、batch size 1024 × 4 个目标 = 有效 batch 4096AdamW,lr 8e-5;bfloat16;300 epochs(README);checkpoint 取 100k 迭代(+Ego4D 版 200k)。推理时对每个模型采样 5 次报均值/方差。torch.compile 可提速约 40%(但可能不稳,选用)。
  • 规划(planning)用法(推理期,不改权重):把规划写成 MPC,最小化能量函数 ℰ = −𝒮(s_T,s*) + 约束惩罚项(动作 ∉ 𝒜_valid、状态 ∉ 𝒮_safe 各加大惩罚),其中相似度 𝒮 = 把 s_T 和目标 s* 解码回像素后算感知相似度(LPIPS / DreamSim)。用**交叉熵法(CEM,无梯度)**优化:
    • Standalone 规划:轨迹设为直线,只优化终点 3 变量 (Δx, Δy, φ),映射成 8 个等距 delta 步、末步施加偏航;步间隔 k=0.25s;每轮采 N=120 候选、每候选评估 M=3 次取平均、选 top-k=5、更新高斯分布;短程(2 秒)规划跑 1 次迭代即可
    • 加约束:把对应动作分量置零即可(如 left-right first 前 3 步前进置零,只优化其余)。
    • Ranking:对 NoMaD 采 n∈{16,32} 条长度 8 的轨迹,用 NWM 自回归模拟、按末帧与目标的 LPIPS 排序选最优。

Infra(训练 / 推理工程)

  • 训练硬件:XL(1B)在 8 台 H100 机器 × 每台 8 卡 = 64 张 H100 上训练;跑法为 torchrun 或 submitit+slurm,8 节点 × 8 GPU/节点。
  • 精度/并行:bfloat16;数据并行(torchrun --nproc-per-node=8,多节点 c10d rendezvous)。未披露张量/流水并行或具体 GPU-hours。GPU-hours 未披露。
  • 推理 / 生成:自回归生成,评测在 1 FPS 和 4 FPS 两档下做(1 FPS 前 8 秒更准,8 秒后因误差累积被 4 FPS 反超);视频最长生成到 16 秒。规划评测(CEM 采 120 条轨迹)在 8 GPU 上跑。
  • 控制频率 / 端侧延迟 / 边缘硬件:论文未给实时控制 Hz、单步延迟或部署硬件数字,未披露(这是一个偏研究性质的世界模型,非现场部署系统)。

评测 benchmark

全部数字取自论文(arXiv 2412.03572),指标:LPIPS↓ / DreamSim↓ / PSNR↑(感知/像素),ATE↓ / RPE(RTE)↓(轨迹),FID↓ / FVD↓(生成质量)。

消融(Table 1,RECON,预测 4 秒后单步)

变量LPIPS↓DreamSim↓PSNR↑
goals=10.3120.09815.044
goals=20.3050.09615.154
goals=40.2960.09115.331
context=10.3040.09715.223
context=20.3020.09515.274
context=40.2960.09115.331
time only0.7600.7837.839
action only0.3180.10014.858
action + time0.2950.09115.343

→ 结论:4 个目标 > 1 个(反事实有效);context 越多越好(context 短会”跟丢”);action 和 time 都有用,只用 time 崩盘

CDiT vs DiT(Fig 5/6):1B 参数区间 CDiT 全面更优且 <2× FLOPs;CDiT-L 比 DiT-XL 快 4× 还更准。

视频合成质量 FVD(Table 7,16s @ 4FPS,NWM vs DIAMOND)

数据集DIAMONDNWM
RECON762.7200.97
HuRoN881.98276.93
TartanDrive2289.69494.25
SCAND1945.09401.70

目标条件视觉导航(Table 2,RECON,2 秒轨迹)

方法ATE↓RPE↓
GNM1.870.73
NoMaD1.930.52
NWM + NoMaD (×16)1.830.50
NWM + NoMaD (×32)1.780.48
NWM (planning)1.130.35

全量 in-domain(Table 5)NWM-only 的 ATE:RECON 1.13、SCAND 1.28、TartanDrive 5.63(均为最优),HuRoN 4.12(此数据集上 NWM+NoMaD 排序更优)。

带约束规划(Table 3,相对无约束基线的终点位置差 δu / 偏航差 δφ):forward-first (+0.36 / +0.61)、left-right first (−0.03 / +0.20)、straight-then-forward (+0.08 / +0.22)——所有约束都满足,规划性能只有小幅下降,证明世界模型规划可动态注入硬约束。

OOD 泛化 + Ego4D(Table 4/6,LPIPS 4 秒后):未知环境 Go Stanford 0.658 → +Ego4D 0.652(改善,且各指标全面变好);已知环境 RECON 0.295 → 0.368、HuRoN 0.250 → 0.377(退化,说明已知环境仍是纯 in-domain 更贴分布),唯 SCAND 0.403 → 0.398 略升(因场景含行人等动态物体,无标注多样数据反而帮上忙)。

创新点与影响

  • 第一个把”世界模型 + 想象中规划”系统性落到真实机器人导航的工作:单一大扩散 Transformer 跨轮式/腿式/ATV/扫地机器人 + 人类第一视角视频统一训练,用同一模型做从零规划给外部策略排序,并在 RECON 上把 ATE 从 1.93 打到 1.13。
  • CDiT 架构:把 context 帧从自注意力挪到交叉注意力,复杂度对 context 帧数从二次降到线性,1B 规模下省 4× FLOPs 还更准——一个可复用的”条件扩散生成”高效骨干。
  • 规划期动态约束:相对写死的监督策略,NWM 能在推理时任意加动作/状态约束(“只先左右转再直行""避开悬崖”),并按需加采样预算——把导航从”策略推理”变成”可搜索的能量最小化”。
  • 吃无标注视频:通过”只保留时间跳变”的条件方式,把 Ego4D 这种无动作/无奖励的第一视角视频纳入训练,改善未知环境的想象质量。
  • 影响力:CVPR 2025 Oral + Best Paper Honorable Mention;代码/权重(S/B/L/XL + Ego4D 版)开源在 facebook/nwm,成为后续”导航/具身世界模型”对照基线。
  • 论文自陈局限:(1) OOD 时模式坍缩——生成会慢慢漂回训练数据分布;(2) 难以模拟行人等时间动力学(偶尔能);(3) 目前只有 3-DOF(平移 u∈ℝ² + 偏航),扩到 6-DOF 乃至控制机械臂关节留作未来工作。前两条作者认为可靠更长 context + 更多数据缓解。

原始链接

一手源存档(sources/)

  • navigation-world-models—github-readme — GitHub README 快照(训练/评测/规划命令、8×8 GPU 配置、依赖、CC BY-NC 4.0)
  • navigation-world-models—project-page — 项目页快照(作者归属、摘要、各类视频 demo 说明、CVPR 2025 Best Paper Honorable Mention)
  • navigation-world-models—hf-card — HF model card 快照(CDiT S/B/L/XL 参数量与训练步数表、+Ego4D 版、EgoBlur 重训说明)
  • arXiv 全文(HTML/PDF)已通读,未入 git —— 见上方 arXiv 链接(arXiv 原文 PDF,不入 git)