一句话定位

NYU/Meta FAIR 团队在纯离线、无奖励的导航数据上系统对比 6 种方法(4 种目标条件 RL、1 种 zero-shot RL、1 种自研的隐空间规划法 PLDM),证明用 JEPA 学一个隐空间动力学模型再做 MPC 规划,在数据稀缺、轨迹质量差、需要跨轨迹拼接(stitching)、需要泛化到没见过的地图布局这四类场景下全面碾压模型无关(model-free)的目标条件强化学习,而后者只在数据又多又好时才占优。

背景与定位

“从无奖励离线轨迹学通用行为”这个问题历来有两条路线在各自为战:一条是强化学习——目标条件 RL(GCIQL、HIQL、CRL、GCBC)把目标当 Hindsight Experience Replay 式的事后标签去学策略,或者 zero-shot RL(HILP)把任务当隐变量学一个可迁移的表征空间;另一条是最优控制——经典控制假设动力学已知,但现实中动力学通常要从数据里学出来(TD-MPC、dreamer-v3 一脉)。这两条路线各自都有零散的强基线,却从未在同一套受控实验里正面比较过”数据质量”这个变量对它们的影响——本文要补的就是这个空白。

论文提出的 PLDM(Planning with a Latent Dynamics Model)延续了 LeCun 在《lecun-path-autonomous-machine-intelligence》里勾勒的世界模型蓝图:用 jepa-predictive(Joint Embedding Predictive Architecture)学一个**重建无关(reconstruction-free)**的自监督隐空间,而不是像 Dreamer 系列那样重建像素。作者的论据是 Balestriero & LeCun 之前的发现——重建目标会产生对下游任务次优的特征,而预测式 SSL 更适合做规划;本文用 Appendix G 的实测把这个论据坐实:把 PLDM 的编码器/动力学换成像素重建目标或换成 dreamer-v3td-mpc2 的表征学习方式,规划成功率大幅下滑甚至直接坍缩。

模型架构

PLDM 是一个轻量 JEPA 世界模型 + MPPI 规划器的组合,backbone 按环境而异,无预训练大模型:

  • 编码器/预测器(AR 式逐步展开,非 Transformer):给定轨迹 (s0,a0,s1,...,aT-1,sT),编码器 s0 编码为初始隐状态 z0;预测器 fθ^k 以自回归方式滚动 ẑ_t^k = fθ^k(ẑ_{t-1}^k, a_{t-1})。当 K>1 时训练一个预测器 ensemble(K 个独立预测头共享同一编码器),用于测试时的不确定性正则。
  • 三套环境各自的具体网络
    • Two-Rooms(64×64 二值图,agent+墙两通道):编码器复用 OGBench 的 Impala Small Encoder;预测器是 2 层 GRU,隐维 512,输入为 2D 位移动作向量、初始隐状态为 hθ(s0);编码器/预测器输出各接一层 LayerNorm。总参数量 2,218,672(编码器 1,426,096 + 预测器 793,600)。
    • Diverse PointMaze(64×64×3 RGB 俯视图 + 2D 速度):编码器 MeNet6——5 层卷积(Conv2d 3→16→32→32→32→16,GroupNorm+ReLU,最后 1×1 卷积)把图像编成 R^{16×26×26};速度向量经 Expander2D 广播成 R^{2×26×26} 后与图像特征沿通道拼接得到状态表征 z∈R^{18×26×26}。预测器 ConvPredictor 把状态(18 通道)与广播后的动作(2 通道)拼接成 20 通道输入,3 层卷积输出与状态同维的 ẑ∈R^{18×26×26}总参数量 53,666(编码器 33,296 + 预测器 20,370)——刻意做得很小,凸显”小模型 + 好目标”也能规划。
    • Ant-U-Maze(29 维状态、8 维动作的四足蚁形机器人):把全局 (x,y) 用 2 层 MLP 编码到 256 维,与其余原始本体感知状态拼接;预测器是 3 层 MLP,ensemble size=5总参数量 1,080,615(编码器仅 9,120,预测器占大头 1,072,007)。方差/协方差正则只施加在表征里编码 (x,y) 的那 256 维上,因为其余本体感知维度本来就没有被编码、不会坍缩。
  • 动作条件:动作直接拼接进预测器输入(GRU 输入或卷积/MLP 通道拼接),不用离散 token 化,属于连续动作条件的隐动力学模型。
  • 训练目标(防坍缩是核心工程问题)L_JEPA = L_sim + αL_var + βL_cov + δL_time-sim + ωL_IDML_sim 是预测隐状态与编码隐状态间对所有时间步、ensemble 成员求和的 L2 距离;L_var/L_covVICReg 式方差/协方差正则(作者把方差项改成沿时间维施加,鼓励特征捕捉”变化的信息”而非静态背景);L_time-sim 额外加一个时序平滑正则(鼓励相邻时刻表征接近);L_IDM逆动力学建模(用 MLP 从 (z_t,z_{t+1}) 预测动作 a_t),进一步防坍缩。三个环境的消融(固定其余系数、把某一项系数清零,Two-Rooms/Diverse Maze 成功率)显示:方差项 α 是最关键的防坍缩闸门(清零后从 98.0/98.7 崩到 13.4/11.4),协方差项 β 次之(崩到 29.2/7.8),IDM 项 ω 对 Diverse Maze 更关键(75.5 vs 98.7)而对 Two-Rooms 几乎无影响,时序平滑项 δ 对 Two-Rooms 更关键(71.0 vs 98.0)。
  • 规划:测试时用 MPPI(Model Predictive Path Integral)在动作序列上做采样优化,目标函数 C_goal 是预测隐状态与编码后的目标状态 hθ(s_g) 在隐空间的距离(对 ensemble 和 horizon 平均),叠加一个 C_uncertainty 惩罚项——用 ensemble 预测的方差(带时间折扣 γ)惩罚偏离训练分布的状态-动作转移,类比 GCIQL/HIQL/HILP 用 expectile regression 约束策略留在数据分布内。最终动作 a* = argmin(C_goal + βC_uncertainty)。默认按 MPC 框架每 1 步重新规划(i=1),这使 PLDM 比模型无关基线慢约 4 倍;把重规划间隔调到 4 步只掉 5% 相对成功率(见”Infra”节)。换新任务(如状态规避)无需重训编码器/动力学,只需要改规划目标 C_goal 的符号,体现了范式相对策略网络的可复用性。

数据

论文自建 23 个数据集、跨三套导航环境,全部是无奖励、状态-动作序列:

  • Two-Rooms(点质量 agent,64×64 双通道俯视图,动作是 2D 位移向量,模长上限 2.45):agent 从随机位置出发,先随机取一个方向,再用集中度 5 的 Von Mises 分布采样每步方向、步长在 [0, 2.45] 均匀采样;默认 episode 长度 T=91,总转移数 3 百万,约合 3 万条轨迹。为测试各种数据条件,作者额外生成:episode 长度 91/64/32/16 四档(用于测试短轨迹拼接,最短的 16 步时终点从未在单条轨迹里被观测到,必须靠拼接才能到达);数据规模从 634 到 1,500,000 转移共 7 档(用于测试样本效率);好数据/随机数据混合比例约 0.001–0.08 共 6 档(用于测试数据质量鲁棒性);以及”轨迹从不穿门”这一人为约束的覆盖度受限数据集(正常数据里约 35% 轨迹会穿门)。
  • Diverse PointMaze(基于 Mujoco PointMaze 改造,4×4 网格随机生成墙体布局,约束空地互连且占比 50%–75%;观测为 64×64×3 RGB 俯视图 + agent 速度;动作是 2D 加速度,action repeat=4):4 档训练集分别用 5/10/20/40 种布局、每布局 2000/1000/500/250 条 episode、episode 长度均为 100,总转移数固定 100 万;起点随机撒在地图内、初始速度随机采样(‖v‖≤5)。测试用的 40 个布局与训练布局完全不相交。
  • Ant-U-Maze(Mujoco 四足蚁形机器人,29 维状态、8 维动作):用 Park et al. (OGBench) 里预训练好的方向性专家策略采集,5 百万转移,每 10 步重采样一次目标方向、每步动作叠加标准差 1.0 的高斯噪声;测试轨迹拼接能力时另生成 episode 长度 25/50/100/250/500 五档数据集。
  • 数据无任何奖励标注、无 sim-to-real 混配——全部是纯模拟环境里采集的 reward-free 轨迹,动作标签就是采集时执行的真实动作(非事后标注)。

训练方法

  • 两阶段范式:先用 JEPA 目标离线预训练编码器+动力学预测器(自监督,不看目标/奖励),再在测试时用 MPPI 做免训练的隐空间规划——训练阶段和”策略”完全解耦,这是 PLDM 相比 4 种 GCRL 基线(都要联合学策略/价值函数)的结构性差异。
  • 训练目标:见”模型架构”节的 L_JEPA 五项组合损失,用 Adam 优化器 + Cosine 学习率调度。
  • 关键超参(按环境,来自 Appendix J.2):
    • Two-Rooms:batch size 64,预测器 horizon H=16,ensemble K=5,IDM 系数 ω 默认置 0(该环境不用 IDM 损失,与 D.1.2 消融”去掉 ω 对 Two-Rooms 无影响”一致),MPPI 噪声 σ=5、采样数 500、λ=0.005,规划器 C_uncertainty 系数 β=0.0001、折扣 γ=0.9;学习率/α/β/δ 按具体数据集设置分别在 0.0003–0.0030、2.2–5.0、6.5–13.0、0.19–0.90 间调节(数据集越难,如短序列/低质量,需要更大的正则系数)。
    • Diverse PointMaze:5 epochs,batch size 128,H=16,ensemble K=1(单预测器,无 ensemble 不确定性正则),MPPI 噪声 σ=5、采样数 500、λ=0.0025;学习率 0.04–0.05、α 35.0–54.5(远大于 Two-Rooms,因为像素级表征更容易坍缩)。
    • Ant-U-Maze:5 epochs,batch size 64,H=16,ensemble K=5,α=26.2、β=0.5、δ=8.1、ω=0.58,MPPI 噪声 σ=5、采样数 500、λ=0.0025,规划器 C_uncertainty 系数=1、折扣 γ=0.9;数据集特定的学习率随轨迹长度从短到长在 0.006→0.001 间递减(长度 25/50/100/250/500 分别对应 LR 0.006/0.004/0.003/0.001/0.001)。
  • 无 RL、无蒸馏:PLDM 完全不使用奖励信号(显式或隐式),论文明确把它归为”最优控制”而非”RL”;也没有模仿学习环节——动力学模型不模仿任何专家策略,只学 transition。
  • 不确定性正则消融(Appendix E):去掉 ensemble 的 C_uncertainty 正则后,PLDM 在数据稀缺/短序列场景下成功率明显下降,证明 MPC 阶段的分布内约束和 GCRL 的 expectile regression 起到类似作用。
  • 对照消融(Appendix G,验证”reconstruction-free”设计选择):把 PLDM 的 VICReg 目标换成同架构下的像素重建损失,Two-Rooms 好数据设定成功率从 97.4±1.3 掉到 26.2±13.9;改用适配版 dreamer-v3(去奖励、只用重建损失训练,规划时用离散表征的 KL 距离代替 L2)得到 24.0±6.9;改用适配版 td-mpc2(去奖励、只保留预测器-编码器一致性损失)直接坍缩到 0.0±0.0,加一个逆动力学建模项才勉强恢复到 35.0±0.0(仅跑了 1 个种子)。这组消融是论文”预测式 SSL 优于重建式 SSL”论点的直接实验证据。

Infra(训练 / 推理工程)

  • 训练算力:论文明确说”所有实验单卡即可,用 Nvidia V100 最长跑 1 天”;全部论文实验加研究过程中的探索性实验,总估算算力在 500–2000 GPU-days(Appendix K,Discussion of Computational Costs)。没有披露具体训练用了多少块 GPU 同时跑、也没有给单个最终模型的 GPU-hours。数据集生成本身很快——Two-Rooms 数据生成”30 分钟以内”完成。
  • 推理侧(规划延迟):在 Two-Rooms 环境实测 25 个 200 步 episode 的平均耗时(Appendix F,Table 5)——PLDM 每步重规划(i=1)16.0±0.13 秒/episode,相对模型无关基线慢约 4 倍;把重规划间隔调到 4 步降到 4.8±0.09 秒/episode(归一化成功率仅从 1.00 降到 0.95);调到 16 步 2.6±0.07 秒(成功率 0.90);调到 32 步 2.2±0.07 秒(成功率降到 0.62,开始明显掉点)。对照组 GCIQL 每 episode 3.6±0.10 秒,HIQL(因分层策略更慢)4.0±0.08 秒——即 PLDM 重规划间隔设到 4 步时,延迟已经接近甚至优于 HIQL。
  • Diverse PointMaze 把 MPPI 重规划频率固定为每 4 步一次(k=4)。
  • 没有面向真实机器人的边端部署或控制频率(Hz)披露——全篇是仿真导航环境的桌面实验,未讨论真实硬件延迟。

评测 benchmark

全部来自论文一手数据(成功率 %,均值±标准误,3 seeds):

Table 1(六项泛化能力总评,★★★/★★✩/★✩✩ 三档)——PLDM 是唯一在全部 6 项(新布局迁移、新任务迁移、数据效率、最佳表现、随机策略数据学习、短轨迹拼接)都拿到至少 ★★✩ 的方法;HILP 在 5/6 项拿 ★★★ 但新布局迁移是 ★✩✩;其余 4 个 GCRL 基线在新布局/新任务两项全部是 ★✩✩。

Table 2(Two-Rooms,好数据 vs 无穿门数据):好数据下 HILP 100.0±0.0 最高,PLDM 97.8±0.7,GCIQL 98.0±0.9,HIQL 96.4±1.3,CRL 89.3±0.7,GCBC 86.0±2.0——好数据下全员接近满分;无穿门约束数据下差距炸开:HILP 100.0±0.0、GCIQL 99.6±0.4 依然接近满分,PLDM 34.4±2.7、HIQL 26.3±5.6、CRL 14.7±4.1、GCBC 8.4±1.2 全面崩溃,说明”轨迹拼接”是 PLDM 的相对弱项(隐动力学虽然还能拼出一部分路径,但不如 HILP/GCIQL 的价值函数/latent-distance 结构擅长跨轨迹拼接)。

数据规模/质量/序列长度扫描(Figure 4):①好数据比例趋近 0 时(几乎全随机策略轨迹),PLDM、GCIQL、HILP 最鲁棒,其余方法性能骤降;②episode 长度从 91 缩到 16 时,除 GCIQL 外的目标条件方法大幅退化(远处目标变成训练分布外),HILP 靠隐空间方向跟随、PLDM 靠学到的动力学做测试时拼接均保持较好;③数据规模从百万级降到几千条转移时,PLDM 和 GCIQL 最省数据,仅几千条转移即可达到接近 80% 成功率,HILP 需要更多数据才能到满分。

Diverse PointMaze 单一固定布局(Table 4,3 seeds):GCIQL/HIQL/HILP 均 1.000±0.000,PLDM 0.990±0.001,CRL 0.980±0.001,GCBC 0.970±0.024——固定单布局下所有方法都接近满分,说明差异只在”跨布局泛化”里显现。

新布局泛化(Figure 2/7/8,定性 + 曲线,无逐点数值表):仅用 5 种训练布局时,PLDM 在完全没见过的布局上仍能成功规划,其余方法全部失败;随着测试布局与训练布局的编辑距离(layout edit distance)增大,除 PLDM 外所有方法成功率持续下降,PLDM 保持稳定——这是论文的核心卖点(“model-based 方法泛化到未见障碍物布局明显优于 model-free”)。

状态规避新任务零样本迁移(Figure 5,Two-Rooms 追逐任务):用 4.2 节训练好的模型、不重新训练,仅把 PLDM 的规划目标符号反转(最大化到追逐者隐空间距离)、HILP 反转技能方向;以”100 步内与追逐者距离维持 ≥1.4 像素”为成功标准,PLDM 在各追逐速度下均优于 HILP,episode 末端维持的追逐者-agent 距离更大。

Ant-U-Maze 高维控制(Figure 6,10 trials/setting):数据充足时对角线导航任务全部方法接近满分;轨迹拼接测试(长度 25/50/100/250/500)中 PLDM、HIQL、HILP 在短轨迹下仍达到 100% 成功率,其余 GCRL 基线随轨迹变短而失败——与 Two-Rooms 里 HIQL 表现平庸相反,作者推测 HIQL 的分层结构(低层管关节动作、高层管导航)在高维四足控制里更占优势。

统计显著性(Appendix H):用 Welch’s t-test 汇总跨设置/种子池化后的结果,PLDM 相对多数基线的优势显著,仅在部分设置对 HILP、GCIQL 未达显著(与论文”HILP/GCIQL 也是强方法”的定性结论一致)。

创新点与影响

  • 贡献 1——把”数据质量对 offline 学习范式的影响”第一次做成系统受控实验:此前 ExORL、Buckman et al.、OGBench 等工作要么只比较探索性 vs 任务特定数据、要么聚焦带奖励标注数据的 offline RL;本文构造 23 个数据集,专门拆解轨迹长度、数据规模、策略质量、覆盖度、布局多样性五个独立变量,逐一归因每个方法的失败模式。
  • 贡献 2——PLDM 作为方法:证明”JEPA 预测式自监督学隐动力学 + MPPI 规划”在数据稀缺、低质量、短轨迹、跨布局四类场景下是目前最鲁棒的组合,且换任务(目标达成 → 状态规避)无需重训表征,只改规划代价函数符号即可零样本迁移——这是模型无关策略网络做不到的灵活性。
  • 贡献 3——为”reconstruction-free SSL 优于 reconstruction-based”提供了规划场景下的直接对照实验(Appendix G):同架构下把 VICReg 换成像素重建,成功率从 97% 掉到 26%;改造版 TD-MPC2 直接坍缩为 0%——这组消融把 Balestriero & LeCun 此前”重建产生次优特征”的论点落到了具体的控制任务上。
  • 论文自陈局限:①全部实验局限在导航环境,未覆盖机器人操作(manipulation)或部分可观测设定,作者认为”数据质量效应”的结论性质应该能推广,但未经验证;②PLDM 推理慢约 4 倍(默认每步重规划),虽然 Appendix F 显示降低重规划频率只轻微掉点,但计算成本仍是实际部署的现实约束;③长时程规划中隐动力学的误差累积问题未被本文解决,作者把”改进动力学学习以缓解误差累积”和”通过反向传播规划梯度或摊销规划提升测试时效率”列为未来工作方向。

原始链接

一手源存档(sources/)