一句话定位

IWM(Image World Models)把 i-jepa 的”只对遮挡做隐空间修复”推广为”对一整族光度变换(色彩抖动、灰度化、模糊、日晒化)做条件化的隐空间预测”,系统性地证明:只要 predictor 被正确条件化在变换参数上、变换足够复杂、且 predictor 容量足够大,就能学出一个可迁移复用的世界模型;这个 predictor 之后可以直接微调去做分类/分割,效果持平或超过对 encoder 做微调,而且参数量小得多。

背景与定位

论文把自监督视觉表征学习的两条主线用”world modeling”的视角重新归类(Figure 2):

  • 不变性/联合嵌入方法(BYOL、SimSiam、对比学习一族)——predictor 不被条件化在变换上,最好情况下只能学到对增强不变的表征。
  • 世界建模方法——遮挡式生成模型(MAE、BEiT,在像素/token 空间重建,decoder 可视为一个 generative world model)以及 i-jepa 这类在隐空间里预测被遮挡内容的 JEPA 方法(predictor 即 latent world model)。

论文观察到一个反差:强化学习里学到的 world model 通常被复用做规划(Ha & Schmidhuber 2018、Hafner et al. Dreamer 系列),但视觉自监督学习里 predictor 预训练完就被扔掉,只留 encoder。作者认为这是浪费,提出 IWM:在 i-jepa 的 JEPA 框架基础上,把”action”从纯粹的 mask 扩展成 mask + 光度变换(对齐 BYOL 一类对比学习常用的增强),系统研究”如何学出一个强 world model”以及”学到的 world model 能不能被复用”。这也是 lecun-path-autonomous-machine-intelligence 里 JEPA 蓝图第一次被明确拿来做”world model 复用”这件事的验证。论文进一步把 IWM 定位为连接对比学习(高抽象、predictor 弱/invariant)与 MIM(低抽象、predictor 强/equivariant)之间的一个可调谱系:调 predictor 容量就能在两端之间插值。

模型架构

沿用 JEPA(i-jepa)范式:encoder $f_\theta$(在线)+ EMA teacher $f_\theta^{\text{EMA}}$(防坍缩)+ predictor $p_\phi$(world model 本体)。

  • Encoder:ViT-B/16(标准 JEPA 设置)。
  • Predictor 命名法:记作 $\text{IWM}{X,Y}^{Z}$,$X$=predictor 深度,$Y$=embedding 维度,$Z\in{\text{Inv},\text{Equi}}$ 表示学到的是不变(弱)还是等变(强)world model。主实验的两个代表配置:$\text{IWM}{12,384}^{\text{Inv}}$(与 I-JEPA predictor 同规模,12 层/384 维,学出的是弱 world model)和 $\text{IWM}{18,384}^{\text{Equi}}$(18 层/384 维,强 world model)。附录 E 的放大实验用 ViT-L/16 encoder + $\text{IWM}{36,512}^{\text{Equi}}$(36 层/512 维)predictor,作者给出经验法则:predictor 参数量/encoder 参数量比例 ≈0.3 时较容易学出好 world model。
  • Action / 条件化 $a_{x\to y}$:包含 source→target 的色彩抖动差异参数以及每种破坏性增强(灰度/模糊/日晒化)是否被应用的标志位。两种条件化方式做了对比(Table 1):
    • Sequence conditioning:把变换参数当作额外 token 加入 predictor 输入,每个 token 过一个独立线性层打破 permutation equivariance;MRR 0.82
    • Feature conditioning(默认):mask token $m$ 与变换向量 $a$ 拼接后过一个 3 层全连接(ReLU,维度 d,d,d),同时注入要预测哪个 patch 的位置编码;MRR 0.79,略低于 sequence 但下游微调效果更好,故作为默认。
    • 不条件化:MRR 0.00,predictor 完全学不会应用变换(退化成纯不变表征)。
  • Source/target 构造:target $y$ = 原图随机裁剪(scale 0.3–1)+ 水平翻转(p=0.5) + 色彩抖动(p=0.8,亮度/对比度强度0.4、色调0.1、饱和度0.2),不加任何破坏性增强以保证 target 信息量最大;source $x$ 在同一基础图上再加一次色彩抖动 + 模糊(p=0.2,半径0.1–2) + 日晒化(p=0.2) + 灰度化(p=0.2)(与 BYOL 增强一致),再叠加 mask(4 个矩形块并集,每块面积占比 0.15–0.2、长宽比 0.75–1.5,对应 patch 从 source 中丢弃,沿用 I-JEPA 的 multi-block masking 作为额外的”action”)。
  • 损失:predictor 输出与 EMA-teacher 编码的 target 表征之间的平方 L2 距离(仅在被遮挡位置 $M_x^C$ 上求和),与 I-JEPA 相同的目标形式。

数据

  • 预训练数据集:单一 ImageNet-1K,无外部数据;主实验统一 300 epoch(部分对比基线用 600/1600 epoch 的 MAE/DINO/iBOT/MOCOv3 结果直接引用自各自论文)。
  • 变换/增强即”数据 mixture”:见上文 source/target 构造;论文在 Appendix C 系统消融了增强强度与概率组合(Table S2,覆盖亮度/对比度/饱和度/色调强度 0.2–0.5、灰度/模糊/日晒化概率 0–0.4 等多档),发现增强越弱越难学出等变 world model(MRR 从 0.79 一路降到 0.02,若把所有强度砍半)。
  • 增强的非对称性(target 无破坏性增强、source 有)是刻意设计:若改成对称增强,学出的不变 world model 在 attentive probing 上掉 2 点、linear probing 掉 1.5 点(Appendix C)。
  • 下游数据:ImageNet-1k(分类:线性/attentive/微调)、ADE20k(分割,UperNet head,160k 迭代)、iNaturalist18(微调 50 epoch)/SUN397(28 epoch)/Places205(12 epoch)(多任务微调 + OOD 泛化,attentive probing)。
  • 无 action 标注、无仿真-真实混合、无跨具身数据——这是纯图像自监督工作,不涉及机器人/视频。

训练方法

  • 目标函数:单一隐空间平方 L2 回归损失,无对比负样本、无像素重建、无额外正则项(防坍缩靠 encoder/EMA-teacher 的非对称设计,继承自 I-JEPA)。
  • 预训练优化:AdamW,lr 1e-3($\beta_1$=0.9, $\beta_2$=0.999),40 epoch 线性 warmup 后 cosine 退火(调度器按 1.25 的 iteration/epoch 比例拉伸,使训练在 lr 降到 0 之前结束),权重衰减按 cosine 从 0.04→0.4
  • World model 质量评估指标:Mean Reciprocal Rank(MRR,借用 Kipf et al. 2019 的 equivariance 评估法)——生成 256 张增强 target 图像的 bank,把 clean 图像表征喂给 predictor 预测目标,在这 256 图的最近邻检索中看目标排第几,MRR→1 说明 predictor 能准确应用变换。
  • Predictor 微调(下游复用协议,核心贡献):把预训练好的 predictor 接到(冻结的)teacher encoder 后面,任务改为”预测一整张未变换的图像”(null 变换参数),再接 attentive head。Table 3 消融:用 teacher 而非 student 输出 +0.3pt;用 null latents(更灵活,不用复用预训练时的具体变换)再 +0.1pt;若只预测单个聚合 token(更省算力)则 -0.5pt。微调训练:100 epoch,AdamW lr 1e-3(若 predictor 是预训练好的则 lr÷10),5 epoch warmup+cosine,weight decay 0.1,drop path 0.2,无 layer-wise lr decay,batch 1024;增强用 RandAugment(rand-m9-mstd0.5-inc1)+CutMix(α=1)+MixUp(α=0.8)+label smoothing 0.1+random erasing(p=0.25)(与 encoder 微调对齐 MAE 协议)。
  • Encoder 微调基线:100 epoch,AdamW lr 2e-3,5 epoch warmup+cosine,wd 0.005,batch 1024,drop path 0.2,layer-wise lr decay 0.65。
  • End-to-end 微调:encoder 和 predictor 各自 lr 都 ÷10,两者合并用统一的 0.9 layer decay,lr 2e-3,其余同 predictor 微调。
  • Multitask predictor tuning(受 prefix-tuning / instruction-tuning 启发):给 predictor 加可学习的 task token,每个任务有独立 head/loss,所有任务的 loss 相加,batch 在任务间均分(每任务 batch 512),训练量等价于 50 个 ImageNet epoch;对照的 4 个单任务 baseline 各自训练相同的总迭代数(所以总计算量与 multitask 打平,但产出 4 个模型而非 1 个)。
  • 分割微调:MMSegmentation + UperNet head,拼接 predictor(或 encoder)最后 4 层,160k 迭代,在 {1e-5, 2e-5, 3e-5} 中选最优 lr,wd 0.01,线性 lr 衰减。

Infra(训练 / 推理工程)

  • GPU 数量、GPU 小时、并行策略、混合精度:论文全文未披露(无类似 I-JEPA README 里”16×A100/72小时”这类硬件说明,附录 A 只给了优化器/数据增强超参,不含集群/精度信息)。
  • 推理 FPS / 控制频率 / 边缘部署:不适用——本工作是图像表征学习论文,不涉及实时推理或具身部署。
  • 论文给出的唯一”效率”证据是参数量而非算力层面的(Figure 3、Table S4):在相同参数量下,predictor 微调比 MAE 的 encoder 微调高约 1 点、比 IWM 自身的 encoder 微调高约 1.5 点;端到端微调的 ViT-B(predictor+encoder 共 121M 参数)以 84.4 反超单独微调的 ViT-L encoder(307M 参数,84.3)。这说明的是”复用 predictor 换算力/参数”的效率,而非训练侧的 GPU 时数。

评测 benchmark

World model 质量(MRR,Table 1/2)

  • 条件化方式:无条件化 0.00,sequence 0.82,feature 0.79。
  • 深度×增强强度(12 层 vs 18 层 predictor):仅 jitter 时 12 层 0.11 / 18 层 0.25;加破坏性增强后 12 层反而掉到 0.09(学不动)而 18 层升到 0.79;再加强 jitter 强度后 12 层 0.81、18 层 0.85——深度不够时无法在复杂变换下学出 equivariant 行为(12 层 5 次里仅 1 次学出 jitter equivariance,18 层 5 次里 4 次)。

Predictor finetuning 消融(Table 3,ImageNet Top-1):默认 82.9 → +teacher 83.2(+0.3) → +null latents 83.3(+0.1) → 只预测单 token 82.8(−0.5,相对默认设置的变体对比)。

ImageNet-1k 微调对比(Table 4,ViT-B/16,300 epoch 除非注明)

方法Encoder 微调冻结encoder+预训练predictor微调End-to-end
MAE(300ep)82.782.482.7 (+0.3 vs 随机init predictor)
MAE(1600ep)83.683.083.1 (+0.1)
I-JEPA(300ep)83.079.180.0 (+0.9)
$\text{IWM}_{12,384}^{\text{Inv}}$83.380.581.3 (+0.8)
$\text{IWM}_{18,384}^{\text{Equi}}$82.981.583.3 (+1.8)

只有 equivariant 的 IWM 在”预训练 predictor vs 随机初始化 predictor”上有明显增益(+1.8pt),说明只有学到真正的 world model 才值得复用;MAE/I-JEPA/invariant-IWM 的预训练 predictor 相对随机初始化增益都 ≤0.9pt。

峰值性能对比(Table 5,任意协议下的最优表现 vs 冻结 encoder)

方法冻结Encoder任意协议最优
DINO(1600ep)82.082.8
MOCOv3(300ep)76.483.2
iBOT(1600ep)83.084.0
MAE(1600ep)83.183.6
I-JEPA(300ep)80.082.0
$\text{IWM}_{12,384}^{\text{Inv}}$81.383.3
$\text{IWM}_{18,384}^{\text{Equi}}$83.384.4

ADE20k 分割(Table 6,mIoU):I-JEPA encoder 44.2 / predictor 45.4 / e2e 45.1;$\text{IWM}{12,384}^{\text{Inv}}$ 45.6/45.7/46.5;$\text{IWM}{18,384}^{\text{Equi}}$ 44.2/46.8/47.0——equivariant IWM 的 predictor 微调大幅超过 encoder 微调。

Multitask 微调(Table 7,$\text{IWM}_{18,384}^{\text{Equi}}$):单任务 vs 多任务:ImageNet 80.8→79.6(−1.2),iNat18 72.4→72.0(−0.4),SUN397 75.6→78.2(+2.6),Places205 64.8→64.1(−0.7),平均 73.4→73.5(+0.1)——多任务单个 predictor 打平 4 个单任务 predictor 的平均表现。

Linear/Attentive probing(Table 8):MoCov3(300ep) 76.3/76.4;MAE(1600ep) 68.0/76.0;I-JEPA(300ep) 70.0/75.0;$\text{IWM}{12,384}^{\text{Inv}}$ 74.5/77.0(逼近对比学习);$\text{IWM}{18,384}^{\text{Equi}}$ 67.5/75.1(更接近 MIM 行为)——印证”invariant world model→高抽象/易 linear probe,equivariant world model→低抽象/需复杂评测头”的谱系假设。

ViT-L/16 放大(Appendix E, Table S4):I-JEPA encoder 84.1/predictor 79.9;$\text{IWM}{18,384}^{\text{Inv}}$ 84.3/81.5;$\text{IWM}{36,512}^{\text{Equi}}$ 83.7/85.0(e2e 85.4)——equivariant predictor 微调反超所有 encoder 微调结果。

OOD 泛化(Appendix F, Table S5,attentive probing,300ep 统一):$\text{IWM}_{18,384}^{\text{Equi}}$ 相对其 invariant 版本在 iNat18 +2.6、SUN397 +0.7、Places205 +1.1,虽然 ImageNet 上不是最优(75.1 vs 77.0),但域外泛化更强。

创新点与影响

贡献(论文自陈):

  1. 提出学习强 IWM 的配方:条件化 + 变换复杂度 + predictor 容量三者缺一不可,否则退化为纯不变表征。
  2. 证明 equivariant world model 可复用于判别式任务:predictor 微调优于 encoder 微调、成本更低,且可扩展到 instruction-tuning 风格的多任务微调而不掉性能。
  3. 证明”world model 容量”直接决定表征抽象层级:控制 predictor 强弱可以在对比学习式(invariant,linear probe 强)和 MIM 式(equivariant,微调峰值强)之间连续插值,为表征学习提供一个可调”抽象度旋钮”。

它改变了什么:把强化学习里”学到的 world model 应被复用做规划”这条经验搬进视觉自监督学习——predictor 不该被预训练完就丢弃,微调它是一种比微调 encoder 更省参数的下游适配范式;同时把 JEPA(i-jepa)的”action”从单纯的空间遮挡扩展为一般化的光度/几何变换族,为后续把 JEPA 类方法扩展到更丰富 action 空间(如 v-jepa 的视频时序 action)提供了方法论参照。

论文自陈的局限

  • 图像上的 world modeling 任务(学会施加颜色/几何变换)本身与大多数下游任务不对齐(不像 LLM 里”预测下一个 token”直接就是下游任务),因此必须依赖 predictor 微调这一”桥梁”,而非直接复用预训练输出。
  • 灰度化不是严格可逆变换,predictor 在”复原颜色”上的可视化预测(Figure 1、Appendix I)存在明显不准确。
  • MoCov3 是唯一一个”接随机初始化 predictor 也不掉分”的基线(论文承认没有定论性解释,猜测与其输出 norm 偏低有关,加归一化也未能解决)——说明”predictor 微调优于随机头”这一现象的普适性边界还不清楚。
  • Broader impact 声明基本是模板化表述,未具体展开。

原始链接

  • 论文(arXiv 2403.00504,v1 2024-03-01):https://arxiv.org/abs/2403.00504
  • PDF:https://arxiv.org/pdf/2403.00504
  • 未找到官方博客 / GitHub 代码仓库 / HuggingFace 页面 / 独立项目页(截至撰写时,Meta 未见 IWM 专属的公开代码或博客;Figure 1 的示意图借用自 2022 年 LeCun “path towards autonomous machine intelligence” 博客的配图,并非本文专属发布渠道)。

一手源存档(sources/)