一句话定位

Meta FAIR 用发展心理学的”预期违背”(violation-of-expectation, VoE)范式给 v-jepa 做了一次纯诊断性评测:不做任何任务专门训练/微调,直接让冻结的 V-JEPA 编码器+predictor 对配对视频(一个符合物理、一个违反物理)分别算”惊讶度”(预测误差),结果 V-JEPA 在 IntPhys 上零样本 98% 准确率、GRASP 66%、InfLevel-lab 62%,而像素预测的 VideoMAEv2 和两个多模态大模型(Qwen2-VL、Gemini 1.5 pro)都接近随机猜测的 50%——证明”在学习到的表征空间里做预测”这一目标本身,而非任何硬编码的物体/几何先验,足以让神经网络涌现出物体恒常性、连续性、形状恒定等直觉物理理解,哪怕只用 1.15 亿参数的小模型或仅 128 小时唯一视频训练。

背景与定位

直觉物理理解(物体不会凭空消失、不会穿墙、不会突变形状)长期被认为需要”核心知识”(core knowledge)——一套人类与灵长类/海洋哺乳动物/鸦科/雏鸡与生俱来的先天认知系统(Baillargeon, Spelke 等发展心理学文献)。此前 AI 路线分两派:结构化模型(手写 3D 物体/几何表示,如 Battaglia 2013 的”心智游戏引擎”)和像素生成模型(在像素空间重建未来帧,如早期 video prediction 工作)。本文研究第三条路——JEPA(Joint-Embedding Predictive Architecture,LeCun 2022):像结构化模型一样坚持”预测应在抽象表征空间做”,但不手写抽象、而是让 v-jepa 自己从自然视频里学。论文本身不提出新架构,而是把已发布的 v-jepa(Bardes et al. 2024)直接搬到 VoE 诊断任务上做零样本探针,并系统消融数据/模型规模/预训练目标对涌现出的物理理解的影响,同时把像素预测(VideoMAEv2)和文本推理的多模态 LLM(Qwen2-VL、Gemini 1.5 pro)拉来做对照。范式定位:latent-space video prediction as a route to intuitive physics, without core knowledge。发布 2025-02-17,代码与结果开源于 github.com/facebookresearch/jepa-intuitive-physics(CC BY-NC)。

模型架构

本文不改动 v-jepa 架构,直接复用其 context encoder + predictor + EMA target encoder 三件套(细节见 v-jepa 页),关键配置:

  • Backbone:ViT-B/16、ViT-L/16、ViT-H/16 三档编码器;predictor 统一为 12 层、embed dim 384 的窄 ViT。
  • 位置编码改动:与原版 V-JEPA 唯一的架构差异——用 RoPE(theta=10000)替换绝对位置编码,并将 RoPE 拆成 3 份分别编码 高×宽×时间 三个时空维度。
  • 输入:分辨率 224×224,16 帧(等效帧率 5.33 fps,约 3 秒 clip),patch 16×16×2(tubelet size 2)。
  • 训练目标(式 S1):$\lVert p_\phi(f_\theta(V_C)) - f_{\theta^{EMA}}(\bar{V_C})\rVert_1$,即在被 mask 区域的表征空间做 L1 回归;测评时把”mask”换成”用前 C 帧预测后 M 帧”,即可直接量化”惊讶度”$S_t = \lVert p_\phi(f_\theta(V_{t:t+C})) - g_\psi(V_{t:t+C+M})\rVert_1$(式 S2)。
  • Mask 策略三种(消融用):Block masking(8 个 scale-0.15 短程块 + 2 个 scale-0.7 长程块,aspect ratio 0.75–1.5,本文默认);Causal Block masking(在此基础上再全遮最后 4 帧);Random masking(随机遮 90% patch)。
  • 无动作条件:纯观测自监督,没有 action channel;论文讨论部分明确指出这是限制之一(见”创新点与影响”)。

数据

  • 预训练数据:沿用 v-jepa 的 VideoMix2M = Kinetics-710(约 65 万视频,710 类,每条约 10 秒)+ Something-Something-v2(约 20 万条,几秒级,聚焦动作而非物体)+ HowTo100M(约 120 万条教程视频,平均 6 分 30 秒,合计约 15 年唯一视频)
  • 数据消融:分别单独用 K710 / SSv2 / HowTo100M(HT)重新训练 V-JEPA-L,固定计算预算为等效 30 年视频(不足部分靠重复采样补齐)——SSv2 单独训练性能接近随机,K710 显著高于随机,HowTo100M 单独训练分数最高(但 HT 本身也最大:15 年 vs SSv2+K710 合计 3 个月)。进一步对 HowTo100M 做子采样:仅用 0.1%(128 小时唯一视频)在所有属性上仍保持 >70% 的成对准确率,说明数据规模不是关键,数据分布/来源才是。
  • 场景多样性 vs 动作多样性消融(附录 S5):两种降采样方式——① 采样视频子集(降场景多样性),② 每条视频只取中段 X% 帧(降动作多样性)。前者(降场景多样性)在 128 小时唯一视频时仍表现良好;后者(降动作多样性)整体分数低于前者,但即使仅保留 2% 帧(约 2579 小时)仍达到非平凡的良好表现,说明降低场景多样性对性能的损伤小于降低动作多样性
  • 评测数据(三个基准,均为分布外、模型全程冻结、不见任何评测数据):IntPhys(Riochet et al. 2022,合成仿真、像素级配对、开发集约 360 条、3 个属性)、GRASP(Jassim et al. 2024,合成仿真、约 4000 条、10 个属性、单视频设计但本文按配对使用)、InfLevel-lab(Weihs et al. 2022,真实拍摄、约 4000 条、3 个属性,配对视频仅光照不同)。IntPhys 另有私有测试集,每属性 3600 条视频(vs 开发集 120 条),用于对齐官方 leaderboard。
  • 无仿真-真实域适配、无动作标注、无跨具身——这是纯观测表征评测,不是机器人数据。

训练方法

  • 本文不做新训练的核心贡献——V-JEPA 的预训练超参完整沿用 v-jepa 原始配方(AdamW,batch size 3072,90000 步,lr 2e-4→6.25e-4 线性 warmup 12000 步后 cosine 衰减到 1e-6,start/final weight decay 0.04→0.4,EMA momentum 0.998→1.0,schedule 拉伸因子 1.25,bfloat16),唯一改动是位置编码换成 RoPE。消融实验(数据源、模型规模、mask 策略)均复用此配方只变动被消融的单一维度。
  • 评测协议(本文的方法学贡献):对每个属性/数据集单独搜索使窗口长度和上下文长度(C+M 固定、C 可变)最优的超参组合(因为零样本探针没有 a priori 校准);IntPhys 上进一步对每个起始帧 t 取所有上下文长度里的最小惊讶度以省去超参搜索。惊讶度聚合有 Avg(对配对视频分类更优)和 Max(对单视频分类更优,能剔除场景复杂度带来的基线惊讶)两种,论文用统计检验(单尾单样本/双样本 Welch’s t 检验)分别验证两种口径都显著优于零。
  • 多模态 LLM 评测协议:把一对视频连同文字 prompt 一起喂给 Qwen2-VL / Gemini 1.5 pro(论文正文称 Qwen2-VL-7B,但图 S2/S10 标注为 Qwen2-VL-72B,原文本身对模型规模表述不一致,本页不强行统一),要求模型指出哪个视频违反物理定律,答案以视频编号结尾便于解析;温度设为 0;videos 顺序随机打乱去偏;对 Qwen2-VL 额外读取 “1”/“2” token 的归一化概率做更细粒度的惊讶度(发现该概率普遍接近 0.5,即接近抛硬币);Gemini 1.5 pro 约 10–15% 的时候拒答(如回答”两个视频都合理”),计为错误。
  • 无 RL、无蒸馏、无 action tokenization——本文是评测性研究,不引入新训练范式。

Infra(训练 / 推理工程)

  • 训练硬件:沿用 v-jepa 原论文,仅披露 A100 80G + bfloat16;GPU 数量与总 GPU-hours 未披露。
  • 评测硬件/并行:官方评测代码基于 submitit + SLURM 分布式执行;README 建议 IntPhys 测试集评测用 6 tasks_per_node × 1 node(因需整除 30)。
  • 推理:作为表征评测任务,无 FPS / control-Hz / 实时延迟指标(这是离线诊断性评测,非部署系统);边缘硬件未适用。

评测 benchmark

主结果(Figure 1,各方法在三个基准上的成对分类平均准确率,95% CI 经 bootstrap,未训练网络 n=20 用正态假设)

方法IntPhysGRASPInfLevel-lab
V-JEPA98% [95%,99%]66% [64%,68%]62% [60%,63%]
VideoMAEv2(像素预测基线)接近随机接近随机接近随机
Qwen2-VL(原文正文称 7B,图 S2/S10 标注 72B)接近随机接近随机接近随机
Gemini 1.5 pro接近随机接近随机接近随机
未训练网络(随机初始化)接近随机接近随机接近随机

V-JEPA 是唯一在全部三个基准上都显著高于未训练网络的方法。

分属性显著性检验(ViT-L/16,HowTo100M 预训练,Welch’s t 检验,V-JEPA n=5 vs 未训练 n=20,Figure 2):IntPhys 上 Object Permanence M=85.7 vs 51.4(p=4.19e-4,效应量 g=9.0)、Continuity M=86.3 vs 51.2(p=1.61e-4,g=11.0)、Shape Constancy M=83.7 vs 51.7(p=5.96e-4,g=8.1);GRASP 上 Object Permanence(p=5.10e-3)、Continuity(p=1.36e-2)、Support M=98.1 vs 58.4(p=1.48e-12,g=3.9)、Gravity M=74.9 vs 55.3(p=6.83e-8,g=4.5)、Inertia(p=2.36e-4)均显著,但 Color Constancy、Solidity、Collision 未见显著提升;InfLevel-lab 上仅 Object Permanence 显著(p=4.46e-6),Gravity 和 Solidity 因需记忆情境化事件而未见显著提升

IntPhys 私有测试集(Table S4/S5,V-JEPA-H/L,3600 条/属性,对比人类基线与 Riochet et al. 2020 方法):成对分类错误率(Max 惊讶)V-JEPA-H 在 Object Permanence 上 Visible 0.6%/Occluded 8.2%/All 4.4%,均低于人类(Visible 10.0%/Occluded 15.0%/All 12.5%)和依赖预定义分割掩码的 Riochet et al. 2020 方法(All 12.0%);Avg 惊讶口径下 V-JEPA-H 错误率进一步降到 0.0–0.56%。单视频分类(1-AUROC)上 V-JEPA-H 用 Max 惊讶达到与人类相当的水平(Object Permanence All 19.2% vs 人类 24.0%),而 V-JEPA-L 明显落后人类,说明规模在更难的单视频任务上收益更大,在成对任务上收益较小

关键消融数字:mask 策略——Random Masking 相对 Block Masking 仅掉约 5 分(对比经典视频识别任务掉 20 分),Causal Block Masking 反而更差;模型规模——115M 参数的最小模型仍达到 IntPhys 85% 以上准确率;数据规模——128 小时唯一视频(HowTo100M 的 0.1%)即可在所有属性上保持 70% 以上准确率。

InfLevel 情境化事件的重要性(附录 S5):Gravity 和 Solidity 两个属性依赖模型记住实验开始前展示的容器属性(“context event”),若不记得这一情境事件任务本质不可解;把标签按”假设物体未被改动”重新标注后 V-JEPA 和 VideoMAEv2 及未训练网络的分数都显著上升——说明该提升部分来自结构性捷径而非物理理解,作者特别指出这一重标注结果需谨慎看待,continuity 属性的原始结果更可靠。

局限(作者自陈):涉及物体间交互的属性(solidity、collision)接近随机——可能因为训练数据里物体交互频率低;JEPA 记忆有限,每次只能处理约 3–4 秒短片;V-JEPA 无法根据额外情境(如一个正在发生的动作)调节预测,只能作为观察者预测未来。

创新点与影响

  • 贡献:首次系统性地把发展心理学的 VoE 范式用于诊断自监督视频模型的直觉物理理解,证明”预测在学习到的表征空间”这一原则本身(而非任何特定架构设计或硬编码先验)足以涌现物体恒常性/连续性/形状恒定等能力;同时证明像素空间预测(VideoMAEv2)和文本推理的前沿多模态 LLM(Qwen2-VL、Gemini 1.5 pro)在同一诊断下接近随机,形成鲜明对比证据链。
  • 改变了什么:为”核心知识非必需、直觉物理可从通用学习原理涌现”提供了实证支持,挑战发展心理学中”核心知识需硬编码”的假设;确立了 VoE 探针作为评测世界模型/JEPA 类方法物理理解能力的标准工具(后续 v-jepa-2 等工作可复用同一诊断框架);揭示当前生成式视频模型(如 Sora 类,论文提及但因闭源难以严格评测)在物理理解上的证据依然不完整。
  • 作者自陈的局限:① 物体间交互类属性(solidity、collision)接近随机,可能因训练数据中交互样本稀疏;② JEPA 目前记忆窗口短(3–4 秒),长时程物理推理超出能力范围;③ V-JEPA 只能作为纯观察者预测未来,无法根据正在发生的动作调节预测,更复杂的物体交互需要更高阶的层级化 JEPA 或引入 action channel;④ InfLevel 的重标注结果存在捷径学习风险,需要更谨慎的基准设计来隔离真正的物理理解与统计偏差。

原始链接

一手源存档(sources/)

  • intuitive-physics-vjepa—github-readme — facebookresearch/jepa-intuitive-physics README 快照(sources/world-model/2025/intuitive-physics-vjepa—github-readme.md)
  • 论文全文见 arXiv HTML/PDF(arXiv:2502.11831,原文不入 git)