一句话定位

Meta FAIR 于 2025-06 发布的 V-JEPA 2——把 JEPA(联合嵌入预测架构)的自监督视频预训练扩到 超 100 万小时互联网视频 + 100 万张图、编码器规模到 10 亿参数(ViT-g) 的旗舰级非生成式(预测嵌入式)视频世界模型;再冻结编码器、只用 不到 62 小时无标注 Droid 机器人视频 后训练一个 3 亿参数动作条件预测器 V-JEPA 2-AC,在表示空间(latent)里做规划,实现 Franka 机械臂零样本抓取与拿放(不采集部署环境数据、无任务专属训练、无奖励)。它证明了”在学到的表示空间里预测、而不是生成像素”这条路线可规模化,并同时在动作识别(SSv2 77.3)、人类动作预判(EK100 recall@5 39.7,较前 SOTA 相对提升 44%)、视频问答(8B 档多项 SOTA)三条线全面刷榜。

背景与定位

世界模型(world model)要同时做到三件事:理解观测、预测世界(含”我采取动作后世界怎么变”)、并据此规划动作序列达成目标。此前两条主流路线各有短板:

  • 纯交互数据 + 奖励 的经典 model-based RL(Dreamer 系等)——真实交互数据稀缺,难规模化;
  • 动作条件的视频生成世界模型(如 NVIDIA CosmosWayve GAIA-2、Genie 系、Microsoft WHAM)——生成像素代价高、评测多停在”预测画面像不像”,真正用来闭环控制机器人的极少(作者称用 Cosmos 控真机”据我们所知是首次尝试”)。

V-JEPA 2 走的是 LeCun 2022 提出的 JEPA 路线:在学到的表示空间里做掩码预测,而非在像素空间生成。好处是模型只需预测场景中”可预测的部分”(如运动物体的轨迹),主动忽略生成式目标必须死磕的不可预测细节(草叶、树叶的精确位置)。这条”latent 预测式世界模型”与 Genie 3Matrix-GameHunyuan-GameCraft 那类”像素级可观看、可交互”的生成式世界模型形成鲜明对照;在自监督视频表示这一侧,它是 V-JEPA(Bardes et al., 2024)的规模化续作,与同源的 LeJEPA 同属 JEPA 家族。范式命名:action-free 自监督视频预训练 + 少量交互数据后训练的动作条件 latent 世界模型

作者团队含 Yann LeCun、Nicolas Ballas、Michael Rabbat、Adrien Bardes、Mahmoud Assran 等(FAIR + Mila)。

模型架构

整体是”编码器 + 预测器”的元架构,两阶段:先 action-free 预训练得到 V-JEPA 2 编码器,再冻结它训练动作条件预测器 V-JEPA 2-AC。

V-JEPA 2 预训练(第一阶段)

  • 目标形式:表示空间掩码去噪(mask-denoising)。视频切成 tubelet,随机丢弃一部分 patch 得到掩码视图 x,编码器 E(x) 输出各 token 表示,拼上可学习 mask token Δy 后送预测器 P,回归到 EMA-编码器 对完整视频 y 的表示 sg(E_θ̄(y)),L1 损失、只在被掩码 patch 上算;stop-gradient + EMA 防塌缩。
  • backbone:编码器/预测器均为 ViT。用 3D-RoPE 取代绝对 sincos 位置编码——把特征维近似三等分给时间/高/宽三轴分别做 1D 旋转,作者发现这对稳定最大模型的训练很关键。patch/tubelet 尺寸 2×16×16(T×H×W),multiblock 掩码策略。
  • 编码器家族(Table 12):ViT-L 300M(width 1024/depth 24/heads 16/MLP 4096)、ViT-H 600M(1280/32/16/5120)、ViT-g 1B(1408/40/heads 22/MLP 6144);embedder 均为 2×16×16 strided conv。预测器固定为 ViT-s 22M(width 384/depth 12/heads 12/MLP 1536),不随编码器放大。blog 口径”V-JEPA 2 是 12 亿参数模型”应指编码器+预测器合计。

V-JEPA 2-AC 后训练(第二阶段)

  • 冻结 ViT-g 编码器,把每帧独立编码成 16×16×1408 的特征图 z_k;预测器 P 沿时间把 (a_k, s_k, z_k) 交错送入,自回归预测下一帧表示 ẑ_{k+1}。
  • 动作条件方式:action a_k 是相邻帧末端执行器状态之差的 7 维实向量(3 维位置 + 3 维外旋 Euler 角 + 1 维夹爪状态);末端状态 s_k 同为 7 维(相对机器人基座)。action / pose / 展平特征图各用独立可学习仿射变换投到隐维,输出再仿射投回编码器嵌入维。
  • 记忆/一致性机制block-causal 注意力——每个 patch 特征只能 attend 到当前及之前时刻的 action、末端状态、其他 patch 特征。3D-RoPE 施于视频 patch,action/pose token 只加时间轴旋转。
  • 配置:预测器 ~300M 参数,24 层、16 头、隐维 1024、GELU。

数据

预训练数据 VideoMix22M(VM22M,2200 万样本,>100 万小时视频 + 100 万图),五路来源(Table 1,含各自采样权重):

来源样本数类型总时长是否 curation权重
SSv2168KEgoVideo168 h0.056
Kinetics(400/600/700)733KExoVideo614 h0.188
HowTo100M1.1MExoVideo134K h0.318
YT-Temporal-1B (YT1B)19MExoVideo1.6M h0.188
ImageNet1M图像n/a0.250
  • 图像被”时间复制”成 16 帧全相同视频以支持图/视频联合训练;权重靠人工调优。
  • 数据 curation(对 YT1B):YT1B 原始 1.4M 视频小时、几乎无筛选。用 PySceneDetect 抽场景、丢弃 <4s 者 → 保留 316M 场景DINOv2 ViT-L 对每场景中间帧算 embedding,聚成 150 万簇;用 Kinetics/SSv2/COIN/EpicKitchen 作目标分布做基于簇的检索,只保留至少命中一个目标视频的簇 → 约 21 万簇、1.15 亿场景。curation 带来 +1.4 分平均提升;VM22M 相对旧 VM2M +1.0 分(appearance 类任务如 K400/COIN/ImageNet 提升更明显)。
  • V-JEPA 2-AC 数据:Droid 数据集,不到 62 小时无标注视频(丢弃 <4s 片段后),约 23k 条轨迹(含成功与失败);7-DoF Franka Emika Panda + 两指夹爪、遥操作采集、每段 3–4s。采样 256×256、4fps、16 帧片段;只用左外视相机(同时用左右两视且不加相机位置条件会掉点)。“无标注”指不用任务/奖励/成败元数据,只用原始视频 + 末端执行器状态。

训练方法

预训练(warmup-constant-decay 学习率 + 渐进分辨率)

  • 三段式:warmup 12K iter → 恒定 LR 228K iter → cooldown 12K iter(合计 252K iter)。warmup/恒定段用 16 帧 256×256;cooldown 段才把帧数升到 64、分辨率升到 256/384/512,故长时高分辨率的算力开销只在末段付出。
  • 关键超参(Table 9):global batch 3072;LR warmup 1e-4→5.25e-4、cooldown 5.25e-4→1e-6;weight decay 0.04(固定);EMA 0.99925(固定,简化掉了原 V-JEPA 的 ramp-up);空间掩码尺度 [0.15,0.7]、时间掩码尺度 [1,1]、tubelet 2、patch 16。
  • 缩放消融(以 ViT-L/16 在 6 任务上的均值为基线,Figure 3):数据 2M→22M +1.0;模型 300M→1B +1.5;训练 90K→252K iter +0.8;再叠加分辨率 256→384、时长 16→64 帧 → 88.2%,累计 +4.0。渐进分辨率相比全程 64×384×384 直训省 8.4× GPU 时(直训需约 60 GPU-年)。>64 帧(128/256)在这组理解任务上不再有增益。

V-JEPA 2-AC 后训练(AdamW)

  • teacher-forcing 损失 + 两步 rollout 损失(T=2,只对一次递归步反传)之和,均为 L1;编码器保持冻结。
  • warmup LR 7.5e-5→4.25e-4(4500 iter)→ 恒定 85500 iter → decay 到 0(4500 iter);weight decay 0.04;batch size 256;random-resize-crop 长宽比 (0.75,1.35)。

规划(推理期,非训练):给定目标图像,在表示空间最小化目标条件能量 E = ‖P(â_{1:T}; z_k,s_k) − z_g‖_1(世界模型 T 步后想象状态与目标表示的 L1 距离),用交叉熵方法(CEM) 优化动作序列,只执行首个动作再重规划(receding horizon / MPC)。作者观察到能量面平滑且局部凸,利于规划。

Infra(训练 / 推理工程)

  • 预训练算力:论文以 A100 给出 ViT-g 训练时长曲线(Figure 5 中),全分辨率直训约需 60 GPU-年、渐进训练省 8.4×;预训练总 GPU 卡数/GPU-hours 未在正文明确披露
  • VQA 对齐训练:受控对比用 128× H100(有效 batch 256;PyTorch 2.5.1 / Transformers 4.46.0 / FlashAttention-2 / DeepSpeed 0.14.4,基于 LLaVA-NeXT 代码);数据规模化 SOTA 版用 512× H100(Stage 2/3 global batch 2048/1024,基于 PerceptionLM 代码)。
  • 推理 / 规划工程:规划在单张 NVIDIA RTX 4090 上跑。V-JEPA 2-AC 每个动作仅需 16 秒(800 采样、10 次 refinement、规划 horizon=1);对照 Cosmos 每动作 4 分钟(80 采样、10 iter、horizon=1)——一次完整 pick-and-place 用 Cosmos 需一小时以上。机器人以 blocking control 部署、4fps;单个采样动作被约束在 L1 半径 0.075 球内(末端最大位移 ~13cm,因大动作对模型 OOD)。

评测 benchmark

均来自论文一手表格。

动作/物体分类(冻结编码器 + 4 层 attentive probe,6 任务均值,Table 4)

  • V-JEPA 2 ViT-g(256)均值 87.5:SSv2 75.3、Diving-48 90.1、Jester 97.7、K400 86.6、COIN 90.7、IN1K 84.6。
  • V-JEPA 2 ViT-g 384 均值 88.2SSv2 77.3、Diving-48 90.2、Jester 97.8、K400 87.3、COIN 91.1、IN1K 85.1。
  • 运动理解显著领先:SSv2 75.3 vs InternVideo2-1B 69.7 vs PE Core G 55.4;appearance 类具竞争力。

人类动作预判 EK100(mean-class recall@5,Table 5)

  • ViT-g 384:Action 39.7 / Verb 63.6 / Noun 57.1;ViT-g 256 Action 38.0。
  • 较前 SOTA PlausiVL(8B)的 27.6,绝对 +12.1、相对 +44%;且随模型规模近似线性提升。

视频问答(8B 档,Llama 3.1 8B backbone,88.5M 对齐数据,Table 8)

  • V-JEPA 2 ViT-g 384 均值 59.5PerceptionTest 84.0MVP 44.5TempCompass 76.9TemporalBench 36.7TOMATO 40.3、TVBench 60.6、MVBench 73.5。
  • 在 PerceptionTest / MVP / TempCompass / TemporalBench / TOMATO 五项超过 PLM 8B(分别 +1.3/+4.8/+4.2/+8.4/+7.1);TVBench、MVBench 未超 PLM 但仍胜 InternVL-2.5 / Qwen2VL / Qwen2.5VL。核心结论:无语言监督预训练的视频编码器也能对齐 LLM 拿到 SOTA,反直觉。

零样本机器人操作(两实验室 Franka,10 次试验取平均,Table 2)

  • V-JEPA 2-AC 均值:Reach 100%;Grasp Cup 65% / Box 25%;Reach-w/Obj Cup 75% / Box 75%;Pick-&-Place Cup 80% / Box 65%
  • 对照 Octo(在 100 万+ 轨迹 Open-X 上预训练 + Droid 行为克隆)均值 Grasp Cup 仅 15% / Pick-&-Place Cup 15%;V-JEPA 2-AC 各项最高。
  • 与 Cosmos 世界模型对照(Lab 2,Table 3):V-JEPA 2-AC Grasp Cup 60% / Pick-&-Place Cup 80%,Cosmos 对应 0% / 0%,且速度快 15×。

随论文发布三个物理推理新基准(blog):IntPhys 2(直觉物理,arXiv 2506.09849)、Minimal Video Pairs / MVPBench(arXiv 2506.09987)、CausalVQA(因果 VQA,arXiv 2506.09943),并在 HF 建物理推理 leaderboard。人类 85–95%,当前视频模型(含 V-JEPA 2)在 IntPhys 2 上接近随机——凸显差距。

创新点与影响

  • 贡献:首个把 JEPA 自监督视频预训练规模化到 M-hour/B-param 的世界模型,并首次证明在表示空间做规划、只用 <62h 无标注机器人视频即可零样本控真机完成抓取/拿放——把”latent 预测式世界模型”从小规模玩具任务推到真实机器人;同时用一个不带语言监督的视频编码器,在理解、预测、VQA 三线刷榜。
  • 改变了什么:给出生成式视频世界模型之外的高效替代——规划成本从 Cosmos 的分钟级/动作降到秒级,且性能更高,说明”预测嵌入 vs 生成像素”在控制任务上有实用价值差异;也提供了公开可复现的数据(全用公开数据源)与 MIT 许可代码/权重(ViT-L/H/g 及 g-384、V-JEPA 2-AC checkpoint 均开放)。
  • 作者自陈局限:① 对相机位置敏感——无标定,机器人基座常不在画面内导致动作坐标轴推断不良(作者手工试相机位);② 长时规划受限于自回归误差累积 + 动作搜索空间指数增长,目前只到约 16 秒预测跨度,pick-and-place 需人给子目标图;③ 只支持图像目标,尚不能用语言指定任务;④ 编码器仅到 1B 参数,尚未探索更大规模的持续收益(前人已试到 20B)。
  • 后续:官方 2026-03 发布 V-JEPA 2.1(新配方主打高质量、时间一致的 dense features:Dense Predictive Loss + Deep Self-Supervision + 多模态 tokenizer,规模扩到 ViT-G 2B),与本页 V-JEPA 2 为不同版本。

原始链接

一手源存档(sources/)

  • v-jepa-2—blog — Meta 官方 blog 快照(sources/world-model/2025/v-jepa-2—blog.md)
  • v-jepa-2—github-readme — GitHub README 快照(含 checkpoint 表、V-JEPA 2.1 说明;sources/world-model/2025/v-jepa-2—github-readme.md)
  • v-jepa-2—hf-card — HuggingFace 模型卡快照(sources/world-model/2025/v-jepa-2—hf-card.md)
  • 论文全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)