一句话

JEPA(Joint-Embedding Predictive Architecture,联合嵌入预测架构)是 LeCun 在 2022 年《lecun-path-autonomous-machine-intelligence》里给”自主机器智能”画的那张蓝图的技术内核:在抽象表征空间里预测被遮挡/未观测的内容,而不是在像素/token 空间里重建它。这条路线用一套几乎不变的骨架——context encoder + EMA target encoder(stop-gradient)+ 窄 predictor,损失只在被遮位置的表征上算——从 2023 年图像的 i-jepa 出发,经视频的 v-jepa 长成 2025 年 10 亿参数、能零样本控真机的世界模型 v-jepa-2;同时向控制(dino-wmpldm-planning-latent-dynamicsjepa-vla)、理论(lejepa)、以及六种全新感官模态(音频 a-jepa、音乐 stem-jepa-music、点云 point-jepa、fMRI brain-jepa、EEG s-jepa-eeg、表格 t-jepa-tabular)扩散,最后连语言(llm-jepa)和推理(jepa-reasoner)都被这套”预测表征”的思想收编。本页把这 18 个同属 category: jepa 的工作按主脊 + 支流梳理成一条完整谱系,并逐维对齐它们的架构、数据、训练与关键数字,与像素级生成式世界模型(Cosmos / GAIA-2 / Genie / Dreamer 一脉)做正面对照。


谱系总览:一条主脊 + 五条支流

整个家族可以用一句话概括:“预测应发生在表征空间”这一条原则,被反复实例化到不同的模态、不同的条件信号、不同的下游目的上。所有分歧都只是”如何遮、遮什么、predictor 条件在什么上、学到的 predictor 拿去干什么”的差异,主体框架惊人地一致。

按血缘和用途,18 个成员可分成六组:

(同在 world-model scope、但归在 method 类的 jepa-t-text-to-image 文生图、jepa-speech-tokenizer-daam 语音 tokenizer,以及 2026 年的后续分析 when-does-lejepa-learn-world-model 属邻接工作,谱系上一脉相承,本页在末尾一并勾连。)

时间线

时间工作机构模态 / 用途在谱系里的角色
2022lecun-path-autonomous-machine-intelligenceMeta蓝图(position paper)提出 JEPA 概念与”非生成式世界模型”路线
2023-01i-jepaMeta FAIR图像JEPA 首个实例;predictor = “原始 world-model”
2023-07mc-jepaMeta FAIR / Inria视频 + 图像运动(光流)+ 内容双目标支线
2023-11a-jepaKunlun音频频谱首次进音频;课程式掩码
2024-02v-jepaMeta FAIR视频主脊第二棒;特征预测 ≠ 必须重建像素
2024-03iwm-learning-leveraging-world-modelsMeta FAIR图像把 predictor 学成可复用的等变世界模型
2024-03s-jepa-eegDonders / InriaEEG空间块遮蔽;跨数据集迁移探索
2024-04point-jepaSaint Mary’s点云贪心排序器破解置换不变性
2024-08stem-jepa-musicSony CSL多轨音乐首次把 predictor 用于推理阶段
2024-09brain-jepaNUSfMRI梯度定位 + 时空掩码;NeurIPS Spotlight
2024-10t-jepa-tabularParis-Saclay表格[REG] token 防坍缩
2024-11dino-wmNYU / Meta FAIR控制(离线规划)冻结 patch 特征 + 动作条件动力学 + MPC
2025-02pldm-planning-latent-dynamicsNYU / Meta FAIR控制(无奖励导航)系统证明”预测式 SSL > 重建式”于规划
2025-02intuitive-physics-vjepaMeta FAIR视频诊断VoE 探针,98% IntPhys
2025-06v-jepa-2Meta FAIR视频 → 世界模型主脊第三棒;1B 参数、零样本控真机
2025-09llm-jepaBrown / NYU / Atlassian语言JEPA 作为 LLM 训练辅助目标
2025-11lejepaBrown / Meta FAIR理论各向同性高斯 + SIGReg,单超参、可证明
2025-12jepa-reasoner未披露推理隐空间推理与 token 生成解耦
2026-02jepa-vla学术(未核实)机器人策略V-JEPA 2 特征注入 VLA

设计范式:所有 JEPA 共享的骨架

在拆解个体之前,先把这 18 个工作反复复用的那套”配方”提炼出来——理解了它,后面每一个成员都只是在填空。

① 三网络结构(context / target / predictor)。 几乎每个成员都是这三件套:context encoder $f_\theta$ 只看可见部分;target encoder $f_{\bar\theta}$ 是 context encoder 的指数滑动平均(EMA)副本、不回传梯度、处理完整输入;predictor $g_\phi$ 从 context 表征去预测 target 表征。i-jepa 定了型,v-jepa / v-jepa-2 / a-jepa / point-jepa / brain-jepa / t-jepa-tabular / stem-jepa-music 全部照搬。少数例外:dino-wm 直接冻结现成的 DINOv2 当 encoder、不训 target encoder;lejepa 干脆证明对图像 JEPA 而言 predictor 和 teacher-student 可以删掉

② 在表征空间遮、在表征空间预测(contextualized targets)。 关键不是”遮输入”,而是”target 取自 target-encoder 对完整输入输出上的被遮位置”。i-jepa 的消融把这点钉死:遮 target-encoder 输出而非遮输入,1% ImageNet 从 56.1 涨到 67.3;在表征空间 vs 像素空间预测,66.9 vs 40.7。这是 JEPA 语义性的根本来源,也是它区别于 MAE 一类像素重建的分水岭。

③ predictor 被”条件化在要预测什么上”——这就是 JEPA 里的”action”。 静态图像里这个条件退化成目标位置的 mask tokeni-jepa 建模的是空间不确定性);视频里是3D 时空坐标v-jepa);到了 v-jepa-2-AC 才是真正的 7 维末端执行器动作iwm-learning-leveraging-world-models 把它一般化成光度/几何变换参数stem-jepa-music被省略乐器的类别标签dino-wm / pldm-planning-latent-dynamics连续控制动作。“predictor 条件在 z 上预测未观测内容”这一句话,串起了从静态图到机器人的所有变体。

④ 防坍缩(anti-collapse)是永恒的工程主线。 基础解法是 EMA + stop-gradient + 窄 predictor 瓶颈,几乎所有成员通用。但不同模态要加料:mc-jepapldm-planning-latent-dynamicsVICReg 方差-协方差正则(PLDM 去掉方差项成功率从 98 崩到 13);t-jepa-tabular 发现表格上 EMA+stop-grad 不够、必须再拼一个 [REG] token 才能逃出初始坍缩(并复现了 I-JEPA 缩小 batch 时也坍缩);lejepa 则从第一性原理给出终极答案——用 SIGReg 把 embedding 逼到各向同性高斯,一步到位、可证明。

⑤ 窄 predictor 是反复出现的最优点。 i-jepa 消融:predictor 宽度 384(瓶颈)70.7 > 1024 的 68.4。v-jepa / v-jepa-2 / point-jepa / stem-jepa-music 全部用 384-ish 维、6–12 层的窄 predictor;v-jepa-2 更是把 predictor 固定成 22M ViT-s,不随 1B 编码器放大。

⑥ 损失函数的演化:L2 → L1 → cosine。 i-jepa 用平方 L2;v-jepa 起换成 L1(更稳定)v-jepa-2 / s-jepa-eeg / a-jepa 沿用;point-jepa 用 Smooth L1;stem-jepa-music 用归一化 MSE;到了语言域,llm-jepa / jepa-reasoner 改用 cosine 相似度llm-jepa 消融显示 cosine 71.5、ℓ2 距离灾难性失败 2.2)。

骨架对齐表

组件典型做法谁不一样
target encodercontext encoder 的 EMA 副本,stop-gradientdino-wm 冻结现成 DINOv2;lejepa 删掉
predictor窄 ViT / MLP,embed dim ≈384stem-jepa-music 用 6 层 MLP;pldm-planning-latent-dynamics 用 GRU/卷积/MLP
”遮”什么multi-block 空间/时空掩码stem-jepa-music 省略整个乐器分轨;dino-wm/pldm-planning-latent-dynamics 不遮、改自回归预测下一帧
predictor 条件 z位置 mask tokenaction(v-jepa-2-AC/dino-wm/pldm-planning-latent-dynamics)、变换参数(iwm-learning-leveraging-world-models)、乐器标签(stem-jepa-music
防坍缩EMA + stop-grad + 窄瓶颈+VICReg(mc-jepa/pldm-planning-latent-dynamics)、+[REG](t-jepa-tabular)、SIGReg(lejepa
损失L2→L1cosine(llm-jepa/jepa-reasoner)、Smooth L1(point-jepa)、归一化 MSE(stem-jepa-music
评测冻结主干 + 线性/attentive probedino-wm/pldm-planning-latent-dynamics 直接 MPC 规划成功率

主脊:I-JEPA → V-JEPA → V-JEPA 2

这三棒是整条谱系的承重墙,也是”表征学习 → 世界模型”这一跃迁的完整轨迹。

i-jepa(2023,图像,静态空间不确定性) 是把 LeCun 蓝图落到图像上的第一个实例。给一张图,从一个信息丰富的 context block(scale 0.85–1.0)出发,预测 4 个 target block(scale 0.15–0.2)在表征空间里的表征。它非生成、非对比、不用任何手工数据增强(预训练只有 masking)。论文里 predictor 被明确称作”一个原始的、受限的 world-model”——它建模的是静态图的空间不确定性,RCDM 可视化显示它能在正确 pose 上补出物体部件、丢弃背景细节。ViT-H/14(632M)用 16×A100 在 <72 小时、<1200 GPU 小时内训完,ImageNet 线性探针 79.3%(H/16-448 达 81.1,追平用增强的 iBOT/DINO),比 MAE 省一个数量级算力。

v-jepa(2024,视频,时空外观+运动) 回答一个尖锐问题:用现代工具,纯特征预测作为独立视频自监督目标到底有多强?答案是——不重建像素也能同时学懂外观(Kinetics-400)和运动(Something-Something-v2,必须理解时序)。它把 i-jepa 的 L2 换成 L1,用 3D multi-block 掩码(平均遮 ~90%,块沿整个时间维拉通以抑制冗余泄漏),只用 200 万条公开视频(VideoMix2M)、9 万步就打平甚至超越数十亿样本的像素/图文模型。它还确立了 attentive probe 这一”把非归一化 JEPA 表征用起来”的关键评测协议(对 ViT-L 相对 average pool 在 K400 +17.3)。样本效率是杀手锏:只”看过” 2.1 亿样本,比 OpenCLIP(390 亿)少两个数量级。官方博客把 predictor 称作”一个早期的物理世界模型”。

v-jepa-2(2025,视频 → 能规划的世界模型) 是主脊的规模化与”兑现”:把预训练扩到 >100 万小时视频 + 100 万图(VideoMix22M,2200 万样本)、编码器到 10 亿参数 ViT-g,用 3D-RoPE 稳住大模型训练、渐进分辨率省 8.4× 算力。真正的突破在第二阶段——冻结编码器,只用不到 62 小时无标注 Droid 机器人视频后训练一个 3 亿参数动作条件预测器 V-JEPA 2-AC,在表示空间里用交叉熵方法(CEM)+ MPC 做规划,实现 Franka 机械臂零样本抓取与拿放(不采部署环境数据、无奖励、无任务专属训练)。它同时在动作识别(SSv2 77.3)、动作预判(EK100 recall@5 39.7,较前 SOTA 相对 +44%)、视频问答(8B 档多项 SOTA)三线刷榜。规划成本:每个动作 16 秒(RTX 4090)vs 生成式 Cosmos 的 4 分钟——快 15×

主脊头对头

维度i-jepav-jepav-jepa-2
时间 / 机构2023-01 / Meta FAIR2024-02 / Meta FAIR2025-06 / Meta FAIR
模态静态图像视频视频 + 图 → 世界模型
编码器ViT-B/L/H,最大 H/14 632MViT-L 200M / H 630MViT-g 1B + 预测器 ViT-s 22M
predictor窄 ViT,384 维,6–16 层窄 ViT,384 维,12 层ViT-s 22M(固定);AC 阶段 ~300M
位置编码绝对 sin-cos绝对 3D sin-cos3D-RoPE(稳大模型)
数据IN1K / IN22K(128 万 / 1400 万图)VideoMix2M(200 万视频)VideoMix22M(2200 万样本,>100 万小时)
“action”位置 mask token(空间不确定性)3D 时空坐标7 维末端执行器动作(AC 阶段)
损失平方 L2L1L1(掩码去噪 + AC 两步 rollout)
掩码multi-block(4 target + 1 context)3D multi-block ~90%multiblock,空间尺度 [0.15,0.7]
训练量H/14 300 ep,<1200 GPU-h,16×A10090K 步,bs 3072,A100252K iter 渐进分辨率,A100(全直训需 ~60 GPU-年)
EMA0.996→1.00.998→1.00.99925 固定(简化掉 ramp)
头条数字IN1K linear 79.3(H/14)/ 81.1(H/16-448)K400 81.9 / SSv2 72.2 / IN1K 77.9(H/16-384)SSv2 77.3 / EK100 R@5 39.7 / 零样本 pick-&-place 80%
规划无(纯感知)无(纯感知)CEM+MPC,16 秒/动作,真机零样本

一条清晰的技术曲线:遮的维度从空间 → 时空 → 时空+动作;predictor 的条件从位置 → 坐标 → 真实动作;产物从表征编码器 → 表征编码器 → 能闭环控制机器人的世界模型。作者们反复自陈的三大待解——数据多样性不足、时间尺度短(几秒)、只做感知不做规划——正好被下一棒逐一啃掉。


控制与规划支线:世界模型的兑现

如果说主脊证明了”JEPA 能学好表征”,这条支线证明的是”这些表征真能当世界模型用来规划、控制真机”。它们共享一个反主流的主张:在潜空间而非像素空间建模,让 MPC 这种测试时优化变得便宜又精确

dino-wm(2024) 把这条路走得最干净:直接冻结现成的 DINOv2 ViT-S/14 patch 特征(256 patch × 384 维,全程不训 encoder),只学”给定历史 patch 特征 + 动作 → 下一帧 patch 特征”的动作条件 ViT 转移模型,纯潜空间 MSE、完全不重建像素。测试时把任务表述成”到达目标观测”,用 CEM+MPC 在潜空间零样本规划——不需要奖励、逆模型、专家演示。它把世界模型同时和”在线 RL 的任务特定工具”(Dreamer/IRIS)与”昂贵的像素生成”(GAIA/UniSim/Sora 类)区分开。关键实证:patch 特征 ≫ 全局向量(Push-T 成功率 0.90 vs R3M 的 0.42),接触密集操作任务上大幅领先。

pldm-planning-latent-dynamics(2025) 把”数据质量对离线学习范式的影响”第一次做成系统受控实验(23 个数据集),并给出方法 PLDM:JEPA 学隐动力学 + MPPI 规划。它用极小的模型(Two-Rooms 版仅 220 万参数、Diverse Maze 版仅 5.4 万参数)证明”小模型 + 好目标”也能规划,在数据稀缺、低质量、短轨迹、跨布局四类场景下全面碾压 model-free 的目标条件 RL。它把”预测式 SSL 优于重建式”钉成实验事实:同架构下把 VICReg 换成像素重建,成功率从 97.4 掉到 26.2;改造版 td-mpc2 直接坍缩到 0。换任务只需反转规划代价符号、无需重训。

jepa-vla(2026) 把主脊的产物反哺给机器人策略:诊断出 DINO 系(不变性目标削弱位置敏感度)、CLIP/SigLIP 系(只保留语言提到的语义)都缺”环境理解 + 策略先验”,而 v-jepa-2 的视频预测表征恰好补上。做法是冻结 V-JEPA 2 编码器,用 Flamingo 式门控交叉注意力(每 8 层插一次、低学习率)把它注入现有 VLA,在 LIBERO / RoboTwin2.0 / 真机上取得 6–19 个百分点提升;真机上 1/5 数据即反超全量 baseline。(注:该 arXiv 条目机构未核实、无开源代码,可复现性存疑。)

控制支线头对头

维度dino-wmpldm-planning-latent-dynamicsv-jepa-2-ACjepa-vla
编码器冻结 DINOv2 ViT-S/14从零训(Impala/卷积/MLP)冻结 V-JEPA 2 ViT-g 1B冻结 V-JEPA 2
转移/预测器动作条件 ViT depth-6GRU/卷积/MLP + ensemble~300M ViT,block-causal门控交叉注意力融合层
参数量轻量(depth-6 ViT)5.4 万–220 万1B 编码器 + 300M 预测器依基座(Basic VLA / OpenVLA-OFT)
数据离线仿真轨迹(1K–18.5K 条/环境)无奖励导航(23 数据集)<62 小时 Droid 视频LIBERO / RoboTwin2.0 / 真机
动作GT 动作,MLP 编码后拼 patch连续动作拼预测器输入7 维末端执行器V-JEPA 2 表征作条件
规划器CEM + MPC(潜空间 MSE 成本)MPPI + ensemble 不确定性CEM + MPC(目标条件能量 L1)无(模仿学习策略)
重建像素否(解码器仅可视化)
头条数字Push-T SR 0.90 / Rope CD 0.41Two-Rooms 97.8% / 换任务零重训真机 pick-&-place 80% cupLIBERO(OFT) +6.1 / RoboTwin Easy +18.7
硬件单张 H100单张 V100,≤1 天A100 训练 + RTX 4090 规划未披露

方法与理论支线:IWM · MC-JEPA · LeJEPA

这三个不换模态,而是往 JEPA 的”方法学根部”钻。

iwm-learning-leveraging-world-models(2024,IWM) 问了个尖锐问题:RL 里学到的世界模型会被复用做规划,为什么视觉 SSL 里 predictor 预训练完就被扔了?它把 i-jepa 的”action”从纯 mask 一般化成一整族光度变换(色彩抖动、灰度、模糊、日晒化),证明只要 predictor 被正确条件化、变换足够复杂、predictor 容量足够大(经验法则:predictor/encoder 参数比 ≈0.3),就能学出一个可微调复用等变(equivariant)世界模型——微调这个 predictor 去做分类/分割,比微调 encoder 更省参数、效果更好(IWM$^{Equi}_{18,384}$ 峰值 IN1K 84.4)。它还给出一个”抽象度旋钮”:调 predictor 强弱,能在对比学习式(不变、linear probe 强)和 MIM 式(等变、微调峰值强)之间连续插值。

mc-jepa(2023) 是主脊之外最早的支线,走”运动 + 内容”双目标:一个共享 ConvNeXt-T(23M)同时从视频自监督学光流(基于 PWC-Net)、从 ImageNet 用 VICReg内容特征。核心论断是两者互相帮助——学光流这个像素级预测任务显著提升了内容特征在分割上的表现(相对纯 VICReg 大幅上涨,Pascal VOC 67.1 mIoU、DAVIS 70.5)。它是 JEPA 谱系里唯一显式建模像素级光流的成员;后来的 v-jepa 选了不同路线(不显式建模光流,改在特征空间做更大范围时空掩码)。

lejepa(2025) 是 Balestriero 与 LeCun 给整个家族补的理论地基。它先证明各向同性高斯是让下游任意任务风险最小的最优 embedding 分布,再用新目标 SIGReg(Sketched Isotropic Gaussian Regularization,球面 Cramér-Wold 切片 + Epps-Pulley 特征函数检验) 把 embedding 逼到这个分布。结果是一个只有 1 个超参、O(N) 线性复杂度、约 50 行核心代码、彻底删掉 stop-gradient / teacher-student / EMA 调度器 / register token 的 JEPA——ImageNet-1k 冻结线性探针 ViT-H/14 达 79%,且训练 loss 与下游精度的相关系数达 99%(首个可无标签交叉验证的 SSL 损失)。它直接反驳了”防坍缩只能靠打地鼠式启发式”的现状。

方法/理论支线头对头

维度iwm-learning-leveraging-world-modelsmc-jepalejepa
核心命题predictor 是可复用的等变世界模型运动学习提升内容特征各向同性高斯是最优 embedding 分布
backboneViT-B/16(+ ViT-L 放大)ConvNeXt-T 23M任意(60+ 架构开箱)
“action”/额外信号光度/几何变换参数光流(下一帧预测)无(DINO 式多视图)
防坍缩EMA + 非对称增强每层 VICReg + LayerNormSIGReg(1 超参,可证明)
关键数字IWM$^{Equi}$ IN1K 峰值 84.4;predictor 微调 > encoder 微调VOC 67.1 / DAVIS 70.5 mIoU;光流 KITTI15 EPE 2.67ViT-H/14 IN1K 79%;train-loss↔acc ρ 99%
硬件未披露8×V100 单机未披露(SIGReg 微基准 O(N))
训练量IN1K 300 ep100 ep(光流延迟到第 10 ep 引入)IN1K ViT-L 100 ep(比 I-JEPA 少 3×)

模态扩展:同一配方,六种新感官

这六个工作是 JEPA 通用性的最好证明。它们的共同套路是——“JEPA 主体不动,只为新模态设计一个领域特定的前置步骤”(tokenizer / 排序 / 位置编码 / 掩码定义),来解决该模态相对图像缺什么。

  • a-jepa(音频):把音频转 Mel 频谱切 patch。难点是频谱时频局部强相关、随机块太容易”猜出”,解法是课程式掩码(随机 block 由易到难退火到时频感知掩码)+ 微调期正则化掩码。ViT-B、仅 AudioSet 预训练,AS-2M 48.6 mAP,超 Audio-MAE +1.3。
  • stem-jepa-music(多轨音乐):难点是没有天然掩码,解法是用”从混音里省略一个乐器分轨”充当遮挡、用被省乐器类别标签条件化 predictor。它是家族里首次把 predictor 用于推理阶段(检索缺失分轨)的工作。MUSDB18 分轨检索 R@1 33%(AutoMashupper 仅 1%)。
  • point-jepa(点云):难点是置换不变、无自然序,无法切空间连续块。解法是贪心排序器(从坐标和最小的点出发、每步选最近邻,让索引相邻≈空间相邻),比 z-order/Hilbert 曲线又快又准。ModelNet40 线性 SVM 93.7%,预训练仅 7.5 小时。
  • brain-jepa(fMRI):难点是 ROI 空间无自然序、功能分区≠解剖分区。解法是 Brain Gradient Positioning(用功能连接梯度做位置编码)+ Spatiotemporal Masking(Cross-ROI/Time/Double-Cross 三区定向采样)。UKB 4 万受试者预训练,跨种族泛化(白人训、亚洲测仍超 BrainLM)。NeurIPS 2024 Spotlight。
  • s-jepa-eeg(EEG):难点是电极空间不规则。解法是逐通道独立编码 + 空间块遮蔽(按电极半径遮一整片),目标是应对跨数据集通道集合变化。OpenBMI 54 受试者,ERP 97% AUC。探索性小规模研究。
  • t-jepa-tabular(表格):难点是异质特征、难构造增强、且会坍缩。解法是每特征独立线性嵌入 + [REG] token 防坍缩(这是 I-JEPA/V-JEPA 都不需要的新发现)。让 ResNet 在 6 个基准上整体持平/超过 XGBoost/CatBoost,总算力仅 ~8.9 GPU-h。

模态 JEPA 头对头

工作模态领域特定前置步骤encoder损失防坍缩加料头条数字数据 / 算力
a-jepa音频频谱课程式掩码(随机→时频)ViT-B 86ML2AS-2M 48.6 mAPAudioSet;未披露
stem-jepa-music多轨音乐省略乐器分轨=掩码ViT-B(768)归一化 MSEMUSDB18 R@1 33%Sony 专有 1350h;A100×4 天
point-jepa点云贪心排序器ViT depth12 384Smooth L1ModelNet40 SVM 93.7%ShapeNet 42K;7.5h
brain-jepafMRI梯度定位 + 时空掩码ViT-B 86ML2HCP-Aging 性别 81.5%UKB 4 万人;4×A100
s-jepa-eegEEG逐通道编码 + 空间块遮蔽5-CNN + 8 层 TransformerL1ERP 97% AUCOpenBMI 54 人;单机 ~12h
t-jepa-tabular表格逐特征嵌入 + [REG] tokenTransformer(隐维≤128)L2[REG] tokenResNet 超 XGBoost6 数据集;~8.9 GPU-h

一个跨模态的共性结论:几乎每篇都报告”隐空间预测在冻结/线性探测场景下优于像素/输入空间重建”,这正是 i-jepa 最初卖点在新模态上的反复复现。


语言与推理:JEPA 出图像

家族最新的野心是把”预测表征”搬进语言和推理——这里 JEPA 遇到 next-token prediction(NTP)这个绝对主流,两者的关系成了核心张力。

llm-jepa(2025) 的策略是不取代、只叠加:保留标准 NTP 损失,额外加一个 JEPA 项,让同一知识的两个”视图”(如自然语言 ↔ 对应正则/SQL/代码)在嵌入空间互相预测。它复用 LLM 自身当 encoder(取最后 token 隐状态)和 predictor(追加 tied-weight 的 [PRED] token),用 cosine 相似度。在 Llama-3/Gemma-2/OLMo-2 等四大家族、多数据集、全量与 LoRA 微调上都稳定超过纯 NTP(NL-RX-SYNTH:57.29→71.46),且更抗过拟合。工程上从 v1 的 3 次前向优化到 v2 自定义 attention mask 的 2 次前向,再用 Loss Dropout 压到 1.25×。它给出可解释证据:JEPA 项把 Text→Code 映射压进近乎线性、维度极低的子空间。

jepa-reasoner(2025) 更激进,直接替换生成机制:把”推理”和”说话”拆成两个模型——一个改造过的 JEPA 在归一化连续隐球面上自回归生成推理链(不经任何 token 采样),再交给独立的 Talker 模型翻译成文本。用概率因式分解 P(R,X)=P(R)·P(X|R) 证明这带来 Error Containment(token 采样误差没有数学路径反向污染推理轨迹)。EMA target encoder(momentum 0.98)+ scaled cosine 损失(k=4)。0.9B 组合模型 GSM8K 8-shot 51.9%,相对同数据耦合基线 +149.5%,反超参数量大 4 倍的 Gemma 3。(注:论文自身存在两处内部数值矛盾,且无开源、机构未披露。)

这两者与 i-jepa 的血缘:llm-jepa 明确承接 LeCun 世界模型蓝图,把视觉验证过的 JEPA 目标”原样”搬进语言而不改生成方式;jepa-reasoner 则批评 i-jepa/v-jepa-2 的 predictor 本质是”填空”、不具生成能力,把 JEPA 从”target-conditioned 填空”改造成”自回归生成”。

此外,同在 world-model scope 的邻接工作还把 JEPA 推向文生图jepa-t-text-to-image:带文本融合的 JEPA 图像生成)与语音 tokenizerjepa-speech-tokenizer-daam:JEPA 作神经 tokenizer 学鲁棒语音表征),以及 2026 年对 lejepa 何时学到世界模型的追问(when-does-lejepa-learn-world-model)——它们在类目上归 method、不在本页 18 个成员之列,但技术上一脉相承。


诊断:直觉物理探针

intuitive-physics-vjepa(2025)不是新模型,而是给 v-jepa 做的一次纯诊断,值得单列,因为它给”JEPA 是不是真世界模型”提供了最有说服力的证据链。它用发展心理学的预期违背(violation-of-expectation, VoE) 范式:不做任何微调,直接让冻结的 V-JEPA 对配对视频(一个符合物理、一个违反)算”惊讶度”(预测误差)。结果 V-JEPA 在 IntPhys 零样本 98%、GRASP 66%、InfLevel-lab 62%,而像素预测的 VideoMAEv2 和两个前沿多模态大模型(Qwen2-VL、Gemini 1.5 pro)全部接近随机 50%

结论极强:“在学习到的表征空间做预测”这一原则本身(而非任何硬编码的物体/几何先验),足以让神经网络涌现出物体恒常性、连续性、形状恒定——哪怕只用 1.15 亿参数或仅 128 小时唯一视频。这为”核心知识非必需、直觉物理可从通用学习原理涌现”提供了实证,也把 VoE 探针确立为评测 JEPA 类世界模型物理理解的标准工具(v-jepa-2 随论文发布的 IntPhys 2 / MVPBench / CausalVQA 基准即沿用此思路)。局限也诚实:涉及物体交互的属性(solidity、collision)接近随机,记忆窗口只有 3–4 秒。


生成式 vs 预测式世界模型:路线之争

JEPA 谱系的身份认同,很大程度上是靠对立于像素级生成式世界模型来定义的。这条对照贯穿多个成员的”背景与定位”:

核心权衡:

预测式(JEPA 谱系)生成式(像素/token 世界模型)
建模空间抽象表征空间像素 / 离散 token 空间
对待不可预测细节主动丢弃(草叶精确位置)必须死磕重建
代表i-jepa/v-jepa/v-jepa-2/dino-wmcosmos-predict2-5-world-simulation/genie-3/dreamer-v3/diamond/decart-oasis
可观看性弱(需另训扩散 decoder 才能可视化)强(像素级、可交互)
规划成本低(v-jepa-2 16 秒/动作)高(Cosmos 4 分钟/动作,一次 pick-&-place >1 小时)
闭环控真机已验证(v-jepa-2-AC 零样本 Franka)极少(V-JEPA 2 论文称用 Cosmos 控真机”据我们所知是首次尝试”,且 0% 成功)
物理理解探针V-JEPA 98% IntPhysVideoMAEv2 接近随机

一句话:JEPA 阵营赌的是”控制/规划任务不需要逐像素想象未来,只需要在表征空间预测可预测的部分”;这个赌注在 v-jepa-2 的真机实验和 intuitive-physics-vjepa 的物理探针上拿到了最强证据。但要”可观看、可交互”的场景(游戏、可控视频生成),生成式仍不可替代——两条路线是互补而非你死我活。


家族走向

综合 18 个成员各自的”未来工作”与已经发生的后续,JEPA 谱系正沿五个方向推进:

  1. 动作条件 + 规划 + 规模化的合流。 主脊已经从纯感知(i-jepa/v-jepa)走到能控真机(v-jepa-2-AC),控制支线(dino-wm/pldm-planning-latent-dynamics)证明潜空间 MPC 的性价比。官方 2026-03 已发布 V-JEPA 2.1(Dense Predictive Loss + Deep Self-Supervision,规模扩到 ViT-G 2B),主攻时间一致的 dense features——下一步是更长时程规划(破自回归误差累积)、语言指定任务(当前只支持图像目标)。
  2. 理论收口。 lejepa 把”防坍缩靠启发式”变成”朝确定目标(各向同性高斯)优化”,when-does-lejepa-learn-world-model 进一步追问它何时真学到世界模型——预示 JEPA 从”配方工程”走向”有保证的设计”。
  3. predictor 从一次性辅助信号变成一等产物。 iwm-learning-leveraging-world-models 微调复用 predictor、stem-jepa-music 推理期用 predictor 检索——“别把预训练完的 predictor 扔了”正在成为共识。
  4. 模态还在铺开,套路已成模板。 “JEPA 主体不变 + 领域特定前置步骤”这个模板(point-jepa 排序、brain-jepa 梯度定位、t-jepa-tabular [REG] token)几乎可以机械地套到任何新模态;文生图(jepa-t-text-to-image)、语音 tokenizer(jepa-speech-tokenizer-daam)已经在路上。
  5. 向语言/推理的收编仍处早期。 llm-jepa 的最大局限是依赖数据天然的”两视图”结构(尚无类似视觉数据增强的通用机制);jepa-reasoner 的”隐空间独立想、Talker 独立说”闭环尚未验证。这是家族目前最不确定、也最有想象空间的边疆。

一句话收束:i-jepa 那个”原始而受限的 world-model”到 v-jepa-2 那个能零样本抓杯子的 10 亿参数世界模型,JEPA 用同一句原则——“在表征空间预测,别重建像素”——把 LeCun 2022 的蓝图从一张图纸变成了一条真在生长的技术谱系。


一手源