一句话
JEPA(Joint-Embedding Predictive Architecture,联合嵌入预测架构)是 LeCun 在 2022 年《lecun-path-autonomous-machine-intelligence》里给”自主机器智能”画的那张蓝图的技术内核:在抽象表征空间里预测被遮挡/未观测的内容,而不是在像素/token 空间里重建它。这条路线用一套几乎不变的骨架——context encoder + EMA target encoder(stop-gradient)+ 窄 predictor,损失只在被遮位置的表征上算——从 2023 年图像的 i-jepa 出发,经视频的 v-jepa 长成 2025 年 10 亿参数、能零样本控真机的世界模型 v-jepa-2;同时向控制(dino-wm、pldm-planning-latent-dynamics、jepa-vla)、理论(lejepa)、以及六种全新感官模态(音频 a-jepa、音乐 stem-jepa-music、点云 point-jepa、fMRI brain-jepa、EEG s-jepa-eeg、表格 t-jepa-tabular)扩散,最后连语言(llm-jepa)和推理(jepa-reasoner)都被这套”预测表征”的思想收编。本页把这 18 个同属 category: jepa 的工作按主脊 + 支流梳理成一条完整谱系,并逐维对齐它们的架构、数据、训练与关键数字,与像素级生成式世界模型(Cosmos / GAIA-2 / Genie / Dreamer 一脉)做正面对照。
谱系总览:一条主脊 + 五条支流
整个家族可以用一句话概括:“预测应发生在表征空间”这一条原则,被反复实例化到不同的模态、不同的条件信号、不同的下游目的上。所有分歧都只是”如何遮、遮什么、predictor 条件在什么上、学到的 predictor 拿去干什么”的差异,主体框架惊人地一致。
按血缘和用途,18 个成员可分成六组:
- 主脊(视觉自监督表征 → 世界模型):i-jepa(图像)→ v-jepa(视频)→ v-jepa-2(动作条件、规模化、能规划)。这是 Meta FAIR 的正统谱系,也是”JEPA = 世界模型”叙事的承重墙。
- 方法与理论支线:iwm-learning-leveraging-world-models(把 predictor 学成可复用的等变世界模型)、mc-jepa(运动 + 内容双目标)、lejepa(给 JEPA 补上第一套可证明的防坍缩理论)。
- 控制与规划支线(世界模型的兑现):dino-wm(冻结 DINOv2 特征 + 动作条件潜在动力学 + MPC)、pldm-planning-latent-dynamics(无奖励离线数据 + VICReg 潜动力学 + MPPI)、jepa-vla(把 V-JEPA 2 特征注入 VLA 策略)。
- 模态扩展(同一配方,新感官):a-jepa、stem-jepa-music、point-jepa、brain-jepa、s-jepa-eeg、t-jepa-tabular。
- 语言与推理:llm-jepa(JEPA 作为 NTP 的辅助正则)、jepa-reasoner(把隐空间推理与 token 生成解耦)。
- 诊断:intuitive-physics-vjepa(用”预期违背”范式探针 V-JEPA 的直觉物理)。
(同在 world-model scope、但归在 method 类的 jepa-t-text-to-image 文生图、jepa-speech-tokenizer-daam 语音 tokenizer,以及 2026 年的后续分析 when-does-lejepa-learn-world-model 属邻接工作,谱系上一脉相承,本页在末尾一并勾连。)
时间线
| 时间 | 工作 | 机构 | 模态 / 用途 | 在谱系里的角色 |
|---|---|---|---|---|
| 2022 | lecun-path-autonomous-machine-intelligence | Meta | 蓝图(position paper) | 提出 JEPA 概念与”非生成式世界模型”路线 |
| 2023-01 | i-jepa | Meta FAIR | 图像 | JEPA 首个实例;predictor = “原始 world-model” |
| 2023-07 | mc-jepa | Meta FAIR / Inria | 视频 + 图像 | 运动(光流)+ 内容双目标支线 |
| 2023-11 | a-jepa | Kunlun | 音频频谱 | 首次进音频;课程式掩码 |
| 2024-02 | v-jepa | Meta FAIR | 视频 | 主脊第二棒;特征预测 ≠ 必须重建像素 |
| 2024-03 | iwm-learning-leveraging-world-models | Meta FAIR | 图像 | 把 predictor 学成可复用的等变世界模型 |
| 2024-03 | s-jepa-eeg | Donders / Inria | EEG | 空间块遮蔽;跨数据集迁移探索 |
| 2024-04 | point-jepa | Saint Mary’s | 点云 | 贪心排序器破解置换不变性 |
| 2024-08 | stem-jepa-music | Sony CSL | 多轨音乐 | 首次把 predictor 用于推理阶段 |
| 2024-09 | brain-jepa | NUS | fMRI | 梯度定位 + 时空掩码;NeurIPS Spotlight |
| 2024-10 | t-jepa-tabular | Paris-Saclay | 表格 | [REG] token 防坍缩 |
| 2024-11 | dino-wm | NYU / Meta FAIR | 控制(离线规划) | 冻结 patch 特征 + 动作条件动力学 + MPC |
| 2025-02 | pldm-planning-latent-dynamics | NYU / Meta FAIR | 控制(无奖励导航) | 系统证明”预测式 SSL > 重建式”于规划 |
| 2025-02 | intuitive-physics-vjepa | Meta FAIR | 视频诊断 | VoE 探针,98% IntPhys |
| 2025-06 | v-jepa-2 | Meta FAIR | 视频 → 世界模型 | 主脊第三棒;1B 参数、零样本控真机 |
| 2025-09 | llm-jepa | Brown / NYU / Atlassian | 语言 | JEPA 作为 LLM 训练辅助目标 |
| 2025-11 | lejepa | Brown / Meta FAIR | 理论 | 各向同性高斯 + SIGReg,单超参、可证明 |
| 2025-12 | jepa-reasoner | 未披露 | 推理 | 隐空间推理与 token 生成解耦 |
| 2026-02 | jepa-vla | 学术(未核实) | 机器人策略 | V-JEPA 2 特征注入 VLA |
设计范式:所有 JEPA 共享的骨架
在拆解个体之前,先把这 18 个工作反复复用的那套”配方”提炼出来——理解了它,后面每一个成员都只是在填空。
① 三网络结构(context / target / predictor)。 几乎每个成员都是这三件套:context encoder $f_\theta$ 只看可见部分;target encoder $f_{\bar\theta}$ 是 context encoder 的指数滑动平均(EMA)副本、不回传梯度、处理完整输入;predictor $g_\phi$ 从 context 表征去预测 target 表征。i-jepa 定了型,v-jepa / v-jepa-2 / a-jepa / point-jepa / brain-jepa / t-jepa-tabular / stem-jepa-music 全部照搬。少数例外:dino-wm 直接冻结现成的 DINOv2 当 encoder、不训 target encoder;lejepa 干脆证明对图像 JEPA 而言 predictor 和 teacher-student 可以删掉。
② 在表征空间遮、在表征空间预测(contextualized targets)。 关键不是”遮输入”,而是”target 取自 target-encoder 对完整输入输出上的被遮位置”。i-jepa 的消融把这点钉死:遮 target-encoder 输出而非遮输入,1% ImageNet 从 56.1 涨到 67.3;在表征空间 vs 像素空间预测,66.9 vs 40.7。这是 JEPA 语义性的根本来源,也是它区别于 MAE 一类像素重建的分水岭。
③ predictor 被”条件化在要预测什么上”——这就是 JEPA 里的”action”。 静态图像里这个条件退化成目标位置的 mask token(i-jepa 建模的是空间不确定性);视频里是3D 时空坐标(v-jepa);到了 v-jepa-2-AC 才是真正的 7 维末端执行器动作;iwm-learning-leveraging-world-models 把它一般化成光度/几何变换参数;stem-jepa-music 用被省略乐器的类别标签;dino-wm / pldm-planning-latent-dynamics 用连续控制动作。“predictor 条件在 z 上预测未观测内容”这一句话,串起了从静态图到机器人的所有变体。
④ 防坍缩(anti-collapse)是永恒的工程主线。 基础解法是 EMA + stop-gradient + 窄 predictor 瓶颈,几乎所有成员通用。但不同模态要加料:mc-jepa 和 pldm-planning-latent-dynamics 加 VICReg 方差-协方差正则(PLDM 去掉方差项成功率从 98 崩到 13);t-jepa-tabular 发现表格上 EMA+stop-grad 不够、必须再拼一个 [REG] token 才能逃出初始坍缩(并复现了 I-JEPA 缩小 batch 时也坍缩);lejepa 则从第一性原理给出终极答案——用 SIGReg 把 embedding 逼到各向同性高斯,一步到位、可证明。
⑤ 窄 predictor 是反复出现的最优点。 i-jepa 消融:predictor 宽度 384(瓶颈)70.7 > 1024 的 68.4。v-jepa / v-jepa-2 / point-jepa / stem-jepa-music 全部用 384-ish 维、6–12 层的窄 predictor;v-jepa-2 更是把 predictor 固定成 22M ViT-s,不随 1B 编码器放大。
⑥ 损失函数的演化:L2 → L1 → cosine。 i-jepa 用平方 L2;v-jepa 起换成 L1(更稳定),v-jepa-2 / s-jepa-eeg / a-jepa 沿用;point-jepa 用 Smooth L1;stem-jepa-music 用归一化 MSE;到了语言域,llm-jepa / jepa-reasoner 改用 cosine 相似度(llm-jepa 消融显示 cosine 71.5、ℓ2 距离灾难性失败 2.2)。
骨架对齐表
| 组件 | 典型做法 | 谁不一样 |
|---|---|---|
| target encoder | context encoder 的 EMA 副本,stop-gradient | dino-wm 冻结现成 DINOv2;lejepa 删掉 |
| predictor | 窄 ViT / MLP,embed dim ≈384 | stem-jepa-music 用 6 层 MLP;pldm-planning-latent-dynamics 用 GRU/卷积/MLP |
| ”遮”什么 | multi-block 空间/时空掩码 | stem-jepa-music 省略整个乐器分轨;dino-wm/pldm-planning-latent-dynamics 不遮、改自回归预测下一帧 |
| predictor 条件 z | 位置 mask token | action(v-jepa-2-AC/dino-wm/pldm-planning-latent-dynamics)、变换参数(iwm-learning-leveraging-world-models)、乐器标签(stem-jepa-music) |
| 防坍缩 | EMA + stop-grad + 窄瓶颈 | +VICReg(mc-jepa/pldm-planning-latent-dynamics)、+[REG](t-jepa-tabular)、SIGReg(lejepa) |
| 损失 | L2→L1 | cosine(llm-jepa/jepa-reasoner)、Smooth L1(point-jepa)、归一化 MSE(stem-jepa-music) |
| 评测 | 冻结主干 + 线性/attentive probe | dino-wm/pldm-planning-latent-dynamics 直接 MPC 规划成功率 |
主脊:I-JEPA → V-JEPA → V-JEPA 2
这三棒是整条谱系的承重墙,也是”表征学习 → 世界模型”这一跃迁的完整轨迹。
i-jepa(2023,图像,静态空间不确定性) 是把 LeCun 蓝图落到图像上的第一个实例。给一张图,从一个信息丰富的 context block(scale 0.85–1.0)出发,预测 4 个 target block(scale 0.15–0.2)在表征空间里的表征。它非生成、非对比、不用任何手工数据增强(预训练只有 masking)。论文里 predictor 被明确称作”一个原始的、受限的 world-model”——它建模的是静态图的空间不确定性,RCDM 可视化显示它能在正确 pose 上补出物体部件、丢弃背景细节。ViT-H/14(632M)用 16×A100 在 <72 小时、<1200 GPU 小时内训完,ImageNet 线性探针 79.3%(H/16-448 达 81.1,追平用增强的 iBOT/DINO),比 MAE 省一个数量级算力。
v-jepa(2024,视频,时空外观+运动) 回答一个尖锐问题:用现代工具,纯特征预测作为独立视频自监督目标到底有多强?答案是——不重建像素也能同时学懂外观(Kinetics-400)和运动(Something-Something-v2,必须理解时序)。它把 i-jepa 的 L2 换成 L1,用 3D multi-block 掩码(平均遮 ~90%,块沿整个时间维拉通以抑制冗余泄漏),只用 200 万条公开视频(VideoMix2M)、9 万步就打平甚至超越数十亿样本的像素/图文模型。它还确立了 attentive probe 这一”把非归一化 JEPA 表征用起来”的关键评测协议(对 ViT-L 相对 average pool 在 K400 +17.3)。样本效率是杀手锏:只”看过” 2.1 亿样本,比 OpenCLIP(390 亿)少两个数量级。官方博客把 predictor 称作”一个早期的物理世界模型”。
v-jepa-2(2025,视频 → 能规划的世界模型) 是主脊的规模化与”兑现”:把预训练扩到 >100 万小时视频 + 100 万图(VideoMix22M,2200 万样本)、编码器到 10 亿参数 ViT-g,用 3D-RoPE 稳住大模型训练、渐进分辨率省 8.4× 算力。真正的突破在第二阶段——冻结编码器,只用不到 62 小时无标注 Droid 机器人视频后训练一个 3 亿参数动作条件预测器 V-JEPA 2-AC,在表示空间里用交叉熵方法(CEM)+ MPC 做规划,实现 Franka 机械臂零样本抓取与拿放(不采部署环境数据、无奖励、无任务专属训练)。它同时在动作识别(SSv2 77.3)、动作预判(EK100 recall@5 39.7,较前 SOTA 相对 +44%)、视频问答(8B 档多项 SOTA)三线刷榜。规划成本:每个动作 16 秒(RTX 4090)vs 生成式 Cosmos 的 4 分钟——快 15×。
主脊头对头
| 维度 | i-jepa | v-jepa | v-jepa-2 |
|---|---|---|---|
| 时间 / 机构 | 2023-01 / Meta FAIR | 2024-02 / Meta FAIR | 2025-06 / Meta FAIR |
| 模态 | 静态图像 | 视频 | 视频 + 图 → 世界模型 |
| 编码器 | ViT-B/L/H,最大 H/14 632M | ViT-L 200M / H 630M | ViT-g 1B + 预测器 ViT-s 22M |
| predictor | 窄 ViT,384 维,6–16 层 | 窄 ViT,384 维,12 层 | ViT-s 22M(固定);AC 阶段 ~300M |
| 位置编码 | 绝对 sin-cos | 绝对 3D sin-cos | 3D-RoPE(稳大模型) |
| 数据 | IN1K / IN22K(128 万 / 1400 万图) | VideoMix2M(200 万视频) | VideoMix22M(2200 万样本,>100 万小时) |
| “action” | 位置 mask token(空间不确定性) | 3D 时空坐标 | 7 维末端执行器动作(AC 阶段) |
| 损失 | 平方 L2 | L1 | L1(掩码去噪 + AC 两步 rollout) |
| 掩码 | multi-block(4 target + 1 context) | 3D multi-block ~90% | multiblock,空间尺度 [0.15,0.7] |
| 训练量 | H/14 300 ep,<1200 GPU-h,16×A100 | 90K 步,bs 3072,A100 | 252K iter 渐进分辨率,A100(全直训需 ~60 GPU-年) |
| EMA | 0.996→1.0 | 0.998→1.0 | 0.99925 固定(简化掉 ramp) |
| 头条数字 | IN1K linear 79.3(H/14)/ 81.1(H/16-448) | K400 81.9 / SSv2 72.2 / IN1K 77.9(H/16-384) | SSv2 77.3 / EK100 R@5 39.7 / 零样本 pick-&-place 80% |
| 规划 | 无(纯感知) | 无(纯感知) | CEM+MPC,16 秒/动作,真机零样本 |
一条清晰的技术曲线:遮的维度从空间 → 时空 → 时空+动作;predictor 的条件从位置 → 坐标 → 真实动作;产物从表征编码器 → 表征编码器 → 能闭环控制机器人的世界模型。作者们反复自陈的三大待解——数据多样性不足、时间尺度短(几秒)、只做感知不做规划——正好被下一棒逐一啃掉。
控制与规划支线:世界模型的兑现
如果说主脊证明了”JEPA 能学好表征”,这条支线证明的是”这些表征真能当世界模型用来规划、控制真机”。它们共享一个反主流的主张:在潜空间而非像素空间建模,让 MPC 这种测试时优化变得便宜又精确。
dino-wm(2024) 把这条路走得最干净:直接冻结现成的 DINOv2 ViT-S/14 patch 特征(256 patch × 384 维,全程不训 encoder),只学”给定历史 patch 特征 + 动作 → 下一帧 patch 特征”的动作条件 ViT 转移模型,纯潜空间 MSE、完全不重建像素。测试时把任务表述成”到达目标观测”,用 CEM+MPC 在潜空间零样本规划——不需要奖励、逆模型、专家演示。它把世界模型同时和”在线 RL 的任务特定工具”(Dreamer/IRIS)与”昂贵的像素生成”(GAIA/UniSim/Sora 类)区分开。关键实证:patch 特征 ≫ 全局向量(Push-T 成功率 0.90 vs R3M 的 0.42),接触密集操作任务上大幅领先。
pldm-planning-latent-dynamics(2025) 把”数据质量对离线学习范式的影响”第一次做成系统受控实验(23 个数据集),并给出方法 PLDM:JEPA 学隐动力学 + MPPI 规划。它用极小的模型(Two-Rooms 版仅 220 万参数、Diverse Maze 版仅 5.4 万参数)证明”小模型 + 好目标”也能规划,在数据稀缺、低质量、短轨迹、跨布局四类场景下全面碾压 model-free 的目标条件 RL。它把”预测式 SSL 优于重建式”钉成实验事实:同架构下把 VICReg 换成像素重建,成功率从 97.4 掉到 26.2;改造版 td-mpc2 直接坍缩到 0。换任务只需反转规划代价符号、无需重训。
jepa-vla(2026) 把主脊的产物反哺给机器人策略:诊断出 DINO 系(不变性目标削弱位置敏感度)、CLIP/SigLIP 系(只保留语言提到的语义)都缺”环境理解 + 策略先验”,而 v-jepa-2 的视频预测表征恰好补上。做法是冻结 V-JEPA 2 编码器,用 Flamingo 式门控交叉注意力(每 8 层插一次、低学习率)把它注入现有 VLA,在 LIBERO / RoboTwin2.0 / 真机上取得 6–19 个百分点提升;真机上 1/5 数据即反超全量 baseline。(注:该 arXiv 条目机构未核实、无开源代码,可复现性存疑。)
控制支线头对头
| 维度 | dino-wm | pldm-planning-latent-dynamics | v-jepa-2-AC | jepa-vla |
|---|---|---|---|---|
| 编码器 | 冻结 DINOv2 ViT-S/14 | 从零训(Impala/卷积/MLP) | 冻结 V-JEPA 2 ViT-g 1B | 冻结 V-JEPA 2 |
| 转移/预测器 | 动作条件 ViT depth-6 | GRU/卷积/MLP + ensemble | ~300M ViT,block-causal | 门控交叉注意力融合层 |
| 参数量 | 轻量(depth-6 ViT) | 5.4 万–220 万 | 1B 编码器 + 300M 预测器 | 依基座(Basic VLA / OpenVLA-OFT) |
| 数据 | 离线仿真轨迹(1K–18.5K 条/环境) | 无奖励导航(23 数据集) | <62 小时 Droid 视频 | LIBERO / RoboTwin2.0 / 真机 |
| 动作 | GT 动作,MLP 编码后拼 patch | 连续动作拼预测器输入 | 7 维末端执行器 | V-JEPA 2 表征作条件 |
| 规划器 | CEM + MPC(潜空间 MSE 成本) | MPPI + ensemble 不确定性 | CEM + MPC(目标条件能量 L1) | 无(模仿学习策略) |
| 重建像素 | 否(解码器仅可视化) | 否 | 否 | 否 |
| 头条数字 | Push-T SR 0.90 / Rope CD 0.41 | Two-Rooms 97.8% / 换任务零重训 | 真机 pick-&-place 80% cup | LIBERO(OFT) +6.1 / RoboTwin Easy +18.7 |
| 硬件 | 单张 H100 | 单张 V100,≤1 天 | A100 训练 + RTX 4090 规划 | 未披露 |
方法与理论支线:IWM · MC-JEPA · LeJEPA
这三个不换模态,而是往 JEPA 的”方法学根部”钻。
iwm-learning-leveraging-world-models(2024,IWM) 问了个尖锐问题:RL 里学到的世界模型会被复用做规划,为什么视觉 SSL 里 predictor 预训练完就被扔了?它把 i-jepa 的”action”从纯 mask 一般化成一整族光度变换(色彩抖动、灰度、模糊、日晒化),证明只要 predictor 被正确条件化、变换足够复杂、predictor 容量足够大(经验法则:predictor/encoder 参数比 ≈0.3),就能学出一个可微调复用的等变(equivariant)世界模型——微调这个 predictor 去做分类/分割,比微调 encoder 更省参数、效果更好(IWM$^{Equi}_{18,384}$ 峰值 IN1K 84.4)。它还给出一个”抽象度旋钮”:调 predictor 强弱,能在对比学习式(不变、linear probe 强)和 MIM 式(等变、微调峰值强)之间连续插值。
mc-jepa(2023) 是主脊之外最早的支线,走”运动 + 内容”双目标:一个共享 ConvNeXt-T(23M)同时从视频自监督学光流(基于 PWC-Net)、从 ImageNet 用 VICReg 学内容特征。核心论断是两者互相帮助——学光流这个像素级预测任务显著提升了内容特征在分割上的表现(相对纯 VICReg 大幅上涨,Pascal VOC 67.1 mIoU、DAVIS 70.5)。它是 JEPA 谱系里唯一显式建模像素级光流的成员;后来的 v-jepa 选了不同路线(不显式建模光流,改在特征空间做更大范围时空掩码)。
lejepa(2025) 是 Balestriero 与 LeCun 给整个家族补的理论地基。它先证明各向同性高斯是让下游任意任务风险最小的最优 embedding 分布,再用新目标 SIGReg(Sketched Isotropic Gaussian Regularization,球面 Cramér-Wold 切片 + Epps-Pulley 特征函数检验) 把 embedding 逼到这个分布。结果是一个只有 1 个超参、O(N) 线性复杂度、约 50 行核心代码、彻底删掉 stop-gradient / teacher-student / EMA 调度器 / register token 的 JEPA——ImageNet-1k 冻结线性探针 ViT-H/14 达 79%,且训练 loss 与下游精度的相关系数达 99%(首个可无标签交叉验证的 SSL 损失)。它直接反驳了”防坍缩只能靠打地鼠式启发式”的现状。
方法/理论支线头对头
| 维度 | iwm-learning-leveraging-world-models | mc-jepa | lejepa |
|---|---|---|---|
| 核心命题 | predictor 是可复用的等变世界模型 | 运动学习提升内容特征 | 各向同性高斯是最优 embedding 分布 |
| backbone | ViT-B/16(+ ViT-L 放大) | ConvNeXt-T 23M | 任意(60+ 架构开箱) |
| “action”/额外信号 | 光度/几何变换参数 | 光流(下一帧预测) | 无(DINO 式多视图) |
| 防坍缩 | EMA + 非对称增强 | 每层 VICReg + LayerNorm | SIGReg(1 超参,可证明) |
| 关键数字 | IWM$^{Equi}$ IN1K 峰值 84.4;predictor 微调 > encoder 微调 | VOC 67.1 / DAVIS 70.5 mIoU;光流 KITTI15 EPE 2.67 | ViT-H/14 IN1K 79%;train-loss↔acc ρ 99% |
| 硬件 | 未披露 | 8×V100 单机 | 未披露(SIGReg 微基准 O(N)) |
| 训练量 | IN1K 300 ep | 100 ep(光流延迟到第 10 ep 引入) | IN1K ViT-L 100 ep(比 I-JEPA 少 3×) |
模态扩展:同一配方,六种新感官
这六个工作是 JEPA 通用性的最好证明。它们的共同套路是——“JEPA 主体不动,只为新模态设计一个领域特定的前置步骤”(tokenizer / 排序 / 位置编码 / 掩码定义),来解决该模态相对图像缺什么。
- a-jepa(音频):把音频转 Mel 频谱切 patch。难点是频谱时频局部强相关、随机块太容易”猜出”,解法是课程式掩码(随机 block 由易到难退火到时频感知掩码)+ 微调期正则化掩码。ViT-B、仅 AudioSet 预训练,AS-2M 48.6 mAP,超 Audio-MAE +1.3。
- stem-jepa-music(多轨音乐):难点是没有天然掩码,解法是用”从混音里省略一个乐器分轨”充当遮挡、用被省乐器类别标签条件化 predictor。它是家族里首次把 predictor 用于推理阶段(检索缺失分轨)的工作。MUSDB18 分轨检索 R@1 33%(AutoMashupper 仅 1%)。
- point-jepa(点云):难点是置换不变、无自然序,无法切空间连续块。解法是贪心排序器(从坐标和最小的点出发、每步选最近邻,让索引相邻≈空间相邻),比 z-order/Hilbert 曲线又快又准。ModelNet40 线性 SVM 93.7%,预训练仅 7.5 小时。
- brain-jepa(fMRI):难点是 ROI 空间无自然序、功能分区≠解剖分区。解法是 Brain Gradient Positioning(用功能连接梯度做位置编码)+ Spatiotemporal Masking(Cross-ROI/Time/Double-Cross 三区定向采样)。UKB 4 万受试者预训练,跨种族泛化(白人训、亚洲测仍超 BrainLM)。NeurIPS 2024 Spotlight。
- s-jepa-eeg(EEG):难点是电极空间不规则。解法是逐通道独立编码 + 空间块遮蔽(按电极半径遮一整片),目标是应对跨数据集通道集合变化。OpenBMI 54 受试者,ERP 97% AUC。探索性小规模研究。
- t-jepa-tabular(表格):难点是异质特征、难构造增强、且会坍缩。解法是每特征独立线性嵌入 + [REG] token 防坍缩(这是 I-JEPA/V-JEPA 都不需要的新发现)。让 ResNet 在 6 个基准上整体持平/超过 XGBoost/CatBoost,总算力仅 ~8.9 GPU-h。
模态 JEPA 头对头
| 工作 | 模态 | 领域特定前置步骤 | encoder | 损失 | 防坍缩加料 | 头条数字 | 数据 / 算力 |
|---|---|---|---|---|---|---|---|
| a-jepa | 音频频谱 | 课程式掩码(随机→时频) | ViT-B 86M | L2 | — | AS-2M 48.6 mAP | AudioSet;未披露 |
| stem-jepa-music | 多轨音乐 | 省略乐器分轨=掩码 | ViT-B(768) | 归一化 MSE | — | MUSDB18 R@1 33% | Sony 专有 1350h;A100×4 天 |
| point-jepa | 点云 | 贪心排序器 | ViT depth12 384 | Smooth L1 | — | ModelNet40 SVM 93.7% | ShapeNet 42K;7.5h |
| brain-jepa | fMRI | 梯度定位 + 时空掩码 | ViT-B 86M | L2 | — | HCP-Aging 性别 81.5% | UKB 4 万人;4×A100 |
| s-jepa-eeg | EEG | 逐通道编码 + 空间块遮蔽 | 5-CNN + 8 层 Transformer | L1 | — | ERP 97% AUC | OpenBMI 54 人;单机 ~12h |
| t-jepa-tabular | 表格 | 逐特征嵌入 + [REG] token | Transformer(隐维≤128) | L2 | [REG] token | ResNet 超 XGBoost | 6 数据集;~8.9 GPU-h |
一个跨模态的共性结论:几乎每篇都报告”隐空间预测在冻结/线性探测场景下优于像素/输入空间重建”,这正是 i-jepa 最初卖点在新模态上的反复复现。
语言与推理:JEPA 出图像
家族最新的野心是把”预测表征”搬进语言和推理——这里 JEPA 遇到 next-token prediction(NTP)这个绝对主流,两者的关系成了核心张力。
llm-jepa(2025) 的策略是不取代、只叠加:保留标准 NTP 损失,额外加一个 JEPA 项,让同一知识的两个”视图”(如自然语言 ↔ 对应正则/SQL/代码)在嵌入空间互相预测。它复用 LLM 自身当 encoder(取最后 token 隐状态)和 predictor(追加 tied-weight 的 [PRED] token),用 cosine 相似度。在 Llama-3/Gemma-2/OLMo-2 等四大家族、多数据集、全量与 LoRA 微调上都稳定超过纯 NTP(NL-RX-SYNTH:57.29→71.46),且更抗过拟合。工程上从 v1 的 3 次前向优化到 v2 自定义 attention mask 的 2 次前向,再用 Loss Dropout 压到 1.25×。它给出可解释证据:JEPA 项把 Text→Code 映射压进近乎线性、维度极低的子空间。
jepa-reasoner(2025) 更激进,直接替换生成机制:把”推理”和”说话”拆成两个模型——一个改造过的 JEPA 在归一化连续隐球面上自回归生成推理链(不经任何 token 采样),再交给独立的 Talker 模型翻译成文本。用概率因式分解 P(R,X)=P(R)·P(X|R) 证明这带来 Error Containment(token 采样误差没有数学路径反向污染推理轨迹)。EMA target encoder(momentum 0.98)+ scaled cosine 损失(k=4)。0.9B 组合模型 GSM8K 8-shot 51.9%,相对同数据耦合基线 +149.5%,反超参数量大 4 倍的 Gemma 3。(注:论文自身存在两处内部数值矛盾,且无开源、机构未披露。)
这两者与 i-jepa 的血缘:llm-jepa 明确承接 LeCun 世界模型蓝图,把视觉验证过的 JEPA 目标”原样”搬进语言而不改生成方式;jepa-reasoner 则批评 i-jepa/v-jepa-2 的 predictor 本质是”填空”、不具生成能力,把 JEPA 从”target-conditioned 填空”改造成”自回归生成”。
此外,同在 world-model scope 的邻接工作还把 JEPA 推向文生图(jepa-t-text-to-image:带文本融合的 JEPA 图像生成)与语音 tokenizer(jepa-speech-tokenizer-daam:JEPA 作神经 tokenizer 学鲁棒语音表征),以及 2026 年对 lejepa 何时学到世界模型的追问(when-does-lejepa-learn-world-model)——它们在类目上归 method、不在本页 18 个成员之列,但技术上一脉相承。
诊断:直觉物理探针
intuitive-physics-vjepa(2025)不是新模型,而是给 v-jepa 做的一次纯诊断,值得单列,因为它给”JEPA 是不是真世界模型”提供了最有说服力的证据链。它用发展心理学的预期违背(violation-of-expectation, VoE) 范式:不做任何微调,直接让冻结的 V-JEPA 对配对视频(一个符合物理、一个违反)算”惊讶度”(预测误差)。结果 V-JEPA 在 IntPhys 零样本 98%、GRASP 66%、InfLevel-lab 62%,而像素预测的 VideoMAEv2 和两个前沿多模态大模型(Qwen2-VL、Gemini 1.5 pro)全部接近随机 50%。
结论极强:“在学习到的表征空间做预测”这一原则本身(而非任何硬编码的物体/几何先验),足以让神经网络涌现出物体恒常性、连续性、形状恒定——哪怕只用 1.15 亿参数或仅 128 小时唯一视频。这为”核心知识非必需、直觉物理可从通用学习原理涌现”提供了实证,也把 VoE 探针确立为评测 JEPA 类世界模型物理理解的标准工具(v-jepa-2 随论文发布的 IntPhys 2 / MVPBench / CausalVQA 基准即沿用此思路)。局限也诚实:涉及物体交互的属性(solidity、collision)接近随机,记忆窗口只有 3–4 秒。
生成式 vs 预测式世界模型:路线之争
JEPA 谱系的身份认同,很大程度上是靠对立于像素级生成式世界模型来定义的。这条对照贯穿多个成员的”背景与定位”:
- v-jepa-2 直接把自己摆在 NVIDIA Cosmos、Wayve GAIA-2、Microsoft WHAM、Genie 系的对面:生成像素代价高、评测多停在”预测画面像不像”,真正闭环控真机的极少。
- dino-wm 把自己与”在线 RL 世界模型”(dreamer-v3、iris、td-mpc2)和”生成式视频世界模型”(GAIA-1、deepmind-genie2、unisim、Sora 类)双双区分开。
- pldm-planning-latent-dynamics 用受控消融把”预测式 SSL > 重建式”坐实(VICReg→像素重建,成功率 97→26;改造版 td-mpc2 坍缩到 0)。
- intuitive-physics-vjepa 让像素预测的 VideoMAEv2 在物理探针上接近随机,与 V-JEPA 的 98% 形成直接反差。
核心权衡:
| 预测式(JEPA 谱系) | 生成式(像素/token 世界模型) | |
|---|---|---|
| 建模空间 | 抽象表征空间 | 像素 / 离散 token 空间 |
| 对待不可预测细节 | 主动丢弃(草叶精确位置) | 必须死磕重建 |
| 代表 | i-jepa/v-jepa/v-jepa-2/dino-wm | cosmos-predict2-5-world-simulation/genie-3/dreamer-v3/diamond/decart-oasis |
| 可观看性 | 弱(需另训扩散 decoder 才能可视化) | 强(像素级、可交互) |
| 规划成本 | 低(v-jepa-2 16 秒/动作) | 高(Cosmos 4 分钟/动作,一次 pick-&-place >1 小时) |
| 闭环控真机 | 已验证(v-jepa-2-AC 零样本 Franka) | 极少(V-JEPA 2 论文称用 Cosmos 控真机”据我们所知是首次尝试”,且 0% 成功) |
| 物理理解探针 | V-JEPA 98% IntPhys | VideoMAEv2 接近随机 |
一句话:JEPA 阵营赌的是”控制/规划任务不需要逐像素想象未来,只需要在表征空间预测可预测的部分”;这个赌注在 v-jepa-2 的真机实验和 intuitive-physics-vjepa 的物理探针上拿到了最强证据。但要”可观看、可交互”的场景(游戏、可控视频生成),生成式仍不可替代——两条路线是互补而非你死我活。
家族走向
综合 18 个成员各自的”未来工作”与已经发生的后续,JEPA 谱系正沿五个方向推进:
- 动作条件 + 规划 + 规模化的合流。 主脊已经从纯感知(i-jepa/v-jepa)走到能控真机(v-jepa-2-AC),控制支线(dino-wm/pldm-planning-latent-dynamics)证明潜空间 MPC 的性价比。官方 2026-03 已发布 V-JEPA 2.1(Dense Predictive Loss + Deep Self-Supervision,规模扩到 ViT-G 2B),主攻时间一致的 dense features——下一步是更长时程规划(破自回归误差累积)、语言指定任务(当前只支持图像目标)。
- 理论收口。 lejepa 把”防坍缩靠启发式”变成”朝确定目标(各向同性高斯)优化”,when-does-lejepa-learn-world-model 进一步追问它何时真学到世界模型——预示 JEPA 从”配方工程”走向”有保证的设计”。
- predictor 从一次性辅助信号变成一等产物。 iwm-learning-leveraging-world-models 微调复用 predictor、stem-jepa-music 推理期用 predictor 检索——“别把预训练完的 predictor 扔了”正在成为共识。
- 模态还在铺开,套路已成模板。 “JEPA 主体不变 + 领域特定前置步骤”这个模板(point-jepa 排序、brain-jepa 梯度定位、t-jepa-tabular [REG] token)几乎可以机械地套到任何新模态;文生图(jepa-t-text-to-image)、语音 tokenizer(jepa-speech-tokenizer-daam)已经在路上。
- 向语言/推理的收编仍处早期。 llm-jepa 的最大局限是依赖数据天然的”两视图”结构(尚无类似视觉数据增强的通用机制);jepa-reasoner 的”隐空间独立想、Talker 独立说”闭环尚未验证。这是家族目前最不确定、也最有想象空间的边疆。
一句话收束:从 i-jepa 那个”原始而受限的 world-model”到 v-jepa-2 那个能零样本抓杯子的 10 亿参数世界模型,JEPA 用同一句原则——“在表征空间预测,别重建像素”——把 LeCun 2022 的蓝图从一张图纸变成了一条真在生长的技术谱系。
一手源
- LeCun 蓝图:lecun-path-autonomous-machine-intelligence(2022,JEPA 概念与非生成式世界模型路线的提出)
- 主脊:i-jepa(arXiv 2301.08243)· v-jepa(2404.08471)· v-jepa-2(2506.09985)
- 方法/理论:iwm-learning-leveraging-world-models(2403.00504)· mc-jepa(2307.12698)· lejepa(2511.08544)
- 控制/规划:dino-wm(2411.04983)· pldm-planning-latent-dynamics(2502.14819)· jepa-vla(2602.11832,未核实)
- 模态:a-jepa(2311.15830)· stem-jepa-music(2408.02514)· point-jepa(2404.16432)· brain-jepa(2409.19407)· s-jepa-eeg(2403.11772)· t-jepa-tabular(2410.05016)
- 语言/推理:llm-jepa(2509.14252)· jepa-reasoner(2512.19171)
- 诊断:intuitive-physics-vjepa(2502.11831)
- 邻接(method 类,本页勾连非成员):jepa-t-text-to-image · jepa-speech-tokenizer-daam · when-does-lejepa-learn-world-model