世界模型五大范式对比:RL-WM · 生成视频 · 交互/游戏 · 驾驶 · JEPA

概述:“世界模型”(world model)这个词从来不是一个单一技术,而是一族共享同一句定义——学一个能预测环境如何演化的内部模型——却各说各话的研究传统。本调研的 200+ 页把它们收拢成五大范式(1) RL 世界模型,为”控制”学一个可在其中想象/规划的动力学模型(dreamer-v3/muzero 两条谱系);(2) 生成视频世界模型,把”动作进、视频出”的可控视频生成直接当模拟器(unisimcosmos-predict2mbzuai-pan-world-model);(3) 交互/游戏世界模型,用神经网络实时”渲染”一个可玩的世界(gamengengenie-3skywork-matrix-game-3);(4) 驾驶世界模型,在图像/占据/点云多种模态上预测未来路况并回灌规划(gaia-1-wayvevista-driving-world-modelxiaomi-auto-world-model);(5) JEPA,LeCun 路线,不生成像素、在抽象表征空间做预测i-jepav-jepa-2)。五者沿两条正交轴分布——预测空间(像素观测 vs 抽象隐状态 vs 3D 结构)与目的(控制 / 造数据 / 给人玩 / 学表征)——但到 2025–2026 正沿骨干、隐动作、实时蒸馏、物理评测四条通道快速合流,并在 NVIDIA Cosmos、MBZUAI PAN 这类”世界基础模型”里被同一骨干统一承载。


一、什么是”世界模型”:两条源头与一张光谱

这个概念有两位不同的”命名人”,也正是五大范式分裂的根。world-models-ha-schmidhuber(Ha & Schmidhuber, NeurIPS 2018)在深度 RL 语境里明确命名了 “world model” 这一术语:把智能体拆成「大世界模型(VAE 视觉 + MDN-RNN 记忆)+ 极小控制器」,并首次证明控制器可以完全在世界模型生成的”梦境”里训练再零样本迁回真实环境(VizDoom)——这条”生成观测、在想象里学控制”的思路直接长成 Dreamer 与所有生成式世界模型。四年后,lecun-path-autonomous-machine-intelligence(LeCun, 2022)给出针锋相对的另一版:世界模型该是一个非生成、在表征空间做预测的联合嵌入预测架构(JEPA),推理即能量最小化的模型预测控制——催生了 I-JEPA/V-JEPA 一脉。

清华 FIB Lab 的纲领性综述 understanding-world-or-predicting-future-survey 把这条裂缝概括成两条并行主线——隐式表征(理解现在)vs 未来预测(预知未来);华科/百度的 survey-world-models-autonomous-driving 则按”预测场景的模态”(2D 图像 / 3D 占据·点云 / 无场景隐状态)给驾驶世界模型建了一张 47 方法总表;新加坡国立的 world-action-models-survey 又从”预测的未来会不会反过来参与产生/打分/训练动作”这条属性收编了 109 篇工作。更早的方法论奠基是 mbrl-survey-moerland(Leiden/TU Delft),用”是否有模型""是否存全局解”两条轴把 planning / model-free / model-based 三分。把这些定义投影到一张光谱上,就是下面这张五范式总览:

范式”世界模型”指什么预测空间核心目标骨干演进代表作
RL-WM供智能体想象/规划的动力学模型抽象隐状态(可无观测重建)样本高效控制RSSM→Transformer→Diffusion;MCTS 隐模型world-models-ha-schmidhuber dreamer-v3 muzero
生成视频动作进、视频出的可控模拟器像素/视频(VAE 隐空间)可执行数据 / 通用模拟视频 U-Net→DiT→flow-matchingunisim cosmos-predict2 mbzuai-pan-world-model
交互/游戏实时可玩的神经游戏引擎像素(逐帧自回归)给人/agent 实时交互GAN→AR Transformer→蒸馏扩散gamengen genie-3 skywork-matrix-game
驾驶预测未来路况并回灌规划图像 / 3D 占据 / 点云 / 隐状态仿真·造数据·前瞻规划扩散/AR 视频、占据 VQ、点云扩散gaia-1-wayve vista-driving-world-model occworld
JEPA表征空间的预测器抽象表征(不重建像素)学可迁移表征 / 隐空间规划ViT + 窄 predictor(EMA target)i-jepa v-jepa v-jepa-2

两条轴一目了然:纵向是”预测越来越抽象”(像素 → 3D 结构 → 纯隐状态 → 表征),横向是”用途从造像素给人看,滑向学表征给策略用”。RL-WM 与 JEPA 站在”抽象/控制”一端,生成视频与游戏站在”像素/交互”一端,驾驶横跨整条光谱。下面逐一展开。


二、范式一 · RL 世界模型:为”控制”而学

RL-WM 的定义最苛刻:世界模型不是给人看的,而是让智能体在其中想象或搜索、从而少碰真实环境就学会控制。它内部又清晰分成两条谱系——“想象派”(学观测动力学、在想象轨迹里训 actor-critic)与”规划派”(学只对规划有用的价值等价隐模型、用 MCTS 前瞻搜索)。

2.1 想象派:Dreamer 一脉与骨干换芯

奠基是 planet(RSSM,纯规划、平均省 ~200× 交互)与 dreamer-v1(第一个纯靠隐空间想象学连续控制的 agent,DMC 20 任务 823 分超 10⁸ 步的 D4PG 786)。dreamer-v2 把 RSSM 的高斯隐状态换成32×32 分类离散隐变量 + KL balancing,成为第一个纯靠想象在 Atari 达人类水平的 agent(单张 V100、<10 天)。dreamer-v3 靠 symlog / twohot / free bits / 百分位归一化这套鲁棒变换做到一套超参打 8 大领域 150+ 任务,并首次无人类数据、无课程地在 Minecraft 挖到钻石(单张 A100,首颗钻石约 30M 步)——Nature 2025 正刊。harmonydream 把它重构为”观测建模 vs 奖励建模”双任务配平,仅加三个可学习标量就把 DreamerV3 在 Atari 100k 刷到 136.5% 人类归一化。真机方向 daydreamer 把 DreamerV2 原封搬到 4 台真实机器人(Unitree A1 1 小时学会行走);层级方向 director 加 manager-worker(K=8 步隐目标);解耦方向 iso-dream 拆可控/不可控/静态三分支;语言方向 dynalang 让语言 token 与图像同步输入做多模态 Dreamer。

真正把这条线做”厚”的是骨干换芯——从 RNN 换到 Transformer / 扩散 / SSM,在极端样本受限的 Atari 100k(每游戏仅 10 万步 ≈ 2 小时真人时长)上比拼:

世界模型骨干Atari 100k 人类归一化关键机制训练开销
irisVQVAE + GPT AR(16 token/帧)mean 1.046,10/26 超人逐 token 想象
TWMTransformer-XLmean 0.956 / median 0.505策略只吃隐状态 z
TWISTERTSSM + 对比预测(AC-CPC)mean 1.62预测未来 10 步高层特征
stormGPT causal Transformermean 1.267保留 categorical-VAE 想象RTX 3090 4.3h
diamond扩散模型即世界模型mean 1.46视觉细节直接建像素
delta-irisΔ-token(4 token/帧Crafter 17/22 成就、超 DreamerV3帧间增量编码比 IRIS 快一个数量级
rem-parallel-observation-predictionRetNet + 并行观测预测26 游戏 12 超人想象加速 15.4×<12h
efficientzeroMuZero + 自监督一致性mean 194.3% / median 109.0%value prefix + off-policy 校正4×3090×7h

长程记忆是另一条隐线:transdreamer 首个 Transformer 随机状态空间模型(TSSM),s4wm-world-model-backbones 首个兼容可并行 SSM 的世界模型骨架(在 2000 步记忆任务上全面超 RNN/Transformer),recall-to-imagine-r2i 把 S4/S5 塞进 DreamerV3(Memory Maze 首次超人、训练快最多 9×)。扩散骨干还外溢到离线 RL:diffusion-world-model-offline-rl 用条件扩散一次前向预测多步状态与奖励(D4RL 比单步动力学高 44%),diffusion-forcing 则用”每 token 独立噪声级别”统一 teacher-forcing 与整序列扩散,成为长时程稳定 rollout 的方法论基石。

2.2 规划派:MuZero 价值等价隐模型与 MCTS

另一条谱系不重建观测,只学”对规划有用”的隐模型。源头是 value-prediction-network(价值等价模型,MuZero 自陈的”最接近前身”)。muzero(Nature 2020)学表示/动力学/预测三件套、把 AlphaZero 的 MCTS 整个搬进抽象隐状态,Atari 57 刷新 SOTA 且在围棋/象棋/将棋匹配拿完美模拟器的 AlphaZero。此后是一整套把 MuZero 往各种”缺陷”上补的工作,几乎每一篇都对应一个具体的能力扩边:

工作给 MuZero 补的能力关键设计效果锚点
sampled-muzero高维/连续动作采样 K 动作 + 重要性加权 PUCT56 维人形 K=3~5 逼近穷举
stochastic-muzero随机环境afterstate + chance node + VQ chance code2048/西洋双陆棋可用、围棋不掉
vq-models-planning部分可观测环境响应编码成 VQVAE latent 节点DeepMind Lab 可扩展
gumbel-muzero极小模拟预算Gumbel Top-k + Sequential Halving2 次模拟/步可靠学习
muzero-unplugged在线/离线统一调节 Reanalyse fraction(0→100%)RL Unplugged SOTA
efficientzero-v2离散+连续统一采样 Gumbel search + 搜索式价值估计50/66 任务超 DreamerV3
unizero长记忆/多任务Transformer 隐模型,解耦 z 与历史 hVisualMatch/多任务超 MuZero
rezero-mctsreanalyze 提速反向视图 + 整 buffer 周期 reanalyze2–4× wall-clock 加速

配套的开源基建是 lightzero(统一 9 个 MCTS/MuZero 变体 + 20 余环境,NeurIPS 2023 Spotlight),UniZero/ReZero 的代码都并入其中。

2.3 隐空间规划的”轻量派”与”复用派”

介于两派之间还有一支”不搜索、直接在隐空间做局部轨迹优化(MPC)“的路线:td-mpc(任务导向隐动力学 TOLD + TD 价值,MPPI 短 horizon H=5)、td-mpc2(同一套超参 104 任务、单个 317M 模型跨 80 任务多具身)。pwm-multitask-world-models 复用同一个 TD-MPC2 世界模型,把策略抽取从”在线规划”换成”对世界模型一阶梯度反传”,反直觉地发现——世界模型对策略学习的价值不在预测精度,而在它诱导的优化地形是否光滑。这个洞见正好把 RL-WM 引向 JEPA 派的核心主张(见第六节)。此外 ivideogpt(压缩 token 化 16×、142 万条轨迹)把 AR Transformer 世界模型做成开源基石,横跨 RL-WM 与生成视频两个范式。


三、范式二 · 生成视频世界模型:视频即模拟器

这一派的定义反过来——世界模型就是一个可控视频生成器:给动作/文本/图像条件,生成”接下来会发生什么”的像素级视频,再把这段视频当模拟器去训策略、抽动作或供人看。它和 RL-WM 的分水岭在于”是否重建观测”:这里全程生成像素。

3.1 视频即策略(video-as-policy)

奠基是把”序列决策 = 文本条件视频生成”这一等式落地的 UniPi(NeurIPS 2023 Spotlight,文本条件视频扩散做 planning + 逆动力学抽动作),和把它做成”真实世界模拟器”的 unisim(5.6B 视频 U-Net 融合互联网/机器人/导航异构数据,action-in-video-out,ICLR 2024 最佳论文)。往下派生出一整族”甩开动作标签”的工作:avdc-actionless-videos(合成视频 + 光流密集对应反推动作,4 GPU 一天 vs UniPi 的 256 TPU pod)、video-language-planning(VLM 当策略+价值、视频扩散当动力学,做前向树搜索)、robodreamer(把语言条件做成可组合的 EBM 乘积)、videoworld(纯看无标签视频学会围棋,Video-GoBench Elo 2317 超人类职业 5 段)。

3.2 通用世界模型与”世界基础模型”(WFM)

2024 起这条线开始规模化、平台化:

世界模型骨干/规模条件数据/规模锚点定位
pandoraVicuna-7B + DynamiCrafter自由文本、任意时刻插动作只有定性结果AR-扩散混合
lwm-large-world-modelLLaMA-2 7B + RingAttentiontokens-in-tokens-out1M token 上下文长视频+书籍联合
cosmos-predict2扩散 DiT 0.6/2/14BText2Image / Video2WorldNATTEN 把 720p 成本压到 38–59%开源 WFM 平台
cosmos-predict2-5-world-simulationflow-matching 2B/14BText/Image/Video2World 统一文本编码器换 nvidia-cosmos-reason1物理 AI 模拟器
mbzuai-pan-world-modelQwen2.5-VL-7B + Wan2.1-14B自然语言动作GLP:LLM 隐骨干 + 视频解码器开源 SOTA,追平 KLING/MiniMax
wow-world-omniscient-modelDiT 14B机器人交互2.03M 段 / 7300h / 6.33 亿帧FM-IDM 真机 94.5%/75.2%

其中 mbzuai-pan-world-model 的 GLP(生成式潜在预测)架构值得单独点名:“LLM 潜在动力学骨干(想象/推理)+ 视频扩散解码器(还原可观测现实)“——这正是 JEPA 的”隐空间预测”与生成视频的”像素还原”缝在一条流水线里,是五范式合流的一个显式样本。NVIDIA Cosmos 家族则把 WFM 做成可后训练的底座:nvidia-cosmos-transfer1 加多路 ControlNet 做 world-to-world transfer、nvidia-cosmos-reason1 把”物理常识推理”拆成单独的多模态 LLM、nvidia-cosmos-policy 干脆把动作/本体/价值当作新”帧”塞进视频扩散序列一个模型兼任策略+世界模型+价值(LIBERO 98.5%)。

3.3 具身视频世界模型:往 4D 与真机走

机器人域这一支强调”生成结果要能变成动作、要几何一致”:irasim(帧级动作条件 DiT,策略评估与真机 Mujoco 相关系数 0.99,Push-T IoU 0.637→0.961)、vidar(Vidu 2.0 基座 + 掩码逆动力学,仅 20 分钟/232 段新平台数据 ≈ 同类 1%)、genie-envisioner(GE-Base 世界模型 + GE-Act 动作策略 + GE-Sim 模拟器四件套共享 latent)、gigaworld-1(evaluator 导向,比 Wan2.2-5B 高 14.9%)。把 2D 视频升维成 4D 是明显趋势——tesseract-4d-world-model(RGB-D-Normal 三通道→4D 点云,ICCV 2025)、alibaba-rynnworld-4d(RGB + Depth + 光流三模态同步)、enerverse(Free Anchor View 虚拟视角 + 4DGS 数据飞轮)、roboscape(联合训深度与关键点动态两个物理先验)。可控性/长时程方法论则由 history-guided-video-diffusion(DFoT + History Guidance,稳定 rollout 800+ 帧)、owl-1(state-observation-dynamics 闭环)、avid(只用预训练模型噪声输出训轻量 adapter)供给。


四、范式三 · 交互/游戏世界模型:可玩的神经引擎

游戏派的定义再挪一格——世界模型必须实时、逐帧响应用户输入,物理/规则/光照全由网络内部想象,没有任何游戏引擎。它和生成视频的区别是”要给人玩”这个硬约束,逼出对延迟、帧率、长程一致性的极致工程。

4.1 从 GAN 引擎到实时扩散/AR

源头 game-gan(CVPR 2020,第一个用 GAN 学出整个游戏引擎,把 Pac-Man 变神经模拟器)与 playable-video-generation(CADDY,无标签视频里学离散动作空间,预演了 Genie 的 LAM)。里程碑是 gamengen——第一个完全由神经网络驱动的游戏引擎,把 SD 1.4 改成动作条件自回归扩散,单 TPU 20+ FPS 实时玩 DOOM(PSNR 29.4,人类只有 58/60% 能区分真假)。此后进入”实时性军备竞赛”:

世界模型骨干分辨率/帧率可玩时长/一致性开源
decart-oasisDiT(ViT-VAE)360p / 20fps / 47msMinecraft 风500M 权重开源
deepmind-genie2自回归潜空间扩散最长约 1 分钟一致
genie-3自回归生成720p / 24fps数分钟一致、~1 分钟记忆研究预览
gamegen-x掩码时空扩散 Transformer320p / 20fpsFVD 1016→760、控制成功率 27%→63%
the-matrix视频 DiT + Swin-DPM720p AAA无限长、8–16 FPS
playable-game-generationVAE + DiT(diffusion forcing)RTX 2060 / 20fps1000+ 帧 ActAcc 仅降 0.803→0.789
mineworldLLaMA AR(VQ token)3–6 FPSMinecraft 实时
skywork-matrix-game-2Wan-I2V 蒸馏(3 步)H100 / 25 FPS分钟级流式
skywork-matrix-game-3双向 DiT + 自纠错720p / 40 FPS分钟级长程一致

工业界代表作还有 microsoft-wham-muse(Nature,1.6B,Xbox《Bleeding Edge》6.1 万场对局、逾 7 年人类游玩,自回归生成 2 分钟一致画面,把创作力拆成一致性/多样性/持久性三指标)、tencent-hunyuan-gamecraft(HunyuanVideo 基座、键鼠映射到连续相机动作、6.6 FPS)、tencent-yan(Yan-Sim 1080P/60FPS + Yan-Gen + Yan-Edit 三段全流程)。开源生态里 skywork-matrix-game(17B + Matrix-Game-MC 2700+h + GameWorld Score)、gamefactory(70h Minecraft 标注迁移到开放域”创造新游戏”)、worldmem(显式记忆库,离开视野再回来场景/事件仍一致)各占一角;diamond 的扩散世界模型也脱离 RL 单独当过 CS:GO Dust II 神经引擎(RTX 3090 / 10Hz)。近期国产实时化工作密集涌现:tencent-yanmirage-dynamicslab(AI 原生 UGC 引擎)、playerone(第一人称真人动作驱动)、yume(SkyReels-V2-14B 基座、键盘动作城市漫游)、alayaworlddreamx-world-1moworld-flash-world-model(昇腾 NPU 原生 50 FPS)、odyssey-explorer(Odyssey-1,30 FPS/5 分钟)。

4.2 3D/可漫游世界生成:从”逐帧”到”持久几何”

游戏派里分出一支不满足于逐帧视频、要持久可自由漫游的 3D 世界:训练无关的 wonderjourney(GPT-4 循环生成场景 + 点云 + GPT-4V 校验)、wonderworld(FLAGS 表示,单场景 <1s、新场景 9.5s,CVPR 2025 Highlight)、genex(单图→360° 世界,把 GPT-4o 多智能体决策从 21.88% 拉到 94.87%)、腾讯混元 hunyuanworld-1(全景图 + VLM 分层 3D 网格)与 hunyuanworld-voyager(RGB-D 视频扩散、可直接 3D 重建)、Skywork matrix-3d(Wan2.1-I2V-14B 全景 + 3DGS)、高德 abot-3dworld-0(14B 全景视频扩散锚定地图 POI)。李飞飞 World Labs 的 world-labs-marble(持久可下载 3DGS+网格世界,2025-11 商用)与 world-labs-rtfm(单张 H100、位姿帧作空间记忆、context juggling)代表这一支的最新工业化形态。


五、范式四 · 驾驶世界模型:多模态 × 可控 × 长时程

驾驶是唯一横跨整条光谱的应用域:这里的世界模型既可以是”环视视频生成器”,也可以是”3D 占据预测器”或”点云预测器”,还可以退化成纯隐状态规划器。survey-world-models-autonomous-driving 按预测模态给它建了骨架,下面按这条模态轴组织。

5.1 图像/视频派:可控性与时长两条竞赛

adriver-i(MLLM 预测控制信号 + 视频扩散生成未来、闭环”无限行驶”)与 gaia-1-wayve(6.5B 自回归 Transformer + 2.6B 扩散解码器、伦敦 4700h、首验驾驶 WM 的 scaling law)起步,往两个方向卷:可控性——drivedreamer(HDMap+3D 框+文本结构化条件)→ drivedreamer-2(LLM 当”交通导演”,nuScenes FID/FVD 11.2/55.7)、magicdrive(场景/前景/背景三路编码)→ magicdrive3d/magicdrivedit(DiT + 3D VAE,848×1600、241 帧)、panacea-driving-video(分解式 4D 注意力)、drivingdiffusion(三阶段级联多视角)、首个多视角的 drive-wm-driving-into-the-future(把多种未来 rollout 接入规划器 VAD);时长——genad-generalized-predictive-model(OpenDV-2K 2059h,比 nuScenes 大 374×)、vista-driving-world-model(SVD 基座、1740h、10Hz 576×1024、15 秒)→ drivingworld-gpt(40 秒+)→ delphi-driving-video(40 帧/12 秒)→ infinitydrive(1500+ 帧 ≈ 2 分钟)→ epona-autoregressive-diffusion(时空解耦 AR 扩散、FVD 82.8 vs Vista 89.4、2 分钟/600 帧,且当规划器 NAVSIM PDMS 86.2)。Wayve 的 gaia-2-wayve 把 GAIA-1 从离散自回归换成 8.4B flow-matching 连续隐空间扩散(448×960、5 路环视、英美德三地)。

5.2 3D 占据 / 点云派:把预测搬进几何空间

另一支认为”生成好看的像素”不等于”懂路况”,于是把世界模型建在 3D 语义占据点云上。占据世界模型的开山是 occworld(VQ-VAE 场景 tokenizer + GPT 式时空 transformer,不用实例框/高精地图):

占据/点云世界模型表征关键锚点
occworld离散场景 token(VQ-VAE)首个占据 WM,联合预测占据+自车轨迹
occsora3D VQ-VAE + DiT-XL/2 整段扩散Sora 思路搬进 4D 占据
dome-occupancy-world-model连续 VAE + 时空 DiT保细节、长 rollout
gaussianworld-occupancy显式 3D 语义高斯流式、几乎不增单帧算力
i2-world-tokenization场内+场间残差量化+25.1% mIoU、2.9GB、37 FPS
sparseworld-4d-occupancy1040 个稀疏动态 query20–40% mIoU、碰撞减半、~7× 提速
copilot4d-waabiLiDAR BEV token + 离散扩散Chamfer 砍 65–75%(1s)
vidar-visual-point-cloud-forecasting视觉→未来点云(跨模态)检测 +3.1 NDS、规划碰撞 ~15%

纯视觉占据这一支还密集产出 drive-occworldsemisup-vision-centric-occ-world-model(PreWorld,2D 标签预训练)、sparseworld-tcdriveworld-4d-pretraining(MSSM 4D 预训练六任务全涨)、cam4docc-benchmark(首个纯相机 4D 占据 benchmark)。

5.3 统一/闭环派与”世界模型即数据机器”

最新趋势是把感知-预测-规划拧成一条闭环doe-1(观测→描述→动作自回归单序列,号称首个闭环生成式驾驶)、hermes-driving-world-model / hermes-plus-plus(BEV 驱动 LLM 同时做 VQA 理解与点云生成,Chamfer -32.4% / CIDEr +8.0%)、world4drive(视觉基础模型注入语义先验、隐空间想象多意图未来)、policy-world-model-forecasting-planning(先描述→滚未来→再规划的 collaborative state-action)、driveworld-vla(VLA 规划器与世界模型共享隐空间闭环,NAVSIMv1 PDMS 91.3)、worlddrive-scene-gen-planning(轨迹感知 WM → 表征继承 → 未来感知奖励器)。小米的 xiaomi-auto-world-model 把”世界重建 WorldRec(小时级→~10s)“与”世界生成 WorldGen(50 步蒸馏到 4 步)“深度耦合成 Joint World Model(nuScenes 自回归 FVD 64.97)。NVIDIA 的 nvidia-omnidreams 从 Cosmos-Predict2.5 后训出 2B 因果扩散驾驶 WM(GB300 单视 68 FPS)并 fine-tune 出碰撞率超 5× 参数 VLA 的 WAM 策略。

还有一支把世界模型当纯数据引擎drivedreamer4d / recondreamer(生成新轨迹视频喂 4DGS 重建)、cosmos-drive-dreams(Cosmos 后训 + SDG 流水线批量造长尾场景,开源 81,802 条)、worldsplat(前馈 4D 高斯桥接生成与重建)。但这条路线也被自我审视:rethinking-dwm-synthetic-data-generator(Dream4Drive)指出此前”合成数据涨点”论文普遍偷偷把训练轮次翻倍,对齐 epoch 后收益几乎消失——一记冷静的方法论警钟;drive-and-gen-coeval(Waymo)则让生成模型与 E2E 规划器互为评测工具。


六、范式五 · JEPA:非生成、在表征空间预测

JEPA 是唯一明确拒绝生成像素的范式:它在抽象表征空间做遮盖预测,主张”预测像素是在浪费容量建模不可预测的细节”。这正是 LeCun 路线(lecun-path-autonomous-machine-intelligence)与 Ha&Schmidhuber 生成派的根本分歧。

6.1 从图像到视频:主线三步

i-jepa 是蓝图的第一个图像实例——从一个 context block 预测同图若干 target block 的表征(非像素、非 token、非对比、无数据增强),ViT-H/14 用 16 A100×72h 训完就拿到强下游表现;论文把它的 predictor 称作”一个原始的、受限的 world-model”。v-jepa 扩到视频(ViT 编码器 + 窄 predictor、EMA target、无像素解码器/无文本/无负样本),仅 200 万公开视频、9 万步,冻结主干 + attentive probe 就 K400 81.9 / SSv2 72.2 / IN 77.9。v-jepa-2 拉到 100 万小时视频 + 10 亿参数(ViT-g),再冻结编码器、只用 <62 小时 无标注 Droid 机器人视频后训一个 3 亿参数动作条件预测器 V-JEPA 2-AC,在表示空间里做规划,实现 Franka 机械臂零样本抓取拿放(无部署数据、无任务训练、无奖励)——这是 JEPA 派”隐空间规划”最强的落地证据。

诊断性证据同样关键:intuitive-physics-vjepa 用”预期违背”范式让冻结 V-JEPA 零样本在 IntPhys 拿 98%(像素预测的 VideoMAEv2、多模态大模型 Qwen2-VL/Gemini 1.5 都接近随机 50%),证明”在学到的表征空间做预测”这一目标本身就足以涌现物体恒常性等直觉物理,哪怕只用 1.15 亿参数小模型。

6.2 跨模态铺开:一套范式,八种数据

I-JEPA 的”隐空间掩码预测”被系统性地搬到几乎每一种模态,构成 JEPA 家族最宽的一层:

JEPA 变体模态定制设计锚点
a-jepa音频课程式时频掩码AudioSet 比 Audio-MAE +1.3 mAP
point-jepa点云贪心排序器解决置换不变性ModelNet40 93.7%、预训练仅 7.5h
brain-jepafMRI 脑动力学梯度定位 + 时空掩码UK Biobank 4 万+、8 任务超 BrainLM
stem-jepa-music多轨音乐”拿掉一个乐器”当遮挡首次把 predictor 用于推理阶段
s-jepa-eegEEG按电极空间块遮蔽跨数据集迁移
t-jepa-tabular表格特征子集互预测 + [REG] token持平/超 XGBoost/CatBoost
mc-jepa视频运动+图像内容共享编码器双任务光流与语义互相帮助
iwm-learning-leveraging-world-models图像光度变换条件化 predictor 可迁移复用predictor 微调 ≈ encoder 微调

6.3 隐空间规划、理论闸门与”生成式旁支”

JEPA 与 RL-WM 在”隐空间规划”上直接握手:dino-wm(LeCun 参与,冻结 DINOv2 patch 特征上学动作条件动力学 + CEM/MPC 零样本规划)、pldm-planning-latent-dynamics(NYU/Meta,纯离线无奖励导航数据上,JEPA 隐动力学 + MPC 全面碾压 model-free 目标条件 RL)、navigation-world-models(Meta FAIR + LeCun,CDiT 自回归预测未来第一视角、既能独立 CEM 规划又能给外部策略打分,CVPR 2025 Oral)。理论上 lejepa(Balestriero & LeCun)证明各向同性高斯是最优 embedding 分布、用 SIGReg 把 JEPA 删到”1 个超参、~50 行、无 stop-gradient/EMA”(ViT-H/14 冻结线性探针 79%),when-does-lejepa-learn-world-model 进一步用 Lean 4 机器验证证明 LeJEPA 在平稳加性噪声世界里线性可辨识。旁支还有把 JEPA 反向改造成生成器的 jepa-t-text-to-image(ImageNet FID 1.42)、把它注入 LLM/VLA 的 llm-jepajepa-vla(冻结 V-JEPA 2 注入 VLA,+6–19 pts)、以及把推理搬进隐空间的 jepa-reasoner


七、五条路正在合流

把五范式并排看,2024–2026 的合流通道已经清晰:

  • 骨干趋同:五派几乎都走了 RNN/GAN → Transformer → DiT/扩散/flow-matching 同一条换芯路;tokenizer 从离散 VQ 走向连续/残差量化。RL-WM 的 storm/iris、驾驶的 drivingworld-gpt、游戏的 mineworld、视频的 cosmos-predict2 用的其实是同代骨干。
  • 隐动作统一游戏与视频:从 playable-video-generation 的无监督离散动作,到 deepmind-genie2/genie-3 的 Latent Action Model,再到 adaworld(连续潜动作、新环境零训练迁移),“从无标签视频里学一个可控动作空间”成为跨游戏/视频/机器人的通用接口。
  • 实时化蒸馏:游戏、驾驶、具身三派同时在做 self-forcing / DMD 少步蒸馏 + KV-cache 流式,把扩散从 50 步压到 3–4 步(skywork-matrix-game-2nvidia-omnidreamsxiaomi-auto-world-modelgigaworld-1),实时帧率成为共同 KPI。
  • “想象→行动”闭环收敛:RL-WM 的想象、视频派的 video-as-policy、驾驶派的前瞻规划、JEPA 派的隐空间 MPC,本质都是”在学到的模型里预测未来、再据此选动作”的模型预测控制。mbzuai-pan-world-model 的 GLP(LLM 隐骨干 + 视频解码器)与 nvidia-cosmos-policy(一个模型兼策略+世界模型+价值)是把 JEPA 隐预测与生成像素焊在一起的显式样本。
  • WFM 作共享底座:一个通用世界基础模型(Cosmos)能被后训练成驾驶(cosmos-drive-dreamsnvidia-omnidreams)与机器人(nvidia-cosmos-policy)专用模型,五范式开始共用一个预训练地基。
  • 消费端 agentsima-scalable-instructable-multiworld-agent / deepmind-sima2 这类通用具身智能体是”住在世界模型里”的一端,与 genie-3 配对构成”agent × 世界模型”栈——世界模型造环境,agent 消费并反过来验证其一致性。

空白与趋势

共同的硬骨头是”物理”。跨范式的评测几乎一致地判了当前世界模型的物理理解不及格:视频派的 videophy(最好的 Pika 仅 19.7% 同时满足语义+物理)、videophy-2(Wan2.1-14B 全集 32.6%、hard 子集 22%)、phygenbench(Gen-3 PCA 0.51)、physics-iq(最好 24.1%,且视觉真实度与物理理解不相关)、phyworldbench/impossible-videos;VLM 理解侧的 physbench(GPT-4o 49.49% vs 人类 95.87%);以及最早把这件事量化的 physion/physion-plus-plus(除读取 3D 真值的 DPI 粒子 GNN 外无模型逼近人类)。评测范式本身也在从”表面保真”转向”内在保真”(vbenchvbench-2.0worldscore-benchmarkworldsimbenchworldmodelbench),并催生 wisa 这类显式注入物理先验的 T2V 方法。

尚未闭合的缺口:(1) 评测缺统一闭环基准——驾驶综述明确点名”无统一 benchmark”,各派各自造尺子;(2) 长时程一致性与记忆仍靠外挂记忆库(worldmem)或工程 hack(context juggling),未见原生解;(3) 像素 vs 表征之争未决——JEPA 派用 intuitive-physics-vjepapldm-planning-latent-dynamicspwm-multitask-world-models 论证”不必生成像素也能规划”,生成派则用 genie-3wow-world-omniscient-model 论证”像素级真实交互不可替代”,mbzuai-pan-world-model 的 GLP 是当前最有希望的调和;(4) 真机数据稀缺——具身派普遍靠 1% 量级新数据微调(vidar)或数字遥操作造数据(alibaba-rynnworld-teleop)。趋势上,五范式正被”世界基础模型 + 后训练 + 实时蒸馏 + 物理评测”这套共同语法收编,“world model”这个词也在从”某个具体网络”变成”一层可被任意下游(控制/生成/规划/表征)复用的通用底座”。