世界模型五大范式对比:RL-WM · 生成视频 · 交互/游戏 · 驾驶 · JEPA
概述:“世界模型”(world model)这个词从来不是一个单一技术,而是一族共享同一句定义——学一个能预测环境如何演化的内部模型——却各说各话的研究传统。本调研的 200+ 页把它们收拢成五大范式:(1) RL 世界模型,为”控制”学一个可在其中想象/规划的动力学模型(dreamer-v3/muzero 两条谱系);(2) 生成视频世界模型,把”动作进、视频出”的可控视频生成直接当模拟器(unisim→cosmos-predict2→mbzuai-pan-world-model);(3) 交互/游戏世界模型,用神经网络实时”渲染”一个可玩的世界(gamengen→genie-3→skywork-matrix-game-3);(4) 驾驶世界模型,在图像/占据/点云多种模态上预测未来路况并回灌规划(gaia-1-wayve→vista-driving-world-model→xiaomi-auto-world-model);(5) JEPA,LeCun 路线,不生成像素、在抽象表征空间做预测(i-jepa→v-jepa-2)。五者沿两条正交轴分布——预测空间(像素观测 vs 抽象隐状态 vs 3D 结构)与目的(控制 / 造数据 / 给人玩 / 学表征)——但到 2025–2026 正沿骨干、隐动作、实时蒸馏、物理评测四条通道快速合流,并在 NVIDIA Cosmos、MBZUAI PAN 这类”世界基础模型”里被同一骨干统一承载。
一、什么是”世界模型”:两条源头与一张光谱
这个概念有两位不同的”命名人”,也正是五大范式分裂的根。world-models-ha-schmidhuber(Ha & Schmidhuber, NeurIPS 2018)在深度 RL 语境里明确命名了 “world model” 这一术语:把智能体拆成「大世界模型(VAE 视觉 + MDN-RNN 记忆)+ 极小控制器」,并首次证明控制器可以完全在世界模型生成的”梦境”里训练再零样本迁回真实环境(VizDoom)——这条”生成观测、在想象里学控制”的思路直接长成 Dreamer 与所有生成式世界模型。四年后,lecun-path-autonomous-machine-intelligence(LeCun, 2022)给出针锋相对的另一版:世界模型该是一个非生成、在表征空间做预测的联合嵌入预测架构(JEPA),推理即能量最小化的模型预测控制——催生了 I-JEPA/V-JEPA 一脉。
清华 FIB Lab 的纲领性综述 understanding-world-or-predicting-future-survey 把这条裂缝概括成两条并行主线——隐式表征(理解现在)vs 未来预测(预知未来);华科/百度的 survey-world-models-autonomous-driving 则按”预测场景的模态”(2D 图像 / 3D 占据·点云 / 无场景隐状态)给驾驶世界模型建了一张 47 方法总表;新加坡国立的 world-action-models-survey 又从”预测的未来会不会反过来参与产生/打分/训练动作”这条属性收编了 109 篇工作。更早的方法论奠基是 mbrl-survey-moerland(Leiden/TU Delft),用”是否有模型""是否存全局解”两条轴把 planning / model-free / model-based 三分。把这些定义投影到一张光谱上,就是下面这张五范式总览:
| 范式 | ”世界模型”指什么 | 预测空间 | 核心目标 | 骨干演进 | 代表作 |
|---|---|---|---|---|---|
| RL-WM | 供智能体想象/规划的动力学模型 | 抽象隐状态(可无观测重建) | 样本高效控制 | RSSM→Transformer→Diffusion;MCTS 隐模型 | world-models-ha-schmidhuber dreamer-v3 muzero |
| 生成视频 | 动作进、视频出的可控模拟器 | 像素/视频(VAE 隐空间) | 造可执行数据 / 通用模拟 | 视频 U-Net→DiT→flow-matching | unisim cosmos-predict2 mbzuai-pan-world-model |
| 交互/游戏 | 实时可玩的神经游戏引擎 | 像素(逐帧自回归) | 给人/agent 实时交互 | GAN→AR Transformer→蒸馏扩散 | gamengen genie-3 skywork-matrix-game |
| 驾驶 | 预测未来路况并回灌规划 | 图像 / 3D 占据 / 点云 / 隐状态 | 仿真·造数据·前瞻规划 | 扩散/AR 视频、占据 VQ、点云扩散 | gaia-1-wayve vista-driving-world-model occworld |
| JEPA | 表征空间的预测器 | 抽象表征(不重建像素) | 学可迁移表征 / 隐空间规划 | ViT + 窄 predictor(EMA target) | i-jepa v-jepa v-jepa-2 |
两条轴一目了然:纵向是”预测越来越抽象”(像素 → 3D 结构 → 纯隐状态 → 表征),横向是”用途从造像素给人看,滑向学表征给策略用”。RL-WM 与 JEPA 站在”抽象/控制”一端,生成视频与游戏站在”像素/交互”一端,驾驶横跨整条光谱。下面逐一展开。
二、范式一 · RL 世界模型:为”控制”而学
RL-WM 的定义最苛刻:世界模型不是给人看的,而是让智能体在其中想象或搜索、从而少碰真实环境就学会控制。它内部又清晰分成两条谱系——“想象派”(学观测动力学、在想象轨迹里训 actor-critic)与”规划派”(学只对规划有用的价值等价隐模型、用 MCTS 前瞻搜索)。
2.1 想象派:Dreamer 一脉与骨干换芯
奠基是 planet(RSSM,纯规划、平均省 ~200× 交互)与 dreamer-v1(第一个纯靠隐空间想象学连续控制的 agent,DMC 20 任务 823 分超 10⁸ 步的 D4PG 786)。dreamer-v2 把 RSSM 的高斯隐状态换成32×32 分类离散隐变量 + KL balancing,成为第一个纯靠想象在 Atari 达人类水平的 agent(单张 V100、<10 天)。dreamer-v3 靠 symlog / twohot / free bits / 百分位归一化这套鲁棒变换做到一套超参打 8 大领域 150+ 任务,并首次无人类数据、无课程地在 Minecraft 挖到钻石(单张 A100,首颗钻石约 30M 步)——Nature 2025 正刊。harmonydream 把它重构为”观测建模 vs 奖励建模”双任务配平,仅加三个可学习标量就把 DreamerV3 在 Atari 100k 刷到 136.5% 人类归一化。真机方向 daydreamer 把 DreamerV2 原封搬到 4 台真实机器人(Unitree A1 1 小时学会行走);层级方向 director 加 manager-worker(K=8 步隐目标);解耦方向 iso-dream 拆可控/不可控/静态三分支;语言方向 dynalang 让语言 token 与图像同步输入做多模态 Dreamer。
真正把这条线做”厚”的是骨干换芯——从 RNN 换到 Transformer / 扩散 / SSM,在极端样本受限的 Atari 100k(每游戏仅 10 万步 ≈ 2 小时真人时长)上比拼:
| 世界模型 | 骨干 | Atari 100k 人类归一化 | 关键机制 | 训练开销 |
|---|---|---|---|---|
| iris | VQVAE + GPT AR(16 token/帧) | mean 1.046,10/26 超人 | 逐 token 想象 | — |
| TWM | Transformer-XL | mean 0.956 / median 0.505 | 策略只吃隐状态 z | — |
| TWISTER | TSSM + 对比预测(AC-CPC) | mean 1.62 | 预测未来 10 步高层特征 | — |
| storm | GPT causal Transformer | mean 1.267 | 保留 categorical-VAE 想象 | RTX 3090 4.3h |
| diamond | 扩散模型即世界模型 | mean 1.46 | 视觉细节直接建像素 | — |
| delta-iris | Δ-token(4 token/帧) | Crafter 17/22 成就、超 DreamerV3 | 帧间增量编码 | 比 IRIS 快一个数量级 |
| rem-parallel-observation-prediction | RetNet + 并行观测预测 | 26 游戏 12 超人 | 想象加速 15.4× | <12h |
| efficientzero | MuZero + 自监督一致性 | mean 194.3% / median 109.0% | value prefix + off-policy 校正 | 4×3090×7h |
长程记忆是另一条隐线:transdreamer 首个 Transformer 随机状态空间模型(TSSM),s4wm-world-model-backbones 首个兼容可并行 SSM 的世界模型骨架(在 2000 步记忆任务上全面超 RNN/Transformer),recall-to-imagine-r2i 把 S4/S5 塞进 DreamerV3(Memory Maze 首次超人、训练快最多 9×)。扩散骨干还外溢到离线 RL:diffusion-world-model-offline-rl 用条件扩散一次前向预测多步状态与奖励(D4RL 比单步动力学高 44%),diffusion-forcing 则用”每 token 独立噪声级别”统一 teacher-forcing 与整序列扩散,成为长时程稳定 rollout 的方法论基石。
2.2 规划派:MuZero 价值等价隐模型与 MCTS
另一条谱系不重建观测,只学”对规划有用”的隐模型。源头是 value-prediction-network(价值等价模型,MuZero 自陈的”最接近前身”)。muzero(Nature 2020)学表示/动力学/预测三件套、把 AlphaZero 的 MCTS 整个搬进抽象隐状态,Atari 57 刷新 SOTA 且在围棋/象棋/将棋匹配拿完美模拟器的 AlphaZero。此后是一整套把 MuZero 往各种”缺陷”上补的工作,几乎每一篇都对应一个具体的能力扩边:
| 工作 | 给 MuZero 补的能力 | 关键设计 | 效果锚点 |
|---|---|---|---|
| sampled-muzero | 高维/连续动作 | 采样 K 动作 + 重要性加权 PUCT | 56 维人形 K=3~5 逼近穷举 |
| stochastic-muzero | 随机环境 | afterstate + chance node + VQ chance code | 2048/西洋双陆棋可用、围棋不掉 |
| vq-models-planning | 部分可观测 | 环境响应编码成 VQVAE latent 节点 | DeepMind Lab 可扩展 |
| gumbel-muzero | 极小模拟预算 | Gumbel Top-k + Sequential Halving | 2 次模拟/步可靠学习 |
| muzero-unplugged | 在线/离线统一 | 调节 Reanalyse fraction(0→100%) | RL Unplugged SOTA |
| efficientzero-v2 | 离散+连续统一 | 采样 Gumbel search + 搜索式价值估计 | 50/66 任务超 DreamerV3 |
| unizero | 长记忆/多任务 | Transformer 隐模型,解耦 z 与历史 h | VisualMatch/多任务超 MuZero |
| rezero-mcts | reanalyze 提速 | 反向视图 + 整 buffer 周期 reanalyze | 2–4× wall-clock 加速 |
配套的开源基建是 lightzero(统一 9 个 MCTS/MuZero 变体 + 20 余环境,NeurIPS 2023 Spotlight),UniZero/ReZero 的代码都并入其中。
2.3 隐空间规划的”轻量派”与”复用派”
介于两派之间还有一支”不搜索、直接在隐空间做局部轨迹优化(MPC)“的路线:td-mpc(任务导向隐动力学 TOLD + TD 价值,MPPI 短 horizon H=5)、td-mpc2(同一套超参 104 任务、单个 317M 模型跨 80 任务多具身)。pwm-multitask-world-models 复用同一个 TD-MPC2 世界模型,把策略抽取从”在线规划”换成”对世界模型一阶梯度反传”,反直觉地发现——世界模型对策略学习的价值不在预测精度,而在它诱导的优化地形是否光滑。这个洞见正好把 RL-WM 引向 JEPA 派的核心主张(见第六节)。此外 ivideogpt(压缩 token 化 16×、142 万条轨迹)把 AR Transformer 世界模型做成开源基石,横跨 RL-WM 与生成视频两个范式。
三、范式二 · 生成视频世界模型:视频即模拟器
这一派的定义反过来——世界模型就是一个可控视频生成器:给动作/文本/图像条件,生成”接下来会发生什么”的像素级视频,再把这段视频当模拟器去训策略、抽动作或供人看。它和 RL-WM 的分水岭在于”是否重建观测”:这里全程生成像素。
3.1 视频即策略(video-as-policy)
奠基是把”序列决策 = 文本条件视频生成”这一等式落地的 UniPi(NeurIPS 2023 Spotlight,文本条件视频扩散做 planning + 逆动力学抽动作),和把它做成”真实世界模拟器”的 unisim(5.6B 视频 U-Net 融合互联网/机器人/导航异构数据,action-in-video-out,ICLR 2024 最佳论文)。往下派生出一整族”甩开动作标签”的工作:avdc-actionless-videos(合成视频 + 光流密集对应反推动作,4 GPU 一天 vs UniPi 的 256 TPU pod)、video-language-planning(VLM 当策略+价值、视频扩散当动力学,做前向树搜索)、robodreamer(把语言条件做成可组合的 EBM 乘积)、videoworld(纯看无标签视频学会围棋,Video-GoBench Elo 2317 超人类职业 5 段)。
3.2 通用世界模型与”世界基础模型”(WFM)
2024 起这条线开始规模化、平台化:
| 世界模型 | 骨干/规模 | 条件 | 数据/规模锚点 | 定位 |
|---|---|---|---|---|
| pandora | Vicuna-7B + DynamiCrafter | 自由文本、任意时刻插动作 | 只有定性结果 | AR-扩散混合 |
| lwm-large-world-model | LLaMA-2 7B + RingAttention | tokens-in-tokens-out | 1M token 上下文 | 长视频+书籍联合 |
| cosmos-predict2 | 扩散 DiT 0.6/2/14B | Text2Image / Video2World | NATTEN 把 720p 成本压到 38–59% | 开源 WFM 平台 |
| cosmos-predict2-5-world-simulation | flow-matching 2B/14B | Text/Image/Video2World 统一 | 文本编码器换 nvidia-cosmos-reason1 | 物理 AI 模拟器 |
| mbzuai-pan-world-model | Qwen2.5-VL-7B + Wan2.1-14B | 自然语言动作 | GLP:LLM 隐骨干 + 视频解码器 | 开源 SOTA,追平 KLING/MiniMax |
| wow-world-omniscient-model | DiT 14B | 机器人交互 | 2.03M 段 / 7300h / 6.33 亿帧 | FM-IDM 真机 94.5%/75.2% |
其中 mbzuai-pan-world-model 的 GLP(生成式潜在预测)架构值得单独点名:“LLM 潜在动力学骨干(想象/推理)+ 视频扩散解码器(还原可观测现实)“——这正是 JEPA 的”隐空间预测”与生成视频的”像素还原”缝在一条流水线里,是五范式合流的一个显式样本。NVIDIA Cosmos 家族则把 WFM 做成可后训练的底座:nvidia-cosmos-transfer1 加多路 ControlNet 做 world-to-world transfer、nvidia-cosmos-reason1 把”物理常识推理”拆成单独的多模态 LLM、nvidia-cosmos-policy 干脆把动作/本体/价值当作新”帧”塞进视频扩散序列一个模型兼任策略+世界模型+价值(LIBERO 98.5%)。
3.3 具身视频世界模型:往 4D 与真机走
机器人域这一支强调”生成结果要能变成动作、要几何一致”:irasim(帧级动作条件 DiT,策略评估与真机 Mujoco 相关系数 0.99,Push-T IoU 0.637→0.961)、vidar(Vidu 2.0 基座 + 掩码逆动力学,仅 20 分钟/232 段新平台数据 ≈ 同类 1%)、genie-envisioner(GE-Base 世界模型 + GE-Act 动作策略 + GE-Sim 模拟器四件套共享 latent)、gigaworld-1(evaluator 导向,比 Wan2.2-5B 高 14.9%)。把 2D 视频升维成 4D 是明显趋势——tesseract-4d-world-model(RGB-D-Normal 三通道→4D 点云,ICCV 2025)、alibaba-rynnworld-4d(RGB + Depth + 光流三模态同步)、enerverse(Free Anchor View 虚拟视角 + 4DGS 数据飞轮)、roboscape(联合训深度与关键点动态两个物理先验)。可控性/长时程方法论则由 history-guided-video-diffusion(DFoT + History Guidance,稳定 rollout 800+ 帧)、owl-1(state-observation-dynamics 闭环)、avid(只用预训练模型噪声输出训轻量 adapter)供给。
四、范式三 · 交互/游戏世界模型:可玩的神经引擎
游戏派的定义再挪一格——世界模型必须实时、逐帧响应用户输入,物理/规则/光照全由网络内部想象,没有任何游戏引擎。它和生成视频的区别是”要给人玩”这个硬约束,逼出对延迟、帧率、长程一致性的极致工程。
4.1 从 GAN 引擎到实时扩散/AR
源头 game-gan(CVPR 2020,第一个用 GAN 学出整个游戏引擎,把 Pac-Man 变神经模拟器)与 playable-video-generation(CADDY,无标签视频里学离散动作空间,预演了 Genie 的 LAM)。里程碑是 gamengen——第一个完全由神经网络驱动的游戏引擎,把 SD 1.4 改成动作条件自回归扩散,单 TPU 20+ FPS 实时玩 DOOM(PSNR 29.4,人类只有 58/60% 能区分真假)。此后进入”实时性军备竞赛”:
| 世界模型 | 骨干 | 分辨率/帧率 | 可玩时长/一致性 | 开源 |
|---|---|---|---|---|
| decart-oasis | DiT(ViT-VAE) | 360p / 20fps / 47ms | Minecraft 风 | 500M 权重开源 |
| deepmind-genie2 | 自回归潜空间扩散 | — | 最长约 1 分钟一致 | 否 |
| genie-3 | 自回归生成 | 720p / 24fps | 数分钟一致、~1 分钟记忆 | 研究预览 |
| gamegen-x | 掩码时空扩散 Transformer | 320p / 20fps | FVD 1016→760、控制成功率 27%→63% | 是 |
| the-matrix | 视频 DiT + Swin-DPM | 720p AAA | 无限长、8–16 FPS | 否 |
| playable-game-generation | VAE + DiT(diffusion forcing) | RTX 2060 / 20fps | 1000+ 帧 ActAcc 仅降 0.803→0.789 | 是 |
| mineworld | LLaMA AR(VQ token) | 3–6 FPS | Minecraft 实时 | 是 |
| skywork-matrix-game-2 | Wan-I2V 蒸馏(3 步) | H100 / 25 FPS | 分钟级流式 | 是 |
| skywork-matrix-game-3 | 双向 DiT + 自纠错 | 720p / 40 FPS | 分钟级长程一致 | 是 |
工业界代表作还有 microsoft-wham-muse(Nature,1.6B,Xbox《Bleeding Edge》6.1 万场对局、逾 7 年人类游玩,自回归生成 2 分钟一致画面,把创作力拆成一致性/多样性/持久性三指标)、tencent-hunyuan-gamecraft(HunyuanVideo 基座、键鼠映射到连续相机动作、6.6 FPS)、tencent-yan(Yan-Sim 1080P/60FPS + Yan-Gen + Yan-Edit 三段全流程)。开源生态里 skywork-matrix-game(17B + Matrix-Game-MC 2700+h + GameWorld Score)、gamefactory(70h Minecraft 标注迁移到开放域”创造新游戏”)、worldmem(显式记忆库,离开视野再回来场景/事件仍一致)各占一角;diamond 的扩散世界模型也脱离 RL 单独当过 CS:GO Dust II 神经引擎(RTX 3090 / 10Hz)。近期国产实时化工作密集涌现:tencent-yan、mirage-dynamicslab(AI 原生 UGC 引擎)、playerone(第一人称真人动作驱动)、yume(SkyReels-V2-14B 基座、键盘动作城市漫游)、alayaworld、dreamx-world-1、moworld-flash-world-model(昇腾 NPU 原生 50 FPS)、odyssey-explorer(Odyssey-1,30 FPS/5 分钟)。
4.2 3D/可漫游世界生成:从”逐帧”到”持久几何”
游戏派里分出一支不满足于逐帧视频、要持久可自由漫游的 3D 世界:训练无关的 wonderjourney(GPT-4 循环生成场景 + 点云 + GPT-4V 校验)、wonderworld(FLAGS 表示,单场景 <1s、新场景 9.5s,CVPR 2025 Highlight)、genex(单图→360° 世界,把 GPT-4o 多智能体决策从 21.88% 拉到 94.87%)、腾讯混元 hunyuanworld-1(全景图 + VLM 分层 3D 网格)与 hunyuanworld-voyager(RGB-D 视频扩散、可直接 3D 重建)、Skywork matrix-3d(Wan2.1-I2V-14B 全景 + 3DGS)、高德 abot-3dworld-0(14B 全景视频扩散锚定地图 POI)。李飞飞 World Labs 的 world-labs-marble(持久可下载 3DGS+网格世界,2025-11 商用)与 world-labs-rtfm(单张 H100、位姿帧作空间记忆、context juggling)代表这一支的最新工业化形态。
五、范式四 · 驾驶世界模型:多模态 × 可控 × 长时程
驾驶是唯一横跨整条光谱的应用域:这里的世界模型既可以是”环视视频生成器”,也可以是”3D 占据预测器”或”点云预测器”,还可以退化成纯隐状态规划器。survey-world-models-autonomous-driving 按预测模态给它建了骨架,下面按这条模态轴组织。
5.1 图像/视频派:可控性与时长两条竞赛
从 adriver-i(MLLM 预测控制信号 + 视频扩散生成未来、闭环”无限行驶”)与 gaia-1-wayve(6.5B 自回归 Transformer + 2.6B 扩散解码器、伦敦 4700h、首验驾驶 WM 的 scaling law)起步,往两个方向卷:可控性——drivedreamer(HDMap+3D 框+文本结构化条件)→ drivedreamer-2(LLM 当”交通导演”,nuScenes FID/FVD 11.2/55.7)、magicdrive(场景/前景/背景三路编码)→ magicdrive3d/magicdrivedit(DiT + 3D VAE,848×1600、241 帧)、panacea-driving-video(分解式 4D 注意力)、drivingdiffusion(三阶段级联多视角)、首个多视角的 drive-wm-driving-into-the-future(把多种未来 rollout 接入规划器 VAD);时长——genad-generalized-predictive-model(OpenDV-2K 2059h,比 nuScenes 大 374×)、vista-driving-world-model(SVD 基座、1740h、10Hz 576×1024、15 秒)→ drivingworld-gpt(40 秒+)→ delphi-driving-video(40 帧/12 秒)→ infinitydrive(1500+ 帧 ≈ 2 分钟)→ epona-autoregressive-diffusion(时空解耦 AR 扩散、FVD 82.8 vs Vista 89.4、2 分钟/600 帧,且当规划器 NAVSIM PDMS 86.2)。Wayve 的 gaia-2-wayve 把 GAIA-1 从离散自回归换成 8.4B flow-matching 连续隐空间扩散(448×960、5 路环视、英美德三地)。
5.2 3D 占据 / 点云派:把预测搬进几何空间
另一支认为”生成好看的像素”不等于”懂路况”,于是把世界模型建在 3D 语义占据或点云上。占据世界模型的开山是 occworld(VQ-VAE 场景 tokenizer + GPT 式时空 transformer,不用实例框/高精地图):
| 占据/点云世界模型 | 表征 | 关键锚点 |
|---|---|---|
| occworld | 离散场景 token(VQ-VAE) | 首个占据 WM,联合预测占据+自车轨迹 |
| occsora | 3D VQ-VAE + DiT-XL/2 整段扩散 | Sora 思路搬进 4D 占据 |
| dome-occupancy-world-model | 连续 VAE + 时空 DiT | 保细节、长 rollout |
| gaussianworld-occupancy | 显式 3D 语义高斯 | 流式、几乎不增单帧算力 |
| i2-world-tokenization | 场内+场间残差量化 | +25.1% mIoU、2.9GB、37 FPS |
| sparseworld-4d-occupancy | 1040 个稀疏动态 query | 20–40% mIoU、碰撞减半、~7× 提速 |
| copilot4d-waabi | LiDAR BEV token + 离散扩散 | Chamfer 砍 65–75%(1s) |
| vidar-visual-point-cloud-forecasting | 视觉→未来点云(跨模态) | 检测 +3.1 NDS、规划碰撞 ~15% |
纯视觉占据这一支还密集产出 drive-occworld、semisup-vision-centric-occ-world-model(PreWorld,2D 标签预训练)、sparseworld-tc、driveworld-4d-pretraining(MSSM 4D 预训练六任务全涨)、cam4docc-benchmark(首个纯相机 4D 占据 benchmark)。
5.3 统一/闭环派与”世界模型即数据机器”
最新趋势是把感知-预测-规划拧成一条闭环:doe-1(观测→描述→动作自回归单序列,号称首个闭环生成式驾驶)、hermes-driving-world-model / hermes-plus-plus(BEV 驱动 LLM 同时做 VQA 理解与点云生成,Chamfer -32.4% / CIDEr +8.0%)、world4drive(视觉基础模型注入语义先验、隐空间想象多意图未来)、policy-world-model-forecasting-planning(先描述→滚未来→再规划的 collaborative state-action)、driveworld-vla(VLA 规划器与世界模型共享隐空间闭环,NAVSIMv1 PDMS 91.3)、worlddrive-scene-gen-planning(轨迹感知 WM → 表征继承 → 未来感知奖励器)。小米的 xiaomi-auto-world-model 把”世界重建 WorldRec(小时级→~10s)“与”世界生成 WorldGen(50 步蒸馏到 4 步)“深度耦合成 Joint World Model(nuScenes 自回归 FVD 64.97)。NVIDIA 的 nvidia-omnidreams 从 Cosmos-Predict2.5 后训出 2B 因果扩散驾驶 WM(GB300 单视 68 FPS)并 fine-tune 出碰撞率超 5× 参数 VLA 的 WAM 策略。
还有一支把世界模型当纯数据引擎:drivedreamer4d / recondreamer(生成新轨迹视频喂 4DGS 重建)、cosmos-drive-dreams(Cosmos 后训 + SDG 流水线批量造长尾场景,开源 81,802 条)、worldsplat(前馈 4D 高斯桥接生成与重建)。但这条路线也被自我审视:rethinking-dwm-synthetic-data-generator(Dream4Drive)指出此前”合成数据涨点”论文普遍偷偷把训练轮次翻倍,对齐 epoch 后收益几乎消失——一记冷静的方法论警钟;drive-and-gen-coeval(Waymo)则让生成模型与 E2E 规划器互为评测工具。
六、范式五 · JEPA:非生成、在表征空间预测
JEPA 是唯一明确拒绝生成像素的范式:它在抽象表征空间做遮盖预测,主张”预测像素是在浪费容量建模不可预测的细节”。这正是 LeCun 路线(lecun-path-autonomous-machine-intelligence)与 Ha&Schmidhuber 生成派的根本分歧。
6.1 从图像到视频:主线三步
i-jepa 是蓝图的第一个图像实例——从一个 context block 预测同图若干 target block 的表征(非像素、非 token、非对比、无数据增强),ViT-H/14 用 16 A100×72h 训完就拿到强下游表现;论文把它的 predictor 称作”一个原始的、受限的 world-model”。v-jepa 扩到视频(ViT 编码器 + 窄 predictor、EMA target、无像素解码器/无文本/无负样本),仅 200 万公开视频、9 万步,冻结主干 + attentive probe 就 K400 81.9 / SSv2 72.2 / IN 77.9。v-jepa-2 拉到 100 万小时视频 + 10 亿参数(ViT-g),再冻结编码器、只用 <62 小时 无标注 Droid 机器人视频后训一个 3 亿参数动作条件预测器 V-JEPA 2-AC,在表示空间里做规划,实现 Franka 机械臂零样本抓取拿放(无部署数据、无任务训练、无奖励)——这是 JEPA 派”隐空间规划”最强的落地证据。
诊断性证据同样关键:intuitive-physics-vjepa 用”预期违背”范式让冻结 V-JEPA 零样本在 IntPhys 拿 98%(像素预测的 VideoMAEv2、多模态大模型 Qwen2-VL/Gemini 1.5 都接近随机 50%),证明”在学到的表征空间做预测”这一目标本身就足以涌现物体恒常性等直觉物理,哪怕只用 1.15 亿参数小模型。
6.2 跨模态铺开:一套范式,八种数据
I-JEPA 的”隐空间掩码预测”被系统性地搬到几乎每一种模态,构成 JEPA 家族最宽的一层:
| JEPA 变体 | 模态 | 定制设计 | 锚点 |
|---|---|---|---|
| a-jepa | 音频 | 课程式时频掩码 | AudioSet 比 Audio-MAE +1.3 mAP |
| point-jepa | 点云 | 贪心排序器解决置换不变性 | ModelNet40 93.7%、预训练仅 7.5h |
| brain-jepa | fMRI 脑动力学 | 梯度定位 + 时空掩码 | UK Biobank 4 万+、8 任务超 BrainLM |
| stem-jepa-music | 多轨音乐 | ”拿掉一个乐器”当遮挡 | 首次把 predictor 用于推理阶段 |
| s-jepa-eeg | EEG | 按电极空间块遮蔽 | 跨数据集迁移 |
| t-jepa-tabular | 表格 | 特征子集互预测 + [REG] token | 持平/超 XGBoost/CatBoost |
| mc-jepa | 视频运动+图像内容 | 共享编码器双任务 | 光流与语义互相帮助 |
| iwm-learning-leveraging-world-models | 图像光度变换 | 条件化 predictor 可迁移复用 | predictor 微调 ≈ encoder 微调 |
6.3 隐空间规划、理论闸门与”生成式旁支”
JEPA 与 RL-WM 在”隐空间规划”上直接握手:dino-wm(LeCun 参与,冻结 DINOv2 patch 特征上学动作条件动力学 + CEM/MPC 零样本规划)、pldm-planning-latent-dynamics(NYU/Meta,纯离线无奖励导航数据上,JEPA 隐动力学 + MPC 全面碾压 model-free 目标条件 RL)、navigation-world-models(Meta FAIR + LeCun,CDiT 自回归预测未来第一视角、既能独立 CEM 规划又能给外部策略打分,CVPR 2025 Oral)。理论上 lejepa(Balestriero & LeCun)证明各向同性高斯是最优 embedding 分布、用 SIGReg 把 JEPA 删到”1 个超参、~50 行、无 stop-gradient/EMA”(ViT-H/14 冻结线性探针 79%),when-does-lejepa-learn-world-model 进一步用 Lean 4 机器验证证明 LeJEPA 在平稳加性噪声世界里线性可辨识。旁支还有把 JEPA 反向改造成生成器的 jepa-t-text-to-image(ImageNet FID 1.42)、把它注入 LLM/VLA 的 llm-jepa 与 jepa-vla(冻结 V-JEPA 2 注入 VLA,+6–19 pts)、以及把推理搬进隐空间的 jepa-reasoner。
七、五条路正在合流
把五范式并排看,2024–2026 的合流通道已经清晰:
- 骨干趋同:五派几乎都走了
RNN/GAN → Transformer → DiT/扩散/flow-matching同一条换芯路;tokenizer 从离散 VQ 走向连续/残差量化。RL-WM 的 storm/iris、驾驶的 drivingworld-gpt、游戏的 mineworld、视频的 cosmos-predict2 用的其实是同代骨干。 - 隐动作统一游戏与视频:从 playable-video-generation 的无监督离散动作,到 deepmind-genie2/genie-3 的 Latent Action Model,再到 adaworld(连续潜动作、新环境零训练迁移),“从无标签视频里学一个可控动作空间”成为跨游戏/视频/机器人的通用接口。
- 实时化蒸馏:游戏、驾驶、具身三派同时在做 self-forcing / DMD 少步蒸馏 + KV-cache 流式,把扩散从 50 步压到 3–4 步(skywork-matrix-game-2、nvidia-omnidreams、xiaomi-auto-world-model、gigaworld-1),实时帧率成为共同 KPI。
- “想象→行动”闭环收敛:RL-WM 的想象、视频派的 video-as-policy、驾驶派的前瞻规划、JEPA 派的隐空间 MPC,本质都是”在学到的模型里预测未来、再据此选动作”的模型预测控制。mbzuai-pan-world-model 的 GLP(LLM 隐骨干 + 视频解码器)与 nvidia-cosmos-policy(一个模型兼策略+世界模型+价值)是把 JEPA 隐预测与生成像素焊在一起的显式样本。
- WFM 作共享底座:一个通用世界基础模型(Cosmos)能被后训练成驾驶(cosmos-drive-dreams、nvidia-omnidreams)与机器人(nvidia-cosmos-policy)专用模型,五范式开始共用一个预训练地基。
- 消费端 agent:sima-scalable-instructable-multiworld-agent / deepmind-sima2 这类通用具身智能体是”住在世界模型里”的一端,与 genie-3 配对构成”agent × 世界模型”栈——世界模型造环境,agent 消费并反过来验证其一致性。
空白与趋势
共同的硬骨头是”物理”。跨范式的评测几乎一致地判了当前世界模型的物理理解不及格:视频派的 videophy(最好的 Pika 仅 19.7% 同时满足语义+物理)、videophy-2(Wan2.1-14B 全集 32.6%、hard 子集 22%)、phygenbench(Gen-3 PCA 0.51)、physics-iq(最好 24.1%,且视觉真实度与物理理解不相关)、phyworldbench/impossible-videos;VLM 理解侧的 physbench(GPT-4o 49.49% vs 人类 95.87%);以及最早把这件事量化的 physion/physion-plus-plus(除读取 3D 真值的 DPI 粒子 GNN 外无模型逼近人类)。评测范式本身也在从”表面保真”转向”内在保真”(vbench→vbench-2.0、worldscore-benchmark、worldsimbench、worldmodelbench),并催生 wisa 这类显式注入物理先验的 T2V 方法。
尚未闭合的缺口:(1) 评测缺统一闭环基准——驾驶综述明确点名”无统一 benchmark”,各派各自造尺子;(2) 长时程一致性与记忆仍靠外挂记忆库(worldmem)或工程 hack(context juggling),未见原生解;(3) 像素 vs 表征之争未决——JEPA 派用 intuitive-physics-vjepa、pldm-planning-latent-dynamics、pwm-multitask-world-models 论证”不必生成像素也能规划”,生成派则用 genie-3、wow-world-omniscient-model 论证”像素级真实交互不可替代”,mbzuai-pan-world-model 的 GLP 是当前最有希望的调和;(4) 真机数据稀缺——具身派普遍靠 1% 量级新数据微调(vidar)或数字遥操作造数据(alibaba-rynnworld-teleop)。趋势上,五范式正被”世界基础模型 + 后训练 + 实时蒸馏 + 物理评测”这套共同语法收编,“world model”这个词也在从”某个具体网络”变成”一层可被任意下游(控制/生成/规划/表征)复用的通用底座”。