世界模型技术演进调研 · 主汇总(2017 → 2026-H1)

覆盖**“世界模型(World Model)“这一命题下的五条并行技术路线:基于模型的强化学习(RL-WM)· 生成式视频世界模型 · 交互/游戏神经引擎 · 自动驾驶世界模型 · JEPA 非生成预测式,以及它们共享的 tokenizer / 动作条件 / 评测等使能方法。 只收一手官方来源**:arXiv 原文、官方技术报告 / system card、官方博客 / 产品发布、官方 GitHub / HuggingFace / ModelScope model card。不含第三方解读。 每个工作页按六维梳理:模型架构 · 数据 · 训练方法 · Infra · 评测 benchmark + 创新影响;landmark 代表作的数字经对抗式 verify 逐条对照一手源核查(删串列 / 张冠李戴 / 杜撰)。


一、语料统计

  • 去重后一手来源208 个结构化工作页(按原始 URL / arXiv 去重)
  • 代表作精读(landmark):47 篇(opus 精读 + 独立对抗式 verify 二次核对数字);长尾 161 篇(sonnet 精读 + 自核查)
  • 横向综述:6 篇 sections/(架构 / 数据 / 训练 / infra / benchmark / 五范式)+ 4 篇 deep-dive/ 家族深挖
  • 一手源存档:官方博客 / model card / README 的 .md 快照随库(sources/world-model/<年>/);arXiv PDF 只留 URL(走 bucket / 重下)

按年(页数):2017→1 · 2018→2 · 2019→4 · 2020→3 · 2021→6 · 2022→9 · 2023→32 · 2024→60 · 2025→72 · 2026(H1)→18 —— 近三年(2023-2026)占约 87%,符合”近 3 年权威工作”的取材重点。

按国别(去重):中国 ~95 · 美国 ~92(含 UK/DeepMind 15)· 欧洲 ~10 · 其它(新/以等)少量 —— 驾驶世界模型与 2026 交互世界模型两块中国工作尤密集。

按类别(单标主类):驾驶 driving-wm 46 · RL 世界模型 rl-wm 40 · 使能方法 method 29 · 生成视频 video-wm 29 · 交互/游戏 game-wm 24 · JEPA 18 · 平台 platform 13 · 综述 survey 8。


二、怎么读这份调研

从”结论”到”原文”四层:

  1. 六大横向章节(核心,先读)sections/
    • 架构演进 — RSSM → Transformer/AR token WM → 扩散/流视频 WM → JEPA → 统一 MoT;因果 video tokenizer;动作条件机制
    • 数据 — RL replay/env-step → 网络+策展视频语料(小时/帧/token 与配比)→ 驾驶多视角 → 仿真/动作标注 → 视频学隐动作
    • 训练方法 — Dreamer 想象力 actor-critic · MuZero 价值等价 MCTS · 扩散/流匹配 & diffusion-forcing · next-token AR · JEPA 回归 · 蒸馏与实时
    • Infra — 算力/并行 · 实时/交互推理(FPS·延迟)这一世界模型独有的工程命门 · 因果 tokenizer 工程
    • 评测 benchmark — 从 FID/美学转向物理一致性 · 3D 一致性 · 动作保真 · 下游 RL/规划 · 驾驶指标(Physics-IQ / VideoPhy / WorldModelBench / WorldScore …)
    • 五大范式对比 — RL-WM vs 生成视频 vs 交互/游戏 vs 驾驶 vs JEPA:各自”世界模型”含义、目标与收敛
  2. 家族深挖deep-dive/
    • RL 世界模型族(World Models · PlaNet · Dreamer v1/2/3 · MuZero · EfficientZero · TD-MPC · IRIS/DIAMOND/STORM)
    • 生成式交互世界族(UniSim · Genie 1/2/3 · GameNGen · Oasis · Matrix-Game · WHAM · Cosmos · World Labs · Decart · Odyssey)
    • 自动驾驶世界模型族(GAIA-1/2 · DriveDreamer · Vista · OccWorld/OccSora · Copilot4D/ViDAR · MagicDrive)
    • JEPA 谱系(I-JEPA · V-JEPA · V-JEPA 2 · DINO-WM · PLDM)
  3. 全量来源索引(按年月,可点开每条)01-INDEX
  4. 单工作结构化页2017/2026/一手源快照sources/world-model/<年>/

三、主线速览(2017 → 2026)

2017-2019 — RL 世界模型奠基value-prediction-networkWorld Models(VAE+MDN-RNN,梦里进化控制器)提出”在模型里学策略”;PlaNet 引入 RSSM 潜空间规划,Dreamer 用解析梯度在想象中学长时行为;MuZero 以价值等价模型 + MCTS 统一 Atari/围棋/象棋。

2020-2022 — 潜空间想象与 token 世界模型dreamer-v2(离散潜变量)/EfficientZero(样本效率 500%)夯实 MBRL;IRIS/TWM/td-mpc 把 Transformer 与隐式 MPC 引入世界模型;DreamerV3 一套超参跨 150+ 任务、首次在 Minecraft 从零采到钻石I-JEPA 开 LeCun 线非生成预测式表征。

2023 — 三线并起:生成视频世界模型 UniSim/UniPi 把”学一个可交互真实世界模拟器”立为范式;驾驶 GAIA-1/DriveDreamer/Drive-WM/OccWorld 起步;DIAMOND 用扩散做 Atari 世界模型。

2024 — Genie 时刻与驾驶爆发Genie(隐动作、可玩 2D 世界)+Genie 2 把交互世界模型推向前台;neural game engine GameNGen(实时 Doom)/Oasis 惊艳;Cosmos 平台化物理 AI 世界基础模型;驾驶占据/视频 WM(OccSora/Vista/Copilot4D/MagicDrive)密集涌现;V-JEPA/DINO-WM 推进预测式路线。

2025 — 平台化与新兴实验室Genie 3(可交互通用世界)、SIMA 2、微软 Muse(Nature)、V-JEPA 2(可动作的机器人世界模型)、GAIA-2;新兴实验室 World Labs MarbleDecart MirageOdysseyLumaMatrix-Game/Hunyuan-GameCraft 把”空间/可玩世界模型”做成产品;Cosmos 演进出 Transfer1/Reason1/Predict2

2026-H1 — 4D/记忆/推理世界模型HunyuanWorld-VoyagerMatrix-3DGenie-Envisioner、阿里 RynnWorldAlayaWorldDreamX-WorldGigaWorldMatrix-Game 3Xiaomi Auto-WM,与一批物理/世界模型 benchmark(worldmodelbench/WorldScore/VideoPhy-2/VBench 2.0)标志评测走向物理与长时一致。


四、四条贯穿性技术主线(详见各 section)

  1. “世界模型”的四种目标:策略优化(RL-WM,在梦里训练/规划)· 可交互模拟器/合成数据(生成视频、游戏、驾驶)· 空间/3D 世界(World Labs 线)· 通用表征与推理(JEPA)——同名不同旨,2025+ 开始在”物理 AI”下收敛。
  2. 骨干演进:RSSM 循环潜空间 → 离散 token + Transformer/自回归 → 扩散/流视频(DiT + diffusion-forcing)→ JEPA 编码器-预测器;因果 video tokenizer(VQ/FSQ/连续)是共用底座。
  3. 可控性与长时一致:动作条件(离散动作 token / 隐动作 / 帧拼接)+ 记忆机制(WorldMem 等)+ 3D/几何约束,是从”好看视频”迈向”可用世界”的关键。
  4. 评测范式迁移:FID/美学 → 物理定律遵守(Physics-IQ/VideoPhy)、3D/位姿一致、动作保真、下游 RL/规划成功率、驾驶轨迹误差——“预测未来是否物理正确”成为核心度量。

维护:01-INDEX.md 由各页 frontmatter 经 scripts/build_index_omni.py research/world-model 自动生成。