世界模型技术演进调研 · 主汇总(2017 → 2026-H1)
覆盖**“世界模型(World Model)“这一命题下的五条并行技术路线:基于模型的强化学习(RL-WM)· 生成式视频世界模型 · 交互/游戏神经引擎 · 自动驾驶世界模型 · JEPA 非生成预测式,以及它们共享的 tokenizer / 动作条件 / 评测等使能方法。 只收一手官方来源**:arXiv 原文、官方技术报告 / system card、官方博客 / 产品发布、官方 GitHub / HuggingFace / ModelScope model card。不含第三方解读。 每个工作页按六维梳理:
模型架构 · 数据 · 训练方法 · Infra · 评测 benchmark+ 创新影响;landmark 代表作的数字经对抗式 verify 逐条对照一手源核查(删串列 / 张冠李戴 / 杜撰)。
一、语料统计
- 去重后一手来源:208 个结构化工作页(按原始 URL / arXiv 去重)
- 代表作精读(landmark):47 篇(opus 精读 + 独立对抗式 verify 二次核对数字);长尾 161 篇(sonnet 精读 + 自核查)
- 横向综述:6 篇
sections/(架构 / 数据 / 训练 / infra / benchmark / 五范式)+ 4 篇deep-dive/家族深挖 - 一手源存档:官方博客 / model card / README 的
.md快照随库(sources/world-model/<年>/);arXiv PDF 只留 URL(走 bucket / 重下)
按年(页数):2017→1 · 2018→2 · 2019→4 · 2020→3 · 2021→6 · 2022→9 · 2023→32 · 2024→60 · 2025→72 · 2026(H1)→18 —— 近三年(2023-2026)占约 87%,符合”近 3 年权威工作”的取材重点。
按国别(去重):中国 ~95 · 美国 ~92(含 UK/DeepMind 15)· 欧洲 ~10 · 其它(新/以等)少量 —— 驾驶世界模型与 2026 交互世界模型两块中国工作尤密集。
按类别(单标主类):驾驶 driving-wm 46 · RL 世界模型 rl-wm 40 · 使能方法 method 29 · 生成视频 video-wm 29 · 交互/游戏 game-wm 24 · JEPA 18 · 平台 platform 13 · 综述 survey 8。
二、怎么读这份调研
从”结论”到”原文”四层:
- 六大横向章节(核心,先读) —
sections/- 架构演进 — RSSM → Transformer/AR token WM → 扩散/流视频 WM → JEPA → 统一 MoT;因果 video tokenizer;动作条件机制
- 数据 — RL replay/env-step → 网络+策展视频语料(小时/帧/token 与配比)→ 驾驶多视角 → 仿真/动作标注 → 视频学隐动作
- 训练方法 — Dreamer 想象力 actor-critic · MuZero 价值等价 MCTS · 扩散/流匹配 & diffusion-forcing · next-token AR · JEPA 回归 · 蒸馏与实时
- Infra — 算力/并行 · 实时/交互推理(FPS·延迟)这一世界模型独有的工程命门 · 因果 tokenizer 工程
- 评测 benchmark — 从 FID/美学转向物理一致性 · 3D 一致性 · 动作保真 · 下游 RL/规划 · 驾驶指标(Physics-IQ / VideoPhy / WorldModelBench / WorldScore …)
- 五大范式对比 — RL-WM vs 生成视频 vs 交互/游戏 vs 驾驶 vs JEPA:各自”世界模型”含义、目标与收敛
- 家族深挖 —
deep-dive/- RL 世界模型族(World Models · PlaNet · Dreamer v1/2/3 · MuZero · EfficientZero · TD-MPC · IRIS/DIAMOND/STORM)
- 生成式交互世界族(UniSim · Genie 1/2/3 · GameNGen · Oasis · Matrix-Game · WHAM · Cosmos · World Labs · Decart · Odyssey)
- 自动驾驶世界模型族(GAIA-1/2 · DriveDreamer · Vista · OccWorld/OccSora · Copilot4D/ViDAR · MagicDrive)
- JEPA 谱系(I-JEPA · V-JEPA · V-JEPA 2 · DINO-WM · PLDM)
- 全量来源索引(按年月,可点开每条) — 01-INDEX
- 单工作结构化页 —
2017/…2026/;一手源快照 —sources/world-model/<年>/
三、主线速览(2017 → 2026)
2017-2019 — RL 世界模型奠基:value-prediction-network 与 World Models(VAE+MDN-RNN,梦里进化控制器)提出”在模型里学策略”;PlaNet 引入 RSSM 潜空间规划,Dreamer 用解析梯度在想象中学长时行为;MuZero 以价值等价模型 + MCTS 统一 Atari/围棋/象棋。
2020-2022 — 潜空间想象与 token 世界模型:dreamer-v2(离散潜变量)/EfficientZero(样本效率 500%)夯实 MBRL;IRIS/TWM/td-mpc 把 Transformer 与隐式 MPC 引入世界模型;DreamerV3 一套超参跨 150+ 任务、首次在 Minecraft 从零采到钻石;I-JEPA 开 LeCun 线非生成预测式表征。
2023 — 三线并起:生成视频世界模型 UniSim/UniPi 把”学一个可交互真实世界模拟器”立为范式;驾驶 GAIA-1/DriveDreamer/Drive-WM/OccWorld 起步;DIAMOND 用扩散做 Atari 世界模型。
2024 — Genie 时刻与驾驶爆发:Genie(隐动作、可玩 2D 世界)+Genie 2 把交互世界模型推向前台;neural game engine GameNGen(实时 Doom)/Oasis 惊艳;Cosmos 平台化物理 AI 世界基础模型;驾驶占据/视频 WM(OccSora/Vista/Copilot4D/MagicDrive)密集涌现;V-JEPA/DINO-WM 推进预测式路线。
2025 — 平台化与新兴实验室:Genie 3(可交互通用世界)、SIMA 2、微软 Muse(Nature)、V-JEPA 2(可动作的机器人世界模型)、GAIA-2;新兴实验室 World Labs Marble、Decart Mirage、Odyssey、Luma、Matrix-Game/Hunyuan-GameCraft 把”空间/可玩世界模型”做成产品;Cosmos 演进出 Transfer1/Reason1/Predict2。
2026-H1 — 4D/记忆/推理世界模型:HunyuanWorld-Voyager、Matrix-3D、Genie-Envisioner、阿里 RynnWorld、AlayaWorld、DreamX-World、GigaWorld、Matrix-Game 3、Xiaomi Auto-WM,与一批物理/世界模型 benchmark(worldmodelbench/WorldScore/VideoPhy-2/VBench 2.0)标志评测走向物理与长时一致。
四、四条贯穿性技术主线(详见各 section)
- “世界模型”的四种目标:策略优化(RL-WM,在梦里训练/规划)· 可交互模拟器/合成数据(生成视频、游戏、驾驶)· 空间/3D 世界(World Labs 线)· 通用表征与推理(JEPA)——同名不同旨,2025+ 开始在”物理 AI”下收敛。
- 骨干演进:RSSM 循环潜空间 → 离散 token + Transformer/自回归 → 扩散/流视频(DiT + diffusion-forcing)→ JEPA 编码器-预测器;因果 video tokenizer(VQ/FSQ/连续)是共用底座。
- 可控性与长时一致:动作条件(离散动作 token / 隐动作 / 帧拼接)+ 记忆机制(WorldMem 等)+ 3D/几何约束,是从”好看视频”迈向”可用世界”的关键。
- 评测范式迁移:FID/美学 → 物理定律遵守(Physics-IQ/VideoPhy)、3D/位姿一致、动作保真、下游 RL/规划成功率、驾驶轨迹误差——“预测未来是否物理正确”成为核心度量。
维护:01-INDEX.md 由各页 frontmatter 经 scripts/build_index_omni.py research/world-model 自动生成。