一句话定位

清华 FIB Lab(Jingtao Ding、Yong Li 等 12 位作者)的世界模型纲领性综述:把”世界模型”这个被 Ha&Schmidhuber 与 LeCun 两条路线各说各话的概念,拆成两条并行主线——隐式表征(理解现在) vs 未来预测(预知未来)——再用这条轴串起决策模型/语言模型世界知识/视频生成/具身环境四类技术进展,并映射到自动驾驶、机器人、社会模拟三大应用域,最后给出五点开放问题。全文不做实验、不训练模型,是纯文献综述(7 个对比表、7 张示意图,均按 arXiv v1 统计),2024-11 首发 arXiv,后被 ACM Computing Surveys(vol 58, no 3, 2025)录用,配套 GitHub 仓库 Awesome-World-Model 持续追加论文/代码链接,2025 年的修订版本进一步把应用域扩展到”生成式游戏”。本页正文以 2024-11 的 arXiv v1 为准。

背景与定位

“世界模型”这个术语从一开始就有两条互不统一的源流:Ha & Schmidhuber 在 2018 年的 world-models-ha-schmidhuber 把它定义为对外部世界的内部抽象——用自编码器把视觉观测压成隐变量,再用 RNN 学习隐空间的状态转移,本质是”理解”路线的起点;Yann LeCun 在 2022 年的 lecun-path-autonomous-machine-intelligence 提出 JEPA 框架,主张世界模型不仅要感知/建模现实,还必须能设想未来状态以指导决策(对应人类认知的”系统 2”慢思考),是”预测”路线的代表。2024 年 OpenAI sora 的出现把这场辩论推向高潮:Sora 生成的视频看似严格遵循物理规律(蜡烛熔化、汉堡咬痕),被广泛称为”世界模拟器”,但它究竟算不算真正的世界模型仍存争议。

本文用 Table 1 系统比对了此前 6 篇相关综述,指出它们的共同缺陷是范围局限:一篇泛论世界模型的综述(arXiv 2024)局限于讨论应用;一篇聚焦”高效多模态模型”的综述局限于技术讨论;一篇聚焦文本转视频生成的综述范围有限;另外三篇(IEEE T-IV 2024 与两篇 arXiv 2024)均聚焦自动驾驶单一场景,范围有限。本文的定位是首次系统定义”世界模型”这个词本身,并按”理解 vs 预测”两条主线覆盖决策/知识/生成/具身/应用五个层面。全文技术脉络与 dreamer-v1/dreamer-v2/dreamer-v3/planet/muzero 等 model-based RL 系工作、genie-generative-interactive-environments/genie-3/unisim/pandora/3d-vla/lwm-large-world-model/ivideogpt 等视频/交互世界模型系工作,以及 gaia-1-wayve/drivedreamer/drivedreamer-2/drive-wm-driving-into-the-future/vista-driving-world-model/occworld/occsora 等驾驶世界模型系工作均有交叉引用。

模型架构

本文不提出新架构,其”架构”贡献是对既有世界模型技术路线的系统分类

决策类世界模型的 MDP 形式化(3.1.1):标准 MDP 元组 (S, A, M, R, γ),世界模型即状态转移动力学 M。学习目标给出两种范式:确定性转移模型的一步预测 MSE min_θ E[||s'-M_θ(s,a)||²](式 1);Chua et al. 的概率转移模型用 KL 散度 min_θ E[log(M*(s'|s,a)/M_θ(s'|s,a))](式 2)处理任意不确定性。高维状态空间则依赖表征学习:Ha&Schmidhuber 用自编码器重建图像隐状态;Hafner 系(dreamer-v1/dreamer-v2)学习视觉编码器+隐动力学;Samsami et al. 提出 Recall-to-Imagine 强化记忆能力;另一条趋势是用 next-token-prediction+Transformer 把 MDP 统一表征,实现跨任务的通用决策模型。策略生成侧列出两条路径:Model Predictive Control(式 3,max_{a_{t:t+τ}} E[Σr(s,a)],Nagabandi 的蒙特卡洛采样、Chua 的概率集成轨迹采样)与蒙特卡洛树搜索(AlphaGo/AlphaGo Zero 离散动作空间、Moerland 扩展到连续动作空间、Oh 的 value prediction network)。

语言骨干世界模型(3.1.2):分”直接生成动作”(Yang et al. 把预训练文生视频模型迁移到机器人控制域;Zhou et al. 用组合式世界模型分解视频生成过程实现少样本迁移)与”模块化调用”(Xiang et al. 在 VirtualHome 模拟器中注入具身知识,用 MCTS 做目标条件规划;Lin et al. 的 Dynalang 学习多模态世界模型预测未来文本/图像表征,再用 actor-critic 从想象 rollout 中学策略;Liu et al. 的 RAFA 把 LLM 推理形式化为贝叶斯自适应 MDP 中的 in-context 规划,在 ALFWorld 等环境上显著提升)两类。

视频世界模型代表工作分类(Table 3,见”数据”节详细列举):按能力维度分长时程(NUWA-XL 粗到细 Diffusion-over-Diffusion、LWM Transformer 长序列训练、GAIA-1 Transformer+Diffusion)、多模态融合(3D-VLA Diffusion 融合 3D 感知/推理/动作、Pandora LLM 驱动自由文本动作控制)、交互性(UniSim Diffusion+RL、VideoDecision Transformer+Diffusion、iVideoGPT Transformer 融合视觉/动作/奖励、PhysDreamer Diffusion 模拟 3D 物体动力学响应新交互)三大类。

具身环境三分类(4.2,Table 4):室内(AI2-THOR/Matterport3D/VirtualHome/Habitat/SAPIEN/iGibson/AVLEN/ProcTHOR/Holodeck/AnyHome/LEGENT)、室内外通用(TDW/GRUTopia)、室外(MineDOJO/MetaUrban/UrbanWorld)、动态(UniSim/Streetscapes/AVID/EVA/Pandora)四档,逐一标注模态(V/L/T/A)、物理引擎有无、3D 资产有无。

数据

本文是纯文献综述,不训练模型、无自有数据集,但系统汇编了被综述工作各自披露的规模数字(均转引,非本文实验):

  • 具身环境场景规模(Table 4):AI2-THOR(2017)120 个场景,视觉模态,含物理引擎+3D 资产;Matterport3D(2018)90 个场景,仅视觉,无物理引擎;VirtualHome(2018)50 个场景;SAPIEN(2020)46 个场景;iGibson(2021)15 个场景,新增 Lidar 模态;AVLEN(2022)85 个场景,视觉+文本+音频三模态;ProcTHOR/Holodeck/AnyHome/LEGENT(2022-2024)均可生成”任意数量”场景,体现从”固定场景库”到”语言指令生成”的演进;GRUTopia(2024)达到 **10 万(100k)**场景规模,室内外通用;MetaUrban(2024)13,800 个场景,室外城市环境,含 Lidar 模态。
  • 自动驾驶感知/规划数据模态(Table 5):早期方案按传感器分列——Faster R-CNN(2015,Camera,CNN)、PointNet(2017,Lidar,MLP)、MultiNet(2018,Camera,CNN)、YOLOP(2022,Camera,CNN)、BEVFormer(2022,Camera,Attention,多摄像头融合鸟瞰图)、Transfusion(2022,Camera+Lidar,Transformer,跨注意力融合);规划/预测模块(Wayformer/MTR/QCNet/HPTR,2022-2023,几何空间,Attention/Transformer);端到端场景理解(UniAD 2023 Camera+Transformer、TOKEN 2024 Camera+MLLM、OmniDrive 2024 Camera+MLLM)。
  • 视频/具身生成类世界模型的训练数据来源普遍是”3D 仿真轨迹 + 真实机器人动作 + 互联网媒体”混合(如 UniSim),具体配比未在本综述中披露,需回溯各自原始论文。

训练方法

本文把”训练方法”呈现为对既有范式的分类整理而非自有方法:

  • MBRL 两步流程:① 学习转移动力学(式 1-2 目标函数,处理随机性/不确定性/部分可观测挑战);② 把模型接入规划产出策略(MPC 式 3 或 MCTS)。
  • 语言世界模型两种使用方式:直接输出动作 vs 作为规划算法(MCTS/actor-critic/贝叶斯 MDP)的模块化输入,后者被认为更可靠但依赖额外的规划算法设计。
  • 视频世界模型的四项必备能力(4.1.2,本文明确提出的评价框架):① 长时程预测能力——Sora 已能生成分钟级、高时序一致性视频,但仍远不及真实世界长时程动力学复杂度;② 多模态融合——从纯语言引导扩展到融合图像/动作条件(3D-VLA、Pandora);③ 交互性——从被动生成转向可控、可交互的决策空间模拟(UniSim、iVideoGPT);④ 多样环境适配——从通用视频扩展到自然环境/游戏/自动驾驶等场景专用模拟。
  • 自动驾驶世界模拟器训练范式演进:早期几何空间仿真(SUMO 2000/MetaDrive/规则based)→ 基于扩散模型直接在大规模交通数据上训练、结合 CLIP 文本-图像对齐实现可控生成的 GAIA-1/DriveDreamer 系(首批此类方法)→ Drive-WM 引入闭环规划控制 → Vista 提升生成分辨率并延长预测时长 → OccWorld/OccSora 改为预测 3D occupancy grid、Copilot4D 改为预测雷达点云,被本文认为比视频空间更能反映交通场景的空间特性。
  • 机器人世界模型训练范式:隐式表征侧——CNN/ViT 提取视觉特征(RoboCraft 把视觉观测转粒子+图神经网络捕捉底层结构)、PointNet 编码非结构化 3D 点云、LLM 文本任务表征(BC-Z 用语言表征做多任务、Text2Motion 把指令拆成任务级/动作级两层计划);未来状态预测侧——UniPi 把动作预测形式化为受约束扩散模型的视频预测问题、VIPER 用专家视频预训练的自回归 Transformer 引导机器人、Genie 内含动力学模型基于历史帧+动作预测下一状态、GR-2 先在互联网海量无标注视频上预训练再微调到机器人任务;仿真到真实——NeBula 构建信念空间做推理决策、DayDreamer 用离线数据泛化世界模型使机器人数小时内学会真实环境行走、SWIM 从人类视频学习并仅用不到 30 分钟真实交互数据微调到机器人设置。
  • 社会模拟中的隐式世界模型:Agent-Pro 把与环境/其他 agent 的交互记忆转化为”信念”(belief)驱动下一步决策;GovSim 让 agent 通过多轮对话积累对世界及他人策略的高层认知,形成隐式世界模型,探索资源可持续利用的合作行为是否能涌现。

Infra(训练 / 推理工程)

不适用/未披露——本文是纯文献综述,无自身训练或推理实验,无 GPU 型号/卡数/GPU-hours/并行策略/精度信息,也无推理 FPS/延迟数字。本文在 6.4 节反过来指出领域内的效率瓶颈:主流大生成模型依赖 Transformer 自回归架构,“一次只能生成一个 token”的特性对高速仿真(例如无人机操控 AI 所需的高帧率)构成巨大挑战;列举的加速方向包括大小模型协同、大模型蒸馏、面向 LLM 请求的调度优化平台,以及用图神经网络高效近似物理系统。

评测 benchmark

本文不含任何自有实验或消融,其”评测”内容体现为对既有综述/工作的系统性对比表:

  • Table 1:与 6 篇既有综述对比,逐一列出各自的 Main Focus 与 Deficiency(如”限于应用讨论""限于技术讨论""范围有限”),论证本文的系统性定位。
  • Table 2:世界知识分类(Common Sense & General Knowledge / Global Physical World / Local Physical World / Human Society)下汇编的代表作(KoLA ICLR2024、EWOK、Space&Time ICLR2024、GeoLLM ICLR2024、CityGPT/CityBench、Testing ToM NHB2024、COKE ACL2024、MuMA-ToM ACL2024 等),逐条标注模态与研究类型(Benchmark/Analysis/Learning)。
  • Table 3-4:视频世界模型(长时程/多模态/交互/多样环境四类)与具身环境(室内/室外/动态三类)的横向对比,见”模型架构”节。
  • Table 5-7:自动驾驶(感知→规划预测→端到端→驾驶世界仿真四段)、机器人(隐式表征→未来预测→仿真到真实三段)、社会模拟(世界模型即社会模拟 vs 模拟中的世界模型两类)三大应用域的代表作系统整理。
  • 本文明确指出:Sora 虽能生成物理上”看似合理”的视频,但仍无法一致地复现正确的物理规律(如流体动力学、重力),且已有研究发现 LLM 无法准确预测物理世界的状态转移(如烧水这类简单物理过程)——这是本文引用他人实证结果得出的判断,不是本文自身的测量。

创新点与影响

贡献:(1) 首次把”世界模型”这个含混术语系统拆分为”隐式表征(理解)“与”未来预测(预知)“两条主线,并论证二者在 Ha&Schmidhuber、LeCun、Sora 三个标志性节点上的演进关系;(2) 首次系统对比自动驾驶/机器人/社会模拟三大应用域各自侧重”理解”还是”预测”,指出自动驾驶需要实时感知+复杂趋势预测并重、机器人需要精确动力学理解+交互式环境生成并重、社会模拟需要建模更抽象的社会行为动态;(3) 提出五点开放问题(物理规则与反事实模拟、社会维度的丰富化、仿真-真实的具身智能桥接、仿真效率、伦理与安全),并给出针对性的未来方向建议;(4) 配套 GitHub 仓库持续追踪领域进展,2025 年被 ACM Computing Surveys 正式录用(vol 58, no 3),后续版本进一步把”生成式游戏”纳入应用域。

本文自陈的局限(第 6 节):① 物理规则是否能仅靠数据规模化涌现仍是有争议的开放问题——Sora 无法准确模拟重力/流体动力学,LLM 无法准确预测状态转移(如烧水),暗示纯数据驱动的 Transformer/Diffusion 存在因果表征的固有局限,一个可能方向是把大生成模型与显式物理规则模拟器结合(可能牺牲分辨率/生成质量换取对反事实场景的泛化能力);② 社会维度模拟目前主要依赖主观人工评估,缺乏可规模化的可靠评测方案;③ 仿真-真实的具身智能桥接仍需提升生成式 AI 的多模态/多任务/3D 能力,并解决长距离决策中误差累积导致策略失配的问题;④ 仿真效率受限于 Transformer 自回归架构的逐 token 生成特性;⑤ 伦理安全层面同时存在数据隐私(训练数据不透明带来的隐私推断风险)、被恶意利用模拟不安全场景(降低策划非法/不道德活动的门槛)、以及深度伪造/虚假信息的问责难题(水印等技术尚不足以完全解决)三重风险,本文认为这些均需更多研究乃至法律层面的解决方案。

原始链接

一手源存档(sources/)