一句话定位
MBZUAI 基础模型研究院(IFM,负责人 Zhiting Hu / Zhengzhong Liu / Eric P. Xing)2025-11 发布的 PAN——一个通用、可交互、长时程的世界模型:以自然语言动作与历史观测为条件,用高质量视频模拟未来世界状态。它把 GLP(Generative Latent Prediction,生成式潜在预测) 架构落地为「LLM 潜在动力学骨干(想象/推理)+ 视频扩散解码器(还原可观测现实)」的层级式生成流水线:骨干用 Qwen2.5-VL-7B-Instruct 在潜空间自回归推演世界状态,解码器用 Wan2.1-T2V-14B + 自研 Causal Swin-DPM 把每步潜状态渲染成时序连贯的视频块。在动作模拟保真、长时程预测、模拟式推理与规划三类基准上取得开源 SOTA、与顶尖闭源商用模型(KLING/MiniMax)持平。
背景与定位
论文把世界模型(world model)定义为「智能体维持的一套对环境演化的内部模拟」,其目标不是产出「看着像」的画面,而是维持支撑推理、预测、交互的连贯内部动力学——让智能体能做假设性思考、探索反事实结果、带前瞻地行动。作者批评了两条现有路线的割裂:
- 视频生成模型(Sora、Veo、Wan、HunyuanVideo 等)视觉逼真,但是「prompt→整段视频」的开环生成,缺状态/动作概念、无实时因果控制、无长时一致性,无法做反事实推演。
- 现有世界模型要么单次/短时程(如 NVIDIA Cosmos),要么受限于领域专用/受限动作空间(游戏、驾驶),要么是静态几何的 3D 世界模型(World Labs)缺动态与交互;JEPA 系(V-JEPA 2)走「只在潜空间匹配、不重建像素」的编码器-预测器路线。
PAN 的定位是「同时兼得广域通用 + 长时程交互动力学」的通用世界模型,能「在任意时刻、对任意文本动作、模拟任意域的状态」。方法学上它属于混合自回归-扩散范式:用 LLM 骨干解决原始感知数据的信息稀疏问题(借文本预训练的世界知识做 grounding),用扩散解码器解决长 rollout 的误差累积与时序漂移。核心方法框架 GLP 来自 Xing et al. 2025,PAN 是其首个大规模实例化。
与 Genie 3、Wayve GAIA-2、Cosmos Predict 2.5、DeepMind SIMA 2 同处「交互式世界模拟器」赛道,但 PAN 强调用 LLM 潜在推理骨干统一多域,而非像素级端到端扩散或纯 latent JEPA。
模型架构
PAN 实例化 GLP 的三大组件(对应生成分布 p_PAN(o_{t+1}|o_t,a_t)=Σ p_h(编码)·p_f(世界模型)·p_g(解码)):
GLP 与 JEPA 的关键区别:JEPA 的目标是「让预测潜状态 f(h(o_t),a_t) 逼近下一观测的编码 h(o_{t+1})」的潜空间匹配,理论上会坍缩(把所有观测映到常向量即可 trivially 最小化 loss)并产生「不可定义性问题」——潜转移不受真实数据分布约束、可能不对应任何可实现的世界动力学。即便 DINO-WM 用冻结 DINOv2 特征缓解坍缩,转移仍未 grounding 在观测空间。PAN 的生成式监督把潜预测与观测空间重建耦合,保证每个潜转移 s_t→s_{t+1} 对应一次可实现的感知变化。
① Vision Encoder h——取 Qwen2.5-VL-7B-Instruct 的视觉塔(ViT)。每帧切 14×14 空间 patch,窗口自注意力,2D RoPE 保留空间结构;视频流用 3D patch 分组原生表达短时运动。输出为保留时空组织的连续视觉 token(世界状态 s_t)。
② Autoregressive World Model Backbone f——取 Qwen2.5-VL-7B-Instruct 的语言模型。以「多轮对话」模板排布输入:交替 <|user|> <视频状态 s_t> <动作 a_t> 与 <|assistant|> <256 个 query embedding>;每个 assistant 轮对应基于历史 (s_1,a_1,…,s_t,a_t) 预测的下一潜状态。输出为 256 个连续 token 表示 s_{t+1},作为跨时间演化的关联记忆保持全局一致性。训练用 teacher forcing(真值状态),推理时闭环 rollout(回喂自身预测)。注:Xing 2025 原设想是「LLM+diffusion embedder 混合骨干、离散-连续混合表示」,PAN 当前实现为更精简的纯自回归语言骨干,混合骨干留作未来工作。
③ Video Diffusion Decoder g——由 Wan2.1-T2V-14B(14B DiT) 适配而来,加 Causal Swin-DPM。关键设计:
- Flow Matching / Rectified Flow 目标:x_k=k·x_1+(1−k)·x_0,预测速度 v_k=x_1−x_0;训练 1000 denoising steps,k 用 shifted schedule 从 [0,1] 采样。
- 双条件注入:潜世界状态先线性投影到解码器条件维,喂入每个注意力块新增的 cross-attention 流,其输出经零初始化第二投影(ControlNet 式,稳训);动作文本用 umT5 编码走原文本 cross-attention 通路;块内两路输出相加。
- Causal Swin-DPM(核心创新,扩展 Feng et al. 2024 的 Shift-Window DPM,加 chunk-wise 因果注意力掩码):滑动时间窗内同时持有两个不同噪声级的视频块——早块噪声级 K/2、晚块满噪声 K;denoise K/2 步后早块出队为成片,同时窗末入队一块高斯噪声新块。用「模糊/半噪声」的历史条件抑制不可预测的像素级细节、强调持久语义一致,从而不为不可知细节(遮挡/未见侧面)不公平地惩罚模型,把细粒度变异交给扩散过程。chunk-wise 因果掩码保证晚块只能 attend 早块,防止未来动作信息泄漏,支持实时交互。
- Wan2.1-VAE:3D 因果 VAE,把 1+T 帧压成 1+T/4 潜特征;解码器窗口 21 潜帧=81 真实帧。训练时对每 81 帧 clip 随机 pad 0~122 前置帧模拟滑窗的长时上下文(编码后即丢弃)。
- 条件帧+噪声增强:滑窗含 1 条件帧 + 2 个 size-10 视频块;条件帧取上一出队块的末帧,窗前进 10 潜帧;对条件帧加 k=0.055 的小噪声增强以抑制长时误差累积;不对条件帧计 loss。
数据
- 来源:广泛使用的公开可获取视频数据,覆盖日常活动、人-物交互、自然环境、多智能体场景等多样物理与具身域。核心训练信条:「下一状态预测是所有推理任务/环境的通用构件」,任何反映世界随时间演化的序列都可作训练材料。注:论文未披露具体小时数/帧数/clip 数/token 数等规模数字。
- 视频切分(3 阶段):帧级启发式检测候选场景边界切成短 clip → 合并内容相似的相邻段减少过碎 → 轻量过滤器按目标时长与画质选段。
- 过滤流水线(三级):
- 规则过滤(无需模型推理、可大规模早期应用):基于光流/边缘差/亮度差的运动度量剔「过静(冻结/幻灯片)」与「过动(闪光/硬切/抖动)」;用稀疏特征跟踪算 translation/zoom 分数剔「平移/缩放等 trivial 运动」;剔首尾纯色(淡入淡出/黑屏)。
- 预训练检测器:美学打分器(帧级平均,低于阈值剔);场景文字检测器剔「字幕/横幅/水印等 obstructive text」占比高的视频。
- 自训练 VLM 过滤器(在标注集上微调,高精度):剔 讲课型视频(对镜头说话无实质动作)、文字主导、屏幕录制/截图(缺真实世界动态)、低质(模糊/压缩伪影)、重度剪辑(转场/特效)、残余场景切换。
- 稠密动态字幕:原视频多无字幕或仅简短描述,作者用 VLM 重新打稠密字幕,要求(a)事实丰富细致(借鉴 DALL-E 3)、(b)聚焦时序动态(运动、事件、环境变化、新物体出现)而非静态背景——因静态内容已在首帧/前一状态中,演化动态才对应世界模型的动作输入并驱动状态转移。
训练方法
分阶段「分而治之」:先各模块单独优化再联合对齐。
Stage 1 — 模块级训练(Module-Wise):视觉编码器与自回归骨干直接用 Qwen2.5-VL-7B-Instruct(已充分预训练,本阶段无需额外适配);只把 Wan2.1-T2V-14B(原非因果、单次生成)改造成 Causal Swin-DPM 架构。冻结 Wan-VAE 与文本编码器并预计算其潜特征。训练技巧:
- 训练所需两个视频块噪声级差 K/2 = denoise 采样区间 [0,1] 的一半——先从 [0,0.5] 采 k 给第一块、赋 k+0.5 给第二块;仅生成首块时从整段 [0,1] 采(须从纯噪声全去噪)。
- BFloat16 + AdamW,lr 1e-5,cosine 衰减,前 5% 步线性 warmup,梯度裁剪 max norm 0.05;训 5 epochs。
Stage 2 — 联合训练(Joint):把三模块整合,用 GLP 目标 L_GLP=E[disc(g∘f(h(o_t),a_t), o_{t+1})],disc 实例化为 flow-matching loss。要点:
- 论点:未来观测细节本就不可预测,但作者把这不可预测性视作物理世界的定义性属性而非反例——生成监督不追求逐像素复现,只求每帧观测与演化的潜世界状态语义/物理一致;低层随机变异交给 (h,g) 编解码对,f 只建模潜空间平滑因果转移。
- 冻结 VLM(视觉编码器+语言骨干),只训 256 个 query embedding + 视频扩散解码器。为对齐 Qwen2.5-VL 上下文窗口,训练时把世界模型历史限制在最近 10 轮。
- 同 Stage 1 的 BFloat16 + AdamW + lr 1e-5 + cosine + 5% warmup。计划 5 epochs,但据验证集收敛在 1 epoch 后 early stop。
Infra(训练 / 推理工程)
训练:
- 960 张 NVIDIA H200 Tensor Core GPU(Stage 1 明确给出;Stage 2 复用同套并行策略)。
- 并行:DP + FSDP → HSDP(Hybrid Sharded Data Parallel),FSDP 在每个 8-GPU 节点内分片;每个 DiT block 粒度做 activation checkpointing。
- kernel:cross-attention 用 FlashAttention-3;chunk-wise 因果注意力用 FlexAttention 编译自定义 kernel。
- Stage 2 增 序列并行 SP(沿序列维分片隐藏态),自注意力用 Ulysses(all-to-all 换按头分片);SP group size = 4(28 个注意力头与 8 GPU/节点的公约数),仅用 intra-node SP 组以最小化通信。
推理:
- 自回归多步:给初始图 o_1 → 编码 s_1=h(o_1) → 按语言动作 a_{1:T-1} 逐步预测 s_{2:T} 并重建视频 o_{2:T}。状态增强:把预测状态与其重建观测的编码拼接 s’_k=[s_k, h(o_k)],并把初始状态、增强状态、历史动作全部拼成上下文喂骨干;每步 decode 额外条件上一观测 o_t 保知觉连续。
- CFG guidance scale = 4(平衡画质与动作依从);DiT 每步输出缓存供下一块生成。
- SP group size = 8(=GPU/节点)求最小延迟;因 28 头不整除 8,作者改 Ulysses 实现允许头维不均匀分片。
- SageAttention2++:Hopper GPU 上 8-bit 计算 + 4-bit 量化、性能损失极小,改支持块级因果掩码后相比训练用的 FlexAttention/FlashAttention-3 加速 30.3%。
- 具体 FPS / control-Hz / 端到端延迟:未披露。
评测 benchmark
作者自建三维度基准(层级递进:动作保真 → 长时一致 → 模拟式推理规划),基线含开源 Wan-2.1 & 2.2、Cosmos 1 & 2、V-JEPA 2 与闭源 KLING、MiniMax(Hailuo)、Gen-3。总体:PAN 取得开源 SOTA、与最佳闭源商用模型持平。
① Action Simulation Fidelity(动作模拟保真,GPT-4o 提动作序列、VLM-judge 打分 action faithfulness/precision)
- Agent Simulation(驱动可控实体、保背景稳定):70.3%
- Environment Simulation(场景级干预:增删移物、改天气光照):47.0%
- 总分 58.6%——超所有开源基线与多数商用基线。作者指出大型视频生成模型难以维持一致的多步动作-效果动力学。
② Long-horizon Forecast(长时程预测)
- Transition Smoothness(转场平滑,基于稠密光流的加速度倒指数):53.6%
- Simulation Consistency(模拟一致,取自 WorldScore 指标、对后段渐进加权惩罚):64.1%
- 均大幅超越所有基线(含 KLING、MiniMax);基线倾向放大运动幅度、时序漂移。
③ Simulative Reasoning and Planning(模拟式推理与规划)
- Step-Wise Simulation(原子因果预测;机器人操作场景取自 AgiBot,遵循 WM-ABench;从 1 真值 + 3 对抗干扰中选下一观测,PAN 由人评判物体关系/物理效应,V-JEPA 2 比对潜状态相似度且用 WAN2.1 的 UMT5 扩展以处理语言动作;所有模型在 AgiBot 上微调对齐):56.1%,开源世界模型中最高。
- Open-Ended Simulation and Planning(OpenAI-o3 作 VLM agent 提候选动作、世界模型模拟后选最接近目标者;15 场景,盲评轨迹成功率与 rollout 质量):接入 PAN 相比纯 VLM 基线任务成功率 +26.7%。
- Structured Simulation and Planning(Language Table 数据集、46 测例、最小空间重排定义目标):+23.4%。
- 结论:真实外观本身不够,可靠的因果 grounding 才是规划时推理有效的关键;基线因模拟不稳有时反而误导 agent、成功率有升有降,唯 PAN 带来一致且显著的提升。
定性结果(§8):交互式长世界模拟(闭环、实时干预、保 identity/空间关系不漂移)、多样动作与跨域世界模拟(把动作语义与外观解耦、跨域迁移)、罕见/反事实事件模拟(生成物理连贯的尾部事件用于鲁棒性/安全增强)。
创新点与影响
- GLP 架构的首个大规模实例化:用「生成式监督」把潜预测锚定到观测空间重建,从原理上规避 JEPA 系的坍缩与不可定义性——把「不可预测的感知细节」交给编解码对、让预测骨干专注平滑因果的潜转移,兼得可扩展 + 可解释 + 稳定的世界模型训练。
- LLM 骨干做世界模型潜在动力学:借 Qwen2.5-VL 的文本世界知识缓解原始视频的信息稀疏,用多轮对话模板 + 256 query embedding 实现语言动作条件、长时程、可交互的闭环 rollout;区别于开环视频生成。
- Causal Swin-DPM:滑窗双噪声级 + chunk-wise 因果掩码,同时解决长 rollout 的局部块间不连续与质量退化累积两大顽疾,并把「历史模糊化」自然转化为对 JEPA「未来不可知」质疑的建设性回应。
- 面向世界模型能力的新基准三件套(动作保真 / 长时一致 / 模拟式推理规划),把评测从「帧级画质」推进到「能否当推理与规划的内部模拟器」。
作者自述局限:当前实现仅采用精简的纯自回归语言骨干,尚未落地 Xing 2025 设想的「LLM+diffusion embedder 混合骨干、离散-连续混合表示」;每组件都可独立增强(层级 embedding、混合表示、高阶时序动力学)。作者明确指出「更强 GLP 设计 + 持续 scaling + 扩展训练」有显著提升潜力,PAN 是迈向通用世界模型的一步而非终点。注:论文未公开代码/权重下载页、GitHub 或 HuggingFace 仓库(截至抓取日在 arXiv 元数据与检索中均未见)。
原始链接
- arXiv 摘要页:https://arxiv.org/abs/2511.09057
- arXiv PDF:https://arxiv.org/pdf/2511.09057
- arXiv HTML 全文:https://arxiv.org/html/2511.09057v1
- 机构:MBZUAI Institute of Foundation Models(IFM),report number 2025-11-14
- 关键依赖一手源(非本工作):Qwen2.5-VL 技术报告 arXiv:2502.13923;Wan2.1 (Wan et al., 2025b);GLP 框架 Xing et al. 2025
一手源存档(sources/)
- 本页唯一一手源为 arXiv 论文全文(arXiv:2511.09057,report 2025-11-14),按规范不入 git——正文所有数字均出自该 PDF/HTML 全文(经 curl 抓取
arxiv.org/html/2511.09057v1通读)。 - 该工作无独立官方博客 / model card / GitHub / 项目主页可存档(检索与 arXiv 元数据均未见),故
downloaded为空。