世界模型训练方法横向综述

把「世界模型」这一大类的训练方法摊开看,真正的分歧不在网络结构,而在两个正交的选择:(1) 模型在什么空间里预测——像素 / 离散 token / 连续隐空间 / 价值-奖励标量;(2) 学到的模型服务于什么下游——在想象里训策略(control)、生成可交互视频(simulation / data-gen)、还是只产出可迁移表征(representation)。这两个选择交叉出五条主干范式,本页按此组织,并在每条主干里抠出目标函数、防坍缩/防漂移机制与具体超参:

  1. 想象力强化学习(imagination RL):学一个重建式隐动力学,在其想象轨迹里用 actor-critic 学策略,代表是 Dreamer 系;
  2. 价值等价 + MCTS(value-equivalent planning):不重建观测,只预测奖励/价值/策略,用搜索产生训练目标,代表是 MuZero 系;
  3. 扩散 / 流匹配视频世界模型:直接在像素/latent 空间去噪生成未来观测,diffusion-forcing 把它和自回归缝合;
  4. next-token 自回归:把观测 tokenize 后当语言模型预测下一 token;
  5. JEPA 回归:在隐空间做非生成式预测,靠正则而非负样本防坍缩。

最后单列蒸馏与实时化——这是 2024 年后所有生成式世界模型收敛到的共同末端工程,也是把 RL 后训练(GRPO / DMD / DiffusionNFT)重新引回视频模型的入口。


一、想象力强化学习:Dreamer 系与 latent imagination

1.1 从 ELBO 到 λ-return:范式定型

这一支的祖先是 planet:世界模型目标就是标准 ELBO(重建项 − KL 复杂度项),并提出「latent overshooting」在隐空间训 1≤d≤D 的多步预测;但一个反直觉的结论是——最终用 RSSM 的 agent 并不需要 overshooting,PlaNet 最后只用标准 ELBO,且规划靠 CEM 而非学策略。world-models-ha-schmidhuber 更早地把「VAE + MDN-RNN + 进化 controller」三段分开训(V 训 1 epoch、M 训 20 epoch、C 用 CMA-ES 种群 64 进化),并首创「在梦里训策略」——把 M 包成 gym.Env 让 controller 只在纯 latent 里学;它也第一个记录了「策略钻世界模型空子」的现象,用调高 MDN 温度 τ 注入不确定性来压制。

dreamer-v1 把「学隐动力学 → 想象里学 actor+value → 部署采数据」的三过程闭环固定下来,两个决定性设计延续至今:Vλ(λ-return,λ=0.95) 平衡 bias/variance 做 value 目标;actor 靠解析梯度穿过可微动力学最大化 Vλ。连续控制超参 H=15、γ=0.99、KL 用 3 free nats(同 PlaNet),且作者报告无需 target network、无需 overshooting。

1.2 KL balancing、free bits 与鲁棒化(V2 → V3)

dreamer-v2 的关键改动是离散隐 + straight-through(替代高斯 + 重参数化)和 KL balancing(用 stop-gradient + 不同 loss scale 让先验往后验靠、而非对称),并确立了 actor 梯度的分域选择:Atari 用纯 Reinforce(ρ=1,离散动作下 straight-through 偏差大),连续控制用纯动力学反传(ρ=0)。dreamer-v3 把「一套超参跨域」做成卖点,堆了一整套鲁棒化技术:世界模型损失拆成 βpred·Lpred + βdyn·Ldyn + βrep·Lrep(1/1/0.1),KL 用 balancing + free bits(低于 1 nat 就截断);critic 用 symexp-twohot 离散回归把梯度大小与目标大小解耦;actor 用 percentile return 归一化(第 5–95 百分位差、EMA 0.99,且只缩大回报、对小于 L=1 的不动)避免稀疏奖励下噪声压过熵正则;优化器换 AGC(0.3)+ LaProp。这套「free bits + 小表示损失权重 + symlog」组合,正是让固定超参跨 150+ 域可用的技术内核。

1.3 骨干换代:Transformer / SSM / 扩散化的世界模型

RSSM 之后,世界模型骨干经历了三轮替换,但 actor-critic 目标几乎原封不动照搬 DreamerV2/V3:

  • Transformertransdreamer(RSSM→Transformer,ELBO 不变,仅因显存把想象轨迹数降到 3)、iris(VQ tokenizer + GPT 式 Transformer G,自编码器用 L1+commitment+感知损失,行为学习直接沿用 DreamerV2 的 REINFORCE+baseline+熵 0.001)、stormL_rec+rew+con+0.5dyn+0.1rep,重建对编码器输出 z 而非序列输出,消融证明这点关键)、twm-transformer-world-model(把平衡 KL 重推导为平衡交叉熵,拆出 L_Obs/L_Dyn 便于独立调权,α1=5/α2=0.01/β1=10/β2=50,并用阈值化熵损失 Γ=0.1 跨不同动作数保持稳定探索)、delta-iris(上下文感知 Δ-token,imagined:collected=64)、rem-parallel-observation-prediction(RetNet + 并行观测预测 POP)、twister-contrastive-world-model(在 DreamerV3 上加 K=10 步 InfoNCE(AC-CPC),消融确认 K=10 最优)。
  • SSMrecall-to-imagine-r2i 用 S5 并行扫描替代循环,关键工程是打断表征模型对 hₜ 的循环依赖(换成非循环 qθ(zₜ|oₜ))才能一次算完整段隐状态,避免想象阶段退化成 O((L+H)²);其余 λ-return/twohot/percentile 归一化全照搬 DreamerV3。骨干对比研究 s4wm-world-model-backbones 则专门比 RNN/Transformer/S4 的想象质量(S4WM lr 1e-3、TSSM-XL 恒定 1e-4、RSSM-TBTT 用截断反传 batch 32)。
  • 扩散化diamond 把世界模型换成 EDM 去噪L=‖Dθ(x_{t+1}^τ,·)−x_{t+1}^0‖²),核心依据是消融——DDPM 在 ≤10 去噪步时自回归会严重漂移出分布,EDM 即使 n=1 步也长时程稳定;部分可观测游戏(Boxing)多模态观测需 n=3 锁定模态,故全实验统一 n=3。

1.4 目标解耦、层级与真机

想象 RL 的另一条演化线是把「世界模型该学什么」显式解耦:harmonydream 用整流调和损失 log(1+σ) 自动平衡观测/奖励/动力学三项(未整流版会给小尺度奖励损失算出极端大系数 1/σ 而失稳);iso-dream 用逆动力学把可控/不可控视觉动态分离,逆动力学损失 α·ℓ2(at,ãt) 直接进世界模型总损失联合优化;director 是层级——manager 选离散 goal(goal autoencoder 重建误差当探索奖励,会随熟悉度自动衰减)、worker 用 max-cosine 相似度奖励,四组件并发更新。真机侧 daydreamer 的核心不是算法而是训练流程解耦:去掉 DreamerV2 的 train_every 超参,learner 线程与 actor 线程完全并行不做速率限制。而 mbpo 代表 Dyna 式的另一条路——不在想象里端到端学策略,而是用概率集成模型做短 k-步 rollout 扩充 SAC 的 replay(理论上 k-分支 rollout 把误差从随 horizon 二次方降为线性),simple-atari 则完全在世界模型 env′ 里用 PPO 训策略(15 次迭代、每轮 N=50 步 random starts 缓解复合误差、评测温度 T=0.5)。

表 1 · 想象力 RL:Dreamer 系目标与超参对比

工作世界模型目标KL / 稳定化actor 梯度折扣/λ/H关键超参
planetELBO(重建+KL)3 free nats无(CEM 规划)Adam lr 1e-3、grad clip 1000
world-models-ha-schmidhuberVAE(L2+KL)+MDN-RNN 似然温度 τ 抗钻空子CMA-ES 进化种群 64、每体 16 种子
dreamer-v1ELBOβ=1 + 3 free nats动力学反传(连续)γ0.99 λ0.95 H15WM lr 6e-4 / actor 8e-5
dreamer-v2img+rew+disc + β·KLKL balancing β0.1/1.0Reinforce(Atari)/动力学反传(连续)λ0.95、target 每100步13M→22M、每4步1更新
dreamer-v3Lpred+Ldyn+Lrep(1/1/0.1)balancing+free bits 1natReinforce + percentile 归一化γ0.997 λ0.95 H15symlog/twohot、AGC0.3+LaProp lr4e-5
irisAE(L1+commit+感知)+G(CE)REINFORCE+baseline+熵0.001γ0.995 λ0.95 H20lr1e-4、600 epoch
stormrec+rew+con+0.5dyn+0.1repKL balance+free bitsDreamerV3 式γ0.985 λ0.95WM lr1e-4 / AC 3e-5、Transformer 2层
twm-transformer-world-model平衡交叉熵(拆 Obs/Dyn)α1=5,α2=0.01,β1=10,β2=50A2C + GAEγ0.99 λ0.95阈值熵 Γ0.1、critic lr1e-5
diamondEDM 去噪 L2n=3 去噪步防漂移REINFORCE+baseline+熵0.001γ0.985 λ0.95 H15AdamW lr1e-4、CS:GO 381M
recall-to-imagine-r2iDreamerV3 ELBOβ 1/0.5/0.1 + free bitsREINFORCE/动力学反传γ0.997 λ0.95 H15SSM batch L=1024、parallel scan
twister-contrastive-world-model+ L_cpc InfoNCE K=10β_dyn0.5 β_reg0.1 free bitsReinforce+熵γ0.997 λ0.95 H15WM lr1e-4 / AC 3e-5
harmonydream整流调和损失 log(1+σ)三 harmonizer 联合反传沿用基座 DreamerAMP(DMCR 用 fp32 防 nan)

二、价值等价 + MCTS:MuZero 家族

2.1 目标函数与 reanalyze 正反馈

MuZero 系不重建观测,muzero 的损失对每个假想步 k=0…K 求和:l_r(reward) + l_v(value) + l_p(policy),其中 policy 目标 = MCTS 搜索访问分布的交叉熵(作者消融证明它比 Q-learning 的高偏差目标信号更强),value 目标 = n 步 bootstrap(棋类直接 bootstrap 到终局 = 预测胜负);损失形式棋类用平方误差、Atari 因奖励幅度多变改用交叉熵。两个工程细节被后续普遍继承:每 head loss 乘 1/K、动力学入口梯度乘 1/2(让施加到动力学的总梯度恒定)。其祖先 value-prediction-network 已经用 d-step 规划算 Qᵈ 选 option、异步 n-step Q-learning(n=10、16 线程)训练。

Reanalyze 是这一族的样本效率引擎:用最新参数重跑 MCTS 产生更优训练标签,标签质量随参数迭代不断变好形成正反馈。muzero-unplugged 把它推到纯离线(value 用 5-step TD + target network,DM Control 因数据集小改为直接回归搜索价值防过拟合),并有一个反直觉消融:数据多时(20M 帧、99.5% reanalyse)5-step TD 反优于 0-step TD(median 126.6% vs 115.3%),即便学习几乎全离策略。rezero-mcts 则从计算侧加速 reanalyze:backward-view 减少单次搜索的树遍历、entire-buffer 把 reanalyze 频率从「每 mini-batch 一次」降到「每隔固定迭代对整 buffer 一次」,且 collect 阶段完全跳过 MCTS 直接采策略网络输出。

2.2 EfficientZero 三件套与连续/随机扩展

efficientzero 建在 MuZero Reanalyze 上,三件套里自监督一致性最关键(去掉后 Normed Mean 从 1.943 跌到 0.881):同步展开 5 步逐步拉近预测隐状态与真实观测表征;value prefix 把 UCT 里的奖励求和整体交给 LSTM 端到端预测、绕开「精确预测哪步丢分」的病态子问题;基于模型的 off-policy 校正用动态时域 l(轨迹越旧 l 越小)减少策略发散。efficientzero-v2 进一步用基于搜索的价值估计 SVE(N 次模拟 bootstrap 取经验均值,误差上界随模型误差 ε→0 收敛到 0)替换自适应步长 TD,用采样式 Gumbel search 替换 MCTS,并在早期训练(模型误差大)退回多步 TD 的混合价值目标。

搜索机制的三个正交扩展:sampled-muzero 用采样动作先验 π̂β 处理大/连续动作空间(消融显示 π̂β 显著比直接用 π 稳健,humanoid.run 上 K=3 已够、K>10 不再提升);gumbel-muzero 用 Gumbel-Top-k + Sequential Halving 在小模拟数下保证策略提升(Atari n≤18 时 Sequential Halving 根本不触发,证明是「planning with Gumbel」本身而非 halving 起效),并把策略目标换成 completed-Q 的 KL(π’,π)stochastic-muzeroL_chance 项建模环境随机性(Backgammon 学到 non-negligible 概率的 chance code 数恰好=21,对应两骰子全部组合)。统一基准 lightzero 把这些算法收进一套代码(默认 sim 50、lr 3e-3、reanalyze 0),并做了两个 case study:探索机制对比(RND 用原始观测而非漂移的隐状态)、一致性损失对不同观测类型的收益(图像最关键、向量增益小、棋盘二值图余弦相似度始终偏低)。vq-models-planning 则把 VQ 离散 latent code 的预测加进 MuZero 损失,MCTS 扩展为动作节点/随机节点交替。

2.3 连续控制的 TD-MPC 路线

td-mpc/td-mpc2 是价值等价思想在连续控制上的变体:不用 MCTS 而用 MPPI 规划,联合目标 = 隐一致性损失(joint-embedding prediction,stop-grad EMA 目标)+ 奖励 CE + 值 CE(TD-target 用 Q 的 EMA),梯度沿时间反传全部 H 步减轻复合误差。TD-MPC2 把奖励/值用 soft cross-entropy 在 log 空间做离散回归,策略用最大熵 RL(α 用 5%/95% 百分位统计自动调),全任务统一超参(UTD=1、λ=0.5、H=3),并证明「大规模多任务离线预训练 → 单任务在线微调」可不加保守正则无缝衔接。pwm-multitask-world-models 在其上做「预训练多任务世界模型 + 逐任务 <10 分钟抽取专家策略」,actor 用 FoG 一阶反传(而非 TD-MPC2 的 DDPG-Q 梯度),并给出反直觉命题:世界模型正则越强、拟合误差越大,但策略奖励反而越高(弱正则模型让策略前期学得快但收敛到更差次优解)。

表 2 · 价值等价 + 搜索:MuZero 系对比

工作value 目标policy 目标搜索 / 规划reanalyze关键超参
muzeron-step(Atari n10 / 棋类终局)MCTS 访问分布 CEMCTS,K=5 unroll80% updatesbs 2048/1024、γ0.997、1M batch
muzero-unplugged5-step TD(Atari)MCTS πₜReanalyse(纯离线)99.5% fractionbs1024、lr1e-4 cosine 1M
efficientzerovalue prefix + off-policy 校正MCTSN_sim=50、mean-Q 初值0.99discount0.9974、120K步(前100K采)
efficientzero-v2SVE(N 模拟均值)+ 混合 TDCE + 简单策略损失Gumbel searchreanalyzeλ1234=1/1/0.25/2、熵5e-3
sampled-muzeron-step(围棋 n25)采样先验 π̂βK=20 采样、sim50bs1024、lr1e-4 cosine 1M
gumbel-muzeron-stepcompleted-Q 的 KL(π’,π)Gumbel-Top-k + Seq-Halvingc_visit50、c_scale1.0/0.1
stochastic-muzeroL_MuZero + L_chanceMCTS 访问分布chance-node MCTSAdam lr3e-4、bs1024
unizeron-step TD CE(101 bin)MCTS 改进 CETransformer-latent MCTS sim50buffer reanalyzeH10、lr1e-4、β_z=10
rezero-mctsMuZero lossMCTS πbackward + entire-bufferfreq=1lr3e-3、bs256、sim50
td-mpcFQI value CE(EMA target)maxQ(DDPG 式)MPPIc1/c2/c3=0.5/0.1/2、λ0.5
td-mpc2TD-target CE(log 空间)最大熵 maxQMPPI H=3UTD1、bs256、lr3e-4、λ0.5
pwm-multitask-world-modelsTD(λ) criticFoG 一阶反传 actor无(直接抽策略)H16 λ0.95、10k 步/任务

值得注意的还有 vq-models-planning(VQ latent code CE + MuZero 四项损失)、unizero 的联合优化(next-latent 预测 β_z=10 + reward/policy/value CE,训练后清 KV Cache 因参数已更新)。


三、扩散 / 流匹配视频世界模型

这是自驾、游戏、机器人三大生成式世界模型共享的主干。目标函数经历了 ε-prediction(DDPM)→ v-prediction → rectified flow / flow-matching 的迁移,训练侧的三个关键机制是:条件 dropout 支撑的 classifier-free guidance、多阶段流水线(图像→短视频→长视频/多视角)、以及 diffusion-forcing 逐帧噪声级别。

3.1 目标参数化的三代迁移

3.2 classifier-free guidance 与条件 dropout:一张参数表

CFG 是可控生成的通用杠杆,训练时按概率 drop 各类条件、推理时放大。这里的分歧在丢什么、丢多少、如何按 token/frame 调度

表 3 · 扩散/流世界模型的 CFG 与条件 dropout

工作目标参数化条件 drop(训练)CFG(推理)特殊调度
gaia-1-wayveAR token + 视频扩散 decoder无/action/text=20/40/40%text CFG按 token + 按 frame(cosine)双调度、top-k50
drive-wm-driving-into-the-futureε(DSM)每条件独立 20%5.0DDIM 50 步、η=1.0
magicdriveε场景级 γ0.2、框/图保留1.5→4.0 消融无条件地图设全 0 提升 Road mIoU
vista-driving-world-modelε+L_dyn+L_struct动作 15% dropout三角 CFG(1.0→2.5)沿帧轴分配 guidance 缓解漂移
magicdriveditrectified flow CFM15%2.0(30 步)路网图用全 0 null 条件
gaia-2-wayveflow(v=x−ε)每条件 80% / 全体 10% / 相机 10%默认关,OOD 才开 2–20空间选择性 CFG(只在 bbox 位置)
gamengenv-predictioncontext 帧 0.11.5(仅过去观测)动作条件不用 CFG
worlddreamermasked-token CE多模态 embed 10%β guidancecosine mask、约 10 步并行解码
cosmos-drive-dreams复用 Cosmos 扩散Qwen 改写 prompt 只改天气/时段

3.3 多阶段流水线:从图像迁移到多视角长视频

自驾世界模型几乎都是「先学单帧结构条件、再叠时序、再扩多视角/长视频」的分阶段冻结式训练,理由是可控生成模型会先学画质、再学可控性magicdrivedit 与 MagicDrive 系一致观察),且模型对提分辨率的适应快于对拉长视频。典型两/三/四阶段:drivedreamer(image 40ep → video 加时序注意力 10ep → prediction 10ep)、drivingdiffusion(跨视角 50k → 时序 40k → 长视频 10k)、panacea-driving-video(单帧多视角 → 叠时序,用真值首帧条件避免依赖自身生成)、wovogen(世界体 AE 30k → 世界体扩散 50k → 单帧多相机 50k → 时序微调 3.5k)、genad-generalized-predictive-model(SDXL 图像域迁移 300k → 冻结只训时序 block 112.5k)、worldsplat(4D 感知扩散四阶段,IDDPM→Rectified Flow 中途切换)。通用 WFM 则是「通用预训练 → 域后训练 → 条件模型微调」:cosmos-drive-dreams(Cosmos-7B 驾驶后训 batch64/140k/lr1.5e-5,再冻基座训 ControlNet 分支)、nvidia-cosmos-transfer1(分模态独立训 control branch)。

3.4 diffusion-forcing:把自回归与扩散缝合

diffusion-forcing 是这一支近年最重要的训练机制创新:训练时对序列每个 token 独立采样噪声级别 k_{1:T}~[K]^T,最小化逐 token 噪声预测损失。理论上它优化的是所有噪声级别序列似然下界的一个 reweighting;特例 k_t∈{0,K} 可掩掉任意历史 token,从而一个模型既是 policy(缩短前瞻窗 H 降延迟)又是 planner(拉长 H + 引导做长时程规划),无需改架构或重训。它直接催生了一批「无限时长 + 逐帧因果」的世界模型:decart-oasis(per-token 噪声 + sigmoid schedule)、history-guided-video-diffusion(DFoT,把 History Guidance 拆成 vanilla/temporal/fractional 三形式:HG-t 在长上下文 Minecraft 把 FVD 从 97.63 降到 79.19,HG-f 用部分加噪历史解决高 guidance 下静止画面失效模式;并证明把 Full-Sequence 模型微调成 DFoT 只需从头训练的 12.5% 成本)、worldmem(Oasis/DFoT 基座 + 记忆模块,已生成帧标记 k=0.02 防误差累积)、decart-mirage/decart-mirage-lsd(history augmentation:训练时用「模型可能产生的伪影」腐化历史帧、推理时显式告知历史不可信)。同源的抗漂移训练技巧还有 epona-autoregressive-diffusionchain-of-forward(每 10 步用模型自预测帧连做 3 次前向、一步估计去噪结果接回)、skywork-matrix-game 的 p=0.2 历史帧加噪 + 运动帧 CFG。

表 4 · 生成式视频世界模型的目标与多阶段(补充)

工作目标阶段/流水线diffusion forcing关键超参
gaia-1-wayveAR token + 视频扩散 decodertokenizer/WM/decoder 分训WM 6.5B、64×A100、100k、seq 15860
vista-driving-world-modelε + L_dyn + L_struct高保真 20K → LoRA 动作可控128×A100、576×1024、lr1e-5
genad-generalized-predictive-modelε图像迁移 300k → 时序 112.5k冻图像 block 只训 2.5B 时序
diffusion-forcing逐帧 ε✓ 核心K=1000、采样 100/50 DDIM
history-guided-video-diffusion逐帧 ε(式 4)FS→DFoT 微调 12.5%✓ + HG-v/t/fKinetics bs192 lr2e-4 640k
cosmos-predict2-5-world-simulationflow(logit-normal)T2I→V2W→480p→720p→T2Wlr3e-5(2B)、rCM 蒸馏 4 步、GRPO RL
gaia-2-wayveflow(双峰 logit-normal)tokenizer 300k + WM 460k256×H100、48 帧、5 相机 12600 token
tesseract-4d-world-modelε(RGB-D-Normal 联合)video → 关键帧规划微调40k、lr1e-4、DDPM 50 步、CFG7.5
worldmem逐帧 εOasis/DFoT 基座 + 记忆模块Minecraft 200K/8GPU、tr=0.9

游戏与开放世界还有一批把 RL 智能体与生成模型分两阶段的工作:gamengen(PPO 智能体 10M 步 → 生成扩散 700K 步,DOOM 特定奖励是唯一游戏专属部分)、gamefactory(LoRA 拟合游戏风格 → 冻结只训动作控制模块 → 推理移除 LoRA 泛化到开放域)、gamegen-x(基础模型预训练 → 冻结只训 InstructNet 指令分支)、playable-video-generation(纯重建自监督 + 互信息动作损失自己「发现」离散动作集,不需预指定动作数)、game-gan(三判别器 GAN + cycle loss 逼模型把静态元素塞进记忆向量涌现长期一致性)。


四、next-token 自回归与 masked-token

把观测 tokenize 成离散序列后,世界模型就退化为一个 GPT。这一支的共性是两阶段:先训 VQ/离散 tokenizer(重建 + commitment + 感知/GAN 损失),冻结后再训 AR Transformer 做 next-token 交叉熵,训练用 teacher forcing、且普遍只对未来帧 token 计损。

  • 视觉 ARiris(VQ + GPT,虽归想象 RL 但骨干是 AR)、ivideogpt(无动作视频预训练 → 领域微调,只对未来帧 token 计损,且下游只需微调 tokenizer、冻结 Transformer 即可迁移新机器人)、larp(tokenizer 联合 AR 先验端到端优化,消融证明去掉 AR 先验后重建最好但生成质量骤降——直接印证「重建目标≠生成友好隐空间」)、videoworld(LDM 潜编码 + next-token,消融显示不用 LDM 的纯视频基线大幅落后;码本 64000 最优、过大 262144 不收敛)、mineworld(图像+动作交错 flat token、并行解码专用微调缩训练/推理 gap)、omnitokenizer(图像单模态 500k → 图像-视频联合 500k → KL 微调,「先图后视频」显著优于任何单阶段)。
  • 自驾 ARdoe-1(观测/描述/动作统一 next-token,动作 token 权重 ×5、z-loss 1e-5 稳大词表 softmax)、drivingworld-gpt(next-state + next-token 混合,帧级和内部状态级都 teacher-forcing)、occworld(VQ tokenizer + 时序自回归,ego token 隐式做 action-conditioning)。
  • masked-token(MaskGIT/Muse 族)worlddreamer(非自回归并行 mask-token 预测,约 10 步解码,声称比扩散快 3×、比 AR 快 20×)、copilot4d-waabi(把 MaskGIT 升级成 absorbing-uniform 离散扩散:非 mask 位置加至多 η=20% 均匀噪声、可迭代重采样修正已解码 token,世界模型混合训练目标 50/40/10% 切换 future/joint/独立去噪)。
  • 超长上下文 / 语言融合lwm-large-world-model(渐进式上下文扩展 32K→1M,RoPE θ 同步放大到 50M,Masked Sequence Packing 让打包等价于 padding 训练)、pandora(复用 Chat-UniVi + DynamiCrafter,只训 Q-Former 适配器做表示对齐 + 扩散损失微调)、dynalang(语言纳入动作空间,文本预训练时图像/动作清零只优化 Lpred+Ll)。
  • 大规模 agent 化microsoft-wham-muse(VQGAN + Transformer next-token,1.6B 因图像 token 多稀释了动作 loss、把动作 loss ×10 才追平多样性;做了 15M→206M scaling law 外推、发现 FVD 与训练 loss 相关 r=0.77)、1x-world-model(Temporally Teacher-forced CE,词表 2^18 分解为两个 2^9 类预测)。

表 5 · next-token / masked-token 世界模型

工作tokenizerAR 目标计损范围关键超参
ivideogptVQGAN 1M 步next-token CE仅未来帧Transformer 7e5 步 bs64 lr1e-4 bf16
videoworldVQ + LDM 潜编码潜编码+下一帧联合 CEAR 1M 步 bs256、码本 64000
doe-1Lumina-mGPT 7B统一 next-token动作 token ×516 epoch、lr1e-5、z-loss1e-5
drivingworld-gptVQ(2×500k)next-state + next-token帧级+状态级 TF450k、bs64、lr1e-4
worlddreamerSTPTmasked-token CE被 mask token2M 步 bs64 lr5e-5、~10 步解码
copilot4d-waabiVQ + render lossabsorbing-uniform 离散扩散全 tokenWM lr1e-3 bs8 cosine0.75M
microsoft-wham-museVQGANnext-token CE交错图像+动作1.6B:bs2.5M token、200k 步、~1e22 FLOPs
lwm-large-world-modelLM + VL next-token加权语言/视觉渐进 32K→1M、RoPE θ 50M、v4-512/1024

五、JEPA 回归:非生成式表征预测

LeCun 蓝图 lecun-path-autonomous-machine-intelligence 给出了这一支的理论框架:训练世界模型 = 自监督 pattern completion,用能量模型统一,核心是如何不坍缩。它把对比法(负样本随维度指数增长、维度诅咒)判为死路,力主正则化/非对比法——训 JEPA 的四条准则是最大化 s_x/s_y 信息量、让 s_y 易从 s_x 预测、最小化 latent z 信息量;VICReg 用 Variance+Covariance 两项做「对分量做对比」(dimension-contrastive)替代「对样本向量做对比」。落地后 JEPA 的目标高度统一:隐空间 L1/L2 回归 + EMA target encoder + 无负样本无重建,防坍缩靠编码器/EMA 的非对称设计。

  • 图像/视频i-jepa(latent 平均 L2,EMA 0.996→1.0,wd 0.04→0.4,bs2048)、v-jepa(特征预测,bs3072、90k 步、schedule 按 112.5k 步算但只训 90k——发现默认调度最后 25% 更新过猛)、v-jepa-2(三段式 warmup-constant-decay,cooldown 段才升帧数/分辨率,渐进分辨率省 8.4× GPU 时;-AC 后训练用 teacher-forcing + 两步 rollout L1 损失、编码器冻结)、iwm-learning-leveraging-world-models(把 predictor 接冻结 teacher 后做下游 predictor 微调,是核心贡献)、intuitive-physics-vjepa(完整沿用 V-JEPA 配方只换 RoPE,证明直觉物理从自监督预训练涌现)。
  • 跨模态a-jepa(音频,掩码课程在随机 block 与时频感知掩码间退火)、mc-jepa(光流+内容多任务,VICReg 每层都加、+1 epoch VC-only warmup)、stem-jepa-musicjepa-speech-tokenizer-daam(两阶段:JEPA 自监督 → 微调 + FSQ + HiFi-GAN,表征学习与重建分开优化)、brain-jepa(脑动力学,梯度定位 + 时空掩码,消融显示 JEPA 框架本身而非仅位置编码带来提升)、point-jepa(点云 Smooth L1)、s-jepa-eegt-jepa-tabular
  • 世界模型/规划dino-wm(在预训练 DINO 特征上做潜一致性 L2、无像素重建,zero-shot CEM 规划,实测 CEM 优于梯度下降)、pldm-planning-latent-dynamics(JEPA 预训练 + 测试时 MPPI 免训练规划,消融证明「预测式 SSL 优于重建式」:把 VICReg 换成像素重建,Two-Rooms 成功率从 97.4 掉到 26.2;换适配版 TD-MPC2 直接坍缩到 0.0)。
  • LLM/推理侧再利用jepa-reasoner(预训练 next-token → SST 用 EMA target + scaled cosine 在隐空间做推理,可并行、不像 COCONUT 需多趟同步前向)、llm-jepa(NTP + JEPA 联合,cosine + Text→Code + 后置 [PRED] 最优,Loss Dropout 加速)、jepa-t-text-to-image(Masked Prediction + Conditional Flow Matching 双目标)、jepa-vla(表征探针 + VLA,video predictive embedding 对 VLA 有必要性)。
  • 理论收敛lejepa 把 JEPA 简化到极致——L = λ·SIGReg + (1-λ)·L_inv,唯一权衡超参 λ=0.05,无多阶段/无 RL/无蒸馏/无 scheduler/无 register token,删掉 predictor 与 teacher-student 也不坍缩;when-does-lejepa-learn-world-model 进一步解析刻画其最优解是正交旋转(先证明再用训练验证,而非训练发现定理)。

表 6 · JEPA 家族:目标与防坍缩

工作目标防坍缩EMA target优化用途
i-jepalatent 平均 L2EMA 非对称0.996→1.0AdamW bs2048 lr1e-3图像表征
v-jepa特征预测 L1/L2EMA0.998→1.0bs3072、90k 步视频表征
v-jepa-2特征预测 + AC teacher-forcingEMA0.99925(固定)bs3072、252k、渐进分辨率理解+规划
mc-jepaL1 + VICRegVC 每层 + warmupConvNeXt-T、bs384光流+内容
dino-wmlatent L2(无重建)EMApredictor lr5e-5zero-shot CEM 规划
pldm-planning-latent-dynamicsL_JEPA 五项 + VICRegensemble + VICRegAdam + cosineMPPI 规划
iwm-learning-leveraging-world-modelslatent L2EMA 非对称lr1e-3、wd0.04→0.4表征 + predictor 微调
lejepaL_inv + SIGRegSIGReg 分布正则无 teacherAdamW λ0.05、bf16通用 SSL
jepa-reasonerscaled cosine(k=4)EMASST 1.3 万步隐空间推理

六、蒸馏与实时化

2024 年后所有生成式世界模型都撞上同一堵墙:扩散/flow 采样几十步 → 无法交互。共同解法是把多步教师蒸馏成少步因果学生,谱系大致是 consistency model → shortcut → self-forcing / DMD,且蒸馏几乎都伴随「双向教师 → 因果学生」的结构转换与「自身分布采样历史帧」抗漂移。

  • 早期少步gamengen 用类 DMD 的 3-U-Net(generator/teacher/fake-score)单步蒸馏跑到 50 FPS,但主方法仍用不蒸馏的 4 步版;playable-game-generation 4 步 DDIM 达 20 FPS;deepmind-genie2 明确区分「未蒸馏高质量基座 vs 可实时蒸馏版(质量下降)」。
  • consistency / shortcutthe-matrix 用 one-stage guided distillation 把 CFG 纳入 student(Euler ODE 单步 25/1000、10k 步);decart-mirage-lsd/decart-mirage 用 shortcut distillation(Frans et al.)+ architecture-aware pruning 做零延迟直播;cosmos-predict2-5-world-simulationrCM(连续时间一致性 + 分布匹配混合)蒸到 4 步、质量与 teacher 相近。
  • self-forcing / DMD 主流化skywork-matrix-game-2 两阶段——ODE 轨迹初始化因果学生(40k ODE pairs、6k 步)→ DMD self-forcing(生成器从自身分布而非 GT 采样历史帧缓解 gap,4k 步)→ 4 步降 3 步;skywork-matrix-game-3 冷启动(单段 GT 历史 600 步)→ 多段自生成推理(段数 1–6 均匀采样,DMD 反向 KL,2400 步);tencent-hunyuan-gamecraftPCM 8 步 + CFG 蒸馏达 <5s→6.6 FPS;playerone 用 CausVid 非对称蒸馏(双向 teacher 监督因果 student);nvidia-omnidreams self-forcing K=2 步、KV cache 梯度 detach + rolling cache 把复杂度从 O(TL²) 降到 O(TL)、progressive teacher 减 rolling-cache 漂移;moworld-flash-world-modelalibaba-rynnworld-teleop(因果 FM 预热 → DMD、跨 chunk 反传穿持久 KV cache)、dreamx-world-1gigaworld-1(ODE warm-start + DMD2:分布匹配 + score 一致 + 对抗,20→4-6 步)、tencent-yanyume(对抗蒸馏 50→14 步)都属此族。

表 7 · 蒸馏与实时化谱系

工作教师/基座蒸馏方法步数帧率/延迟
gamengen自身 4 步DMD 式 3-U-Net4→1 步50 FPS(主用 4 步)
the-matrixstage3 ckptconsistency(guided)单步 25/1000实时 SCM
decart-mirage-lsd大教师shortcut + 剪枝零延迟直播
cosmos-predict2-5-world-simulation预训练 teacherrCM(一致性+DMD)4 步高保真
tencent-hunyuan-gamecraft扩散+CFGPCM + CFG 蒸馏8 步<5s → 6.6 FPS
skywork-matrix-game-2教师ODE-init + DMD self-forcing4→3 步实时 streaming
skywork-matrix-game-3记忆增强基座冷启动 + 多段 DMD少步streaming(记忆池检索)
playerone双向 teacherCausVid 非对称实时
nvidia-omnidreamsbidirectional teacherself-forcing DMDK=2 步实时(rolling KV cache)
gigaworld-1teacherODE + DMD220→4-6 步
yumeteacher对抗蒸馏50→14 步

七、RL 后训练回到视频/世界模型

蒸馏解决了速度,但视频世界模型的「物理一致性 / 指令跟随」需要奖励信号,于是 RL 从 LLM 迁回了世界模型。三条落地路径:(1) VLM 奖励 + GRPOcosmos-predict2-5-world-simulation 把「条件=状态、去噪轨迹=动作」纳入 RL,用 VideoAlign VLM 奖励做 GRPO 式组内归一化 advantage(每条件 8 输出 × 20 步、训 256 步)、并用 diffusion loss 正则缓解 reward hacking;nvidia-cosmos-reason1 用 GRPO + 规则奖励(准确率 + 格式)做 Physical AI RL(自研全异步容错框架比 colocated 提效 ~160%)。(2) 奖励梯度对齐 / 可微奖励worldmodelbench 沿 VADER 把微调判官当可微奖励、优化「No−Yes」softmax 概率差;vista-driving-world-model 用模型自身预测不确定性(条件方差) 当免真值动作的奖励。(3) DiffusionNFT 几何奖励abot-3dworld-0 的 3DRL 用 RAFT 光流循环一致性 + LPIPS 保真度双奖励、dreamx-world-1 用相机控制 + 视觉质量双奖励模型融合 + KL 正则、driveworld-vla 用想象-真实一致性奖励反过来重加权动作模仿损失。具身智能体侧则是完整的「SFT → 在线 RLVR → 自改进」三段式:deepmind-sima2(Gemini 同时当 Task Setter + Universal Reward Model,混入非 gameplay 数据防灾难性遗忘,动作微调只带来温和回退而非「摧毁对话能力」),sima-scalable-instructable-multiworld-agent 则是纯行为克隆 + 「目标是否完成」辅助分类头。

值得注意的还有一批评测/基准本身不训练模型,只规定评测协议或训练一个 LoRA 判官:physion/physion-plus-plus(三训练协议 × 三读出协议)、vbench/vbench-2.0(VLM 判官 LoRA 微调)、videophy/videophy-2(VideoCon LoRA r=32)、worldsimbench/worldscore-benchmark/phygenbench/phyworldbench/physics-iq/physbench/impossible-videos/cam4docc-benchmark,以及综述 understanding-world-or-predicting-future-survey/survey-world-models-autonomous-driving/world-action-models-survey/mbrl-survey-moerland 把训练方法整理为既有范式分类。3D 场景生成类 wonderjourney/wonderworld/hunyuanworld-1 则大多训练无关,「训练」仅发生在推理时的场景级深度对齐/逐层优化。


空白与趋势

  • 目标函数在收敛:控制侧(Dreamer / MuZero / TD-MPC)的「隐空间一致性 + 值/奖励离散回归」与生成侧的「flow-matching + diffusion-forcing」正在互相靠拢——unizero/pwm-multitask-world-models 用 joint-embedding 一致性(本是 JEPA/TD-MPC 的做法)做世界模型损失,gaia-2-wayve/cosmos-predict2-5-world-simulation 用 flow-matching 统一自驾与通用生成。JEPA 的「非重建 latent 回归」正被 pldm-planning-latent-dynamics/dino-wm 证明在规划上优于重建式。
  • 抗自回归漂移是通用主线:从 world-models-ha-schmidhuber 的温度正则,到 diffusion-forcing 的逐帧噪声、epona-autoregressive-diffusion 的 chain-of-forward、decart-mirage 的 history augmentation、self-forcing 的「自身分布采样历史帧」,「训练时就见到自己会犯的错」已成共识。
  • 蒸馏 + RL 后训练成为新标配末端:2025 年的新基座(Cosmos、Matrix-Game 3.0、GigaWorld、OmniDreams、DreamX)无一例外是「大教师预训练 → 少步因果蒸馏 → 奖励后训练」三连,DMD / DiffusionNFT / GRPO 把 LLM 的对齐工具搬进了世界模型。
  • 一手训练配方披露度两极分化:学术论文(Dreamer 系、MuZero 系、JEPA 系、Cosmos、GAIA-2)给出完整目标+超参+消融;而产品级世界模型(genie-3world-labs-marble(Marble)、luma-ray2/luma-ray3-world-modelsdecart-oasisodyssey-explorergenesis-generative-physicsalayaworld)普遍只给定性工程难点、训练目标/流水线/超参「未披露」。跨这道鸿沟做方法复现,是本 scope 后续深挖的最大缺口。
  • RL 让世界模型「自己产生策略」仍未闭环1x-world-modelmuzero 之外,大多数生成式世界模型仍停在「学动力学 + 外置逆动力学/策略」,把「用学到的世界模型做 policy improvement」列为未来方向;deepmind-sima2genie-3 里跨生成环境泛化是首个实例,但还远未成为范式。