世界模型训练方法横向综述
把「世界模型」这一大类的训练方法摊开看,真正的分歧不在网络结构,而在两个正交的选择:(1) 模型在什么空间里预测——像素 / 离散 token / 连续隐空间 / 价值-奖励标量;(2) 学到的模型服务于什么下游——在想象里训策略(control)、生成可交互视频(simulation / data-gen)、还是只产出可迁移表征(representation)。这两个选择交叉出五条主干范式,本页按此组织,并在每条主干里抠出目标函数、防坍缩/防漂移机制与具体超参:
- 想象力强化学习(imagination RL):学一个重建式隐动力学,在其想象轨迹里用 actor-critic 学策略,代表是 Dreamer 系;
- 价值等价 + MCTS(value-equivalent planning):不重建观测,只预测奖励/价值/策略,用搜索产生训练目标,代表是 MuZero 系;
- 扩散 / 流匹配视频世界模型:直接在像素/latent 空间去噪生成未来观测,diffusion-forcing 把它和自回归缝合;
- next-token 自回归:把观测 tokenize 后当语言模型预测下一 token;
- JEPA 回归:在隐空间做非生成式预测,靠正则而非负样本防坍缩。
最后单列蒸馏与实时化——这是 2024 年后所有生成式世界模型收敛到的共同末端工程,也是把 RL 后训练(GRPO / DMD / DiffusionNFT)重新引回视频模型的入口。
一、想象力强化学习:Dreamer 系与 latent imagination
1.1 从 ELBO 到 λ-return:范式定型
这一支的祖先是 planet:世界模型目标就是标准 ELBO(重建项 − KL 复杂度项),并提出「latent overshooting」在隐空间训 1≤d≤D 的多步预测;但一个反直觉的结论是——最终用 RSSM 的 agent 并不需要 overshooting,PlaNet 最后只用标准 ELBO,且规划靠 CEM 而非学策略。world-models-ha-schmidhuber 更早地把「VAE + MDN-RNN + 进化 controller」三段分开训(V 训 1 epoch、M 训 20 epoch、C 用 CMA-ES 种群 64 进化),并首创「在梦里训策略」——把 M 包成 gym.Env 让 controller 只在纯 latent 里学;它也第一个记录了「策略钻世界模型空子」的现象,用调高 MDN 温度 τ 注入不确定性来压制。
dreamer-v1 把「学隐动力学 → 想象里学 actor+value → 部署采数据」的三过程闭环固定下来,两个决定性设计延续至今:Vλ(λ-return,λ=0.95) 平衡 bias/variance 做 value 目标;actor 靠解析梯度穿过可微动力学最大化 Vλ。连续控制超参 H=15、γ=0.99、KL 用 3 free nats(同 PlaNet),且作者报告无需 target network、无需 overshooting。
1.2 KL balancing、free bits 与鲁棒化(V2 → V3)
dreamer-v2 的关键改动是离散隐 + straight-through(替代高斯 + 重参数化)和 KL balancing(用 stop-gradient + 不同 loss scale 让先验往后验靠、而非对称),并确立了 actor 梯度的分域选择:Atari 用纯 Reinforce(ρ=1,离散动作下 straight-through 偏差大),连续控制用纯动力学反传(ρ=0)。dreamer-v3 把「一套超参跨域」做成卖点,堆了一整套鲁棒化技术:世界模型损失拆成 βpred·Lpred + βdyn·Ldyn + βrep·Lrep(1/1/0.1),KL 用 balancing + free bits(低于 1 nat 就截断);critic 用 symexp-twohot 离散回归把梯度大小与目标大小解耦;actor 用 percentile return 归一化(第 5–95 百分位差、EMA 0.99,且只缩大回报、对小于 L=1 的不动)避免稀疏奖励下噪声压过熵正则;优化器换 AGC(0.3)+ LaProp。这套「free bits + 小表示损失权重 + symlog」组合,正是让固定超参跨 150+ 域可用的技术内核。
1.3 骨干换代:Transformer / SSM / 扩散化的世界模型
RSSM 之后,世界模型骨干经历了三轮替换,但 actor-critic 目标几乎原封不动照搬 DreamerV2/V3:
- Transformer:transdreamer(RSSM→Transformer,ELBO 不变,仅因显存把想象轨迹数降到 3)、iris(VQ tokenizer + GPT 式 Transformer G,自编码器用 L1+commitment+感知损失,行为学习直接沿用 DreamerV2 的 REINFORCE+baseline+熵 0.001)、storm(
L_rec+rew+con+0.5dyn+0.1rep,重建对编码器输出 z 而非序列输出,消融证明这点关键)、twm-transformer-world-model(把平衡 KL 重推导为平衡交叉熵,拆出 L_Obs/L_Dyn 便于独立调权,α1=5/α2=0.01/β1=10/β2=50,并用阈值化熵损失 Γ=0.1 跨不同动作数保持稳定探索)、delta-iris(上下文感知 Δ-token,imagined:collected=64)、rem-parallel-observation-prediction(RetNet + 并行观测预测 POP)、twister-contrastive-world-model(在 DreamerV3 上加 K=10 步 InfoNCE(AC-CPC),消融确认 K=10 最优)。 - SSM:recall-to-imagine-r2i 用 S5 并行扫描替代循环,关键工程是打断表征模型对 hₜ 的循环依赖(换成非循环 qθ(zₜ|oₜ))才能一次算完整段隐状态,避免想象阶段退化成 O((L+H)²);其余 λ-return/twohot/percentile 归一化全照搬 DreamerV3。骨干对比研究 s4wm-world-model-backbones 则专门比 RNN/Transformer/S4 的想象质量(S4WM lr 1e-3、TSSM-XL 恒定 1e-4、RSSM-TBTT 用截断反传 batch 32)。
- 扩散化:diamond 把世界模型换成 EDM 去噪(
L=‖Dθ(x_{t+1}^τ,·)−x_{t+1}^0‖²),核心依据是消融——DDPM 在 ≤10 去噪步时自回归会严重漂移出分布,EDM 即使 n=1 步也长时程稳定;部分可观测游戏(Boxing)多模态观测需 n=3 锁定模态,故全实验统一 n=3。
1.4 目标解耦、层级与真机
想象 RL 的另一条演化线是把「世界模型该学什么」显式解耦:harmonydream 用整流调和损失 log(1+σ) 自动平衡观测/奖励/动力学三项(未整流版会给小尺度奖励损失算出极端大系数 1/σ 而失稳);iso-dream 用逆动力学把可控/不可控视觉动态分离,逆动力学损失 α·ℓ2(at,ãt) 直接进世界模型总损失联合优化;director 是层级——manager 选离散 goal(goal autoencoder 重建误差当探索奖励,会随熟悉度自动衰减)、worker 用 max-cosine 相似度奖励,四组件并发更新。真机侧 daydreamer 的核心不是算法而是训练流程解耦:去掉 DreamerV2 的 train_every 超参,learner 线程与 actor 线程完全并行不做速率限制。而 mbpo 代表 Dyna 式的另一条路——不在想象里端到端学策略,而是用概率集成模型做短 k-步 rollout 扩充 SAC 的 replay(理论上 k-分支 rollout 把误差从随 horizon 二次方降为线性),simple-atari 则完全在世界模型 env′ 里用 PPO 训策略(15 次迭代、每轮 N=50 步 random starts 缓解复合误差、评测温度 T=0.5)。
表 1 · 想象力 RL:Dreamer 系目标与超参对比
| 工作 | 世界模型目标 | KL / 稳定化 | actor 梯度 | 折扣/λ/H | 关键超参 |
|---|---|---|---|---|---|
| planet | ELBO(重建+KL) | 3 free nats | 无(CEM 规划) | — | Adam lr 1e-3、grad clip 1000 |
| world-models-ha-schmidhuber | VAE(L2+KL)+MDN-RNN 似然 | 温度 τ 抗钻空子 | CMA-ES 进化 | — | 种群 64、每体 16 种子 |
| dreamer-v1 | ELBO | β=1 + 3 free nats | 动力学反传(连续) | γ0.99 λ0.95 H15 | WM lr 6e-4 / actor 8e-5 |
| dreamer-v2 | img+rew+disc + β·KL | KL balancing β0.1/1.0 | Reinforce(Atari)/动力学反传(连续) | λ0.95、target 每100步 | 13M→22M、每4步1更新 |
| dreamer-v3 | Lpred+Ldyn+Lrep(1/1/0.1) | balancing+free bits 1nat | Reinforce + percentile 归一化 | γ0.997 λ0.95 H15 | symlog/twohot、AGC0.3+LaProp lr4e-5 |
| iris | AE(L1+commit+感知)+G(CE) | — | REINFORCE+baseline+熵0.001 | γ0.995 λ0.95 H20 | lr1e-4、600 epoch |
| storm | rec+rew+con+0.5dyn+0.1rep | KL balance+free bits | DreamerV3 式 | γ0.985 λ0.95 | WM lr1e-4 / AC 3e-5、Transformer 2层 |
| twm-transformer-world-model | 平衡交叉熵(拆 Obs/Dyn) | α1=5,α2=0.01,β1=10,β2=50 | A2C + GAE | γ0.99 λ0.95 | 阈值熵 Γ0.1、critic lr1e-5 |
| diamond | EDM 去噪 L2 | n=3 去噪步防漂移 | REINFORCE+baseline+熵0.001 | γ0.985 λ0.95 H15 | AdamW lr1e-4、CS:GO 381M |
| recall-to-imagine-r2i | DreamerV3 ELBO | β 1/0.5/0.1 + free bits | REINFORCE/动力学反传 | γ0.997 λ0.95 H15 | SSM batch L=1024、parallel scan |
| twister-contrastive-world-model | + L_cpc InfoNCE K=10 | β_dyn0.5 β_reg0.1 free bits | Reinforce+熵 | γ0.997 λ0.95 H15 | WM lr1e-4 / AC 3e-5 |
| harmonydream | 整流调和损失 log(1+σ) | 三 harmonizer 联合反传 | 沿用基座 Dreamer | — | AMP(DMCR 用 fp32 防 nan) |
二、价值等价 + MCTS:MuZero 家族
2.1 目标函数与 reanalyze 正反馈
MuZero 系不重建观测,muzero 的损失对每个假想步 k=0…K 求和:l_r(reward) + l_v(value) + l_p(policy),其中 policy 目标 = MCTS 搜索访问分布的交叉熵(作者消融证明它比 Q-learning 的高偏差目标信号更强),value 目标 = n 步 bootstrap(棋类直接 bootstrap 到终局 = 预测胜负);损失形式棋类用平方误差、Atari 因奖励幅度多变改用交叉熵。两个工程细节被后续普遍继承:每 head loss 乘 1/K、动力学入口梯度乘 1/2(让施加到动力学的总梯度恒定)。其祖先 value-prediction-network 已经用 d-step 规划算 Qᵈ 选 option、异步 n-step Q-learning(n=10、16 线程)训练。
Reanalyze 是这一族的样本效率引擎:用最新参数重跑 MCTS 产生更优训练标签,标签质量随参数迭代不断变好形成正反馈。muzero-unplugged 把它推到纯离线(value 用 5-step TD + target network,DM Control 因数据集小改为直接回归搜索价值防过拟合),并有一个反直觉消融:数据多时(20M 帧、99.5% reanalyse)5-step TD 反优于 0-step TD(median 126.6% vs 115.3%),即便学习几乎全离策略。rezero-mcts 则从计算侧加速 reanalyze:backward-view 减少单次搜索的树遍历、entire-buffer 把 reanalyze 频率从「每 mini-batch 一次」降到「每隔固定迭代对整 buffer 一次」,且 collect 阶段完全跳过 MCTS 直接采策略网络输出。
2.2 EfficientZero 三件套与连续/随机扩展
efficientzero 建在 MuZero Reanalyze 上,三件套里自监督一致性最关键(去掉后 Normed Mean 从 1.943 跌到 0.881):同步展开 5 步逐步拉近预测隐状态与真实观测表征;value prefix 把 UCT 里的奖励求和整体交给 LSTM 端到端预测、绕开「精确预测哪步丢分」的病态子问题;基于模型的 off-policy 校正用动态时域 l(轨迹越旧 l 越小)减少策略发散。efficientzero-v2 进一步用基于搜索的价值估计 SVE(N 次模拟 bootstrap 取经验均值,误差上界随模型误差 ε→0 收敛到 0)替换自适应步长 TD,用采样式 Gumbel search 替换 MCTS,并在早期训练(模型误差大)退回多步 TD 的混合价值目标。
搜索机制的三个正交扩展:sampled-muzero 用采样动作先验 π̂β 处理大/连续动作空间(消融显示 π̂β 显著比直接用 π 稳健,humanoid.run 上 K=3 已够、K>10 不再提升);gumbel-muzero 用 Gumbel-Top-k + Sequential Halving 在小模拟数下保证策略提升(Atari n≤18 时 Sequential Halving 根本不触发,证明是「planning with Gumbel」本身而非 halving 起效),并把策略目标换成 completed-Q 的 KL(π’,π);stochastic-muzero 加 L_chance 项建模环境随机性(Backgammon 学到 non-negligible 概率的 chance code 数恰好=21,对应两骰子全部组合)。统一基准 lightzero 把这些算法收进一套代码(默认 sim 50、lr 3e-3、reanalyze 0),并做了两个 case study:探索机制对比(RND 用原始观测而非漂移的隐状态)、一致性损失对不同观测类型的收益(图像最关键、向量增益小、棋盘二值图余弦相似度始终偏低)。vq-models-planning 则把 VQ 离散 latent code 的预测加进 MuZero 损失,MCTS 扩展为动作节点/随机节点交替。
2.3 连续控制的 TD-MPC 路线
td-mpc/td-mpc2 是价值等价思想在连续控制上的变体:不用 MCTS 而用 MPPI 规划,联合目标 = 隐一致性损失(joint-embedding prediction,stop-grad EMA 目标)+ 奖励 CE + 值 CE(TD-target 用 Q 的 EMA),梯度沿时间反传全部 H 步减轻复合误差。TD-MPC2 把奖励/值用 soft cross-entropy 在 log 空间做离散回归,策略用最大熵 RL(α 用 5%/95% 百分位统计自动调),全任务统一超参(UTD=1、λ=0.5、H=3),并证明「大规模多任务离线预训练 → 单任务在线微调」可不加保守正则无缝衔接。pwm-multitask-world-models 在其上做「预训练多任务世界模型 + 逐任务 <10 分钟抽取专家策略」,actor 用 FoG 一阶反传(而非 TD-MPC2 的 DDPG-Q 梯度),并给出反直觉命题:世界模型正则越强、拟合误差越大,但策略奖励反而越高(弱正则模型让策略前期学得快但收敛到更差次优解)。
表 2 · 价值等价 + 搜索:MuZero 系对比
| 工作 | value 目标 | policy 目标 | 搜索 / 规划 | reanalyze | 关键超参 |
|---|---|---|---|---|---|
| muzero | n-step(Atari n10 / 棋类终局) | MCTS 访问分布 CE | MCTS,K=5 unroll | 80% updates | bs 2048/1024、γ0.997、1M batch |
| muzero-unplugged | 5-step TD(Atari) | MCTS πₜ | Reanalyse(纯离线) | 99.5% fraction | bs1024、lr1e-4 cosine 1M |
| efficientzero | value prefix + off-policy 校正 | MCTS | N_sim=50、mean-Q 初值 | 0.99 | discount0.9974、120K步(前100K采) |
| efficientzero-v2 | SVE(N 模拟均值)+ 混合 TD | CE + 简单策略损失 | Gumbel search | reanalyze | λ1234=1/1/0.25/2、熵5e-3 |
| sampled-muzero | n-step(围棋 n25) | 采样先验 π̂β | K=20 采样、sim50 | — | bs1024、lr1e-4 cosine 1M |
| gumbel-muzero | n-step | completed-Q 的 KL(π’,π) | Gumbel-Top-k + Seq-Halving | — | c_visit50、c_scale1.0/0.1 |
| stochastic-muzero | L_MuZero + L_chance | MCTS 访问分布 | chance-node MCTS | — | Adam lr3e-4、bs1024 |
| unizero | n-step TD CE(101 bin) | MCTS 改进 CE | Transformer-latent MCTS sim50 | buffer reanalyze | H10、lr1e-4、β_z=10 |
| rezero-mcts | MuZero loss | MCTS π | backward + entire-buffer | freq=1 | lr3e-3、bs256、sim50 |
| td-mpc | FQI value CE(EMA target) | maxQ(DDPG 式) | MPPI | — | c1/c2/c3=0.5/0.1/2、λ0.5 |
| td-mpc2 | TD-target CE(log 空间) | 最大熵 maxQ | MPPI H=3 | — | UTD1、bs256、lr3e-4、λ0.5 |
| pwm-multitask-world-models | TD(λ) critic | FoG 一阶反传 actor | 无(直接抽策略) | — | H16 λ0.95、10k 步/任务 |
值得注意的还有 vq-models-planning(VQ latent code CE + MuZero 四项损失)、unizero 的联合优化(next-latent 预测 β_z=10 + reward/policy/value CE,训练后清 KV Cache 因参数已更新)。
三、扩散 / 流匹配视频世界模型
这是自驾、游戏、机器人三大生成式世界模型共享的主干。目标函数经历了 ε-prediction(DDPM)→ v-prediction → rectified flow / flow-matching 的迁移,训练侧的三个关键机制是:条件 dropout 支撑的 classifier-free guidance、多阶段流水线(图像→短视频→长视频/多视角)、以及 diffusion-forcing 逐帧噪声级别。
3.1 目标参数化的三代迁移
- ε-prediction(DDPM L2) 是 SD 时代的默认:drivedreamer、drivingdiffusion、magicdrive、panacea-driving-video、wovogen、drive-wm-driving-into-the-future(denoising score matching)、genad-generalized-predictive-model(SDXL 2.7B 全参微调迁到驾驶域)、irasim、unisim(级联 base + 2 超分)、avdc-actionless-videos(纯 actionless 视频模仿)、avid(只对 adapter 反传、预训练模型仅推理拿 ε_pre)、tesseract-4d-world-model(RGB-Depth-Normal 三模态联合 ε)。
- v-prediction 在游戏/交互场景更稳:gamengen(解冻全 U-Net、context 帧 0.1 dropout)、decart-oasis、playable-game-generation、enerverse。
- rectified flow / flow-matching 成为 2024–2025 新基座的共识:magicdrivedit(CFM,
z_t=t·z1+(1-t)ε,t~lognorm)、gaia-2-wayve(v=x−ε,双峰 logit-normal 采样 τ:主峰 μ0.5σ1.4 学中低噪 + 次峰 μ-3σ1 聚焦近纯噪学空间结构)、epona-autoregressive-diffusion(视觉与轨迹统一 rectified flow)、cosmos-predict2-5-world-simulation(logit-normal,shift β 随分辨率从 1 增到 5,强制 5% 样本取最高 2% 噪声区消除帧间突变)、gaussiandwm、tencent-hunyuan-gamecraft、skywork-matrix-game、yume、hunyuanworld-voyager、multiworld-multiagent、gigaworld-1(L_FM=‖u_t−u_θ‖²)。
3.2 classifier-free guidance 与条件 dropout:一张参数表
CFG 是可控生成的通用杠杆,训练时按概率 drop 各类条件、推理时放大。这里的分歧在丢什么、丢多少、如何按 token/frame 调度:
表 3 · 扩散/流世界模型的 CFG 与条件 dropout
| 工作 | 目标参数化 | 条件 drop(训练) | CFG(推理) | 特殊调度 |
|---|---|---|---|---|
| gaia-1-wayve | AR token + 视频扩散 decoder | 无/action/text=20/40/40% | text CFG | 按 token + 按 frame(cosine)双调度、top-k50 |
| drive-wm-driving-into-the-future | ε(DSM) | 每条件独立 20% | 5.0 | DDIM 50 步、η=1.0 |
| magicdrive | ε | 场景级 γ0.2、框/图保留 | 1.5→4.0 消融 | 无条件地图设全 0 提升 Road mIoU |
| vista-driving-world-model | ε+L_dyn+L_struct | 动作 15% dropout | 三角 CFG(1.0→2.5) | 沿帧轴分配 guidance 缓解漂移 |
| magicdrivedit | rectified flow CFM | 15% | 2.0(30 步) | 路网图用全 0 null 条件 |
| gaia-2-wayve | flow(v=x−ε) | 每条件 80% / 全体 10% / 相机 10% | 默认关,OOD 才开 2–20 | 空间选择性 CFG(只在 bbox 位置) |
| gamengen | v-prediction | context 帧 0.1 | 1.5(仅过去观测) | 动作条件不用 CFG |
| worlddreamer | masked-token CE | 多模态 embed 10% | β guidance | cosine mask、约 10 步并行解码 |
| cosmos-drive-dreams | 复用 Cosmos 扩散 | — | — | Qwen 改写 prompt 只改天气/时段 |
3.3 多阶段流水线:从图像迁移到多视角长视频
自驾世界模型几乎都是「先学单帧结构条件、再叠时序、再扩多视角/长视频」的分阶段冻结式训练,理由是可控生成模型会先学画质、再学可控性(magicdrivedit 与 MagicDrive 系一致观察),且模型对提分辨率的适应快于对拉长视频。典型两/三/四阶段:drivedreamer(image 40ep → video 加时序注意力 10ep → prediction 10ep)、drivingdiffusion(跨视角 50k → 时序 40k → 长视频 10k)、panacea-driving-video(单帧多视角 → 叠时序,用真值首帧条件避免依赖自身生成)、wovogen(世界体 AE 30k → 世界体扩散 50k → 单帧多相机 50k → 时序微调 3.5k)、genad-generalized-predictive-model(SDXL 图像域迁移 300k → 冻结只训时序 block 112.5k)、worldsplat(4D 感知扩散四阶段,IDDPM→Rectified Flow 中途切换)。通用 WFM 则是「通用预训练 → 域后训练 → 条件模型微调」:cosmos-drive-dreams(Cosmos-7B 驾驶后训 batch64/140k/lr1.5e-5,再冻基座训 ControlNet 分支)、nvidia-cosmos-transfer1(分模态独立训 control branch)。
3.4 diffusion-forcing:把自回归与扩散缝合
diffusion-forcing 是这一支近年最重要的训练机制创新:训练时对序列每个 token 独立采样噪声级别 k_{1:T}~[K]^T,最小化逐 token 噪声预测损失。理论上它优化的是所有噪声级别序列似然下界的一个 reweighting;特例 k_t∈{0,K} 可掩掉任意历史 token,从而一个模型既是 policy(缩短前瞻窗 H 降延迟)又是 planner(拉长 H + 引导做长时程规划),无需改架构或重训。它直接催生了一批「无限时长 + 逐帧因果」的世界模型:decart-oasis(per-token 噪声 + sigmoid schedule)、history-guided-video-diffusion(DFoT,把 History Guidance 拆成 vanilla/temporal/fractional 三形式:HG-t 在长上下文 Minecraft 把 FVD 从 97.63 降到 79.19,HG-f 用部分加噪历史解决高 guidance 下静止画面失效模式;并证明把 Full-Sequence 模型微调成 DFoT 只需从头训练的 12.5% 成本)、worldmem(Oasis/DFoT 基座 + 记忆模块,已生成帧标记 k=0.02 防误差累积)、decart-mirage/decart-mirage-lsd(history augmentation:训练时用「模型可能产生的伪影」腐化历史帧、推理时显式告知历史不可信)。同源的抗漂移训练技巧还有 epona-autoregressive-diffusion 的 chain-of-forward(每 10 步用模型自预测帧连做 3 次前向、一步估计去噪结果接回)、skywork-matrix-game 的 p=0.2 历史帧加噪 + 运动帧 CFG。
表 4 · 生成式视频世界模型的目标与多阶段(补充)
| 工作 | 目标 | 阶段/流水线 | diffusion forcing | 关键超参 |
|---|---|---|---|---|
| gaia-1-wayve | AR token + 视频扩散 decoder | tokenizer/WM/decoder 分训 | — | WM 6.5B、64×A100、100k、seq 15860 |
| vista-driving-world-model | ε + L_dyn + L_struct | 高保真 20K → LoRA 动作可控 | — | 128×A100、576×1024、lr1e-5 |
| genad-generalized-predictive-model | ε | 图像迁移 300k → 时序 112.5k | — | 冻图像 block 只训 2.5B 时序 |
| diffusion-forcing | 逐帧 ε | — | ✓ 核心 | K=1000、采样 100/50 DDIM |
| history-guided-video-diffusion | 逐帧 ε(式 4) | FS→DFoT 微调 12.5% | ✓ + HG-v/t/f | Kinetics bs192 lr2e-4 640k |
| cosmos-predict2-5-world-simulation | flow(logit-normal) | T2I→V2W→480p→720p→T2W | — | lr3e-5(2B)、rCM 蒸馏 4 步、GRPO RL |
| gaia-2-wayve | flow(双峰 logit-normal) | tokenizer 300k + WM 460k | — | 256×H100、48 帧、5 相机 12600 token |
| tesseract-4d-world-model | ε(RGB-D-Normal 联合) | video → 关键帧规划微调 | — | 40k、lr1e-4、DDPM 50 步、CFG7.5 |
| worldmem | 逐帧 ε | Oasis/DFoT 基座 + 记忆模块 | ✓ | Minecraft 200K/8GPU、tr=0.9 |
游戏与开放世界还有一批把 RL 智能体与生成模型分两阶段的工作:gamengen(PPO 智能体 10M 步 → 生成扩散 700K 步,DOOM 特定奖励是唯一游戏专属部分)、gamefactory(LoRA 拟合游戏风格 → 冻结只训动作控制模块 → 推理移除 LoRA 泛化到开放域)、gamegen-x(基础模型预训练 → 冻结只训 InstructNet 指令分支)、playable-video-generation(纯重建自监督 + 互信息动作损失自己「发现」离散动作集,不需预指定动作数)、game-gan(三判别器 GAN + cycle loss 逼模型把静态元素塞进记忆向量涌现长期一致性)。
四、next-token 自回归与 masked-token
把观测 tokenize 成离散序列后,世界模型就退化为一个 GPT。这一支的共性是两阶段:先训 VQ/离散 tokenizer(重建 + commitment + 感知/GAN 损失),冻结后再训 AR Transformer 做 next-token 交叉熵,训练用 teacher forcing、且普遍只对未来帧 token 计损。
- 视觉 AR:iris(VQ + GPT,虽归想象 RL 但骨干是 AR)、ivideogpt(无动作视频预训练 → 领域微调,只对未来帧 token 计损,且下游只需微调 tokenizer、冻结 Transformer 即可迁移新机器人)、larp(tokenizer 联合 AR 先验端到端优化,消融证明去掉 AR 先验后重建最好但生成质量骤降——直接印证「重建目标≠生成友好隐空间」)、videoworld(LDM 潜编码 + next-token,消融显示不用 LDM 的纯视频基线大幅落后;码本 64000 最优、过大 262144 不收敛)、mineworld(图像+动作交错 flat token、并行解码专用微调缩训练/推理 gap)、omnitokenizer(图像单模态 500k → 图像-视频联合 500k → KL 微调,「先图后视频」显著优于任何单阶段)。
- 自驾 AR:doe-1(观测/描述/动作统一 next-token,动作 token 权重 ×5、z-loss 1e-5 稳大词表 softmax)、drivingworld-gpt(next-state + next-token 混合,帧级和内部状态级都 teacher-forcing)、occworld(VQ tokenizer + 时序自回归,ego token 隐式做 action-conditioning)。
- masked-token(MaskGIT/Muse 族):worlddreamer(非自回归并行 mask-token 预测,约 10 步解码,声称比扩散快 3×、比 AR 快 20×)、copilot4d-waabi(把 MaskGIT 升级成 absorbing-uniform 离散扩散:非 mask 位置加至多 η=20% 均匀噪声、可迭代重采样修正已解码 token,世界模型混合训练目标 50/40/10% 切换 future/joint/独立去噪)。
- 超长上下文 / 语言融合:lwm-large-world-model(渐进式上下文扩展 32K→1M,RoPE θ 同步放大到 50M,Masked Sequence Packing 让打包等价于 padding 训练)、pandora(复用 Chat-UniVi + DynamiCrafter,只训 Q-Former 适配器做表示对齐 + 扩散损失微调)、dynalang(语言纳入动作空间,文本预训练时图像/动作清零只优化 Lpred+Ll)。
- 大规模 agent 化:microsoft-wham-muse(VQGAN + Transformer next-token,1.6B 因图像 token 多稀释了动作 loss、把动作 loss ×10 才追平多样性;做了 15M→206M scaling law 外推、发现 FVD 与训练 loss 相关 r=0.77)、1x-world-model(Temporally Teacher-forced CE,词表 2^18 分解为两个 2^9 类预测)。
表 5 · next-token / masked-token 世界模型
| 工作 | tokenizer | AR 目标 | 计损范围 | 关键超参 |
|---|---|---|---|---|
| ivideogpt | VQGAN 1M 步 | next-token CE | 仅未来帧 | Transformer 7e5 步 bs64 lr1e-4 bf16 |
| videoworld | VQ + LDM 潜编码 | 潜编码+下一帧联合 CE | — | AR 1M 步 bs256、码本 64000 |
| doe-1 | Lumina-mGPT 7B | 统一 next-token | 动作 token ×5 | 16 epoch、lr1e-5、z-loss1e-5 |
| drivingworld-gpt | VQ(2×500k) | next-state + next-token | 帧级+状态级 TF | 450k、bs64、lr1e-4 |
| worlddreamer | STPT | masked-token CE | 被 mask token | 2M 步 bs64 lr5e-5、~10 步解码 |
| copilot4d-waabi | VQ + render loss | absorbing-uniform 离散扩散 | 全 token | WM lr1e-3 bs8 cosine0.75M |
| microsoft-wham-muse | VQGAN | next-token CE | 交错图像+动作 | 1.6B:bs2.5M token、200k 步、~1e22 FLOPs |
| lwm-large-world-model | — | LM + VL next-token | 加权语言/视觉 | 渐进 32K→1M、RoPE θ 50M、v4-512/1024 |
五、JEPA 回归:非生成式表征预测
LeCun 蓝图 lecun-path-autonomous-machine-intelligence 给出了这一支的理论框架:训练世界模型 = 自监督 pattern completion,用能量模型统一,核心是如何不坍缩。它把对比法(负样本随维度指数增长、维度诅咒)判为死路,力主正则化/非对比法——训 JEPA 的四条准则是最大化 s_x/s_y 信息量、让 s_y 易从 s_x 预测、最小化 latent z 信息量;VICReg 用 Variance+Covariance 两项做「对分量做对比」(dimension-contrastive)替代「对样本向量做对比」。落地后 JEPA 的目标高度统一:隐空间 L1/L2 回归 + EMA target encoder + 无负样本无重建,防坍缩靠编码器/EMA 的非对称设计。
- 图像/视频:i-jepa(latent 平均 L2,EMA 0.996→1.0,wd 0.04→0.4,bs2048)、v-jepa(特征预测,bs3072、90k 步、schedule 按 112.5k 步算但只训 90k——发现默认调度最后 25% 更新过猛)、v-jepa-2(三段式 warmup-constant-decay,cooldown 段才升帧数/分辨率,渐进分辨率省 8.4× GPU 时;-AC 后训练用 teacher-forcing + 两步 rollout L1 损失、编码器冻结)、iwm-learning-leveraging-world-models(把 predictor 接冻结 teacher 后做下游 predictor 微调,是核心贡献)、intuitive-physics-vjepa(完整沿用 V-JEPA 配方只换 RoPE,证明直觉物理从自监督预训练涌现)。
- 跨模态:a-jepa(音频,掩码课程在随机 block 与时频感知掩码间退火)、mc-jepa(光流+内容多任务,VICReg 每层都加、+1 epoch VC-only warmup)、stem-jepa-music、jepa-speech-tokenizer-daam(两阶段:JEPA 自监督 → 微调 + FSQ + HiFi-GAN,表征学习与重建分开优化)、brain-jepa(脑动力学,梯度定位 + 时空掩码,消融显示 JEPA 框架本身而非仅位置编码带来提升)、point-jepa(点云 Smooth L1)、s-jepa-eeg、t-jepa-tabular。
- 世界模型/规划:dino-wm(在预训练 DINO 特征上做潜一致性 L2、无像素重建,zero-shot CEM 规划,实测 CEM 优于梯度下降)、pldm-planning-latent-dynamics(JEPA 预训练 + 测试时 MPPI 免训练规划,消融证明「预测式 SSL 优于重建式」:把 VICReg 换成像素重建,Two-Rooms 成功率从 97.4 掉到 26.2;换适配版 TD-MPC2 直接坍缩到 0.0)。
- LLM/推理侧再利用:jepa-reasoner(预训练 next-token → SST 用 EMA target + scaled cosine 在隐空间做推理,可并行、不像 COCONUT 需多趟同步前向)、llm-jepa(NTP + JEPA 联合,cosine + Text→Code + 后置 [PRED] 最优,Loss Dropout 加速)、jepa-t-text-to-image(Masked Prediction + Conditional Flow Matching 双目标)、jepa-vla(表征探针 + VLA,video predictive embedding 对 VLA 有必要性)。
- 理论收敛:lejepa 把 JEPA 简化到极致——
L = λ·SIGReg + (1-λ)·L_inv,唯一权衡超参 λ=0.05,无多阶段/无 RL/无蒸馏/无 scheduler/无 register token,删掉 predictor 与 teacher-student 也不坍缩;when-does-lejepa-learn-world-model 进一步解析刻画其最优解是正交旋转(先证明再用训练验证,而非训练发现定理)。
表 6 · JEPA 家族:目标与防坍缩
| 工作 | 目标 | 防坍缩 | EMA target | 优化 | 用途 |
|---|---|---|---|---|---|
| i-jepa | latent 平均 L2 | EMA 非对称 | 0.996→1.0 | AdamW bs2048 lr1e-3 | 图像表征 |
| v-jepa | 特征预测 L1/L2 | EMA | 0.998→1.0 | bs3072、90k 步 | 视频表征 |
| v-jepa-2 | 特征预测 + AC teacher-forcing | EMA | 0.99925(固定) | bs3072、252k、渐进分辨率 | 理解+规划 |
| mc-jepa | L1 + VICReg | VC 每层 + warmup | — | ConvNeXt-T、bs384 | 光流+内容 |
| dino-wm | latent L2(无重建) | EMA | — | predictor lr5e-5 | zero-shot CEM 规划 |
| pldm-planning-latent-dynamics | L_JEPA 五项 + VICReg | ensemble + VICReg | — | Adam + cosine | MPPI 规划 |
| iwm-learning-leveraging-world-models | latent L2 | EMA 非对称 | — | lr1e-3、wd0.04→0.4 | 表征 + predictor 微调 |
| lejepa | L_inv + SIGReg | SIGReg 分布正则 | 无 teacher | AdamW λ0.05、bf16 | 通用 SSL |
| jepa-reasoner | scaled cosine(k=4) | EMA | ✓ | SST 1.3 万步 | 隐空间推理 |
六、蒸馏与实时化
2024 年后所有生成式世界模型都撞上同一堵墙:扩散/flow 采样几十步 → 无法交互。共同解法是把多步教师蒸馏成少步因果学生,谱系大致是 consistency model → shortcut → self-forcing / DMD,且蒸馏几乎都伴随「双向教师 → 因果学生」的结构转换与「自身分布采样历史帧」抗漂移。
- 早期少步:gamengen 用类 DMD 的 3-U-Net(generator/teacher/fake-score)单步蒸馏跑到 50 FPS,但主方法仍用不蒸馏的 4 步版;playable-game-generation 4 步 DDIM 达 20 FPS;deepmind-genie2 明确区分「未蒸馏高质量基座 vs 可实时蒸馏版(质量下降)」。
- consistency / shortcut:the-matrix 用 one-stage guided distillation 把 CFG 纳入 student(Euler ODE 单步 25/1000、10k 步);decart-mirage-lsd/decart-mirage 用 shortcut distillation(Frans et al.)+ architecture-aware pruning 做零延迟直播;cosmos-predict2-5-world-simulation 用 rCM(连续时间一致性 + 分布匹配混合)蒸到 4 步、质量与 teacher 相近。
- self-forcing / DMD 主流化:skywork-matrix-game-2 两阶段——ODE 轨迹初始化因果学生(40k ODE pairs、6k 步)→ DMD self-forcing(生成器从自身分布而非 GT 采样历史帧缓解 gap,4k 步)→ 4 步降 3 步;skywork-matrix-game-3 冷启动(单段 GT 历史 600 步)→ 多段自生成推理(段数 1–6 均匀采样,DMD 反向 KL,2400 步);tencent-hunyuan-gamecraft 用 PCM 8 步 + CFG 蒸馏达 <5s→6.6 FPS;playerone 用 CausVid 非对称蒸馏(双向 teacher 监督因果 student);nvidia-omnidreams self-forcing K=2 步、KV cache 梯度 detach + rolling cache 把复杂度从 O(TL²) 降到 O(TL)、progressive teacher 减 rolling-cache 漂移;moworld-flash-world-model、alibaba-rynnworld-teleop(因果 FM 预热 → DMD、跨 chunk 反传穿持久 KV cache)、dreamx-world-1、gigaworld-1(ODE warm-start + DMD2:分布匹配 + score 一致 + 对抗,20→4-6 步)、tencent-yan、yume(对抗蒸馏 50→14 步)都属此族。
表 7 · 蒸馏与实时化谱系
| 工作 | 教师/基座 | 蒸馏方法 | 步数 | 帧率/延迟 |
|---|---|---|---|---|
| gamengen | 自身 4 步 | DMD 式 3-U-Net | 4→1 步 | 50 FPS(主用 4 步) |
| the-matrix | stage3 ckpt | consistency(guided) | 单步 25/1000 | 实时 SCM |
| decart-mirage-lsd | 大教师 | shortcut + 剪枝 | — | 零延迟直播 |
| cosmos-predict2-5-world-simulation | 预训练 teacher | rCM(一致性+DMD) | 4 步 | 高保真 |
| tencent-hunyuan-gamecraft | 扩散+CFG | PCM + CFG 蒸馏 | 8 步 | <5s → 6.6 FPS |
| skywork-matrix-game-2 | 教师 | ODE-init + DMD self-forcing | 4→3 步 | 实时 streaming |
| skywork-matrix-game-3 | 记忆增强基座 | 冷启动 + 多段 DMD | 少步 | streaming(记忆池检索) |
| playerone | 双向 teacher | CausVid 非对称 | — | 实时 |
| nvidia-omnidreams | bidirectional teacher | self-forcing DMD | K=2 步 | 实时(rolling KV cache) |
| gigaworld-1 | teacher | ODE + DMD2 | 20→4-6 步 | — |
| yume | teacher | 对抗蒸馏 | 50→14 步 | — |
七、RL 后训练回到视频/世界模型
蒸馏解决了速度,但视频世界模型的「物理一致性 / 指令跟随」需要奖励信号,于是 RL 从 LLM 迁回了世界模型。三条落地路径:(1) VLM 奖励 + GRPO:cosmos-predict2-5-world-simulation 把「条件=状态、去噪轨迹=动作」纳入 RL,用 VideoAlign VLM 奖励做 GRPO 式组内归一化 advantage(每条件 8 输出 × 20 步、训 256 步)、并用 diffusion loss 正则缓解 reward hacking;nvidia-cosmos-reason1 用 GRPO + 规则奖励(准确率 + 格式)做 Physical AI RL(自研全异步容错框架比 colocated 提效 ~160%)。(2) 奖励梯度对齐 / 可微奖励:worldmodelbench 沿 VADER 把微调判官当可微奖励、优化「No−Yes」softmax 概率差;vista-driving-world-model 用模型自身预测不确定性(条件方差) 当免真值动作的奖励。(3) DiffusionNFT 几何奖励:abot-3dworld-0 的 3DRL 用 RAFT 光流循环一致性 + LPIPS 保真度双奖励、dreamx-world-1 用相机控制 + 视觉质量双奖励模型融合 + KL 正则、driveworld-vla 用想象-真实一致性奖励反过来重加权动作模仿损失。具身智能体侧则是完整的「SFT → 在线 RLVR → 自改进」三段式:deepmind-sima2(Gemini 同时当 Task Setter + Universal Reward Model,混入非 gameplay 数据防灾难性遗忘,动作微调只带来温和回退而非「摧毁对话能力」),sima-scalable-instructable-multiworld-agent 则是纯行为克隆 + 「目标是否完成」辅助分类头。
值得注意的还有一批评测/基准本身不训练模型,只规定评测协议或训练一个 LoRA 判官:physion/physion-plus-plus(三训练协议 × 三读出协议)、vbench/vbench-2.0(VLM 判官 LoRA 微调)、videophy/videophy-2(VideoCon LoRA r=32)、worldsimbench/worldscore-benchmark/phygenbench/phyworldbench/physics-iq/physbench/impossible-videos/cam4docc-benchmark,以及综述 understanding-world-or-predicting-future-survey/survey-world-models-autonomous-driving/world-action-models-survey/mbrl-survey-moerland 把训练方法整理为既有范式分类。3D 场景生成类 wonderjourney/wonderworld/hunyuanworld-1 则大多训练无关,「训练」仅发生在推理时的场景级深度对齐/逐层优化。
空白与趋势
- 目标函数在收敛:控制侧(Dreamer / MuZero / TD-MPC)的「隐空间一致性 + 值/奖励离散回归」与生成侧的「flow-matching + diffusion-forcing」正在互相靠拢——unizero/pwm-multitask-world-models 用 joint-embedding 一致性(本是 JEPA/TD-MPC 的做法)做世界模型损失,gaia-2-wayve/cosmos-predict2-5-world-simulation 用 flow-matching 统一自驾与通用生成。JEPA 的「非重建 latent 回归」正被 pldm-planning-latent-dynamics/dino-wm 证明在规划上优于重建式。
- 抗自回归漂移是通用主线:从 world-models-ha-schmidhuber 的温度正则,到 diffusion-forcing 的逐帧噪声、epona-autoregressive-diffusion 的 chain-of-forward、decart-mirage 的 history augmentation、self-forcing 的「自身分布采样历史帧」,「训练时就见到自己会犯的错」已成共识。
- 蒸馏 + RL 后训练成为新标配末端:2025 年的新基座(Cosmos、Matrix-Game 3.0、GigaWorld、OmniDreams、DreamX)无一例外是「大教师预训练 → 少步因果蒸馏 → 奖励后训练」三连,DMD / DiffusionNFT / GRPO 把 LLM 的对齐工具搬进了世界模型。
- 一手训练配方披露度两极分化:学术论文(Dreamer 系、MuZero 系、JEPA 系、Cosmos、GAIA-2)给出完整目标+超参+消融;而产品级世界模型(genie-3、world-labs-marble(Marble)、luma-ray2/luma-ray3-world-models、decart-oasis、odyssey-explorer、genesis-generative-physics、alayaworld)普遍只给定性工程难点、训练目标/流水线/超参「未披露」。跨这道鸿沟做方法复现,是本 scope 后续深挖的最大缺口。
- RL 让世界模型「自己产生策略」仍未闭环:1x-world-model、muzero 之外,大多数生成式世界模型仍停在「学动力学 + 外置逆动力学/策略」,把「用学到的世界模型做 policy improvement」列为未来方向;deepmind-sima2 在 genie-3 里跨生成环境泛化是首个实例,但还远未成为范式。