世界模型架构演进

世界模型(world model)的骨干,本质是在回答同一个问题:“给定历史观测与动作,如何预测下一个状态?” 但七年来这个”状态”从 30 维对角高斯,膨胀到 4096 维连续 token、再到整段视频 latent;“预测”从单步 GRU 递推,走到 token 级自回归、整序列扩散、纯表征空间 L2 回归。这条主线可粗分为五代骨干,且它们并非替代而是层叠共存:

  1. RSSM 隐动力学——确定性 GRU + 随机隐变量,在紧凑 latent 里想象、纯 latent 规划(planetdreamer-v3);
  2. 价值等价隐模型——隐状态无重建语义、只服务 MCTS 的 latent 树搜索(muzerounizero);
  3. Transformer / 自回归 token 世界模型——把帧切成离散 token、用 GPT 式因果注意力建模动力学(irismicrosoft-wham-muse);
  4. 扩散 / 流匹配视频世界模型——直接在像素或 VAE latent 上做去噪,画质与物理细节跃升(gamengengenie-3);
  5. JEPA 预测嵌入——非生成、在表征空间预测被遮区域,主动丢弃不可预测细节(i-jepav-jepa-2);

外加一条正在收口的统一 MoT / VLA-世界模型支线,把感知-世界模型-动作压进同一条自回归 token 流(doe-1mbzuai-pan-world-modelnvidia-cosmos-policy)。三个横切维度贯穿始终:tokenizer(VQ / FSQ / 连续因果视频 latent)、动作条件注入机制长时程记忆与一致性。本页沿这条骨干主线纵向梳理,抠具体架构数字。


一、RSSM 隐动力学:确定性 + 随机的双通道

范式源头是 world-models-ha-schmidhuber(2018)的 V+M+C 三件套:卷积 VAE(CarRacing latent 32 维 / Doom 64 维,VAE 约 4.3M 参数)压视觉、MDN-RNN(LSTM 256/512 单元 + 5 个高斯混合分量)建时序、单层线性 Controller(仅 867/1088 参数,正好落在 CMA-ES 可优化的规模)决策——三者分阶段训练。

planet 把它凝练成 RSSM(Recurrent State-Space Model) 的标准形态:把 latent 拆成确定性 h_t(GRU 200 units)+ 随机 s_t(30 维对角高斯),两条通道缺一不可(消融证明纯 RNN 无法表达多模态未来、纯 SSM 难跨步记忆)。所有观测信息必须经 s_t 采样步,避免确定性捷径。规划用 CEM(horizon 12、1000 候选 ×10 迭代 = 每步评 1 万条想象序列),全程在 latent 前推、不生成图像。

dreamer-v1 在 RSSM 上加了本代真正的贡献——在想象轨迹上学 actor-critic:连续动作用 tanh-Gaussian 重参数化让梯度穿过采样步、离散动作用 straight-through,想象窗 H=15。dreamer-v2 的两个关键创新定义了后续所有离散 RSSM:分类隐状态(32 个变量 × 32 类 → 1024 维稀疏二值向量,直觉是”分类混合仍是分类,能完美拟合聚合后验的多模态”)+ KL balancing(先验 α=0.8、后验 0.2,把先验学准而非撑大后验熵)。dreamer-v3 把它工程化为跨域通吃:6 部件、GRU 用 block-diagonal 8 块循环权重(单元数变大而 FLOPs 不平方增长)、symlog + twohot 离散回归贯穿全网、unimix(1% 均匀 + 99% 网络输出)杜绝确定性分布,6 档规模 12M→400M 全部超参固定。

这条线在具身、记忆、多模态上各生一支:daydreamer 把 actor/learner 异步解耦上真机(去掉 train_every 超参);director 加 goal autoencoder(8×8 离散码)做分层规划;iso-dream 三分支解耦可控/不可控动态;dynalang 逐 token 逐帧对齐语言(最简架构反超 6 种 T5 方案);harmonydream 用可学习标量自动调和观测/奖励/KL 三损失尺度。骨干替换实验同样活跃:transdreamer 用 Transformer(TSSM)换 GRU、s4wm-world-model-backbones 用 S4/S5 结构化 SSM、recall-to-imagine-r2i 用 S3M 并行扫描,都证明”RSSM 的生成式框架可换任意可并行序列骨干”。连续控制侧 td-mpctd-mpc2 走另一条极简路线——纯 MLP 隐动力学、无重建、SimNorm 隐归一化(L 个单纯形各做 softmax,VQ 的软松弛版),317M 档在 80 任务上验证 scaling;pwm-multitask-world-models 复用其骨干、只改奖励头为可微版本以支持一阶策略梯度。

表 1 · RSSM 家族关键配置

工作骨干隐状态类型确定性/隐单元想象 H规模
world-models-ha-schmidhuberVAE+MDN-RNN高斯 32/64 维LSTM 256/512VAE~4.3M / C 867
planetRSSM高斯 30 维GRU 20012(CEM)全 MLP 200 宽
dreamer-v2RSSM 离散32×32 分类GRU 60015WM 20M + AC 2M
dreamer-v3RSSM 离散d/16 codesGRU 8-block1512M–400M(6 档)
daydreamerRSSM(复用 V2)32×32 分类RSSM 51215MLP 4×512
td-mpc2MLP 隐动力学SimNorm 单纯形latent 512H=3 rollout1M–317M(5 档)
recall-to-imagine-r2iS3M(对角 SSM)32×32 分类h 512、SSM 3–5 层15Small/Medium
s4wm-world-model-backbonesS4 blocks32×32 分类d_model 512×63D 41M / 2D 28M

二、价值等价隐模型:为 MCTS 而生的 latent

value-prediction-network 最早提出”隐状态不必对应环境状态、只需准确预测未来价值/奖励”;muzero 把它做成范式——表示 h / 动力学 g / 预测 f 三件套,隐状态在 16 残差块×256 平面的卷积塔里递归展开,value/reward 用 601 维 categorical support + 可逆缩放变换,全程 latent MCTS(pUCT c₁=1.25、c₂=19652,每次模拟只调一次 g+f)。动作条件化是把动作 one-hot 平铺成与隐状态同分辨率的平面再拼接。

这一支的演化几乎全在搜索算法与随机性建模上,网络骨干基本沿用:efficientzero 加 SimSiam 式自监督一致性 + value-prefix LSTM(低数据下小网即可);sampled-muzero 用采样式先验支持连续动作;stochastic-muzero 用 afterstate 分解 + VQ-VAE 式 chance codebook(M=32 one-hot,无 decoder、无重建损失)建模随机转移;gumbel-muzero 用 Sequential Halving + completed-Q 蒸馏免掉 Dirichlet 噪声;muzero-unplugged 换 ResNet-v2 pre-activation + Adam,并把离线数据真实动作 25% 注入根节点(humanoid.run 从 3.3→633.4 分)。vq-models-planning 把状态先 VQVAE 离散化再在离散 latent 上跑 MCTS(VQHybrid 动作/code 交替)。

Transformer 化的一支重要转折是 unizero:动力学头条件于到当前步的完整隐状态+动作序列(而非 MuZero 式单步递归),nanoGPT 骨架、每步拆成隐状态 token + 动作 token、SimNorm 隐归一化、推理期 KV Cache 覆盖 memory_length,去掉 decoder 重建(消融证明加重建对性能无益)。lightzero 提供统一基准骨架(ptree/ctree 双实现),rezero-mcts 用 backward-view + entire-buffer reanalyze 提速。

表 2 · 价值等价 / latent MCTS 家族

工作骨干value/reward 表示随机性关键搜索改动
muzero16 resblock×256601-bin categorical确定性(future work)latent pUCT
efficientzero1 resblock(缩小)601-bin + LSTM prefixSimSiam 一致性
sampled-muzero10 block×51251-bin采样 K 动作先验
stochastic-muzero10 block×256601-binafterstate + VQ M=32decision/chance 交替
gumbel-muzero6/32 层瓶颈+广播Sequential Halving
unizeronanoGPT(2 层默认)101-bin全序列条件 + KV Cache

三、Transformer / 自回归 token 世界模型

第三代把”帧”离散成 token、用 GPT 式因果注意力建模动力学,天然继承 LLM 的可扩展性与上下文能力。奠基作 irisVQVAE tokenizer(词表 512、每帧 K=16 token、64×64 帧)+ GPT2 式 Transformer G(L=20 步、D=256、10 层、序列 340 token),动作作为独立 token 插在每帧 16 个 image token 之后,token 级自回归预测下一帧。作者点破一个关键:IRIS 世界模型无需 GTrXL 式门控,因为训练目标是自监督的而非直接吃 RL 梯度——这解释了为何 Transformer-in-RL 的稳定性难题在世界模型语境里消失。

后续沿三个方向优化:压缩序列长度——delta-iris 用条件式 Δ-token(每帧仅 K=4,配连续 I-token 提供”软马尔可夫毯”,25M/20FPS);storm 把观测+动作先融合成单 token(仅 2 层 Transformer);rem-parallel-observation-prediction 用 RetNet + 并行观测预测(POP)把想象调用从 K·H 砍到 2H。换骨干——twm-transformer-world-model 用 Transformer-XL(隐状态/动作/奖励三 token,奖励回填输入);twister-contrastive-world-model 在 TSSM 上加动作条件对比预测(AC-CPC,预测视野扩到 K=10 步)。放大到基础模型——microsoft-wham-muse(WHAM/Muse)用 ViT-VQGAN(原生 300×180、540 token/帧、码本 16384)+ decoder-only GPT-2,图像 token 与动作 token(16 维手柄、摇杆离散 11 bin)交错无分隔符,1.6B 参数、上下文 1 秒(10Hz);microsoft-wham-muse 同时支持世界模型/行为策略/联合生成三模式。

驾驶与游戏侧的 AR 世界模型各具巧思:drivingworld-gpt 用时序层(跨帧同位置 token)+ 多模态层(帧内双向)分级,配平衡注意力(给 2 个位姿 token 人为加 +0.4/+0.2 权重)对抗 512 图像 token 的淹没;gaia-1-wayve 三模态交错(text-image-action,d=4096)、image tokenizer 用 DINO 蒸馏做归纳偏置、6.5B 自回归 + 2.6B 视频扩散解码器;doe-1 用 Chameleon/Lumina-mGPT 统一图/文/动作 token(动作用正弦位置编码保度量特性);mineworlddecart-oasisvideoworld(LDM 潜动力学 + IDM)、lwm-large-world-model(LLaMA-2 7B + RingAttention 1M 上下文 + aMUSEd VQGAN)、1x-world-model(GENIE/Llama/UNet 多基线 + MAGVIT2 tokenizer)各自扩展这条线。pandoraowl-1 则把 LLM 主干与视频扩散解码器缝合(Q-Former 适配器),走”AR 骨干出 latent、扩散头出像素”的混合路。

表 3 · Transformer / AR token 世界模型骨干

工作tokenizertoken/帧序列模型层×维上下文
irisVQVAE 51216GPT2 因果10×25620 步/340 tok
delta-irisVQ 1024 + I-token4GPT 因果3×51221 步
stormcategorical VAE32×32(单 tok)vanilla TF2×512KV cache
twm-transformer-world-modelCNN VAE 32×32Transformer-XL10×256ℓ 步
rem-parallel-observation-predictionVQ 51264(8×8)RetNet5×2562 帧
microsoft-wham-museViT-VQGAN 16384540GPT-21s/5560 tok
drivingworld-gpt时序 VQ 16384512+2时序×多模态层15 帧
gaia-1-wayveVQ-GAN 8192(DINO)576自回归 TF6.5B15860 tok
lwm-large-world-modelaMUSEd VQGAN256LLaMA-2 7BRingAttn1M

四、扩散 / 流匹配视频世界模型

第四代放弃离散 token 的信息瓶颈,直接在像素或 VAE latent 上做去噪,画质与物理细节大幅跃升,代价是采样成本与自回归漂移。gamengen 是转折点:改造 SD v1.4 U-Net(去文本、动作 embedding 换掉 cross-attention,过去帧沿通道拼接,上下文 64 帧),核心稳定性技巧是 noise augmentation——训练时给 context 帧加不同幅度噪声并把噪声级喂给模型(10 bucket、最大 0.7),让网络学会纠正自己生成的污染历史,把”20–30 步后崩坏”压住。

本代最重要的两条架构分野是扩散范式自回归粒度

  • EDM vs DDPMdiamond 用 EDM 预处理(信号/噪声自适应混合 c_skip),直接在 64×64 像素空间扩散、1–3 步去噪即稳定生成(避免 DDPM 低步数复合误差),动作经 AdaGN 注入、4 帧 frame-stacking 提供短记忆,Atari 版仅 4M 参数。
  • Diffusion Forcing(逐帧独立噪声级)diffusion-forcing 让序列每个 token 独立取噪声级 k_t,单个 RNN 单元行为等价于条件扩散模型——由此解锁稳定自回归 rollout(历史带小噪声更新)、zig-zag 调度编码”越远越不确定”、Monte Carlo guidance。这一机制被 decart-oasisworldmemplayable-game-generationskywork-matrix-gamegamefactory 广泛继承。history-guided-video-diffusion 进一步证明”每帧独立随机噪声级”是对 ELBO 的 reweighting,明显优于帧级二值 dropout。

骨干形态上,DiT 逐步取代 U-Net:navigation-world-models 提出 CDiT(只对目标帧做自注意力、过去帧走交叉注意力,复杂度对 context 帧数线性,比同规模 DiT 省 4× FLOPs);decart-oasis 用 ViT-VAE + SpatioTemporalDiTBlock(空间/时间轴向注意力交错、RoPE、动作 25 维加到 AdaLN);the-matrix 用 32 block DiT + 每 2 block 插一个交互模块 + Swin-DPM 滑窗 + 4 步一致性蒸馏。动作条件注入方式在本代高度分化(见第七节),一致性/记忆机制百花齐放(见第八节)。

规模化的世界基础模型集中在 2024–2026:NVIDIA Cosmos 系列把 DiT + flow matching 做成套件——cosmos-predict2(统一 backbone 0.6B/2B/14B、3D RoPE、T5-11B、rectified flow)、cosmos-predict2-5-world-simulation(WAN2.1 causal VAE、Cosmos-Reason1 换 T5、去绝对位置编码只留 3D RoPE)、nvidia-cosmos-transfer1(ControlNet 式多模态自适应空间控制);mbzuai-pan-world-model(PAN)用 Qwen2.5-VL 视觉塔 + 语言塔做 AR 世界模型骨干、Wan2.1-14B + Causal Swin-DPM 做扩散解码器(滑窗内同时持两个噪声级、chunk-wise 因果掩码),把”生成式监督”作为对 JEPA 潜空间坍缩的解药。genie-3(720p/24fps 自回归逐帧、涌现 1 分钟一致性)、world-labs-rtfm(自回归扩散 TF、KV cache 即隐式世界、位姿条件 + 空间记忆检索)等闭源系统则只披露架构骨架。

表 4 · 扩散 / 流匹配视频世界模型

工作骨干扩散范式潜空间动作注入规模
gamengenSD1.4 U-NetDDPM v-pred8×8→4ch替换 cross-attn
diamond2D U-NetEDM(3 步)无(像素)AdaGN4M/13M
diffusion-forcingU-Net+GRU / resMLP逐帧独立噪声2D 张量拼接24–36M
navigation-world-modelsCDiTDiT 式SVD VAEAdaLN(u,φ,k)50M–1B
decart-oasisST-DiTDiffusion ForcingViT-VAE 18×32AdaLN 25 维500M
vista-driving-world-modelSVD U-NetEDMSVD latentcross-attn+128 Fourier2.5B
cosmos-predict2统一 DiTrectified flowcausal VAE 16chframe-replace0.6/2/14B
mbzuai-pan-world-modelQwen2.5-VL + Wan2.1Causal Swin-DPMWan2.1-VAEcross-attn + umT57B+14B
the-matrix32-block DiT4 步一致性3D VAE16 交互模块2.7B

五、JEPA:非生成的预测嵌入架构

lecun-path-autonomous-machine-intelligence 把 JEPA 定位为”世界模型”谱系的通用预测架构:两路编码器把 x,y 编成 s_x,s_y,predictor 从 s_x(借 latent z)预测 s_y 的表征而非像素——由此让 y 编码器主动丢弃不可预测的无关细节(树叶、水波纹)。这与前四代”生成式监督”是根本对立的技术路线。

图像奠基作 i-jepa 定型了三件套:context encoder(ViT)+ target encoder(EMA 副本)+ 窄 predictor(384 维、6–16 层),损失是被遮 target block 表征的平均 L2;防坍缩靠 EMA + predictor 窄瓶颈的非对称设计。masking 是核心(4 个 target block scale 0.15–0.2、1 个 context block scale 0.85–1.0)。视频版 v-jepa 用 3D patchify(tubelet 2×16×16、1568 token)、L1 损失(比 L2 稳)、ViT-L/H/g(300M–1B)+ 固定 ViT-s 22M predictor。v-jepa-23D-RoPE(稳定最大模型训练)并延伸出两阶段——先 action-free 预训练,再冻结编码器训 V-JEPA 2-AC(7 维末端动作、block-causal 注意力自回归预测下一帧表征,predictor ~300M)。

这个家族的关键特征是极强的跨模态可迁移性:同一 encoder+EMA+predictor 元架构被搬到音频(a-jepastem-jepa-musicjepa-speech-tokenizer-daam)、点云(point-jepa 加 Greedy Sequencer、dino-wm 用冻结 DINOv2)、脑信号(brain-jepas-jepa-eeg)、表格(t-jepa-tabular,靠 [REG] token 防坍缩)、文本图像生成(jepa-t-text-to-imagellm-jepajepa-reasoner)。规划侧 pldm-planning-latent-dynamics 用 JEPA + MPPI(VICReg 式方差/协方差正则防坍缩,方差项是最关键闸门)、iwm-learning-leveraging-world-models 用等变 predictor(深度比 ≈0.3 时较易学出强世界模型)。理论侧 lejepa(SIGReg:球面 Cramér-Wold + Epps-Pulley 检验,~50 行 PyTorch、单超参 λ)与 when-does-lejepa-learn-world-model(形式化 OU 过程 + Hermite 谱分析、给出线性可辨识性四定理)为这条路线补上收敛/坍缩理论。jepa-vla 则把冻结 V-JEPA 2 表征门控注入 VLA 动作模型。

表 5 · JEPA 家族架构

工作模态encoderpredictor防坍缩条件变量 z
i-jepa图像ViT-B/H/G窄 ViT 6–16 层EMA + 窄瓶颈target 位置
v-jepa视频ViT-L/H/gViT-s 22MEMA + stop-grad3D 时空位置
v-jepa-2视频+动作ViT-g 1B300M(AC)EMA + 3D-RoPE7 维动作
dino-wm视觉+动作冻结 DINOv2 ViT-SViT depth 6冻结 encoder动作 concat patch
iwm-learning-leveraging-world-models图像ViT-B/L12–36 层EMA增强参数
pldm-planning-latent-dynamics视觉+动作Impala/MeNet6GRU/Conv/MLPVICReg + IDM动作 concat
lejepa任意60+ 架构通用无 predictorSIGReg多视图

六、统一 MoT / VLA-世界模型:感知-动力学-动作同流

最新一条支线把编码-世界模型-解码压进同一条自回归/扩散 token 流,取消模块边界。doe-1owl-1 用 Chameleon 早融合骨干,把观测(VQ image token)、描述(文本/数值正弦编码)、动作(position-aware token)交错成一维序列做统一 next-token 预测——动作条件因此不需额外 cross-attention/FiLM,上一步动作 token 本身就在因果上下文里。mbzuai-pan-world-model 显式对比了这条路与 JEPA 的区别:JEPA 的潜空间匹配理论上会坍缩、且潜转移不受真实数据约束(“不可定义性”),PAN 用生成式监督把每个潜转移 grounding 回可实现的感知变化。

具身 VLA-世界模型把这条线推向机器人:3d-vla 在 BLIP2 上加交互 token(obj/loc/scene/action)+ 扩散解码器(RGB-D 用 SD、点云用 Point-E);nvidia-cosmos-policylatent frame injection 最激进——不加任何新模块,把动作、本体感知、未来价值都编码成与图像同形状的隐帧插进扩散序列 (s,a,s′,V(s′)),一个模型联合训策略/世界模型/价值函数;driveworld-vlahermes-driving-world-model/hermes-plus-plusgaussiandwm 则把 VLM 骨干(InternVL/Qwen)与 BEV/占据 tokenizer + 体渲染解码器缝合,用 world queries 把语言世界知识迁移到未来几何预测。world-action-models-survey 把这一大类统一成 4 元组 (预测子空间 Φ, 动作耦合 F, 架构骨干 B, 部署机制 D),并区分 Render-and-Decode / Latent-Only / Video-Generation-Free 三种设计哲学。


七、Tokenizer 谱系:VQ → FSQ → 连续因果视频 latent

tokenizer 决定了世界模型输入空间的语义密度与压缩比,是贯穿三、四代的隐性主线。三条技术支:

  • VQ / VQGAN 离散码本:主流路线。iris 512 码 / delta-iris 1024(factorized+normalized)/ copilot4d-waabi 点云 BEV token 1024(K-Means 重启防坍缩)/ occworld 占据 tokenizer 512 码(50×50 latent,重建 mIoU 66.38)/ larp holistic tokenization(可学习 query 打破 token-patch 局部绑定,SVQ 随机量化,8192 码)/ omnitokenizer 图像-视频联合(窗口注意力空间 + 因果注意力时间,8192 码)。gaia-1-wayve 的关键创新是 DINO 蒸馏把语义压进 token(同类物体 embedding 相近,让世界模型输入空间更语义、少高频噪声)。
  • FSQ(Finite Scalar Quantization):无需学习码本,按每维离散边界就近取整。videoworld 用 FSQ 档位 [8,8,8,5,5,5]=64000 码;jepa-speech-tokenizer-daam 用 L=[4,4,4,4] + Mixed-Radix 打包(128 维每 7 组打成一个 16384 词表 token,token 速率压到 1/7)。
  • 连续因果视频 VAE:扩散代主流,放弃离散化。Cosmos 用 WAN2.1 causal VAE(时空 4×8×8、16 通道);gaia-2-wayve非对称 encoder(85M)/decoder(200M)、32× 空间 + 8× 时间、64 通道(高压缩 + 高维度,token 更少更语义,总压缩比 ~384);tencent-yan 的 Yan-Sim 把 VAE 空间压缩从 8 提到 32、通道 16(1×8×8 → 2×32×32),只轻量化解码器(因只有解码延迟计入推理);hunyuanworld-voyagerskywork-matrix-game 系用 3D Causal VAE(空间 8×、时间 4×)。

时序一致性是视频 tokenizer 的专属难题:drivingworld-gpt 在 VQ 前后各插一层沿时间维自注意力缓解逐帧闪烁;epona-autoregressive-diffusion 用 Temporal-aware DCAE(32× 下采样、比 8× VAE 少 16× token)+ 解码器前插时空自注意力。


八、动作条件与长时程记忆:两个横切设计空间

动作条件注入在各代高度分化,且注入方式经消融被证明并非等价:

注入方式代表工作备注
喂进 GRU / 拼接隐状态planet dreamer-v2 td-mpc2RSSM/MLP 代标准做法
one-hot 平铺成平面拼接muzero efficientzero与隐状态同分辨率
独立动作 token 插入序列iris doe-1 microsoft-wham-museAR 代标准,因果上下文自带
cross-attention(离散动作)gamefactory skywork-matrix-game键盘等类别信号
通道拼接(连续动作)gamengen gamefactory鼠标等数值幅度信号
AdaLN / FiLM 调制decart-oasis navigation-world-models diamond逐帧调制,动作影响每空间位置
cross-attention + Fourier embeddingvista-driving-world-model genad-generalized-predictive-model实测比 additive 收敛快、可控性强
加到 timestep embeddingcosmos-predict2-5-world-simulation消融优于 cross-attn 与 concat
latent frame injectionnvidia-cosmos-policy动作编码成与图像同形状隐帧
潜动作无监督抽取adaworld videoworldβ-VAE / LDM 从帧对反推动作

一个反复出现的经验规律(gamefactory 明确消融):连续量拼接 + 离散量交叉注意力是最优组合——拼接保留数值幅度,交叉注意力的相似度归一化会削弱幅度但更适合类别信号。

长时程记忆与一致性是第四代的核心战场,机制可分五类:

  1. frame-stacking / 短上下文窗diamond(4 帧)、gamengen(64 帧)、microsoft-wham-muse(1 秒)——最小记忆,作者多承认是瓶颈。
  2. KV cache 即隐式世界world-labs-rtfm(输入帧转 KV 激活隐式代表世界)、genie-3mirage-dynamicslabunizero
  3. 显式记忆检索 + 几何线索worldmem(记忆单元 {帧,位姿,时间戳},按 FOV 重叠 + 时间戳检索,把记忆帧当”干净帧”塞进 Diffusion Forcing 去噪流,相对 Plücker embedding 使 300 帧后仍稳定)、skywork-matrix-game-3(相机感知记忆选择 + 头级扰动 RoPE base 打破周期性伪影)、dreamx-world-1(按位姿+视野重叠检索、带原始时间 RoPE)。
  4. 外部关联记忆 / NTMgame-gan(shift-based 寻址的 NTM,测试时块可从 39×39 放大到 99×99 做 loop closure)、lecun-path-autonomous-machine-intelligence(key-value 关联记忆)。
  5. 显式 3D / 场景缓存hunyuanworld-voyager(世界缓存 + point culling 省 40% 存储)、abot-3dworld-0(SGP 空间生成原语)、world-labs-marble(一次性生成完整持久 3DGS,天然无漂移)、matrix-3d(网格渲染条件)。

自回归漂移的抑制手段自成一条暗线:gamengen 的 noise augmentation、decart-oasis 的 dynamic noising、skywork-matrix-game-3/alayaworld 的 error bank(把 rollout 残差注入记忆与目标两侧)、world-labs-rtfm/decart-mirage 的 history augmentation(训练时腐化历史帧、告知模型历史可能不准),本质都是”训练时暴露模型于自身生成分布”以弥合 train/inference gap。少步蒸馏(DMD / 一致性 / Self-Forcing)则是把这些重扩散骨干压进实时交互的工程闸门(the-matrix 4 步、skywork-matrix-game-3 因果学生、moworld-flash-world-model 50→4 步)。


空白与趋势

  • 五代骨干正在收口而非替代。最强的近作往往是杂交:mbzuai-pan-world-model(AR VLM 骨干 + 扩散解码器 + Swin-DPM)、nvidia-cosmos-policy(扩散序列里塞策略/世界模型/价值)、owl-1(Chameleon LMM + DynamiCrafter)都是”AR 出 latent、扩散出像素、JEPA 式 latent 监督”的组合。纯单一范式的 SOTA 越来越少。
  • JEPA 与生成式监督的路线之争尚未收敛。JEPA 靠丢弃不可预测细节获得高效表征与规划能力(v-jepa-2dino-wm),但坍缩与潜转移 grounding 问题被 mbzuai-pan-world-modellejepawhen-does-lejepa-learn-world-model 反复讨论;生成式路线画质无敌但采样贵、物理一致性靠数据堆。二者可能在”latent 预测 + 稀疏像素校验”处融合。
  • tokenizer 向”更少 token、更高维度、更强因果”演进gaia-2-wayve 的 64 通道高压缩、larp 的 holistic query、连续因果 VAE 取代离散码本,都指向”减少序列长度以支持更长上下文”。FSQ 因免码本训练正在替代 VQ。
  • 实时交互是第四代的硬约束。少步蒸馏(DMD/一致性)+ KV cache + 因果化几乎成为游戏/驾驶世界模型的标配(Matrix-Game 系、Cosmos 系、world-labs-rtfmdecart-mirage),“扩散步数 50→4”与”逐帧因果 rollout”是过去一年最密集的工程投入。
  • 长时程一致性仍是未解的涌现问题genie-3 的 1 分钟一致性被官方称为 emergent、无显式记忆模块;显式记忆检索(worldmem)、3D 缓存(hunyuanworld-voyager)、error bank 各有取舍,但”无界探索下上下文不爆炸且不漂移”尚无普适解——这可能是下一代骨干(长时记忆压缩、可写外存、显隐式 3D 混合)的主战场。