世界模型架构演进
世界模型(world model)的骨干,本质是在回答同一个问题:“给定历史观测与动作,如何预测下一个状态?” 但七年来这个”状态”从 30 维对角高斯,膨胀到 4096 维连续 token、再到整段视频 latent;“预测”从单步 GRU 递推,走到 token 级自回归、整序列扩散、纯表征空间 L2 回归。这条主线可粗分为五代骨干,且它们并非替代而是层叠共存:
- RSSM 隐动力学——确定性 GRU + 随机隐变量,在紧凑 latent 里想象、纯 latent 规划(planet→dreamer-v3);
- 价值等价隐模型——隐状态无重建语义、只服务 MCTS 的 latent 树搜索(muzero→unizero);
- Transformer / 自回归 token 世界模型——把帧切成离散 token、用 GPT 式因果注意力建模动力学(iris→microsoft-wham-muse);
- 扩散 / 流匹配视频世界模型——直接在像素或 VAE latent 上做去噪,画质与物理细节跃升(gamengen→genie-3);
- JEPA 预测嵌入——非生成、在表征空间预测被遮区域,主动丢弃不可预测细节(i-jepa→v-jepa-2);
外加一条正在收口的统一 MoT / VLA-世界模型支线,把感知-世界模型-动作压进同一条自回归 token 流(doe-1、mbzuai-pan-world-model、nvidia-cosmos-policy)。三个横切维度贯穿始终:tokenizer(VQ / FSQ / 连续因果视频 latent)、动作条件注入机制、长时程记忆与一致性。本页沿这条骨干主线纵向梳理,抠具体架构数字。
一、RSSM 隐动力学:确定性 + 随机的双通道
范式源头是 world-models-ha-schmidhuber(2018)的 V+M+C 三件套:卷积 VAE(CarRacing latent 32 维 / Doom 64 维,VAE 约 4.3M 参数)压视觉、MDN-RNN(LSTM 256/512 单元 + 5 个高斯混合分量)建时序、单层线性 Controller(仅 867/1088 参数,正好落在 CMA-ES 可优化的规模)决策——三者分阶段训练。
planet 把它凝练成 RSSM(Recurrent State-Space Model) 的标准形态:把 latent 拆成确定性 h_t(GRU 200 units)+ 随机 s_t(30 维对角高斯),两条通道缺一不可(消融证明纯 RNN 无法表达多模态未来、纯 SSM 难跨步记忆)。所有观测信息必须经 s_t 采样步,避免确定性捷径。规划用 CEM(horizon 12、1000 候选 ×10 迭代 = 每步评 1 万条想象序列),全程在 latent 前推、不生成图像。
dreamer-v1 在 RSSM 上加了本代真正的贡献——在想象轨迹上学 actor-critic:连续动作用 tanh-Gaussian 重参数化让梯度穿过采样步、离散动作用 straight-through,想象窗 H=15。dreamer-v2 的两个关键创新定义了后续所有离散 RSSM:分类隐状态(32 个变量 × 32 类 → 1024 维稀疏二值向量,直觉是”分类混合仍是分类,能完美拟合聚合后验的多模态”)+ KL balancing(先验 α=0.8、后验 0.2,把先验学准而非撑大后验熵)。dreamer-v3 把它工程化为跨域通吃:6 部件、GRU 用 block-diagonal 8 块循环权重(单元数变大而 FLOPs 不平方增长)、symlog + twohot 离散回归贯穿全网、unimix(1% 均匀 + 99% 网络输出)杜绝确定性分布,6 档规模 12M→400M 全部超参固定。
这条线在具身、记忆、多模态上各生一支:daydreamer 把 actor/learner 异步解耦上真机(去掉 train_every 超参);director 加 goal autoencoder(8×8 离散码)做分层规划;iso-dream 三分支解耦可控/不可控动态;dynalang 逐 token 逐帧对齐语言(最简架构反超 6 种 T5 方案);harmonydream 用可学习标量自动调和观测/奖励/KL 三损失尺度。骨干替换实验同样活跃:transdreamer 用 Transformer(TSSM)换 GRU、s4wm-world-model-backbones 用 S4/S5 结构化 SSM、recall-to-imagine-r2i 用 S3M 并行扫描,都证明”RSSM 的生成式框架可换任意可并行序列骨干”。连续控制侧 td-mpc→td-mpc2 走另一条极简路线——纯 MLP 隐动力学、无重建、SimNorm 隐归一化(L 个单纯形各做 softmax,VQ 的软松弛版),317M 档在 80 任务上验证 scaling;pwm-multitask-world-models 复用其骨干、只改奖励头为可微版本以支持一阶策略梯度。
表 1 · RSSM 家族关键配置
| 工作 | 骨干 | 隐状态类型 | 确定性/隐单元 | 想象 H | 规模 |
|---|---|---|---|---|---|
| world-models-ha-schmidhuber | VAE+MDN-RNN | 高斯 32/64 维 | LSTM 256/512 | — | VAE~4.3M / C 867 |
| planet | RSSM | 高斯 30 维 | GRU 200 | 12(CEM) | 全 MLP 200 宽 |
| dreamer-v2 | RSSM 离散 | 32×32 分类 | GRU 600 | 15 | WM 20M + AC 2M |
| dreamer-v3 | RSSM 离散 | d/16 codes | GRU 8-block | 15 | 12M–400M(6 档) |
| daydreamer | RSSM(复用 V2) | 32×32 分类 | RSSM 512 | 15 | MLP 4×512 |
| td-mpc2 | MLP 隐动力学 | SimNorm 单纯形 | latent 512 | H=3 rollout | 1M–317M(5 档) |
| recall-to-imagine-r2i | S3M(对角 SSM) | 32×32 分类 | h 512、SSM 3–5 层 | 15 | Small/Medium |
| s4wm-world-model-backbones | S4 blocks | 32×32 分类 | d_model 512×6 | — | 3D 41M / 2D 28M |
二、价值等价隐模型:为 MCTS 而生的 latent
value-prediction-network 最早提出”隐状态不必对应环境状态、只需准确预测未来价值/奖励”;muzero 把它做成范式——表示 h / 动力学 g / 预测 f 三件套,隐状态在 16 残差块×256 平面的卷积塔里递归展开,value/reward 用 601 维 categorical support + 可逆缩放变换,全程 latent MCTS(pUCT c₁=1.25、c₂=19652,每次模拟只调一次 g+f)。动作条件化是把动作 one-hot 平铺成与隐状态同分辨率的平面再拼接。
这一支的演化几乎全在搜索算法与随机性建模上,网络骨干基本沿用:efficientzero 加 SimSiam 式自监督一致性 + value-prefix LSTM(低数据下小网即可);sampled-muzero 用采样式先验支持连续动作;stochastic-muzero 用 afterstate 分解 + VQ-VAE 式 chance codebook(M=32 one-hot,无 decoder、无重建损失)建模随机转移;gumbel-muzero 用 Sequential Halving + completed-Q 蒸馏免掉 Dirichlet 噪声;muzero-unplugged 换 ResNet-v2 pre-activation + Adam,并把离线数据真实动作 25% 注入根节点(humanoid.run 从 3.3→633.4 分)。vq-models-planning 把状态先 VQVAE 离散化再在离散 latent 上跑 MCTS(VQHybrid 动作/code 交替)。
Transformer 化的一支重要转折是 unizero:动力学头条件于到当前步的完整隐状态+动作序列(而非 MuZero 式单步递归),nanoGPT 骨架、每步拆成隐状态 token + 动作 token、SimNorm 隐归一化、推理期 KV Cache 覆盖 memory_length,去掉 decoder 重建(消融证明加重建对性能无益)。lightzero 提供统一基准骨架(ptree/ctree 双实现),rezero-mcts 用 backward-view + entire-buffer reanalyze 提速。
表 2 · 价值等价 / latent MCTS 家族
| 工作 | 骨干 | value/reward 表示 | 随机性 | 关键搜索改动 |
|---|---|---|---|---|
| muzero | 16 resblock×256 | 601-bin categorical | 确定性(future work) | latent pUCT |
| efficientzero | 1 resblock(缩小) | 601-bin + LSTM prefix | — | SimSiam 一致性 |
| sampled-muzero | 10 block×512 | 51-bin | — | 采样 K 动作先验 |
| stochastic-muzero | 10 block×256 | 601-bin | afterstate + VQ M=32 | decision/chance 交替 |
| gumbel-muzero | 6/32 层瓶颈+广播 | — | — | Sequential Halving |
| unizero | nanoGPT(2 层默认) | 101-bin | — | 全序列条件 + KV Cache |
三、Transformer / 自回归 token 世界模型
第三代把”帧”离散成 token、用 GPT 式因果注意力建模动力学,天然继承 LLM 的可扩展性与上下文能力。奠基作 iris:VQVAE tokenizer(词表 512、每帧 K=16 token、64×64 帧)+ GPT2 式 Transformer G(L=20 步、D=256、10 层、序列 340 token),动作作为独立 token 插在每帧 16 个 image token 之后,token 级自回归预测下一帧。作者点破一个关键:IRIS 世界模型无需 GTrXL 式门控,因为训练目标是自监督的而非直接吃 RL 梯度——这解释了为何 Transformer-in-RL 的稳定性难题在世界模型语境里消失。
后续沿三个方向优化:压缩序列长度——delta-iris 用条件式 Δ-token(每帧仅 K=4,配连续 I-token 提供”软马尔可夫毯”,25M/20FPS);storm 把观测+动作先融合成单 token(仅 2 层 Transformer);rem-parallel-observation-prediction 用 RetNet + 并行观测预测(POP)把想象调用从 K·H 砍到 2H。换骨干——twm-transformer-world-model 用 Transformer-XL(隐状态/动作/奖励三 token,奖励回填输入);twister-contrastive-world-model 在 TSSM 上加动作条件对比预测(AC-CPC,预测视野扩到 K=10 步)。放大到基础模型——microsoft-wham-muse(WHAM/Muse)用 ViT-VQGAN(原生 300×180、540 token/帧、码本 16384)+ decoder-only GPT-2,图像 token 与动作 token(16 维手柄、摇杆离散 11 bin)交错无分隔符,1.6B 参数、上下文 1 秒(10Hz);microsoft-wham-muse 同时支持世界模型/行为策略/联合生成三模式。
驾驶与游戏侧的 AR 世界模型各具巧思:drivingworld-gpt 用时序层(跨帧同位置 token)+ 多模态层(帧内双向)分级,配平衡注意力(给 2 个位姿 token 人为加 +0.4/+0.2 权重)对抗 512 图像 token 的淹没;gaia-1-wayve 三模态交错(text-image-action,d=4096)、image tokenizer 用 DINO 蒸馏做归纳偏置、6.5B 自回归 + 2.6B 视频扩散解码器;doe-1 用 Chameleon/Lumina-mGPT 统一图/文/动作 token(动作用正弦位置编码保度量特性);mineworld、decart-oasis、videoworld(LDM 潜动力学 + IDM)、lwm-large-world-model(LLaMA-2 7B + RingAttention 1M 上下文 + aMUSEd VQGAN)、1x-world-model(GENIE/Llama/UNet 多基线 + MAGVIT2 tokenizer)各自扩展这条线。pandora、owl-1 则把 LLM 主干与视频扩散解码器缝合(Q-Former 适配器),走”AR 骨干出 latent、扩散头出像素”的混合路。
表 3 · Transformer / AR token 世界模型骨干
| 工作 | tokenizer | token/帧 | 序列模型 | 层×维 | 上下文 |
|---|---|---|---|---|---|
| iris | VQVAE 512 | 16 | GPT2 因果 | 10×256 | 20 步/340 tok |
| delta-iris | VQ 1024 + I-token | 4 | GPT 因果 | 3×512 | 21 步 |
| storm | categorical VAE | 32×32(单 tok) | vanilla TF | 2×512 | KV cache |
| twm-transformer-world-model | CNN VAE 32×32 | — | Transformer-XL | 10×256 | ℓ 步 |
| rem-parallel-observation-prediction | VQ 512 | 64(8×8) | RetNet | 5×256 | 2 帧 |
| microsoft-wham-muse | ViT-VQGAN 16384 | 540 | GPT-2 | — | 1s/5560 tok |
| drivingworld-gpt | 时序 VQ 16384 | 512+2 | 时序×多模态层 | — | 15 帧 |
| gaia-1-wayve | VQ-GAN 8192(DINO) | 576 | 自回归 TF | 6.5B | 15860 tok |
| lwm-large-world-model | aMUSEd VQGAN | 256 | LLaMA-2 7B | RingAttn | 1M |
四、扩散 / 流匹配视频世界模型
第四代放弃离散 token 的信息瓶颈,直接在像素或 VAE latent 上做去噪,画质与物理细节大幅跃升,代价是采样成本与自回归漂移。gamengen 是转折点:改造 SD v1.4 U-Net(去文本、动作 embedding 换掉 cross-attention,过去帧沿通道拼接,上下文 64 帧),核心稳定性技巧是 noise augmentation——训练时给 context 帧加不同幅度噪声并把噪声级喂给模型(10 bucket、最大 0.7),让网络学会纠正自己生成的污染历史,把”20–30 步后崩坏”压住。
本代最重要的两条架构分野是扩散范式与自回归粒度:
- EDM vs DDPM:diamond 用 EDM 预处理(信号/噪声自适应混合 c_skip),直接在 64×64 像素空间扩散、1–3 步去噪即稳定生成(避免 DDPM 低步数复合误差),动作经 AdaGN 注入、4 帧 frame-stacking 提供短记忆,Atari 版仅 4M 参数。
- Diffusion Forcing(逐帧独立噪声级):diffusion-forcing 让序列每个 token 独立取噪声级 k_t,单个 RNN 单元行为等价于条件扩散模型——由此解锁稳定自回归 rollout(历史带小噪声更新)、zig-zag 调度编码”越远越不确定”、Monte Carlo guidance。这一机制被 decart-oasis、worldmem、playable-game-generation、skywork-matrix-game、gamefactory 广泛继承。history-guided-video-diffusion 进一步证明”每帧独立随机噪声级”是对 ELBO 的 reweighting,明显优于帧级二值 dropout。
骨干形态上,DiT 逐步取代 U-Net:navigation-world-models 提出 CDiT(只对目标帧做自注意力、过去帧走交叉注意力,复杂度对 context 帧数线性,比同规模 DiT 省 4× FLOPs);decart-oasis 用 ViT-VAE + SpatioTemporalDiTBlock(空间/时间轴向注意力交错、RoPE、动作 25 维加到 AdaLN);the-matrix 用 32 block DiT + 每 2 block 插一个交互模块 + Swin-DPM 滑窗 + 4 步一致性蒸馏。动作条件注入方式在本代高度分化(见第七节),一致性/记忆机制百花齐放(见第八节)。
规模化的世界基础模型集中在 2024–2026:NVIDIA Cosmos 系列把 DiT + flow matching 做成套件——cosmos-predict2(统一 backbone 0.6B/2B/14B、3D RoPE、T5-11B、rectified flow)、cosmos-predict2-5-world-simulation(WAN2.1 causal VAE、Cosmos-Reason1 换 T5、去绝对位置编码只留 3D RoPE)、nvidia-cosmos-transfer1(ControlNet 式多模态自适应空间控制);mbzuai-pan-world-model(PAN)用 Qwen2.5-VL 视觉塔 + 语言塔做 AR 世界模型骨干、Wan2.1-14B + Causal Swin-DPM 做扩散解码器(滑窗内同时持两个噪声级、chunk-wise 因果掩码),把”生成式监督”作为对 JEPA 潜空间坍缩的解药。genie-3(720p/24fps 自回归逐帧、涌现 1 分钟一致性)、world-labs-rtfm(自回归扩散 TF、KV cache 即隐式世界、位姿条件 + 空间记忆检索)等闭源系统则只披露架构骨架。
表 4 · 扩散 / 流匹配视频世界模型
| 工作 | 骨干 | 扩散范式 | 潜空间 | 动作注入 | 规模 |
|---|---|---|---|---|---|
| gamengen | SD1.4 U-Net | DDPM v-pred | 8×8→4ch | 替换 cross-attn | — |
| diamond | 2D U-Net | EDM(3 步) | 无(像素) | AdaGN | 4M/13M |
| diffusion-forcing | U-Net+GRU / resMLP | 逐帧独立噪声 | 2D 张量 | 拼接 | 24–36M |
| navigation-world-models | CDiT | DiT 式 | SVD VAE | AdaLN(u,φ,k) | 50M–1B |
| decart-oasis | ST-DiT | Diffusion Forcing | ViT-VAE 18×32 | AdaLN 25 维 | 500M |
| vista-driving-world-model | SVD U-Net | EDM | SVD latent | cross-attn+128 Fourier | 2.5B |
| cosmos-predict2 | 统一 DiT | rectified flow | causal VAE 16ch | frame-replace | 0.6/2/14B |
| mbzuai-pan-world-model | Qwen2.5-VL + Wan2.1 | Causal Swin-DPM | Wan2.1-VAE | cross-attn + umT5 | 7B+14B |
| the-matrix | 32-block DiT | 4 步一致性 | 3D VAE | 16 交互模块 | 2.7B |
五、JEPA:非生成的预测嵌入架构
lecun-path-autonomous-machine-intelligence 把 JEPA 定位为”世界模型”谱系的通用预测架构:两路编码器把 x,y 编成 s_x,s_y,predictor 从 s_x(借 latent z)预测 s_y 的表征而非像素——由此让 y 编码器主动丢弃不可预测的无关细节(树叶、水波纹)。这与前四代”生成式监督”是根本对立的技术路线。
图像奠基作 i-jepa 定型了三件套:context encoder(ViT)+ target encoder(EMA 副本)+ 窄 predictor(384 维、6–16 层),损失是被遮 target block 表征的平均 L2;防坍缩靠 EMA + predictor 窄瓶颈的非对称设计。masking 是核心(4 个 target block scale 0.15–0.2、1 个 context block scale 0.85–1.0)。视频版 v-jepa 用 3D patchify(tubelet 2×16×16、1568 token)、L1 损失(比 L2 稳)、ViT-L/H/g(300M–1B)+ 固定 ViT-s 22M predictor。v-jepa-2 加 3D-RoPE(稳定最大模型训练)并延伸出两阶段——先 action-free 预训练,再冻结编码器训 V-JEPA 2-AC(7 维末端动作、block-causal 注意力自回归预测下一帧表征,predictor ~300M)。
这个家族的关键特征是极强的跨模态可迁移性:同一 encoder+EMA+predictor 元架构被搬到音频(a-jepa、stem-jepa-music、jepa-speech-tokenizer-daam)、点云(point-jepa 加 Greedy Sequencer、dino-wm 用冻结 DINOv2)、脑信号(brain-jepa、s-jepa-eeg)、表格(t-jepa-tabular,靠 [REG] token 防坍缩)、文本图像生成(jepa-t-text-to-image、llm-jepa、jepa-reasoner)。规划侧 pldm-planning-latent-dynamics 用 JEPA + MPPI(VICReg 式方差/协方差正则防坍缩,方差项是最关键闸门)、iwm-learning-leveraging-world-models 用等变 predictor(深度比 ≈0.3 时较易学出强世界模型)。理论侧 lejepa(SIGReg:球面 Cramér-Wold + Epps-Pulley 检验,~50 行 PyTorch、单超参 λ)与 when-does-lejepa-learn-world-model(形式化 OU 过程 + Hermite 谱分析、给出线性可辨识性四定理)为这条路线补上收敛/坍缩理论。jepa-vla 则把冻结 V-JEPA 2 表征门控注入 VLA 动作模型。
表 5 · JEPA 家族架构
| 工作 | 模态 | encoder | predictor | 防坍缩 | 条件变量 z |
|---|---|---|---|---|---|
| i-jepa | 图像 | ViT-B/H/G | 窄 ViT 6–16 层 | EMA + 窄瓶颈 | target 位置 |
| v-jepa | 视频 | ViT-L/H/g | ViT-s 22M | EMA + stop-grad | 3D 时空位置 |
| v-jepa-2 | 视频+动作 | ViT-g 1B | 300M(AC) | EMA + 3D-RoPE | 7 维动作 |
| dino-wm | 视觉+动作 | 冻结 DINOv2 ViT-S | ViT depth 6 | 冻结 encoder | 动作 concat patch |
| iwm-learning-leveraging-world-models | 图像 | ViT-B/L | 12–36 层 | EMA | 增强参数 |
| pldm-planning-latent-dynamics | 视觉+动作 | Impala/MeNet6 | GRU/Conv/MLP | VICReg + IDM | 动作 concat |
| lejepa | 任意 | 60+ 架构通用 | 无 predictor | SIGReg | 多视图 |
六、统一 MoT / VLA-世界模型:感知-动力学-动作同流
最新一条支线把编码-世界模型-解码压进同一条自回归/扩散 token 流,取消模块边界。doe-1、owl-1 用 Chameleon 早融合骨干,把观测(VQ image token)、描述(文本/数值正弦编码)、动作(position-aware token)交错成一维序列做统一 next-token 预测——动作条件因此不需额外 cross-attention/FiLM,上一步动作 token 本身就在因果上下文里。mbzuai-pan-world-model 显式对比了这条路与 JEPA 的区别:JEPA 的潜空间匹配理论上会坍缩、且潜转移不受真实数据约束(“不可定义性”),PAN 用生成式监督把每个潜转移 grounding 回可实现的感知变化。
具身 VLA-世界模型把这条线推向机器人:3d-vla 在 BLIP2 上加交互 token(obj/loc/scene/action)+ 扩散解码器(RGB-D 用 SD、点云用 Point-E);nvidia-cosmos-policy 的 latent frame injection 最激进——不加任何新模块,把动作、本体感知、未来价值都编码成与图像同形状的隐帧插进扩散序列 (s,a,s′,V(s′)),一个模型联合训策略/世界模型/价值函数;driveworld-vla、hermes-driving-world-model/hermes-plus-plus、gaussiandwm 则把 VLM 骨干(InternVL/Qwen)与 BEV/占据 tokenizer + 体渲染解码器缝合,用 world queries 把语言世界知识迁移到未来几何预测。world-action-models-survey 把这一大类统一成 4 元组 (预测子空间 Φ, 动作耦合 F, 架构骨干 B, 部署机制 D),并区分 Render-and-Decode / Latent-Only / Video-Generation-Free 三种设计哲学。
七、Tokenizer 谱系:VQ → FSQ → 连续因果视频 latent
tokenizer 决定了世界模型输入空间的语义密度与压缩比,是贯穿三、四代的隐性主线。三条技术支:
- VQ / VQGAN 离散码本:主流路线。iris 512 码 / delta-iris 1024(factorized+normalized)/ copilot4d-waabi 点云 BEV token 1024(K-Means 重启防坍缩)/ occworld 占据 tokenizer 512 码(50×50 latent,重建 mIoU 66.38)/ larp holistic tokenization(可学习 query 打破 token-patch 局部绑定,SVQ 随机量化,8192 码)/ omnitokenizer 图像-视频联合(窗口注意力空间 + 因果注意力时间,8192 码)。gaia-1-wayve 的关键创新是 DINO 蒸馏把语义压进 token(同类物体 embedding 相近,让世界模型输入空间更语义、少高频噪声)。
- FSQ(Finite Scalar Quantization):无需学习码本,按每维离散边界就近取整。videoworld 用 FSQ 档位 [8,8,8,5,5,5]=64000 码;jepa-speech-tokenizer-daam 用 L=[4,4,4,4] + Mixed-Radix 打包(128 维每 7 组打成一个 16384 词表 token,token 速率压到 1/7)。
- 连续因果视频 VAE:扩散代主流,放弃离散化。Cosmos 用 WAN2.1 causal VAE(时空 4×8×8、16 通道);gaia-2-wayve 用非对称 encoder(85M)/decoder(200M)、32× 空间 + 8× 时间、64 通道(高压缩 + 高维度,token 更少更语义,总压缩比 ~384);tencent-yan 的 Yan-Sim 把 VAE 空间压缩从 8 提到 32、通道 16(1×8×8 → 2×32×32),只轻量化解码器(因只有解码延迟计入推理);hunyuanworld-voyager、skywork-matrix-game 系用 3D Causal VAE(空间 8×、时间 4×)。
时序一致性是视频 tokenizer 的专属难题:drivingworld-gpt 在 VQ 前后各插一层沿时间维自注意力缓解逐帧闪烁;epona-autoregressive-diffusion 用 Temporal-aware DCAE(32× 下采样、比 8× VAE 少 16× token)+ 解码器前插时空自注意力。
八、动作条件与长时程记忆:两个横切设计空间
动作条件注入在各代高度分化,且注入方式经消融被证明并非等价:
| 注入方式 | 代表工作 | 备注 |
|---|---|---|
| 喂进 GRU / 拼接隐状态 | planet dreamer-v2 td-mpc2 | RSSM/MLP 代标准做法 |
| one-hot 平铺成平面拼接 | muzero efficientzero | 与隐状态同分辨率 |
| 独立动作 token 插入序列 | iris doe-1 microsoft-wham-muse | AR 代标准,因果上下文自带 |
| cross-attention(离散动作) | gamefactory skywork-matrix-game | 键盘等类别信号 |
| 通道拼接(连续动作) | gamengen gamefactory | 鼠标等数值幅度信号 |
| AdaLN / FiLM 调制 | decart-oasis navigation-world-models diamond | 逐帧调制,动作影响每空间位置 |
| cross-attention + Fourier embedding | vista-driving-world-model genad-generalized-predictive-model | 实测比 additive 收敛快、可控性强 |
| 加到 timestep embedding | cosmos-predict2-5-world-simulation | 消融优于 cross-attn 与 concat |
| latent frame injection | nvidia-cosmos-policy | 动作编码成与图像同形状隐帧 |
| 潜动作无监督抽取 | adaworld videoworld | β-VAE / LDM 从帧对反推动作 |
一个反复出现的经验规律(gamefactory 明确消融):连续量拼接 + 离散量交叉注意力是最优组合——拼接保留数值幅度,交叉注意力的相似度归一化会削弱幅度但更适合类别信号。
长时程记忆与一致性是第四代的核心战场,机制可分五类:
- frame-stacking / 短上下文窗:diamond(4 帧)、gamengen(64 帧)、microsoft-wham-muse(1 秒)——最小记忆,作者多承认是瓶颈。
- KV cache 即隐式世界:world-labs-rtfm(输入帧转 KV 激活隐式代表世界)、genie-3、mirage-dynamicslab、unizero。
- 显式记忆检索 + 几何线索:worldmem(记忆单元 {帧,位姿,时间戳},按 FOV 重叠 + 时间戳检索,把记忆帧当”干净帧”塞进 Diffusion Forcing 去噪流,相对 Plücker embedding 使 300 帧后仍稳定)、skywork-matrix-game-3(相机感知记忆选择 + 头级扰动 RoPE base 打破周期性伪影)、dreamx-world-1(按位姿+视野重叠检索、带原始时间 RoPE)。
- 外部关联记忆 / NTM:game-gan(shift-based 寻址的 NTM,测试时块可从 39×39 放大到 99×99 做 loop closure)、lecun-path-autonomous-machine-intelligence(key-value 关联记忆)。
- 显式 3D / 场景缓存:hunyuanworld-voyager(世界缓存 + point culling 省 40% 存储)、abot-3dworld-0(SGP 空间生成原语)、world-labs-marble(一次性生成完整持久 3DGS,天然无漂移)、matrix-3d(网格渲染条件)。
自回归漂移的抑制手段自成一条暗线:gamengen 的 noise augmentation、decart-oasis 的 dynamic noising、skywork-matrix-game-3/alayaworld 的 error bank(把 rollout 残差注入记忆与目标两侧)、world-labs-rtfm/decart-mirage 的 history augmentation(训练时腐化历史帧、告知模型历史可能不准),本质都是”训练时暴露模型于自身生成分布”以弥合 train/inference gap。少步蒸馏(DMD / 一致性 / Self-Forcing)则是把这些重扩散骨干压进实时交互的工程闸门(the-matrix 4 步、skywork-matrix-game-3 因果学生、moworld-flash-world-model 50→4 步)。
空白与趋势
- 五代骨干正在收口而非替代。最强的近作往往是杂交:mbzuai-pan-world-model(AR VLM 骨干 + 扩散解码器 + Swin-DPM)、nvidia-cosmos-policy(扩散序列里塞策略/世界模型/价值)、owl-1(Chameleon LMM + DynamiCrafter)都是”AR 出 latent、扩散出像素、JEPA 式 latent 监督”的组合。纯单一范式的 SOTA 越来越少。
- JEPA 与生成式监督的路线之争尚未收敛。JEPA 靠丢弃不可预测细节获得高效表征与规划能力(v-jepa-2、dino-wm),但坍缩与潜转移 grounding 问题被 mbzuai-pan-world-model、lejepa、when-does-lejepa-learn-world-model 反复讨论;生成式路线画质无敌但采样贵、物理一致性靠数据堆。二者可能在”latent 预测 + 稀疏像素校验”处融合。
- tokenizer 向”更少 token、更高维度、更强因果”演进。gaia-2-wayve 的 64 通道高压缩、larp 的 holistic query、连续因果 VAE 取代离散码本,都指向”减少序列长度以支持更长上下文”。FSQ 因免码本训练正在替代 VQ。
- 实时交互是第四代的硬约束。少步蒸馏(DMD/一致性)+ KV cache + 因果化几乎成为游戏/驾驶世界模型的标配(Matrix-Game 系、Cosmos 系、world-labs-rtfm、decart-mirage),“扩散步数 50→4”与”逐帧因果 rollout”是过去一年最密集的工程投入。
- 长时程一致性仍是未解的涌现问题。genie-3 的 1 分钟一致性被官方称为 emergent、无显式记忆模块;显式记忆检索(worldmem)、3D 缓存(hunyuanworld-voyager)、error bank 各有取舍,但”无界探索下上下文不爆炸且不漂移”尚无普适解——这可能是下一代骨干(长时记忆压缩、可写外存、显隐式 3D 混合)的主战场。