这一族是什么
这条深挖线覆盖 world-model 库里 category: rl-wm 的全部 41 个工作:它们的共同点不是”生成好看的视频”,而是把学到的环境模型真正用于决策——用它来规划、想象、或做价值扩展,从而让智能体少与真实环境交互就学会控制。这与另一条”视频生成即世界模型”的支线(纯做像素预测保真度)划清了界线:本族的每一个模型,最终都要回答”这个学到的动力学怎么帮我选动作 / 学策略”。
把学到的模型”用起来”,历史上收敛出三种范式,也是本族的三条主干:
- 隐空间想象(learning in imagination)——在模型的隐空间里 rollout 出成千上万条虚拟轨迹,在这些”梦境”里用 actor-critic 学策略,真实交互只用来学动力学。代表:world-models-ha-schmidhuber → planet → dreamer-v1/dreamer-v2/dreamer-v3,以及 token/扩散 backbone 的 iris/storm/diamond 等。
- 价值等价 + 前瞻搜索(value-equivalent + lookahead)——不重建观测,只要求隐模型准确预测 reward/value/policy,把 MCTS 搬进抽象隐空间跑。代表:value-prediction-network → muzero → efficientzero/unizero。
- 隐空间 MPC / Dyna 价值扩展——用采样式局部轨迹优化(MPPI)在隐空间做在线规划(td-mpc/td-mpc2),或把模型生成的短 rollout 当增广数据喂给无模型算法(mbpo/simple-atari)。
与之正交的第二根轴,是世界模型怎么表征状态:重建式 RSSM(Dreamer 系)、价值等价的无解码器隐(MuZero / TD-MPC 系)、离散 token(IRIS 系)、还是像素空间扩散(DIAMOND)。本文先给谱系时间线,再沿这两根轴做逐成员的头对头对比,最后收在”这一族正在往哪走”。
谱系时间线
timeline title RL 世界模型族演进(2017–2026) 2017 : VPN 价值等价先驱 2018 : World Models(VAE+MDN-RNN, 梦中训练) : PlaNet(RSSM + CEM 规划) 2019 : SimPLe(像素视频预测+PPO, 提出 Atari 100k) : Dreamer v1(隐想象 actor-critic + 解析价值梯度) : MuZero(价值等价隐模型 + MCTS) : MBPO(Dyna 短分支 rollout) 2020 : DreamerV2(离散隐 + KL balancing, Atari 人类水平) 2021 : Sampled MuZero(采样搜索→连续动作) : MuZero Unplugged(reanalyse 统一在线/离线) : VQ Models(VQ 隐 + 随机/部分可观测搜索) : EfficientZero(SSL 一致性 + value prefix, Atari 100k 超人) 2022 : TD-MPC(无解码器 TOLD + MPPI + TD) : TransDreamer(首个 Transformer 世界模型) : IRIS(离散 token + GPT 自回归) : Stochastic MuZero(afterstate + chance node) : Director(层级 manager-worker) : DayDreamer(真机在线学习) : Iso-Dream(可控/不可控解耦) 2023 : DreamerV3(一套超参跨 150+ 任务, Minecraft 挖钻石) : TWM(Transformer-XL WM) : STORM(GPT + categorical VAE, 单卡高效) : TD-MPC2(SimNorm, 317M, 104 任务) : S4WM(SSM backbone 对比) : HarmonyDream(损失配平) : Dynalang(语言 + RSSM) 2024 : UniZero(Transformer 隐 WM + MCTS 联合训练) : EfficientZero V2(Gumbel search, 离散+连续统一) : Δ-IRIS(增量 token, 4 token/帧) : REM(RetNet + 并行观测预测) : DIAMOND(扩散 EDM 世界模型 + CS:GO 引擎) : R2I(S4/S5 记忆骨干) : PWM(一阶梯度离线策略提取) : DWM(扩散多步预测 offline RL) : 1X(真机视频 WM 做策略评估) 2025 : AdaWorld(潜动作预训练) : TWISTER(动作条件对比预测) : SIMA2(通用具身智能体 + Genie3) 2026 : Cosmos Policy(视频 WM 即策略+价值) : RynnWorld-4D / Teleop(4D / 数字遥操作世界模型)
一条清晰的技术主线贯穿全程:表征从像素→VAE 隐→RSSM 双通道隐→离散/token 隐→无解码器价值等价隐→回到像素扩散;“用法”从进化 controller→CEM 规划→MCTS 搜索→隐想象 actor-critic→MPPI 规划;backbone 从 MDN-RNN→GRU→Transformer/RetNet/SSM→Diffusion。而衡量所有这些进步的公共擂台,2019 年后基本锁定在 Atari 100k(每个游戏只准 10 万步交互 ≈ 2 小时真人游戏)和 DMControl 连续控制上。
主干一:隐空间想象(World Models → PlaNet → Dreamer 系)
起点:把大脑拆成”大模型 + 小控制器”
world-models-ha-schmidhuber(2018)用 VAE 把每帧压成 32/64 维隐向量 $z$、用 MDN-RNN(5 混合高斯)建模 $P(z_{t+1}\mid a_t,z_t,h_t)$,再用 CMA-ES 只进化一个几百参数的线性 controller(CarRacing 867 参数、Doom 1088 参数)。它给现代深度 RL 语境命名了 “world model”,并首次演示”完全在世界模型生成的梦境里训练策略、再零样本迁回真实环境”(VizDoom Take Cover,真实环境 100 次平均 1092 步,远超 750 门槛)。它也点出了这一族最持久的隐患——策略会钻模型的空子(让梦里怪物永不发射火球),并给出解法:调温度 $\tau$ 往梦境注不确定性($\tau=1.15$ 是迁移最优)。
RSSM:这一族的地基
planet(2018)提出 RSSM(Recurrent State-Space Model):把隐状态拆成确定性通道 $h_t$(GRU 200 units)+ 随机通道 $s_t$(30 维对角高斯),消融证明两条通道缺一不可(确定性负责跨多步记忆,随机负责表达多模态未来 + 给规划加安全裕度)。PlaNet 不训任何 policy/value,纯靠 CEM 在隐空间在线规划(horizon 12、每步评估 10×1000=1 万条想象序列),在 6 个 DMControl 图像任务上用约 1000 个 episode 逼近训了 10 万 episode 的 D4PG,平均省约 200× 交互。RSSM 从此成为 Dreamer 三代乃至 Director/DayDreamer/Iso-Dream/Dynalang/R2I 的共同骨架。
Dreamer 三代:把”怎么从模型导出行为”做成范式
| 维度 | dreamer-v1(2019) | dreamer-v2(2020) | dreamer-v3(2023) |
|---|---|---|---|
| 隐状态 | 30 维连续高斯 | 32×32 分类离散(1024 维稀疏 one-hot) | 分类离散 + 1% unimix 混合 |
| 关键创新 | 多步 λ-return 价值的解析梯度穿过动力学反传 | 分类隐 + straight-through、KL balancing(先验 α=0.8 / 后验 0.2) | symlog + symexp-twohot、free bits、百分位 return 归一化、block-GRU |
| actor 梯度 | 重参数化动力学反传 | Atari 纯 Reinforce(ρ=1),连续控制纯动力学反传(ρ=0) | Reinforce(离散连续通用)+ 固定熵 η=3e-4 |
| 招牌成果 | DMC 20 任务 5M 步 823 分 > D4PG(10⁸步) 786 | 首个纯世界模型在 Atari 达人类水平,55 游戏单卡 <10 天 | 一套超参跨 8 域 150+ 任务;首个无人类数据在 Minecraft 挖到钻石(10/10 seed 100M 步内挖到,首钻约 30M 步) |
| 规模 | — | 22M(WM 20M + actor/critic 各 1M) | 6 档 12M→400M,性能随规模单调涨且更省数据 |
| 算力 | 单张 V100,5M 步约 16h | 单张 V100,200M 步 <10 天 | 单张 A100:Minecraft 8.9 GPU-天、Atari 7.7、视觉控制 0.1 |
三代的技术叙事很干净:v1 立起”隐想象 actor-critic + 解析价值梯度”的骨架(value 网络管想象窗口外的回报,动力学梯度管窗口内),把 PlaNet 昂贵的在线 CEM 规划换成一次前向采样的 actor;v2 只改两处(离散隐 + KL balancing)就把世界模型精度推过人类水平线(消融:分类 vs 高斯 42/55 游戏更优,KL balancing 44/55 更优);v3 靠一整套跨尺度鲁棒的预测/归一化变换(symlog、symexp-twohot、free bits、百分位归一化)实现”一套配置零调参跨域”,并揭示一个反直觉发现——DreamerV3 主要靠世界模型的无监督重建损失学表征(停重建梯度掉得比停 reward/value 梯度更狠),为”用互联网视频预训练世界模型”指了方向。
Dreamer 谱系的横向扩展
RSSM 骨架被后人从各个维度加料,构成一大簇 Dreamer 变体:
| 工作 | 相对 Dreamer 的改动 | 解决的问题 | 招牌数字 |
|---|---|---|---|
| director(2022) | RSSM 上加 manager-worker 层级:manager 每 8 步在离散 goal-autoencoder 空间选子目标,worker 用 max-cosine 相似度追目标 | 稀疏奖励下的时间抽象 / 层级探索 | 唯一在四足第一视角迷宫 + Visual Pin Pad 两个稀疏奖励基准都成功;worker 完全不看任务奖励也能广泛工作 |
| daydreamer(2022) | DreamerV2 原样搬上 4 台真机,补异步 actor/learner 系统工程 | 真机在线 RL 的样本效率 | Unitree A1 1 小时从躺地学会走路,被推倒 10 分钟内学会抗推 |
| iso-dream(2022) | RSSM 拆成可控 / 不可控但可预测 / 静态三分支,逆动力学损失约束可控分支 | 背景噪声动态(车流、水波)干扰控制 | DMC 噪声背景 + CARLA 自驾全面超 DreamerV2 |
| transdreamer(2022) | RSSM 的 GRU 换成 TSSM(Transformer 状态空间模型),表征后验去掉对 $h_t$ 依赖以保并行 | RNN 无法直接访问历史、长程记忆弱 | 自建 Hidden Order Discovery 记忆任务 2D 4-Ball 成功率 23% vs DreamerV2 7% |
| harmonydream(2023) | 把 WM 学习重构为观测建模 vs 奖励建模的多任务问题,加 3 个可学习标量自动配平损失尺度 | 观测损失(H×W×C 维)系统性压制奖励损失(标量) | DreamerV3 在 Atari 100k 刷到 136.5% 人类归一化均值 |
| dynalang(2023) | RSSM 扩多模态,语言 token 与图像帧同步逐步输入,联合预测未来文本/图像/奖励 | 利用不能直接归因到 reward 的多样语言(规则、描述、纠错) | HomeGrid/Messenger/VLN-CE/LangRoom 超 IMPALA、R2D2 |
| s4wm-world-model-backbones(2023) | 首个兼容可并行 SSM(S4/S5)的世界模型骨架,正面对比 RNN/Transformer/S4 三骨架 | 长程记忆容量(序列长到 2000 步) | S4WM 在长期想象/召回/奖励预测/记忆推理四项全面超 RSSM 与 TSSM-XL |
| recall-to-imagine-r2i(2024) | 把 S4/S5(对角 MIMO SSM + parallel scan + 可重置隐状态)塞进 DreamerV3 做 S3M 骨架,并把 SSM 隐状态暴露给策略 | 长程记忆 + 长程 credit assignment | Memory Maze 首次超越人类;BSuite 记忆延迟上限 30→100 步;训练比 DreamerV3 快最多 9× |
| twister-contrastive-world-model(2025) | Transformer 世界模型加**动作条件对比预测编码(AC-CPC)**辅助损失,预测未来 10 步高层特征 | ”预测下一步隐状态”目标不足以发挥 Transformer 表征力 | Atari 100k 无搜索类新纪录 162% 人类归一化均值 |
值得单列的是 simple-atari(SimPLe,2019):它是 Atari 100k 基准的提出者,走的是像素级视频预测 + PPO 在脑内模拟器训练的老路(离散隐变量随机模型),第一个在 ALE 上证明”学到的模型 + model-based 控制”能打过 model-free(Freeway 上样本效率最多 10×),是 IRIS/DIAMOND 这条”在想象里学”支线的直接先声,尽管其自身分数(mean 0.332)后来被全面超越。
主干二:价值等价 + 前瞻搜索(VPN → MuZero → EfficientZero → UniZero)
价值等价模型的思想
这条支线的核心信条与 Dreamer 相反:不要求隐状态能重建观测、也不要求它匹配真实环境状态,只要求”在抽象 MDP 里规划 ≈ 在真实环境里规划”(沿抽象轨迹累积的 reward/value 一致)。value-prediction-network(VPN,2017)是最早把这一思想接到”动作驱动的抽象 MDP + 前瞻树搜索”上的工作:编码 $h$、转移 $trans$、outcome(reward+discount)、value 四模块共享参数,训练目标不是重建像素而是直接预测未来 option-reward/discount/value;实证发现观测预测模型(OPN)在随机环境里会退化为预测”平均未来观测”($V(E[x])\ne E[V(x)]$),而 VPN 的抽象状态不受此约束。MuZero 论文明确称 VPN 是其”最接近的前身”(VPN 缺 policy 头、搜索只靠 value)。
MuZero:把学到的模型和 MCTS 真正合一
muzero(2019)用表示 $h$ / 动力学 $g$ / 预测 $f$ 三件套(预测 reward·value·policy 三个量),把 alphazero 的 MCTS 整个搬进抽象隐空间——全程不知道环境真实规则、从不重建像素。它终结了”model-based 在 Atari 打不过 model-free”的旧格局(Atari 大数据设定 median 2041% / mean 4999%,20B 帧 12 小时超过 R2D2 的 37.5B 帧 5 天),同时在围棋/象棋/将棋上匹配甚至略超拿着完美模拟器的 AlphaZero。它把 AlphaZero 从”双人、无折扣、±1 终局奖励”推广到”单智能体、带折扣、任意幅度中间奖励”,并埋下了整条 MuZero 谱系。
MuZero 谱系:补齐每一块短板
| 工作 | 补的短板 | 关键机制 | 招牌数字 |
|---|---|---|---|
| sampled-muzero(2021) | MCTS 默认枚举全部动作,无法处理连续/高维动作 | 节点展开时从策略采 K 个动作 + 重要性加权先验 $\hat\pi_\beta\propto(\hat\beta/\beta)\pi$ | 56 维 CMU 人形;围棋 K=50/362、Atari K=3/18 即逼近全枚举 |
| muzero-unplugged(2021) | 在线/离线/数据高效 RL 被当三个问题 | 把 Reanalyse(用最新参数对存量数据重跑 MCTS 生成新目标)推到极限,调 fraction 0%→100% 无缝跨在线到离线 | RL Unplugged Atari median 265.3%(BC 53%、CRR 156%);仅换 ResNet-v2+Adam 就把在线 Atari median 从 742%→1006% |
| vq-models-planning(2021) | 确定性模型无法应对随机/部分可观测 | 把环境响应编码成 VQVAE 离散 latent code,搜索树在动作节点 + 环境 code 节点上交替展开 | 单人视角象棋恢复双人 MuZero 水平;DeepMind Lab 验证可扩展 |
| stochastic-muzero(2022) | MuZero 动力学是确定性的 | afterstate 分解(动作效果→机会事件两段)+ 无解码器定制 VQ-VAE(codebook M=32)+ MCTS 加 chance node | 2048 / 双陆棋匹配拿完美模拟器的 AlphaZero;双陆棋学到的 chance code 数恰好=21(两骰子组合数) |
| efficientzero(2021) | MuZero 在低数据(Atari 100k)失效 | 三件套:SimSiam 时序一致性损失 + LSTM 端到端 value prefix + 基于模型的 off-policy 校正 | 首个 Atari 100k 均值+中位数双超人(1.943 / 1.090);开源把门槛从 64 TPU×12h 降到 4×3090×7h |
| efficientzero-v2(2024) | EfficientZero 只能纯离散动作 | 采样式 Gumbel search(保证连续动作策略提升)+ 基于搜索的价值估计 SVE 替代自适应 TD | 66 任务中 50 个超 DreamerV3;Atari 100k 2.428 / 1.286;规划仅需 32 个想象状态 vs TD-MPC2 的 9216 |
| unizero(2024) | MuZero 隐状态与历史纠缠、训练轨迹利用不足 | Transformer 骨架显式解耦隐状态 $z_t$ 与隐式历史 $h_t$,KV Cache 保留完整上下文;SimNorm 归一化 | VisualMatch 长程记忆稳定高成功率;DMControl 18 任务均值 787.2 > DreamerV3 743.7;保留 MCTS + 模型-策略联合训练 |
这条线的一个关键分野:除 UniZero 外,Dreamer/TD-MPC/IRIS/STORM 都是”先学世界模型、再用想象/MPC 学策略”的两阶段流水线;而 MuZero 与 UniZero 坚持”模型-策略联合优化 + MCTS 策略提升”的单阶段范式。UniZero 也顺手证明了不需要观测重建(消融显示 decode regularization 无收益),把 IRIS 的 token 化 backbone 与 MuZero 的搜索范式接了起来(代码合入 lightzero benchmark)。
主干三:隐空间 MPC(TD-MPC → TD-MPC2 → PWM)与 Dyna 支线
TD-MPC:无解码器 + MPPI + TD
td-mpc(2022)主张”建模整个环境是过度建模”——重建观测容易把光影等无关细节建进模型引入 bias。它在隐空间联合训练一个只需预测 reward/value 的任务导向动力学模型 TOLD(用 latent consistency loss 替代重建,无 decoder)和一个 TD 学出的终端价值函数,推理时用 MPPI 在短 horizon(H=5)局部轨迹优化、拿价值函数 bootstrap 长期回报。相比 MuZero/EfficientZero 的 MCTS 受限于离散/低维动作,TD-MPC 用 MPPI 直接吃 38 维连续动作,是文中首个记录在案解出 DMControl Dog 任务的方法(3M 步内解出全部 6 个 Humanoid/Dog 任务,既有工作通常需 30M 步),单卡 3090 上约 20ms/决策(50Hz)。
TD-MPC2:把这条路线做到可扩展
td-mpc2(2023)把 TD-MPC 从百万参数放大到 317M、跨 80 个任务 12 种具身联合训练,证明 model-based RL 也能随规模稳定涨点(80 任务归一化分 1M→16.0、5M→49.5、317M→70.6,随 log 参数近似线性、未饱和)。关键改动:SimNorm 隐归一化(把 $z$ 切成 L 个 simplex 各做 softmax,VQ 的软松弛版,训练稳定性关键)、NormedLinear(Linear+LayerNorm+Mish)、奖励/值离散回归、5-Q ensemble、零填充 + 动作掩码 + 可学习任务嵌入处理多具身。它明确定位为能吃”混质量(uncurated)“数据、从 random→expert 全谱系里用 RL 抽专家行为的路线(区别于 Gato/RT-1 的行为克隆),开源 324 个 checkpoint + 545M/345M transition 两套数据集。SimNorm 后来被 unizero 直接借用。
pwm-multitask-world-models(2024)是 TD-MPC2 的一个反直觉延伸:复用同一个预训练 TD-MPC2 世界模型,把策略抽取从”在线 MPC 采样规划”换成”对世界模型直接做一阶梯度反传的离线策略提取”,每任务 <10 分钟学出的策略甚至超过用真实仿真器梯度的 SHAC——核心发现是世界模型对策略学习的价值不在预测精度,而在于它诱导的优化地形是否光滑、最优性 gap 是否够小。
Dyna 支线:模型生成数据增广
mbpo(2019)是”Dyna 式短程分支 rollout + 集成动力学模型 + SAC”的奠基与命名工作:从真实 replay buffer 采状态起点、用模型只往前走 k 步(k 远小于任务 horizon),把模型 rollout 长度与任务 horizon 解耦。它给出了”该信多少模型 / rollout 该多长”的理论分析(把悲观 PAC 误差界改成能经验估计的模型泛化斜率,论证非零最优 rollout 长度存在),Ant 上 30 万步达到 SAC 300 万步的表现(10× 样本效率)。与 MuZero/Dreamer 不同,MBPO 不对模型求导、也不做搜索,只把模型转移当真实数据喂给标准无模型 RL——是”想象/规划 + 无模型策略优化”这一大类工作的公共分析框架。
主干四:token / Transformer / 扩散 backbone
这一支的问题意识:RSSM 的 GRU 串行、长程记忆弱,能不能换更强的序列 backbone?而图像不像文本有天然词表——朴素把像素当 token 会让序列爆炸。答案分成三条路。
token 化自回归(IRIS 系)
iris(2022)把世界模型拆成离散自编码器(VQVAE,每帧压成 K=16 个 image token,词表 512)+ GPT 式自回归 Transformer(在 token 序列上逐 token 预测下一帧/奖励/终止),策略在这个”梦境”里用 actor-critic 学。它把动力学学习整体转写成离散 token 序列建模,在 Atari 100k 上以 mean 1.046、10/26 超人成为无 lookahead search 类新 SOTA(还超过了非样本高效设定的 MuZero),并证明自监督训练目标让标准 Transformer 无需 GTrXL 式 gating 就能稳定学世界模型。IRIS 的两个瓶颈——每帧 token 太多导致注意力平方开销、想象阶段逐 token 串行生成——催生了三个后续:
| 工作 | 攻击的瓶颈 | 机制 | 招牌数字 |
|---|---|---|---|
| delta-iris(2024) | 每帧独立编码,视觉复杂环境要太多 token | 只编码帧间随机增量(Δ-token,每帧 4 个),确定性动力学交给条件解码器;序列里插连续 I-token(软确定性状态) | Crafter 10M 帧平均解 17/22 成就(新 SOTA);Atari 100k mean 1.39;比 IRIS 训练快一个数量级、推理 20 FPS vs IRIS 2 FPS |
| rem-parallel-observation-prediction(2024) | 想象阶段逐 token 串行生成(K·H 次调用) | RetNet 骨干 + 并行观测预测 POP:用专用预测 token 批量查询循环状态,串行调用降到 2H | 想象阶段 15.4× 加速;Atari 100k IQM 0.673、12/26 超人;训练 <12h;token 网格提到 8×8 |
| storm(2023) | IRIS 16 token/帧 + 10 层 Transformer 太慢 | GPT 因果 Transformer 换掉 GRU,但保留 DreamerV2/V3 的 categorical VAE + 单 latent token、仅 2 层 Transformer | Atari 100k mean 126.7% / median 58.4%(无搜索类新纪录);单卡 3090 4.3h 训完(五方法中最省) |
STORM 顺带给出一个反 scaling 的数据点:Transformer 层数从 2 增到 4/6 层在 Atari 100k 上不涨反可能有害(数据量小、领域单一喂不饱大模型),是”Transformer 越大越好”直觉的反例。
非 token 化 Transformer / SSM
twm-transformer-world-model(2023)把 backbone 换成 Transformer-XL,把隐状态/动作/奖励三种模态各自嵌入后拼成 token 序列自回归,但让策略只吃隐状态 $z$、不吃 Transformer 输出 $h$——因此真机推理时完全不需要跑 Transformer(CPU 上 653 帧/秒 vs 吃 [z,h] 的 213 帧/秒)。Atari 100k mean 0.956 / median 0.505,全面超 SimPLe/DER/CURL/DrQ/SPR。transdreamer(前述,Dreamer 分支)是更早的 Transformer 世界模型尝试。s4wm-world-model-backbones / recall-to-imagine-r2i(前述)则把 backbone 换成可并行 SSM。这些工作共同表明:“世界模型该用什么序列 backbone”本身是一个独立的、正交于”怎么用模型”的设计空间。
扩散世界模型
diamond(2024)把当时图像生成”扩散取代离散 token”的范式迁移搬进世界模型:用连续像素空间的条件扩散模型直接预测下一帧观测,绕开离散化的信息瓶颈。核心论点是”视觉细节 matters”——IRIS 式离散压缩会丢掉对 RL 关键的几像素细节(远处红点奖励、敌人 vs 奖励)。关键架构决策是用 EDM 而非 DDPM(信号/噪声自适应混合让极少去噪步下长时程稳定,破解自回归复合误差),全实验统一 n=3 去噪步。它拿下 Atari 100k 完全在世界模型内训练的新 SOTA(mean HNS 1.459、11/26 超人),并证明同一个扩散世界模型能脱离 RL 单独当可玩神经游戏引擎(87 小时 CS:GO 数据训出 Dust II 地图神经模拟器,RTX 3090 上 10Hz 键鼠实时操控)。
diffusion-world-model-offline-rl(DWM,2024)走的是另一条扩散路线:用条件扩散模型一次前向预测未来多步的状态与奖励(而非逐步递归查询单步动力学),接入 Dyna 式 value expansion 训练离线 RL 价值函数,在 D4RL 9 个 locomotion 数据集上比传统单步动力学模型高 44%,与最强 model-free(TD3+BC/IQL/Decision Diffuser)持平。
头对头总表:主线成员
| 成员 | 年 | 机构 | 范式 | backbone / 表征 | 模型怎么用 | 主 benchmark | 招牌数字 |
|---|---|---|---|---|---|---|---|
| world-models-ha-schmidhuber | 18 | Google Brain/IDSIA | 想象 | VAE + MDN-RNN | 梦中进化 controller | CarRacing / VizDoom | CarRacing 906±21(首次解出);梦中训练迁真机 1092 步 |
| planet | 18 | Google/DeepMind | 隐规划 | RSSM($h$+$s$) | CEM 在线规划(无 policy) | DMControl 6 图像任务 | 1000 episode 逼近 D4PG(10⁵),省约 200× |
| dreamer-v1 | 19 | Google/DeepMind | 想象 | RSSM 连续隐 | 隐想象 actor-critic + 解析价值梯度 | DMC 20 视觉任务 | 5M 步 823 分 > D4PG(10⁸) 786 |
| dreamer-v2 | 20 | Google/DeepMind | 想象 | RSSM 32×32 分类隐 | 隐想象 actor-critic | Atari 55 | 首个纯 WM 达 Atari 人类水平;单卡 <10 天 |
| dreamer-v3 | 23 | DeepMind | 想象 | RSSM 分类隐 + symlog | 隐想象 actor-critic | 8 域 150+ 任务 | 一套超参跨域;Minecraft 挖钻石;单张 A100 |
| muzero | 19 | DeepMind | 搜索 | 价值等价隐(无重建) | 隐空间 MCTS | Atari 57 + 棋类 | Atari median 2041%;围棋匹配 AlphaZero |
| efficientzero | 21 | 清华/Berkeley | 搜索 | 价值等价隐 + SSL | 隐空间 MCTS | Atari 100k | 1.943 / 1.090(首个双超人);4×3090×7h |
| unizero | 24 | 上海 AI Lab | 搜索 | Transformer 隐(解耦 $z$/$h$) | MCTS + 模型-策略联合 | Atari 100k / DMC / VisualMatch | DMC 18 任务 787.2 > DreamerV3;长程记忆稳定 |
| td-mpc | 22 | UCSD | 隐 MPC | 无解码器 TOLD(MLP) | MPPI 局部规划 + TD | DMC/Meta-World 92 任务 | 首解 Dog;3M 步解 6 个高维 locomotion |
| td-mpc2 | 23 | UCSD | 隐 MPC | 无解码器 + SimNorm | MPPI + 终端值 | 104 任务 4 域 | 317M 跨 80 任务;随规模线性涨点 |
| iris | 22 | Geneva | 想象 | 离散 token(VQVAE+GPT) | token 想象 actor-critic | Atari 100k | mean 1.046,无搜索类 SOTA,超 MuZero |
| storm | 23 | 北理工 | 想象 | categorical VAE + 2 层 GPT | token 想象 actor-critic | Atari 100k | mean 126.7%;单卡 4.3h |
| diamond | 24 | Geneva/Edinburgh/MSR | 想象 | 像素扩散(EDM) | 扩散想象 actor-critic | Atari 100k + CS:GO | mean HNS 1.459(WM 内训练 SOTA);CS:GO 10Hz 可玩引擎 |
Atari 100k 擂台(人类归一化,横跨全族)
这是本族最密集的公共对照。区分**无 lookahead search(在想象里学)与有搜索(MCTS)**两类很重要,因为搜索可叠加在世界模型之上:
| 方法 | 类别 | Mean | Median | IQM | 超人数(/26) |
|---|---|---|---|---|---|
| simple-atari SimPLe | 想象 | 0.332 | 0.134 | 0.130 | 1 |
| twm-transformer-world-model TWM | 想象 | 0.956 | 0.505 | 0.459 | 8 |
| iris IRIS | 想象 | 1.046 | 0.289 | 0.501 | 10 |
| dreamer-v3 DreamerV3 | 想象 | 1.097–1.124 | ~0.49 | 0.49–0.50 | 9 |
| rem-parallel-observation-prediction REM | 想象 | 1.222 | 0.280 | 0.673 | 12 |
| storm STORM | 想象 | 1.267 | 0.584 | 0.636 | 10 |
| harmonydream HarmonyDream(+DreamerV3) | 想象 | 1.365 | — | — | — |
| delta-iris Δ-IRIS | 想象 | 1.39 | — | 0.65 | 11 |
| diamond DIAMOND | 想象 | 1.459 | — | 0.641 | 11 |
| twister-contrastive-world-model TWISTER | 想象 | 1.62 | — | — | — |
| muzero MuZero(Reanalyze) | 搜索 | 0.562 | 0.227 | — | 5 |
| efficientzero EfficientZero | 搜索 | 1.943 | 1.090 | — | 14 |
| efficientzero-v2 EfficientZero V2 | 搜索 | 2.428 | 1.286 | — | — |
读法:无搜索类的天花板从 SimPLe 0.33 一路被 IRIS/DreamerV3/STORM/Δ-IRIS/DIAMOND/TWISTER 抬到 1.6(backbone 从 RSSM→token→扩散→对比学习一路换);有搜索类(EfficientZero 谱系)因为叠加了 MCTS + SSL + off-policy 校正,数字更高(2.4),但代价是训练/推理复杂度、且难与无搜索类公平比较。DreamerV3 的独特价值不在 Atari 100k 单点最高,而在同一套超参还能跨 150+ 任务。
全族共享的设计模式
抽掉表面的 backbone 差异,这一族沉淀出一批反复出现的”套路”:
- 确定性 + 随机双通道隐状态:PlaNet 的 RSSM 定下 $h_t$(记忆)+ $s_t$(多模态未来 + 规划安全裕度)拆分,被 Dreamer 三代、Director、DayDreamer、Iso-Dream、Dynalang、R2I 全盘继承;TransDreamer/S4WM 只是把 $h_t$ 的计算从 GRU 换成 Transformer/SSM。
- 离散隐 + straight-through:DreamerV2 用 32×32 分类隐替掉高斯(分类先验能拟合多模态聚合后验),从此离散 latent + straight-through 成了 STORM/TWM 的默认;IRIS/Δ-IRIS/REM/VQ-models/Stochastic-MuZero 则走 VQ-VAE 离散码本这条平行路线。
- stop-gradient + KL balancing / free bits:DreamerV2 的 KL balancing(先验学得比后验快)+ DreamerV3 的 free bits,被 STORM、R2I 直接沿用;EfficientZero/UniZero 的时序一致性损失也靠 stop-gradient 的 target 分支(SimSiam/EMA)成形。
- 无解码器 / 价值等价:MuZero、TD-MPC、TD-MPC2、UniZero、Stochastic-MuZero 都不重建观测,只让隐状态服务于 reward/value/policy 预测——UniZero 甚至用消融证明 decode regularization 无收益。这与 Dreamer 系”靠重建塑造表征”形成本族内部最根本的两派分歧。
- 想象 horizon + λ-return + value bootstrap:H≈15、λ=0.95、γ≈0.99–0.997 是 Dreamer/IRIS/STORM/Δ-IRIS/REM/DIAMOND/R2I 的共同配方;value 网络负责想象窗口外的回报,这是 Dreamer v1 相对固定窗口”短视”方法的关键突破。
- 跨尺度鲁棒变换:DreamerV3 的 symlog + symexp-twohot 离散回归(把梯度大小与目标大小解耦)被 STORM、Δ-IRIS、R2I 采纳;TD-MPC2、EfficientZero 系也都用 101/51-bin 离散回归(C51 式)稳住不同任务的奖励尺度。
- SimNorm 隐归一化:TD-MPC2 发明、UniZero 借用——把隐向量切成 simplex 做 softmax,是 VQ 的软松弛,被证明是训练稳定性的关键旋钮。
- 样本效率作为公共货币:从 PlaNet 的”省 200ד到 Atari 100k(省 500×)、DMControl-100k,整条线的进步几乎都以”用更少真实交互达到同等性能”来度量;想象/搜索本质上是用算力放大稀缺的真实数据(DreamerV2 在 200M 步里想象出 4680 亿个隐状态,是真实输入的约 1 万倍)。
这一族正在往哪走
1)Scaling 与”决策基础模型”。 TD-MPC2(317M、80 任务、随 log 参数线性涨点未饱和)、DreamerV3(12M→400M 单调涨且更省数据)、UniZero(自称 scalable foundational model for decision-making)共同指向一个方向:model-based RL 也能吃 scaling law,只要 backbone 和归一化足够鲁棒。PWM 进一步暗示,预训练世界模型的价值可能主要在”提供光滑的优化地形”而非预测精度。
2)离散 + 连续、单任务 + 多任务的统一。 EfficientZero V2 用 Gumbel search 把 MuZero 谱系从纯离散扩到连续;UniZero 用一套架构横跨短/长程记忆、离散/连续、单/多任务;TD-MPC2 用零填充 + 动作掩码 + 任务嵌入吃多具身。“一个模型通吃所有控制场景”是共同野心,但都还没做到真正的开箱即用(TD-MPC2 自陈离散动作仍是 open problem,UniZero 多任务平衡待解)。
3)Backbone 仍在换代。 RSSM(GRU)→ Transformer(IRIS/STORM/TWM/UniZero)→ RetNet(REM)→ SSM(S4WM/R2I)→ Diffusion(DIAMOND/DWM),每次换代都对应”更强的长程记忆 / 更高的视觉保真 / 更快的想象吞吐”。S4WM、R2I 揭示 SSM 在长程记忆上的独特优势,而 DIAMOND 揭示像素扩散在视觉细节上的独特优势——未来大概率是混合架构(SSM + attention,或 token + 扩散)。
4)与”视频生成即世界模型”支线的合流。 这是最大的趋势。DIAMOND 已经证明同一个扩散世界模型既能服务 Atari 的 RL 想象、又能当 CS:GO 可玩神经引擎。库里 2024 年后的一批工作正是这条合流线:1x-world-model(用真机第一视角视频训动作条件 WM,把”如何评估机器人策略”重构为”学一个可学习模拟器”)、adaworld(从无标注视频自监督抽连续潜动作预训练,零训练迁移动作或 100 样本微调学新动作空间)、deepmind-sima2(Gemini 为核心的通用具身智能体,与 Genie 3 生成世界组成”智能体 × 世界模型”栈,演示开放式自改进)、nvidia-cosmos-policy(把预训练视频世界模型 Cosmos-Predict2 原样当机器人策略,一个模型兼任策略/世界模型/价值,LIBERO 98.5%)、alibaba-rynnworld-4d(RGB+Depth+光流三模态 4D 世界模型 + 逆动力学策略头)、alibaba-rynnworld-teleop(动作条件世界模型替代真机做”数字遥操作”,产出(视频,动作)轨迹对,单 H100 40+ FPS,纯合成数据零样本 Sim2Real)。
这批工作把本族的两条内在张力推到台前:表征该重建到什么程度(价值等价的极简 vs 视频生成的高保真),以及世界模型该服务谁(在想象里训 RL 策略,vs 直接当策略/模拟器/评估器)。从 Ha & Schmidhuber 用 MDN-RNN 在梦里进化一个 867 参数的 controller,到 NVIDIA 把整个视频扩散大模型当策略跑真机双臂 ALOHA——变的是规模和 backbone,不变的是那个 2018 年就立好的信条:learn a model of the world, then act inside it(学一个世界的模型,然后在里面行动)。
家族成员索引(按范式)
- 隐空间想象 / RSSM 系:world-models-ha-schmidhuber、planet、dreamer-v1、dreamer-v2、dreamer-v3、director、daydreamer、iso-dream、transdreamer、harmonydream、dynalang、s4wm-world-model-backbones、recall-to-imagine-r2i、twister-contrastive-world-model、simple-atari
- 价值等价 + MCTS 系:value-prediction-network、muzero、sampled-muzero、muzero-unplugged、vq-models-planning、stochastic-muzero、efficientzero、efficientzero-v2、unizero
- 隐空间 MPC / Dyna 系:td-mpc、td-mpc2、pwm-multitask-world-models、mbpo
- token / Transformer / 扩散 backbone:iris、delta-iris、rem-parallel-observation-prediction、storm、twm-transformer-world-model、diamond、diffusion-world-model-offline-rl
- 视频生成即世界模型 / 具身合流:1x-world-model、adaworld、deepmind-sima2、nvidia-cosmos-policy、alibaba-rynnworld-4d、alibaba-rynnworld-teleop