一句话定位
Moerland、Broekens、Plaat、Jonker(Leiden/TU Delft)的纲领性综述:给出模型基础强化学习(model-based RL)第一套系统分类学——用「是否有模型」「是否存全局解」两条轴把 planning / model-free RL / model-based RL 三分(Table 1、2),再把「规划-学习整合」拆成四个正交维度(从哪个状态开始规划、分配多少预算、怎么规划、如何接入学习-行动循环,Table 3),并单列 implicit(端到端)model-based RL 一章覆盖 muzero 这类价值等价模型。全文不训练任何模型、不做任何实验,是一篇纯概念/方法论综述(47 页正文),2020-06 首版、2022-03 修订到 v4,在 model-based RL 与世界模型文献中被广泛引用作共同术语表。
背景与定位
RL 与 planning 长期是两条并行发展的路线:planning 依赖对 MDP 动力学的可逆访问(模型),能在同一状态反复推演,但只存局部解(推完就弃);model-free RL 只有不可逆的真实交互访问,但会存全局解(策略/价值函数覆盖整个状态空间)。本文按”是否有模型 × 是否存全局解”重新定义三者(Table 1):planning = 模型 + 局部解;RL = 全局解(不论有无模型);model-based RL = 模型 + 全局解。这个定义特意把 AlphaZero 这种”用模型做 MCTS 却输出全局策略/价值网络”的方法划进 model-based RL,而不是 planning。
在 model-based RL 内部,“学习”可以发生在两个位置——学模型、学全局解——由此产生三个互斥子类(Table 2):model-based RL with a learned model(模型和解都学,例:Dyna)、model-based RL with a known model(模型已知,只学解,例:AlphaZero、动态规划)、planning over a learned model(只学模型不学全局解,例:Embed2Control,因不存全局解,严格说不算 model-based RL 但仍属规划-学习整合范畴)。
综述指出此前领域缺一篇系统综述:Hester & Stone (2012) 只是书章节、未覆盖深度神经网络时代文献;Hamrick (2019) 聚焦认知科学视角的 mental simulation;Moerland et al. (2020a) 给规划/RL 共享维度但不谈整合;Plaat et al. (2020) 侧重隐式/端到端方向。本文定位为填补”model 学习 + 规划-学习整合 + 隐式 MBRL + 收益”四段的系统覆盖,并作为后续世界模型工作(如 dreamer-v1、dreamer-v2、dreamer-v3、planet)共享的分类框架来源之一。
模型架构
本文不提出神经网络架构,其”架构”贡献是分类学定义本身:
MDP 形式化:{S, A, T, R, p(s0), γ},标准 Bellman 方程与最优策略定义,构成后文分类的共同语言。
动力学模型学习的三个基本考量(Sec 4.1):
- 模型类型:forward model
(s,a)→s'(最常用,支持前向 lookahead)、backward/reverse models'→(s,a)(用于 prioritized sweeping 反向传播)、inverse model(s,s')→a(用于 RRT 规划、也用作表征学习的辅助损失)。 - 估计方法:parametric-exact(表格式最大似然模型
T(s'|s,a)=n(s,a,s')/Σn(s,a,·),维数灾难)vs parametric-approximate(线性回归、DBN、随机森林、神经网络);non-parametric-exact(replay buffer)vs non-parametric-approximate(Gaussian Process,可给不确定性但高维计算代价大)。 - 有效区域:global(全状态空间近似,主流)vs local(每次只拟合当前状态附近的局部线性模型,用完即弃,见于控制界)。
神经网络式状态抽象的标准三段分解(Sec 4.7,Figure 2 arrow 4):编码函数 z_t=f_enc(s_t) → 隐动力学 z_{t+1}=f_trans(z_t,a_t) → 解码 ŝ_{t+1}=f_dec(z_{t+1}),形如带隐动力学的自编码器;文中讨论了在此结构上叠加 iLQR 线性化规划、物理先验的 grey-box 混合、以及 object-oriented / graph-network 式表征(Schema Networks、Interaction Networks、Neural Physics Engine、Structured World Models、COBRA)。
规划-学习整合的四维分类学(Table 3,本文核心贡献之一):
- 起始状态(5.1):uniform(如动态规划全扫)↔ visited(如 Dyna)↔ prioritized(如 Prioritized Sweeping)↔ current(如 AlphaGo Zero)。
- 预算(5.2):真实步与规划步的配比 + 每轮规划的努力量(1 ↔ n ↔ 收敛为止)。文中用具体数字对比 Dyna 与 AlphaGo Zero:Dyna 每个真实步后最多做 100 次一步规划(100 次迭代 × 预算 1 = 总预算 100);AlphaGo Zero 每个真实步做 1 次 MCTS,含 1600 条轨迹、每条约 200 层深,总预算 ≈ 1600×200 = 320,000——两者预算相差约 3200 倍。
- 怎么规划(5.3):type(离散搜索 MCTS/minimax ↔ 梯度式 value-gradient,需模型可微,例:dreamer-v1/Dreamer 系、PILCO)、direction(forward ↔ backward/prioritized sweeping)、breadth/depth(1 ↔ adaptive ↔ full)、uncertainty 处理方式(data-close ↔ 不确定性传播,传播方法再分 parametric ↔ sample-based)。
- 接入学习-行动循环(5.4):规划是否吃学到的 value/policy 作输入 ↔ 规划输出是否作为 value/policy 的训练目标 ↔ 规划输出是否直接用于选动作。Table 4 用这四维系统比较了 Dyna、AlphaGo Zero、muzero、Embed2Control、TreeQN、VIN、UPN、MCTSNet、I2A、IBP、DRC 等十余种算法的取值组合。
隐式(implicit)model-based RL 的三分(Sec 6,Figure 10):把模型学习和/或规划过程嵌入端到端可微计算图,按”优化哪部分”再分三类——value equivalent models(只优化 transition,不做隐式规划,例:muzero、Value Prediction Networks、Predictron;MuZero 内部展开多步 action-conditional value,学到的模型服务于 MCTS,在 Chess/Go/Shogi 达到 SOTA)、learning to plan(只优化规划算子本身,已知/固定 transition,例:MCTSNet)、full implicit MBRL(transition 和规划算子联合优化,例:TreeQN、VIN、UPN、I2A、IBP、DRC)。
数据
本文是纯概念综述,不使用任何数据集,不训练任何模型,无自有的 scale/mixture/curation 数字。文中提及的”数据”仅以两种方式出现:(1) 作为分类讨论的问题场景(随机性/stochasticity、认知不确定性/epistemic uncertainty、部分可观测、非平稳性等模型学习挑战对应的数据特性);(2) 作为引用他人工作的实证例子(见下方”训练方法”与”评测 benchmark”中列出的具体任务与规模,均转引自被综述的原始论文,非本文实验)。
训练方法
本文把 model-based RL 的方法论拆成”两步 + 一个替代路径”:
显式 MBRL 的两步流程:① 从观测数据学动力学模型(Sec 4,监督学习问题,需应对随机性/不确定性/部分可观测/非平稳/多步预测/状态与时间抽象六类挑战);② 把模型接入规划,产出策略/价值(Sec 5,即上文四维分类学)。隐式 MBRL(Sec 6)则把两步揉进一个端到端可微图,用 RL 损失(预测正确的最优价值)或模仿损失(预测正确的最优动作/来自专家演示)优化。
收益分类与代表性数字(Sec 7,本文对既有工作的系统汇编,非本文实验):
- 数据效率分两条路线:squeezing(每轮规划到收敛/近收敛,追求最大数据效率)——PILCO(Deisenroth & Rasmussen 2011)用 Gaussian Process 建不确定性,在真实 Cartpole 上用不到 20 秒经验就解决任务;PETS(Chua et al. 2018)用 bootstrap ensemble,扩展到 **7 自由度(DOF)**动作空间;MBPO(Janner et al. 2019)同样用 bootstrap ensemble,扩展到仿真中 22 DOF 人形机器人;Embed2Control(Wahlström et al. 2015)在 51×51 像素的 Pendulum swing-up 上,15 次试验(每次 1000 帧)后达到 90% 成功率。mixing(规划与 model-free 更新混合,不追求榨干信息)——Dyna(Sutton 1990)原始工作在 gridworld 上取得 20-40 倍数据效率提升;Gu et al. (2016)、Nagabandi et al. (2018c) 在高维函数近似场景下取得约 2-5 倍提升。
- 探索:区分 one-phase vs two-phase 探索、value-based vs state-based(intrinsic motivation)探索(Table 6),并进一步分 knowledge-based IM(新颖性/预测误差驱动,如 BEB
r_i∝1/(1+n(s,a)))与 competence-based IM(学习进度驱动,IMGEP 三步:学目标空间→采样目标→规划抵达)。 - 最优性:已知模型的 model-based RL(AlphaGo Zero、Guided Policy Search)可超越 model-free 的长期渐近表现;muzero 用学到的价值等价模型进一步超过 AlphaGo Zero,暗示”全局函数近似(学习)+ 局部表格式表征(规划)“的组合能相互平滑误差,呼应认知科学的双过程理论(“thinking fast and slow”)。
- 迁移 / 安全 / 可解释性:迁移区分”同动力学换奖励”(多目标 RL、successor representation)与”动力学微变”(sim-to-real);安全举 Berkenkamp et al. (2017) 的安全区域探索;可解释性举 van der Waa et al. (2018) 的对比式解释生成。
- 代价(disbenefits):额外计算(训模型+规划)、学到模型的不确定性带来不稳定(数据效率换渐近性能)、额外内存、更多需调超参——本文明确列为”不可避免的权衡”。
Infra(训练 / 推理工程)
不适用/未披露 —— 本文是纯概念综述,无自身训练或推理实验,无 GPU 型号/卡数/GPU-hours/并行策略/精度,也无推理 FPS/延迟数字。本文在 Discussion(Sec 10)中反过来批评了领域内计算成本报告不统一的现状:许多论文用”训练小时/天数”作横轴(严重依赖硬件),另一些用”episode 数”作横轴(而 model-based 算法每 episode 用的样本量远多于 model-free),呼吁统一用真实环境步数/模型调用次数/计算量(FLOPs)作可比横轴。
评测 benchmark
本文不含任何自有实验或消融。其定量内容分两类,均转引/汇编自被综述的原始工作:
- 理论保证一览(Sec 8,Table 7):汇总多种 model-based RL 算法的 minimax regret 上界——UCRL2 (Jaksch et al. 2010)、Agrawal & Jia (2017,大 T 场景下的改进界)、UCBVI (Azar et al. 2017)、EULER (Zanette & Brunskill 2019)——与 model-free Q-learning 的界及 Jaksch et al. (2010) 给出的理论下界相比较。文本明确指出:EULER 在对最优价值函数方差的额外假设下,其 regret 界能匹配理论下界;且 Efroni et al. (2019b) 证明 Dyna 式的一步贪心规划就能匹配 UCRL2、EULER 的 regret 界,同时降低时间/空间复杂度——即”浅规划也能拿到深规划的理论保证”。
- 实证数据效率数字:见上”训练方法”一节列出的 PILCO / PETS / MBPO / Embed2Control / Dyna / Gu-Nagabandi 具体数字(均为本文汇编他人实验结果,非本文测得)。
本文在 Discussion 中自陈领域缺系统 benchmark:模型无关的问题难度度量(不只是状态/动作维度,稀疏奖励等也是难度来源,引 Osband et al. 2019 的 bsuite)、对 model-based RL 算法的横向比较工作稀少(仅举 Wang et al. 2019 一例)、学习曲线横轴标准化缺失——这是本文明确指出的领域空白,而非本文自身的评测缺陷。
创新点与影响
本文自陈的原创贡献(Sec 11 Summary):
- 用”模型 + 全局解”的存在性重新定义 planning / model-free RL / model-based RL 及其三个子类(known-model MBRL、learned-model MBRL、planning-over-learned-model),解决了此前术语混用的问题。
- 系统覆盖模型学习六大挑战(随机性、不确定性、部分可观测、非平稳、多步预测、状态/时间抽象)。
- 提出规划-学习整合的四维分类学(起始状态/预算/怎么规划/接入学习循环),并用 Table 4 系统横向比较十余种知名算法。
- 单列 implicit model-based RL 一章,把端到端可微的模型/规划优化统一到同一框架下。
- 系统梳理 model-based RL 的六类潜在收益(数据效率、探索、最优性、迁移、安全、可解释性)及其代价。
影响:作为 model-based RL 领域第一篇系统综述,本文提供的术语表与四维分类学被后续大量世界模型/model-based RL 工作用作共同参照坐标系(例如区分”哪种规划-学习整合”时直接援引 Table 2/3 的类别名)。
本文自陈的局限与未来方向(Sec 10 Discussion,六点):① 学到模型的 model-based RL 渐近性能仍不及 model-free,需要更好的不确定性处理;② 时间抽象/层级 RL 仍缺一致方法去识别有用子程序(bottleneck、状态覆盖、信息压缩、reward-relevancy、先验五类方法各有局限);③ competence-based intrinsic motivation 相对 knowledge-based 关注更少,值得深耕;④ 迁移场景下的数据效率评估不足;⑤ 规划/学习/真实数据采集的预算权衡目前靠人工调超参,缺乏自适应机制;⑥ 高维函数近似下的 prioritized sweeping(反向规划)仍不稳定。全篇无一行代码、无一次实验,是分类框架而非实证成果。
原始链接
- arXiv 摘要页(canonical):https://arxiv.org/abs/2006.16712
- 论文 PDF(v4,2022-03-31 修订,47 页正文):https://arxiv.org/pdf/2006.16712
- arXiv-issued DOI:https://doi.org/10.48550/arXiv.2006.16712
一手源存档(sources/)
- mbrl-survey-moerland—arxiv-abstract — arXiv 摘要页快照(作者/单位/提交历史/摘要/目录),sources/world-model/2020/
- 论文原文 PDF(arXiv 2006.16712,v4,47 页):按约定不入 git,见上方链接重取