一句话定位
Meta-World 是一套建立在单臂 Sawyer + MuJoCo 之上的 50 个仿真桌面操作任务基准,配 ML1 / MT1 / MT10 / MT50 / ML10 / ML45 六档难度评测协议,成为多任务(multi-task RL)与元强化学习(meta-RL)在机器人操作领域事实上的标准评测,首次系统揭示”当前 SOTA 方法连同时学十个任务都很吃力”。
背景与定位
论文发表于 CoRL 2019(第 3 届机器人学习大会,大阪),arXiv v1 为 2019-10,v2 于 2021-06 更新(把任务升到 v2、观测统一为 39 维)。作者横跨 Stanford(Tianhe Yu, Chelsea Finn)、UC Berkeley(Deirdre Quillen, Sergey Levine)、Columbia(Zhanpeng He)、USC(Ryan Julian 等)、Robotics at Google(Karol Hausman)。
它要解决的痛点是评测协议本身的贫瘠:
- 多任务 RL 过去主要在 Atari 套件(Arcade Learning Environment)上评,但各游戏视觉/控制/目标差异过大,几乎没有可迁移的共享结构,反而普遍出现负迁移;
- 元 RL 过去评在”变速/变方向的单一运动任务”这种极窄任务分布上(如 MAML、PEARL 原始实验),根本无法检验”快速学会一个全新任务”的能力。
Meta-World 的立意是造一个既足够多样、又共享结构的任务分布——同一个机械臂、同一动作空间、同一工作台、相似奖励结构,但 50 个任务在”非参数”层面质变(开门 vs 拉抽屉 vs 投篮)。它与同期的仿真基准(如 RLBench、habitat 视觉导航、SURREAL 单任务操作)并列,但唯一聚焦”多任务 + 元学习 + 迁移”三合一评测。范式上属于benchmark / evaluation protocol,不训练任何模型,而是提供环境 + 一批 baseline 复现(跑在自研的 Garage RL 库上)。
模型架构
本文是基准,不含新模型;“架构”即环境与任务的规格。
- 机器人 / 物理引擎:全部任务由仿真 Sawyer 机械臂在 MuJoCo 物理引擎中执行,接口基于 Multiworld + OpenAI Gym,方便已熟悉 Gym 的研究者接入。
- 动作空间:4 维连续 = 末端执行器(end-effector)在 3D 空间的位移增量 + 夹爪手指的归一化力矩;取值范围 [−1, 1]。
- 观测空间:始终 39 维(v2)。语义为末端执行器 3D 位置、夹爪开合归一化量、第一个物体 3D 位置 + 四元数、第二个物体 3D 位置 + 四元数、上一时刻的全部上述量、以及目标 3D 位置;无第二物体或不含目标时对应分量置零。不同任务物体数不同但维度恒定(部分坐标不用)。
- 奖励结构:采用多分量塑形奖励(reaching + grasping + placing 或其子集),刻意让所有任务奖励量级一致、结构相似——范围 0~10,10 恒等于任务被解,避免因奖励尺度不同而掩盖任务间共享结构、诱导算法偏好高幅奖励任务(呼应 PopArt 观察)。
- 任务定义:一个任务 = 三元组(奖励函数, 初始物体位置, 目标位置)。每个任务内含参数化变化(物体/目标位置随机化,理论上无穷多变体),任务间是非参数化变化(开窗 vs 够取拼图是质的不同)。参数化变化的引入是防止算法靠”某位置=门、另一位置=抽屉”记忆而不泛化。
- 成功判据:与奖励解耦,用可解释的距离阈值 ‖o − g‖₂ < ε,ε 取小距离(论文举例 5 cm ≈ 0.05),逐任务给阈值。
数据
基准本身不提供离线数据集,也无演示轨迹——它提供的是”可交互环境 + 评测划分”,数据由算法在线采样。相关”规模”数字全在任务与评测划分上:
- 任务总量:50 个质变操作任务(开/关门、开/关抽屉、开/关窗、按按钮、投篮、锤钉、装/拆螺母、扫入洞、货架摆放、插销、开水龙头、踢足球、开箱、锁/解锁门、拣箱等,附录 Table 2 逐条列出)。
- 多任务划分:MT10 = 10 个环境 × 50 个随机初始/目标 = 500 个训练任务;MT50 = 50 环境 × 50 = 2500 个训练任务。MT10/MT50 观测里拼接 one-hot 任务 ID,物体与目标位置固定,专测”能否同时掌握多个技能”。
- 元学习划分:ML1 单任务,meta-train 用 50 个随机初始/目标、meta-test 用 50 个held-out 位置(评测于 reach / push / pick-place 三个任务);ML10 = 10 个 meta-train 任务 + 5 个 held-out 测试任务;ML45 = 45 个 meta-train + 5 个测试任务。ML 系列不给任务 ID,逼迫算法从交互中辨识任务。
- 来源 / 构造:全为人工设计的日常物体仿真场景,共享同一 Sawyer、动作空间与工作台以保证正迁移可能性;训练任务被有意选得与测试任务结构相似。全部为 sim(纯仿真),无真实机器人数据、无 co-training。
训练方法
论文不训模型,而是给出评测协议 + baseline 复现。它评了 7 个 SOTA 算法(跑在 Garage 库):
- 多任务(4 个):MT-PPO、MT-TRPO(均以 one-hot 任务 ID 作输入的 on-policy 策略梯度)、Task Embeddings(TE,把策略参数化到共享技能嵌入空间)、MT-SAC(off-policy actor-critic,以 one-hot 任务 ID 作输入)。
- 元 RL(3 个):RL²(GRU 隐状态跨 episode 保留、用 PPO 训的 on-policy 元 RL)、MAML(把策略梯度步嵌入元优化的 on-policy 梯度法,用 TRPO/PPO 训)、PEARL(off-policy,把经验编码成任务的概率隐变量喂给 actor/critic)。
评测流程:先在附录 B 用单任务 SAC / PPO 验证 50 个任务各自可解(SAC 全部可解、PPO 解出大多数,3 seeds);再跑 MT / ML 六档、每档 10 seeds 取最大平均成功率。核心超参(附录 D,均在 Garage):
- 单任务 SAC:hidden (256,256)、ReLU、policy/qf lr = 3×10⁻⁴、discount 0.99、batch 500、max path length 500、自动熵调节。
- 单任务 PPO:hidden (128,128)、tanh、lr 5×10⁻⁴、clip 0.2、GAE λ 0.95、batch 5000。
- MT-PPO:hidden (512,512),MT10 batch 100k / MT50 batch 500k。
- 采样规模(总环境步):ML1 约 3×10⁸、MT10 约 1×10⁸、MT50 约 2×10⁸、ML10 约 3.5×10⁸、ML45 约 4×10⁸。
Infra(训练 / 推理工程)
论文作为仿真基准,未披露 GPU 型号 / 数量 / GPU-hours / 并行策略 / 精度等训练工程细节。仅可确认:物理仿真用 MuJoCo(面向接触的快速仿真),baseline 与实验启动器开源在 Garage RL 库,环境接口基于 Multiworld + OpenAI Gym。推理侧无 real-robot 部署,无 FPS / 控制频率 / 边缘硬件披露(动作为末端执行器增量控制,属仿真步进)。当前由 Farama Foundation 维护的版本已迁到 Gymnasium API、升级到 v3 环境,支持 MT10/MT50/ML10/ML45 的 同步 / 异步向量化(sync/async VectorEnv)以适配不同算力。
评测 benchmark
下列为论文 Table 1 一手数字(10 seeds,最大平均成功率):
多任务(训练成功率)
| 方法 | MT10 | MT50 |
|---|---|---|
| Multi-task PPO | 30.5% | 35.4% |
| Multi-task TRPO | 31.3% | 21.0% |
| Task Embeddings | 20.9% | 11.8% |
| Multi-task SAC | 68.3% | 38.5% |
元 RL(meta-train / meta-test 成功率)
| 方法 | ML10 train | ML10 test | ML45 train | ML45 test |
|---|---|---|---|---|
| MAML | 44.4% | 31.6% | 40.7% | 39.9% |
| RL² | 86.9% | 35.8% | 70% | 33.3% |
| PEARL | 23.2% | 13% | 14.5% | 22% |
核心结论:
- MT10 上 MT-SAC 尚能到 ~68%,但扩到 MT50 骤降到 ~38%,MT-PPO/TRPO 全程只在 30% 上下——即使只有 10 个任务,多任务学习就已很吃力。
- 元 RL 在 ML10/ML45 测试任务上普遍只有 13%~40%;RL² 训练成功率最高(ML10 86.9%)但泛化并不显著优于 MAML,PEARL 因任务编码器难训而整体偏弱。
- 论文明确指出:当前方法既不能有效泛化到全新任务,甚至在多个质变任务上连 meta-train 都学不好——优化难度在元学习设定下更严重。ML10/ML45 上仍有非零泛化,说明基准可解但对彼时方法很难,留足改进空间。
创新点与影响
- 贡献:把”多样却共享结构”这一元/多任务学习的前提,第一次落成一个可复现、开源、带成功判据的 50 任务操作基准,并配 6 档递进难度协议(ML1→MT1→MT10/MT50→ML10/ML45)与 7 个 SOTA baseline 的系统复现。
- 改变了什么:Meta-World 迅速成为多任务 RL / 元 RL / 机器人技能迁移研究的默认评测台,MT10/MT50/ML10/ML45 成为通用缩写;它把领域焦点从”在窄任务上刷分”扭到”能否处理高度多样任务集”。后续大量多任务 RL(如软模块化、冲突梯度处理)与元 RL 工作均以它为主战场。基准现由 Farama Foundation 长期维护,2025 年 Meta-World+(arXiv 2505.11289,NeurIPS D&B 2025)对其做了标准化重整(修复版本漂移、统一 v3 环境与 Gymnasium 接口)。
- 作者自陈局限 / 未来方向:(1) 现实中物体位姿常不可直接获取,应扩展到图像观测 + 稀疏奖励(成功判据可直接当稀疏奖励,图像渲染已支持,但需防元学习算法从图像直接识别任务而记忆);(2) 加入组合式长程任务以指数级扩充共享结构任务;(3) 降低 reset 频率以模拟真实无人复位难题;(4) 增加符合 online meta-learning 设定的评测(任务非一次性全可见)。
原始链接
- arXiv abs:https://arxiv.org/abs/1910.10897 (v1 2019-10 / v2 2021-06)
- arXiv PDF:https://arxiv.org/pdf/1910.10897
- 项目页:https://meta-world.github.io/
- GitHub(Farama 维护):https://github.com/Farama-Foundation/Metaworld
- 文档站:https://metaworld.farama.org/
- 原始代码库(历史):https://github.com/rlworkgroup/metaworld ;baseline 库 Garage:https://github.com/rlworkgroup/garage
- 后续标准化:Meta-World+(arXiv 2505.11289 / OpenReview id=1de3azE606,NeurIPS 2025 D&B)
一手源存档(sources/)
- meta-world—github-readme — Farama-Foundation/Metaworld README(master,含 Gymnasium/v3 API 用法与 Meta-World+ 引用)
- meta-world—project-page — meta-world.github.io 官方项目页(摘要 + 六档评测模式 + 作者列表)
- arXiv 1910.10897v2 全文 PDF(arXiv 原文 PDF,不入 git;见上方 arXiv 链接)