一句话定位

LIBERO(LIfelong learning BEnchmark on RObot manipulation tasks)是 UT Austin / Sony AI 提出的一个终身机器人操作学习基准:用一条基于 Robosuite + PDDL 的程序化生成流水线造出 130 个语言条件操作任务,分成四个套件(LIBERO-Spatial / Object / Goal 各 10 个,LIBERO-100 一百个),前三个套件被刻意设计成只考察**声明性知识(spatial/object)或程序性知识(goal/motion)**的单一维度迁移,用来系统研究「决策中的终身学习(LLDM)」。配套 50 条/任务、共 6500 条人类遥操作演示。NeurIPS 2023 Datasets & Benchmarks track。其四个套件后来成为 VLA 微调评测的事实标准。

背景与定位

论文攻击的是终身学习在决策/机器人领域的空白。作者的核心区分:视觉/文本领域的终身学习主要迁移声明性知识(declarative knowledge)——关于实体与概念的知识(果汁在哪、冰箱长什么样);而决策/机器人的终身学习还必须迁移程序性知识(procedural knowledge)——「怎么做」的知识(怎么开冰箱、怎么抓果汁)。当一个先学会「从冰箱取果汁」的机器人在学新任务后失败,我们缺乏方法去定位它到底忘了果汁位置(声明性)还是忘了开冰箱的动作(程序性)。LIBERO 就是为了把这两类知识的迁移解耦并可量化地测出来。

与既有基准的定位差异:终身学习基准此前多是把标准视觉/文本数据集改造成任务流(MNIST / CIFAR / ImageNet / CORe50 / GLUE),或用游戏 RL(Atari / XLand / VizDoom),前者不含程序性知识、后者不代表人类活动;机器人向的 ContinualWorld(改造 MetaWorld 的 50 个任务)、CORA(基于 Atari/Procgen/MiniHack/ALFRED)虽引入操作,但没有针对 LLDM 的受控知识解耦设计。机器人学习基准 CALVIN、MetaWorld、RLBench、ManiSkill、VIMA-Bench 则各自面向语言长时程、meta learning、多任务泛化等,而非终身学习。LIBERO 的独特点在于:程序化生成(可无限扩展)+ 受控分布漂移的四套件 + 高质量人类演示三者结合,专为 LLDM 的五个研究主题(知识迁移 / 神经架构 / 终身算法 / 任务顺序鲁棒性 / 预训练效应)而造。任务灵感取自 Ego4D 的人类日常活动标注。

模型架构

LIBERO 本身是基准 + 生成流水线 + 基线策略,此处分述两侧。

(一)任务生成流水线——三步程序化生成,建在 Robosuite 之上:

  1. 行为模板与指令生成:从大规模第一人称活动数据集 Ego4D(3000 小时)的语言标注里抽取常用语言模板(如「Open …」),再结合模拟器中可用物体,生成自然语言任务指令(如「Open the drawer of the cabinet」)。
  2. 初始状态分布 μ₀:先按指令选一个匹配的场景布局(如厨房场景),再用 PDDL 语言(BDDL 文件)声明物体类别、摆放、初始状态。
  3. 目标规格 g:用谓词合取定义目标——一元谓词描述物体属性 Open(X) / TurnOff(X),二元谓词描述空间关系 On(A,B) / In(A,B);所有谓词为真即任务终止。采用稀疏奖励(完成给 +1)。

(二)三种基线视觉-语言策略(均行为克隆训练,动作维度 7,GMM 输出头产连续末端执行器动作,三者 FLOPS 对齐到约 13.5 GFLOPS):

  • ResNet-RNN:ResNet 视觉骨干逐帧编码 + LSTM 时序骨干;语言用 FiLM 注入 ResNet 特征并加到 LSTM 输入。超参:resnet_image_embed_size 64、text_embed 32、rnn_hidden 1024、2 层。
  • ResNet-T:ResNet 视觉骨干 + Transformer 解码器时序骨干(源自作者的 VIOLA);语言嵌入作为独立 token 与视觉 token 一起送入 transformer。超参:img_embed 64、transformer 4 层 6 头、head_output 64、mlp_hidden 256、dropout 0.1、max_seq_len 10。
  • ViT-T:Vision Transformer 视觉骨干 + Transformer 解码器时序骨干(ViLT 式);语言嵌入在 ViT 与时序 transformer 两处都作独立 token。超参:spatial transformer 7 层 8 头、head_output 120;temporal transformer 4 层 6 头、head_output 64、max_seq_len 10。

语言指令统一用预训练 BERT 嵌入(768 维)编码。图像观测分辨率 128×128(含手眼相机)。

数据

  • 任务规模:130 个语言条件操作任务,四套件:
    • LIBERO-Spatial(10):同一组物体、放同一个盘子,但有两个仅位置/空间关系不同的相同碗——只考察空间关系(声明性)迁移。
    • LIBERO-Object(10):每个任务 pick-place 一个独特物体——只考察物体概念(声明性)迁移。
    • LIBERO-Goal(10):物体与空间关系固定,只有任务目标不同——只考察运动/行为(程序性)迁移。
    • LIBERO-100(100):多样物体交互与多样运动技能,纠缠型知识迁移;进一步切成 LIBERO-90(90 个短时程任务,作预训练数据源)与 LIBERO-Long / LIBERO-10(10 个长时程任务,作下游终身学习评测)。
  • 演示数据:为全部 130 个任务提供高质量人类遥操作演示,每任务 50 条轨迹,合计约 6500 条演示;由人类专家用 3Dconnexion Spacemouse 遥操作采集。
  • 数据来源与整理:任务指令模板来自 Ego4D 人类活动标注;场景/物体由模拟器资产库选取,布局与目标以 PDDL/BDDL 声明。
  • 发布:数据托管于 HuggingFace(yifengzhu-hf/LIBERO-datasets);代码 MIT 许可,数据集 CC BY 4.0

训练方法

  • 目标函数:终身模仿学习,逐任务做行为克隆(BC),负对数似然损失,策略为高斯混合模型(GMM)。数学上是式(2)的 BC 代理目标,终身设置下学第 k 个任务时前 k−1 个任务的数据不再完全可用。
  • 每任务训练协议:50 条演示上训 50 epoch,每 5 epoch 评一次;Adam,batch 32,余弦学习率 1e-4 → 1e-5;按最优成功率挑 checkpoint(Robomimic 惯例);评测时每个已学任务跑 20 条 rollout、最大长度 600。
  • 五种终身学习算法(覆盖三大范式 + 上下界):
    • SeqL(顺序微调,下界);MTL(多任务联合,上界)。
    • EWC(正则化派):Fisher 信息矩阵约束,在线更新,γ=0.9、λ=5·10⁴。
    • ER(回放派):回放缓冲最多存 1000 条轨迹,每次训练迭代额外均匀采样 32 条回放数据拼进当前 batch。
    • PackNet(动态架构派):迭代训练-剪枝-微调-冻结,每任务保留最重要 25% 参数、其余剪掉,再微调 50 epoch 后冻结;理论上完全不遗忘但可用参数逐任务缩水。
  • 实验矩阵:算法 × 架构 × 套件 × 3 个随机种子 {100,200,300},共 180 组实验

Infra(训练 / 推理工程)

  • 算力:每组实验用单张 Nvidia A100 或单张 A40 GPU(CUDA 11.7)+ 8–16 CPU 训练与评测。总 GPU-hours 未披露
  • 精度 / 并行:未披露(单卡、无分布式并行)。
  • 推理:纯仿真基准,无真机部署;控制频率 / FPS / 时延未披露。观测相机 128×128 离屏渲染。三种策略 FLOPS 对齐到约 13.5 G 以保证公平比较。

评测 benchmark

三个指标(均以成功率计,论文论证成功率比 BC loss 更可靠):FWT(前向迁移,↑,学新任务多快)、NBT(负后向迁移,↓,对旧任务遗忘多少)、AUC(成功率曲线下面积,↑,综合)。

代表性数字(ResNet-T 骨干,三种子均值):

  • 算法对比(LIBERO-Spatial):SeqL FWT 0.72;ER FWT 0.65 / NBT 0.27 / AUC 0.56;EWC FWT 0.23;PackNet FWT 0.55 / NBT 0.07 / AUC 0.63;MTL AUC 0.83(上界)。
  • 算法对比(LIBERO-Long):SeqL FWT 0.54;ER FWT 0.48 / NBT 0.32 / AUC 0.32;PackNet FWT 0.22 / NBT 0.08;EWC FWT 0.13。
  • 语言嵌入对比(LIBERO-Long, ER+ResNet-T):BERT FWT 0.48、CLIP 0.52、GPT-2 0.46、Task-ID 0.50——无统计显著差异

五条主要发现(论文自陈的洞见,有的甚至反直觉):

  1. 策略架构和终身算法一样关键:ResNet-T 与 ViT-T 明显优于 ResNet-RNN——时序层用 Transformer 优于 RNN;ViT 在物体种类丰富的任务(LIBERO-Object)上更强(视觉信息处理),卷积网络在主要靠程序性知识的任务上更好。
  2. 终身算法虽能防遗忘,前向迁移却普遍不如顺序微调:SeqL 在所有套件上 FWT 最高——即所有被评估的终身算法都损害了前向迁移。PackNet 在 LIBERO-X 上防遗忘最好但在 LIBERO-Long 上被 ER 显著反超(因子网络容量不足);EWC 甚至比 SeqL 还差;ER 跨套件最稳健。
  3. 语义丰富的语言嵌入并不比 Task-ID 嵌入更好:句子嵌入更像 bag-of-words,只起区分不同任务的作用,呼吁更好的语言编码。
  4. 朴素监督预训练会损害下游 LLDM:在 LIBERO-90 上 BC 预训练反而拖累下游终身学习表现。
  5. 任务顺序会显著影响表现(对 PackNet 尤为统计显著),指向「对任务顺序鲁棒」这一开放方向。

创新点与影响

贡献:(1) 首个系统解耦声明性 vs 程序性知识迁移的终身机器人操作基准;(2) 基于 Robosuite + PDDL/BDDL 的程序化生成流水线,原则上可生成无限任务,并用受控分布漂移造出四套件;(3) 130 任务 × 50 条高质量人类遥操作演示的公开数据集;(4) 一套 FWT/NBT/AUC 指标与 180 组实证,给出「架构与算法同等重要」「终身算法伤害前向迁移」「预训练可能有害」等一批可复现的反直觉结论。

影响:LIBERO 的四个套件(尤其 Spatial/Object/Goal/Long)此后被大量视觉-语言-动作(VLA)与操作策略工作采用为微调 / few-shot 评测标准(如 OpenVLA、π0 系列等;此为生态层面事实,非本论文原文结论),成为衡量「预训练操作策略下游适应能力」的通用标尺。

论文自陈局限:(1) 仅稀疏奖励、聚焦模仿学习(BC),未涉真正的 RL;(2) 需要更好的架构来处理空间/时序信息;(3) 需要更好的算法来提升前向迁移;(4) 需要更好的预训练技术;(5) 由于学习者主要从人类学习,长期看隐私保护是重要课题。

原始链接

一手源存档(sources/)