一句话定位

SUDD(Scaling Up and Distilling Down)用 LLM 递归任务分解 + 采样式机器人规划器(RRT/抓取采样器)做零人工示范的数据生成,LLM 同时推断每个任务的成功判定代码片段,实现失败检测与重试,把生成的”验证-重试”轨迹过滤成功后蒸馏进一个语言条件化的多任务 diffusion policy——蒸馏出的策略继承了数据采集策略的鲁棒重试行为,同时绝对成功率平均再提升 33.2 个百分点(5 个域)。

背景与定位

范式名称:LLM-as-suboptimal-data-collection-policy + diffusion-policy distillation(LLM 当”次优数据采集策略”而非最终策略,再蒸馏成视觉运动策略)。发表于 CoRL 2023(Oral,LangRob workshop / Cognitive Science & Robot Learning workshop)。

  • 对比 LLM-as-final-policy 路线saycancode-as-policies、Inner Monologue、PaLM-E、Text2Motion、ProgPrompt 等把 LLM 直接当零样本规划器/策略,推理时性能受限于 LLM 的规划鲁棒性,且不会随经验积累而改进。SUDD 反其道而行——LLM 只当次优数据采集策略,真正部署的是从数据蒸馏出的策略,其成功率可以超过采集它的 LLM 策略本身。
  • 对比人类示范数据路线bc-z、Perceiver-Actor、CLIPort、RT-1、Interactive Language 等靠人类遥操作 + 人类语言标注,数据规模受人力上限约束。SUDD 不需要任何专家示范或人工奖励工程,语言标注也是任务分解过程自动产生的。
  • 对比经典 TAMP:本文扩展任务和运动规划(TAMP)的思路,用 LLM 的常识知识替代领域特定的转移函数工程,换取对新任务/新域的灵活性。
  • 策略侧:直接扩展 diffusion-policy(Chi et al., RSS 2023)——把单任务行为克隆的 diffusion policy 加上语言条件,做成多任务策略;与同期用大规模示范做多任务语言条件模仿学习的路线(如 RT-1、Interactive Language)互补。
  • 三个作者所在机构:Columbia University(Huy Ha, Shuran Song)+ Google DeepMind(Pete Florence)。

模型架构

SUDD 分两个阶段,数据生成阶段不是神经网络(是 LLM + 采样式规划器的算法流水线),策略蒸馏阶段是语言条件化的 diffusion policy

数据生成流水线(§3):

  • Simplify(递归任务分解,§3.1):LLM 判断任务描述涉及单个还是多个物体(one-or-multiple 模块),多物体任务递归分解为子任务序列,最终得到一棵任务树(task tree);单物体的叶节点再由 LLM 判断要交互的具体物体/部件名。
  • Ground(接地为机器人 API 调用,§3.2):任务树的每个叶节点被接地为一串 6 自由度探索原语(6 DoF Exploration Primitives)——几何式抓取/放置采样器(在物体部件点云上均匀采样候选位姿)+ 基于 RRT 的采样式运动规划器(关节空间均匀采样)+ 铰接物体的旋转/平移运动原语(依据关节类型/轴/原点)。这套采样式原语天然伪随机,产生多样化的抓取、放置与运动轨迹,是探索效率的关键。接地仅在节点被执行时才发生(先序遍历),依赖当时的仿真状态。
  • Verify & Retry(验证与重试,§3.3):LLM 为任务树每个节点推断一个成功判定函数代码片段(用到的 API:check_contactcheck_activated/check_deactivatedcheck_on_top_ofcheck_inside,均基于特权仿真状态如接触/关节值/包围盒)。失败则用不同随机种子重跑同一序列的机器人工具(不重置仿真状态),直到成功或超时;只有超时或进入无效状态(如物体掉地)才被标记失败。

策略蒸馏(§3.4,“Language-conditioned Policy Distillation”):

  • 骨干:扩展 diffusion-policy 单任务 behavior-cloning 架构到多任务 + 语言条件;用卷积(1D UNet)diffusion policy 架构,最终网络 1.08 亿参数
  • 条件输入:任务描述用 CLIP B/32 文本编码器编码后投影到 512 维;两路相机视角(前视工作区 + 腕部相机,跟随 Robomimic 发现”腕部视角有助于精细操作”)各自独立 ResNet18 视觉编码器(BatchNorm→GroupNorm,最后平均池化层替换为 spatial softmax pooling),特征拼接后投影到 512 维;本体感觉(proprioception)历史与视觉/文本条件拼接后输入 diffusion policy。
  • 观测/动作细节:图像分辨率 160×240(每视角),90% 随机裁剪到 144×216;只用最新一帧视觉观测(而非完整视觉观测时域)+ 完整本体感觉观测时域,兼顾性能与训练时间。动作空间为 10 维绝对末端位姿(3 平移 + 6 旋转[旋转矩阵上两行] + 1 夹爪开合)。
  • 推理加速:训练用 50 步扩散过程,推理时配合 DDIM 噪声调度器只需 5 步(10 倍缩短)而性能相当;10 维动作空间下推理速度约 35 Hz(NVIDIA RTX 3080)。

数据

规模:数据生成运行直到每个任务积累 ≥500 条成功轨迹;训练/评测统一在 200 个 episode 上报告成功率。Transport 域用 22 个玩具资产做训练、另留 8 个未见过的新玩具做测试泛化。

来源/资产:基准建立在 MuJoCo 之上,资产取自 Google Scanned Objects 数据集;桌面操作设置用 UR5e 机械臂 + WSG50 夹爪 + Toyota Research Institute Finray 手指,策略控制频率 4 Hz,两路相机(前视 + 腕部)。

动作标注:全自动——抓取/放置由几何采样器给出,运动轨迹由 RRT 规划器给出,成功/失败标签由 LLM 推断的代码片段自动判定,无需人工标注。

mixture/curation:只保留 verify 判定为成功的轨迹进入蒸馏训练集(“success-filtering”,可视为最简单的离线 RL 形式);对照组 “Distill No Retry” 用不含 verify&retry 的数据采集策略产生的成功轨迹训练,用来隔离”重试行为”对蒸馏效果的贡献。

sim-vs-real:数据生成/训练全部在仿真中进行(依赖特权仿真状态,如接触、关节值、精确物体位姿——这是论文自陈的核心限制);真实世界评测靠**领域随机化(光照、纹理、相机位姿)**训练一个仿真策略,零微调直接部署到真实 UR5e + WSG50(Transport 任务,5 个未见过的真实物体)。

规模量级参照:数据采集成本随任务难度陡增——最长时程的 Mailbox 域数据生成耗时 2 天、256 个 CPU 核心(Intel Xeon Gold 6230R @ 2.10GHz);但作者强调这是一次性成本(数据生成完之后可反复复用蒸馏)。

训练方法

  • 数据采集”策略”:LLM(GPT-3 text-davinci-003,温度 0.0)驱动的 Simplify → Ground → Verify & Retry 流水线,本质是把 LLM 常识规划能力接到采样式规划器上,无需奖励工程、无需人工示范。
  • LLM 流水线设计:拆成多个专职小模块(如”单物体 vs 多物体”分类、物体部件名识别、子任务分解、成功条件代码生成),每个模块 prompt 只负责一个小推理技能,便于维护、便于缓存补全、节省 token。
  • 策略训练目标:扩展的语言条件 diffusion policy,用 AdamW 优化器,学习率 5e-5,权重衰减 1e-6,余弦学习率调度;评测用**指数滑动平均(EMA,衰减率 0.75)**的网络权重。
  • 训练配置:每个域单独训练一个多任务策略(单任务域则退化为单任务策略),相同网络架构与超参跨域复用。
  • 关键消融(§4.1/4.2,Prose 明确陈述的增量)
    • Verify & Retry 让数据采集策略成功率在 transport/catapult/balance/drawer 域分别提升 2×/3×/8×/13×;无此步骤时 mailbox 域数据采集成功率为 0%
    • 动作空间从 delta 切到 absolute:MLP 动作解码器提升 +6.5%,diffusion 动作解码器提升 +9.5%(均在单任务 balance 域上的消融,语言条件被移除)。
    • Spatial-softmax 池化(相对 BC-Z 选用的 mean pool)在他们自己的实验里带来约 +5.0% 的性能提升。
    • 伪随机 diffusion 动作解码器在所有其它设计选择组合下都持续优于确定性 MLP 动作映射。

Infra(训练 / 推理工程)

  • 数据生成机器:CPU 集群,256 核 Intel Xeon Gold 6230R @ 2.10GHz(mailbox 域耗时 2 天,仅需一次)。
  • 策略训练机器:单张 NVIDIA A6000,每个域训练 2 天,性能通常在训练进行到第 1 天左右就饱和。
  • 推理硬件/速度:单张 NVIDIA RTX 3080,10 维动作空间下推理约 35 Hz;用 DDIM 把推理扩散步数从训练时的 50 步压缩到 5 步(10×)换取实时性,性能损失可忽略。
  • 真实机器人:UR5e + WSG50 夹爪 + TRI Finray 手指;策略控制频率 4 Hz。
  • GPU-hours、并行策略、训练精度:未披露。

评测 benchmark

自建多任务基准:5 个域、18 个任务、30 个资产(MuJoCo + Google Scanned Objects),覆盖长时程(Mailbox 最长需约 800 个控制周期,Drawer 约 300 个)、常识推理(如”寄回快递”隐含要竖起邮箱旗)、工具使用(弹射器需先按按钮激活)、直觉物理(巴士平衡在小块积木上)与多任务语言条件(Catapult 3 个任务对应 3 个不同目标箱,Drawer 12 个任务对应 4 物体 × 3 抽屉)。评测协议:200 个 episode 上的成功率(%),Catapult 域因基线成功率过低改为累计到 500 条成功轨迹再统计平均成功率。

主表(Table 2,5 域成功率 %,200 trials,论文原表数字):

方法BalanceCatapultTransportMailboxDrawerAverage
LLM-as-Policy (2D)28.033.321.50.00.027.6
(+) 6DoF Robot Utils5.52.535.00.01.38.8
(+) Verify & Retry(数据采集策略)45.07.382.03.031.833.8
Distill No Retry67.538.532.50.022.732.2
Distill (Ours)79.058.380.062.055.867.0

(注:LLM-as-Policy (2D) 一行的 Average 列按原文印刷数字照录,与该行 5 个域值的简单算术平均不完全吻合,疑为原文排版/统计口径差异,未做人工”纠正”。)

  • 6DoF 探索的必要性:从 2D 平面动作切到 6DoF 探索原语后,Balance/Transport 这类平面动作也能勉强完成的简单任务成功率短期反而下降(28.0→5.5、21.5→35.0 因域而异),但 6DoF 对抓取复杂几何物体(Transport)、操作铰接物体(Drawer/Mailbox)是必要前提,为后续蒸馏提供了更好的探索数据。Catapult 域按 3 个目标箱单独统计,(+)6DoF Robot Utils 的 near/mid/far 三箱成功率为 16.3% / 3.3% / 2.2%(明文陈述)——相比 LLM-as-Policy(2D) 只能用确定性策略解到最近箱(100/0/0,平均 33.3%)但对另外两个箱完全无法提供有用数据。
  • 鲁棒性传递:蒸馏策略继承数据采集策略的”验证-重试”鲁棒行为——Distill (Ours) 相比其数据采集来源 ”(+) Verify & Retry” 平均绝对提升 +33.2%;相比 Distill No Retry(数据采集不含重试步骤)平均绝对高出约 34.8 个百分点。Fig.6 的 Balance 域时间-成功率曲线显示 Ours(79.0% @ 100s)和其数据采集策略随时间单调上升(体现多样化重试尝试),而基线在第一次抓取/放置尝试后即平台化。
  • LLM 规模消融(Table 4,10 samples/task)
模型规模Planning 准确率Success(判定)准确率
LLAMA27B42.0%10.0%
LLAMA213B62.0%48.3%
GPT-3 (text-davinci-003)175B82.0%91.1%

LLAMA2 因不能很好遵循 prompt 指令(如 Drawer 域两模型都不会先开抽屉)而明显落后 GPT-3;13B 相比 7B 在规划/成功判定准确率上分别提升 +20.0% / +38.3%。

  • 误差来源分解(Table 3,Mailbox 域各子任务,200 trials)
子任务PlanningVerifyExecution
Open mailbox100%100%43.5%
Put package in mailbox100%100%28.5%
Raise mailbox flag100%100%62.0%
Close mailbox100%100%94.2%

规划与验证阶段准确率均为 100%,误差全部来自执行阶段——长时程任务链条越长,累积执行失败概率越高。

  • Sim2Real 迁移:在领域随机化数据上训练的策略零微调部署到真实 UR5e,Transport 任务 5 个未见真实物体各评 10 个 episode:梨 70%、怪兽玩具 80%、魔方 60%、Fetch 遥控器 80%、芥末瓶 90%,平均 76%
  • 附录补充定性发现:Drawer 域对大件物体(维他命瓶、马形玩具,需侧向抓取才能塞进抽屉)与顶层抽屉(接近机械臂运动学极限,易与抽屉碰撞导致物体脱落或抽屉关闭)更困难;平面动作原语在开抽屉这类任务上因俯视抓取与抽屉本体碰撞而直接规划失败。

创新点与影响

  • 贡献:(1) 一套零人力示范/零奖励工程的语言引导数据采集框架,把 LLM 常识规划与 6DoF 采样式机器人工具(运动规划、抓取采样)结合,并用 LLM 自动推断的成功判定代码同时实现失败检测重试与轨迹自动标注;(2) 把 diffusion policy 扩展到多任务语言条件闭环控制;(3) 一个 18 任务、5 域的新基准,覆盖长时程、常识、工具使用与直觉物理,弥补现有操作基准的空白。
  • 改变了什么:证明”次优 LLM 数据采集策略 + 成功过滤蒸馏”可以让最终策略的性能超过其数据采集来源本身(区别于此前”LLM 即最终策略”路线的能力天花板即为 LLM 推理时规划能力);同时首次把机器人技能获取的两大主线(可扩展数据采集 + 有效策略学习)统一进一个不依赖人类示范的单一框架,是把机器人学习推向类似 LLM 数据规模化趋势的一步尝试。
  • 作者自陈局限:数据生成阶段依赖特权仿真状态信息(真值接触/关节/物体位姿)来推断成功条件,因此实现仅限仿真环境,策略需要 Sim2Real 迁移;数据生成依赖现有 3D 资产与环境,规模化需要 3D 生成模型或程序化生成资产的进一步工作;数据集虽含所有子任务的文本与成功标签,但论文只评测了学习根任务的效果,学习全部子任务、随时间积累可复用子技能库以实现组合泛化留作未来工作。

原始链接

一手源存档(sources/)