一句话定位
DemoStart 是一种演示引导的自动课程强化学习方法:仅用每个任务 2–60 条次优仿真演示 + 一个二值稀疏奖励,就能训出在仿真中success率 98.6%–99.9% 的三指灵巧手操作策略(提物、插拔、定向、拧螺母、收纳),再靠行为克隆把特权状态策略蒸馏成纯 RGB+本体感知的视觉运动策略,实现向真实机器人的近零样本迁移(插拔任务真实成功率 64%,提物/定向任务 97%)——所需演示量比直接在真实机器人上做模仿学习少两个数量级。
背景与定位
论文瞄准的缺口:遥操作模仿学习在简单本体(有成熟遥操作设备)上效果显著,但复杂高自由度灵巧手操作缺乏好用的遥操作接口,而 sim-to-real 又面临”密集奖励难设计”与”课程如何自动生成”两个老问题。同期同一博客发布的姐妹论文 aloha-unleashed(真实双臂 + 大规模遥操作数据 + 扩散策略)走的是”纯规模 + 更强表达力模型”路线;DemoStart 则是正交路线——单臂+三指手,完全在仿真里用 RL 从稀疏奖励学习,只需要极少演示来”指路”,不需要遥操作真实机器人采集大规模数据。
方法定位为 auto-curriculum RL:与 PAIRED、PLR(Prioritized Level Replay)等需要额外训练一个对抗性/优先级控制器的自动课程方法不同,也和最相近的 Tao et al. 2024(Reverse Forward Curriculum Learning,把 PLR 与演示状态重置分两个独立阶段串联)不同,DemoStart 把”演示重置”与”自动课程”揉进同一套数据生成流程,且从不使用演示里的动作(只用演示的状态做起点),因此能兼容质量差、动作空间不同、甚至只覆盖任务某一段的不完整演示。RL 主干沿用 DeepMind 一脉的 MPO(Abdolmaleki et al. 2018)与分布式 actor-learner 架构(IMPALA,Espeholt et al. 2018);蒸馏用的 Perceiver-Actor-Critic(PAC)模型来自同组 2024 年工作 “Offline actor-critic reinforcement learning scales to large models”(Springenberg et al.),本文只借用其行为克隆能力而非其 offline-RL 目标。灵巧手 DEX-EE 由 Shadow Robot 与 Google DeepMind 合作开发;任务集参考 NIST 灵巧装配基准(Board #1)与 YCB 物体数据集设计。
模型架构
两阶段——特权状态 teacher(RL 训练)+ 视觉 student(BC 蒸馏):
- Teacher(MPO agent):actor 与 critic 共享一个编码器。输入是纯本体感知向量(Table V):
iiwa14_joint_pos/vel(各7维)、iiwa14_tcp_pos/pose/rmat(3/7/9维)、每根手指的ftip_pos/rmat、joint_pos/torques/vel/commanded(各手指 3/9/4/4/4/4 维,3 指)。取最近 3 个时间步的观测堆叠、展平拼接后线性投影到 512 维,过 LayerNorm,再送入 **8 层 MLP(隐层 512)**共享编码器,输出接线性策略头。动作空间 18 维:前 6 维为机械臂末端 6D 笛卡尔速度,后 12 维为三指关节位置指令(仅 cube reorientation 任务改用关节速度控制)。 - 硬件本体:7 自由度 Kuka LBR iiwa 14 R820 机械臂 + 三指 DEX-EE 灵巧手(超驱动腱驱动,每指 4 关节、5 个驱动器,三指共 12 自由度,两指近平行、一指对置的类拮抗布局)安装于法兰;篮筐两前角各 1 个 Basler ACA1920-40GC(GigE)相机 + 手腕两侧各 1 个 Basler ACA1920-40UC(USB3)相机,共 4 路相机。真实环境用 MuJoCo 建成数字孪生。
- Student(PAC 蒸馏策略):视觉编码器 φ_V 与本体感知编码器 φ_P 把多模态输入编码为 embedding 序列,再用一个 cross-attention 模块以少量可训练 latent 向量对输入 embedding 做查询(Perceiver 式),随后对 latent 做若干次 self-attention,得到输出 z_M;只用行为克隆目标训练(PAC 本身支持 offline-RL 目标,本文未使用)。Student 输入:4 路相机图像各下采样到 80×80 像素,加本体感知(机械臂关节位置 7 维、TCP 位姿+旋转矩阵 12 维、每指关节角 12 维)。
- 每个任务单独训练一个 teacher + 一个蒸馏 student,不做跨任务共享权重或语言条件化。
数据
- 各任务仿真演示数(3Dconnexion SpaceMouse 遥操作采集,动作空间与部署时不同——因为 DemoStart 从不使用演示动作):Plug lifting 5 条;Plug insertion 20 条(12 条完整插入 + 8 条仅”把插头掰正”的局部演示,插头朝向随机化后追加);Cube reorientation 2 条(非结构化交互);Nut and bolt threading 60 条(20 条完整任务 + 20 条提起 + 20 条”移到螺栓顶部”);Screwdriver in cup 20 条。
- 演示采集耗时对比:plug insertion 的 20 条仿真演示 ≈ 0.5 小时采集时间;对照的真实机器人遥操作基线采集了 2753 条演示(含失败)≈ 27 小时不间断采集,历时 36 天(因手套式遥操作单次不超过 1 小时);insertion 用了 2067 条成功演示,lift 用了 2116 条(因 500 条 lift 专用成功演示不够,混入了 insertion 演示中的提起片段凑够 2000+ 条)。
- 蒸馏训练数据:由 teacher(DemoStart 或 SAC-X)rollout 生成的成功轨迹,每任务生成数千条,包含物理域随机化(physics DR)、物体扰动、视觉域随机化(visual DR);plug insertion 任务额外混入 Filament 渲染器 + Blender 资产制作的照片级真实感(photorealistic)图像,比例约为 1 条照片级 : 1 条 visual-DR 图像。
- 动作标注:RL rollout 无需标注(稀疏二值奖励 + ZVF 自动筛选起点,从不使用演示动作);蒸馏阶段的动作标签即 teacher 策略自身输出。
- Sim-vs-real:teacher 完全在仿真训练;真实世界只用于评测和基线(真实遥操作数据仅作为 BC-from-teleop 基线的训练数据)。
训练方法
DemoStart 三个机制整合进单一 actor 数据生成流程:
- 机制 1——把演示的每个时间步状态存为环境全状态,可作为 task parameter(TP)的起始状态 s₀;靠近演示末尾的状态更容易,靠近开头的更难。
- 机制 2——Zero-Variance Filtering(ZVF):只在当前策略”有时成功有时失败”(T 次探测 rollout 的稀疏奖励有方差)的 TP 上生成训练数据;全败判定太难、全胜判定太易,均跳过。相比 PAIRED/PLR,ZVF 不需要额外训练一个对抗智能体或独立的中心控制器。
- 机制 3——偏向使用演示中较早的状态做训练起点,避免策略过拟合演示里的非典型状态(如不稳定抓握)。
Actor 流程:采样 K=8 个 TP 序列(第一个采自目标分布 𝒯_target,其余 K 个来自把一条随机演示切成 K 段、每段随机取一个状态,难度从难到易排列)→ 对每个候选 TP 跑 T=4 条探测 rollout 判定 ZVF(不送入训练)→ 命中后生成 M=50 条 rollout 送入 replay buffer。
- RL 算法:MPO,分布式 actor-learner 架构,经验回放缓冲区。
- 训练超参:轨迹长度 10,每条轨迹复用 2 次训练,batch size 256;训练至收敛通常 <10M learner 更新步,Screwdriver-in-cup 任务需要 32M 步;所有消融基线训练步数为 DemoStart 的 2 倍。
- 奖励设计细节:默认到达目标态给 1 分并终止;plug lifting 要求把插头提起 5cm 并连续保持 0.5 秒才计分(否则智能体学会”猛地弹起”插头再落下的取巧行为);nut-and-bolt 额外引入
difficulty(easy/hard)任务参数,50% 概率采样为 easy(螺母到达螺栓正上方即算成功),用于引导智能体先学会抓取-搬运再学穿螺纹的完整任务。 - 蒸馏:offline 行为克隆(非交互式查询 teacher),在 teacher 生成的离线数据集上训练 PAC student;域随机化(扰动/物理/视觉三类)在 teacher 与 student 训练阶段均启用,但 teacher 训练时对起始于演示状态的 episode 不施加扰动与物理 DR。
Infra(训练 / 推理工程)
GPU/TPU 具体数量与训练总时长(GPU-hours)论文未披露;论文明确指出 ZVF 因丢弃 actor 生成的大部分数据、且使用稀疏奖励,相比稠密奖励方法计算更密集,并提出未来可用 GPU 版仿真器或更聪明的起点筛选来提高计算效率。
真实机器人控制回路(已披露的时序细节):agent 与环境以 20Hz 锁步运行;机械臂 6D 笛卡尔速度指令经基于 QP 的微分逆运动学控制器(200Hz)映射为关节速度,再经阻抗控制器(1kHz)计算关节力矩;灵巧手关节位置控制器运行于 1kHz;篮筐相机 42 FPS,手腕相机 30 FPS;机械臂与手的传感器数据率均为 1kHz。实验并行使用 6 个机器人 cell。
评测 benchmark
Table I(plug insertion,仿真,1000 次评测 episode,每次 10 秒,含物理 DR + 扰动): Vanilla RL 0%;Vanilla RL + Mechanism 1 0%;Vanilla RL + Mechanism 1 + Success Filter 0%;Vanilla RL + Mechanisms 1&2 97.2%;DemoStart(机制 1+2+3)99.6%;SAC-X 99.2%;DemoStart + BC 蒸馏 99.0%;SAC-X + BC 蒸馏 20.4%(蒸馏后策略学不好 SAC-X 的抖动、不平滑动作)。
Table II(DemoStart 在 5 个任务上的仿真成功率):Plug Insertion 99.6%,Plug Lift 99.7%,Cube Reorientation 99.9%,Nut and Bolt 99.8%,Screwdriver in cup 98.6%。
Table III(真实机器人,每方法/任务 100 episode,lift/定向 1 分钟、插拔 3 分钟):
| 方法 | Plug Lift | Plug Insertion | Cube reorientation |
|---|---|---|---|
| DemoStart 蒸馏 | 97% | 64% | 97% |
| SAC-X 蒸馏 | 20% | 1% | 未评测 |
| 真实遥操作 BC | 64% | 2% | 未评测 |
Table IV(plug insertion 蒸馏管线消融,仿真/真实成功率):完整设置(照片级渲染+关节角+4 相机)99.0%/64%;去掉照片级渲染 97.0%/29%;用指尖笛卡尔位姿替代关节角 98.6%/50%;3 相机 99.3%/51%;2 相机 98.1%/42%;1 相机(无手腕相机)97.0%/17%——真实世界性能随相机路数(尤其手腕相机缺失)大幅下降,仿真性能几乎不受影响。
效率对比:以 Screwdriver-in-cup 为例,DemoStart 策略完成任务的中位耗时 3.5 秒,而演示本身的中位耗时为 93.2 秒——学到的行为显著比演示更高效。
论文未与 ALOHA 系之外的第三方公开 benchmark 或 SOTA 方法比较,所有基线(Vanilla RL、SAC-X、真实遥操作 BC)均为自建对照。
创新点与影响
- Zero-Variance Filtering(ZVF):一个无需额外智能体或中心控制器、可直接搭配二值稀疏奖励的自动课程启发式,相比 PAIRED/PLR 更易嵌入已有 RL 系统。
- 把”演示状态”与”演示动作”彻底解耦——只用演示状态做训练起点,从不模仿演示动作序列,因此能利用数量极少(2–60条)、质量较差、甚至只覆盖任务局部片段的演示(如仅”把插头掰正”而非完整插入)。
- 用受控实验证明:演示量比真实机器人直接模仿学习少两个数量级(20 条仿真演示 ≈0.5 小时 vs 2753 条真实演示 ≈27 小时、36 天)即可蒸馏出在真实世界上同时优于从零 RL(SAC-X,需要人工设计辅助奖励)与真实遥操作 BC 基线的视觉运动策略。
- 作者自陈局限:(1) 仅用演示塑造起始状态分布、不约束动作目标,导致更难对最终解是否”贴近演示”给出保证;(2) ZVF 的方差判据在环境本身随机性较大、而非策略能力差异导致方差时可能失效;(3) 因 ZVF 丢弃大部分 rollout 数据、又用稀疏奖励,方法比稠密奖励方法更耗算力,作者建议用 GPU 版仿真器或更聪明的起点筛选来缓解;(4) 未来方向:把真实机器人数据纳入蒸馏阶段第二训练环节,形成部署中持续自我提升的闭环。
原始链接
- arXiv abstract: https://arxiv.org/abs/2409.06613
- arXiv PDF: https://arxiv.org/pdf/2409.06613
- 项目主页: https://sites.google.com/view/demostart
- DeepMind 官方博客: https://deepmind.google/discover/blog/advances-in-robot-dexterity/
一手源存档(sources/)
- demostart—blog — DeepMind 官方博客(同期发布 DemoStart 与 aloha-unleashed 两篇论文的介绍)
- demostart—project-page — 项目主页(摘要、任务演示视频)
- arXiv 原文 PDF(arxiv.org/pdf/2409.06613,不入 git)