一句话定位
ALOHA Unleashed 在扩大版 ALOHA 2 平台上采集 26,000+ 条真实双臂遥操作演示,配一个 217M 参数、以扩散损失训练的 Transformer 编码-解码器策略(架构近乎照搬 ACT + Diffusion Policy),证明「大规模数据 + 表达力更强的扩散策略」这一极简配方本身就足以让端到端模仿学习掌握系鞋带、把衬衫挂上衣架这类此前被认为需要专用高精度硬件(如手术机器人)或精细力/触觉建模才能完成的可变形物体双臂任务——全程只用 4 路 RGB + 本体感知,没有力/触觉反馈。CoRL 2024。
背景与定位
论文站在「模仿学习已在非灵巧任务(拾放、推动)上很能打,但灵巧双臂操作(可变形物体、复杂接触动力学、多步骤高精度)仍被视为极难」这一缺口上。作者点名此前处理系鞋带、解绳结、穿针一类高精度双臂任务的工作,大多依赖造价高昂、普通人难以获取的平台(如 Intuitive 的手术机器人),而非低成本可扩展硬件。
本文刻意选择极简路线:架构上直接复用 ACT(Zhao et al., 2023,随 ALOHA 一起提出的 Transformer 动作分块策略)的编码-解码器骨架,训练目标换成 Diffusion Policy(Chi et al., 2023)式的扩散损失;不引入力/触觉传感、不做显式状态估计或运动学精修,把主要工程投入放在数据采集规模与多样性上——在 ALOHA 2(Team et al., 2024,Stanford 原版 ALOHA 的增强版双臂遥操作硬件)低成本工作站基础上,组织 35 名非研究员操作员长期采集数据。这与同一团队的 Mobile ALOHA(用 co-training 把静态操作数据和移动操作数据混采、以更少演示达到高性能)形成对照:Mobile ALOHA 走的是「小样本 + 数据复用」,ALOHA Unleashed 走的是「纯规模 + 更强表达力模型」;二者共同验证了 ALOHA 谱系「模仿学习 + 精心设计的数据管线」范式在不同轴上的可扩展性。方法部分也提及 RT-2 式的动作 token 化思路,但本文选择了扩散建模而非离散 token 化以处理多模态动作分布。
模型架构
- 视觉编码:4 路 RGB 相机图像(各 resize 到 480×640×3),每路独立送入一个 ImageNet 预训练的 ResNet50,取 stage-4 输出得到 15×20×512 特征图,展平后得到 1200 个 512 维 embedding;再拼接 1 个机器人本体感知(两臂关节位置+夹爪值)投影得到的 embedding,共 1201 个 token,加位置编码后送入 85M 参数的 Transformer Encoder(双向注意力),产生观测 latent。
- 扩散解码:一个 55M 参数的 Transformer Decoder(双向注意力),输入是带学习位置编码的加噪动作块(50×14 张量),对编码器 latent 与扩散时间步(one-hot 表示)做 cross-attention,输出 50×512,再经线性层投影为 50×14 的预测噪声。
- 参数规模:Base 模型(85M 编码器 + 55M 解码器 + 4×ResNet50 视觉骨干等其余部分)合计 217M 可学习参数;消融实验用的 Small 变体编码器/解码器分别缩小到 17M / 37M,网络总参数为 150M(论文原文对 Base/Small 均只单独给出编码器与解码器参数量,二者相加均明显小于各自的总参数量,差额来自视觉骨干等未单列部分,此处如实按原文数字呈现)。
- 动作空间:14 维——两条 6-自由度 ViperX 臂各 6 个绝对关节位置(共 12 维)+ 两个夹爪各 1 个连续值(共 2 维)。动作分块(action chunking)一次预测 50 步动作,对应 1 秒轨迹;测试时开环执行整段 chunk,不像 ACT 那样做时序集成(temporal ensembling)。
- 扩散公式:采用 DDIM(Denoising Diffusion Implicit Models)形式化,训练时用 50 步扩散、squared-cosine 噪声调度;测试时步数可灵活调整(消融了 50/25/2 步,见下)。
- 推理延迟:一次完整前向 + 迭代去噪在单张 RTX 4090 GPU 上耗时 0.043 秒;由于动作块开环执行 1 秒,实际可轻松超过 50Hz 的目标控制频率。
- 每个任务单独训练一个策略,不做多任务/语言条件化的共享权重。
数据
-
真实数据规模:26,000+ 条演示,覆盖 5 个真实任务,由10 台不同的 ALOHA 2 机器人在2 栋不同建筑、历时8 个月采集,由一支 35 人的非研究员操作员团队完成——每个任务操作员先采 5–10 条测试演示交研究员审核质量,通过后才批量采集,全程无需研究员持续监督。
-
各任务演示量与成功率(20 次试验,超时 80 秒/ShirtMessy 120 秒):
任务 演示数 成功率 ShirtEasy 8,658(5,345 Easy + 3,313 Messy 共享一个模型;正文另一处写 ShirtMessy 为 “3,113”,与表 1 的 3,313 不一致,疑似原文笔误) 75% ShirtMessy 同上 70% LaceEasy 5,133(2,212 Easy + 2,921 Messy 共享一个模型) 70% LaceMessy 同上 40% FingerReplace 5,247 75% GearInsert(插 1/2/3 个齿轮,累进统计) 4,005 95% / 75% / 40% RandomKitchen(叠 Bowl / Bowl+Cup / Bowl+Cup+Fork,累进统计) 3,198(其中 216 为评测所用机器人的域内演示,其余 2,983 来自另一栋楼的不同硬件迭代版本) 95% / 65% / 25% -
仿真数据:3 个仿真任务共 2,000+ 条演示——SingleInsertion 522、DoubleInsertion 201、MugOnPlate 550——通过遥操作 MuJoCo Menagerie 的 ALOHA 2 模型采集。
-
动作标注:遥操作本身即标签(leader 臂关节位置 + 夹爪值),无需额外标注。
-
数据量/质量消融(用 150M 参数 Small 模型,仅针对 Shirt 任务):把数据下采样到 75%/50%/25%(对应 6,493/4,329/2,164 条),ShirtEasy 成功率相对稳定(75%/85%/30%),但 ShirtMessy 随数据减少急剧下滑(70%→20%→0%),说明「凌乱」初始化任务对数据量更敏感。进一步对 25% 采样(2,164 条)按episode 时长过滤:保留最短 75%(1,623 条,<43s)成功率仍 30%;保留最短 50%(1,082 条,<29s)成功率升到 55%;但激进过滤到最短 25%(仅 541 条,<20s,几乎全是无失误演示)成功率降到 40%——作者认为过滤掉冗长(多半含操作失误)的演示有帮助,但过度过滤会丢失恢复/重试类有价值的次优演示。
-
硬件差异:附录测量了 12 台 ALOHA 2 机器人的底座位置,机身/相机安装存在毫米级差异,加上跨建筑的背景光照差异,共同构成数据集里机器人本体的多样性来源。
训练方法
- 目标:监督式扩散去噪损失(预测加到动作块上的噪声),全程无 RL。
- 优化器与超参:JAX 训练,Adam,权重衰减 0.001,batch size 256,训练 2M 步(约 265 小时),线性 warmup 5,000 步后恒定学习率 1e-4。
- 扩散 vs L1 回归消融(同为 150M 参数架构):把扩散损失换成 L1 回归损失(使系统更接近纯 ACT),在 ShirtMessy(真实)上从 70%(Diffusion)跌到 25%(L1);仿真三任务上 Diffusion Policy(XS-LowRes)在 SingleInsertion(58±3 vs 32)与 MugOnPlate(74±0 vs 40)上胜出,但在 DoubleInsertion(48±2 vs 58)上不敌 ACT——作者指出参数更小的 ACT 更易调参,在数据量小时往往表现更好。
- Chunk size 消融:仿真 SingleInsertion 上把 chunk size 从 50 改为 10,单 seed 最佳成绩 66,高于 chunk 50 对应设置 3-seed 均值 58±3;但作者强调 chunk size 高度任务相关,真实实验统一固定为 50。
- 扩散步数消融:DDIM 采样器分别用 50/25/2 步做推理,在仿真 SingleInsertion 任务上几乎不影响评测曲线;真实任务保留完整 50 步,因为未观测到明显的延迟收益。
Infra(训练 / 推理工程)
- 训练:JAX,64 块 TPUv5e 芯片,数据并行(data-parallel)mesh,batch 256,训练 2M 步、约 265 GPU/TPU 小时;精度/其余并行细节论文未披露。
- 推理:单张 RTX 4090 GPU 上,一次完整前向传播 + 迭代去噪耗时 0.043 秒;因动作块以 1 秒为单位开环执行,实测可轻松超过 50Hz 目标控制频率;不使用 ACT 式的时序集成。未披露边缘部署(如板载算力)方案——ALOHA Unleashed 的评测均在带外部 GPU 的工作站上完成。
评测 benchmark
所有数字均来自论文本身,20 次试验(仿真为 50 次 rollouts):
主结果(Table 1,各任务单独训练模型):见上文”数据”表格中的成功率列。
仿真三任务对比(Table 3,50 rollouts):
| 任务 | DP (Small) | DP (XS-LowRes) | ACT (XS-LowRes) | 演示数 |
|---|---|---|---|---|
| SingleInsertion | 72 | 58±3 | 32 | 522 |
| DoubleInsertion | 60 | 48±2 | 58 | 201 |
| MugOnPlate | 80 | 74±0 | 40 | 550 |
真实任务扩散 vs ACT 对比(Table 3):ShirtMessy,DP (Small) = 70 vs ACT (150M) = 25,8,658 条演示。
注意:论文没有与 ALOHA 系之外的第三方 SOTA 方法做对比,“improved performance over state-of-the-art baselines”(摘要用语)指的就是同架构族的 ACT/L1-回归基线,而非外部公开 benchmark 排行榜对比。
泛化观察(定性,非成对成功率表):Shirt 模型在训练集未见过的成人长袖衬衫(训练集仅儿童短袖红/白/蓝/藏青/浅蓝色)上有成功 rollout;在另一栋楼、背景完全不同(家庭白墙 vs 工业实验室)的未见机器人上也有成功 rollout;ShirtMessy 模型可处理 ±60° 倾斜、皱缩、正面朝上的衬衫初始化,但对 180°/反面朝下(训练分布外)基本失败;Lace 模型学到”理顺”行为但同样在分布外状态(鞋侧翻、鞋带缠结)失效;RandomKitchen 在仅有 216 条域内演示(其余 2,983 条来自另一硬件迭代)的机器人上仍观察到一定初始状态泛化能力。
创新点与影响
- 据作者所知,是首个能自主系鞋带、挂衬衫的端到端学习策略——这两个任务此前被视为模仿学习难以触及的可变形物体+多步骤+高精度组合。
- 用受控消融证明扩散损失是必要而非锦上添花:同参数量下把损失换成 ACT 式 L1 回归,ShirtMessy 成功率从 70% 骤降到 25%。
- 罕见地在论文里量化报告了大规模真实数据采集的工程代价与数据质量/数量权衡(26k+ 演示、35 名非专家操作员、10 台机器人、2 栋建筑、8 个月;数据下采样与按时长过滤的消融曲线),为「靠规模堆数据能否解决灵巧操作」提供了一手证据。
- 作者自述局限:(1) 策略仅按单任务训练,不像其他工作那样用语言/目标图像条件化的共享权重做多任务;(2) 策略每 1 秒重规划一次(对应 50 步动作块),对非常需要快速反应的任务可能不够快;(3) 每个任务仍需大量人类遥操作演示,采集成本高。作者在结论中提出后续方向:扩展到多任务共享模型、提升反应性、降低数据需求。
原始链接
- arXiv abstract: https://arxiv.org/abs/2410.13126
- arXiv PDF: https://arxiv.org/pdf/2410.13126
- 项目主页: https://aloha-unleashed.github.io/
- 论文 PDF(项目页镜像): https://aloha-unleashed.github.io/assets/aloha_unleashed.pdf
- DeepMind 官方博客: https://deepmind.google/discover/blog/advances-in-robot-dexterity/
一手源存档(sources/)
- aloha-unleashed—blog — DeepMind 官方博客(同期发布 ALOHA Unleashed 与 DemoStart 两篇论文的介绍)
- aloha-unleashed—project-page — 项目主页(摘要、任务描述、演示视频)
- arXiv 原文 PDF(arxiv.org/pdf/2410.13126,不入 git)