一句话定位

Mobile ALOHA 把桌面双臂遥操作系统 ALOHA 装到一台可背驱(backdrive)的移动底盘上,做出一套造价 3.2 万美元、能连续用几个小时、全身 16 自由度可同时遥操作的双臂移动操作数据采集平台;再配一条极简的 co-training 配方——把新采的移动数据和已有的 825 条静态 ALOHA 演示 各按 50% 概率混采——就能用每个任务仅 20~50 条演示把 ACT 训到炒虾、开双门柜收锅、叫电梯并进电梯、水龙头冲洗平底锅等 7 个复杂长程任务上,多数任务成功率 >80%,co-training 相对不用带来平均 34% 的绝对提升(个别子任务最高 +90%)。CoRL 2024。

背景与定位

论文站在「模仿学习已在桌面操作上很能打、但缺乏移动性和全身协调」这个缺口上。作者点名两个卡住双臂移动操作普及的因素:

  • 没有低成本、即插即用的全身遥操作硬件。现成的双臂移动机器人(PR2、TIAGo)动辄 20 万美元以上;PR1 靠两个力反馈设备加脚踏板遥操作,TIAGo 要动捕重定向且只控单臂,Stretch/Fetch 用手柄键盘但不支持双臂或全身遥操作。
  • 此前机器人学习工作没在复杂任务上做出高性能双臂移动操作。表达力强的扩散模型/Transformer 在精细多模态桌面任务上表现好,但移动带来的额外自由度让「臂-底盘」交互变复杂——底盘位姿的小偏差会被放大成末端的大漂移,此前没有令人信服的软硬件方案。

本文的路线是纯模仿学习 + 数据 co-training,刻意避开 model-based 控制(DARPA 机器人挑战赛式的重工程、依赖状态估计/深度/包围盒),端到端从原始 RGB 直接映射到全身动作。方法侧直接复用 ACT(Zhao 2023,随 ALOHA 一起提出)、Diffusion Policy(Chi 2023)、VINN(Pari 2021)三种现成模仿学习算法,几乎不改实现。co-training 的灵感来自单臂操作 / 导航上「跨相似机器人数据集共训有正迁移」的既有结果( Open X-Embodiment 等),但作者指出双臂移动操作数据几乎没有,于是转而复用更易采、更丰富的静态双臂 ALOHA 数据。据作者所知,这是首次发现「用静态操作数据 co-training 能提升移动操作策略的性能与数据效率」。它与 数据 scaling law 一类 data-centric 的模仿学习研究是同一谱系——都在回答「该采什么数据、怎么用最省的数据训出可用策略」。

模型架构

本文的「模型」有两层:硬件本体(数据采集平台)和策略网络(复用现成模仿学习算法)。

硬件(Mobile ALOHA 本体) —— 四条设计原则:移动(≈人步速)、稳定(能搬重物)、全身可遥操作、无线(板载电源+算力)。

  • 移动底盘:AgileX Tracer 差速驱动 AGV,低姿态、原为仓储物流设计,最高 1.6 m/s(接近人步速;系统实测移动速度约 1.42 m/s),最大载荷 100 kg,可翻越 10 mm 高障碍、带载爬 坡,最小离地 30 mm(实测能跨越楼层与电梯之间的缝隙)。Tracer 在美国售价 $7,000,比 Clearpath 同等速度/载荷的 AGV 便宜 5 倍以上。
  • 手臂:沿用 ALOHA 的 leader-follower 双臂结构;自主执行时只保留两台 ViperX 300(遥操作用的 leader 臂和背驱结构拧掉 4 颗螺丝即可拆除,减小占地与重量)。四条臂全部朝前安装(原版 ALOHA 是两臂相对),扩大工作空间、改善人体工学。
  • 全身遥操作接口:因为操作者双手已占用于 leader 臂,作者用把操作者腰部拴到移动底盘这一「最简单直接」的方案——扭矩关断时轮子低摩擦可被人体背驱(vinyl 地面滚动阻力实测约 13 N),人后退即带动底盘后退,从而在双手控臂的同时独立控底盘;直接拴接还带来碰撞时的粗粒度触觉反馈。拴接点高度与 leader 臂位置各可独立调 30 cm
  • 供电与算力:底盘放 1.26 kWh / 14 kg 电池,兼作低重心配重防倾覆;数据采集与推理全部跑在一台消费级笔记本上(NVIDIA 3070 Ti GPU,8 GB 显存 + Intel i7-12800H)。
  • 传感:3 台 Logitech C922x RGB 网络摄像头(两台腕装、一台前向),分辨率 480×640(正文写 50 Hz 流,附录 A.2 写 30 fps——两处口径不一致);4 条臂经 USB 串口回传本体感知,底盘经 CAN 总线回传线速度/角速度。
  • 规格:垂直可达 65–200 cm,水平伸出底盘 100 cm,整机可举 1.5 kg(单臂上限 750 g,重物需双臂合抱)、在 1.5 m 高处可施 100 N 拉力;整机占地 90×135 cm;总预算 约 $32k(含板载电源与算力,与单台工业协作臂 Franka Panda 相当)。软硬件全开源,附 3D 打印/组装/软件安装教程。

策略网络(动作建模) —— 关键在动作空间的极简拼接:

  • 动作头:把 ALOHA 的 14 维关节位置(含两个连续夹爪动作,a_arms∈ℝ¹⁴)与移动底盘的目标线速度、角速度(a_base∈ℝ²)直接拼成 16 维动作向量。这样几乎不改现成模仿学习算法即可直接用。臂用位置控制、底盘用速度控制
  • 观测:两路腕相机 RGB + 一路装在两臂之间的前向 egocentric 顶相机 RGB + 各臂关节位置。
  • Action chunking(关键):策略一次预测一段未来动作序列而非单步动作(ACT/Diffusion 自带,VINN 也补上)。除了提升轨迹连贯性、降低逐步推理延迟外,对 Mobile ALOHA 还有独特价值——灵活处理不同硬件部件的延迟:底盘目标速度和实际速度间有明显延迟,位控臂延迟小得多。为补偿底盘 d 步延迟,机器人执行长度 k 的动作块时,执行前 k−d 个臂动作和后 k−d 个底盘动作
  • 三种 backbone:ACT(Transformer,pretrained ResNet18 视觉骨干,chunk size 45)、Diffusion Policy(1D UNet 去噪 + DDIM,chunk size 64)、VINN+Chunking(BYOL 视觉表征 + 最近邻检索动作块,chunk size 100)。

数据

数据是这篇论文(category=data)的主线,分两部分:新采的移动数据 + 复用的静态数据。

  • Mobile ALOHA 移动数据(in-domain):7 个任务,每任务仅 20 或 50 条演示——Wipe Wine 50、Cook Shrimp 20、Rinse Pan 50、Use Cabinet 50、Call Elevator 50、Push Chairs 50、High Five 20。由两名专家操作者采集。平台支持数小时连续遥操作(作者演示了做三道菜、打扫公共卫生间、洗衣服等超长时段采集)。
  • 静态 ALOHA 数据(co-training 源):来自原版 ALOHA [104] 与 [81]、经 RT-X 发布,共 825 条演示。任务与移动任务完全不相交:Ziploc 封口、拿叉子、糖果包装、撕纸巾、开塑料杯盖、玩乒乓、胶带分配、用咖啡机、递铅笔、系魔术贴线缆、插电池、递螺丝刀。全部在黑色桌面上、两臂相对固定——与 Mobile ALOHA(背景随底盘移动、两臂并排朝前)任务和形态都不同。作者不对静态数据的 RGB 或双臂动作做任何特殊处理
  • 配比 / 混采策略:训练每个 mini-batch 以相等概率(各 50%)从静态数据和移动任务数据采样,batch size 16。因静态数据没有底盘动作,把其动作标签零填充到相同维度(底盘部分填 [0,0]);同时忽略静态数据的前向相机使两数据集都是 3 路相机;动作归一化只按移动数据的统计量做。
  • 数据配比稳健性(Table 3,Wipe Wine + ACT):静态数据采样率取 30% / 50% / 70%,成功率 95% / 95% / 90%,基本不敏感,减少了迁到新任务时的调参负担。
  • 动作标注:遥操作本身即动作标签——leader 臂回传目标关节位置、底盘回传线/角速度,无需额外标注。全为真实世界数据,无仿真、无 sim-to-real
  • 开环回放误差(说明数据必须闭环学):对所有任务,把物体复位到相同初始配置后开环回放一条演示,整任务成功率为 0。以「半径约 1 m 的 180° 转弯」为例,回放底盘速度序列后末端平均误差 约 10 cm(20 次回放全部偏左约 10 cm、沿一条线散布约 20 cm)。这说明成功必须靠学到的策略闭环纠错,而策略确实能在无 SLAM 等显式定位下纠正此类误差。

训练方法

  • 目标:监督式行为克隆(BC)/ 模仿学习。移动任务策略 π^m 的训练目标是「移动数据上的模仿损失 + 静态数据上的模仿损失(底盘动作置 [0,0])」两项之和,两者等概率采样。全程无 RL
  • co-training vs pre-training(Table 4,Wipe Wine + ACT):co-train 95% > 先在静态数据上 pre-train 10K 步再 fine-tune 的 40% ≈ 只用移动数据的 50%。即 pre-train 相对纯 in-domain 无增益,作者推测微调阶段网络遗忘了静态数据的经验——co-training 才是有效用法
  • 数据效率消融(Fig 3,Wipe Wine + ACT,各 20 次试验):co-training 一致优于纯移动数据;co-train 用 35 条演示(70%)即超过不 co-train 用 50 条演示(50%),领先 20%
  • 关键超参
    • co-training:移动/静态采样概率各 0.5。
    • ACT:LR 2e-5、batch 16、encoder 4 层 / decoder 7 层、FFN 3200、hidden 512、8 头、chunk 45、β=10、dropout 0.1、backbone pretrained ResNet18。
    • Diffusion Policy:LR 1e-4、batch 32、chunk 64、DDIM、训练/测试去噪步 50/10、EMA power 0.75、ResNet18 + UNet 噪声预测器,图像增广(RandomCrop 0.95、ColorJitter、RandomRotation ±5°)。
    • VINN:BYOL 特征器 LR 3e-4、batch 128、100 epoch、momentum 0.9、weight decay 1.5e-6;检索时 k 按最低验证损失选、chunk 100、state weight 5、三相机特征权重 1:1:1。

Infra(训练 / 推理工程)

  • 训练:论文未披露 GPU 型号/张数/GPU-hours/并行方式/精度等训练侧工程细节(模仿学习模型小,训练不是本文瓶颈)。
  • 推理 / 边缘部署:数据采集与自主推理全部在板载消费级笔记本上完成——NVIDIA 3070 Ti(8 GB 显存)+ Intel i7-12800H,无外接算力、无云端。相机以 480×640 取流(正文 50 Hz / 附录 30 fps,口径不一)。具体控制频率 Hz / 推理 FPS / 端到端延迟数值未披露;论文只定性说 action chunking 用于抵消底盘速度控制的延迟。
  • 硬件工程栈:AgileX Tracer 底盘(CAN 总线,pyagxrobots SDK,sudo ip link set can0 up type can bitrate 500000);4 台 Interbotix/Trossen 机械臂经 USB 串口 + udev 固定符号链接(ttyDXL_master/puppet_left/right);3 台 webcam 经 udev 固定为 CAM_HIGH / CAM_LEFT_WRIST / CAM_RIGHT_WRIST;软件基于 ROS 1 noetic(Ubuntu 18.04/20.04),训练代码在单独的 act-plus-plus 仓库。

评测 benchmark

所有指标来自一手论文。子任务成功率 = 成功 / 尝试(尝试数 = 上一子任务的成功数),故整任务成功率 = 各子任务成功率之积。每个成功率由 20 次试验 计算,Cook Shrimp 例外为 5 次

Table 1 — co-training 提升 ACT(整任务成功率,有/无 co-train)

任务演示数Co-trainNo Co-train提升
Wipe Wine5095%50%+45%
Cook Shrimp2040%20%+20%
Rinse Pan5080%0%+80%
Use Cabinet5085%85%≈0
Call Elevator5095%0%+95%
Push Chairs5080%0%+80%(OOD 椅子泛化)
High Five2085%85%≈0
  • 7 个任务中 5 个整任务提升,提升幅度 45% / 20% / 80% / 95% / 80%;平均 34% 绝对提升(摘要称最高提升可达 90%)。
  • co-training 对精细操作是瓶颈的子任务尤其有用:Press Button(叫电梯,按钮 2×2 cm)、Turn On Faucet(不锈钢小旋钮,约 4 cm 长 0.7 cm 径,需视觉伺服)、Flip Shrimp——这些地方复合误差最致命。无 co-train 时 Rinse Pan 的 Turn On Faucet 掉到 0%、Call Elevator 的 Press Button 仅 5%(其后的 Enter Elevator 与整任务均 0%)。
  • 泛化更好:Push Chairs 只采前 3 把椅子的数据,co-train 在未见的第 4、5 把椅子上分别领先 15%、89%;Wipe Wine 在酒杯随机化区域边界处 co-train 更稳,说明 co-training 还能抑制过拟合(20–50 条低数据 + 强 Transformer 策略)。
  • 唯一 <80% 的是 Cook Shrimp(40%)——75 秒长程任务、仅 20 条演示,翻虾与把虾倒进低对比度白碗易失败,作者归因于数据量不足。

Table 2 — 三算法兼容性(整任务,Wipe Wine / Push Chairs)

方法Wipe Wine(co / no)Push Chairs(co / no)
ACT95% / 50%100% / 100%
Diffusion Policy65% / 35%100% / 80%
VINN + Chunking15% / 20%60% / 40%
  • ACT 最强;Diffusion Policy 因表达力强、50 条演示偏少而在 Wipe Wine 只 65%(既有 Diffusion Policy 工作常用 250+ 条);VINN 全面偏弱但仍有可用成功率。
  • co-training 对 ACT、Diffusion 都提升(Diffusion Wipe Wine +30% / Push Chairs +20%);对 VINN 结果不一(Wipe Wine −5%、Push Chairs +20%),因为 VINN 只 co-train 了表征、检索式动作预测无法利用域外静态数据。

User study(遥操作易用性):8 名 CS 研究生(5 女 3 男,21–26 岁,4 人无遥操作经验),先自由熟悉 3 分钟,再各做 Wipe Wine 与 Use Cabinet 各 5 次。平均完成时间:Wipe Wine 46s → 28s(−39%)、Use Cabinet 75s → 36s(−52%),5 次内即接近专家速度。

创新点与影响

  • 贡献一(硬件/数据):一套低成本(<$32k)、可无线连续数小时使用、全身可遥操作的双臂移动操作数据采集平台,软硬件全开源。它把「怎样低成本采到双臂+移动+全身协调的高质量演示」这一采集难题解决到工程可复现级,直接催生了后续一大批 mobile / bimanual 遥操作数据工作,也是家用机器人「爆火出圈」的代表 demo。
  • 贡献二(方法/数据用法)co-training 配方——用与目标任务不相交、形态不同的静态双臂数据按 50% 混采,即可让移动操作策略在每任务仅 20–50 条演示下达到多数 >80% 的成功率(平均 +34%)。三条经验被反复引用:co-train > pre-train;对数据配比不敏感(30/50/70% 都行);对精细子任务与分布外泛化提升最大。作者称这是首次证明静态操作数据 co-training 能提升移动操作的性能与数据效率
  • 改变了什么:把双臂移动操作从「贵、难、要重工程」拉到「消费级笔记本 + 几十条演示 + 现成模仿学习算法」的可达区间;aloha/act-plus-plus 成为社区标准的低成本双臂操作软硬件基线之一。
  • 作者自述局限:(1) 占地 90×135 cm 仍偏大,某些狭窄通道过不去;(2) 两条 follower 臂高度固定,低柜、烤箱、洗碗机够不到,计划给臂加升降自由度;(3) 只做单任务模仿学习,机器人不能自主改进或探索获取新知识;(4) 演示由两名专家采集,如何从高度次优、异质的数据中学习留待将来。

原始链接

一手源存档(sources/)

  • mobile-aloha—github-readme — GitHub README(ROS/conda 安装、Tracer 底盘 CAN 配置、4 臂+3 相机 udev 固定、遥操作/采集/回放脚本)
  • mobile-aloha—project-page — 项目主页(团队、摘要、自主技能/遥操作/鲁棒性 demo 清单、CoRL 2024 BibTeX、数据集与两个代码库入口)
  • arXiv 原文 PDF(arxiv.org/pdf/2401.02117,不入 git)