一句话定位

UMI 是一套「不用机器人就能采机器人数据」的采集+策略学习框架:一把 780g、3D 打印、装了一台 GoPro 作唯一传感器的手持平行夹爪,配上鱼眼镜头、侧镜、IMU-视觉惯性 SLAM、连续夹爪宽度追踪,把野外人手演示直接变成可训练的机器人动作;再在策略侧用推理期延迟匹配 + 相对轨迹动作表示 + Diffusion Policy,把一份手持数据零样本部署到不同机器人本体(UR5、Franka FR2、ARX),做出动态抛掷、双臂叠衣、超长程洗盘子等此前遥操作难以采集的技能,且野外多样数据训出的策略对新环境/新物体有约 70% 的零样本泛化。RSS 2024 最佳系统论文奖入围。

背景与定位

论文站在「机器人操作数据从哪来」这个瓶颈上,把已有路线分成三类并逐一指出短板:

  • 遥操作真机数据ALOHA、GELLO、spacemouse、VR):直接可迁移,但需要真机在场、专家操作、成本高、被限制在实验室,且数据/策略是本体专属(embodiment-specific)不可复用;外骨骼虽去掉真机依赖但部署仍需真机遥操作数据微调。
  • 野外人类视频(YouTube 等):视觉多样但缺显式动作、且人-机之间具身鸿沟大,观测也对不齐,迁移困难。
  • 手持夹爪(此前的 sensorized hand-held gripper,如 Dobb-E 的 reacher-grabber+iPhone):是介于二者的中间地带,观测鸿沟小、便携直观,但受限于 6DoF 位姿恢复精度低——多用单目 SfM(尺度模糊)、RGB-D 融合(贵、需板载算力)或外部动捕(只能实验室),因此只能做准静态抓取/pick-and-place,缺乏动作多样性,且往往需要针对环境微调。

UMI 把失败原因具体拆成四点并逐一对症:(1) 腕装相机视觉上下文不足→鱼眼扩大视场;(2) 动作不精确(SfM 尺度模糊/运动模糊)→视觉惯性 SLAM 恢复真实尺度;(3) 训练无延迟、推理有多源延迟导致动作失同步→推理期延迟匹配;(4) 简单策略(MLP+回归)拟合不了人类数据的多模态→用 Diffusion Policy。方法侧直接复用 Diffusion Policy(Chi 2023,同一批作者),并声明 ACT 可作 drop-in 替换。它与 Mobile ALOHA数据 scaling lawOpen X-Embodiment 同属 data-centric 模仿学习谱系,但独特之处是彻底把真机从采集环节移除,让数据以单个标准 mp4 文件在互联网上分发、支持地理分布式众包采集。

模型架构

UMI 的「架构」有两层:采集接口硬件(Demonstration Interface)策略接口(Policy Interface)

采集硬件(UMI gripper) —— 触发式手持 3D 打印平行夹爪 + 软指,GoPro 作唯一传感与记录设备:

  • HD1 腕装相机:GoPro 装在与手持夹爪相同位置、相同 3D 打印指上,人演示与机器人部署时相机视角几乎不可区分,最小化观测具身鸿沟;相机机械固定于指上,部署到机器人免相机-机器人-世界标定,抗机械冲击。
  • HD2 鱼眼镜头:155° 鱼眼附加镜。直接把原始鱼眼图喂给策略(不做去畸变)——鱼眼恰好在中心保分辨率、周边压缩信息;若矫正到针孔模型会把周边极度拉伸、把最重要的中心信息压到小块。鱼眼还提升 SLAM 鲁棒性。
  • HD3 侧镜(implicit stereo):夹爪周边视野放一对物理镜子,镜中像等价于沿镜面反射的两台虚拟相机,无额外成本/重量地提供隐式立体深度;策略输入时把镜中裁剪区数字翻转(并左右互换)效果最好——否则镜像里物体朝向相反会迷惑有平移等变性的视觉编码器。
  • HD4 IMU-视觉惯性 SLAM:利用 GoPro 内录的 IMU(加速度计+陀螺仪,随标准 mp4 存储),基于 ORB-SLAM3 做惯性-单目 SLAM,运动模糊/无纹理(低头看桌面)时靠惯性短时维持追踪,从而能采/部署动态抛掷;联合视惯优化直接恢复真实米制尺度,是动作精度与双臂间位姿本体感知的关键。
  • HD5 连续夹爪控制:不同于此前二值开合,UMI 用基准标记(fiducial marker)连续追踪指宽;配合弹性末端执行器(series-elastic)原理,软指形变可隐式记录/控制抓握力。抛掷任务需按物体宽度精确控制释放时机,二值动作无法满足。
  • HD6 运动学数据过滤:采集本身与机器人无关,但用已知机器人底座+运动学,对 SLAM 恢复的绝对末端位姿做运动学/动力学可行性过滤,只保留对某本体有效的轨迹。
  • 规格:整机 780g;外形 L310 × W175 × H210 mm;指行程 80 mm。3D 打印夹爪 BoM $73,GoPro + 配件 $298(合计约 $371)。

策略接口(Policy Interface) —— 目标是让策略对机器人硬件平台无关:

  • 输入:一序列同步观测(RGB 图、6DoF 末端位姿、夹爪宽度);输出:一序列目标末端位姿 + 夹爪宽度。视觉编码器按任务而定(Table A1):Cup Arrangement / Dish Washing 用 CLIP 预训练 ViT-B/16、Obj Tossing / Cloth Folding 用从零训 ResNet-34(无预训练)、野外 cup 用 CLIP ViT-L/14;CLIP 微调时学习率设为扩散模型的 1/10;策略主体用 Diffusion Policy(DDIM,训练 50 步 / 推理 16 步)。
  • PD1 推理期延迟匹配:采集时 GoPro 同步视频/IMU/视觉夹爪宽度零延迟,但真机各流(RGB、位姿、夹爪)由分布式微控制器采集、延迟从个位数到数百毫秒不等。观测侧把所有流对齐到延迟最高的流(通常相机),先把 RGB 降采样到目标频率(常 10–20Hz),再用图像时间戳线性插值本体感知;双臂系统靠最近邻软同步两相机(最大差 1/60 秒)。动作侧则提前发指令补偿执行延迟,丢弃因延迟已过时的前几步动作。
  • PD2 相对末端位姿:所有末端位姿都表示为相对当前末端位姿,避开本体/部署专属坐标系。(2.1) 动作用相对轨迹(从 t0 起的一段 SE(3) 变换序列,均相对 t0 的末端位姿),比 delta 动作不累积误差、比绝对动作免全局标定;(2.2) 本体感知也用相对轨迹,观测窗=2 时隐式提供速度信息,使系统免标定、移动底座不影响性能(可用于移动操作);(2.3) 双臂时提供两夹爪间相对位姿对协调至关重要——靠 map-then-localize 方案(先扫场景建图,之后所有演示重定位到同一张地图共享坐标系)计算。

数据

数据是本文(category=data)主线,分四个真实世界任务数据集 + 一个大规模野外泛化数据集,全为真机之外采集、无仿真、无 sim-to-real

  • Cup Arrangement(窄域)305 条,2 名演示者。
  • Dynamic Tossing(动态抛掷)280 条,混合多物体/单物体抓取与抛掷;把 YCB 里 6 个物体(3 球形→圆桶、3 乐高→方桶)分拣,桶放在机器人运动学可达范围之外,强制需要动态动作。
  • Bimanual Cloth Folding(双臂叠毛衣)250 条,2 名演示者,初始态随机(平移/旋转衣服、折袖);单一集中式策略同时出两臂两夹爪动作。
  • Dish Washing(洗盘子,7 步超长程)258 条,1 名演示者,随机化番茄酱图案、盘/海绵位置、水龙头角度;显式演示了加番茄酱后的恢复行为(追加脏污后重新洗擦)。
  • 野外 Cup Arrangement(泛化)1400 条,3 名演示者在 12 人·小时内、跨 30 个真实地点(家、办公室、餐厅、户外)采集;涉及 15 个不同颜色/形状(圆柱/锥形)/材质(陶瓷、玻璃、金属)的浓缩咖啡杯。README 补充:训练用杯全部取自亚马逊「espresso cup with saucer」品类(附了 Amazon 购物清单),跨 30 地采集(README/论文均未给「20 款 / 18 训 2 测」这类拆分数字)。
  • 数据格式与流程:单个标准 mp4 即含视频+IMU+视觉夹爪宽度;一条脚本自动按 GoPro 序列号消歧左右夹爪、配对视频、用 SLAM+基准标记恢复动作。采集 4 步:(可选)时间同步(扫手机上滚动 QR 校准两台 GoPro 内部时钟,±1/60 秒精度,GoPro Labs 固件)、(可选)夹爪标定(录 5 次开合校准最小/最大指宽)、建图(慢移夹爪扫场景约 1 分钟,可选放临时基准标记)、演示(单臂按录制键或遥控、双臂用语音「GoPro capture / stop capture」分段)。README 示例数据集 99% 原始数据可用(成功 SLAM)、0 条演示被丢弃
  • 动作标注:SLAM 恢复的 6DoF 末端位姿即动作标签,无需额外标注。

训练方法

  • 目标函数:Diffusion Policy 的动作扩散去噪(条件行为克隆),单一集中式策略在双臂任务中同时输出两臂两夹爪动作;不做 RL,纯模仿学习。
  • 视觉编码器(Table A1):并非全用 ViT——Obj Tossing / Cloth Folding 直接从零训 ResNet-34(无预训练,视觉编码器学习率=扩散模型 3e-4)就够用;Cup Arrangement / Dish Washing 用 CLIP 预训练 ViT-B/16 微调(学习率是扩散模型的 1/10,即 3e-5)。洗盘子这种视觉复杂任务,从零训 ResNet-34 会学出非反应式行为、无视盘/海绵位置变化(0/10 成功),必须换 CLIP 预训练 ViT-B/16;野外 cup 泛化进一步升到 ViT-L/14 并仅用单步观测(省 ViT-L 训练/推理开销,偏离其余任务的双步观测窗)。
  • 动作/观测表示:相对轨迹动作 + 相对轨迹本体感知(见架构 PD2)。DDIM 调度器,训练 50 扩散步、推理 16 步。
  • 执行速度:Diffusion Policy 输出目标位姿序列带隐式 dt,但执行时可改 dt——抛掷须保原速以达释放速度,其余准静态任务用 0.5x 慢速更平滑(作者认为源于延迟补偿不完美,可通过更好的延迟匹配缓解)。
  • 图像增广:RandomCrop 比例 0.95、RandomRotation ±5°、ColorJitter(亮度 ±0.3 / 对比度 0.4 / 饱和度 0.5 / 色调 0.08)。
  • 逐任务超参(Table A1):观测/动作频率 10Hz(抛掷 20Hz);动作 horizon Ta=6;图像观测 horizon=2(野外 cup=1);本体感知 horizon=2;分辨率 224×224(叠衣/洗盘子用 2 相机视图)。学习率:扩散模型 3e-4;视觉编码器 CLIP 微调 3e-5、从零训 ResNet 3e-4。epoch 50–350、batch 224–1024。

Infra(训练 / 推理工程)

  • 训练算力(Table A1):Cup Arrangement / Obj Tossing / Cloth Folding 用 4×A10G;Dish Washing 用 8×A10G;野外 Cup(ViT-L/14)用 8×A100。README 补充:单卡训练在 RTX 3090 24GB 可跑(配 train_diffusion_unet_timm_umi_workspace),多卡用 accelerate。GPU-hours 未披露。
  • SLAM 系统:改造 ORB-SLAM3 的惯性-单目模式,加两个特性——Map as Initialization(改成在从磁盘加载的已有地图上重定位后继续正常 SLAM 优化,而非原生只读定位模式,因 UMI 操作会动态改变场景)与 Marker-enhanced Initialization(可选用已知尺寸基准标记消歧远处/重复纹理特征匹配,仅建图阶段用,演示视频不含标记);SLAM fork 提供 docker 镜像。作者自陈 ORB-SLAM3 仍是整条管线最脆弱的部分。
  • 推理硬件与延迟标定:部署用单台腕装 GoPro Hero 9 + GoPro Media Mod 1.0(USB-C→HDMI)+ Elgato HD60X 采集卡(HDMI→USB3.0 UVC)。逐组件测延迟:相机端到端用录屏上的滚动 QR 时间戳测;本体感知延迟——Franka FR2 报全局时间戳可直接相减,UR5/Schunk WSG-50 无时间戳则近似为 ping RTT 的一半;夹爪/机器人执行延迟用正弦位置指令与实测宽度/位姿的互卷积最优对齐求得。
  • 控制频率:准静态任务 10Hz,动态抛掷 20Hz。具体端到端延迟毫秒数、推理 FPS 未在正文披露具体数值。
  • UR5 部署配置(README):负载质量 1.81 kg、重心 (2, −6, 37) mm;FR2 因末端俯仰受限须 3D 打印 90° 旋转适配座装 WSG50。

评测 benchmark

全部为真机实测(同初始态、第三视角像素级对齐、人工判定成功/失败):

窄域能力实验(各 20 集,除注明)

  • Cup Arrangement:UMI 20/20 = 100%(含数字翻转侧镜)。消融:无鱼眼(矫正裁到 69° FoV,类比 RealSense D415/iPhone)→ 11/20 = 55%;绝对动作 → 5/20 = 25%(标定误差致选择偏置);delta 动作 → 16/20 = 80%;侧镜直接给(不翻转)→ 17/20 = 85%,无侧镜 18/20 = 90%,数字翻转侧镜 20/20 = 100%。跨本体:同一 checkpoint 部署到 Franka FR2 → 18/20 = 90%(2 例关节限位失败)。
  • Dynamic Tossing(120 个物体计数):带延迟匹配 105/120 = 87.5%;关掉延迟匹配(所有延迟置 0)→ 69/120 = 57.5%(抖动破坏抛掷速度与释放时机)。
  • Bimanual Cloth Folding:UMI 14/20 = 70%;去掉双臂间相对本体感知 → 6/20 = 30%(抓取不同步、常漏抓底边)。
  • Dish Washing(7 步长程):UMI 14/20 = 70%;用从零训 ResNet-34 替换 CLIP ViT → 0/10 = 0%

野外泛化(cup arrangement,两个未见环境)

  • 训练杯 28/40 = 70%、测试杯 15/20 = 75%、合计 43/60 = 71.7%;仅用窄域数据(同 ViT 骨干)在同样未见环境 → 0%(机器人根本不朝杯移动)。结论:微调大预训练模型+窄域数据不足以野外部署,多样野外数据是泛化关键

采集吞吐与 SLAM 精度

  • 吞吐(15 分钟内可采演示数,含复位/随机化/故障处理):cup arrangement 上 UMI 比 spacemouse 遥操作快 >3×、为人手速度的 48%;tossing 上 UMI 为人手 64%,而遥操作 15 分钟内一条成功演示都采不出来
  • SLAM 精度(MoCap 基准,7 单臂 + 7 双臂任务):位置平均 ATE 6.1 mm、旋转 3.5°;双臂间相对位姿误差 RPE 位置 10.1 mm、旋转 0.8°(整体 <1cm、<4°)。

创新点与影响

  • 贡献:给出一套「in-the-wild robot teaching without in-the-wild robots」的完整开源软硬件系统——把便携手持夹爪从「只能准静态 pick-and-place」推进到可做动态、双臂、精密、长程技能,且一份手持数据可跨 6DoF/7DoF 多本体零样本部署。四项对症设计(鱼眼视觉上下文、侧镜隐式立体、视惯 SLAM 真尺度+连续夹爪、推理期延迟匹配+相对轨迹表示)每一项都有消融支撑其必要性。
  • 改变了什么:证明「用非专家、地理分布式、单 mp4 文件」即可众包采集高质量、可迁移的机器人操作数据,把数据采集与真机解耦,并首次在手持数据上做出约 70% 的野外零样本泛化——这是行为克隆里少见的泛化度。UMI 硬件成本低(~$371 夹爪部分)、全开源(含 SLAM fork、硬件指南、数据教程、预训练 checkpoint),成为后续 UMI-on-Legs、DexUMI、Fast-UMI 等一系列工作的基座。RSS 2024 最佳系统论文奖入围。
  • 作者自陈局限:(1) 采集时不知下游机器人运动学限制,只能靠数据过滤保证可行性,未来应做具身感知的策略学习以迁移「有效但硬件不可行」的动作;(2) SLAM 继承视觉 SLAM 对充足纹理的依赖,纯白墙等无纹理环境会失败,未来可用第三视角相机+夹爪上基准标记补救;(3) UMI 夹爪仍比人手采集慢(重、笨、自由度少于人手),未来可用更轻材料/更好人体工学,或造足够灵巧的机器人手直接从人手动作迁移。

原始链接

一手源存档(sources/)