一句话定位
DexUMI(Stanford + Columbia,CoRL 2025 Best Paper Finalist)把 universal-manipulation-interface(UMI)的”手持采集器直接换成机器人抓手”思路,从平行夹爪扩展到多指灵巧手:给人手戴一个针对目标机器人手逐款优化设计的可穿戴外骨骼,用编码器直接读关节角、用力敏电阻/电磁触觉阵列复刻机器人同款触觉,再用一条”分割-修复-重渲染”的视频处理流水线把训练画面里的人手/外骨骼像素换成目标机器人手像素,从而让人手采集的数据能直接喂给模仿学习策略、无需遥操作或视觉重定向。
背景与定位
灵巧手模仿学习的数据采集长期卡在”人手-机器人手”的具身鸿沟(embodiment gap)上:遥操作(motion-capture 手套、VR 设备、摄像头视觉重定向)需要机器人硬件实时在场,存在空间失配且大多没有触觉反馈;单纯用人手视频学习(learning from human hand video)又缺少与机器人一致的动作标签和视觉观测。手持采集器路线(如 UMI 系)此前只验证过平行夹爪/简单吸盘等低自由度末端,直接搬到多指手上会撞上两个新问题:外骨骼与人手在物理空间上抢位置(尤其是拇指的大范围旋转会和外骨骼结构打架),以及人手视频与机器人手视频存在明显的视觉外观差异。
范式上,DexUMI 延续 universal-manipulation-interface 开创的”人手作为采集接口”(human hand as manipulation interface)这条路线,但把它的适用范围从二指抓手扩到多指灵巧手;与同样面向手部数据采集的 dexcap(纯 mocap 手套 + 点云,仍需要视觉重定向和遥操作式人工纠正数据)相比,DexUMI 的关键区别是用穿戴外骨骼直接约束人手运动到机器人手可行的运动学空间,并把动作读数从视觉估计换成编码器直读,同时用视频修复而非重定向来解决视觉一致性问题,因此可以不依赖机器人在场、不依赖遥操作纠正数据,直接训练策略部署。
模型架构
DexUMI 本身不是一个新的策略网络架构,而是一套”硬件适配 + 软件适配”的数据采集与处理框架,下游策略用标准的 diffusion policy:
硬件适配(外骨骼设计)
- 目标:让外骨骼与目标机器人手共享同一套”关节角→指尖位姿”映射(含关节限位),同时保证人手可穿戴(wearability)。
- 建模为双层优化(bi-level optimization):给定 K 个采样的机器人手关节构型和 N 个采样的外骨骼构型,最小化二者指尖工作空间(fingertip workspace,SE(3) 中所有可达指尖位姿的集合)之间的双向最近邻距离,同时约束外骨骼工作空间是机器人工作空间的子集,防止生成机器人手不可达的位姿;设计参数包括腕部坐标系下的关节位置 j_i 和连杆长度 l_j,均带经验设定的上下界约束(例如把拇指摆动关节沿 MANO 坐标 x 轴移向手腕,避免与人类拇指旋前旋后运动碰撞)。
- 对有 URDF 的全驱动手(XHand,12 个主动自由度:拇指 3、食指 3、其余三指各 2),直接从 URDF 提取连杆长度和关节限位;对闭链、URDF 不完整的欠驱动手(Inspire Hand,12 自由度中 6 个主动,拇指 2 主动+2 被动、其余四指各 1 主动+1 被动),改用运动捕捉系统实测指尖轨迹(四指各均匀采样 16 个电机值 0→1000,拇指在摆动 0/200/400/600/800/1000 六个位置各扫一遍弯曲),拟合等效四连杆机构再代入同一优化式。
- 工艺细节:Inspire 外骨骼末端连杆额外加长 3mm 保证遮罩完全覆盖真实手指、拇指四连杆加宽消除相机视野空洞、关节限位额外收紧 5° 应对 3D 打印 PLA-CF 材料形变;XHand 外骨骼按 URDF 限位收紧约 5°(如 -110°
20° 收到 -105°15°),结构最小壁厚 4mm。 - 传感器集成三类信号:(S.1) 每个主动关节装 Alps RDC506018A 电阻式旋转编码器直读关节角(通过同步测量供电电压归一化,抵消电压漂移),并用回归模型标定编码器读数与机器人电机指令的非线性映射;(S.2) 手腕装 iPhone(15 Pro Max)经 ARKit 追踪 6-DoF 腕部位姿,仅采集期需要,部署时不用;(S.3) 腕下安装 150° 对角视场角的 OAK-1 广角相机,外骨骼和机器人手上相机安装位姿严格一致;(S.4) 触觉——XHand 沿用其自带的电磁式触觉阵列(120 个点位的三维力测量,经 SPI 输出),Inspire Hand 因无原生触觉,外骨骼和机器人手都额外加装同款力敏电阻(FSR),电压分压电路输出模拟量作为触觉代理信号。
软件适配(视频重渲染流水线,4 步)
- 用 SAM2 分割人手+外骨骼像素(固定初始手势复用同一组 prompt point);
- 用 ProPainter(光流式视频修复)填补挖除区域后的背景空洞;
- 把记录的关节动作在真实机器人手上回放(不含机械臂),单独录制”仅机器人手”的视频,再用 SAM2 提取机器人手像素;
- 遮挡感知合成:取外骨骼掩膜与机器人手掩膜的交集作为”可见掩膜”,只在该交集区域内把背景视频的像素替换成机器人手像素(而非无脑覆盖),从而保持手与物体之间正确的遮挡关系。
下游模仿学习策略:视觉观测经预训练 DINO-V2 编码(训练期随机裁剪、颜色抖动、随机灰度化、高斯模糊增强,DINO-V2 不冻结、随策略一起更新),CLS token 与触觉读数拼接后输入 diffusion policy;策略输出 16 步未来动作(6-DoF 机械臂末端相对动作 + 6-DoF/12-DoF 手部动作,Inspire/XHand 各异),部署时只执行前 8 步。
数据
- 采集规模(按任务的训练轨迹数):Cube Picking 310 条、Egg Carton Opening 175 条、Tea Picking Using Tool 400 条(Inspire 和 XHand 各自 400 条)、Kitchen 任务 370 条覆盖全部四个子步骤 + 额外 100 条专门针对”关闭旋钮”子任务。
- 采集帧率:Inspire Hand 平台上腕部位姿(ARKit)、视觉、关节编码器、触觉全部以 45 FPS 同步记录;XHand 平台降到 30 FPS(更高频率下触觉读数会不稳定)。
- 时间戳对齐:记录每路数据到达缓冲区的接收时间戳,用相机/iPhone 的滚动二维码标定法(沿用 UMI 的做法)估计相机与 IMU 的采集延迟,编码器延迟通过外骨骼图像与回放机器人手图像的叠加对齐手动调优;对齐后所有数据按相机时间戳线性插值,并整体降采样 3 倍以降低策略训练开销。
- 数据来源全部是真实世界人工采集(无仿真数据、无网络爬取视频),采集时佩戴绿色手套以配合绿色 PLA-CF 打印的外骨骼提高 SAM2 分割质量。
- 提供开箱即用的样例数据(sample_data.zip,用于跑通 render pipeline)供复现;论文未披露最终训练数据集的具体存储规模(GB/小时数)。
训练方法
- 学习范式是纯模仿学习(behavior cloning via diffusion policy),无 RL 微调、无额外仿真到真实迁移。
- 动作表示消融:finger action 用绝对位置(absolute)还是相对位置(relative);wrist action 始终用相对位置。
- 训练规模:所有任务、两种机器人手都训练 400 epoch。
- Ablation 维度(Table 1):(1) 手指动作绝对 vs 相对;(2) 有无触觉输入;(3) 视觉适配 Inpaint vs Mask(用绿色色块替换外骨骼/机器人手像素)vs Raw(不做任何处理,直接把带外骨骼的原始图像喂给策略)。
Infra(训练 / 推理工程)
- GPU 数量、GPU-hours:未披露。
- 策略推理频率:diffusion policy 以 10 Hz 输出动作(预测 16 步、执行 8 步,线性插值到硬件执行频率);机械臂(UR5)以 125 Hz 执行指令;Inspire Hand 以 10 Hz 执行;XHand 以 60 Hz 执行。
- 部署工程细节:XHand 手指在外力(如镊子回弹力)作用下会有位置漂移,10 Hz 策略反应不够快,论文引入”虚拟当前电机位置”(评估开始时读取真实电机位置作为初值,此后只累加策略输出的相对动作,不再读硬件当前值)来规避漂移导致的抓取失败;Inspire Hand 电机自锁、无此问题。
- 边缘硬件:iPhone 15 Pro Max(ARKit 腕部追踪,仅采集期)、OAK-1 相机(150° DFoV)、Alps RDC506018A 电阻编码器、XHand 自带电磁触觉阵列 / Inspire Hand 外挂 FSR。
评测 benchmark
四个真实世界任务,每个任务每种配置评测 20 次(相同初始物体摆放跨方法复用),报告阶段级累计成功率(Table 1,节选,Ours = Rel action + Inpaint 视觉,含触觉):
| 配置(动作/触觉/视觉) | Cube (IHand) | Carton (IHand) | Tea-tool (IHand) | Tea-leaf (IHand) | Tea-tool (XHand) | Tea-leaf (XHand) | Kitchen-knob | Kitchen-pan | Kitchen-salt |
|---|---|---|---|---|---|---|---|---|---|
| Rel / 有触觉 / Inpaint(Ours) | 1.00 | 0.85 | 1.00 | 0.85 | 1.00 | 0.85 | 0.95 | 0.95 | 0.75 |
| Abs / 有触觉 / Inpaint | 0.10 | 0.35 | 0.80 | 0.00 | 1.00 | 0.25 | 0.50 | 0.45 | 0.00 |
| Rel / 无触觉 / Inpaint | 0.95 | 0.90 | 1.00 | 0.90 | 0.95 | 0.80 | 0.95 | 0.95 | 0.15 |
| Abs / 无触觉 / Inpaint | 0.90 | 0.85 | 0.90 | 0.60 | 1.00 | 0.75 | 0.60 | 0.60 | 0.00 |
| Rel / 无触觉 / Mask | 0.60 | 0.10 | 0.90 | 0.50 | / | / | / | / | / |
| Rel / 无触觉 / Raw | 0.20 | 0.05 | 0.85 | 0.05 | / | / | / | / | / |
四任务两平台综合平均成功率 86%(论文摘要口径)。此外报告采集效率对比:以 tea-picking-with-tool 任务、15 分钟窗口内统计的成功示教数吞吐(collection throughput),DexUMI 比传统遥操作快 3.2 倍(仍慢于裸手直接操作)。论文未与其他具体基线方法(如 DexCap、GELLO 等)做直接数值对比,评测都是自身内部消融。
创新点与影响
- 把 UMI 式”人手当采集器”的适用范围从平行夹爪首次系统性扩展到多指灵巧手,核心贡献是把”具身鸿沟”拆成运动学(硬件外骨骼 + 优化设计)和视觉(软件分割-修复-重渲染)两个独立可解的子问题,而非依赖端到端视觉重定向或遥操作。
- 双层优化的外骨骼设计方法论具有跨机器人手的可迁移性:同一套优化公式分别适配了全驱动的 XHand(可从 URDF 直接建模)和欠驱动闭链的 Inspire Hand(需运动捕捉逆向拟合等效连杆),验证了框架对不同硬件设计范式的通用性。
- 遮挡感知的视频合成方法(取外骨骼掩膜∩机器人手掩膜决定像素替换区域)比朴素覆盖更好地保留了手-物体的自然遮挡关系,是软件适配层的关键技巧。
- 消融揭示了两个反直觉但对灵巧手模仿学习有指导意义的发现:(1) 相对手指动作全面优于绝对动作(假设是相对动作分布更简单、且能形成”接触事件驱动累积”的反应式行为,而绝对动作在标定误差下容易在目标附近卡死);(2) 触觉反馈只有搭配相对动作才能带来正收益(噪声较大的触觉信号在绝对动作下反而拖累性能),且只在视觉信息缺失、力信号清晰的任务(如抓盐)上明显有效,在触觉信号本身弱相关的任务(如夹镊子)上无益。
- 论文自陈的局限:外骨骼设计仍需针对每款机器人手单独调优,尚未完全自动化;当前建模只对齐指尖工作空间,未建模掌心等其他接触几何;两种触觉传感器(电阻式、电磁式)在人手操作下的力普遍大于机器人自身受力,读数容易漂移;软件适配仍依赖实际机器人硬件采集”机器人手视频”这一步,尚未用生成模型替代;相机被要求刚性固定在腕部,不支持移动相机;两款商用灵巧手本身存在背隙(backlash)和摩擦导致的指尖定位不一致,以及跨时间/断电重启后电机-位置映射漂移的问题。
原始链接
- arXiv: https://arxiv.org/abs/2505.21864
- 项目主页: https://dex-umi.github.io/
- GitHub: https://github.com/real-stanford/DexUMI
- 硬件搭建指南: https://dex-umi.github.io/tutorial/hardware.html
- 部署指南: https://dex-umi.github.io/tutorial/deployment.html
- 采集数据集: https://umi-data.github.io/
一手源存档(sources/)
- dexumi—github-readme — GitHub README(安装、数据采集/回放/渲染流程、策略训练与评估命令)
- dexumi—project-page — 项目主页(摘要、各任务消融实验描述、视频修复局限性讨论)
- arXiv 原文 PDF(https://arxiv.org/pdf/2505.21864,不入 git)