一句话定位

DexCap 是斯坦福 The Movement Lab + SVL 提出的一套便携式人手动作捕捉硬件(EMF 手套测指关节 + SLAM 追踪相机测手腕 6-DoF + 胸前 RGB-D LiDAR 相机测 3D 场景),配套 DexIL 模仿学习算法(指尖 IK 重定向 + 点云输入的 Diffusion Policy + 可选人机协同修正),使人可以不穿戴机器人、不依赖遥操作,仅靠佩戴这套 3.96 磅的背包式装置在真实环境(包括实验室外的”in-the-wild”场景)里直接采集灵巧操作数据,训练双臂 LEAP 灵巧手完成六项高难度任务(含拿剪刀剪纸、开瓶盖倒茶)。

背景与定位

论文把已有的灵巧操作数据采集路线分为两类并指出各自短板:(1) 遥操作——需要真实机器人在场、动作慢、扩展成本高;(2) 纯视觉单目/多目手部跟踪——即便能给出还算准的姿态,也严重受手-物交互中频繁发生的自遮挡影响,且许多系统依赖标定好的第三视角相机,不便携。EMF(电磁场)手套能提供抗遮挡的指关节跟踪,但缺失手腕在世界坐标系下的 6-DoF 位姿;IMU 式全身动捕虽可穿戴但长时间跟踪存在漂移。DexCap 的定位是把 EMF 手套(指关节)、SLAM 视觉惯性相机(手腕 6-DoF,且可自纠正漂移)、RGB-D LiDAR(3D 场景观测)组合到同一套可穿戴装置里,同时解决”抗遮挡的精细指部跟踪”与”准确的手腕位姿”两个此前互斥的问题。

这项工作与同期的 UMI(手持平行夹爪 + GoPro)同属”不需要真机在场即可采集机器人数据”的范式,但走的是互补路线:UMI 面向平行夹爪的简单抓取,DexCap 面向多指灵巧手(LEAP hand)的精细操作,因此需要专门的手套式方案捕捉指部细节。策略侧直接沿用 Diffusion Policy(Chi et al. 2023)作为动作解码器,并与 GELLOALOHA/Mobile ALOHA 等遥操作数据采集方案形成对照(论文实测数据采集吞吐量比传统遥操作快 3 倍)。

模型架构

DexCap 系统本身不是一个学习到的模型,而是”可穿戴硬件 + 三步 DexIL 算法流水线”:

硬件(DexCap)

  • 指部跟踪:Rokoko EMF 动捕手套,每个指尖嵌入微型磁传感器,手背有信号接收 hub,测量 hub 到各指尖传感器的相对 3D 平移,抗手-物交互遮挡。
  • 手腕 6-DoF 跟踪:每只手套背部装一个 Intel Realsense T265 鱼眼追踪相机(双鱼眼镜头 + IMU),基于 SLAM 算法构建环境地图、实时跟踪手腕 6-DoF 位姿;相比纯 IMU 方案可自校正漂移。
  • 3D 场景观测:胸前佩戴 Intel Realsense L515 RGB-D LiDAR 相机;整套胸前 3D 打印相机架共容纳 1 台 L515 + 3 台 T265(其中 1 台固定作为世界坐标系参考主相机,另外 2 台采集开始前从相机架上取下、插入左右手套的卡槽,用于跟踪各自手腕位姿)。
  • 标定:借助一个卡入式 3D 打印相机架,采集开始时所有追踪相机先固定在架子上确定初始相对变换,随后 2 台移到手套上,整个标定/佩戴流程约 10-15 秒;人体到机器人切换时更换胸前相机架构(快拆扣),耗时小于 5 秒。
  • 算力与续航:Intel NUC 13 Pro mini-PC(64GB RAM、2TB SSD)+ 40000mAh 移动电源,装入背包,整套系统重 3.96 磅(约 1.8 kg),支持约 40 分钟连续采集,电源满充仅需 30 分钟;硬件总成本控制在 4000 美元以内,模块化、不限定相机/手套/mini-PC 品牌型号。
  • 评测用机器人本体:两台 Franka Emika 机械臂 + 两只 LEAP 灵巧手(四指、16 关节,比人手约大 50%),臂与手均以 20Hz 控制频率运行。

DexIL 算法(三步)

  1. 数据重定向:观测侧把 RGB-D 转成带 RGB 颜色的点云,对齐到以主 SLAM 相机初始位姿定义的世界坐标系(隔离人体躯干移动),再通过键盘方向键一次性对齐到机器人操作空间、并剔除桌面以下的多余点;动作侧用指尖逆运动学(IK)把人手指尖位置映射到 LEAP 手(因 LEAP 只有 4 指,IK 计算时舍弃小拇指数据),手腕 6-DoF 位姿作为 IK 的初始参考。机器人本体的状态定义为 (6-DoF 腕部位姿, 16 维手指关节),双手合计 46 维(2×(7+16),与臂的 7 自由度对应);动作标签为下一时刻状态。
  2. 点云输入的 Diffusion Policy:观测点云经均匀降采样后与关节位置正向运动学生成的机器人手点云拼接(弥合人手与机器人手的视觉外观差异),送入策略网络;策略输出 20 步的未来动作序列(GitHub README 披露,涵盖双臂+双手 46 维)。作者对比 PointNet 与 Perceiver 两种点云编码器,最终默认模型 DP-perc 采用 Perceiver 编码器(在双手协同任务上比 PointNet 提升约 20% 成功率)。Diffusion 部分沿用 Diffusion Policy 的 UNet 骨干:embedding dim 256,下采样通道 [256, 512, 1024],卷积核尺寸 5,采用 DDIM 去噪,训练步数 100、推理步数 10;所有基线的观测输入时间跨度(context)统一设为 3 帧。
  3. 可选人机协同修正(human-in-the-loop):策略 rollout 期间,人可再次佩戴 DexCap,通过脚踏板在”残差修正”(人手相对初始姿态的 delta 位移,按系数 α、β<0.1 缩放叠加到策略动作上)与”遥操作接管”(直接用人手 IK 结果驱动机械臂/手指尖)两种模式间切换;修正轨迹存入新数据集 D’,与原数据集 D 等概率采样用于策略微调(类似 IWR 方法)。

数据

  • 采集频率:原始 60fps(手套+相机同步记录 4 类流:胸前相机 6-DoF 位姿、双手腕 6-DoF 位姿、双手指关节 3D 位置、RGB-D 帧);mini-PC 内存缓冲支持 60fps 采集约 15 分钟,内存写满后因转存 SSD 而降到 20fps(且降频会影响 SLAM 跟踪精度),因此实际每段采集优先使用前 10 分钟的高质量数据;训练时统一下采样到 20Hz 匹配机器人控制频率(人机协同修正数据本身就以 20Hz 直接采集)。
  • 各任务数据规模(人工标注截取每段任务演示的起止帧,剔除复位动作):
    • Sponge picking / Ball collecting / Plate wiping:合计 30 分钟机器人操作空间内 DexCap 数据 → 分别得到 251 / 179 / 102 条演示。
    • Packaging:1 小时 in-the-wild(超过 10 个不同场景混合采集)DexCap 数据 → 104 条演示。
    • Scissor cutting:1 小时机器人操作空间 DexCap 数据 → 96 条演示。
    • Tea preparing:1 小时机器人操作空间 DexCap 数据 → 55 条演示。
    • 上述 4 项复杂任务(Packaging/Scissor cutting/Tea preparing)另各配 30 次人机协同修正轨迹用于策略微调。
  • 数据处理:点云观测统一降采样到 5000 点存入 hdf5(robomimic 格式),送入策略前再降采样到 1000 点;机器人手部点云由正向运动学生成后拼接进观测;训练时对点云与轨迹做随机 2D 平移数据增强。
  • 来源与配比:全部为真实世界人手动作捕捉数据(无仿真数据),不涉及跨本体数据混合;对比实验中另与传统遥操作方式(未指明具体系统)做数据采集吞吐量对比。
  • 公开数据集:官方在 HuggingFace 发布 chenwangj/DexCap-Data(CC BY 4.0),含原始数据(.zip)与处理后 hdf5 两种形式,覆盖 Plate wiping 任务 30 分钟数据 + Packaging 任务 60 分钟 in-the-wild 数据。

训练方法

  • 目标:行为克隆(behavior cloning),策略以点云观测 + 机器人本体状态为条件,生成未来动作序列;无强化学习环节。
  • 动作表示:连续回归(非离散 token 化),通过 Diffusion Policy 的去噪过程生成动作序列,而非分类式 token 预测。
  • 控制层级:策略输出的目标位置由低层控制器执行——机械臂用 Operational Space Controller(OSC)插值轨迹跟踪目标末端位姿,手指用关节阻抗控制器;若机器人在 h=10 步内未到达目标位姿阈值,则提前重新查询策略给出下一动作(接触密集任务用更小的 h 可获得更平滑运动)。
  • 超参数(Appendix Table V/VI/VII,三种模型架构共享大部分设置):Batch Size 16,学习率 1e-4,训练 3000 epoch,无学习率衰减;点云模型(DP-point / DP-perc)点云降采样至 1000 点,池化方式 MaxPooling,UNet embedding dim 256,下采样通道 [256, 512, 1024],卷积核 5,DDIM 训练步数 100 / 推理步数 10,输入时间跨度 3;图像基线用 ResNet-18 作图像编码器。
  • 人机协同微调:修正数据 D’ 与原始数据 D 等概率混合采样,对已训练好的策略做微调(而非从头训练)。

Infra(训练 / 推理工程)

  • 训练侧计算资源:论文未披露训练用 GPU 型号、数量或训练时长(GPU-hours 未披露)。
  • 数据采集侧硬件:Intel NUC 13 Pro mini-PC(64GB RAM、2TB SSD)+ 40000mAh 移动电源,背包总重 3.96 磅;连续采集约 40 分钟,电源满充 30 分钟;硬件总成本 < $4000 美元。
  • 采集帧率:原始 60fps,内存写满转 SSD 后降至 20fps;训练前统一下采样到 20Hz。
  • 推理 / 部署侧:机械臂与 LEAP 灵巧手均以 20Hz 控制频率运行;人机切换(人体佩戴 ↔ 装到机器人台架)通过快拆扣完成,耗时 < 5 秒;具体端到端推理延迟(策略前向时间)论文未披露。
  • 边缘硬件:机器人评测台使用两台 Franka Emika 机械臂 + 两只 LEAP 灵巧手(四指 16 关节);人机协同修正阶段用 Redis 服务器在局域网内转发 T265 跟踪数据,供另一台工作站上运行策略的机器人实时接收人手 delta 位移。

评测 benchmark

Table I — DexCap-only 数据训练,20 次试验/任务,Sponge picking / Ball collecting / Plate wiping:

模型Sponge pickingBall collectingPlate wiping平均
BC-RNN-img0.000.000.000.00
BC-RNN-img-mask0.250.100.100.15
BC-RNN-point0.450.300.250.33
BC-RNN-prec0.500.300.350.38
DP-img0.000.000.000.00
DP-img-mask0.550.400.300.42
DP-point-raw0.700.700.400.60
DP-point0.750.650.500.63
Ours (DP-perc)0.850.600.700.72

原始 RGB 输入(未做遮罩处理)的 BC-RNN-img / DP-img 完全失败(0.00),说明人手与机器人手的视觉外观差异会让图像策略彻底学不到东西;点云方案无需遮罩即可达到 60%+ 成功率。

Table II — Packaging(1 小时 in-the-wild 数据,6 训练物体×5 次=30 + 9 未见物体×5=45 次试验):

模型Subtask(纯 in-the-wild)AllUnseenSubtask(+30次人工修正)AllUnseen
BC-RNN-img-mask0.000.000.000.230.070.00
BC-RNN-point0.330.230.160.400.270.22
DP-img-mask0.170.000.000.470.330.00
Ours0.700.470.400.830.570.42

Table III — Scissor cutting(1 小时数据 + 30 次修正): BC-RNN-point 在纯 DexCap 数据下 Subtask/All 均为 0.00,加修正后 0.10/0.00;Ours 纯数据下同样 0.00/0.00,加 30 次修正后达到 Subtask 0.45 / All 0.20(剪断纸带成功率)。

Table IV — Tea preparing: Ours 纯 DexCap 数据 Subtask(拧开瓶盖)0.30,全任务 0.00;加 30 次修正后 Subtask 0.65、全任务 0.25

Appendix Table VIII — 手腕追踪漂移误差对比(cm,两条测试轨迹):

方法Trajectory 1Trajectory 2
纯 IMU8.0 ± 3.111.3 ± 4.7
SLAM-IMU(DexCap)0.4 ± 0.20.8 ± 0.3

其他定性结果:与视觉 SOTA 手部姿态估计方法 HaMeR 对比,DexCap 在手指严重遮挡场景下明显更稳健(HaMeR 出现漏检或指尖位置误判);数据采集吞吐量比传统遥操作快约 3 倍(Fig. 8,定性对比,无逐秒数值表)。论文未与其他遥操作系统(如 ALOHA)做下游策略成功率的直接定量对比。

创新点与影响

  • 贡献(作者自陈):(1) DexCap——一套便携式人手动捕系统,实时同步跟踪手腕 6-DoF 位姿与指部动作;(2) DexIL——直接利用手部动捕数据学习灵巧操作技能的模仿学习框架;(3) 人机协同修正机制,显著提升复杂任务表现。
  • 方法论意义:首次把”抗遮挡指部 EMF 追踪 + SLAM 手腕 6-DoF + 场景 3D 观测”整合到同一便携装置,解决了此前 EMF 手套缺手腕位姿、纯视觉方案怕遮挡、IMU 方案会漂移的三方矛盾;证明仅用 30 分钟人手动捕数据(无任何机器人上真机数据/遥操作数据)即可训练出双手协同成功率 72% 的灵巧策略,且能直接从”实验室外”混合场景采集的数据里学到可泛化到未见物体(40% 成功率)的策略。
  • 影响:代码、硬件设计(3D 打印文件、组装教程)与数据集(HuggingFace,CC BY 4.0)全部开源;后续社区工作常把 DexCap 作为便携式灵巧手动捕数据采集方案的代表之一,与手持夹爪路线的 UMI 并列成为”去真机化”数据采集范式的两个代表性分支。
  • 作者自陈局限(Conclusion 章节):(1) 功耗限制单次连续采集时长最多 40 分钟;(2) 指尖 IK 重定向未能完全弥合人手与 LEAP 手的尺寸差异(机器人手指更粗),导致如握剪刀这类需要精确力控的任务单靠重定向做不好,需依赖人机协同修正;(3) 当前系统仅采集 3D 观测与运动轨迹,不含力/触觉信息,作者计划探索保形触觉织物(conformal tactile textiles)方向作为后续改进。

原始链接

一手源存档(sources/)

  • dexcap—github-readmej96w/DexCap GitHub README 快照(安装、采集、数据处理、训练流程说明,含”20 步动作序列 / 46 维”披露)
  • dexcap—project-page — dex-cap.github.io 项目主页快照(摘要、方法图解、视频结果说明)
  • dexcap—hf-dataset-card — HuggingFace chenwangj/DexCap-Data 数据集卡片快照(CC BY 4.0,原始/处理后数据说明)
  • arXiv 原文 PDF(2403.07788v2,正文 Section I–VI 及 Appendix A–B、Table I–VIII、Fig. 1–15),不入 git,见上方 arXiv 链接