一句话定位

Bunny-VisionPro 是一套用 Apple Vision Pro 做实时双臂灵巧手遥操作的采集系统:手部/手腕位姿驱动的手部 retargeting(含四杆连杆等 loop joint 的实时求解)+ 臂部运动控制(IK+奇异位+碰撞避免统一成一个优化目标)+ 低成本 ERM 触觉反馈三个解耦模块,全部跑在单颗消费级 CPU 上无需高端 GPU;在 Telekinesis 基准 10 个单臂任务上 9/10 持平或超越已有系统,在自建双臂短/长程任务上比 AnyTeleop+ 成功率高约 11%、耗时少约 45%,据此采集的示范让下游模仿学习(ACT/Diffusion Policy/DP3)平均成功率提升约 22%、泛化提升约 14%(空间泛化)/26%(未见物体)。

背景与定位

论文把已有双臂/灵巧手遥操作分两条主线并各自指出短板:一是 ALOHA/Mobile ALOHA 一类关节空间(joint-space)主从遥操作,能做出精细双臂协调,但要求主从机器人运动学等价(本体专属),且碰撞/奇异规避的负担全压在人类操作者身上;二是末端执行器(end-effector)控制路线,用动捕、惯性传感器或 VR 控制器驱动逆运动学,但过去多用 1–2 自由度简单夹爪,牺牲灵巧性。灵巧手遥操作方面,手套式方案(如 Tesla Bot 用的 MANUS glove)昂贵且要求特定手型;视觉方案如 AnyTeleop 需要复杂 GPU 处理且主要面向单臂,并行工作用抓握按钮控制 Ability Hand(牺牲手指精细步态换取低延迟)。本文站在这两条线的交叉点:用 VR 头显(Vision Pro)的手/腕追踪覆盖末端执行器路线的直观性,同时补齐灵巧手全自由度、双臂协调、安全性(碰撞+奇异规避)与实时性,三者过去很少同时满足。

UMI 等「去真机化」手持采集范式不同,Bunny-VisionPro 仍是「真机在场」的实时遥操作范式,但目标一致——为下游模仿学习提供更高质量、更易采集的双臂灵巧操作示范数据,尤其是此前罕有工作触及的多阶段长程(multi-stage, long-horizon)任务。下游 IL 策略直接复用已有基线 ACTDiffusion PolicyDP3,本文贡献集中在数据采集端而非策略架构本身。

模型架构

论文没有训练神经网络策略;其「架构」是三个解耦的实时优化/信号处理模块(各自单独进程运行,避免延迟累积):

(1) 手部运动 retargeting:把人手指尖关键点向量 $v_i$(Vision Pro 追踪)映射到机器人手关节位置 $q$,目标函数 $L_{hand}=\sum_i |\alpha v_i - FK_i(q)|_2^2 + \beta|\Delta q|2^2$(第一项做尺度对齐的位置匹配,第二项做帧间时间平滑),用序列二次规划(SQP)求解。核心创新是处理loop joint(关节数超过实际自由度的连杆,如 Ability Hand 的四杆连杆):不对被动关节加等式约束(会因高度非线性 FK 导致不稳定、耗时增加),而是把优化变量降维到 $k$ 个主动关节,被动关节位置由约束函数 $q_j=c_j(q_1,…,q_k)$ 前向算出,反向传播时把被动关节梯度通过链式法则加回主动关节梯度:$\text{grad}i=\partial L{hand}/\partial q_i+\sum_j (\partial c_j/\partial q_i)(\partial L{hand}/\partial q_j)$。这一方案让 Ability Hand 四杆连杆求解相比把 loop joint 当等式约束处理加速 10.2 倍(3.43ms vs 34.98ms,见 Infra)。

(2) 手臂运动控制:统一目标 $L_{arm}=L_{ik}+L_{sin}+L_{col}$。$L_{ik}$ 是末端位置+四元数旋转误差的加权和;$L_{sin}$ 只在最小奇异值 $s_0$ 低于阈值 $s_{low}$ 时才生效,用可操作度指标 $\sqrt{\det[JJ^T]}$(比 $s_0$ 更适合梯度优化)惩罚接近奇异;$L_{col}$ 把每个机械臂连杆建模成若干球体,用球间欧氏距离的倒数和作自碰撞代价(同连杆内部、父子连杆间的球对跳过检测),避免昂贵的 GJK 算法,且该简化让距离函数可微。

(3) 人体触觉反馈:Ability Hand 五指指尖共 30 个 FSR(力敏电阻)传感器 → 零漂校准(记录不同关节位置基线值并插值扣除)+ 低通滤波 → 用 ELEGOO UNO 板做 PWM 驱动低成本 ERM(偏心转子)致动器(单个成本 $1.2),BJT 三极管隔离各致动器避免相互干扰。

真机系统配置:双臂各一台 UFactory xArm-7 + 6-DoF Ability Hand,共 24-DoF 双臂系统;两台 RealSense L515(前视+俯视)采集视觉观测;Vision Pro 手势流通过第三方开源项目 VisionProTeleop 传到主机。

数据

本文 category=data,核心产出是采集流程而非静态数据集发布,全部真机、无仿真:

  • Telekinesis 基准(借用已有基准,Sivakumar et al. 2022):10 个单臂任务,用于横向对比遥操作系统本身的精度/成功率,非训练数据。
  • 自建双臂任务示范(用于下游 IL 训练):短程任务(grasp toy 抓玩具入箱、clean pan 抓锅柄+海绵擦锅、uncover & pour 揭盖倒物)每任务 50 条演示;长程任务(wipe glass 抽纸巾擦玻璃、sweep floor 扫地倒垃圾、prepare coffee 倒咖啡搅拌递给人)每任务 30 条演示(附录 C)。
  • 观测采集频率:图像+处理后的点云约 30Hz;机器人本体感知 >100Hz;两路数据按时间戳插值对齐后降采样到 10Hz 供 IL 训练。
  • 动作标注:无需额外标注——遥操作过程中机器人执行的关节/末端轨迹本身即动作标签。
  • haptics 相关但非训练用:论文原话为「每只手 30 个 FSR 触觉传感器,分布于五个指尖」(双手合计 60 个,为按 2 手相乘的推算而非论文直接给出的总数),用于触觉反馈与触觉策略输入实验(Sec 5.2),阈值 force>500 / impulse>50 判定”激活”。
  • 数据采集时未使用触觉反馈设备(haptic 反馈模块是在示范收集完成后才设计的,教程/正文均声明这一点)。

训练方法

本文自身模块(retargeting、运动控制、触觉信号处理)都是在线优化/信号处理,不是学习得到的,不涉及训练。下游模仿学习(用于评估示范质量)复用三种已有策略并各自训练:

  • ACT:多视角图像输入,chunk size = 20,训练 3000 epochs
  • Diffusion Policy:多视角图像输入,horizon = 8(观测步 2 + 动作步 6),训练 300 epochs,batch size 64
  • 3D Diffusion Policy (DP3):多视角点云输入,与 Diffusion Policy 相同 horizon 设置,训练 500 epochs,batch size 64
  • 触觉数据处理(Sec 5.2/附录 E):FSR 力信号做零漂校准+低通滤波,可再对力求时间导数得到冲量(impulse);触觉信号既可编码成向量(MLP)作为状态的一部分,也可可视化成接触点点集与相机点云拼接,做法参考 DexPoint;附加一维布尔标志位表示触觉信号是否超过阈值。

Infra(训练 / 推理工程)

  • 实时模块性能剖析(Table 1,单颗 CPU i7-12700KF,无 GPU 参与):
    • Retargeting(无 loop joint)2.54ms;Retargeting(loop joint 当等式约束)34.98ms;Retargeting(loop joint,本文方法)3.43ms —— 即 10.2× 加速
    • Motion Control(仅 IK)0.74ms;+碰撞 7.85ms;+奇异 10.42ms;+碰撞+奇异 15.93ms(对应 >60Hz 实时率,约 62.8Hz)。
    • Haptic Feedback(PWM 计算)0.04ms
    • 相关工作段落另提到:loop joint retargeting 在 Ability Hand 上可达 300Hz、单 CPU 核
  • 下游 IL 策略训练算力:论文正文/附录未披露 GPU 型号、数量或 GPU-hours(未披露)。
  • 推理/控制硬件:Vision Pro(手/腕追踪)+ 主机(通过 VisionProTeleop 项目流式传输位姿);控制频率未给出统一数值,但运动控制模块本身在 >60Hz 下完成一步计算(见上)。

评测 benchmark

Telekinesis 基准(Table 2,10 个单臂任务,与原论文/AnyTeleop 报告数字对比):Bunny-VisionPro 在 9/10 任务持平或超过 Telekinesis 与 AnyTeleop:Pickup Box 10/10、Pickup Fabric Toy 10/10、Box Rotation 9/10(Telekinesis 6/10、AnyTeleop 6/10)、Scissor Pickup 7/10(唯一逊于 AnyTeleop 的 8/10,作者归因于 Ability Hand 自由度不足难以把手指伸进剪刀把手)、Cup Stack 10/10(对比 6/10、9/10)、Two Cup Stacking 9/10(对比 3/10、7/10)、Pouring Cubes onto Plate 10/10(对比 7/10、7/10)、Cup Into Plate 10/10、Open Drawer 10/10、Open Drawer & Pickup 10/10(对比 6/10、9/10)。

自建双臂任务示范采集(Table 3,对比 AnyTeleop+ = 用本文 Vision-Pro 手部追踪改造后的 AnyTeleop,同一真机配置)

  • Grasp Toy(单臂):AnyTeleop+ 50/54 成功、耗时 28.9 分钟、episode 长度 145±24、ΔQpos 0.77;Ours 50/55、24.3 分钟、142±21、0.35。
  • Clean Pan(双臂):AnyTeleop+ 50/78、74.6 分钟、282±23、0.98;Ours 50/58、30.4 分钟、186±17、0.58。
  • Uncover & Pour(双臂):AnyTeleop+ 50/77、63.2 分钟、189±21、1.26;Ours 50/63、41.5 分钟、183±15、0.86。
  • Wipe Glass(双臂,长程):AnyTeleop+ 30/53、69.0 分钟、517±51、1.44;Ours 30/41、32.2 分钟、360±35、0.68。
  • Sweep Floor(双臂,长程):AnyTeleop+ 30/61、129.4 分钟、786±118、1.99;Ours 30/40、45.4 分钟、570±77、1.30。
  • Prepare Coffee(双臂,长程):AnyTeleop+ 30/52、95.3 分钟、705±42、1.87;Ours 30/44、55.2 分钟、576±33、1.05。
  • 论文正文汇总:相比 AnyTeleop+,本文系统成功率高 11%、任务完成耗时少 45%、episode 长度短 19%(方差更低);AnyTeleop+ 在复杂轨迹/大幅末端位姿变化下关节位置变化量增加 43%,表现出激进、不可预期的运动。

触觉反馈用户研究(Fig. 4,5 名未受训操作者,toy handover 与 ball moving 两任务各 5 次试验):9/10 组对比中触觉反馈维持或提升成功率;ball moving(低形变球体、需精细控制)任务上触觉反馈还缩短了完成时间。

模仿学习主结果(Table 4,10 次试验测 SR / SR-SG 空间泛化 / SR-U 未见物体,ACT / Diffusion Policy / DP3 三种策略 × grasp toy / clean pan / uncover & pour 三任务):本文示范训出的策略平均成功率比 AnyTeleop+ 高 22%;空间泛化 SR-SG 高 14%、未见物体 SR-U 高 26%。逐任务示例:Uncover & Pour 用 ACT,AnyTeleop+ 仅 2/10 成功、Ours 达 8/10;Clean Pan 用 Diffusion Policy,AnyTeleop+ 5/10、Ours 7/10(SR-U 从 1/10 升到 7/10)。

长程多阶段任务(Table 5,DP3,仅 30 条演示):Wipe Glass 子任务成功率 7/10、整任务 7/10;Sweep Floor 子任务 8/10、整任务 4/10;Prepare Coffee 子任务 7/10、整任务 4/10。论文正文自陈整体「73% 子任务成功率、38% 整任务成功率」(该 38% 数字与三任务整任务成功率简单平均得到的 50% 不一致,此处按论文原文数字如实记录,未做换算修正)。

触觉数据作策略输入的消融(Table 6,DP3,clean pan / uncover & pour):不加触觉 8/10、7/10;force 向量 7/10、4/10;impulse 向量 8/10、7/10;force 点云 7/10、6/10;impulse 点云 7/10、8/10。论文结论:触觉未必稳定提升效果(视觉本身对这些任务已足够,触觉只在接触后才激活、不助于物体定位),impulse 表示比原始 force 更稳健(force 有零点漂移问题)。

创新点与影响

  • 贡献:三个此前遥操作系统很少同时具备的能力——(i) 无需高端 GPU、实时(>60Hz)的臂部碰撞+奇异规避统一优化;(ii) 实时处理灵巧手 loop joint(四杆连杆)retargeting,相比朴素等式约束方案加速 10.2 倍;(iii) 成本 $1.2/致动器的 ERM 触觉反馈装置,配合 VR 头显提升沉浸感与操作精度。三者组合成一套面向 24-DoF 双臂灵巧手系统的实时遥操作方案。
  • 改变了什么:在标准 Telekinesis 基准与自建双臂短/长程任务上均展示出对已有系统(Telekinesis、AnyTeleop/AnyTeleop+)的一致优势,尤其在双臂长程任务上优势更明显;据此采集的示范让下游三种主流 IL 算法(ACT/Diffusion Policy/DP3)平均成功率与泛化能力都显著提升,并且是较早在真实机器人上把模仿学习推向多阶段长程双臂灵巧操作(wipe glass / sweep floor / prepare coffee 等 3+ 步骤任务)的工作——此前该类任务在模仿学习文献中很少被系统性覆盖。代码(含真机 xArm7 + Ability Hand 控制)与文档已开源。
  • 作者自陈局限:(i) Vision Pro 手部追踪在手指自遮挡时不准确,导致机器人指令抖动,未来可融合可穿戴设备数据缓解;(ii) 触觉反馈对轻触碰的细微力度变化不敏感,未来考虑用接触面积更大、灵敏度更高的压电致动器。

原始链接

一手源存档(sources/)