一句话定位

ACE-F 是 UC San Diego(Xiaolong Wang 组)做的一套可折叠、跨本体的遥操作硬件+算法系统:用一个 3-DoF 的紧凑领导臂(leader arm)+ IMU + 手套做手腕/手指姿态追踪,靠 IK 把 6-DoF 末端位姿重定向到任意跟随臂(follower);核心创新是不加任何力/力矩传感器,纯靠”跟随臂目标位姿 - 实际位姿”这个末端偏差量推算虚拟 3-DoF 力信号,再用软控制器(PD + 逆动力学)把这个虚拟力实时渲染回领导臂,让操作者像捏鼠标一样”摸到”接触力,并证明这样采集的示教数据能让模仿学习策略在接触密集任务上明显更好。

背景与定位

遥操作是采集高质量机器人示教数据的主流方式,但论文指出现有平台长期卡在三个短板:(1) 缺力反馈——要么完全没有触觉线索,要么依赖昂贵、难集成的力/力矩(FT)传感器;(2) 跨本体能力差——关节复制(joint-copy)式领导臂必须为每种新机器人重新设计硬件,代表方法是 GELLO(Zhao2023learning / wu2023gello 系);(3) 硬件笨重不便携,难以快速部署。ACE-F 延续同组前作 ACE(yang2024ace,一套基于 IK 的外骨骼式跨本体遥操作系统)的设计思路,但把领导臂从外骨骼简化为 3-DoF 折叠臂,专门为”无传感器力反馈”重新设计控制回路。

范式上,ACE-F 属于 IK-based Cartesian 遥操作这一支(与 GELLO 代表的关节复制式相对),论文将其与 homie 提到的”关节匹配外骨骼”路线、twist 代表的”动捕驱动全身模仿控制”路线并列讨论——但 TWIST/HOMIE 面向人形机器人全身控制,ACE-F 面向单臂/双臂桌面级灵巧操作的数据采集,是不同层级的遥操作问题。数据侧,ACE-F 与 egodex 这类”从人类第一视角视频被动采集操作数据”的路线形成对照:ACE-F 仍是主动遥操作,但通过软件把力反馈这个”高价传感器专属能力”下放到低成本硬件上。

模型架构

硬件(领导臂):

  • 3-DoF 机械臂:1 个底座旋转关节 + 2 个正交肘关节(“perpendicular elbow joints”),刻意保持低自由度以简化力渲染的实时逆动力学计算。
  • 驱动:DYNAMIXEL XM430-W350-R 舵机 + U2D2 控制器;GitHub 示例配置波特率 4,000,000、电机 ID 0/1/2。
  • 末端:外露球窝关节(3D 打印 ball-and-socket),配弹性安全锁防止误脱落,支持热插拔式末端执行器;论文验证了 4 种末端配置——裸露(bare,通用力反馈)、两种夹爪配置(简单夹爪驱动)、手套配置(面向人形灵巧手)。
  • 整臂可折叠,强调便携部署。

6-DoF 控制的解耦方案: 3-DoF 领导臂只负责确定末端 Cartesian 位置;手腕朝向由一个 IMU 实时采集;可进一步接入手套式追踪模块拿到手指朝向。位置流 + 朝向流合成完整 6-DoF 手部姿态,再通过 IK 转成机器人专属末端指令,实现跨运动学结构的无缝遥操作。

增强 IK 求解器: 在标准的末端位置/朝向误差最小化之外新增两个任务项以避免奇异点:(1) 计算末端在底座平面上的投影角,令其匹配机器人第一关节角度,使操作者朝向与底座旋转自然对齐;(2) 对 7-DoF 机械臂的第四关节施加软约束——赋予其更高的垂直(z 轴)目标值,抑制该关节在末端靠近底座时向外弯折(这一动作容易引发运动学奇异)。

软控制器: PD 控制 + 定制逆动力学(ID)融合,跨本体只需微调 URDF 参数即可快速部署,兼顾稳定性、响应性与安全性。

虚拟力反馈计算(核心算法): 不用传统的 Jacobian 力矩映射(wrench-to-torque),而是计算跟随臂末端”目标位姿 - 实际位姿”的偏差 Δee = target − current;将 Δee 缩放后作用于领导臂当前末端位姿,生成一个”虚拟目标位姿”——相当于领导臂与跟随臂之间连了一根虚拟弹簧,操作者的手因为紧握末端而感知为力而非明显位移。为防止跟随臂高速运动(而非真实接触)导致 Δee 虚高造成失稳,用跟随臂 Cartesian 速度 v 对反馈幅度做正则:

Force Feedback Factor = sqrt( α·‖Δee‖² / (1+‖v‖²) )

该 factor 同时用于(a)生成虚拟目标位姿和(b)自适应调节领导臂的阻抗增益 Kp、Kd。消融实验比较了 v 项的四种变换——|v|、v²、exp(v)、tanh(v)(Table I):|v| 综合最优,高频能量比 0.123(最低)、最大局部急动度 0.00064(最低)、纯领导臂急动异常率 0.00%(最低)、反馈相关性 0.758(最高);exp(v) 最激进但最不稳定(高频能量比 0.211、急动异常率 4.59%);v² 和 tanh(v) 居中(tanh(v) 反馈相关性 0.662、急动异常率 0.81%)。系统最终采用 |v|。

数据

本文不是”数据集论文”,而是给出一套遥操作数据采集系统,其配套实验里实际采集/使用的数据规模:

  • 仿真(Robosuite/MuJoCo)模仿学习实验:Lifting、Stacking、Wiping 三个 Robosuite 内置 benchmark 任务环境,每个任务各采集 50 条示教(两路相机视角 + qpos 关节位置数据),分别在”力反馈开(FF)“和”力反馈关(Regular)“两种条件下各训一份策略;Lifting/Wiping 用 Franka Emika 机械臂,Stacking 用 UFactory XArm7;采集时未使用中间运动规划器,论文明确指出这是策略成功率偏低于平均水平的原因之一。
  • 真实世界模仿学习实验:Franka Emika Panda 上做”罐头三档分拣”任务,训练数据为 18 条 episode(每种起始罐头组合各 3 条示教),同样是两路相机视角 + qpos。
  • 基线对比实验的数据(非训练数据,用于人因评测):在 Franka Emika Panda + 两种 UFactory XArm 变体上,分真实/仿真两种环境测试 ACE-F 对比 GELLO(关节复制基线),覆盖 6 个任务(仿真箱子堆叠/拖拽/擦桌,真实罐头堆叠/擦标记/盲插);另在 Robosuite 中用”广泛多样”的机器人平台做定性演示以展示跨本体泛化能力(未给出具体机器人数量)。
  • 数据全程来自人类遥操作,不涉及仿真到真实的域随机化或额外增广;力反馈开关是唯一的数据采集条件变量。

训练方法

  • 数据采集流程为 Algorithm 1(Force Feedback–Enhanced Teleoperation Loop):领导臂根据操作者 3-DoF 臂位姿 + 手套朝向算出末端目标 → 解 IK 得跟随臂关节目标 → 下发给跟随臂;跟随臂把当前关节位置回传给领导臂 → 领导臂用 FK 算出跟随臂当前末端位姿 → 算偏差 Δee → 算 Force Feedback Factor → 更新领导臂虚拟目标位姿与阻抗增益 Kp/Kd,循环执行直至任务完成。
  • 下游模仿学习策略的具体网络架构(是否为 ACT / Diffusion Policy 等)论文未披露,只说明”用两路相机视角与 qpos 数据训练”策略,并在有/无力反馈两种数据上各训一份做对照。
  • 无强化学习环节;力反馈的作用被定位为”提升示教数据质量/一致性”,而非训练目标或损失函数的一部分。

Infra(训练 / 推理工程)

  • 训练侧算力(GPU 型号/数量/训练时长):论文未披露
  • 遥操作/力反馈控制回路的具体频率(Hz)、端到端延迟:论文未披露具体数值,只定性描述为”real-time”。
  • 下游策略推理频率、控制 Hz:论文未披露
  • 硬件成本定位为”低成本”(relatively low cost),但未给出具体金额。
  • 已知的硬件细节(来自 GitHub 仓库):DYNAMIXEL XM430-W350-R 舵机 + U2D2 控制器,示例配置波特率 4,000,000;软件运行环境 conda + Python 3.11。

评测 benchmark

基线对比:ACE-F vs. GELLO(关节复制),均使用真实/仿真 Franka Emika Panda:

仿真箱子堆叠(Table II):ACE-F 用时 102.1±27.2s、平均用秤次数 0.7±0.5、成功率 90.0%;GELLO 用时 187.0±121.2s、用秤次数 2.3±0.7、成功率 70.0%——ACE-F 快 54.62%、成功率高 28.57%。

仿真箱子拖拽:ACE-F(有灯)16.7±2.5s 成功率 100%;ACE-F(盲操作/无灯)16.4±2.5s 成功率 94.4%;GELLO(有灯)21.9±4.8s 成功率 75.0%——ACE-F 快 23.72%,盲操作失败率仅 5.6% vs. GELLO(有灯)失败率 25%。

仿真擦桌(左右向 / 前后向):左右向 ACE-F 法向力 196.8±55.9、最大/平均力比 4.59,GELLO 231.9±69.6、力比 7.19(ACE-F 力比小 36.16%);前后向 ACE-F 229.0±146.8、力比 7.19,GELLO 251.7±183.1、力比 9.73(力比小 41.86%)。

真实罐头堆叠(Table III):ACE-F 90.81±17.97s、用秤 0.0±0.00 次、成功率 83.3%;GELLO 88.36±23.46s(更快)、用秤 2.0±0.63 次、成功率 66.7%。

真实擦标记:ACE-F 26.54±7.89s、0 次安全告警、成功率 100.0%;GELLO 22.13±4.30s(快 16.62%)、1 次安全告警、成功率 100.0%。

真实盲插罐头:ACE-F 43.26±20.87s、成功率 100.0%;GELLO 34.42±12.30s(更快)、成功率仅 50.0%。

模仿学习策略对比:FF(有力反馈数据)vs. Regular(无力反馈数据)(Table IV)——数据采集阶段:FF Lift 成功率 96.0%/7.0±0.7s vs. Regular Lift 96.0%/8.9±1.3s;FF Stack 95.8%/9.5±1.0s vs. Regular Stack 72.0%/9.9±1.5s;FF Wipe 100.0%/6.9±1.8s vs. Regular Wipe 76.0%/10.1±3.1s。策略部署评测阶段(rollout,取”完全成功率”/“部分成功率”):FF Lift 完全成功 95.0% vs. Regular Lift 60.0%;FF Stack 完全成功 52.6%、部分成功 44.4% vs. Regular Stack 完全成功 30.0%、部分成功 21.4%;FF Wipe 完全成功 75.0% vs. Regular Wipe 完全成功 65.0%;真实世界 FF Can Sort(仅 FF,无 Regular 基线)完全成功 66.7%、部分成功 75.0%。

创新点与影响

  • 无传感器虚拟力反馈:把”跟随臂末端目标-实际位姿偏差”直接解释为 3-DoF 力信号,免去昂贵 FT 传感器,且天然跨本体(只需 IK/URDF,不需为每个机器人重新做力传感器标定)。
  • 紧凑折叠领导臂 + IMU + 手套的组合,把 6-DoF 末端控制解耦成”3-DoF 位置(领导臂)+ 朝向(IMU/手套)“两条流,相比外骨骼式方案大幅降低电机扭矩需求与硬件体积/成本。
  • 增强 IK 求解器通过两个额外任务项规避 7-DoF 冗余臂在遥操作长时程任务中的运动学奇异点。
  • 实验证实力反馈数据本身能提升下游模仿学习策略的成功率(尤其在 Stacking/Wiping 等需要深度感/压力感的任务上提升明显)。
  • 硬件与软件均已开源(acef_hardware / acef_software)。
  • 论文自陈局限:(1) 只做 3-DoF Cartesian 力反馈,没有做完整 6-DoF 力/力矩反馈——项目明确选择”低成本”优先于”完整 6-DoF 力反馈”;(2) 更好的电机能提供更强的反馈力,当前电机是限制因素;(3) 真实世界的罐头分拣策略没有做”无力反馈”基线对照,论文明确表示不敢断言力反馈优势在真实世界”一定”成立,只说仿真结果暗示该优势会延续;(4) 数据采集未用中间运动规划器,导致模仿学习策略成功率整体偏低;(5) 未来工作方向是扩展手套的实现并加入扭矩反馈(当前只有 Cartesian 力)。

原始链接

一手源存档(sources/)