一句话定位
AnyTeleop 是一套摄像头式(camera-only)、机器人无关的通用视觉遥操作系统,单一系统即可支持任意机械臂-灵巧手组合、任意”现实”(仿真器或真实世界)、任意相机配置以及多操作者协作,用于规模化采集灵巧操作示范数据;在真实机器人和仿真两条实验线上都反超了此前专为特定硬件/仿真器定制的系统。
背景与定位
遥操作(teleoperation)是采集人类示范来教机器人的核心范式之一。此前的视觉遥操作系统——DexPilot、Holo-Dex、DIME、TeachNet、Robotic Telekinesis(论文称 Telekinesis)、Transteleop 以及作者自己的前作 Qin et al.(用于仿真的示范采集系统)——普遍绑定某个特定机械臂-灵巧手组合(如 DexPilot 用 Kuka+Allegro)、且训练了针对特定机器人的重定向/避障模型,只能二选一地跑在”仅真实世界”或”仅某个仿真器”里,难以随机器人型号和部署环境的扩张而扩展。
AnyTeleop 提出的范式是:一套系统同时支持”任意机械臂/灵巧手 + 任意现实(仿真或真实)+ 任意相机配置(单/多、RGB/RGB-D)+ 任意数量操作者-机器人搭档(含协作遥操作)“,面向规模化示范数据采集(embodied-data-teleop)。技术路径上,它刻意选择**无学习(learning-free)**的实时运动重定向和碰撞规避——把此前系统里”为特定机器人训练一个重定向/避障模型”替换成”给定 URDF 运动学模型即可适配新机器人的优化算法”,并用 GPU 并行计算(CuRobo)弥补无学习方案的实时性缺口。
论文发表于 RSS 2023,并衍生出两个独立开源基础设施:浏览器可视化库 sim-web-visualizer(NVlabs)和手部重定向库 dex-retargeting(dexsuite),后者已成为后续遥操作 / 人体动作到机器人动作重定向工作(如面向人形全身操作的数据生成工作 omniretarget)复用的组件。
模型架构
AnyTeleop 不是一个端到端训练的策略网络,而是一条感知 + 优化的实时流水线,由服务器端四个模块串联而成:
- 手部姿态检测(Hand Pose Detection):复用现成模型而非自训练。手指关键点检测用 MediaPipe(RGB 输入,CPU 实时,输出 21 个手关节的局部 3D 关键点 + 图像 2D 关键点);全局 6D 手腕位姿在 RGB-D 输入下用检测到关键点的深度值 + 相机内参通过 PnP 算法求解;纯 RGB 输入下借鉴 FrankMocap 的做法,额外用一个神经网络回归弱透视变换的尺度因子来近似手腕 3D 位置(精度低于深度相机方案,但足够支撑多数遥操作任务)。
- 多相机检测融合(Detection Fusion):用人手本身作”自然标记”做自动外参标定——取前 N=50 帧的多相机检测结果计算相机间相对旋转(SO(3)),无需显式标定板;用 SMPL-X 预测的手型(shape)参数的稳定性作为置信度代理:以前 50 帧手型参数均值为参考,实时预测值与参考的误差越大代表该相机检测越不可靠,融合模块选置信度最高的相机给出的相对运动向下游传递。
- 手部姿态重定向(Hand Pose Retargeting):表述为无学习的逐帧优化问题——最小化人手与机器人手对应关键点向量之差,约束为机器人前向运动学 $f_i(q_t)$ 与关节位置上下限,并加入时序平滑惩罚项(式 1)。跨形态(如 Dclaw 这类非拟人手)需要人工指定关键点映射关系;该模块只处理手部,不涉及手臂。
- 运动生成(Motion Generation):放弃此前 DexPilot 依赖的黎曼运动策略 RMP(只保证加速度场,不保证轨迹自然),改用 CuRobo——一个 GPU 高度并行加速的无碰撞运动生成库。检测/融合/重定向以设计频率 25 Hz 输出末端执行器 Cartesian 目标位姿,运动生成模块以更高频率 120 Hz 生成关节空间的无碰撞轨迹,供阻抗控制器在仿真或真实机器人上安全执行。
此外还有一个独立的 Web 可视化模块(基于 meshcat + three.js),浏览器端渲染,支持多窗口多视角以及跨互联网的远程/多操作者协作同步查看,是实现”任意地点遥操作”和”协作遥操作”的关键组件。整套系统按照标准化输入输出接口做模块化封装,并以 Docker 容器打包,方便适配不同机械臂/灵巧手/相机而无需重训任何模型——即跨 embodiment 的泛化靠”提供 URDF + 少量人工映射”而非学习获得。
数据
AnyTeleop 本身是一个实时数据采集工具,不产出静态数据集,论文用它采集了两类评测用数据:
- 仿真(SAPIEN 环境):3 个操作任务 Relocate / Flip Mug / Open Door,每任务 2 个变体(floating-hand 无臂悬浮手、arm-hand 固定臂+手),每任务/变体采集 50 条示范轨迹,单 RGB-D 相机。基线系统(Qin et al. [43])的示范由原作者直接提供(同样每任务 50 条,且只能采集 floating-hand,需要额外的转换流水线才能得到 arm-hand 版本);AnyTeleop 一侧统一用 arm-hand 设置采集,再转换出 floating-hand 版本以兼容两种变体的评测,从而保证两套系统数据规模对齐、比较公平。
- 真实机器人:复刻 Robotic Telekinesis 论文里的 10 个操作任务(Pickup Box Object、Pickup Fabric Toy、Box Rotation、Scissor Pickup、Cup Stack、Two Cup Stacking、Pouring Cubes onto Plate、Cup Into Plate、Open Drawer、Open Drawer and Pickup Object),机器人为 XArm6 + Allegro hand,单 Intel RealSense 相机,一名熟练操作者每任务跑 10 次。
- 相机配置消融数据:IsaacGym 里的 Play Piano 任务,单 RGB / 单 RGB-D / 双 RGB-D 三种配置各由熟练操作者跑 10 次。
没有预训练用的大规模示范数据集,也不涉及数据配比、清洗或过滤流程——这是一个在线采集系统而非离线数据集构建管线;下游模仿学习实验里唯一涉及规模的说明是项目页提到的 3K / 5K / 10K transition 三档 BC 策略训练量(论文正文未展开对应的定量结果表)。
训练方法
系统的核心算法链路刻意采取无学习设计,不是端到端训练出来的:
- 手部关键点检测直接复用预训练的 MediaPipe;纯 RGB 场景下的尺度回归网络沿用 FrankMocap 的方法(该网络非本文训练对象)。
- 重定向是逐帧数值优化问题(式 1:keypoint 向量差 + 关节限位惩罚 + 时序平滑惩罚项 $\beta$),不是学习到的映射函数;换新机器人只需提供 URDF 运动学模型(必要时人工补充关键点映射),无需重新采集数据训练重定向网络。
- 运动生成用 CuRobo 的 GPU 并行运动规划求解无碰撞轨迹,同样是实时求解而非离线训练。
真正涉及”训练”的地方是下游应用实验(VII-A 模仿学习):用 AnyTeleop 采集的示范 + DAPG(Demo Augmented Policy Gradient,示范增强策略梯度)作为模仿学习算法训练策略,并与不使用示范的纯 RL 基线([44])对比;每个任务/方法用 3 个随机种子独立训练策略,每个训练出的策略在 100 次随机初始化的 trial 上评估成功率。
Infra(训练 / 推理工程)
-
训练侧:系统本身不含需要 GPU 训练的神经网络(重定向、运动生成均为无学习实时求解),因此无 GPU 训练规模或训练时长可披露;下游 DAPG/RL 实验的具体训练算力未在原文披露。
-
推理侧 profiling(Table II,两种硬件配置,所有模块同机同时运行时的单次前向耗时):
模块 Desktop(RTX 3090 + i9-10980XE) Laptop(RTX 2070 + i7-8750) Hand Pose (RGB) 26±5 ms 34±5 ms Hand Pose (RGB-D) 27±5 ms 35±5 ms Fusion 1±0 ms 1±0 ms Retargeting 9±7 ms 10±9 ms Motion 8±3 ms 11±5 ms 设计频率:手部检测/融合/重定向目标 25 Hz;运动生成目标 120 Hz(可在更低频率下仍可用)。作者指出当所有模块跑在同一台机器上时难以同时达到这两档目标频率,因此系统采用”通信优先”(communication-focused)架构,把控制模块拆分到独立机器上运行以达到最佳吞吐——这也是协作/远程遥操作能成立的基础设计。
-
部署:AnyTeleop 及全部依赖库封装为 Docker 镜像,可在任意 Linux 机器上下载部署,免去处理复杂软件依赖的成本。
-
边缘设备 / 更多硬件配置下的功耗、时延等未披露。
评测 benchmark
-
系统能力对比(Table I):与 DexPilot、Holo-Dex、DIME、TeachNet、Telekinesis、Qin et al.[43]、MVP-Real、Transteleop、Mosbach et al. 逐项对比传感器需求(标定自由/接触自由/深度自由)、机器人相关支持(多机械臂/多手/reality 自由度)、用例(碰撞规避/远程遥操/协作遥操)。AnyTeleop 是表中唯一同时支持多机械臂与协作遥操作的系统,也是仅有的两个支持多种灵巧手的系统之一。
-
真实机器人遥操作(Table III,对比 Robotic Telekinesis[54],同 XArm6+Allegro 硬件,单 RealSense 相机,10 次/任务):AnyTeleop 在 10 个任务中 8 个胜出、2 个持平——Pickup Box Object 1.0 vs 0.9、Pickup Fabric Toy 1.0 vs 0.9、Box Rotation 0.6 vs 0.6(平)、Scissor Pickup 0.8 vs 0.7、Cup Stack 0.9 vs 0.6、Two Cup Stacking 0.7 vs 0.3、Pouring Cubes onto Plate 0.7 vs 0.7(平)、Cup Into Plate 1.0 vs 0.8、Open Drawer 1.0 vs 0.9、Open Drawer and Pickup Object 0.9 vs 0.6。作者分析优势集中在薄壁物体抓取(cup 相关任务),因为优化式重定向能主动收紧指尖间距离,而基线的网络式重定向难以还原精细的捏取(precision grasp)动作。
-
仿真模仿学习(Table VI,对比 Qin et al.[43] 采集的示范 + DAPG,以及不用示范的纯 RL[44],3 个随机种子、每策略 100 次 trial 的成功率 %,均值±标准差):
任务(变体) RL Baseline[43] Ours Relocate(floating-hand) 36.3±15.3 49.7±18.3 53.7±12.2 Flip Mug(floating-hand) 33.7±15.0 51.3±34.7 47.3±28.3 Open Door(floating-hand) 69.3±38.0 64.7±14.7 73.3±9.0 Relocate(arm-hand) 33.7±29.3 40.3±36.7 70.0±9.8 Flip Mug(arm-hand) 31.0±28.7 36.0±32.4 53.7±24.0 Open Door(arm-hand) 34.7±31.7 51.3±30.7 79.7±15.5 6 个任务中 5 个 AnyTeleop 最优(唯一例外是 floating-hand 的 Flip Mug),且 arm-hand 场景下优势更显著——作者归因于基线的重定向流程可能给机械臂带来自碰撞,而 AnyTeleop 显式保证生成轨迹无碰撞、更平滑,更利于 BC 类算法消费。
-
相机配置消融(Table IV,Play Piano 任务,IsaacGym,10 次/配置):单 RGB 完成时间 109s / 按键错误率 28.1%;单 RGB-D 87s / 21.8%;双 RGB-D 74s / 12.5%(最优)。表明系统允许用户按需在部署成本与遥操作效率之间权衡。
创新点与影响
- 贡献:(i) 无学习实时手部重定向库(已独立开源为
dex-retargeting,被后续多个手/物体位姿数据后处理及遥操作工作复用);(ii) 无学习、GPU 并行加速的碰撞规避运动生成(接入 CuRobo,替代此前依赖的 RMP 方案);(iii) 浏览器端可视化(已独立开源为sim-web-visualizer,支持 IsaacGym/SAPIEN/静态 URDF,尤其适合无显示器远程服务器场景);(iv) 据作者所知,首次在灵巧手视觉遥操作文献中演示协作遥操作(多操作者跨地理位置分别操控多个机器人协同完成同一任务,如人手向机器人手的物品交接)。 - 影响:两个衍生开源库成为社区常用基础设施,
dex-retargeting尤其被后续人体动作到机器人动作重定向、遥操作数据生成类工作(如面向人形全身操作与场景交互的数据生成工作 omniretarget)作为标准组件复用;“标准化模块接口 + 容器化部署”的设计降低了新机器人接入遥操作系统的门槛。 - 作者自陈局限(Section VIII Failure Modes):(i) 人手快速运动时会丢失跟踪,触发暂停并重新检测;(ii) 手部自遮挡(尤其手掌与相机平面垂直时)会导致姿态检测不可靠,workaround 是要求操作者放慢动作,或为需要大幅度手部旋转的任务增加相机数量。此外,跨形态(如非拟人手 Dclaw)仍需人工指定关键点映射,并非全自动的跨 embodiment 泛化;重定向优化和碰撞规避虽然”无学习”,但仍依赖精确的 URDF 运动学模型作为前提。
原始链接
- arXiv abstract:https://arxiv.org/abs/2307.04577
- arXiv PDF:https://arxiv.org/pdf/2307.04577
- 项目主页(RSS 2023):https://yzqin.github.io/anyteleop/
- GitHub(Web 可视化):https://github.com/NVlabs/sim-web-visualizer
- GitHub(手部重定向):https://github.com/dexsuite/dex-retargeting
一手源存档(sources/)
- anyteleop—project-page — yzqin.github.io/anyteleop 项目主页快照(RSS 2023、BibTeX、两条开源代码入口、视频/用户测试章节标题)
- anyteleop—sim-web-visualizer-readme —
NVlabs/sim-web-visualizerGitHub README 快照 - anyteleop—dex-retargeting-readme —
dexsuite/dex-retargetingGitHub README 快照 - arXiv 原文 PDF(2307.04577,含正文 Section I–X 及附录 Table IV 相机配置消融),不入 git,见上方 arXiv 链接