一句话定位
Open-TeleVision 是 UC San Diego + MIT 提出的开源 VR 遥操作系统:机器人头部装一台可主动转动(2-3 自由度)的立体相机,把双目 480×640 视频实时流回 VR 头显,操作者像”魂穿”进机器人一样看它所看、转头即转动机器人头部,同时手腕/手指姿态经逆运动学与 dex-retargeting 映射到机械臂与灵巧手;全链路(感知流+动作流)跑在 60 Hz,支持跨美国东西海岸(约 3000 英里)的远程遥操作。作者用它在 Unitree H1(六指灵巧手)与 Fourier GR-1(夹爪)两台人形机器人上采集四个长程精细任务数据,训练 ACT+DinoV2 模仿学习策略,验证了立体视觉与主动视觉对遥操作易用性与策略成功率的独立贡献。CoRL 2024。
背景与定位
论文把遥操作系统拆成”动作(actuation)“与”感知(perception)“两个组件分别归纳短板:动作侧的关节复刻(joint copy,如 ALOHA/Mobile ALOHA/GELLO)控制带宽高、精度好,但要求操作者与机器人物理同地、且尚未扩展到多指灵巧手;感知侧则长期在”第三人称直视/固定相机视角”与”第一人称直视”之间二选一,都会造成操作者视野被机械臂/躯干遮挡,且无法保证采到的画面正是策略学习所需的观测。更关键的是:此前系统里,“远程操作”与”人眼立体深度感知”是互斥的——要么直视机器人(有深度但必须同地),要么看 RGB 视频流远程操作(能远程但丢失深度);Open Teach 之类的混合现实方案缓解了这个问题但仍要求操作者在机器人附近才有深度感知。Open-TeleVision 的定位是首次让远程控制与立体深度感知在同一套系统里共存:用一台随头动的立体相机把双目视频流回头显,既保留人眼固有的立体视觉能力,又不要求物理同地。
方法上,手部姿态映射直接复用 AnyTeleop 提出的 dex-retargeting 库(向量优化器公式化重定向问题),机械臂逆运动学基于 Pinocchio 的闭环 CLIK 算法;模仿学习策略沿用 ACT(action chunking transformer)架构,仅替换视觉骨干与相机路数。论文将自己与并发的人形机器人遥操作工作(如全身遥操作 H2O/OmniH2O/HumanPlus 一脉)区分开来:那些工作聚焦全身动作模仿与下肢控制,而 Open-TeleVision 的核心创新在感知侧(立体+主动视觉),并专门验证了远程跨洲遥操作的可行性。
模型架构
系统分两部分:遥操作硬件/软件栈(非学习模型)与下游模仿学习策略(ACT 变体)。
遥操作系统(TeleVision):
- 基于 Vuer 搭建 web 服务器;VR 设备(论文选用 Apple VisionPro,声称设备无关,同时展示了 Meta Quest 与笔记本/平板/手机的跨平台访问界面)把操作者的手、头、手腕位姿以 SE(3) 流式发送到服务器,服务器做人到机器人的动作重定向;机器人侧再把立体视频流回 VR 设备,每只眼 480×640,全链路 60 Hz。
- 头部/颈部主动感知:H1 用 3D 打印的 2 自由度(yaw、pitch)云台,由 DYNAMIXEL XL330-M288-T 电机驱动;GR-1 使用厂商自带的 3 自由度颈部(yaw、roll、pitch)。两机器人均用一台 ZED Mini 立体相机做双目 RGB 采集。
- 手臂控制:把人手腕位姿转换到机器人坐标系——末端相对头部的位置关系与人手腕相对人头的位置关系对齐(保证机器人转头时末端不跟着漂移),手腕朝向直接对齐 VisionPro 手部跟踪初始化时估计的绝对朝向;用基于 Pinocchio 的闭环逆运动学(CLIK)解算关节角,末端位姿先经 SE(3) 群插值滤波平滑,并在机械臂可操作度接近极限时把修正量投影到雅可比零空间以避免破坏末端跟踪精度。
- 手部控制:人手关键点通过 AnyTeleop 的 dex-retargeting 库映射为机器人关节角,建模为向量优化问题
min_qt Σ‖α·v_t^i − f_i(q_t)‖² + β‖q_t − q_{t-1}‖²(α 补偿人手/机器人手尺寸差,H1 用的 Inspire 手取 α=1.1;β 做时序平滑),用 NLopt 的 SLSQP 实时求解,FK 与其导数由 Pinocchio 计算。灵巧手(H1 六自由度 Inspire 手)用 7 个向量(5 个腕-指尖向量 + 2 个拇指到食指/中指向量提升精细操作精度);夹爪(GR-1 一自由度)只用拇指-食指指尖间 1 个向量,直接映射捏合开合。 - 本体:Unitree H1(双 7-DoF 臂 + Inspire 六自由度五指手)与 Fourier GR-1(双 7-DoF 臂 + 1 自由度夹爪),只使用两臂+主动颈部自由度,其余(腿部等)本文不涉及。
下游模仿学习策略(ACT 变体):以 ACT 为基础做两处修改——(1) 视觉骨干从 ResNet18 换成自监督预训练的 DinoV2 ViT,每张图产生 16×22 个 token;(2) 输入从传统 ACT 的 4 路独立摆放相机改为 2 路立体图像(左右眼),状态 token 由当前关节位置投影得到,动作空间为绝对关节位置。H1 动作维度 28(每臂 7 + 每手 6 + 主动颈 2),GR-1 动作维度 19(每臂 7 + 每夹爪 1 + 主动颈 3)。
数据
- 任务与规模(真实机器人采集,无仿真):
- H1 Can Sorting:10 条演示,平均单条 93±5 秒;GR-1 Can Sorting:10 条演示,平均 61±5 秒(Can Sorting 任务定义为单条演示内连续分拣 10 个罐子[5 可乐 5 雪碧随机排列],重复度高,故只用 10 条演示即可覆盖上百次子任务采样;除 Can Sorting 外全部任务均用 20 条演示)。
- Can Insertion:20 条演示,平均 84±7 秒;Folding:20 条演示,平均 44±5 秒;Unloading:20 条演示,平均 93±6 秒。
- 数据来源:全部由人类操作者通过本文遥操作系统实时采集,无第三方数据集混合,无跨本体/跨任务 co-training。
- 动作标注:遥操作本身即标注——VR 流出的手/头/腕姿态经重定向后直接作为关节位置动作标签,无需事后标注。
- 任务设计要点:四个任务均刻意设计成需要主动看向工作台左右两侧(否则要多相机固定摆位)且含大量物体位置/朝向随机化:Can Sorting 随机放置可乐/雪碧罐并按颜色分拣入左右箱;Can Insertion 需用拇指+食指的精细捏取把罐子(直径约 5.6cm)插入仅大 2cm 的槽(直径约 7.6cm);Folding 操作软体毛巾折叠两次;Unloading 需从 4 个随机槽位中定位试管、单手取出后手递手传给另一只手放置。演示结尾操作者摆固定的”结束手势”标记完整周期,且不裁剪该手势,训练出的策略也能正确响应结束条件。
- 生成/开源数据集:数据集经 Google Drive 公开(见项目页 Datasets 链接),供复现训练使用。
训练方法
- 算法:模仿学习/行为克隆,ACT 框架(action chunking transformer),无 RL。
- 优化器/超参(正文与附录 Table 7 一致):AdamW,学习率 5e-5,batch size 45,训练 25,000 迭代,单张 RTX 4090 GPU;KL 权重 10,hidden dim 512,feedforward dim 3200。
- 动作分块(chunk size):默认 60(对应 60Hz 推理/控制频率,约给策略 1 秒记忆),仅 Can Insertion 用 100(更长历史动作有助于精细插入的动作序列判断)。
- 时序加权(temporal weighting,ACT 的 temporal aggregation 指数权重 m):默认 0.01;Unloading 调至 0.05(提升手递手阶段稳定性);Can Sorting 调至 0.005(换取更快的动作响应)。
- 两组消融基线:
w. ResNet18(把 DinoV2 换回原版 ACT 的 ResNet18 骨干)与w/o Stereo Input(策略只用左眼单目图像的视觉 token,不用双目)。
Infra(训练 / 推理工程)
- 训练侧:单张 RTX 4090 GPU,batch 45,25k 迭代;论文未披露具体训练墙钟时间/GPU-hours。
- 计算成本对比(Table 2,采样 100 个 batch/100 个部署步取平均):
- Cropped Active(本文方案,640×480 降采样到 308×224,每相机 352 token)batch 45:训练每 batch 平均 0.41s,部署每步 0.012s(83Hz);batch 10 时训练每 batch 0.10s。
- Wide Angle(1280×720 广角相机、无主动云台,降采样到 588×336,每相机 1008 token,因显存限制 batch 只能开到 10):训练每 batch 0.32s,部署每步 0.024s(42Hz)。
- 结论:主动裁剪视角比广角静态视角训练快 2× 且同显存下可放 4× batch,推理也快 2×,为 60Hz 部署控制频率留出 IK/重定向计算的时间余量;广角方案推理帧率仅约 42fps,不足以稳定支撑 60Hz 闭环。
- VR/流式回路:VR 头显 ↔ 服务器 ↔ 机器人的感知流+动作流全链路 60 Hz,双目视频 480×640/眼。
- 边缘硬件:头部云台由 DYNAMIXEL XL330-M288-T 舵机驱动(H1);ZED Mini 立体相机做视觉采集;H1 手臂为准直驱(quasi-direct-drive)+ 行星减速器电机(存在齿隙、刚度不如工业臂,论文指出即便如此仍能在人在环下达到高精度操作)。
评测 benchmark
以下数据均来自论文 Table 1(5 次真实机器人试验/任务;GR-1 Can Sorting 每次 rollout 含 6 次拣+6 次放,累计 30 次子任务试验)。
H1 Can Sorting / GR-1 Can Sorting / Can Insertion(拣 Pick / 放 Place / Insert 成功率):
| 方案 | H1 Pick | H1 Place | GR-1 Pick | GR-1 Place | Insertion Pick | Insertion Insert |
|---|---|---|---|---|---|---|
| w. DinoV2(本文) | 92% | 88% | 87% | 60% | 90% | 87% |
| w. ResNet18 | 74% | 58% | 83% | 50% | 53% | 70% |
| w/o Stereo Input | 46% | 52% | 73% | 63% | 47% | 63% |
Folding(Lift/Fold)/ Unloading(Extract/Pass/Place)成功率:
| 方案 | Fold-Lift | Fold-Fold | Fold-Move | Fold-Fold2 | Unload-Extract | Unload-Pass | Unload-Place |
|---|---|---|---|---|---|---|---|
| w. DinoV2(本文) | 100% | 100% | 100% | 100% | 100% | 100% | 100% |
| w. ResNet18 | 100% | 100% | 100% | 100% | 85% | 100% | 95% |
| w/o Stereo Input | 100% | 100% | 60% | 100% | 70% | 95% | 100% |
- GR-1 Can Sorting 的放置阶段(Place)三种方案都不理想(60/50/63%),论文归因于夹爪抓取时相机严重遮挡罐身颜色(灵巧手抓取时颜色仍可见,夹爪则看不到),叠加 chunk size=60(约 1 秒记忆)导致放罐时策略已”忘记”拿起时看到的颜色。附录 B 用贴色标签做对照实验后 Place 成功率跃升至本文方案 100%(旧 60%)、ResNet18 97%(旧 50%)、w/o Stereo 93%(旧 63%),验证了遮挡假设。
- 主动视觉 vs 广角静态相机:Table 2 显示裁剪主动视角训练/推理均快 2 倍(见 Infra 节)。
- 用户研究(Table 3,4 名 20-25 岁研究生,含无 VR 经验者):立体(Stereo)显示相对单目(Mono)在完成时间与成功率上均显著更优——平均完成时间 Can Sorting 66s vs 91s、Can Insertion 58s vs 85s、Folding 34s vs 50s、Unloading 67s vs 97s;平均成功率 Stereo 全部 100%,Mono 为 93%/71%/100%/50%。
- 抓取位置泛化(Fig 5,4×4 网格、格距 3cm,每格 5 次试验):H1 Can Sorting 在训练分布覆盖区域保持 100% 抓取成功率,边缘稀疏/未覆盖区域仍有一定适应性。
- 与既有遥操作系统的定性对比表(Table 4,附录 A 详细讨论):论文点出感知侧的核心矛盾——“直视机器人”能给操作者立体深度感知但必须与机器人同地;“流式传输 RGB 视频”能远程但丢失深度感知;AnyTeleop/Telekinesis 这类 RGB(D)/RGB 跟踪系统虽然表中 Remote 和 Depth 两列都打勾,但作者明确指出这是”系统分别支持两种模式、但二者互斥”(选流式 RGB 可远程但没深度,切回直视有深度但不能远程),而非同时具备;Open Teach 用混合现实融合了两者,但仍要求操作者在机器人附近,一旦真正远程就没有深度感知(Remote✗ Depth✓);ALOHA/Mobile ALOHA/GELLO/AirExo 等关节复刻系统固定为直视、无远程、且不支持灵巧手(Hand✗);DexCap 用 SLAM+动捕支持灵巧手与双手,但同样是直视、无远程。Open-TeleVision 是表中唯一把 Perception 列标为 “Stereo” 且 Remote 与 Depth 同时打勾的系统——单路立体视频流回放,使远程操作与人眼立体深度感知第一次可以同时获得。
- 论文未与其他系统做下游策略成功率的直接横向数值对比(仅做能力矩阵对比),也未报告跨洲遥操作(H1 圣地亚哥 ↔ 操作者波士顿)的量化指标,仅作定性视频展示。
创新点与影响
- 核心贡献:把”远程控制”与”立体深度感知”两个此前互斥的能力首次整合到同一套遥操作系统——单个可主动转动的立体相机随操作者头动,把双目视频流回 VR 头显,让操作者获得第一人称立体视觉的同时不必与机器人同地。
- 消融验证的两条设计原则:(1) 立体输入相比单目在四项任务的多数子任务上带来明显更高的策略成功率(尤其依赖深度判断的抓取/插入/贴桌力度控制场景);(2) DinoV2 视觉骨干相比 ResNet18 在双相机(而非传统 ACT 四相机)输入下明显更强,弥补了相机路数减少造成的空间信息损失。
- 主动视觉的双重收益:对操作者而言提供更符合人眼中央凹注视习惯的交互方式(无需盯着画面边缘的兴趣点);对策略学习而言,主动视角相当于一种”注意力机制”,减少了需要处理的像素量,训练/推理均比固定广角相机快 2 倍,为 60Hz 闭环控制留出计算余量。
- 系统能力展示:钻孔(1kg 工具)、耳塞装盒的双手协同、移液枪精细操作(管径 1.5cm)等灵巧手专属任务;跨美国东西海岸(约 3000 英里)的远程遥操作。
- 作者自陈局限(Conclusion):(1) 缺乏触觉/力反馈,而这类反馈在第一人称视觉遮挡与触觉密集任务中通常是主导反馈渠道;(2) 系统尚不支持专家数据的事后重标注(relabeling),而这类机制有望进一步提升下游成功率;(3) 当前只用了两臂+主动颈部自由度,尚未扩展到移动版本(利用机器人全部自由度)。
原始链接
- arXiv abstract: https://arxiv.org/abs/2407.01512
- arXiv PDF: https://arxiv.org/pdf/2407.01512
- 项目主页: https://robot-tv.github.io/
- GitHub(代码): https://github.com/OpenTeleVision/TeleVision
- 数据集(Google Drive): https://drive.google.com/drive/folders/11WO96mUMjmxRo9Hpvm4ADz7THuuGNEMY?usp=sharing
- 硬件组装文档(Google Doc): https://docs.google.com/document/d/1zBi4skD8Jv9Sm6ZL0TInbfMHww3qrICmWE42jQNjEE4/edit?usp=sharing
一手源存档(sources/)
- open-television—github-readme —
OpenTeleVision/TeleVisionGitHub README 快照(安装、VisionPro/Quest 本地与 ngrok 网络流式配置、ACT 训练命令与超参、CoRL 2024 引用) - open-television—project-page — robot-tv.github.io 项目主页快照(摘要、视频分区说明、媒体报道链接、BibTeX)
- arXiv 原文 PDF(2407.01512,含正文 Sec.1-5、Appendix A-E、Table 1-7、Fig.1-11),不入 git,见上方 arXiv 链接