一句话定位
用一部普通 iPhone(靠 ARKit 做 6-DoF 姿态跟踪)当遥操作手柄、把机器人仿真通过 WebRTC 实时推流进浏览器,RoboTurk 让 Amazon Mechanical Turk 式的众包工人足不出户就能远程操作 Sawyer 机械臂——22 小时系统占用收集到 3224 条尝试、2218 条成功演示(137.5 小时轨迹),完成时间统计上与专用 VR 手柄(HTC Vive)无显著差异,是”用消费级硬件把示教数据采集规模化”这条数据飞轮路线的早期奠基之作。
背景与定位
2018 年前后,模仿学习(Imitation Learning)已经在避开强化学习的探索难题与奖励设计难题上展现优势,但受限于示教数据的采集方式:动觉引导(kinesthetic teaching)通常只能收集几十条演示;专用遥操作硬件(VR 手柄、3D 鼠标、master-slave 主从设备)虽然轨迹质量高但价格与部署门槛把众包工人挡在门外;键盘/游戏手柄这类廉价接口又容易产生轴对齐、不自然的退化轨迹。作者把问题归纳为一个矛盾:数据需要同时”自然”(VR 级的自由空间 6-DoF 控制)与”海量”(众包级的可扩展性),而当时的方案二者不可兼得。
RoboTurk 的解法是把示教接口做到人人都有的智能手机上:用 Apple ARKit 的视觉惯性里程计把 iPhone 变成一个自由空间 6-DoF 位姿控制器,用 WebRTC 把机器人仿真的相机画面低延迟地流回浏览器,从而把示教门槛从”买一台 VR 设备”降到”打开一个网页”。论文本身只在仿真环境里验证(真实机器人版本是次年 IROS 2019 的后续工作),但它确立了后续一系列工作共享的范式:云端仿真 + 消费级硬件遥操作 + 众包规模化,这条路线后来演化出 RoboTurk 真实机器人数据集(IROS 2019)、Multi-Arm RoboTurk(ICRA 2021)、人机协同干预的 IWR(2020),并最终沉淀为被广泛使用的模仿学习框架/数据集集合 robomimic(2021)。这一脉络与后来 mobile-aloha 用廉价机械臂做全身遥操作、droid 用便携硬件在”in-the-wild”场景规模化采集、open-x-embodiment 汇聚跨机构演示数据的思路一脉相承——都是”用更便宜/更易得的硬件换取数据规模”这一条数据中心化范式的不同阶段;mimicgen 则是在演示数据本身昂贵这一前提下,转而用少量人类演示自动生成更多轨迹的下一步演化。
范式命名:teleoperation-based crowdsourced demonstration collection(遥操作众包示教采集)。
模型架构
本文严格意义上不是一个”模型”论文,而是一套数据采集系统架构;论文里唯一涉及学习的部分是第 4 节用现成的分布式 PPO 做示教引导的强化学习(非本文提出的新算法)。
系统组件(云端-客户端架构):
- User Endpoint(用户端):用户在浏览器里接收机器人仿真的实时视频流,同时移动 iPhone 来控制机械臂。手机姿态由 Apple ARKit 跟踪(结合相机帧与运动传感器数据),要求 iPhone 6S 及以上(ARKit 兼容)。手机把姿态与状态信息打包,通过平台传给专属的遥操作服务器实例;遥操作服务器再把任务相关信息传回手机,用震动做接触反馈(haptic feedback)。
- Coordination Server(协调服务器):负责创建、维护每个用户的遥操作会话。新用户加入时,协调服务器为其动态派生一个专属遥操作服务器实例,并建立两条低延迟 WebRTC 通信通道:(1) 用户浏览器 ↔ 遥操作服务器,(2) 用户手机 ↔ 遥操作服务器。
- Teleoperation Server(遥操作服务器):每个实例只接收一名用户的手机指令,用于控制仿真中的机械臂。控制律:接收到手机在 AR 世界坐标系下的新位姿后,映射为期望的末端执行器位姿;再用**逆运动学(IK)**求解期望关节位置 q*;最终关节速度控制器为 q̇ = −k_v(q − q*)。
- 仿真后端:把机器人仿真卸载到云端强力机器(而非本地执行),用 WebRTC 同时传输控制指令与渲染后的相机视图,使客户端无需任何本地算力或软件安装。
- 模拟机器人 / 环境:7-DoF Sawyer 机械臂,物理引擎为 MuJoCo,任务取自 SURREAL Robotics Suite(Fan et al. 2018,灵感来自 World Robot Summit 工业机器人赛道)。
ACTION-conditioning:本文不训练感知或控制策略网络,动作直接来自遥操作指令;下游第 4 节的策略学习用现成分布式 PPO(32 个 actor),策略为高斯分布,均值网络 = LSTM(隐层 100) + 两层全连接(300, 200),价值网络同构。
Cross-embodiment / memory:未涉及;系统面向单臂 Sawyer 抓取/装配任务,论文声明”可扩展至其他机器人、仿真器、任务”但本文未做验证。
数据
- 采集方式:远程合同工(contracted remote workers,而非公开众包平台)用 RoboTurk 平台的 iPhone 界面采集。
- 规模(论文附录 A.7 与摘要一致):总计尝试 3224 条演示,历时 22 小时总系统使用量(多用户并发,非墙钟时间);其中 2218 条成功,对应 137.5 小时轨迹。任务拆分口径存在一处论文自身的数字不一致:附录 A.7 原文写”1171 条拾放 + 1147 条装配”,但二者相加为 2318,与同一句话给出的总数 2218 及摘要”over 2200”对不上;作者自己维护的项目主页(index 页与数据集下载页)两处都给出拾放 1070–1071 条 + 装配 1147 条(合计 2217–2218),与总数 2218 吻合,因此正文采用 1071 + 1147 = 2218 这一口径,并将论文 PDF 里的”1171”判断为原文笔误。
- 打包下载版:项目页提供的正式数据集
RoboTurkPilot.zip标注为 1070 条拾放 + 1147 条装配成功演示,与上述统计口径相差 1 条(同一批数据的不同页面表述)。 - 完成时间统计:装配任务平均 112.12 ± 59.95 秒;拾放任务平均 146.71 ± 52.67 秒。
- 任务与物体:Bin Picking 需要把 4 类物体(牛奶盒、面包、麦片盒、罐头)分别放入对应格子;Nut-and-peg Assembly 需要把方形和圆形螺母分别装到对应的桩柱上。
- 数据格式:每组演示是一个目录,含
models/(每条演示对应一份 MuJoCo XML 模型)与demo.hdf5;hdf5 内每条演示记录 MuJoCo 状态序列states、关节速度指令joint_velocities、夹爪指令gripper_actuations、末端执行器增量位姿指令{left,right}_{dpos,dquat}。数据集额外提供按单物体切分的子集(如 bins-Milk、pegs-SquareNut)。 - 纯仿真:本文数据 100% 来自仿真环境,无真实机器人数据;无跨具身/跨机器人混合。
- 另有独立的用户界面对比实验数据(非用于策略学习):8 名 18–30 岁的大学生,在 Lifting 任务each提供 20 条、Picking 任务 each 提供 5 条演示,覆盖 4 种界面 × 4 种网络条件共 8 个测试条件。
训练方法
RoboTurk 本身不是学习算法,第 4 节仅用现成方法验证数据可用性:
- 算法:分布式 PPO(近端策略优化,实现取自同组 SURREAL 框架 [39]),32 个并行 actor。
- 示教引导的探索:训练回合每次环境重置时,以 90% 概率从演示集合中随机采样一条演示、并把仿真器重置到该演示中随机采样的一个状态开始训练;以 10% 概率正常初始化。训练回合的视野(horizon)被人为设为 100 个时间步这一”近视”窗口,鼓励策略访问演示附近的状态而非探索全新经验。
- 对照实验设计:在 Bin Picking (Can) 与 Nut-and-peg Assembly (Round) 两个简化子任务上,比较使用 0 条(纯 RL)、1、10、100、1000 条演示指导训练;每个 (任务, 演示数) 组合跑 10 个随机种子,取最终策略回报的均值与标准差。
- 奖励设计:纯稀疏奖励(任务完成才给 1,无 shaping),故探索本身极难,示教引导是本文验证的核心价值点。
- 训练时长:Can Picking 训练 24 小时,Round Assembly 训练 48 小时(因 24 小时不足以让策略学会该任务)。
Infra(训练 / 推理工程)
- 系统部署:云端仿真 + WebRTC 低延迟通信;协调服务器为每个新用户动态起一个专属遥操作服务器实例,支持多用户同时在线、各自控制独立仿真机械臂(也支持共享工作空间的协作/对抗任务)。
- 跨地域压力测试:加州用户分别操控位于中国(约 6500 英里)与俄勒冈(约 500 英里)数据中心的服务器;中国服务器带来近乎恒定的额外延迟,完成时间比俄勒冈服务器慢(装配任务慢 24 秒,拾放任务慢 28 秒),但任务仍可成功完成。
- 网络鲁棒性测试:用 Cellsim 网络模拟器构造 4 种条件——Baseline(2.4 Mbps 带宽、20 ms 单程延迟)、Low Capacity(500 Kbps、20 ms)、High Delay(2.4 Mbps、120 ms)、Both(500 Kbps、120 ms,120 ms 用于模拟跨太平洋连接)。四种条件下拾放任务完成时间无统计显著差异(K-S 检验,5% 显著性水平),得益于 WebRTC 的自适应视频压缩。
- 客户端硬件门槛:仅需 iPhone 6S 及以上(ARKit 兼容)+ 一台带浏览器的设备,无需本地算力、无需安装软件。
- 策略训练 GPU 数量 / GPU-hours / 精度:未披露(仅披露 PPO actor 并行数 32 与训练墙钟时长 24/48 小时,无 GPU 型号或数量)。
- 推理 FPS / 控制频率 / 时延:未披露具体数值(仅描述”以固定速率(regulated rate)“发送关节速度指令,未给出 Hz 数字);边缘硬件:未涉及(无真机部署)。
评测 benchmark
均取自论文一手数据(Fig. 4–6、Table 1、附录 Table 2–6)。
界面对比(Picking 任务,完成时间,均值 ± 标准差,各 N=40):
| 界面 | 均值 (s) | 标准差 |
|---|---|---|
| Keyboard | 151.45 | 23.69 |
| 3D Mouse | 112.57 | 43.65 |
| VR Controller (HTC Vive) | 79.36 | 29.41 |
| Phone(本文) | 89.97 | 34.94 |
Kolmogorov-Smirnov 检验(5% 显著性水平):Phone 与 VR Controller 的分布差异不显著(p = 0.231),二者均显著快于 3D Mouse(p ≤ 0.022)与 Keyboard(p < 0.001)。结论:Phone ≈ VR Controller ≫ 3D Mouse ≫ Keyboard。Lifting 任务上四种界面除 Keyboard(22.34 ± 7.92s)外无显著差异(3D Mouse 16.58 ± 12.27s、VR 14.29 ± 8.38s、Phone 14.26 ± 8.27s),因任务过短(约 10 秒级)不足以体现差异。
示教引导 RL 结果(Table 1,最大回报 1000 = 瞬时解决任务,10 个随机种子均值 ± 标准差):
| 任务 | 0 条演示 | 1 条 | 10 条 | 100 条 | 1000 条 |
|---|---|---|---|---|---|
| Bin Picking (Can),24h | 0 ± 0 | 278 ± 351 | 273 ± 417 | 385 ± 466 | 641 ± 421 |
| Nut Assembly (Round),48h | 0 ± 0 | 381 ± 467 | 663 ± 435 | 575 ± 470 | 775 ± 388 |
纯 RL(0 条演示)在两个任务上均完全学不会(回报恒为 0),而使用 1000 条演示(约为整个 RoboTurk 试点数据集)在两个任务上都取得最好的平均表现,验证”更多演示 → 更一致、更优”的趋势(尽管作者也指出高方差——部分种子仍未能在给定时间内学会任务)。
创新点与影响
- 首次证明:用一部消费级 iPhone(ARKit 姿态跟踪)+ 浏览器视频流,就能在统计上达到专用 VR 手柄(HTC Vive)级别的遥操作效率,同时把硬件门槛降低到几乎为零——这是本文相对此前”game 接口廉价但轨迹差、VR 接口好但硬件门槛高”两难的核心贡献。
- 用 WebRTC 构建的云端仿真-众包架构证明了对网络带宽/延迟劣化(含跨太平洋级别的高延迟)具有鲁棒性,验证了面向全球远程工人规模化采集的可行性。
- 提供了一个可复现的试点数据集(3224 条尝试 / 2218 条成功 / 137.5 小时)并用示教引导 PPO 定量证明:演示数量从 1 条扩到 1000 条能持续提升稀疏奖励任务的策略一致性与最终表现——为”用众包硬件换数据规模”的路线提供了早期实证支持。
- 作为一个平台/数据采集范式,直接催生了后续 RoboTurk 真实机器人数据集(IROS 2019,111 小时)、Multi-Arm RoboTurk(ICRA 2021)、人机协同干预 IWR(2020),并沉淀为社区常用的 robomimic 框架与数据集集合(2021),是模仿学习”数据为中心”路线的早期基础设施工作之一。
- 论文自述局限:(1) 本文用来利用演示数据的方法”非常简单”——只是控制训练回合的起始状态分布,作者明确指出”更精细的算法应能更好地利用这些演示数据”;(2) Table 1 的结果方差很高,因为每种设置下总有一部分随机种子的策略完全学不会任务;(3) 两个任务的训练时长不同(24h vs 48h),使得”演示数量”与”探索时间”两个变量存在混淆,作者推测装配任务给了更长训练时间可能部分抵消了演示数量差异带来的优势;(4) 手机的姿态跟踪比 VR 控制器噪声更大、精度更低,用户需要经过若干次演示适应这种噪声;(5) 全文仅在仿真环境验证,未涉及真实机器人(真实机器人验证是次年 IROS 2019 后续论文的工作)。
原始链接
- arXiv: https://arxiv.org/abs/1811.02790
- PDF: https://arxiv.org/pdf/1811.02790
- 项目主页: https://roboturk.stanford.edu/
- 试点数据集下载页: https://roboturk.stanford.edu/dataset_sim.html
- 试点数据集下载(zip): http://cvgl.stanford.edu/projects/roboturk/RoboTurkPilot.zip
一手源存档(sources/)
- roboturk—project-page(项目主页快照,含系统特性、数据集家族与后续论文列表)
- roboturk—dataset-page(试点仿真数据集下载页快照,含数据集目录结构与 hdf5 字段说明)
- arXiv 原文 PDF(1811.02790,不入 git)