一句话定位

上海交大卢策吾组用力反馈遥操作(haptic 设备+踏板,非 3D 鼠标/VR 手柄/手机)采集了 11 万+ 条接触丰富的真机操作序列(配对等量人类演示视频),覆盖 147 个任务(42 个技能动词)× 7 种机器人配置,每条序列同步记录 RGB-D、双目红外、6 自由度力/力矩、(部分)指尖触觉与音频,是 2023 年前后首个同时具备”人类演示配对 + 接触丰富 + 深度 + 相机标定 + 力觉”五项属性的公开操作数据集(Table I),目标是支撑”看一段人类演示、少样本学会新技能”的通用操作模型。

背景与定位

RH20T(Robot-Human demonstration in 20TB)的动机与同年的 bridgedata-v2 高度呼应——都在回应”NLP/CV 靠大数据出现基础模型,机器人操作数据集为什么长期停留在小而简单的 push/pick-place”这一诘问,但选择了不同的正交维度:BridgeData V2 押注单臂低成本、可复现、跨机构,RH20T 押注多本体、多传感模态、接触丰富。论文 Table I 直接对比 MIME、RoboTurk、RoboNet、原始 BridgeData、BC-Z、RoboSet、BridgeData V2:这些数据集里没有一个能同时勾选”人类演示配对/接触丰富/深度感知/相机标定/力觉传感”五栏——RH20T 是唯一全勾选的。

论文认为纯视觉引导不足以解决许多真实操作(生理学观察:触觉受损的人即使视觉正常也难以完成许多精细操作),因此把力/力矩列为与视觉同等重要的核心模态,这也是”contact-rich”(切、拧、插、倒、折、拧螺丝等)being 数据集选题重心的原因。RH20T 用 ACT(Action Chunking with Transformers,Zhao et al. 2023)作为效果验证的基线策略——这是本文唯一使用的下游模型,用于回答”预训练在这份数据上是否有用”,而非提出新架构。论文明确承认受限于算力,未能在 RH20T 全量数据上训练/复现任何机器人基础模型,只做了 ACT 的小规模少样本迁移实验。RH20T 后来被 droidrdt-1bgroot-n1、Data Scaling Laws 等工作作为对比数据集或预训练数据源引用,属于 VLA/多本体基础模型崛起前夜、“用多传感器堆多样性”这条数据路线的代表性数据集之一。

模型架构

本文不提出新策略架构,唯一使用的模型是标准 ACT(Zhao et al. 2023 提出的 Transformer 动作分块模型),用于验证数据集对少样本迁移的价值:

  • 骨干:ACT 原始结构(视觉编码器 + Transformer 编码器-解码器,动作分块 chunking 预测),本文将隐藏通道数设为 512、前馈通道数设为 3200(原论文之外的具体取值,未改动整体架构)。
  • 动作表示:连续动作分块(chunking),chunk size = 20,对应控制频率 10Hz 下的 2 秒动作序列;评测时套用 ACT 原论文的时序集成(temporal ensembling),系数 k=0.01。
  • 视觉输入:训练/测试图像统一缩放到 640×360
  • 该 ACT 模型仅用单一 RGB 相机视角(Intel RealSense RGB-D,仅用 RGB)+ Flexiv 机械臂 + Dahuan-95 夹爪,未使用 RH20T 数据集本身提供的力/触觉/音频等其余模态。

数据

  • 规模110,000+ 机器人操作序列,配对等量(110,000+)人类演示视频;总计 **5000 万+**张图像,其中机器人操作序列 4000 万+ 帧,人类演示 1000 万+ 帧。每个技能平均约 750 次操作演示。
  • 任务/技能:共 147 个任务(48 个取自 RLBench、29 个取自 MetaWorld、70 个自建),归为 42 个技能(动词),涉及数百种物体;技能含大量接触丰富操作(切、拧、插、倒、折、旋转等)。
  • 机器人配置(7 种,Table II):4 种机械臂(Flexiv / UR5 / Franka / Kuka)× 4 种夹爪(Dahuan AG95 / WSG50 / Robotiq-85 / Franka 自带)× 3 类力-力矩传感器(OptoForce / ATI Axia80-M20 / Franka 自带),组合为:
    • Cfg1 = Flexiv + Dahuan AG95 + OptoForce
    • Cfg2 = Flexiv + Dahuan AG95 + ATI Axia80-M20
    • Cfg3 = UR5 + WSG50 + ATI Axia80-M20
    • Cfg4 = UR5 + Robotiq-85 + ATI Axia80-M20
    • Cfg5 = Franka(一体式臂/夹爪/力传感)
    • Cfg6 = Kuka + Robotiq-85 + ATI Axia80-M20
    • Cfg7 = Kuka + Robotiq-85 + ATI Axia80-M20 + uSkin 指尖触觉(唯一带指尖触觉的配置)
  • 传感模态与频率(Table III,Cfg1-7 通用前 9 项 + Cfg7 专属触觉):RGB 图像 1280×720×3 @10Hz;深度图 1280×720 @10Hz;双目红外图 2×1280×720 @10Hz;机器人关节角 6/7 维 @10Hz;关节力矩 6/7 维 @10Hz;夹爪末端笛卡尔位姿 6/7 维 @100Hz;夹爪开合宽度 1 维 @10Hz;6 自由度力/力矩 6 维 @100Hz;音频 @30Hz;指尖触觉(仅 Cfg7)2×16×3 @200Hz
  • 采集平台:每套平台含 1 台带力-力矩传感器的机械臂、1 把夹爪、1-2 个手内相机、8-10 个全局 RGBD 相机、2 个麦克风、1 个力反馈触觉设备、1 个踏板、1 台采集工作站;所有相机预先做外参标定。人类演示在同一平台采集,额外加一个第一人称相机。
  • 环境/状态多样性:频繁更换 50+ 种不同材质/纹理桌布,加入干扰物;数十名志愿者参与采集;每个技能要求志愿者变换物体实例/位置等条件重复采集 10 次;另含人为干预(对抗式与协作式)场景。
  • 质量控制:志愿者需标注操作结束时间,并对每次操作打 0-9 分(0=机器人进入急停/碰撞异常,1=任务失败,2-9=完成质量,越高越好);数据集内成功:失败样本比约 10:1。所有相机-机器人坐标系统一对齐,力-力矩传感器逐一去皮标定,人工逐场景验证相机标定质量。
  • 数据层级/组合性:数据按任务内相似度组织成树状层级(相机视角/场景/志愿者/环境等分支),任意两个共同祖先节点下的叶子(人类演示×机器人操作)均可配对,单个任务可构成”数百万”级 <人类演示, 机器人操作> 训练对;此外包含由多个短任务拼接而成的长序列(如”抓插头→插入插座→开关开关→开灯”),可用于研究短任务掌握是否迁移到长序列任务。
  • 发布形式:原始全分辨率约 40TB;官方额外提供 640×360 精简版(RGB ~5TB / RGBD ~10TB,深度因压缩有精度损失)与 320×180 版本(RGB 视频压缩、深度无损压缩),按 7 个 Cfg 分别打包,经 Google Drive/百度网盘分发;配套开源解析与可视化 API(rh20t_api,含场景加载器、在线力/位姿投影预处理器、Open3D 可视化脚本)。
  • 许可:分为 RH20T-C(scene_0001–0005,CC BY-SA 4.0,可商用)与 RH20T-NC(scene_0006–0010,CC BY-NC-SA 4.0,仅限非商业用途,含用其训练的模型)。

训练方法

数据集论文本身不训练基础模型,仅设计了一组验证性少样本迁移实验来证明数据集的实用价值:

  • 任务:新环境(新相机位姿、新桌布)下”抓取一个方块并放置在秤上”。在新环境用遥操作采集 75 条演示;同时从 RH20T 数据集里为迁移预训练挑选样本:335 条同任务操作 + 195 条来自 3 个相似任务(拾取方块;拾取并放到指定位置;从左移到右)的操作,这些样本的相机视角、桌布、物体、机器人本体均与新环境不同。
  • 流程:先在 RH20T 挑选出的子集上预训练 ACT,再在新环境采集的目标任务数据上微调;对照组为不做预训练、直接在目标数据上从头训练。
  • 超参数:预训练阶段学习率 2×10⁻⁵,训练 10 epoch;微调阶段学习率 1×10⁻⁵,训练至多 750 epoch(低于 ACT 原论文设置,但通过纳入全部有效子轨迹提高了每 epoch 的样本密度以补偿);chunk size 20(10Hz 下 2 秒);图像缩放到 640×360;评测应用时序集成,系数 k=0.01;单次评测时间上限 60 秒。
  • 评测协议:真机重复 20 次(同环境评测,Table IV)或 10 次(换物体/桌布的跨环境泛化评测,Table V),将任务拆成到达(Reach)/抓取(Pick)/放置(Place)三阶段分别统计成功率。

Infra(训练 / 推理工程)

  • 训练算力:论文未披露 ACT 基线实验所用的 GPU 型号/数量/GPU-hours(未披露);仅说明数据采集端使用”数据采集工作站”驱动多相机/传感器同步采集,型号未披露。
  • 数据采集频率:RGB/深度/双目红外/关节角/关节力矩/夹爪宽度均为 10Hz,末端位姿与 6DoF 力/力矩为 100Hz,音频 30Hz,Cfg7 指尖触觉 200Hz(Table III)。
  • 推理/控制:ACT 基线实验的控制回路频率对应数据采集频率 10Hz(chunk size 20 = 2 秒动作块);未披露单步推理延迟数字。
  • 规模自陈限制:作者明确指出数据采集成本高昂,且”由于算力所限,尝试复现近期机器人基础模型但未成功”,因此选择先开源数据集而非自行训练大模型(V. Discussion and Conclusion)。

评测 benchmark

论文里唯一的定量实验是 ACT 少样本迁移消融(无外部基线对比,只对比”是否用 RH20T 预训练”):

同环境评测(Table IV,20 次试验,成功率 % Reach/Pick/Place)——75 条目标演示:不预训练 500ep 35/10/0;同任务预训练 500ep 70/15/15;同任务+多任务预训练 500ep 65/20/15;不预训练 750ep 55/5/0;同任务预训练 750ep 80/20/15;同任务+多任务预训练 750ep 80/25/25(全场景最佳)。降到 40 条目标演示(750ep):不预训练 45/10/0;同任务预训练 65/25/5;同任务+多任务预训练 70/25/15。降到 10 条目标演示(750ep):不预训练 15/0/0;同任务预训练 30/15/5;同任务+多任务预训练 50/10/5——对比 75 条演示、不预训练、500epoch 的基线(35/10/0),10 条演示+多任务预训练在三项上均持平或更优;对比 75 条演示、不预训练、750epoch 的基线(55/5/0),Reach 略低(50 vs 55)但 Pick/Place 更高(10/5 vs 5/0)。

跨环境泛化评测(Table V,10 次试验,均用 75 条演示训练 750 epoch,对比”多任务预训练 vs 不预训练”):换金属秤——不预训练 20/0/0,预训练 80/30/10;换粉色秤——不预训练 40/10/0,预训练 70/20/10;换白色桌布——不预训练 20/0/0,预训练 50/0/0;换蓝色桌布——不预训练 30/0/0,预训练 80/20/10。四组场景下预训练模型的 Reach 成功率全部大幅超过不预训练对照,验证了 RH20T 数据(即便本体/相机/背景都不同)能提升模型对新物体、新场景的泛化能力。

论文未与任何其他数据集预训练的效果做横向对比,也未报告除 ACT 外的其他策略在 RH20T 上的表现(Table I 中的数据集规模对比是描述性的,非性能基准)。

创新点与影响

  • 贡献:(1) 截至发表时规模最大、模态最全的公开真机操作数据集——110k+ 操作序列、147 任务/42 技能、7 种机器人配置、5000 万+ 帧,首次把人类演示配对、接触丰富、深度、相机标定、力觉五项属性同时做到齐全(Table I);(2) 用力反馈触觉遥操作设备(而非 3D 鼠标/VR 手柄/手机)替代传统遥操作方式,使高速接触丰富操作的数据采集更安全、更精确;(3) 提出”数据树状层级”组织方式,让每个任务下的人类演示与机器人操作可按相机视角/场景/志愿者等多重相似度自由配对,构成规模远超原始采集量的训练对;(4) 用真机 ACT 少样本实验实证——即便预训练数据的本体/视角/背景都与目标环境不同,在其上预训练仍显著提升少样本(10~75 条演示)微调的成功率与新场景泛化能力。
  • 改变了什么:RH20T 成为 droidrdt-1bgroot-n1 等后续跨本体基础模型论文里反复引用的对比/预训练数据集之一,是”多传感器、多本体、堆多样性”这条数据路线(区别于 bridgedata-v2 的”单一低成本本体+可复现”路线)的代表性样本;其接触丰富+力觉标注的定位也影响了后续数据集在”是否需要力/触觉模态”上的设计考量。
  • 作者自陈局限:(i) 数据采集成本高昂;(ii) 受限于算力,论文未能在 RH20T 全量数据上评估/复现任何机器人基础模型的潜力,只做了 ACT 的小规模验证;作者表示未来计划扩展至双臂协作与多指灵巧操作。

原始链接

一手源存档(sources/)

  • rh20t—project-page — 项目主页(任务构成、传感器表、采集平台说明、数据格式目录树、下载链接、许可条款)
  • rh20t—github-readmerh20t_api GitHub README(场景数据加载器接口、在线力/位姿投影预处理器、可视化工具使用说明)
  • arXiv 原文 PDF(2307.00595,不入 git):见上方 arXiv 链接