一句话定位

BridgeData(原版)用一台 US$2900 的 WidowX250 6-DoF 机械臂,在 10 个”玩具厨房/水槽”环境里遥操作采集了 7,200 条演示、覆盖 71 个语义任务,并用它验证一个假设:只要新任务与新环境跟这份共享先验数据在结构上相近,联合训练(而非单任务从零训练)就能把策略的成功率提升约 2 倍——从而把机器人学习里”每个新任务都要重新收数据”的惯例,往”像 ImageNet 一样复用一份共享数据”的方向推了一步。

背景与定位

论文由 UC Berkeley(Frederik Ebert*、Yanlai Yang*、Sergey Levine)、Stanford(Chelsea Finn)、UPenn(Karl Schmeckpeper、Bernadette Bucher、Georgios Georgakis、Kostas Daniilidis)联合完成。它提出的”bridge dataset”范式,核心动机来自计算机视觉/NLP 里 ImageNet、BERT 式共享预训练数据带来的跨任务泛化收益——而机器人学习长期缺少这样的”共享数据基础设施”:数据集通常绑定特定机器人平台,由采集者自用,难以被其他实验室复用。

最相关的前作是同一实验室的 robonet(7 种机器人跨域数据,但只有随机推抓动作、无语义任务标签,不适合模仿学习),以及单域多任务数据集 DAML、MIME、roboturk、Young et al. 的 Visual Imitation Made Easy(后者跨域最多但只有 2 个抓取任务)。BridgeData 与它们的关键区别是同时具备”多任务 + 多域”:71 个语义任务 × 10 个环境,且专门设计了三种迁移场景来检验”跨域先验数据能否帮到全新任务”这一假设(论文称之为 bridge data hypothesis)。这是”数据即基础设施”范式在机器人操作里的早期代表作,后续由同一团队扩展为规模更大的 bridgedata-v2,并进一步汇入 open-x-embodiment 等跨机构联合数据集。

模型架构

本文的贡献是数据集本身,策略架构只是用来验证假设的最小工具(proof-of-concept),并非论文创新点:

  • 策略骨干:task-conditioned behavioral cloning (BC)。图像先过一个 34 层 ResNet,输出的特征图经 spatial softmax 提取空间特征点位置;再与一个 one-hot task-id 向量拼接,送入 3 层全连接网络回归动作。
  • task-id 条件化的原因:部分任务仅凭单帧图像无法唯一确定(例如同一场景下多种可能的操作意图),one-hot task-id 用于消歧。
  • 训练目标:给定任务 id、图像观测,用标准 L2 误差回归真实动作(连续动作,非离散 token/扩散/flow)。
  • 动作空间:连续末端执行器动作(论文未给出具体维度分解,如 6-DoF 位姿 + 夹爪,属常规 IK 遥操作设置的镜像)。
  • 论文明确指出该数据也可用于 offline RL、基于模型的规划等其他算法,BC 只是本文用于实证假设的选择。

数据

  • 规模7,200 条演示,覆盖 71 个不同任务,采集自 10 个环境(4 个玩具厨房 Toy Kitchen 1-4、5 个玩具水槽 Toy Sink 1-5、1 个真实厨房 Real Kitchen 1)。每个任务 50–300 条演示不等。早期部分实验(toy kitchen 1-3、toy sink 1-3)用的是仅 4,700 条轨迹的中间版本,其余实验用完整 7,200 条。
  • 采集硬件WidowX250s 6-DoF 机械臂(单价 US$2,900,含全套设置总成本低于 US$3,600,不含电脑),配 Oculus Quest 2 VR 头显+手柄做遥操作——把头显放在桌上,跟踪手柄运动,经逆运动学(IK)映射到机械臂末端执行器。同时用 3–5 台相机并发采集(标准网络摄像头 + Intel RealSense 深度相机)。
  • 场地分工:除 Toy Sink 4/5 和 Toy Kitchen 3 外的环境在 UC Berkeley 采集,用 Logitech C920 网络摄像头;其余 3 个环境在 UPenn 采集,用 Intel RealSense RGB-D 相机。
  • 随机化协议:UC Berkeley 场地每 25 条轨迹随机化一次厨房位置(平移 0–20cm)与可动相机位置(平移 0–10cm、旋转 0–30°);UPenn 场地每 50 条轨迹随机化一次相机位置。所有场地的干扰物(非任务相关物体)位置至少每 5 条轨迹随机化一次。
  • 动作标注:遥操作直接产生动作标签(IK 映射的末端执行器指令),非事后标注、非视频反推。
  • sim-vs-real:纯真实机器人数据,不含仿真数据、不做 co-training。
  • 对比表(论文 Fig.2,与彼时同类数据集对照):DAML 3 任务/2.9k 轨迹/1 域;MIME 22/8.2k/1;robonet N/A 任务/162k 轨迹/7 域(但为随机动作、非语义任务);roboturk 3/2.1k/1;Visual Imitation Made Easy 2/2k/50 域;本文 71/7.2k/10 域——是当时唯一”多任务 + 多域”兼具的数据集。
  • 发布形式:全分辨率原始图像 100GB(Google Cloud bucket);mp4 子集 34GB(Berkeley 服务器);另有 128×128 降采样 numpy 格式(兼容 rl-kit)。开放社区贡献数据的流程与采购清单(WidowX250s、Oculus Quest 2、Logitech C920 及各玩具厨房/水槽的 Amazon 采购链接)。

训练方法

  • 联合训练(joint training) 是本文验证 bridge data 假设的核心手段:把用户在目标域采集的少量演示与全部 bridge 数据合并训练,而非分阶段预训练+微调——作者做了对比,发现预训练+微调效果显著不如联合训练(与既有文献一致)。
  • 数据再平衡:因 bridge 数据与目标域数据规模差异大,需要按轨迹数加权重采样:
    • Scenario 1(matching behaviors)与 Scenario 2(zero-shot transfer with target support):bridge:target 轨迹数比约 10:1,训练时重采样至 70% bridge / 30% target
    • Scenario 3(boosting new tasks):比例悬殊达约 60:1(目标域仅 50 条新任务演示),重采样至 90% bridge / 10% target;作者指出更低的 bridge 占比在仅 50 条目标演示时容易过拟合。
  • 三种迁移场景(评测协议即训练协议的一部分):
    1. Transfer with matching behaviors——目标任务同时存在于 bridge 数据和目标域数据中;
    2. Zero-shot transfer with target support——目标任务只出现在 bridge 数据里,目标域只提供其它任务的数据;
    3. Boosting generalization of new tasks——目标任务完全不在 bridge 数据里,纯新任务。
  • 无 RL 成分,纯监督模仿学习;无蒸馏、无动作离散化(token化)。

Infra(训练 / 推理工程)

  • GPU 型号/数量/GPU-hours:未披露。
  • 并行策略/精度:未披露。
  • 推理侧:作为真实机器人闭环控制运行,但论文未给出具体控制频率(Hz)、推理延迟或边缘硬件规格。
  • 训练框架、batch size、学习率等具体超参数:论文正文未给出(配套 GitHub 仓库提供可运行的 config 文件,但未在论文中列出具体数值)。

评测 benchmark

评测方式:每任务 10 次试验(trials),每次试验随机化物体位置和干扰物,每 5 次试验改变一次机器人相对环境的位置,确保测试配置均未在训练中出现,用以衡量泛化性能。

Scenario 1(transfer with matching behaviors):Toy Kitchen 2 (tk2) 目标域含 6 个任务,Toy Sink 3 (ts3) 含 10 个任务,各 50 条演示。四种对比:

  • Joint Bridge-Target Imitation:66% 平均成功率
  • Direct Transfer(只用 bridge 数据,无目标域数据):14%
  • Target Domain Only(只用目标域数据,无 bridge 数据):28%
  • Single Task(仅目标域数据训练单任务策略):18%

Scenario 2(zero-shot transfer with target support):目标任务无目标域数据,只能与 direct transfer 基线对比:

  • Joint 训练:44% 平均成功率
  • Direct Transfer(仅 bridge 数据训练):30%

Scenario 3(boosting generalization of new tasks):在 4 个环境采集 10 个全新任务(未出现在 bridge 数据中),每任务 50 条目标域演示:

  • Joint Bridge-Target:50% 平均成功率,10 个任务中 6 个有显著提升
  • Single Task(仅目标域):22%
  • 即约 2× 提升;Direct Transfer 在此场景不可行(bridge 数据完全不含该任务)。

失败案例分析(Fig.9,定性):bridge 数据带来提升的任务通常物体外观/操作动作/场景与 bridge 数据相似(如 “put pear in bowl” 因梨与 bridge 中的蔬菜视觉相近而获益);不带来提升的任务通常涉及 bridge 数据中罕见的物体外观(如”flip orange pot upright”中的橙色锅、“open box flaps”中的纸箱推动动作)或场景(如颜色差异大的工具箱背景)。

创新点与影响

  • 首次系统验证”跨域共享数据可提升全新任务泛化”:不仅验证了同任务跨域迁移(Scenario 1,属传统域适应范畴),更首次演示了 Scenario 2(零样本”导入”bridge 数据里的任务到新域)与 Scenario 3(用不相关的先验数据提升全新任务),据作者称是同类工作中首次展示后两种迁移场景。
  • 提出”bridge dataset”设计原则:(i) 场景多样性;(ii) bridge 域与目标域需有共享结构(如都是厨房场景,不能拿厨房数据帮建筑机器人);(iii) 任务范围要足够广以打破”任务-域”间的虚假相关。
  • 低成本、可复现的硬件方案:US$2900 WidowX250s + Oculus Quest 2 遥操作,总成本 <US$3600,并公开采购链接,降低了其他实验室复现/贡献数据的门槛。
  • 开源数据 + 众包扩展机制:公开原始图像(100GB)/mp4(34GB)/numpy 降采样版本,并开放社区贡献数据的采集协议,是”社区共建共享机器人数据集”早期的具体实践。
  • 作者自陈局限:(1) 评测环境有限,仅在 UC Berkeley 的 5 个不同环境中验证,覆盖面不够广;(2) 迁移效果高度依赖 bridge 域与目标域的结构/视觉相似性,对差异很大的场景(如工具箱、纸箱)效果有限,论文未给出何时迁移会成功的正式理论,留作未来方向;(3) 仅验证了模仿学习这一种算法范式,未实测 offline RL/基于模型规划等其他可能用法。
  • 后续该团队将数据集规模显著扩大,发布为 bridgedata-v2,并成为 open-x-embodiment 等大规模跨机构机器人数据联合体的组成部分之一。

原始链接

一手源存档(sources/)