一句话定位
UC Berkeley 用一台成本约 4000 美元、任何实验室都能买到的 WidowX 250 机械臂,采集了 6 万条覆盖 24 个环境、13 类技能、100+ 物体的操作轨迹,并首次用 6 种假设各异的离线学习方法(模仿学习/离线 RL、目标图像/语言条件)在同一份数据上做交叉验证,证明这份公开数据能支撑跨任务、跨环境乃至跨机构的策略泛化——是 octo、open-x-embodiment 等后续跨本体基础模型的核心数据来源之一。
背景与定位
BridgeData V2 是 bridge-data-original(2021,7.2k 轨迹 / 4 环境 / 12 技能)的扩量升级版,同一 UC Berkeley RAIL 实验室出品,作者名单也与 rt-1(Vuong)、aloha-act(Tony Zhao)、Contrastive RL(Zheng)等工作交叠,体现的是同一批人在”数据规模化”这条线上的持续投入。论文动机直接对标 CV/NLP 的”大模型+大数据”配方:机器人要复现这条曲线,数据集必须满足三点——(1) 能被其他实验室复用(而非绑死在采集现场的单一场景);(2) 支持灵活的任务指定(目标图像或自然语言);(3) 同一环境下有大量可行任务,逼迫策略依赖任务指定而非从初始观测猜任务。
Table 1 系统对比了 MIME、RoboTurk、RoboNet、MT-Opt、原始 BridgeData、BC-Z、rt-1、RH20T、RoboSet 等数据集在轨迹数/技能数/环境数/语言标注/数据公开/机器人公开维度上的差异:BridgeData V2 是当时唯一公开数据 + 公开机器人 + 语言标注三者兼备、且轨迹数(60.1k)、技能数(13)、环境数(24)都排在前列的数据集(RoboNet 轨迹数更高但无语言标注、单臂固定场景;RT-1 用专有 Everyday Robots 机械臂不公开)。这也是本条目归入 data 类的原因:论文本体贡献是数据集本身及其多方法验证,而非某个特定模型架构。
模型架构
本文不提出新的策略架构,而是用数据集去验证 6 种代表性策略架构的兼容性(Sec 4),覆盖目标条件与语言条件两条线:
目标条件(goal-image conditioning):
- GCBC(基线):ResNet-34 编码”观测+目标”(channel-wise 堆叠),过 3 层 256 单元全连接层输出动作。
- D-GCBC(扩散策略):同样的 ResNet-34 编码,但用 DDPM 目标训练一个扩散过程建模动作分布(沿用 IDQL 的 BC-diffusion 策略,但不学价值函数)。
- ACT(action chunking with transformers):把 aloha-act 的 ACT 改造成目标条件版本,用 ResNet-18 编码”观测+目标”;因为 BridgeData V2 控制频率仅 5Hz(ACT 原论文 50Hz)、轨迹长度约 50–100 步(原论文 1000 步),chunk size 从 100 砍到 5。
- CRL(Contrastive RL):目标条件离线 RL,把观测和目标各自过 ResNet-34 + MLP 得到表征,用对比学习式的 log-linear 表示参数化目标条件价值函数(TD 风格目标),策略与价值函数共享 ResNet 编码器。
语言条件:
- LCBC(基线):MUSE 句嵌入编码指令,ResNet-34 + FiLM 条件化编码图像,输出动作。
- RT-1:沿用 rt-1 原架构(EfficientNet 图像 tokenizer + 语言编码 + decoder-only Transformer,离散动作 token,词表 256),仅把序列长度从原论文的 6 扩到 15 以适配更长的 episode。
统一观测/动作空间:除 RT-1 用 320×256 图像外,其余 5 种方法均用 128×128 RGB(仅用固定的过肩相机视角);动作空间统一为 7 维——6 维连续 Cartesian 末端执行器相对位姿变化 + 1 维离散夹爪开合。
数据
- 总量 60,096 条轨迹:50,365 条人类遥操作演示 + 9,731 条重度随机化脚本策略 rollout(84% 人类 / 16% 脚本,Table 1)。
- 本体与硬件:WidowX 250 6-DOF 机械臂,整套系统(含相机)成本约 4,000 美元,全部零件公开可购、交货周期 <2 周。传感:1 个固定过肩 RGBD 相机(Intel RealSense D435)+ 2 个位姿随机化的 RGB 相机(Logitech C920,每 50 条轨迹随机化一次)+ 1 个手腕 RGB 相机(树莓派相机模块,自制 3D 打印支架)。图像分辨率 640×480,控制频率 5 Hz,平均轨迹长度 38 个时间步。用 Meta Quest 2 VR 头显遥操作采集。
- 场景与技能:24 个环境(7 个不同的玩具厨房为主,另含各类桌面、独立玩具水槽、玩具洗衣机等)、13 类技能(拾放/推动/擦拭/扫扫/堆叠/叠布/开关抽屉/开关柜门/开关纸箱翻盖/拧旋钮/拨开关/拉拉链/扳杠杆,完整清单见 Table 5)、100+ 物体。采集时不要求每条轨迹间重置物体或机械臂位置,也不要求现场标注任务名。
- 脚本自动化数据:为加速拾放这一基础技能的数据量,作者用一个重度随机化的脚本策略自主运行采集(该策略失败频繁,但可无监督地跑出大量对象拾放数据),供离线 RL 等能从次优数据获益的方法使用;用户训练时可自由排除这部分自动化数据。
- 语言标注:数据采集时不打任务标签,事后通过众包平台补标——标注员为每条轨迹描述机器人执行的任务,重点标注被移动物体的最终位置(借助 Microsoft Research 协助部分标注)。
- 相机覆盖分层:因为相机是分阶段加装的,绝大多数早期数据只有固定过肩视角,随时间推移含 4 路视角(固定+2随机+手腕)的数据比例逐步增加(Fig.6)。
- 数据规模/多样性消融对照组(Appendix D,Table 6):原始 bridge-data-original + PTR 数据合并共 13k 轨迹、15 环境、11 技能,作为”小数据”基线与 BridgeData V2(60k/24/13)对比。
- 许可:CC BY 4.0,原始数据(JPEG/PNG/pkl)及预处理好的 256×256 TFDS/RLDS 版本均公开托管在 UC Berkeley 服务器。
训练方法
- 论文本身不提出新训练算法,而是把 6 种方法在同一份数据、同一动作空间上跑一遍标准训练流程:GCBC / D-GCBC / CRL / LCBC 统一用 Adam,lr=3e-4,线性 warmup 2000 步;观测增强用随机裁剪、随机缩放、颜色抖动。
- ACT:沿用原论文超参数(仅 chunk size 5→100 改为 5),单张消费级 RTX 2080Ti 训练 3 天。
- RT-1:沿用原论文超参数,仅把 Transformer 序列长度从 6 扩到 15 以适配更长 episode;动作各维缩放到 [-1,1],用词表大小 256 离散化。
- 目标采样:所有目标条件方法在训练时对每条轨迹的观测均匀采样一个”未来时间步”作为目标图像(hindsight relabeling 风格)。
- 跨机构验证协议:把训练好的策略原封不动搬到另一所机构(Lab 2)复现同样的机器人设置,在相机位置、光照、物体实例存在差异的情况下做零样本评测(未在 Lab 2 采集任何新数据、未微调)。
Infra(训练 / 推理工程)
- 训练算力:论文未披露 GPU 型号/数量/GPU-hours(未披露),仅披露 ACT 用单张 RTX 2080Ti 训练 3 天。
- 推理:机械臂闭环控制频率 5 Hz;未披露具体推理延迟数字。
- 数据采集算力:本研究由 TPU Research Cloud 支持,用于研究团队的其他计算需求(未直接对应本数据集的模型训练)。
评测 benchmark
论文用统一的 6 种方法在同一数据上做三组真机评测(均为 10 次试验取成功率均值,除 Fig.5 消融用 20 次):
已见任务(Table 2,8 项任务均值):GCBC 0.49、D-GCBC 0.49、ACT 0.41、CRL 0.42、LCBC 0.23、RT-1 0.49(RT-1 显著优于 LCBC,目标条件方法之间接近)。
未见任务(Table 3,物体/环境未见,6 项任务均值):GCBC 0.60、D-GCBC 0.55、ACT 0.28、CRL 0.52、LCBC 0.08、RT-1 0.50——语言条件方法在未见物体名称上明显更弱(因物体名未在数据中出现过)。
跨机构评测(Table 4,Lab1→Lab2,3 项任务均值):GCBC 0.30→0.13、D-GCBC 0.23→0.13、ACT 0.03→0.10、CRL 0.13→0.20、LCBC 0.13→0.03、RT-1 0.47→0.40(RT-1 跨机构衰减最小)。所有方法在零样本迁移下均取得非零成功率,验证数据集对其他实验室可复用。
规模消融(Fig.5):(a) GCBC 图像编码器从 ResNet-18→34→50 容量增大,“移动勺子”任务成功率单调提升;(b) 数据量按任务分层随机子采样,seen/unseen 任务性能均随数据量增大而提升;(c) 技能多样性消融——固定约 27–28k 轨迹规模,仅含 3 种技能(拾放/推动/擦拭)的子集 vs 全部 13 种技能的子集,在未见拾放任务上成功率从 0.30 → 0.65,证明技能多样性本身(而不仅是数据量)带来正向迁移。
与原始 BridgeData 对照(Appendix D,Table 6):原始 BridgeData V1 + PTR(13k 轨迹/15 环境/11 技能)训练的 GCBC 在两项未见任务上均值成功率仅 0.08,同样的 GCBC 换成 BridgeData V2(60k/24/13)训练后升至 0.70——量级与多样性提升带来的泛化增益直接可见。
创新点与影响
- 贡献:(1) 首个同时满足”公开数据+公开机器人+语言标注+多任务多环境”的规模化操作数据集,60k 轨迹/24 环境/13 技能/100+ 物体;(2) 首次在同一数据集上系统评测 6 种假设迥异的离线学习方法(模仿学习 vs 离线 RL、目标条件 vs 语言条件、连续动作 vs 离散 token vs 扩散/chunking),证明数据集本身的方法无关兼容性;(3) 首次做跨机构零样本评测,证明数据可支持”在别的实验室复现出可用策略”这一此前很少被验证的属性。
- 改变了什么:BridgeData V2 后来成为 octo(Octo transformer 策略的核心训练数据)和 open-x-embodiment(RT-X 跨本体大数据集的组成部分之一)的关键数据来源,是”低成本机械臂+大规模遥操作数据”这条务实路线在 VLA 时代持续被复用的代表性数据集。论文的技能多样性消融结果(技能多样性 > 单纯堆数据量)呼应并扩展了 RT-1 论文里”物体多样性提升泛化”的发现。
- 作者自陈局限:(1) 任务整体偏低精度、不涉及复杂力控,不覆盖投掷、搬运重物、低容差工业装配等更动态/更需力反馈的任务;(2) 数据完全采集自单一机构(UC Berkeley),虽验证了跨机构可用性,但更广泛的环境覆盖仍是未来工作方向;(3) 尽管选用了低成本机械臂以提高可及性,但要求其他实验室统一使用同款机械臂仍有门槛,跨机器人本体的泛化是作者点名的未来方向。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2308.12952
- arXiv PDF:https://arxiv.org/pdf/2308.12952
- 项目主页:https://rail-berkeley.github.io/bridgedata/
- 代码(Jax BC/RL 训练实现):https://github.com/rail-berkeley/bridge_data_v2
- 数据下载:https://rail.eecs.berkeley.edu/datasets/bridge_release/data/
- 预训练 checkpoint:https://rail.eecs.berkeley.edu/datasets/bridge_release/checkpoints/
一手源存档(sources/)
- bridgedata-v2—github-readme — GitHub README(训练/评测流程、checkpoint 说明、环境依赖)
- bridgedata-v2—project-page — 项目主页(数据集构成、系统硬件参数、方法评测视频索引、贡献者名单、CC BY 4.0 许可)
- arXiv 原文 PDF(2308.12952,不入 git):见上方 arXiv 链接