一句话定位
DROID(Distributed Robot Interaction Dataset)是 13 家研究机构、18 台同款 Franka Panda 硬件、50 名采集者在北美 / 亚洲 / 欧洲三大洲 52 栋楼里跑了 12 个月众包出来的真机遥操作数据集:76k 条成功轨迹 / 350 小时,覆盖 564 个真实场景、86 个任务动词、1417 个相机视角,是当时场景多样性比任何前作大一个数量级的「in-the-wild」机器人操作数据集,用 diffusion policy 做 50/50 co-training 就能把策略成功率与 OOD 鲁棒性显著抬高。
背景与定位
这是「用统一硬件把真机操作数据的采集从单实验室扩到跨机构、跨大洲」的范式代表作,属于视觉 / 语言领域「大而多样的数据催生泛化」这一逻辑在机器人操作上的延续。作者的核心论点:机器人操作数据不能像图文那样从网上爬,只能靠遥操作,而真机采集受硬件、人力、安全与后勤约束,导致「即使当今最通用的策略也基本训练在少数受控实验室场景」。DROID 想打破的正是场景(scene)多样性这条瓶颈。
在本 vault 内可与 open-x-embodiment(把已有真机数据集拼成统一格式的聚合项目,约 300 场景、22 本体、1.4M 轨迹——DROID 论文全程拿它当主对手)、rt-1 / rt-2(Google 大规模遥操作 + VLA 路线)、diffusion-policy(DROID 实验直接采用的策略骨干)、aloha-act(低成本双臂遥操作硬件路线)、behavior-1k / libero(仿真侧基准)对照阅读。DROID 站的位置是「真机、跨机构众包、以场景多样性取胜的操作数据集」这一支。论文明确表 I 里对标了 MIME / RoboTurk / RoboNet / MT-Opt / BridgeData(V2) / BC-Z / RT-1 / RH20T / RoboSet / DobbE / OXE——DROID 的 564 场景 / 86 动词是其中场景与动词双高的。范式关键词:in-the-wild teleoperation dataset、standardized hardware fleet、scene diversity、co-training。
模型架构
DROID 本体是「数据集 + 可复现硬件平台」,不是模型。此处分两块记录:一是采集硬件平台,二是论文用于验证数据价值的 diffusion policy 策略骨干(即本条目的 EMB policy)。
DROID 机器人平台(全 13 机构同款,共复制 18 套)
- 机械臂:Franka Emika Panda 7 DoF,选它因为社区广泛采用、可靠、相对便宜、多数机构已有。
- 夹爪:Robotiq 2F-85(连续控制)。
- 相机:3 路同步立体相机——2 个外部 Zed 2(可调三脚架、桌面安装,便于快速适配新场景布局)+ 1 个腕部 Zed Mini;原始录制分辨率 1280×720,含深度信息。
- 控制器:Polymetis(Facebook fairo),动作以关节空间与末端执行器空间双记录,控制频率 15 Hz。
- 遥操作:Meta / Oculus Quest 2 头显手柄,6D 控制臂位姿 + 连续控制夹爪。
- 计算:Franka control box + 跑 Polymetis server 的 NUC + 跑采集 GUI 的 Alienware 笔记本;整套挂在带轮、可升降的便携站立桌上,单根电源线供电,方便换场景 / 换楼。
策略骨干(diffusion policy,用于「数据是否有用」实验)
- 实现基座:Robomimic 代码库上的 diffusion policy(diffusion-policy Chi et al. 2023)。作者强调「本工作贡献是数据集不是新算法」,故直接用 SOTA 现成实现。
- 输入:两路外部相机 RGB(下采样到 128×128,做 color jitter + random crop 到 116×116 数据增强)→ ImageNet 预训练 ResNet-50 视觉编码器;拼接冻结的 DistilBERT 语言嵌入 + 机器人本体感(夹爪 3D 笛卡尔位置 + 夹爪开合状态)。
- 头部:拼接特征过 Observation Processing MLP [1024, 512, 512] → U-Net diffusion head [256, 512, 1024] 生成动作序列;用 DDIM 去噪加速。
- 动作:绝对末端执行器平移 + 旋转 + 夹爪;action chunking——观测 horizon 2,预测 16 步,开环执行前 8 步后再推理。
- 关键超参:Batch 128、Adam、lr 1e-4(linear scheduler)、train steps 25000(Cook Lentils OOD 用 50000)、EMA power 0.75。
数据
规模(DROID 主口径,全部来自论文正文与项目页)
- 76k 条成功遥操作轨迹 / 350 小时交互数据。
- 另有约 16k 条被标为「不成功」的轨迹:随数据集一并释放,但不计入 DROID 规模。
- 564 个唯一场景、86 个任务(去重动词计)、52 栋楼、1417 个相机视角。
- 采集主体:50 名采集者、13 家机构、18 台机器人,横跨北美 / 亚洲 / 欧洲,历时 12 个月。
多样性五轴(论文 §IV 的分析口径)
- 任务多样性:用 spaCy 语义解析从语言指令抽动词 + 宾语,再用 GPT-4 去重(去同义 / 拼写错),对数刻度看长尾——DROID 动词长尾只有 BridgeData V2 可比,但 V2 场景受限。
- 物体多样性:同一语义解析管线统计交互物体,覆盖大量日常物件多个类别。
- 场景多样性:定义 10 种场景类型(工业办公 / 工业厨房 / 家庭厨房 / 卧室 / 浴室 / 客厅 / 走廊等),用 GPT-4V 自动分类。564 场景比任何前作大一个数量级。
- 视角多样性:采集时频繁移动外部相机,共 1417 个唯一视角,且都带内外参标定。
- 交互位置多样性:以「每条轨迹夹爪首次闭合的 3D 位置」为代理,DROID 覆盖机器人工作空间更大范围(因机器人在场景间自由移动,而非固定桌面前)。
采集协议 / 处理
- 每次 session 先把机器人推到新场景,鼓励选「多任务、多物体、适度杂乱」的场景;先用棋盘格 + OpenCV 做外参标定,再把该场景所有可能任务录入 GUI。
- GUI 每条 episode 随机抽一个任务提示采集者,避免偏向简单 / 近处任务;并周期性提示「场景增广」——推一下移动底座、移动并重标定外部相机、改房间灯光、增删物体。
- 一个采集者在换场景前通常采到 100 条 / 约 20 分钟再换场景。
- 语言标注:后处理阶段用 tasq.ai 众包平台给每条 episode 打 1–3 条独立自然语言指令(不同标注员,保证多样性)。
- 场景去重:采集时每次移动机器人 / 相机会生成 scene ID,原始共 2080 个 scene ID,经「同机器人序列号 + 实验室名 + 楼名分组、按时间排序、剔除相邻及非相邻重复」保守去重到 564 个唯一场景。
- 每条轨迹记录:3 路立体 RGB(1280×720)、关节位置 / 速度(7D)、末端执行器位姿 / 速度(base frame, 6D)、夹爪位置 / 速度(1D);元数据含 1–3 条语言指令、两个外部相机外参标定矩阵、楼名、采集者 ID、GPT-4V 场景类型、成功标记。
- 发布 / 格式:CC-BY 4.0;以 TFDS / RLDS 格式托管在
gs://gresearch/robotics(tfds.load("droid"))。原始 SVO 数据在gs://gresearch/robotics/droid_raw/1.0.1/...。 - 后续增补(HF
KarlP/droid):2024-12 补齐全量语言标注(75k 成功 episode 的 3 条标注,覆盖 95%+);2025-04 补齐 36k episode 的高精度相机外参(cam2base_extrinsics.json~36k、cam2cam_extrinsics.json~90k、intrinsics.json~72k),并提供keep_ranges_1_0_1.json用于过滤 episode 起始处的 idle 停顿帧(非 idle 连续段 ≥16 帧 / 1 秒才保留)。
下游 co-training 用量:策略实验用 DROID 前 40K 条当时已有语言标注的成功轨迹;场景多样性消融用其中 7362 条子集。
训练方法
DROID 论文不提新算法,训练方法即「如何用 DROID 做 co-training」:
- 目标:diffusion policy 的去噪回归目标(DDPM/DDIM),语言条件、视觉 + 本体感输入、绝对末端执行器动作。
- co-training 配方:每个评测任务训练一条独立策略,训练时按 50/50 比例混合 batch——一半来自该任务的少量 in-domain 演示,一半来自完整 DROID(剔除「不成功」轨迹)。作者称「简单 50/50 混就很好用」。
- 三种 batch 构造对照:
- No Co-training:只用 in-domain 演示。
- DROID (Ours):in-domain 与 DROID 50/50。
- OXE:in-domain 与 open-x-embodiment 的 curated 子集(沿用 Octo 训练混合、移除 Language Table 后约 400K 轨迹、22 本体、~300 场景)50/50。
- 三者架构与超参完全一致,只有 batch 数据来源不同,以保证对照公平。
- 训练超参(Table II):Batch 128、Adam、lr 1e-4 linear、25000 步(Cook Lentils OOD 50000 步)、EMA 0.75、obs horizon 2 / prediction 16 / action 8、DDIM。
- Toasting 与 Close Waffle Maker 两任务合训一个多任务策略。
Infra(训练 / 推理工程)
- 算力:致谢明确用了 Google TPU Research Cloud(策略训练算力)与 TRI(从数据采集到训练算力)。具体 TPU/GPU 型号、卡数、训练 GPU/TPU-hours 均未披露。
- 并行 / 精度:未披露。
- 采集 / 推理频率:数据采集与控制频率 15 Hz;策略推理为 action chunking——每次推理产 16 步、开环执行前 8 步后再推理(等效约每 0.53 s 重规划一次 @15 Hz)。推理延迟 / 边缘硬件功耗等未披露。
- 可复现性工程:全套硬件 + 软件(Polymetis 控制栈、采集 GUI、标定流程)开源,附「已被 18 套平台验证过」的分步搭建指南(hardware-setup / software-setup / example-workflows 三档文档),单电源线 + 带轮升降桌是为跨楼搬运设计。
评测 benchmark
主实验(Fig. 6,6 任务 × 4 地点,A/B 对照,每设置每方法 10 次 rollout)
- 任务与 in-domain 演示数:Close Waffle Maker 70、Place Chips on Plate 50、Put Apple in Pot 60、Toasting 150、Clean up Desk 50、Cook Lentils 50(每任务另配 OOD 变体:加干扰物 / 换物体 / 相机偏移等)。
- 每任务两档评测:in-distribution(初始位姿加噪)与 OOD(加干扰物 / 换被操作物体)。
- 核心结论:跨全部任务平均,DROID co-training 比次优方法(OXE)在 in-distribution 上高 22% 绝对成功率、在 OOD 上高 17%;Intro 概述为「平均比 SOTA(用 OXE 的方法)高约 20%」。No Co-training 在 OOD 上尤其差,co-training 显著更稳;DROID 整体最强。
- 定性:DROID co-train 的策略动作更平滑、精准,在长程 Cook Lentils(作者自家厨房)能连续完成全 3 步,而 in-domain-only 或 OXE co-train 常在一两步后失败。
场景多样性消融(Fig. 8,控制数据量看多样性)
- DROID (7k, 20 Scenes):取演示最多的 20 个场景 → 7362 条,场景多样性低。
- DROID (7k, Diverse Scenes):从 DROID 均匀随机采 7362 条,数据量相同但场景多样。
- 结论:同样 7362 条,diverse scenes 的 OOD 表现更好;且全量 DROID co-train 在三个任务上匹配或超过子采样版——「DROID 的强项在于规模,尤其在多样性」。
数据集对比(Table I,横向定位而非策略指标):DROID 76k 轨迹 / 86 动词 / 564 场景,均带语言指令 + 相机标定 + 公开机器人;对比 OXE 1.4M 轨迹 / 217 动词 / 311 场景(聚合而非单一采集)、BridgeData V2 60.1k / 82 / 24、RH20T 13k / 33 / 7 等——DROID 在场景数上一骑绝尘。
创新点与影响
- 贡献:(1) 首次用单一标准化硬件平台把真机操作数据采集扩展到 13 机构 / 3 大洲 / 52 栋楼的「in-the-wild」规模,把场景多样性从前作的数十级别拉到 564,大一个数量级;(2) 提供带三视角立体 RGB + 深度 + 相机标定 + 语言标注的高质量、结构统一数据;(3) 全面开源数据(CC-BY 4.0)、策略训练代码、预训练 checkpoint、可复现硬件 / 软件指南;(4) 实验证明简单 50/50 co-training 即能显著提升策略性能与 OOD 鲁棒性,且多样性(而非单纯数量)是关键驱动。
- 改变了什么:DROID 成为此后跨本体 / VLA 训练混合里高频出现的真机数据源之一(如 π0、OpenVLA 等后续工作的 co-train 混合),并把「统一硬件 + 分布式众包」确立为扩大真机操作数据的可行路径;其 RLDS 释放格式与后续标定 / 过滤补丁也被社区训练管线沿用。
- 作者自述局限 / 开放问题:如何把 DROID 与已有大规模数据集最优组合、如何在无 in-domain 数据下泛化到新场景、能否用 DROID 学更好的视觉表征、何时该用全量 vs 切片,均留作开放问题;场景去重为保守估计(跨不同机器人序列号的同场景可能被重复计数);原始释放的相机标定较噪(后由 HF 补丁改善)。
原始链接
- 论文 arXiv:https://arxiv.org/abs/2403.12945 (PDF:https://arxiv.org/pdf/2403.12945 )
- 项目主页 / 数据可视化 / Colab:https://droid-dataset.github.io/
- 硬件 + 采集代码:https://github.com/droid-dataset/droid
- 策略训练代码:https://github.com/droid-dataset/droid_policy_learning
- 后续标注 / 标定补丁(HF):https://huggingface.co/KarlP/droid
- 数据托管:
gs://gresearch/robotics(TFDSdroid)
一手源存档(sources/)
- droid—project-page — 项目主页快照(摘要、更新日志、硬件与实验概述、BibTeX)
- droid—github-readme — 硬件平台仓库 README
- droid—hf-annotations-card — HF
KarlP/droid补充标注 / 标定 / 过滤说明 - arXiv 2403.12945 全文(HTML/PDF):见上方 arXiv 链接(arXiv 原文,不入 git)