一句话定位

RoboNet 把 4 家机构、7 种机器人平台自主随机采集的约 16.2 万条轨迹(近 1500 万帧)汇入同一个开放数据库,用统一的末端执行器动作空间抹平机器人间差异,是最早系统研究”跨机器人本体(cross-embodiment)预训练能否带来正迁移”的大规模数据集工作。

背景与定位

论文发表于 CoRL 2019(第 3 届机器人学习大会,大阪,日本),v1 挂 arXiv 于 2019-10,v2 于 2020-01 更新。作者跨 4 校:UC Berkeley(Sudeep Dasari, Frederik Ebert, Stephen Tian, Sergey Levine)、Stanford(Suraj Nair, Chelsea Finn)、University of Pennsylvania(Bernadette Bucher, Karl Schmeckpeper, Siddharth Singh)、CMU(Sudeep Dasari)。

它要解决的痛点是机器人学习里长期存在的”数据孤岛”:绝大多数机器人学习实验是小规模、单域、单机器人的,每换一个场景/机器人几乎要从零重新采数据、重新学习关于世界的基本常识(物体几何、刚体物理等)。论文受 ImageNet 启发——认为数据集的价值不在标注质量而在多样性——提出把多家实验室、多种机器人本体的自监督交互数据汇聚成一个共享池,而非各自为战地收集单机数据或投入人力搭建仿真环境。

方法上建立在两条既有技术线之上:(1) visual foresight([9, 7],即 Finn & Levine 一脉的动作条件视频预测 + 基于模型的规划);(2) 来自 learning-latent-plans-from-play 一类工作的监督逆模型(inverse model)。RoboNet 本身不提出新算法,而是提出”如何让同一批模型在跨机器人、跨视角、跨场景的数据上共享学习”这一问题,并用这两种既有算法做验证。它与同期的 Meta-World、RLBench 等仿真基准并列于 2019 年前后的机器人学习基础设施浪潮,但唯一聚焦真实机器人、跨本体(cross-embodiment)真实数据这条路线,是后续 Open X-Embodiment / RT-X 等跨具身预训练数据集思路的早期先声。范式上属于数据集 + 迁移学习实验(data-driven robot learning),不是端到端策略模型论文。

模型架构

RoboNet 本身不是模型,是数据集;论文用两类既有算法在其上做迁移实验,二者共享同一数据格式与动作空间:

  • 动作空间(跨机器人统一):所有轨迹共享同一套动作语义——末端执行器(end-effector)位置与旋转的增量(delta),外加 1 维夹爪关节;参考系是机器人根连杆(root link),无需相机-机器人外参标定,模型需从历史上下文帧中隐式推断相机与机器人参考系的相对位置。多数机器人(除 Google Robot 外)状态是 R⁵ 向量:末端 XYZ 位置 + 偏航角(yaw,其余姿态锁定,夹爪朝下)+ 夹爪关节角。动作按当前状态与下一步指令状态的差值给出,夹爪动作二值化为”开/合”。
  • Visual foresight 路线:核心是动作条件视频预测模型——[51] SAVP 视频预测架构的确定性变体,重度基于 [5](Finn/Goodfellow/Levine 2016 的 unsupervised video prediction)。用卷积 LSTM 堆叠 + 卷积层 + 跳跃连接的循环网络,输入历史图像 I₀:T 与动作 a₀:T,输出光流场 F̂ 并据此变换(bilinear-sampling)预测未来帧 Î_{t+1:t+h};论文实验统一用 2 帧上下文。规划侧用用户指定像素目标(designated pixels)+ MPPI(model-predictive path integral)采样优化动作序列:采样数 N=600,预测视界 15 步,3 次 MPPI 迭代,并对动作加低通滤波做时序平滑;执行时按 MPC 方式滚动重规划。
  • Inverse model 路线:简化版 [11](Learning Latent Plans from Play)逆模型,给定 2 帧上下文(图像+动作对)、当前帧、目标帧,训练一步(T=1)监督回归当前动作,可闭环重复执行做视觉伺服式到达(reaching)。
  • 跨具身(cross-embodiment)处理:论文不对不同机器人做架构区分,靠统一动作空间 + 池化训练数据本身来实现跨本体共享;实验里既有全池训练,也有留一法(held-out 某机器人)预训练 + 小样本微调。
  • 规模:控制实验用的视频预测模型参数量在 5M–75M;另有专门做”容量是否是瓶颈”消融的两个大模型:200M500M 参数(简化版 [53] 架构的确定性版本,只在 Sawyer 数据子集上训练)。

数据

  • 总规模:约 162,000 条轨迹,对应约 1500 万帧视频(外加同步动作序列),来自 113 个独立相机视角7 种机器人平台4 家机构
  • 平台与轨迹数拆分(论文 Table 1):Sawyer 68k、Baxter 18k、WidowX 5k、Franka 7.9k、Kuka 1.8k、Fetch 5k(引自 [Yu et al. 2019] 已有公开数据)、Google Robot 56k(引自 Finn/Goodfellow/Levine 2016 已有公开数据)。其中前 5 种(Sawyer/Baxter/WidowX/Franka/Kuka)合计约 100.7k 条为本文作者自采(论文正文称约 104.4k),Fetch 与 Google Robot 的 5k + 56k 是复用并入的已有公开数据集。
  • 多样性属性(Table 1):夹爪类型 6 种(Weiss Robotics WSG-50、Robotiq、以及 WidowX/Baxter/Franka/Kuka 各自原生夹爪);场地类型(arena types)7 种;场地内衬(arena inserts,不同材质/颜色的桌面插件)10 种;夹爪构型(3D 打印的不同指尖)10 种;相机构型 113 种;实验室环境 4 个。
  • 采集方式:自主、自监督、最少人工干预——人工只需设定初始动作分布并周期性更换物体,其余无人值守。多数机器人用对角高斯随机动作,叠加 [52] 提出的”接近桌面时提高抓取概率”的抓取先验(grasping primitive,在末端到达高度阈值以下时闭合夹爪、抬升超过阈值且未持物时张开),以增加数据中抓取事件的比例;Google R3 采样的是随机推动而非笛卡尔随机运动,Fetch 数据仅在 x/y 两维随机探索。
  • 格式与基础设施:每条轨迹存为独立带可过滤属性的记录,用 Pandas API 访问;数据以 hdf5 存储,视频以 MP4 编码;完整下载 36GB(另提供约 100MB 的抽样子集便于快速上手)。图像张量形状约定为 (B, T, N_VIEWS, H, W, C)。
  • 纯真实(sim-vs-real):数据全部来自真实机器人交互,无仿真数据、无 sim-to-real 迁移,也没有语言标注;动作标签直接来自机器人执行的随机/半随机策略指令(自带 ground-truth 动作,无需额外标注或逆运动学重建)。

训练方法

  • 目标函数:visual foresight 端用像素级视频预测损失(预测帧与真实帧的重建误差)训练光流条件的循环预测网络;inverse model 端用监督回归损失,从(起止图像对)预测动作。
  • 两阶段范式(预训练 + 微调):核心实验设计是”在 RoboNet 上(可能留出目标机器人)预训练 → 在少量目标域轨迹(300–8000 条不等)上微调”,与”直接在目标域从零训练”做对比。
  • Visual foresight 训练超参(附录 A):预训练 160k 迭代,batch size 16,Adam 优化器;微调再跑 150k 步;学习率从 1e-3 线性退火到 0(200k 步内退完)。
  • RL/模仿:论文不使用强化学习信号或人工奖励——两条算法路线都是自监督(无奖励、无演示标签),visual foresight 靠目标像素位移做规划目标,inverse model 靠图像对做监督回归标签,都直接从随机探索数据中学。
  • 多任务/多视角实验设计:包括”90 个视角联合训练 vs 单视角训练”的零样本视角泛化对比;“留出某机器人的全部数据预训练 + 该机器人 300–8000 条微调 vs 从零训练”的跨本体少样本适配对比(Kuka/Franka/Baxter/Robotiq 夹爪四组实验)。

Infra(训练 / 推理工程)

  • 训练硬件:论文未披露 GPU 型号、数量、总 GPU-hours,也未披露并行策略与训练精度(fp16/fp32 等)——原文仅给出迭代步数与 batch size,属于未披露
  • 推理侧:控制回路是逐步图像观测 → MPPI 规划 → 执行首个动作 → 重新观测的 MPC 范式;动作执行是”阻塞式”(blocking,带超时),机器人需在每一步完全停止后才计算下一动作,无实时(real-time)约束,论文未报告控制频率(Hz)或延迟(latency)数字。
  • 数据基础设施:Pandas 元数据索引 + hdf5 存储 + MP4 视频编码,代码库提供跨机器人的采集脚本与统一存储格式;项目网站提供供第三方上传轨迹的贡献入口,人工质检后并入正式数据集(自动化质检留作未来工作)。

评测 benchmark

论文用真实机器人物体重定位任务(推/抓放到指定位置,人工用卷尺测终点距离、人工判定成功)做评测,量化数字均来自 CoRL 2019 论文正文表格:

视角泛化(Table 2,末端到目标平均距离,越小越好)

模型已见视角留出(held-out)视角
单视角训练14.8 ± 3.8 cm23.2 ± 2.6 cm
多视角训练(90 视角)9 ± 2.2 cm16.2 ± 2.9 cm

多视角模型迁移到与训练环境差异很大的新场景时,平均终点距离 14.4 ± 2 cm,与其在留出视角上的表现相当。

跨机器人少样本适配(成功率,人工判定,Table 3/4/5)

Kuka 实验成功率
从零训练 N=40010%
从零训练 N=180030%
RoboNet(去除 Kuka/R3/Fetch)预训练 + 微调 N=40040%
Franka 实验成功率
从零训练 N=40020%
从零训练 N=800035%
RoboNet(去除 Franka/R3/Fetch)预训练 + 微调 N=40040%
Baxter 实验成功率
从零训练 N=30033%
仅 Sawyer 子集预训练 + 微调 N=30083%
全 RoboNet(去除 Baxter)预训练 + 微调 N=30058%

关键结论:Kuka/Franka 上,仅用 400 条目标域数据微调的 RoboNet 预训练模型,超过了用 4–20 倍数据(1800/8000 条)从零训练的同类模型;但 Baxter 实验里,只用视觉相似的 Sawyer 子集预训练(83%)反而好于用全部 RoboNet 预训练(58%),论文将其归因于模型欠拟合(under-fitting)——训练/验证误差始终接近且早早平台,200M 参数模型逐像素 L1 误差 0.104 ± 0.057,500M 参数模型降到 0.0847 ± 0.045,但仍未达到高保真水平,说明当时 5M–75M 参数的控制模型明显容量不足。

未见夹爪泛化(附录 E,Robotiq 夹爪装到 Sawyer 上,Table 7,平均距离 cm)

设置平均距离
零样本(RoboNet 预训练,不微调)15.5 ± 2.6
仅用新数据从零训练17 ± 1.8
Sawyer 子集预训练 + 微调9.8 ± 2.1
全 RoboNet 预训练 + 微调14.7 ± 2.1

逆模型多机器人到达任务(Table 6,人工判定成功次数/5 次)

任务成功率
Sawyer 到达 · 训练视角4/5
Sawyer 到达 · 未见视角5/5
Franka 到达 · 训练视角4/5

论文未与其他跨机器人数据集/方法做直接基准对比(因为当时几乎不存在同类可比基线),比较主要是自身的”预训练 vs 从零训练”消融。

创新点与影响

  • 贡献:(1) 首次把 4 家机构、7 种真实机器人的自主交互数据以统一动作空间与统一存储格式汇聚成一个开放、可扩展、允许第三方持续贡献的数据库;(2) 用两条既有算法(visual foresight、逆模型)系统验证了”跨机器人预训练 + 小样本微调”相对”目标域从零训练”的数据效率优势,且证明用远少于(4–20 倍更少)目标域数据即可超越专用训练。
  • 改变了什么:RoboNet 是较早明确提出”池化多机构、多机器人真实交互数据做预训练”这一范式并给出真实机器人上量化证据的工作,是后续 Open X-Embodiment / RT-X、DROID 等大规模跨具身数据集与”机器人基础模型”路线的早期先声;它把机器人学习的数据观从”单机构单机器人自采”推向”跨机构、跨本体共享数据池”。
  • 作者自陈局限:(1) 任务集合相对简单(推、抓放),保真度低,尚不足以直接实用;(2) 数据全部来自预设随机策略采集,限制了交互的复杂度与细腻程度,未来计划纳入演示数据、现代探索方法(好奇心/RND/disagreement)与任务驱动的 RL 数据;(3) 当时的视频预测模型(≤500M 参数)在全量 RoboNet 上明显欠拟合,导致”用最相似的数据子集预训练”有时反而优于用全部多样数据预训练——论文指出这提示了两条后续方向:自动选择训练子集,或者研发能真正吃下更大更多样数据的模型架构。

原始链接

一手源存档(sources/)

  • robonet—project-page — robonet.wiki 官方项目页(摘要、“By the Numbers”、贡献入口)
  • robonet—github-readme — SudeepDasari/RoboNet README(引用信息、CC BY 4.0 许可)
  • robonet—github-wiki-getting-started — GitHub wiki 下载/使用教程(36GB 全量、hdf5 格式、Pandas 过滤 API、训练脚本用法)
  • arXiv 1910.11215v2 全文 PDF(arXiv 原文 PDF,不入 git;见上方 arXiv 链接)