一句话定位
Open X-Embodiment(OXE)把 34 个实验室、21 家机构的 60 个现成机器人数据集汇成一份统一 RLDS 格式的语料——1M+ 真机轨迹、22 种本体、527 项技能、160266 个任务——并用它训出 RT-1-X / RT-2-X 证明「不做任何跨本体对齐、只把数据池化一起训」就能产生正向跨本体迁移(小数据域成功率平均比各实验室自研 SOTA 高 50%,RT-2-X 涌现技能提升约 3×)。它是此后几乎所有通用机器人策略(Octo、OpenVLA 等)赖以预训练与评测的数据与评测底座。
背景与定位
论文攻击的是机器人学习的结构性困境:视觉/NLP 靠 web 级大数据养出了可复用的通用预训练骨干,而机器人「一任务一机器人一环境各训一个模型」,即便最大的采集努力,数据量也只是视觉(5–18M)、NLP(1.5B–4.5B)基准的一个零头,且在环境/物体/任务某个轴上总是很窄。作者的立场:训练可泛化机器人策略需要 X-embodiment(多本体)训练——单个数据集太窄,但众多数据集的并集能覆盖环境与机器人的变化。
与既往跨本体迁移工作(多数在仿真里、或引入「共享动作表示 / 表征学习目标 / 本体条件化 / 解耦机器人-环境表征」等专门机制去弥合 embodiment gap)不同,OXE 的核心主张是:直接在多本体数据上训一个策略、不加任何弥合 gap 的机制,就能观察到正向迁移。它继承的是 rt-1(RT-1,机器人 Transformer)与 RT-2(VLA,arXiv 2307.15818)的具体配方,并把二者放到跨本体设定下检验;在「通用智能体」谱系上与 gato-a-generalist-agent(Gato)、RoboCat 同代,但 OXE 的贡献不在架构创新,而在把大量既有数据集处理、聚合成单一标准化仓库并证明其价值——定位类比「机器人界的 ImageNet」。范式名:cross-embodiment robot learning / 通用机器人策略预训练底座。论文为 Open X-Embodiment Collaboration 集体署名(ICRA 2024,最佳会议论文),一作 Abby O’Neill 等,通讯来自 Google DeepMind。
模型架构
OXE 本体是数据集 + 评测,配套两个策略模型(RT-X)用来验证数据价值。二者都吃「视觉输入 + 自然语言指令」,吐离散化的 tokenized action。
动作/观测的粗对齐(data format consolidation):观测/动作空间在各机器人间差异极大,OXE 只做粗对齐——
- 每个数据集选一路 canonical 相机视角作输入图,resize 到统一分辨率;
- 动作统一成 7 维末端执行器向量:x、y、z、roll、pitch、yaw、夹爪开合(或这些量的变化率);某些维度机器人不使用时训练中置零;
- 每个数据集的动作在离散化前各自归一化,模型输出再按本体反归一化(de-normalize)解读;
- 坐标系不跨数据集对齐,动作值允许是绝对位置/相对位置/速度,按各机器人原控制方案;因此同一个动作向量在不同机器人上会诱发完全不同的运动。
- 动作 token 化:每维均匀 256 个 bin,共 8 个维度(1 维用于终止 episode + 7 维末端运动)。
- 数据存储用 RLDS 格式(序列化 tfrecord),可容纳不同数目的 RGB/深度相机与点云,并支持主流框架的并行加载。
RT-1-X(面向机器人控制的高效 Transformer):35M 参数。输入最近 15 帧图像 + 自然语言;每帧过 ImageNet 预训练 EfficientNet,语言过 USE(Universal Sentence Encoder) 嵌入;视觉与语言经 FiLM 层交织,产生 81 个 vision-language token,送入 decoder-only Transformer 输出 tokenized action。(据 GitHub README:推理时只吃工作区相机一路 RGB,不含腕部相机/手内相机/深度。)
RT-2-X(大 VLA):把 tokenized action 直接当文本 token(如动作 "1 128 91 241 5 101 127"),于是任何预训练 VLM 都能微调成机器人策略、承接 VLM 的泛化能力。本文聚焦 RT-2-PaLI-X 变体:视觉骨干 ViT + 语言骨干 UL2,主要在 WebLI 上预训练。规模用了 55B 与 5B 两档(后者带 history=2 的消融)。
数据
规模与来源(一手口径,取论文/项目页数字):
- 1M+ 真机轨迹(episodes);
- 22 种机器人本体(单臂、双臂、四足都有);
- 由 60 个现成机器人数据集汇聚,来自全球 34 个机器人研究实验室;论文摘要另表述为「21 家机构的合作」,DeepMind 博客口径为「33 个学术实验室 / 20+ 家机构」(同一工作的不同粒度计数);
- 527 项技能、160266 个任务(博客四舍五入为「500+ 技能、150000 任务、100 万+ episode」)。
分布与筛选:Franka 是最常见本体,且视觉上不同场景数最多(Franka 相关数据集多);xArm 与 Google Robot 因个别大数据集贡献了最多轨迹。技能上绝大多数属 pick-place 家族,长尾含「擦拭 wiping」「装配 assembling」等;物体覆盖家电、食物、餐具等常见家居物。作者用 PaLM 从语言标注里抽取物体与行为来做多样性分析。所有动作标注沿用各源数据集原有的(多为遥操作示教)动作标签,OXE 只做格式统一,不重新标注。全部为真机数据(非仿真)。
实验用的 robotics data mixture(子集,非全量 22 本体):跨全部实验固定用 9 个机械臂的数据,取自 rt-1(RT-1)、QT-Opt、Bridge、Task Agnostic Robot Play、Jaco Play、Cable Routing、RoboTurk、NYU VINN、Austin VIOLA、Berkeley Autolab UR5、TOTO、Language Table 等数据集。之所以只有 9 本体(少于全量 22)——实验时数据集尚在持续扩充,上述即当时全部。RT-1-X 只在该混合上训;RT-2-X 用 co-fine-tuning、以约 1:1 混合原 VLM 数据与该 robotics 混合。
训练方法
- 目标函数:两模型都用类别交叉熵——RT-1 对离散 bucket、RT-2 对全部语言 token。
- RT-1-X:仅在 robotics data mixture(9 本体)上训练,架构与只训单数据集的 RT-1 完全相同——因此小数据域上的提升可归因于跨本体混合共训,而非架构。
- RT-2-X:co-fine-tuning,约 1:1 混合原始 VLM 数据与 robotics 数据(同 RT-2 原配方),以保住 web 知识、承接 VLM 泛化。
- 动作 token 化:每维 256 bin 均匀离散、共 8 维(含 1 维终止),见上。
- 关键消融结论(Table II):web 预训练对大模型是决定性的(从头训 emergent 掉到 0%);引入短历史显著提升泛化;55B > 5B 的容量差直接决定跨本体迁移强度;此工作里 co-fine-tune ≈ fine-tune(作者归因为 OXE 的 robotics 数据比以往更多样)。
Infra(训练 / 推理工程)
- 训练算力:GPU/TPU 型号与数量、GPU-hours、并行策略、精度——本文与博客/README 均未披露(论文明言不追求架构/算法创新,未给训练工程细节)。
- 推理:各模型按机器人所需频率运行 3–10 Hz;RT-1 本地运行,RT-2 托管在云服务、经网络查询。GitHub README 补充:RT-1-X 以 3 Hz(每 333 ms 喂一帧工作区 RGB) 推理;仅用单路工作区相机,不含腕/手内相机与深度。RT-2-X(55B)为「至今最大的模型之一」在学术实验室真机上执行未见任务(隐含较高推理成本,故走云端)。
- 边端硬件/时延具体数值:未披露。
评测 benchmark
共 3600 次评测 trial、跨 6 个不同机器人。
小数据域(Fig. 2,RT-1-X):在 Jaco Play(Kitchen Manipulation)、Cable Routing、NYU Door Opening、AUTOLab UR5、Robot Play 五个数据集上,RT-1-X 在 5 个中的 4 个上胜过各自 Original Method(数据集作者自研、只训该数据集的模型),平均提升很大。博客图注:RT-1-X 平均成功率 63%,对应 baseline 均值 41%(即约 +50% 相对提升)。
大数据域(Table I,WidowX / Google Robot):
| 评测 | 本体 | Original Method | RT-1 | RT-1-X | RT-2-X (55B) |
|---|---|---|---|---|---|
| Bridge @IRIS (Stanford) | WidowX | 13% (LCBC) | 40% | 27% | 50% |
| Bridge @RAIL (UCB) | WidowX | 13% (LCBC) | 30% | 27% | 30% |
| RT-1 paper 6 skills @Google Lab | Google Robot | — | 92% | 73% | 91% |
结论:大数据域里 RT-1-X 欠拟合(不如只训单数据集的 RT-1),说明小容量模型撑不住如此庞杂的多本体数据;而高容量 RT-2-X 同时压过 Original Method 与 RT-1——跨本体训练在数据充裕域也能提升,但前提是足够大的模型容量。
涌现技能 / 泛化消融(Table II,RT-2-X)——Emergent Skills(来自 Bridge/WidowX、Google Robot 原数据里没有的技能)与 Generalization(未见物体/背景/环境)两列:
| 行 | 模型 | Size | History | 数据 | 初始化 | Emergent | Generalization |
|---|---|---|---|---|---|---|---|
| (1) | RT-2 | 55B | none | Google Robot action | web 预训练 | 27.3% | 62% |
| (2) | RT-2-X | 55B | none | robotics 数据 | web 预训练 | 75.8% | 61% |
| (3) | RT-2-X | 55B | none | robotics 数据(去 Bridge) | web 预训练 | 42.8% | 54% |
| (4) | RT-2-X | 5B | 2 | robotics 数据 | web 预训练 | 44.4% | 52% |
| (5) | RT-2-X | 5B | none | robotics 数据 | web 预训练 | 14.5% | 30% |
| (6) | RT-2-X | 5B | 2 | robotics 数据 | 从头训 | 0% | 1% |
| (7) | RT-2-X | 5B | 2 | robotics 数据 | web 预训练(纯 fine-tune) | 48.7% | 47% |
- RT-2-X 涌现技能约为 RT-2 的 3×(75.8% vs 27.3%,行 2 vs 1)——把别的机器人(WidowX)数据混进来,让本已数据充足的 Google Robot 也学会原本没有的技能;
- 去掉 Bridge(行 3)emergent 由 75.8% 掉到 42.8%,坐实这些新技能来自 WidowX 的跨本体迁移;
- 历史(行 4 vs 5:44.4 vs 14.5)、容量 55B>5B(行 2 vs 4:75.8 vs 44.4)、web 预训练(行 4 vs 6:44.4 vs 0)均关键;泛化维度上 RT-2 与 RT-2-X 大致持平(VLM 骨干本已擅长)。
RT-2-X 还展示了介词敏感的空间理解:「move apple near cloth」与「move apple on cloth」轨迹明显不同——改动指令中的介词即可调制底层动作。
创新点与影响
- 贡献:(1) 首份大规模、跨机构、跨本体、统一 RLDS 格式的真机机器人数据集(1M+ 轨迹 / 22 本体 / 527 技能 / 160266 任务),配开源工具与 RT-1-X checkpoint;(2) 实证——无需任何弥合 embodiment gap 的专门机制,仅把异构数据池化共训,Transformer 策略即可产生显著正向跨本体迁移(RT-1-X 小数据域 +50%,RT-2-X 涌现 ~3×);(3) 明确「容量是跨本体迁移的闸门」——只有足够大的模型(RT-2-X 55B)才能在数据充裕域也吃到迁移红利。
- 改变了什么:把机器人学习从「各实验室各训各的」推向「共享数据 + 通用预训练骨干」的范式;OXE 成为此后 Octo、OpenVLA 等一大批通用策略/VLA 的预训练语料与横向评测基准,「用 OXE 预训练」几乎成了通用操作策略的默认起点。
- 作者自陈局限:未涉及传感/驱动模态差异很大的机器人;未研究对全新(未见)机器人的泛化;未给出「何时会/不会发生正向迁移」的判据——正向迁移目前仍是经验观察,缺乏理论刻画。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2310.08864
- arXiv PDF:https://arxiv.org/pdf/2310.08864
- 项目主页:https://robotics-transformer-x.github.io/
- DeepMind 博客:https://deepmind.google/discover/blog/scaling-up-learning-across-many-different-robot-types/
- GitHub(数据 + RT-1-X checkpoint):https://github.com/google-deepmind/open_x_embodiment
- 数据集清单表(60 数据集 metadata + 逐个引用):https://docs.google.com/spreadsheets/d/1rPBD77tk60AEIGZrGSODwyyzs5FgCU9Uz3h-3_t2A9g/edit
一手源存档(sources/)
- open-x-embodiment—blog — DeepMind 官方博客快照(sources/embodied/2023/open-x-embodiment—blog.md)
- open-x-embodiment—github-readme — GitHub README(数据访问 / RT-1-X checkpoint / 动作空间)快照
- open-x-embodiment—project-page — robotics-transformer-x.github.io 项目页快照
- arXiv 全文 PDF(2310.08864):见上「原始链接」,arXiv 原文 PDF,不入 git