一句话定位
ARIO(All Robots In One)不是一个模型,而是一套具身智能数据标准 + 配套数据集:用统一的 collection→series→task→episode 层级结构和基于时间戳的多模态对齐(相机 30Hz / 激光 10Hz / 本体感 200Hz / 触觉 100Hz),把真机遥操作、仿真生成、开源数据转换三路数据缝进同一格式,聚出 258 个系列、321,064 个任务、3,033,188 条 episode(约 3M),并首次在单一数据集里同时覆盖 2D 图像、3D 视觉、文本、触觉、声音五种感官模态。
背景与定位
具身数据长期卡在四个问题上:感官模态不全(没有数据集同时有图像+3D+文本+触觉+声音)、格式不统一(多机器人数据集各自为政,处理麻烦)、控制对象不兼容(导航的位姿指令和机械臂的关节角无法用同一份 schema 表达)、仿真与真实数据割裂(缺少同一机器人在 sim 与 real 中都采过的数据,无法研究 sim-to-real gap)。ARIO 论文把 open-x-embodiment(聚合 72 个数据集、超 240 万条 episode,但缺统一格式与时间戳)当作直接对照对象:OXE 解决了”数据来源多”,但没解决”格式统一”和”模态完整”;ARIO 想同时啃下这两块骨头。
在本 vault 内可与 open-x-embodiment(跨机构聚合但无统一格式的先驱)、rh20t(ARIO 转换吸收的开源数据源之一,也是本 vault 里 RH20T 的下游用例)、universal-manipulation-interface(ManiWAV 数据采集所用的 UMI 手持采集器,ARIO 转换吸收了 ManiWAV)、mobile-aloha(同属 AgileX 双臂移动平台路线,ARIO 的 Cobot Magic 硬件出自同一家 AgileX Robotics)、droid(同期另一支”统一硬件跨机构众包”真机数据集路线,DROID 走单一 Franka 硬件精采集、ARIO 走”标准先行、多源拼接”)、robomind(同为中国团队做的跨本体数据集,时间稍晚)对照阅读。ARIO 站的位置是”先定标准、再拼数据”这一支:三路并行采集(自建真机平台 + 仿真生成 + 开源数据转换),共同套进同一个 schema,而不是像 OXE 那样只做格式层面的松散聚合。论文本身不训练模型,是一篇数据标准 + 数据集论文,2024 年 3 月发起了配套的 ARIO Alliance(10 家成员单位),把这套标准当作行业协作的起点。
模型架构
本工作不含策略模型,此处记录的是”架构”层面对应的数据 schema 设计:
- 层级结构:collection(多个 series)→ series(对应特定场景+机器人类型,由多个用自然语言描述的 task 组成,如”picking an apple”)→ task → episode(单次完整执行,含所有观测与控制数据,按统一时间戳同步)。
- 元数据:每个 series 下的
information.yaml记录场景、机器人、传感器信息;每个 task 下的description.yaml记录任务指令与所需技能。 - 模态覆盖:2D 图像、3D 视觉、声音、文本、触觉共 5 种模态,为目前唯一同时覆盖全部 5 种的具身数据集(对照见下方 Table 1)。
- 时间戳对齐:按传感器/执行器各自采样率命名与记录时间戳,标准设计频率为相机 30Hz、激光 10Hz、本体感 200Hz、触觉 100Hz,用于解决”不同传感器帧率不一致、数据合并困难”的问题。
- 统一控制配置:以配置文件形式声明控制对象,支持单臂、双臂、人形、四足、轮式等多种本体形态,以及位置、姿态、速度、力矩等多种控制动作类型,二者均”灵活可配”而非固定 schema。
数据
总量(论文 Table 2,精确值):258 series / 321,064 tasks / 3,033,188 episodes,来自三路并行采集:
| 数据来源 | series | tasks | episodes |
|---|---|---|---|
| 开源数据集转换 | 161 | 319,761 | 2,326,438 |
| 自建真机平台采集 | 2 | 105 | 3,662 |
| 仿真平台生成 | 95 | 1,198 | 703,088 |
| 合计 | 258 | 321,064 | 3,033,188 |
① 开源数据集转换(Open X-Embodiment / RH20T / ManiWAV)
- Open X-Embodiment:原始聚合 72 个数据集、超 240 万条 episode;ARIO 过滤掉缺少夹爪/关节信息或文档不清的数据集后,转换了其中 62 个数据集进入 ARIO 格式,转换时尽量保留原始数据、只剔除不可用部分。
- RH20T:原数据集含超 140 个任务,由多名操作员用 7 种不同机械臂在多种条件下采集,配 8–10 台全局 RGBD 相机 + 1–2 台手部相机,部分夹爪带指尖触觉传感器;ARIO 转换出 12,719 条 episode 轨迹(因部分 episode 缺相机/关节数据或文档不足,转换时只剔除任务描述完全缺失的 episode)。
- ManiWAV:唯一含声音模态的来源,含 4 个任务(擦白板 Wiping Whiteboard、翻贝果 Flipping Bagel、倒骰子 Pouring Dice、绕线 Taping Wires with Velcro Tape),用人操作的 universal-manipulation-interface(UMI)采集,配一个随动相机 + 两个麦克风(一个录接触音、一个录环境音);ARIO 转换出 1,297 条 episode 轨迹,并补充了文本描述。
② 仿真平台生成(Habitat / MuJoCo / SeaWave)
- Habitat + HM3D 物体导航:用 Habitat-Matterport 3D(HM3D)场景数据集与 Habitat Challenge 2022 ObjectNav 任务设置,覆盖 6 个目标类别,从训练集里取 80 个场景,用官方 Habitat API 实例化最短路径贪婪跟随 agent 生成轨迹,每步记录 RGB-D 观测与 agent 状态,失败轨迹直接丢弃;OpenI 数据集页面列出该源为 664,241 条 episode(该具体数字未在论文正文中给出,来自持续更新的数据托管页面)。
- MuJoCo(UR5):基于 Ha et al. “Scaling Up and Distilling Down”(CoRL 2023)的 LLM 引导任务生成 + 分层控制框架,用 UR5 六自由度机械臂设计了拾取物体、放入篮子、开抽屉三类任务;初始化时随机化目标物体位姿并加入干扰物,开抽屉任务额外随机化桌面背景色与其他抽屉的开合状态;共生成 1,700 条轨迹 episode,涉及 21 个交互物体。
- SeaWave(Cloud Ginger XR-1):基于 UE5 的仿真器,测试机器人理解并执行自然语言指令的能力,覆盖拾取、放置、移近等操作技能,任务按指令与操作性质分为 4 个复杂度等级;论文正文未单独披露该源的 episode 数(由总量 703,088 减去 Habitat 与 MuJoCo 两项推算,约占仿真数据的小部分)。
③ 自建真机平台采集(Cobot Magic / Cloud Ginger XR-1)
- Cobot Magic(AgileX Robotics)双臂移动操作平台:AgileX Tracer AGV 移动底盘(最高时速 1.6 m/s)+ 4 条 ARX Robotics 六自由度轻量臂(末端负载 3kg,2 条主臂靠重力补偿由人直接示教、2 条从臂跟随主臂)+ 力控 + 通过关节电流估算的粗略触觉反馈 + 线性电机自定义夹爪(主臂夹爪带手柄机构连续控制开合)+ 3 台 Orbbec DaBai RGB-D 相机(2 个装在从臂腕部、1 个装在支架前方朝前);相机以 640×480 @ 30Hz 采集,本体感(4 臂关节位置/速度/力矩)与末端 6D 位姿+夹爪状态均以 200Hz 记录;数据采集代码开源在 https://github.com/agilexrobotics/ario-tools 。招募 30 余名志愿者遥操作,每个任务采集 50 条 episode,志愿者需在完成后为每次操作标注难易等级(易/中/难);共设计超过 60 个桌面家居场景操作任务,覆盖长程任务(如按指令摆放物品列表、依次叠杯子)、双臂精细协作(拧瓶盖、传递物品、拉拉链)、接触密集任务(插插头、写字)、人机协作(涂药膏、递物品)、可变形物体操作(叠毛巾、铺桌布)五类。
- Cloud Ginger XR-1(Dataa Robotics)5G 轮式人形机器人:40 余个智能关节、七自由度灵巧手(负载 5kg)、机身 9 个可扩展接口;设计 3 个任务——Pick up(拾取正确物体)、Put on(放到对应颜色色块)、Push to(推向指定颜色色块),分别采集 400 / 200 / 200 条共 800 条 episode,全部通过人类遥操作示教采集。
场景/技能统计(论文 Fig.6):数据集中 series 数最多的场景类型是 table(165 个 series)与多种室内场景(open domains / multi-room / living room / kitchen,合计 213 个 series);episode 数在 table 场景下达到百万级。本体统计(Fig.7):机器人形态以单臂为主,人形机器人数据量很小,主要来自 ARIO 自采与仿真部分。
训练方法
ARIO 论文本身不训练策略模型,“训练方法”对应的是数据构建流程:
- 真机采集协议:志愿者遥操作前先熟悉任务的初始/终止条件;每任务固定采 50 条 episode;采集完成后人工标注难度等级;采集软件原始格式不完全符合 ARIO 标准,需额外后处理转换,并人工过滤掉信息缺失或相机帧率异常的 episode。
- 仿真生成流程:Habitat 用脚本化的最短路径贪婪跟随 agent(非学习策略)生成轨迹,查询模拟器成功状态、删除失败轨迹;MuJoCo 沿用”Scaling Up and Distilling Down”的分层控制系统(高层任务策略 + 中层运动规划 + 底层关节控制)生成数据并额外记录中间状态;SeaWave 直接复用其 UE5 仿真器自带的任务生成与执行机制。
- 开源数据转换流程:为每个来源数据集单独开发转换脚本,原则是”尽量保留原始数据,只剔除不可用/文档不清的部分”;因原始文档不全,转换过程中遇到缺失字段需人工判断如何解读,OXE 因此只转换了满足要求的 62/72 个子数据集。
Infra(训练 / 推理工程)
本工作不训练模型,故不存在训练 GPU/精度/并行等信息;下表为数据采集侧的工程信息(论文正文披露):
- Cobot Magic 端上算力:一台车载笔记本电脑负责计算,通过 USB 串口接收 4 条机械臂的本体感流、通过 CAN 总线接收 Tracer 移动底盘数据;3 路 RGB-D 相机以 640×480 分辨率、30Hz 帧率推流;本体感(关节位置/速度/力矩、末端 6D 位姿、夹爪状态)录制频率 200Hz。
- ARIO 标准设计的目标同步频率:相机 30Hz、激光 10Hz、本体感 200Hz、触觉 100Hz(用于跨传感器时间戳对齐,非某一具体硬件的实测频率)。
- 模型训练 / 推理 infra(GPU 型号与数量、训练时长、推理延迟等):未披露——论文明确把”评估 ARIO 用于大规模模型训练”列为未来工作,本文未训练或部署任何模型。
评测 benchmark
论文不含策略模型的评测实验,其”评测”仅体现为与既有开源具身数据集的横向对比表(论文 Table 1,原始数据):
| Dataset | Modality | Task | Data Scale | Data Sources | Diverse Robotic Forms | Unified Format | Time-stamp Record |
|---|---|---|---|---|---|---|---|
| JD ManiData | 2D, 3D, text | manipulation | 0.5K | real | ✗ | ✓ | ✗ |
| ManiWAV | 2D, text, audio | manipulation | 1.3K | real | ✗ | ✓ | ✗ |
| RH20T | 2D, 3D, text, tactile | manipulation | 13K | real | ✓ | ✓ | ✓ |
| DROID | 2D, 3D, text | manipulation | 92K | real | ✗ | ✓ | ✓ |
| Open X-Embodiment | 2D, 3D, text | manipulation | 2.4M | sim, open-source, real | ✓ | ✗ | ✗ |
| ARIO | 2D, 3D, text, tactile, audio | manipulation & navigation | 3M | sim, open-source, real | ✓ | ✓ | ✓ |
ARIO 是表中唯一同时满足”5 种模态齐全 + 覆盖 manipulation 与 navigation + 多本体 + 统一格式 + 时间戳记录”的数据集;论文没有报告任何基于 ARIO 训练出的策略模型的成功率或下游任务指标。
创新点与影响
- 贡献:(1) 提出目前唯一同时覆盖图像、3D、文本、触觉、声音 5 种模态的具身数据标准,并用时间戳机制解决相机(30Hz)/激光(10Hz)/本体感(200Hz)/触觉(100Hz)等异构采样率的对齐问题;(2) 用 collection→series→task→episode 层级 +
information.yaml/description.yaml元数据文件,统一表达单臂/双臂/人形/四足/轮式等多种本体与位置/姿态/速度/力矩等多种控制对象;(3) 首次把自建真机遥操作(Cobot Magic + Cloud Ginger XR-1)、仿真生成(Habitat/MuJoCo/SeaWave)、开源数据转换(62/72 个 OXE 子集 + RH20T + ManiWAV)三路数据统一进同一格式,聚出约 3M episode;(4) 发起 ARIO Alliance(2024 年 3 月成立,10 家成员单位:鹏城实验室、南方科技大学、中山大学、AgileX Robotics、港大、港中大、慕尼黑工大、Dataa Robotics、D-Robotics、京东科技),把数据标准做成行业协作机制而非一次性数据发布。 - 改变了什么:把”统一格式”和”感官模态完整性”作为具身数据集的独立评价维度提出来,并给出 Table 1 这样的量化对比坐标系,供后续数据集论文(如同年底发布的 robomind)参照定位;配套的 ARIO Alliance 与持续更新的 OpenI 数据托管页面(此后新增了 Isaac Sim 等来源)把这项工作变成一个仍在生长的开放数据基础设施,而非静态论文快照。
- 作者自述局限(论文 Section 4 Future Work 原话):(1) 尚未验证 ARIO 对大规模具身模型训练的实际效果,作者把”用现有开源模型或专门架构在 ARIO 上训练并评估其泛化性/鲁棒性”明确列为下一步工作;(2) 论文自己的 Figure 2(d) 指出”同一机器人同时有仿真与真实数据”这一 sim-to-real 关键缺口在现有数据集(含 ARIO 首个版本)中仍”目前未被解决”;(3) 人形机器人数据量按自身统计仍然很小,主要靠自采和仿真补充;(4) 作者明确列出后续需要扩大模态采集范围(点云等)、构建更大规模仿真环境、探索多机器人交互场景等方向,说明当前版本在规模与场景复杂度上仍是起点而非终点。
原始链接
- 论文 arXiv:https://arxiv.org/abs/2408.10899 (PDF:https://arxiv.org/pdf/2408.10899 )
- 项目主页:https://imaei.github.io/project_pages/ario/
- 数据集托管(OpenI,持续更新):https://openi.pcl.ac.cn/ARIO/ARIO_Dataset
- 数据格式说明仓库:https://openi.pcl.ac.cn/ARIO/ARIO
- 真机数据采集代码(AgileX,论文中引用):https://github.com/agilexrobotics/ario-tools
一手源存档(sources/)
- ario-all-robots-in-one—project-page — 项目主页快照(摘要、数据流水线、统计图说明、ARIO Alliance 介绍、License、BibTeX)
- ario-all-robots-in-one—openi-dataset-readme — OpenI 数据集仓库 README 快照(各子数据源下载链接与规模、联系方式、License)
- arXiv 2408.10899 全文(HTML/PDF):见上方 arXiv 链接(arXiv 原文,不入 git)