一句话定位

RoboMIND(Multi-embodiment Intelligence Normative Data)是北京人形机器人创新中心 + 北大 + 智源在同一套统一平台、统一标准协议下用人类遥操作采出的多本体真机操作数据集:107k 条成功轨迹 / 305.5 小时,覆盖 4 种本体(Franka Panda、UR5e、AgileX 双臂、Tien Kung 人形+双灵巧手)、479 个任务、96 类物体、38 种技能,另附 5k 条带失败原因标注的真机失败轨迹10k 条帧级细粒度语言标注,以及一套在 Isaac Sim 里做的数字孪生仿真环境——作者自称”在统一平台上采集的最大多本体遥操作数据集”,已被 RSS 2025 接收。

背景与定位

这是”用一套统一硬件 + 统一采集/质检协议,把真机操作数据从单实验室扩到多本体(含人形灵巧手)“的数据集范式代表作。核心论点与 droid 一脉相承:机器人操作数据不能像图文那样爬网,只能靠遥操作真机采集,受硬件、人力、安全约束,导致”即使当今最通用的策略也基本训练在少数受控实验室、本体单一(两指夹爪)“。RoboMIND 想同时打破两条瓶颈——本体多样性(首次把人形双灵巧手纳入统一标准采集)与采集一致性

作者在表 I 里对标了一长串真机数据集,明确点名 open-x-embodiment(把 21 家机构已有数据拼成统一格式的聚合项目,1.4M 轨迹但”设置各异、难以整体学策略”——RoboMIND 全程拿它当反面对照)、droid(76k 遥操作轨迹,但仍是单一 Franka 两指夹爪本体)、RH20T、RoboSet、BridgeData V2、RT-1、BC-Z、ARIO 等。RoboMIND 站的位置是”统一平台、异构本体(含灵巧手)、任务数最多(479)、且独家提供失败数据 + 数字孪生”这一支。可与 vault 内 droid / open-x-embodiment(数据集对手)、rdt-1b / openvla / diffusion-policy / aloha-act / mobile-aloha(它用作 benchmark 的策略骨干与遥操作硬件来源)对照阅读。范式关键词:unified multi-embodiment teleoperation dataset、standardized collection protocol、failure demonstrations、digital twin、cross-embodiment benchmark。

RoboMIND 是”数据集 + benchmark”,不是模型;本条目下”模型架构”记录采集硬件平台它跑 benchmark 用到的策略骨干

模型架构

采集硬件平台(四本体,同平台统一采集)

  • Franka Emika Panda(单臂 7-DoF):Gello 式遥操作——按机械臂自由度做 3D 打印结构件 + 舵机,把打印件运动映射到机械臂;深度相机录 RGB-D + 同步机器人状态。真机实验相机:3× Intel RealSense D435i(左 480×640、上 720×1280、右 480×640)+ Robotiq 夹爪
  • UR5e(单臂):Gello 式遥操作;真机实验为顶置 1× RealSense D435i(480×640)+ Robotiq 夹爪
  • AgileX Cobot Magic V2.0(双臂):类 mobile-aloha 的双边遥操作装置,用辅助臂主从控制主臂。真机实验相机:2× 手眼 Orbbec Astra + 1× 前视,均 480×640。
  • Tien Kung(X-Humanoid 人形,双灵巧手)全身 42 DoF;躯干头/胸/腰/背四处装深度相机(头部 Orbbec Gemini 335,其余 Gemini 335L,主动+被动立体视觉);双手为 Inspire-Robots RH56DFX 灵巧手。遥操作除 Gello 式外,主要用 Xsens 动捕服采人体各关节运动再映射到人形对应关节(比 VR 头显 + 相机姿态识别更精确直接)。真机实验相机:头/胸 2× Gemini 335(480×640)。

每条轨迹(多视角 RGB-D + 机器人本体状态 + 末端执行器状态 + 遥操作人体状态)统一打包成单个 H5 文件

数据类型(每条轨迹含)

多视角 RGB-D、机器人本体 proprioceptive 状态、末端执行器状态、任务的语言描述;动作以关节空间 + 末端执行器双空间记录。

benchmark 用到的策略骨干(EMB policy)

  • 单任务模仿学习:ACTaloha-act 的 action-chunking transformer)、Diffusion Policydiffusion-policy,实现照 droid)、BAKU
  • VLA 大模型:RDT-1Brdt-1b,diffusion-transformer 双臂基座)、OpenVLAopenvla,微调 Llama-2 的 7-DoF VLA,本文只在 Franka 单臂测)、CrossFormer(cross-embodiment transformer)。

数据

总规模:107k 成功轨迹 / 305.5 小时交互;479 任务、96 物体类、38 技能、4 本体

按本体分(论文正文口径):Franka 单臂 26,856 真机 + 30,035 仿真(数字孪生);Tien Kung 人形 15,187;AgileX 双臂 10,269;UR5e 25,170。论文分析节把 Franka(真机 26,866 + 孪生 26,070)合计后约占 49.2%;人形约占 17.8%。(HF release v1.1/1.2 口径略有出入且更新:Franka 52,926、Tien Kung 19,152、AgileX 10,629、UR5e 25,170,合计 ≈107,877,总文件 12.3 TB。)

失败数据:额外发布 5k 条真机失败轨迹,每条附详细失败原因(作者类比 RLHF,供失败反思/纠正学习)。失败案例在质检时被识别、分类、记录(如 FR-PlacePlateInPlateRack 板子滑出、AX-PutCarrot 夹爪意外张开掉胡萝卜)。

语言标注10k 条成功长程轨迹做帧级细粒度语言标注——先用 Gemini 按操作序列切分视频并生成分段文本描述,再人工精修(识别关键物体、描述所有关键动作、保证操作细节准确、时间切分粒度合理、时间逻辑一致),多人复核。

任务分类(六类,按语言描述归纳技能,每条只计主类型):Articulated M.(开关/转动带关节物体)、Coordination M.(双臂协同)、Basic M.(抓/握/举/放)、Multiple Object Int.(多物体交互)、Precision M.(倒液体、插电池等精细)、Scene U.(场景语义理解,如从右侧关上抽屉、按颜色分块入盒)。

物体多样性:96 类,跨 domestic / industrial / kitchen / office / retail 五类场景(厨房草莓/蛋/香蕉/梨 + 烤箱/面包机等带关节电器;家居含刚体网球 + 可形变玩具;办公/工业含电池、齿轮等需精控小件)。

轨迹长度:Franka、UR 多 <200 步(原语技能);Tien Kung、AgileX 多 >500 步(长程/技能组合);>70% Franka 任务只含单技能,>75% Tien Kung/AgileX 任务含 ≥2 技能(有的人形任务达 5 技能)。

采集与质检管线:云原生 + 分布式的”智能数据平台”,五模块——采集 / 存储(标准 H5)/ 预处理(按执行准确度、轨迹平滑度、遮挡或运动模糊过滤)/ 分类(按本体 + 任务名,任务名 = 本体 + 技能 + 物体 + 场景四要素)/ 标注。质检定义 8 条质量准则(Touch Excess、Movement not Smooth、Secondary Grabbing、Mechanical Arm Shaking、Collision before Grabbing、Image Distortion、Failed Placement、Gripper out of Camera),分初检 / 逐帧细检 / 过滤记录三步;采集员轮换休息以减少疲劳误差。

仿真/数字孪生:在 NVIDIA Isaac Sim 里复刻真机任务与资产(机械臂、桌面、物体、相机),低成本扩数据 + 高效评测;仿真中相机:机械臂采集频率约 1:4,暂无深度图。

训练方法

RoboMIND 是数据集,本身无训练目标;训练方法体现在它对 benchmark 策略的使用协议上:

  • 单任务模仿学习:从零训练,每个数据集/任务单独训一个 model;ACT、BAKU 用原论文默认设置,Diffusion Policy 照 droid 实现;训后直接部署真机评测。
  • VLA 微调:取官方预训练 VLA(OpenVLA / RDT-1B / CrossFormer),在每类机器人的多任务聚合数据上微调,再逐任务评测泛化。OpenVLA 是微调 Llama-2 得到的 7-DoF VLA,只在 Franka 单臂测;RDT-1B、CrossFormer 在三类机器人(单臂/人形/双臂)测。
  • RoboMIND 预训练增强:把 RDT-1B / CrossFormer 先在整套 RoboMIND 上预训练(尤其吸收 Tien Kung 人形灵巧手数据),再在专家多任务集上微调,对比”直接微调”考察预训练收益。
  • 动作空间:末端执行器 SE(3) / 关节空间;异构本体统一标准采集正是为给不同动作空间的策略提供预训练数据。

关键超参未在正文披露(学习率、batch、训练步数等沿用各骨干原设置)。

Infra(训练 / 推理工程)

  • 数据平台工程:云原生架构 + 分布式计算处理大规模数据;统一 H5 存储。
  • 训练算力:论文未披露训练 benchmark 模型所用 GPU 型号 / 数量 / GPU-hours / 并行 / 精度。
  • 推理/控制频率:真机部署控制 Hz、FPS、时延均未披露;仿真侧仅给相机:机械臂采集频率 ≈ 1:4。
  • 数据体量:HF 发布总文件 12.3 TB(n>1T 量级),月下载约 3.2 万。

评测 benchmark

所有成功率均为真机、每任务 10 次试验(VLA 单任务 15 选,含 Franka 5 / 人形 5 / 双臂 5;单任务 IL 用 45 任务:Franka 15 / Tien Kung 10 / AgileX 15 / UR5e 5)。

① 单任务模仿学习(ACT / Diffusion Policy / BAKU,图 12)

  • ACT 平均成功率:AgileX 55.3% > UR5e 38.0% > Tien Kung 34.0% > Franka 30.7%;人形 HR-CloseDrawerLowerCabinet 达 60%
  • Diffusion Policy 在若干 Franka / Tien Kung 任务上超 ACT;BAKU 普遍较低(其超参偏仿真、迁真机差)。

② VLA 微调(表 III,RoboMIND 微调后真机成功率,/10)

  • RDT-1B 整体最强,双臂尤为突出:AX-AppleYellowPlate 10/10、AX-PutPepper 9/10、AX-PackBowl 8/10、AX-TakePotato 6/10。
  • CrossFormer 微调后仍在所有 AgileX 双臂任务 0/10;单臂/人形有改善(HR-PressDownToaster 7/10)。
  • OpenVLA(仅 Franka)简单任务与 RDT-1B 相当(FR-SideCloseDrawer 7/10、FR-PlaceBreadPlate 4/10)。

③ 泛化(表 IV,FR-PlaceBreadPlate 换物体/背景)

  • 换与面包形状相近的物体(香蕉)泛化好:CrossFormer FR-PlaceBananaPlate 9/10、RDT-1B 6/10;苹果差(RDT-1B 3/10)。
  • 换未见背景全线崩:三模型在 Unseen Background 1/2/3 多为 0–2/10(Background 3 全 0/10)。

④ RoboMIND 预训练增强(表 V,(origin) 直接微调 vs (RoboMIND) 先全量预训练再微调,/10)

  • CrossFormer 双臂从”全 0/10”跃升:AX-TakePotato 0→10/10、AX-PutPepper 0→10/10、AX-AppleBluePlate 0→9/10。
  • HR-PressDownToaster CrossFormer 7→10/10;RDT-1B 多任务普遍 +1~3/10(如 FR-OpenTrashCan 3→6/10、AX-AppleBluePlate 6→9/10)。
  • 结论:全量 RoboMIND 预训练对多本体任务成功率有显著、稳定的提升。

⑤ 真实-仿真 co-training(图 17,Franka FR-UprightBlueCup)

  • 100 条真机 + 500 条仿真,比例 real-only / sim-only / 100:100…100:500,无 sim2real 技巧直接混训。
  • 增大仿真占比在真机与仿真两侧成功率都升;但仅用仿真数据在真机仅 10% 成功(而 100 真机+500 仿真在仿真环境侧达 90%),说明接触密集任务的 sim-real 物理差距仍大、真机数据不可或缺。

⑥ 失败原因分析(图 15,ACT 45 任务)

  • 预定义 9 类失败(Inaccurate Positioning、Cannot Close Gripper、Cannot Approach Object、Early Gripper Release、Object Drop、Cannot Release Gripper、Cannot Return to Home Pose、Collision Recovery Failure、Excessive Speed)。
  • “Inaccurate Positioning” 是各本体最主要失败因(人形高达 48%);夹爪类失败(Cannot Close Gripper / Object Drop)次之,源于夹爪动作帧数少、难学。

创新点与影响

  • 统一平台 + 标准协议的多本体真机数据集:与 open-x-embodiment 拼接式聚合不同,RoboMIND 全程同一套设置采集,降低变异噪声、开箱即用;表 I 里它在”任务数 479 / 灵巧手 / 详细标注 / 失败数据 / 数字孪生”多列独占优势。
  • 首次把人形双灵巧手纳入统一标准采集(Tien Kung 42-DoF + Inspire RH56DFX),并证明这些人形数据能作预训练料,把 RDT-1B/CrossFormer 在真机(尤其双臂)任务上从近乎不能完成拉到接近全对。
  • 独家提供 5k 失败数据 + 10k 帧级语言标注 + 数字孪生:为失败恢复、任务规划、VQA、真仿 co-training 等方向提供一手料。
  • 落地影响:RSS 2025 接收;HF 月下载约 3.2 万、12.3 TB;已被后续模型(如 EO-1)用作训练料;后续开源 RoboMIND V2.0(ModelScope,按本体切分,新增 mobile 移动操作 Agilex-mobile 与 Ark 新本体,正好补齐 V1 的移动操作短板)。
  • 作者自述局限:背景环境相对简单(未来拟加复杂背景);当前缺移动操作数据(V2.0 已补);标注可进一步加高层规划指令;接触密集任务的仿真保真度不足;现有算法在长程任务上的精确定位与精细控制仍是瓶颈(“Inaccurate Positioning” 主导失败)。

原始链接

一手源存档(sources/)

  • robomind—project-page — 项目主页快照(RSS 2025、V2.0、作者/机构、abstract、硬件、BibTeX)
  • robomind—hf-card — HF 数据集卡快照(按本体轨迹数、目录结构、H5 格式、版本更新 v1.0/1.1/1.2、工具仓库)
  • robomind—modelscope-v2 — ModelScope RoboMIND V2.0 合集快照(16 数据集、新增 mobile/Ark 本体)
  • arXiv 原文见上方链接(PDF 不入 git)