一句话定位

AgiBot World 是智元(AgiBot)联合上海 AI Lab / HKU / 上海创智学院放出的百万级真机双臂人形操作数据集 + 全栈开源平台:100+ 台同构人形机器人 AgiBot G1 在 4000 ㎡ 五大真实场景中人工遥操采集 1,003,672 条轨迹 / 2976 小时 / 217 任务 / 87 技能 / 106 场景,配套提出用潜动作规划器(latent action planner)打通 VLM 与底层控制的通用策略 GO-1(Genie Operator-1),是当时轨迹规模最大、且带人工闭环质检的开源灵巧操作数据集与基准。

背景与定位

机器人操作长期卡在”高质量数据稀缺”上:文本/图像海量且标准化,机器人数据却因硬件异构、采集流程不统一而碎片化、质量参差。此前的规模化尝试各有短板——open-x-embodiment(OXE)靠聚合 140 万条异构轨迹,但受限于短时任务、embodiment/视角混杂、缺乏统一质量保证;droid 靠众包扩场景多样性,却仍单臂、规模与质控不足;RT-1(13 万)、RoboMIND(5.5 万)等则场景/技能有限。

AgiBot World 的立场是”用一套标准化 + 人工在环(human-in-the-loop)的真机采集流水线,把规模、真实性、质量一次做齐”,并把自己定义为”数据 + 模型 + benchmark + 生态”的全栈平台,喊出面向 Embodied AI 的”ImageNet 时刻”。方法范式上属于 VLA(Vision-Language-Action)大策略一脉,但通过引入潜动作(latent action)把范式扩展为 ViLLA(Vision-Language-Latent-Action):借鉴 genie 的潜动作建模与 LAPA(latent action pretraining)的思路,在 VLM(internvl 2.5-2B)与扩散动作专家之间插一层 embodiment-agnostic 的潜动作规划,从而能吃下无动作标签的人类视频与跨本体机器人数据。对照的 baseline 是 rdt-1b(扩散 Transformer 双臂基座)与 pi0(VLM + flow 动作专家)。论文为 IROS 2025 版本。

模型架构

数据集侧(硬件平台 AgiBot G1):

  • 双 7-DoF 机械臂 + 移动底盘 + 可调升降腰,末端模块化——可换标准夹爪或 6-DoF 灵巧手;需要触觉的任务用带视触觉传感器的夹爪。
  • 8 路相机:前视 1 个 RGB-D + 3 个鱼眼;左右末端各 1 个(RGB-D 或鱼眼);后置 2 个鱼眼。图像观测与本体感知(关节 + 末端位姿)以 30 Hz 控制频率记录。
  • 两套遥操系统:VR 头显控制(手势映射到末端平移/旋转,经逆运动学转关节角;摇杆/按键控底盘与躯干,扳机控末端;但灵巧手仅支持少数预设手势)与全身动捕控制(记录含手指的人体关节,映射到机器人姿态,支持逐指、躯干、头部朝向的精细控制)。

模型侧(GO-1,ViLLA 三阶段层级框架):

  • Stage 1 — 潜动作模型 LAM:encoder-decoder 结构对连续帧 {I_t, I_{t+H}} 建模逆动力学。编码器 I(z_t|I_t,I_{t+H}) 为带因果时序 mask 的时空 Transformer(follow Genie/Bruce et al.);解码器 F(I_{t+H}|I_t,z_t) 为空间 Transformer,输入初始帧 + 离散潜动作 token z_t=[z_t^0,…,z_t^{k-1}],k=4;用 VQ-VAE 目标量化,codebook 大小 |C|。在互联网级异构数据(Ego4D 人类视频 + 跨本体机器人数据)上训练。
  • Stage 2 — 潜动作规划器 Latent Planner:VLM 主干用 InternVL2.5-2B(2B 规模在机器人任务上已被验证够用);多视角图像先经 InternViT 编码再投影到语言空间。规划器为 24 层 Transformer,逐层从 VLM 主干做条件注入、全双向注意力。给定头/左腕/右腕三视角 I^h,I^l,I^r 与语言指令 l,预测潜动作 token P(z_t|I^h,I^l,I^r,l),监督信号由 LAM 编码器基于头视角给出 z_t:=I(I_t^h,I_{t+H}^h);因潜动作空间比 OpenVLA 那种离散化底层动作小若干数量级,便于把通用 VLM 高效改造成策略。
  • Stage 3 — 动作专家 Action Expert:用扩散目标对底层连续动作分布建模,迭代去噪。架构同 latent planner 但目标不同(规划器走 masked language modeling 出离散潜 token,动作专家走 denoising 回归底层动作)。解码动作 chunk A_t=[a_t,…,a_{t+H}],H=30,条件于本体状态 p_t。双专家层级条件、信息流耦合。推理时 VLM→先预测 k 个潜动作 token→据此条件去噪,产出最终控制信号。
  • GO-1 Air = 去掉 latent planner 的轻量版(README 与开源模型库中提供)。

数据

  • 规模(Beta 全量)1,003,672 条轨迹(约 43.8 TB);论文正文口径 1,001,552 条 / 总时长 2976.4 小时 / 217 个具体任务 / 87 技能 / 106 场景
  • Alpha 子集92,214 条轨迹(约 8.5 TB),changelog 记为 Beta 的约 10%;实验章节把 alpha 描述为 Beta 轨迹的”约 14%“、时长 236 小时(对照 OXE 约 2000 小时)。
  • 对象与场地3,000+ 独立物体4,000 ㎡ 采集工厂,1:1 复刻五大域——家居 domestic / 零售 retail / 工业 industrial / 餐厅 restaurant / 办公 office(工业、零售场景此前数据集罕见)。
  • 来源与采集方式:全部人工遥操(human teleop),非脚本、非聚合;标准化流水线三阶段——(1) 预采集验证任务可行性并定采集标准;(2) 熟练遥操者按标准采集,本地先做完整性(缺帧)校验后上云;(3) 云端标注者核对是否符合标准并补语言标注。
  • 标注:逐 episode 提供多相机视角、深度、相机标定、以及整任务 + 每个子步骤的语言标注与关键帧;标注维度含 item / scene / skill(子任务切分)/ task 级。
  • 长时任务:多数轨迹 30–60 秒(部分 >2 分钟),由多个原子技能组成(如”泡咖啡”);对照 DROID 多为 5–20 秒、OXE v1.0 多在 5 秒内。技能覆盖上刻意纳入 chop、plug 等低频高价值技能,每个技能至少 100 条轨迹
  • 失败恢复数据(imperfect data):保留遥操者失误后成功恢复的轨迹,人工标注失败原因与时间戳,约占数据集 1%,用于策略对齐与失败反思。
  • 人工在环质检:迭代”采一小批→训策略→部署评估→据表现回改采集协议”。例如部署发现模型动作起始处长时间停顿 → 对应标注反馈的”过多 idle 帧” → 修订协议并加后处理剔除 idle 帧。
  • 协议侧改进(GO-1 开源博客补充,非本论文):提出 Adversarial Data Collection(ADC)——双人协作,一人正常遥操、另一”对抗”操作者中途移动物体/改光照/换指令(“抓猕猴桃”中途改”拿橙子”),迫使主操作者不断适应,把每帧变得有信息量。
  • 许可:CC BY-NC-SA 4.0;数据集 HF 页面为 gated。

训练方法

  • 三阶段流水线:Stage 1 在互联网级异构视频(Ego4D 人类视频 + 跨本体机器人数据)上训 LAM,把连续帧压成离散潜动作;Stage 2 用潜动作作伪标签训 latent planner,做 embodiment-agnostic 长时规划、复用 VLM 泛化力;Stage 3 引入 action expert 与 latent planner 联合训练,学灵巧底层动作。
  • 目标函数:latent planner 用 masked language modeling 预测离散潜 token;action expert 用扩散去噪回归连续动作 chunk。
  • 微调超参:完成第三阶段预训练后,用高质量任务数据微调;GO-1 微调 lr 2e-5、batch size 768、30,000 步。动作 chunk 与控制频率在预训练设为 30(匹配 30Hz 采集),LIBERO 微调时改为 10(LIBERO 为 10Hz)。
  • 动作空间(GO-1 开源博客):开源模型采用绝对关节空间(absolute joint space);实验发现强模型对不同动作空间(相对上一帧 / 相对 chunk 首帧如 π0)都能适配,甚至预训练与微调用不同动作空间也可。
  • 跨本体结论(GO-1 开源博客):仅在 AgiBot G1 单本体上预训练,即可迁移到 Franka、AgileX 等仿真/真机平台,且 fine-tune 时 scaling 优于多本体预训练模型;<200 条叠衣演示即可迁移到新本体。
  • 工程栈:基于 LeRobot(dataset v2.1,commit 2b71789),CUDA 12.4,FlashAttention 2(经 HF kernels 库拉预编译二进制)。

Infra(训练 / 推理工程)

  • 预训练 GPU 规模 / GPU-hours / 并行策略 / 精度:未披露(论文与博客均未给出预训练卡数与卡时)。
  • 推理:GO-1 推理约 7 GB 显存(RTX 4090 可跑);控制频率 30 Hz、动作 chunk H=30。提供 policy server(client-server)远程推理方案(真机 GPU 弱、依赖各异时用)。
  • 微调显存:全量微调约 70 GB(batch 16,A100 80GB / H100);仅微调 Action Expert 约 24 GB(batch 16,RTX 4090 / A100 40GB)。
  • 边缘部署硬件(如车载/机上芯片)、端到端时延:未披露具体数字。

评测 benchmark

全部在真机评测(论文明确未用仿真),normalized completion score,每任务/场景/方法 10 次 rollout 取均值,支持部分成功打分。

  • 数据价值(用 RDT 做探针):在 AgiBot World 上预训练比在 OXE 上预训练,平均 completion score in-distribution +0.30、OOD +0.29;具体 in-dist 0.77 vs 0.47、OOD 0.67 vs 0.38(“Table Bussing”近乎三倍提升)。Alpha 仅 236h(约 OXE 1/10 时长)却成功率更高;用 1/10 时长数据即把泛化性抬升 18%
  • GO-1 vs 先前 SOTA:在 5–6 个不同复杂度任务(Restock Bag / Table Bussing / Pour Water / Restock Beverage / Wipe Table / Fold Shorts)上,每任务 30 次(10 次 seen + 20 次扰动/变体)。GO-1 全面超过 rdt-1bpi0;聚合”Performance”口径 GO-1 ≈ 78、GO-1 w/o Latent Planner ≈ 66、RDT ≈ 46,GO-1 较 RDT +32 个百分点(摘要口径”复杂任务成功率 >60%、较 RDT +32%”)。
  • latent planner 消融:加入潜动作规划器平均 +0.12 completion score(在 Fold Shorts 等复杂任务、Restock Beverage 指令跟随上增益尤明显)。
  • 数据 scaling:用 alpha 10% / alpha 100% / beta(轨迹数 9.2k → 1M),out-of-the-box 性能随轨迹数呈幂律Pearson r = 0.97
  • 数据质量消融:Wipe Table 任务上,人工核验过的 528 条 vs 未核验的 482 条——数量更多不必然更好,较小的人工核验集反而 +0.18 completion score。

创新点与影响

  • 贡献 1(数据):构建当时轨迹规模最大(1M+)的真机双臂人形操作数据集,配全流程开源工具;首创从场景配置、任务设计、采集到人工在环核验的一体化流水线,并纳入失败恢复数据与灵巧手任务,把”数据质量”作为一等目标而非仅堆规模。
  • 贡献 2(模型):提出 GO-1 / ViLLA——用潜动作表示解锁 web 规模(人类视频)预训练,把通用 VLM 与机器人时序决策高效对接;latent planner 提升长时任务执行并被证明随数据幂律 scaling。
  • 影响:数据集 + 工具链 + 预训练模型全部开源(CC BY-NC-SA 4.0),被定位为 Embodied AI 的”ImageNet 时刻”级公共资源;GO-1 于 2025-09 开源(含 GO-1 / GO-1 Air),并衍生 GO-1-Pro(arXiv:2507.06219,用 velocity model 过滤速度多模态噪声)与 ADC(arXiv:2503.11646)等后续工作。
  • 作者自陈局限:所有评测均在真机进行;配套仿真环境仍在开发中,目标是与真机 setup 对齐以支持快速、可复现评测——当前评测成本高、复现性受限。

原始链接

一手源存档(sources/)