一句话定位
BiGym 是 Dyson Robot Learning Lab(与 UCL 合作,Stephen James 组)提出的 40 任务、人形移动双臂(mobile bi-manual)demo-driven 操作基准:以 Unitree H1 + Robotiq 2F-85 夹爪为本体,每个任务配 50 条 VR 人工遥操采集的示教,同时支持模仿学习(IL)与 demo-driven 强化学习(RL)评测,用七个 SOTA 算法(BC/ACT/Diffusion Policy + DrQV2/AWAC/IQL/CQN)跑了一遍基线,结论是即使最强的 ACT 平均成功率也只有 46.3%,长程任务与刚体/铰接物体精细操作普遍失败。
背景与定位
这是「给移动双臂人形操作提供真实、多模态、demo-driven 的仿真测试床」这一路线的代表作。作者的核心批评对象是 rlbench 一类依赖运动规划器(motion planner)生成示教的基准——规划器轨迹要么是直线式的、要么分布过窄,无法反映真实机器人轨迹的噪声与多模态性;同时批评 humanoidbench、LocoMujoco 一类人形基准只做稠密奖励 RL、不提供示教、且不考虑移动双臂操作。BiGym 与 humanoidbench 同样基于 Unitree H1,但前者聚焦运动 + 操作的 RL 诊断,BiGym 聚焦「移动 + 双臂 + 真实人类示教」的 IL/RL 对比;与同为 2024 年提出的 robocasa(同期工作,单臂 + 人类示教)相比,BiGym 的差异化在于移动 + 双臂 + 人形。范式关键词:demo-driven benchmark、mobile bi-manual manipulation、humanoid embodiment、multi-modal human demonstrations、whole-body vs bi-manual action mode。
模型架构
BiGym 本身不是一个学习模型,而是「仿真环境 + 任务套件 + 示教数据集 + 基线算法」四件套,此处记录仿真本体、观测/动作空间配置与基线策略架构。
机器人本体(MuJoCo):基于公开的 Unitree H1 模型(取自 mujoco_menagerie),原始 H1 无夹爪,作者为双臂各加装一个 Robotiq 2F-85 平行夹爪(带驱动腕关节)。作者说明可替换为其他灵巧手,但当前任务下平行夹爪已足够。场景基于 MuJoCo MJCF、dm_control 风格的自定义面向对象 API,共提供 46 个高质量资产(含铰接物体如洗碗机、可定制厨房模块)。
观测空间:机器人头部 + 左/右腕共 3 个 RGB-D 相机,每个可输出 RGB 与深度,默认图像分辨率 84×84(可自定义)。本体状态按两种控制模式不同维度:whole-body 模式下 proprio 为 76 维(关节角 37 + 关节速度 37 + 双爪开合量 2);bi-manual 模式(下肢简化为浮动基座)下为 64 维(关节角 29 + 关节速度 29 + 浮动基座位姿 4 + 双爪开合量 2)。
动作空间:两种可切换模式——① whole-body:23 维 = 双臂 10 + 双腿 10 + 躯干 1 + 双爪 2,支持全身运动 + 操作联合学习;② bi-manual:16 维 = 双臂 10 + 浮动基座 4(δx, δy, δz, δθ)+ 双爪 2,下肢用经典控制器简化为全向浮动基座,聚焦上肢移动双臂操作。均支持 joint-position 的绝对/增量(delta)两种动作表示。
基线策略架构:ACT 用 ResNet-18 视觉编码器 + CVAE 条件 transformer,预测长度 16 的动作序列(执行 1 步,receding-horizon + temporal ensembling);Diffusion Policy 同样用 ResNet-18 编码器,同时跑 UNet-1D 与因果 Transformer 两种去噪骨干、报告两者中较优结果,动作序列长度同为 16;BC 与四个 demo-driven RL 基线(DrQV2/AWAC/IQL/CQN)共用简单 CNN(3 层卷积,kernel 3、32 通道,SiLU + LayerNorm)+ 全连接头(2 层 512 维,瓶颈到 64 维,LayerNorm+tanh 输出)架构。
数据
- 任务规模:40 个任务,分 5 类——Reach Target(3 个:single/multi_modal/dual)、Table-Top 操作(5 个:stack_blocks、move_plate、move_two_plates、flip_cup、flip_cutlery)、Dishwasher(12 个,含长程 unload_*_long)、Kitchen Counter(20 个,含 drawer/cupboard 开关、take/put cups、pick/store box、saucepan/sandwich 系列、grocery 收纳等)。
- 示教规模:每个任务 50 条人类采集示教(sparse reward + 50 demos 的组合设计),任务时长范围 1000–7000 步(远超 MetaWorld 的 500、RLBench 的 100–1000)。
- 采集方式:Valve Index VR 头显 + 两个手柄 + 两个基站,遥操 H1 仿真本体;头显 6DoF 姿态控制机身位置朝向,手柄 6DoF 姿态经逆运动学解算控制双臂末端并对齐夹爪朝向。
- 降采样与存储:示教在物理仿真频率(500 Hz)下采集,支持降采样到 20–500 Hz 任意频率;为省存储只保存”轻量”示教(仅控制信号/动作),回放时按用户指定的观测配置(RGB/深度等)重建完整示教,本地缓存避免重复下载/回放。
- 多模态设计:任务被有意设计为可多解,如
reach_target_multi_modal允许左右手任一到达目标,诱导多模态示教分布;论文 Figure 3 对比 BiGym 与 RLBench 的腕部轨迹分布,BiGym 轨迹噪声大、多模态但整体平滑,RLBench(规划器生成)轨迹要么是直线要么不自然。 - 奖励:全部任务仅提供稀疏奖励(成功检测器判 1/0),success detector 逐任务定义(见 Appendix B,如关节角接近 0/1 阈值 0.1、物体碰撞 + released 判定等)。
- 纯仿真数据,无 sim-to-real 或跨具身混合;GitHub README 提示当前示教集只覆盖
JointPositionActionMode(floating_base=True, absolute=True/False)两种动作模式,且明确警告”并非所有示教都能成功完成任务,使用前需自行校验”。
训练方法
- IL 训练:Adam 优化器,学习率 1e-4,batch size 256,frame stack 4;训练 150K steps(IL)/ 100K steps(demo-driven RL),二者均在约 100K 步后收敛,更长训练无额外增益;结果取最后 3 个 checkpoint 的平均。
- RL 训练:demo-driven RL(DrQV2/AWAC/IQL/CQN)沿用 AW-Opt 做法,每个 batch 保持 50% 示教比例(独立示教 replay buffer),以缓解稀疏奖励下的探索难题。
- 所有算法均使用统一超参跑出参考结果,未针对单个任务精调(论文明确这是”参考基线”而非”最优结果”)。
- 未使用蒸馏;action tokenization 采用连续动作(非离散 token),ACT/Diffusion Policy 走生成式序列预测(CVAE / diffusion),BC 与 RL 基线走确定性回归头。
Infra(训练 / 推理工程)
- 仿真性能:在单进程、NVIDIA L4 GPU + Intel Xeon Gold 6438Y+ CPU 的无头服务器上测得,MuJoCo 引擎下 BiGym 环境运行速度约 400–1400 FPS(依相机数量而定),可通过并行环境或 MuJoCo XLA 进一步加速。
- 训练硬件:论文正文与附录均未披露训练所用的 GPU 型号/数量、GPU-hours(仅有仿真 FPS 数据)。
- 推理/控制频率:仿真物理频率 500 Hz,示教/控制频率可降采样至 20–500 Hz 任意值;论文未给出具体最终推理所用的控制 Hz,也未涉及真机部署延迟(纯仿真基准)。
评测 benchmark
基准对比(Table 1):与 MetaWorld、RLBench、RoboSuite、LocoMujoco、HumanoidBench 对比,BiGym 是唯一同时具备”移动 + 双臂 + 人类示教 + 40 任务 + 1000–7000 步长程”的基准;动作模式标注为 J(关节位置)/ J+FB(关节位置+浮动基座)。
主实验(Table 2,40 任务成功率 %,50 episodes 评测,末 3 checkpoint 均值±std):
| 算法 | 类型 | 平均成功率 |
|---|---|---|
| ACT | IL | 46.3 ± 1.4 |
| Diffusion Policy | IL | 20.8 ± 0.8 |
| BC | IL | 18.0 ± 1.1 |
| DrQV2 | demo-driven RL | 13.9 ± 0.2 |
| AWAC | demo-driven RL | 13.0 ± 1.2 |
| IQL | demo-driven RL | 12.4 ± 0.0 |
| CQN | demo-driven RL | 10.5 ± 0.4 |
代表性任务级数字:drawer_top_close(简单单关节任务)全部 7 个算法都拿到 100%;stack_blocks、store_groceries_lower/upper 等高精度/长程任务全部算法 0%;dishwasher_open(长程铰接操作)ACT 达 72.0±45.0 而其余算法均 ≤6%;四个 demo-driven RL 算法(DrQV2/AWAC/IQL/CQN)在绝大多数需要真实物体交互的任务上success rate 为 0,仅在 reach_target_*、drawer_top_close 等简单/关节类任务上非零。
论文自述发现:① 刚体/铰接物体的高精度操作(如 move_two_plates、stack_blocks)叠加移动基座后更难,因为移动中难以准确估计抓取位姿、且 POMDP 下的置信估计(belief estimation)困难;② 长程任务(如 dishwasher_unload_cups_long、put_cups)所有算法均失败,模型无关(model-free)基线不具备任务级推理能力;③ ACT/Diffusion Policy(生成式策略:CVAE/diffusion + transformer/UNet)显著优于 BC 与 RL 基线(简单 CNN+MLP),说明策略表达能力对处理多模态噪声示教至关重要;④ demo-driven RL 普遍失败于移动基座带来的探索困难(转错方向就会丢失物体视野)与稀疏奖励下的长程价值函数学习。
创新点与影响
- 首个提供大规模人类采集示教(而非规划器合成轨迹)的移动双臂人形操作基准,40 个任务覆盖从简单到接近实用家居场景(洗碗机装卸、厨房柜体、三明治制作)的完整难度谱。
- whole-body / bi-manual 双模式解耦设计,让研究者可分别研究”运动+操作联合学习”与”固定下肢的双臂操作”两个子问题。
- 用统一超参对 3 个 IL + 4 个 demo-driven RL 算法做了首次系统性对比,实证揭示当前 SOTA 在移动双臂长程/高精度任务上的普遍失败,为后续策略架构与置信估计研究指出具体缺口。
- 作者自陈局限:论文未针对单任务调参,只给出”参考”而非”最优”结果;示教数据集本身仍在完善中,部分示教可能无法完成任务;GitHub 说明当前公开示教仅覆盖两种 joint-position 动作模式。
原始链接
- 论文 arXiv:https://arxiv.org/abs/2407.07788 (v1: 2024-07-10, v2: 2024-07-11;PDF https://arxiv.org/pdf/2407.07788)
- 项目主页:https://chernyadev.github.io/bigym/
- 代码:https://github.com/chernyadev/bigym
一手源存档(sources/)
- bigym—github-readme — GitHub README 快照(40 任务清单、安装/使用示例、示教下载与告警、许可证、引用)
- bigym—project-page — 项目主页快照(摘要、作者、链接)
- arXiv 全文 PDF(arXiv 原文 PDF,不入 git):https://arxiv.org/pdf/2407.07788