一句话定位

HumanoidBench 是 UC Berkeley(Pieter Abbeel 组)提出的第一个「带双灵巧手的仿真人形机器人」全身控制基准:以 Unitree H1 + 两只 Shadow Hand 为主体,在 MuJoCo 上给出 27 个任务(12 个运动 + 15 个全身操作)、高达 61 维动作空间,用 DreamerV3 / TD-MPC2 / SAC / PPO 四个 SOTA RL 跑了一遍,结论是端到端 RL 在绝大多数任务上都过不了成功阈值,尤其栽在长程、需要全身协调的操作任务上;而「鲁棒低层策略 + 高层规划」的分层 RL 在有可复用底层技能时能显著翻盘。

背景与定位

这是「用仿真基准撬动人形机器人算法研究」范式的开山之作——作者的核心动机是:人形硬件(Atlas、Optimus、Unitree H1)昂贵易碎、真机实验不安全,导致人形学习算法研究被卡住;需要一个快、安全、便宜且够难的仿真测试床。它在本 vault 内可与几类工作对照:一是仿真基准/家居长程behavior-1k、桌面操作的 robocasa、真机迁移评测的 simpler-env;二是仿真基础设施 maniskill3genesis-physics-engine;三是同样以 Unitree H1 全身控制为对象、但走「模仿人类动作 / 遥操」路线的 h2o-human2humanoidomnih2ohover——后者做的是 sim-to-real 的全身控制策略,HumanoidBench 做的是纯仿真、任务多样、算法诊断的基准,互为补集。

论文用一张对比表(Table I)把自己和 MyoHand、Adroit、MyoLeg、LocoMujoco(Unitree-H1)、DMControl、FurnitureSim、robosuite、RLBench、Meta-World 全部并列:HumanoidBench 是唯一同时具备**灵巧手 + 61 维动作 + 101 DoF + 12 类技能标签(PnP/P/I/R/Po/IR/H/L/Ro/Lo/BM/St)**的基准,动作空间维度远超其它。范式关键词:high-dimensional whole-body control benchmark、loco-manipulation、hierarchical RL、dexterous-hand humanoid、simulated algorithmic testbed。作者身份:Carmelo Sferrazza、Dun-Ming Huang、Xingyu Lin、Youngwoon Lee、Pieter Abbeel(UC Berkeley / Yonsei)。

模型架构

HumanoidBench 本身不是一个模型,而是「仿真环境 + 任务套件 + 基线」三件套。此处记录仿真机器人本体观测/动作空间分层 RL 基线架构三部分工程配置。

机器人本体(MuJoCo)

  • 主体:Unitree H1 人形(取自 unitree_ros,经 MuJoCo Menagerie 适配),双臂各挂一只 Shadow Hand 灵巧手。为贴近人类形态,移除了 Shadow Hand 笨重的前臂(作者承认当前不完全真实,但对齐 Optimus / Figure 01 这类更纤细人手的产业趋势)。
  • 之所以主用 H1 而非 Agility Digit:H1 机械结构更简单、学习更快;Digit 有四连杆驱动的被动关节,训练更慢。
  • 环境可换本体/末端:另提供 Agility Robotics DigitRobotiq 2F-85 平行夹爪、Unitree 自带手;GitHub 仓库后续还加入了 Unitree G1(三指手) 与低维手 h1simplehand 等变体。

观测空间

  • 机器人本体状态(关节角 + 角速度)共 151 维:躯干 49 维 + 每只手 51 维(49+51+51);任务相关的物体位姿/速度按任务追加。
  • 第一人称视觉:机器人头部 2 个相机的 egocentric 图像。
  • 全身触觉:MuJoCo touch-grid 传感器,全身共 448 个 taxel,每个给出三维接触力;手部高分辨、其它部位低分辨(仿人类分布)。为提高触点分辨率,用 CoACD 凸分解把原始网格细分成许多小凸网格。
  • 论文主实验只用 state-based(本体 + 物体状态),视觉/触觉留作 future work;且刻意让各任务观测保持一致以减少领域先验。

动作空间

  • 61 维(躯干 19 + 每只手 21),归一化到 [−1,1]^61。默认 位置控制(也支持力矩控制,但位置控制更稳、可用更低控制频率)。
  • 控制频率 50 Hz,仿真步长 0.002 s

分层 RL 基线架构

  • 高层规划策略输出 setpoint(构成高层动作空间)→ 下发给一个冻结的低层到达(reaching)策略;低层用 PPO 在 MJX 上训练。push 用单手到达策略、package 用双手到达策略。低层作为可跨任务复用的预训练块,训练时不再更新。

数据

作为诊断型基准,这里的”数据”= 任务套件构成 + 奖励设计 + 在线经验规模(无离线示教数据集,作者刻意选 RL 因为人形示教难采)。

  • 任务总量 27:12 个运动 + 15 个全身操作;任务时长 horizon 500–1000 步。含 simple/hard、insert_small/normal、bookshelf_simple/hard、highbar_simple/hard 等变体,实际 env 数更多。
  • 运动任务(12):walk(前进 1 m/s 不摔)、stand、run(5 m/s)、reach(左手够到随机 3D 点)、hurdle(5 m/s 且跨栏)、crawl(1 m/s 钻隧道)、maze、sit(坐椅)、balance(站不稳的平衡板)、stair(1 m/s 上下楼梯)、slide(1 m/s 上下斜坡)、pole(穿密集细杆林不碰)。
  • 全身操作任务(15):push(推箱到随机点)、cabinet(开 4 种柜门/抽屉)、highbar(单杠翻转到倒立)、door(拉门并穿过)、truck(卸货)、cube(双手在手内转两个方块到目标朝向)、bookshelf(按序取放多物)、basketball(接球投篮)、window(拿工具擦窗、跟随竖直速度)、spoon(拿勺沿锅内画圆)、kitchen(源自 Relay Policy Learning:开微波炉门、移水壶、拨炉灶/开关)、package(搬箱到随机目标)、powerlift(举指定质量杠铃)、room(5m×5m 房间归整散落物、最小化其位置方差)、insert(把矩形插销两端插入两个紧配目标块)。
  • 奖励设计:每个环境 = 稠密奖励 + 稀疏子任务完成奖励的组合,并给出定性成功阈值(图中虚线)。kitchen 是唯一纯离散稀疏奖励任务,最大值仅 4.0。
  • 在线经验规模:基线各跑约 48 小时——TD-MPC2 约 2M 环境步、DreamerV3 / SAC 约 10M 步(差异源于算法吞吐);每算法 3 个随机种子
  • 低层到达策略的经验规模(MJX 并行):单手到达 20 亿步(36 小时)、双手到达 40 亿步(60 小时),均在 32,768 个并行环境上;训练时对各连杆施加力扰动以增鲁棒。

训练方法

四个 SOTA RL 基线(实现细节见附录 C):

  • DreamerV3(模型基、想象 rollout 学习):用 ‘medium’ 配置,update-to-data 比 = 64,官方代码,训练 10M 步。
  • TD-MPC2(模型基 + 在线规划):用 5M 配置,官方代码,训练 2M 步。
  • SAC(off-policy 无模型,最大熵):用 JaxRL Minimal 实现,10M 步。
  • PPO(on-policy 无模型):用 Stable-Baselines3,仅 4 个并行环境,因样本效率差只在 walk/kitchen/door/package 子集上跑。
  • 除特别说明外均用各自默认超参;均值/标准差取 3 seed 的最大回合回报。

分层 RL(V-D):核心是先在 MuJoCo MJX(GPU 大规模并行)上用 PureJaxRL 的 PPO 训一个鲁棒低层到达策略——为提效用简化 H1(仅足-地碰撞)、去掉手、每回合到达即重置目标、对各连杆加力扰动;超参用 PureJaxRL 默认,除环境数放大、每环境 16 步熵系数 0.001。因力扰动带来的鲁棒性,MJX 训得的策略可直接迁移到完整碰撞网格的经典 MuJoCo 全模型,且对加手后的额外质量也鲁棒。随后把该到达策略作为冻结低层,高层用 DreamerV3 或 TD-MPC2 训练,对 push/package 把到达目标范围限制到工作空间内以利探索。

关键消融(有手 vs 无手,V-C):在 walk 上加双手(额外 42 DoF)会大幅掉点。进一步把手的驱动固定为零(动作维 61→19,但保留手的观测与质量)——性能只略降(图中 “Blocked”);再把手关节从观测里也去掉(“Reduced”)结果相似。结论:性能下降主要来自动作维度增加,而非观测维度或质量。这直接支撑了”高维动作空间是人形 RL 主要难点”的论断。

Infra(训练 / 推理工程)

  • 仿真引擎:MuJoCo,步长 0.002 s。单 CPU FPS(Table II):默认全模型(双手)1050 FPS、无手 2450、简化躯干碰撞 3600、仅足碰撞 5100;带精细网格 + 触觉的全模型 550 FPS。即便完整人形 + 灵巧手也能 1000+ FPS。
  • 低层策略训练硬件/并行:MuJoCo MJX 在 GPU 上并行 32,768 环境;单手 20 亿步 = 36 小时、双手 40 亿步 = 60 小时。作者指出:若在 MJX 里保留全部人形几何体,并行收益会被大幅削弱(故只用简化模型训低层,复杂基准任务不走 MJX)。
  • 基线训练:每个算法约 48 小时墙钟;PPO 无大规模并行时样本效率差。具体 GPU 型号与卡数未披露
  • 推理 / 控制频率:控制 50 Hz、位置控制。边缘硬件 / 部署延迟未涉及(纯仿真基准,无真机部署)

评测 benchmark

主结果(Table III/IV,均值±std,DreamerV3/SAC @10M、TD-MPC2 @2M;Target 为定性成功阈值)。总基调:所有基线在多数任务上都低于成功阈值,DreamerV3 总体最强。摘录代表性数字:

任务DreamerV3TD-MPC2SACTarget
walk800.2±158.7782.0±109.231.7±24.0700
stand622.7±404.8809.0±137.1208.3±105.6800
run633.8±222.493.3±14.35.0±2.1700
reach7580.9±19517316.1±21124565.1±212.812000
crawl878.8±122.7957.4±17.5330.0±111.9700
hurdle126.2±59.446.4±10.813.2±8.8700
push−1251.9±659.8−258.7±66.5−97.9±147.0700
door213.0±149.3274.7±12.539.4±25.2600
kitchen0.0±0.00.0±0.00.0±0.04.0
package−18015±9478−3656±1055−6718±6071500
basketball19.3±2.542.0±14.822.1±3.21200
insert_small184.8±26.3129.8±51.910.8±13.4350

要点:

  • 能过阈值的极少——只有 walk、crawl(Dreamer/TD-MPC2)、stand(TD-MPC2)等少数运动任务达标;几乎所有操作任务远低于 target,push/package 甚至为大负值,kitchen 全为 0(唯一离散稀疏奖励任务,无一学到)。
  • SOTA RL 连 walk 这种在 DMControl 简化人形上已被充分研究的任务都要很多步才学会——归因于高维状态/动作空间放大了探索空间
  • 分层 RL 翻盘(Figure 7):在 push 上分层架构显著超过端到端基线、成功率很高;但更难的 package 上提升有限——策略能接近抓取但举不起来(低层从未在训练中经历举起),限制了整体表现。
  • 常见失败模式(V-E):highbar——保守地保持贴杆不摔而学不会翻转(短视规划);door——会转门把手却学不会”边拉门边全身后退”的协调;hurdle——学会以目标速度前跑却不会跳栏(硬探索问题),甚至找保守姿势撞栏后稳住不终止。

创新点与影响

  • 第一个带双灵巧手的综合人形全身控制仿真基准:一次覆盖运动 + 静/动态操作 + 全身协调,任务从玩具级(推箱)到实用级(卸货、书架重排),且 61 维动作 / 101 DoF 的维度远超同期基准。
  • 诊断出”动作维度是人形 RL 主难点”:有手/无手 + 固定手驱动的对照消融,干净地把性能下降归因到动作维数(而非观测或质量),为后续”行为先验 / 常识引导探索”指方向。
  • 给出可复用的分层解法与工程实现:MJX + PureJaxRL PPO + 力扰动训出的鲁棒到达策略能 sim-to-sim 迁移到全几何全模型,作为冻结低层被高层复用,并开源全部代码与训练曲线 json。
  • 多模态观测预留:448-taxel 全身触觉 + 双头相机 egocentric 视觉已内置,为后续多模态感知研究铺路。
  • 影响:成为人形 loco-manipulation 算法的标准诊断床,被后续全身控制 / VLA / 人形 RL 工作广泛引用与对照。

作者自陈局限:① 主实验仅 state-based,视觉/触觉多模态未评测;② 手模型不真实(去前臂);③ 物体与环境不够真实、渲染质量有限;④ 尚无螺纹拧入 / 家具装配等任务;⑤ 只跑了 RL,未纳入模仿学习 / 人类视频引导;⑥ MJX 全几何并行收益有限,低层只能用简化模型训。

原始链接

一手源存档(sources/)