一句话定位
HumanPlus 是一套人形机器人「从人类数据学技能」的全栈系统:先用 40 小时离线人类动作数据(AMASS)在仿真里 RL 训一个任务无关的全身低层策略(Humanoid Shadowing Transformer),零样本迁移真机后,操作者只需站在旁边、用一台 RGB 摄像头实时估计自己的全身+双手姿态就能「影随(shadowing)」操控 33-DoF 人形机器人采数据;再用采到的双目第一视角数据做行为克隆(Humanoid Imitation Transformer),让机器人自主完成穿鞋走路、货架取物、叠衣服等任务,40 条示范内达 60–100% 成功率(CoRL 2024 最佳论文入围 top 6)。
背景与定位
这是人形遥操作 + 模仿学习数据管线的代表作,把「用单目视觉低成本采人形全身数据」这条路真正跑通。它站在三条线的交汇点:
- 人形 RL 全身控制(exbody 表现性全身控制、real-world-humanoid-locomotion-rl、phc-perpetual-humanoid-control)——已能做鲁棒真机行走/表现性动作,但多数是任务专用、reward engineering 繁重,且不解决「怎么高效采操作数据」。
- 低成本遥操作 + 模仿学习(aloha-act / Mobile ALOHA)——ALOHA 用双臂 leader-follower puppeteering 高效采桌面双臂数据,但不支持全身、不支持人形腿部。HumanPlus 直接沿用 ACT 的 chunking 思路,但把采集接口换成单目视觉影随,把控制对象扩展到人形全身。
- 人形遥操作接口(He et al. H2O「Learning human-to-humanoid real-time whole-body teleoperation」用 RGB 相机做全身遥操;Cheng et al. exbody 用离线人类数据学上半身动作)——HumanPlus 的贡献是把离线人类数据(学低层策略)与在线人类数据(影随采集)两头都用上,形成从遥操作到自主技能的闭环。
核心范式叫 shadowing(影随):操作者不戴任何设备、不进 mocap 棚,只站在机器人视线范围内,让机器人实时复现自己的全身+双手动作。这把传统 mocap 套装 / VR 头显 / 外骨骼(昂贵、限定场地)替换成一台 RGB 摄像头 + 现成人体姿态估计器。数据管线的另一半是:影随时机器人自己用头部双目 RGB 采第一视角图像,绕开了「仿真里渲染逼真 RGB、模拟软体、指定多样任务」的难题。
模型架构
系统由两个 decoder-only transformer 组成(论文 Figure 3),一个管低层控制、一个管高层技能。
Humanoid Shadowing Transformer(HST,低层策略)
- 形态:decoder-only transformer,非视觉、纯本体感知闭环。
- 输入:机器人本体感知 + 机器人目标姿态。
- 本体感知:root 状态(roll、pitch、base 角速度)、关节位置、关节速度、上一步动作。
- 目标姿态:目标前向/侧向速度、目标 roll/pitch、目标 yaw 速度、目标关节角——由 AMASS 采样的人类姿态 retarget 而来。
- 输出:19 维人形身体关节的位置 setpoint,随后由 1000Hz PD 控制器转成力矩;目标手部关节角直接送 PD 控制器(不过策略)。
- 运行频率 50Hz,context length = 8(用观测历史适应不同环境,沿用 RMA 类思路)。
- 零样本 sim-to-real:仿真训完直接部署真机;本体观测只用板载 IMU + 关节编码器。机器人坐下时不走策略、直接把目标姿态送 PD(无需补偿重力,且带丰富接触的坐姿难仿真)。
Humanoid Imitation Transformer(HIT,技能策略)
- 改自 ACT(Action Chunking Transformer,见 aloha-act):去掉 encoder-decoder,改成 decoder-only。
- 输入:两路第一视角 RGB 图像特征 + 本体感知 + 固定位置嵌入;图像用预训练 **ResNet(README: resnet18)**编码。
- 动作:基于输入端固定位置嵌入预测一个 chunk = 50 个目标姿态;同时在图像特征对应的输入位置预测「未来图像特征 token」。
- 前向动力学正则:对预测的图像特征加 L2 feature loss,逼 transformer 在执行完 GT 目标姿态序列后预测出对应未来图像特征——把「动作预测」与「前向动力学预测」融合。作用是正则图像特征空间,防止视觉策略忽略图像、过拟合到本体感知(这是 HIT 相对 ACT 的关键改动,直接决定了穿鞋走路任务能不能解)。
- 部署:HIT 板载 25Hz 运行,异步把预测目标位置发给低层 HST,丢弃预测的未来图像特征 token。
- README 超参:
chunk_size 50 / hidden_dim 512 / dim_feedforward 512 / batch_size 48 / lr 1e-5 / num_steps 100000 / dec_layers 6 / backbone resnet18 / feature_loss_weight 0.005,带data_aug、use_mask、双目共享 backbone。
硬件(自定义 33-DoF 人形,基于 Unitree H1)
- 33 DoF:19-DoF 身体(两条 4-DoF 手臂 + 两条 5-DoF 腿 + 1-DoF 腰)+ 两个 1-DoF 手腕 + 两只 6-DoF 灵巧手。手臂含腕后有效 5 DoF。
- 手:Inspire-Robots RH56DFX,食/中/无名/小指各 1 DoF、拇指 2 DoF;手腕用 Dynamixel 舵机 + 两个止推轴承,手与腕走串口通信。
- 头部双目:两台 Razer Kiyo Pro RGB 网络摄像头,下倾 50°,瞳距 160mm。
- 力学:手指出力 ≤ 10N,手臂负载 ≤ 7.5kg,腿部电机瞬时力矩 ≤ 360Nm;机身高 180cm。
数据
离线人类数据(训 HST)
- AMASS:光学标记 mocap 聚合数据集,40 小时、11,000+ 条独立动作序列,覆盖多样任务。
- 用 phc-perpetual-humanoid-control(PHC, ref [48])的方法做质量过滤。
- 参数化:SMPL-X——22 个身体 + 30 个手部 3-DoF 球关节,3 维全局平移 + 3 维全局旋转;手另用 MANO 模型。
- Retarget(人→人形):人形身体只有 19 个 revolute 关节(SMPL-X 的子集),直接把 SMPL-X 的髋/膝/踝/躯干/肩/肘 Euler 角复制过来(髋、肩各 3 正交 revolute 关节 ≈ 1 球关节);手部按每指中间关节旋转映射 Euler 角;1-DoF 腕角用前臂与手掌全局朝向的相对旋转算。
在线数据(影随采集,训 HIT)
- 实时人体姿态:WHAM(World-grounded Humans with Accurate Motion),单 RGB 相机联合估计姿态+全局变换,RTX4090 上 25 fps。
- 实时手部姿态:HaMeR(transformer 手姿估计器,MANO),单 RGB 相机,RTX4090 上 10 fps。
- 影随时机器人头部双目 RGB 采第一视角图像作为 HIT 训练输入。
- 每任务示范数与长度:叠衣服 40 条(500 步/20s)、重排物体 30 条(250 步/10s)、打字「AI」30 条(200 步/8s)、双机器人握手 30 条(125 步/5s)、货架取物 25 条(500 步/20s)、穿鞋走路 40 条(1250 步/50s)。全部「≤ 40 条示范」。
- 仿真域随机化范围(Table 2):基座负载 [-3.0, 3.0]kg、末端负载 [0, 0.5]kg、基座质心 [-0.1, 0.1]³m、电机强度 [0.8, 1.1]、摩擦 [0.3, 0.9]、控制延迟 [0.02, 0.04]s。
训练方法
HST:PPO 仿真训练 + 零样本迁移
- 用 PPO 在仿真里最大化折扣回报 $\mathbb{E}[\sum_{t=0}^{T-1}\gamma^t r_t]$;代码基于
legged_gym+rsl_rl(IsaacGym v4)。 - 奖励项(Table 1):目标 xy 速度 $\exp(-|[v_x,v_y]-[v_x^{tg},v_y^{tg}]|)$、目标 yaw 速度、目标关节位置 $-|q-q^{tg}|2^2$、目标 roll&pitch、能量 $-|\tau\dot q|2^2$、脚接触 $c==c^{tg}$、脚打滑 $-|v{feet}\cdot\mathbb{1}[F{feet}>1]|_2$、alive。核心是「匹配目标姿态 + 省能 + 防滑」。
- 训完零样本部署真机。
HIT:监督行为克隆
- 对影随采到的真机数据做 supervised behavior cloning,训练目标 = 动作预测 + 前向动力学(图像特征 L2 loss,权重 0.005)。
- 相对 ACT 的改动全在架构侧(decoder-only + forward-dynamics 正则),非 encoder-decoder + CVAE。
Infra(训练 / 推理工程)
- 训练侧:HST 用 PPO 在 IsaacGym 仿真训练;具体 GPU 型号 / 卡数 / GPU-hours、并行方式、精度均未在论文披露。HIT 训练命令见 README(单 GPU,
num_steps 100000)。 - 遥操作工作站:WHAM/HaMeR 姿态估计跑在 NVIDIA RTX4090(body 25fps + hand 10fps)——这是操作者侧的算力,不在机器人上。
- 机器人板载推理:README 显示板载走 NVIDIA Jetson(nvidia-jetpack、torch 1.11.0);HIT 策略板载 25Hz 推理,低层 HST 50Hz,PD 控制器 1000Hz。
- 推理精度 / 具体延迟数字:未披露。
评测 benchmark
遥操作对比与用户研究(Table 3,6 名参与者 × 2 任务)
在 Rearrange Objects 与需要下蹲的 Rearrange Lower Objects(低桌 0.55m)上,对比 Kinesthetic Teaching / ALOHA / Meta Quest:
| 方法 | 成本 | 操作人数 | 全身控制 | 整任务用时(s) | 稳定站立% |
|---|---|---|---|---|---|
| Kinesthetic | $50 | 3 | ✗ | 6.60 | 90.5 |
| ALOHA | $7050 | 2–3 | ✗ | 7.15 | 100 |
| Meta Quest | $250 | 2 | ✗ | 8.87 | 95.3 |
| Ours(影随) | $50 | 1 | ✓ | 5.20 | 100 |
Ours 是唯一支持全身控制、唯一能解 Rearrange Lower Objects(下蹲)的方法(该任务用时 15.34s),且用时最短、仅需 1 名操作者。
低层策略鲁棒性(Table 4,对比 H1 官方控制器)
向骨盆施力测最小失稳力:Ours 前 32N / 后 44N / 左 70N / 右 100N,恢复时间 1.2s,可下蹲到 0.44m、跳 0.35m、能从坐姿站起 ✓;H1 Default 为 24/36/40/40N、恢复 15s、下蹲 0.85m、跳 0m、不能站起 ✗。失稳时 Ours 一两步 / <3s 恢复,H1 需数步、最长 20s。
模仿学习成功率(Table 5,每任务 10 次试验,整任务成功率)
对比 HIT-Monocular(单目)、ACT、Open-loop 回放:
| 任务 (示范数) | HIT(Ours) | Monocular | ACT | Open-loop |
|---|---|---|---|---|
| 叠衣服 (40) | 100 | 40 | 100 | 0 |
| 重排物体 (30) | 90 | 70 | 50 | 0 |
| 打字「AI」(30) | 80 | 40 | 0 | 60 |
| 双机器人握手 (30) | 90 | 80 | 90 | 0 |
| 货架取物 (25) | 90 | 80 | 90 | 0 |
| 穿鞋走路 (40) | 60 | 0 | 0 | 0 |
HIT 在所有任务上不劣于/优于基线;唯一能解「穿鞋走路」全流程(60%),其余方法全 0。归因:HIT 用双目、靠 forward-dynamics 正则避免过拟合本体感知;ACT 会卡在「捡起鞋 / 离开 A」后不用视觉反馈重复动作;Monocular 缺深度,穿鞋任务全败。
创新点与影响
- 单目 RGB 全身影随遥操作:把人形整机(含双手、腿、腰)的遥操作接口从 mocap/VR/外骨骼降到「一台 RGB 摄像头 + 1 名操作者 + $50」,且是对比方法里唯一支持全身控制、能做下蹲行走的接口。
- 离线 + 在线人类数据双用:离线 AMASS 训低层策略、在线影随采技能数据,形成「遥操作 → 自主技能」闭环——这是相对 exbody(仅离线上半身)与 H2O(仅遥操作接口)的整合式贡献。
- HIT 的 forward-dynamics 正则:在 ACT 上加图像特征 L2 预测这一改动,是「穿鞋站起走路」这种需真正用视觉+深度的长程全身任务能被解出的关键。
- 影响:CoRL 2024 最佳论文入围(top 6);硬件基于现成 Unitree H1 + Inspire 手,代码/数据/硬件全开源,成为后续人形遥操作—模仿数据管线的常被对比基线。
- 作者自陈局限:① 硬件 DoF 少于人(1-DoF 踝限制单腿抬举等敏捷动作,5-DoF 臂无法做 6-DoF operational space 控制、影随时有不可达区);② 头部相机固定、非主动,手/交互物易出视野;③ 固定 retarget 映射丢弃了硬件上没有的人类关节,限制可学动作多样性;④ 姿态估计在大面积遮挡下失效,限制操作者活动区;⑤ 主要覆盖操作 + 少量下蹲/站起/行走,长程导航需大得多的示范量与真机精确速度跟踪。
原始链接
- 论文(arXiv abs):https://arxiv.org/abs/2406.10454
- 论文 PDF:https://arxiv.org/pdf/2406.10454
- 项目主页(视频/数据集/硬件):https://humanoid-ai.github.io/
- 代码(HST + HIT + 硬件 + 姿态估计说明):https://github.com/MarkFzp/humanplus
- 依赖组件:WHAM https://github.com/yohanshin/WHAM ;HaMeR https://github.com/geopavlakos/hamer
一手源存档(sources/)
- humanplus—github-readme — GitHub README 快照(HST/HIT/硬件/姿态估计安装与训练命令、板载 Jetson 环境、HIT 超参)
- humanplus—project-page — 项目主页快照(摘要、CoRL 2024 最佳论文入围、团队、BibTeX)
- 论文全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)