一句话定位

HugWBC(Humanoid’s Unified and General Whole-Body Control)用一套 RL 策略、靠一个把「任务命令(速度)× 行为命令(步态相位 / 频率 / 抬脚高度 / 身高 / 前倾 / 腰旋转)」拆开的细粒度通用命令空间,让一台真实 Unitree H1 用单个策略做出走 / 跑 / 跳 / 站 / 单脚跳(hopping 用独立策略)等多种自然步态并可连续调参;同时通过**干预训练(intervention training)**让上半身随时可被外部遥操作接管而不破坏下肢步态,从而支持 loco-manipulation。SJTU + Shanghai AI Lab(SHARE Lab),RSS 2025

背景与定位

问题范式是人形机器人的”基础”全身控制器(fundamental whole-body controller):作为上层任务的底座,既要能走得稳,又要能像人一样细调步态参数、切换步态、并腾出上半身做操作。作者指出以往人形运动大多是”单一、乏味、不可扩展、被动”的位移,命令空间太窄。

论文把已有路线分两类并各点短板:

  • 基于模型(model-based / 最优控制):把控制拆成规划(生成轨迹与接触序列)+ 跟踪。人形的非线性动力学与多接触离散性使在线优化算力吃紧、难实时;且依赖完美状态估计与理想执行,真机鲁棒性差。
  • 基于学习(learning-based):本文所属。近期人形工作要么只跟踪运动(motion-tracking,如 ExBody / HumanPlus / asap)、要么把上半身命令直接塞进命令空间(OmniH2O / hover / Exbody2)、要么像 Mobile-TeleVision 那样解耦但只学下肢并注入上半身先验。

HugWBC 相对这些工作做了两个关键选择:(1) 把命令空间扩展到 foot/gait 细粒度行为命令(频率、抬脚高度、占空比、相位偏移),这是以往工作没有的;(2) 用一套策略控制全身关节(而非仅下肢),同时通过干预训练让外部控制器(IK 或关节序列)可随时接管上半身。它与同期 Shanghai AI Lab 的 homie(解耦遥操作、下肢 loco-manipulation 策略)互为呼应,同属人形全身控制这一大方向(humanoid-wbc)。方法学根基是四足的周期步态奖励(periodic gait reward,Siekmann / Walk-These-Ways) + 非对称 actor-critic(AAC,Pinto / DreamWaQ) + 对称性损失(symmetry loss,Yu et al. 2018)

模型架构

这是一个低层全身控制策略(motion-tracking / command-tracking policy,非 VLA、无 VLM、无语言条件),机器人为 Unitree H1,19 DoF(两个 3-DoF 肩、两肘、一个腰、两个 3-DoF 髋、两膝、两踝)。

命令空间 C = K × B(核心创新):

  • 任务命令 K:目标速度 v_t ∈ R^3 = 纵向线速度 v_x、横向线速度 v_y、偏航角速度 ω
  • 行为命令 B = [f, l | h, p, w | ψ, φ_1, φ_2, φ_stance],三组:
    • foot 行为:步频 f、最大抬脚高度 l
    • posture 行为:身高 h、身体前倾 pitch p、腰偏航 w
    • gait:相位偏移 ψ、两腿相位变量 φ_1/φ_2、占空比 φ_stance
  • 四种步态由相位参数直接指定:走 ψ=0.5(左右差半周期);跳 ψ=0(两腿同相);站 = 两腿相位恒定使脚始终触地;单脚跳 hopping = 一腿恒空、另一腿以频率 f 踏步。跑步由”高速 + 小占空比”从走步态自然导出(延长双脚腾空)。所有步态共用同一个 φ_stance。相位按 φ_{t+1,1}=φ_{t,1}+f·dtφ_{t+1,2}=φ_{t+1,1}+ψ 递推。
  • 送入策略时,相位变量 φ_i 被替换为两个时钟函数 [Cl_L(t), Cl_R(t)] = [sin(2π φ̄_{t,1}), sin(2π φ̄_{t,2})](φ̄ 为齐次化相位),做接触指示、平滑摆动/支撑切换。

动作:各关节目标位置的偏移(upper-body / lower-body / hands 三类),叠加名义位姿后由固定增益 PD 控制器跟踪。

网络(AAC,全 MLP,Tab. IX):actor 由三部分组成 ——

  • 历史状态编码器:输入 5 帧历史本体感受,隐层 [256,128],输出历史编码向量;
  • 状态估计器:隐层 [64,32],隐式估计线速度、足底离地高度(foot clearance)、身高(onboard 传感器难测的量);
  • 低层网络:吃历史编码 + 估计量 + 当前本体感受 + 命令 + 干预指示位 I(t),隐层 [256,128,64],输出全关节动作;
  • critic:隐层 [512,256,128],可见全部特权信息。

观测:actor 只见最近 5 步本体感受历史(角速度、重力投影、关节位置/速度、上一步动作)+ 命令 + 干预指示;critic 另见特权观测(线速度、身高误差、足底离地、地面摩擦系数、足接触力、各连杆碰撞检测)与地形高程采样。

数据

HugWBC 不用离线运动数据集训练策略——它是纯 RL、在仿真里靠奖励与命令采样生成行为,因此没有”小时数 / 帧数 / 轨迹数”这类语料规模。数据要点是命令采样范围与课程(Tab. II,除 hopping 外全步态共用;均匀采样):

命令默认初始范围结束范围
v_x(纵向线速度)0[-0.6, 0.6][-0.6, 2.0] m/s
v_y(横向线速度)0[-0.6, 0.6][-0.6, 0.6] m/s
ω(偏航角速度)0[-0.6, 0.6][-1.0, 1.0] rad/s
f(步频)2[1.5, 3.5]
l(抬脚高度)0.15[0.1, 0.35] m
h(身高偏移)0[-0.3, 0] m
p(身体前倾 pitch)0[0, 0.4] rad
w(腰偏航)0[-1.0, 1.0] rad
  • 速度与角速度走速度课程(grid adaptive curriculum,Margolis)逐步扩范围;行为命令直接在上表范围内均匀采样。
  • hopping 单独命令空间(Tab. VII):因其极不稳定,只保留 v_x/v_y/ω ∈ [-0.6,0.6] 与身高 h ∈ [-0.3,0],其余行为命令退化为常量。
  • 干预动作数据(用于上半身被接管的训练):默认从均匀噪声采样上半身关节动作(模拟遥操作误操作、故意引入与身体碰撞的可能);对比 baseline 用过滤后的 AMASS 动作做干预。噪声每若干步重采一次,前 2/3 时间做线性插值平滑过渡,后 1/3 保持目标位姿。
  • sim-only 训练 + 直接 sim-to-real:IsaacGym 训练,直接部署真机;另用 unitree_mujoco 做 Sim2Sim 验证。地形课程只含 rough terrain

训练方法

目标 = AAC(PPO)+ 对称性损失min L^AAC + λ·L^symmetryλ=0.5。AAC 损失 L^value + λ_policy·L^policy + λ_est·L^est(估计损失训练特权编码器)。

奖励(Tab. I,三类)

  • 任务奖励:线速度跟踪(权重 2)、角速度跟踪(2)。
  • 行为奖励:身高跟踪(-40)、身体 pitch(-10)、腰 yaw(-2)、抬脚跟踪(-30)、接触-摆动周期奖励 contact-swing(-2)。
    • 周期 contact-swing 奖励:先用标准正态 CDF 定义”期望接触概率函数” C^cmd_i(用标准差 σ 把切换点松弛成切换区间,平滑 swing↔stance);支撑相罚足速度、忽略接触力,摆动相罚接触力、忽略足速度。
    • 足轨迹奖励:用**五次多项式(quintic polynomial)**在 z 轴生成目标抬脚轨迹(满足支撑相零速零加速、摆动末端零速零加速、相变处速度/加速度连续),跟踪命令抬脚高度 l;x/y 轴摆动(决定步幅 stride)由步频 f 与速度 v 推算。
  • 正则奖励:R-P 角速度(-0.5)、竖直体位移(-0.1)、足打滑(-0.2)、动作变化率(-0.01)、动作平滑(-0.01)、关节力矩(-5e-6)、关节加速度(-2.5e-7)、上肢关节偏离(-0.5)、髋关节偏离(-2)、双足对称(-5)。

对称性损失(L^symmetry):借人形 X-Z 平面镜像结构,定义动作镜像 M_a 与观测镜像 M_s,鼓励”对称状态→对称动作”;可把走/跳这类对称行为迁移出 hopping 这类非对称行为(左脚跳镜像即右脚跳)。独立于 RL 目标,可插到任意 RL 算法。

干预训练(intervention training,第二大创新)——让策略对上半身被任意接管保持鲁棒:

  • 切换:二值指示 I(t)小概率 p=0.005 翻转,使一段连续同控制模式的期望长度 (1-p)/p ≈ 199 步,避免频繁抖动切换。
  • 干预采样:上半身动作用均匀噪声替换真身策略输出。
  • 奖励掩码:干预时屏蔽上半身正则奖励,消除策略与外部接管的冲突。
  • 噪声课程:替换动作 ā 从策略动作平滑过渡到噪声,平滑因子 α 每次**+0.01**(当线/角速度跟踪奖励双双超阈值时),若任一奖励掉到阈值 2/3 以下则 -0.01
  • 双组课程:并行分”agile 组”(学高速敏捷,只对它开速度课程)与”intervention 组”(学抗上半身干预,开噪声课程);均在攻克最难地形后再同时启动这两个课程。

训练范围:站/走/跳三步态用一个策略联合训练;hopping 用独立策略(太不稳、极少用于操作,未纳入干预训练)。

Infra(训练 / 推理工程)

  • 仿真器:NVIDIA IsaacGym(GPU 大规模并行)。
  • 代码栈:基于 rsl_rl + legged_gym + Walk-These-Ways;conda python=3.8、PyTorch CUDA 11.8、Isaac Gym Preview 4;训练入口 train.py --task=h1int --headless
  • 训练硬件 / 时长单张 NVIDIA RTX 4090,wall-clock 约 16 小时(附录 B-F Policy Learning Time)。并行环境数 / 精度:未披露
  • 推理 / 部署:Sim2Sim 用 unitree_mujoco,Sim2Real 经 unitree_sdk2_python 接口,真机 Unitree H1,PD 固定增益驱动;actor+encoder 直接部署真机、控制频率 50 Hz(采样轨迹最长 1000 步 = 20 s)。推理延迟 / 边缘算力:未披露

评测 benchmark

全部量化结果来自 IsaacGym 仿真与真机,指标为逐命令平均 episodic 跟踪误差(一阶范数)。

单命令跟踪(Tab. III,误差越小越好)

  • 走 / 站步态误差显著低于跳 / 单脚跳;hopping 误差最大(高速/pitch/waist 跟踪时甚至会摔)。
  • 走步态:v_x 误差 0.030(低速)/ 0.216(高速),v_y 0.085,ω 0.054,步频 f 0.028,抬脚 l 0.011,身高 0.064,pitch 0.038,腰 0.075。
  • 跳步态:v_x 0.090(低速)/ 0.532(高速),v_y 0.069,ω 0.077。站步态只测姿态:身高 0.035、pitch 0.047、腰 0.022。
  • 结论:跟踪精度与该步态的训练难度一致(走/站先学会、跳/单脚跳后学会且需更久);低速优于高速;纵向 v_x 优于横向 v_y(受 H1 硬件构型限制);抬脚高度 l 最难跟踪;姿态命令比落脚命令更难(调姿态更挑战平衡,策略趋保守)。

干预训练消融(Tab. IV/V,走步态)——三策略:噪声课程(HugWBC) / AMASS / 无干预

  • 噪声干预任务下,无干预策略跟踪误差爆炸(v_x 误差 0.8658、脚位移 17.5 m/episode,基本摔倒);AMASS 策略受限于数据分布(噪声干预下 v_x 0.1697);HugWBC 噪声课程最稳(噪声干预 v_x 0.0483,脚位移仅 0.034 m)。
  • 站步态 20 s 内平均脚位移:HugWBC 噪声干预下 0.034 m(几乎站定),AMASS 需频繁小碎步,无干预直接翻倒。
  • 副产物:干预训练同时提升了无干预下的移动/落脚鲁棒性,并增强外部推力扰动容忍(8 方向持续力 / 1 秒脉冲力测试,HugWBC 生存率更高)。

命令组合正交性分析(Tab. 热图,Q2):走步态正交范围最大、hopping 最小。走步态下 v_x/ω/h/w 相互正交;v_x>1.5 m/s 后正交性下降(策略牺牲跟踪保平衡);步频 f 在 1.5 或 2 时跟踪最优,过高变差;站步态因 H1 腰只 1 DoF,身高降 0.3 m 会把髋 pitch 关节行程压到近零、难跟踪 pitch。

真机实验(Tab. VI,5 次测试,仅电机可读的 pitch / waist):误差略高于仿真(传感器噪声 + 硬件磨损)。站:pitch 0.0712、waist 0.0718;走:pitch 0.1006、waist 0.0571;跳:pitch 0.0674、waist 0.0552。waist 误差普遍小于 pitch(腰控对整体稳定影响小),趋势与仿真一致。

创新点与影响

  • 贡献:(1) 面向人形细粒度运动的扩展通用命令空间(任务 × 行为,含步频 / 抬脚高度 / 相位 / 占空比等 foot-gait 级参数)+ 配套训练技术(周期步态奖励 + 五次多项式足轨迹 + 对称性损失);(2) 一套策略在四步态下精确跟踪 8 个命令(hopping 独立);(3) 干预训练——让外部上半身控制器可随时接管而不伤下肢,把该控制器变成 loco-manipulation 的通用底座。作者称这是首个支持如此细粒度运动行为、且高鲁棒高灵活的人形全身控制器
  • 改变了什么:把人形 locomotion 从”少数固定步态”推向”连续可调的行为命令空间”,并给出”下肢自适应 + 上半身可被任意接管”的解耦范式(相比 Mobile-TeleVision 只学下肢、且它还需注入上半身运动先验,HugWBC 证明不需要该先验也能得到鲁棒 loco-manipulation 控制器)。可作为上层规划器的统一低层控制器。
  • 作者自述局限:hopping 太不稳、需独立策略且未纳入干预训练;姿态命令在范围边界会互相干扰、牺牲平衡(H1 腰仅 1 DoF 加剧);干预训练观察到真机落地力更”硬”,暗示运动正则与跟踪精度之间存在权衡;跟踪精度受 H1 硬件构型限制(横向速度、抬脚高度尤其)。

原始链接

一手源存档(sources/)