一句话定位

WoCoCo(Whole-Body Control with Sequential Contacts)把任意接触序列任务(跳石头、搬箱子、跳舞打拍、攀爬崖壁)统一分解成一串「接触阶段」,每阶段只由一个接触目标+一个任务目标定义,配一套跨任务共享的稠密接触奖励+阶段计数奖励+好奇心探索奖励,端到端 RL 单策略即可在 Unitree H1 上真机跑通四类高动态全身接触任务,且每个任务只需额外写 1-2 条直觉化任务奖励项,全程不依赖动作参考/动捕先验。

背景与定位

人形机器人涉及序列接触的任务(踩踏石阶、攀爬、搬运)传统上靠模型式运动规划/轨迹优化(如 Crocoddyl)生成全身参考轨迹再跟踪,但依赖简化降阶动力学模型、耗时且运动质量受限。模型无关 RL 在标准行走任务上已证明鲁棒,但面对显式接触序列时,已有工作(如 Haarnoja et al. 的双足踢球、Dao et al./Xie et al. 的箱体搬运)大多依赖状态机,为每个任务/每次状态转移单独调奖励和策略,难以复用;Sferrazza et al.(HumanoidBench)用共享分层 RL 架构训练多任务但未处理 sim-to-real 与统一接触奖励;Xiao et al. 的 chain-of-contacts 需要人体动作参考。WoCoCo 想在 RL 框架内复刻 Crocoddyl 这类模型式求解器”改几个直觉化 cost 项就能切任务”的简洁性:把任务分解为若干接触阶段 i∈{0,1,…,I},每阶段由接触目标 g_con(哪些末端执行器要接触什么)和任务目标 g_task(额外任务要求,如姿态/位置)共同定义完成条件,机器人按顺序完成各阶段。这一分解把探索难题拆成三个子问题:如何在单阶段内达到接触目标(Q1)、如何激励跨阶段推进探索(Q2)、如何做兼容的 sim-to-real(Q3)。与同实验室的 h2o-human2humanoid(动作模仿式遥操作)、omnih2o(视觉遥操作)依赖人体动作参考不同,WoCoCo 完全不用动作先验;与 humanoid-parkour-learning(纯行走式跨越障碍)相比,WoCoCo 处理的是显式定义的接触序列(含手部接触),任务谱系更广(跳跃/操作/舞蹈/攀爬)。论文发表于 CoRL 2024(口头报告,OpenReview id Czs2xH9114)。

模型架构

  • 策略主干:Actor 与 Critic 均为纯 MLP,隐藏层 [512, 256, 128],无 transformer/CNN,无动作参考跟踪网络。框架本身对策略架构不设限制。
  • 动作空间:关节目标位置,由底层 PD 控制器驱动电机(论文未给出具体 PD 增益数值)。
  • 观测:分两部分,跨任务共享。
    • 本体感知(proprioception,四任务通用):关节位置、关节速度、上一帧动作、机体线/角速度、投影重力;其中关节位置、关节速度、上一帧动作各堆叠 3 个控制步(时序记忆,做法沿用 Li et al. 2024)。不使用外感知(exteroception),论文声明框架并不排斥引入。
    • 目标表征(goal representation,逐任务不同)
      • 跳跃:接触目标=每只脚接下来两块石头的角点(基座系),悬空脚记为全零;任务目标=期望肘部朝向+位置(基座系)。
      • 箱体搬运:接触目标=箱体两侧面中心点(基座系);任务目标=目的地位置(基座系)。
      • 跳舞:接触+任务目标合并为 one-hot 动作类别(Left/Middle/Right)+机体世界系 x、y、yaw。
      • 攀爬:任务目标恒满足,只需接触目标=当前及下一阶段所有目标区域角点(基座系)。
  • 接触阶段建模:形式化为扩展 MDP ⟨S,A,T,R,γ,G^con,G^task⟩,策略 a_t=π*(s_t|g_{i:I}^con, g_{i:I}^task) 以剩余阶段的目标序列为条件;奖励 r = r_WoCoCo + r_reg(任务无关)+ r_task(任务相关,仅 1-2 项)。
  • 跨具身泛化:同一套 r_WoCoCo/r_reg 奖励设计直接迁移到一台 22-DoF 恐龙机器人(论文原文注明改编自 Shafiee et al. 2023 的 ManyQuadrupeds 四足平台)上做”用不同末端执行器(头/尾/四脚之一)把球顶到目标点”的操作任务,验证框架不局限于人形拓扑。
  • 训练/推理平台:Isaac Gym(GPU 并行仿真)+ legged_gym/rsl_rl 并行 RL 框架(Rudin et al. 2022);PPO 优化,叠加基于人形左右对称性的对称增广(Mittal et al. 2024),并对好奇心奖励做对称化(原始观测与镜像观测各算一次 r_curi 取平均)。真机平台经 GitHub 代码确认为 Unitree H1(训练任务名 h1:jumpjack)。

数据

WoCoCo 不使用任何动作捕捉/示范数据训练策略——全部训练数据来自 Isaac Gym 仿真中的策略自身 rollout(on-policy PPO),无预先采集的轨迹数据集、无人类动作参考、无逆运动学重定向流程。

  • 任务多样性即”数据”来源:四个人形任务(跳跃/搬运/跳舞/攀爬)+ 1 个恐龙任务共享同一套任务无关奖励(r_WoCoCo + r_reg),仅通过每回合随机化的接触阶段配置(如跳跃任务中不同石阶高度/间距/落脚序列组合、舞蹈的 Left/Middle/Right 序列切换)产生任务内多样性,训练时并未使用外部数据集。
  • 好奇心奖励的”计数”数据:以随机冻结网络对(机体世界系位置/朝向四元数/线角速度 + 各末端执行器世界系位置和接触状态)做哈希分桶,用桶内累计访问次数的倒数平方根做探索奖励——这是一种数据无关、纯 online 的计数机制,不依赖预训练数据或回放缓冲区之外的统计。
  • 仿真到真实(无真实世界训练数据):真机测试仅用于评估,不做真实数据微调;真实世界的接触阶段切换目前依赖动作捕捉系统或人工观察触发(论文在局限中明确指出这是待改进项,见”创新点与影响”)。
  • 论文未披露:具体并行环境数量(num_envs)、总训练步数/总迭代次数、每个任务训练到收敛所需的仿真时长。

训练方法

  • 目标函数:r = r_WoCoCo + r_reg + r_task,其中:
    • r_WoCoCo = w_con·r_con + w_stage·r_stage + w_curi·r_curi(Eq. 2)。
    • 稠密接触奖励 r_con = n_corr − n_con·n_wrong·𝟙(n_stage>0) + 2·n_con²·F_con·F_task(Eq. 3),相比 0-1 奖励(仅阶段整体达成给 1 分)逐个末端执行器计正确/错误接触,奖励更稠密;n_stage=0(首阶段)时不惩罚错误接触,避免 reset 后瞬间受罚。
    • 阶段计数奖励 r_stage = n_stage·F_task(Eq. 4),用已完成阶段数激励机器人继续推进而非停留在当前阶段”吃满”奖励;F_task 门控避免为刷阶段计数故意不完成任务目标。
    • 好奇心奖励 r_curi = 1/√(#该哈希桶访问次数)(Eq. 6),用随机冻结 NN 对好奇心观测做符号哈希(BIN2DEC)分桶计数,灵感来自 Tang et al. 的 Exploration 计数式探索和 Charikar 的哈希相似度估计;相比直接用 RND,论文的消融显示 RND 会诱发”贴地皮蹭”类危险但存活率高的过拟合行为(对应 Burda et al. RND 论文中的”Dancing with Skulls”现象),而计数式哈希更稳定。
    • 正则/sim-to-real 奖励 r_reg:跨全部四个人形任务共享同一套权重(偏航角速度、力矩平方及超限、关节加速度/速度平方、动作变化率、终止惩罚、脚部接触力超限、脚部朝向、绊倒、打滑;非跳跃任务额外加”脚悬空时间”和”禁止腾空”两条塑形项)。
    • 任务相关奖励(每任务仅 1-2 项,均为直觉化指数型跟踪项):跳跃仅 1 项——肘部姿态+位置跟踪 exp(-|err_rot|/π)·exp(-|err_pos|/1),w_task=30;箱体搬运 2 项——箱到目的地 w_box=200(阶段>0 且朝向在 ±90° 内门控)+手到箱侧 w_hand=100(箱朝向 ±30° 内门控);跳舞 2 项——手部左右分展 w_hand=5 +脚到落脚区中心 w_foot=10;攀爬 2 项——面墙朝向 w_base=50 +四肢到目标区中心 w_ee=5。
  • WoCoCo 奖励权重(Table 1,按任务):w_con/w_stage/w_curi 分别为——跳跃 120/160/20000,箱体搬运 40/160/40000,跳舞 10/5/5000,攀爬 20/40/10000(好奇心项权重比接触/阶段项高 2-3 个数量级,体现探索奖励需要更大尺度才能驱动长时序探索)。
  • 课程式 sim-to-real 训练流程(三阶段,跨全部人形任务共享):1)先在无域随机化下训练至收敛(好奇心奖励仅在此阶段生效);2)恢复训练并加入域随机化,训练至收敛;3)此后每 2000 次迭代把正则奖励权重提高 20%,直至翻倍为止,诱导更保守的真机行为。此课程设计沿用 Li et al. 2024(RL for versatile bipedal locomotion)的思路,用于降低域随机化和正则项带来的额外探索负担。
  • 域随机化(Table 3,四个人形任务共享同一套):摩擦系数 U(0.2,1.1);基座质心偏移 U(-0.1,0.1)m;连杆质量 U(0.7,1.3)×默认值 kg;P 增益 U(0.75,1.25)×默认;D 增益 U(0.75,1.25)×默认;力矩 RFI 扰动 0.1×力矩上限 N·m;控制延迟 U(0,20)ms;每 5s 随机推机体一次,Δv_xy=0.25m/s;地形在平地/未知碎石间切换。
  • 好奇心哈希网络:1 层隐藏层 32 单元,输出 16 维(Appendix I.2);好奇心观测预处理试过 3 种归一化方式(线性归一化到 [0,1]、正弦/余弦编码到 [0,π]、按 (n_stage+1) 重缩放使好奇心具阶段感知),论文报告三者结果无显著差异,正文结果用的是正弦/余弦编码版本。
  • 对称增广:沿用 Hoeller et al./Zhang et al. 的方法,基于人形左右对称性做 PPO 数据增广提升样本效率;好奇心奖励额外对原始观测和镜像观测各算一次取平均以保持对称。

Infra(训练 / 推理工程)

  • 仿真器:Isaac Gym(GPU 加速物理仿真),基于 legged_gym + rsl_rl 并行 RL 框架(Rudin et al. 2022,“Learning to walk in minutes”)训练;PPO 算法。
  • GPU 型号、GPU 数量、并行环境数(num_envs)、单任务训练总迭代数/总耗时:论文未披露具体数字,仅披露课程第三阶段”每 2000 次迭代正则权重提高 20%,直至翻倍”这一相对量。
  • 策略网络:Actor/Critic 均为 [512,256,128] MLP;好奇心哈希网络为单隐藏层 32 单元、16 维输出的随机冻结小网络,参数量可忽略。
  • 真机平台:Unitree H1 人形机器人(由 GitHub 代码 --task=h1:jumpjack 确认),另有一台 22-DoF 恐龙机器人做跨具身验证(改编自 Shafiee et al. 2023 ManyQuadrupeds 四足平台,论文致谢中提到 Milad Shafiee 协助搭建该硬件)。
  • 控制频率、机载算力、推理延迟/FPS:论文正文与附录均未披露具体的控制频率(Hz)、机载计算平台型号或策略推理延迟数字。
  • 真实世界阶段切换机制:目前依赖动作捕捉系统或人工观察来判定当前接触阶段已完成、触发进入下一阶段(论文在第 6 节局限中明确列为待解决问题,计划未来尝试机载感知)。

评测 benchmark

本文没有给出跨方法的数值成功率/精度基准表,评测以定性演示+消融为主(基于最具挑战性的跳跃任务):

  • 跳跃任务真机测试:受限于场地条件,仅测试了双脚同时接触序列(1-2 次连续跳跃),在不同石阶高度/间距及“hug”上肢姿态下均展现出高动态、可适应的跳跃行为;仿真中验证了对未见碎石地形的鲁棒性。
  • 箱体搬运真机测试:机器人可高效转身、在行走与拾取间无缝切换、边接近目的地边抬箱;能从”踩到系在自己身上的绑带”这一意外扰动中恢复。
  • 跳舞真机测试:成功学到含精确踏点+可选拍手的动态跳舞策略并部署真机。
  • 攀爬真机测试:仿真中对推力扰动和未见碎石具有鲁棒性;真机用人手持木板模拟崖壁,机器人能适应手部接触力的变化。
  • 消融实验(均在跳跃任务上做)
    • 去掉稠密接触奖励(换 0-1 奖励)→ 机器人无法探索出跳跃,只原地跟踪上肢姿态不动。
    • 去掉阶段计数奖励 → 机器人故意不满足接触目标以停留在当前阶段”吃”其他奖励,验证该奖励项对推进探索的必要性。
    • 去掉好奇心奖励 → 同样无法探索出跳跃(欠探索);换成 RND 式好奇心 → 机器人学会”危险地向后倾斜”这种在 Burda et al. RND 论文中记录过的过拟合行为(罕见但存活的危险状态被过度探索);本文的计数哈希式好奇心则能有效探索且不过拟合特定行为模式。
    • 训练稳定性:5 个不同随机种子的跳跃任务学习曲线(好奇心值与阶段完成进度)在 Appendix C(Figure 9)中显示对随机网络初始化和探索过程稳定收敛。
  • 论文明确说明:跳跃任务被认为是四项任务中最具挑战性的,出于训练成本考虑消融实验只在该任务上做,未对其余三个任务重复消融。

创新点与影响

  • 首次证明单一端到端 RL 策略(未使用任何动作参考/动捕先验)可以在真实人形机器人上解决 4 类高动态全身接触任务(跳跃、箱体搬运、跳舞、攀爬),且据作者所知均为各自任务首次由单一端到端 RL 策略解决。
  • 提出把任意接触序列任务分解为”接触阶段”的统一形式化,使得跨任务的任务无关奖励(r_WoCoCo + r_reg)可以完全复用,每个新任务只需设计 1-2 条直觉化任务奖励,从而摆脱以往工作依赖有限状态机、为每次接触转移单独调参调奖励的模式。
  • 三项具体奖励设计的贡献点:稠密逐末端执行器接触计数奖励(优于 0-1 奖励)、阶段计数奖励(解决”策略故意滞留当前阶段”问题)、基于随机网络哈希的计数式好奇心奖励(比 RND 更抗过拟合、任务无关观测下依然稳定)。
  • 通过 22-DoF 恐龙机器人的球体操作任务证明框架的跨具身通用性,不局限于双足人形拓扑。
  • 论文自陈局限(第 6 节):1)不像模型式方法那样能显式判断”当前是否存在可行解”,无法提前预知控制器何时会失败,未来可探索失败预测器和安全评估方法;2)目前依赖动作捕捉作为真机原型的阶段切换手段,需要未来接入机载感知;3)目前依赖启发式预定义的接触阶段序列,未来计划探索基于采样的规划器或 LLM 式高层规划器自动生成接触序列;4)阶段切换目前需要显式的接触反馈(传感器或人工判断),未来可探索让策略隐式管理该切换过程。

原始链接

一手源存档(sources/)