一句话定位

CoRL 2024:把 CoRL 2023 四足跑酷的「特权 scandot 预训练 → DAgger 蒸馏纯视觉学生」范式搬到 Unitree H1 人形机器人,用地形分形噪声(fractal noise)替代运动参考或「feet air time」reward 让脚自动抬高,训出单一端到端视觉全身控制跑酷策略:可跳上 0.42m 平台、跨 0.8m 沟、越栏架,野外奔跑达 1.8m/s;并验证手臂被遥操作覆盖时不会破坏下肢跑酷的平衡。

背景与定位

跑酷对人形机器人是比四足更难的「grand challenge」:人形自由度更多、转动惯量分布更不利、动力容量更受限。论文指出已有人形运动学习方法要么(1)单条轨迹离线优化(如 Boston Dynamics Atlas 的工程化跑酷,非学习、难泛化),要么(2)需要大量运动参考/动作先验的 RL 行走(只能平地走)。并行工作多用「feet air time」reward 或动作参考让人形学会抬脚,这类做法与本文对比的 baseline 正是这条路线(如 exbodyh2o-human2humanoid 这类依赖人体动作模仿/遥操作 retarget 的人形全身控制工作)。

方法脉络直接延续同一作者组的 特权-学生蒸馏(teacher-student distillation) 范式——前作 robot-parkour-learning(CoRL 2023,四足 A1/Go1,同一作者 Ziwen Zhuang)用软硬动力学两阶段 RL + DAgger 蒸馏出纯视觉跑酷策略;本文是该范式向人形的延伸,但改用地形分形噪声(借自四足文献中鼓励抬脚步态涌现的技巧,替代前作与并行人形工作依赖的显式抬脚 reward/动作参考)simplify 训练目标。与并行的四足工作 extreme-parkour-legged-robots(Cheng et al. 2023,单阶段 RL)也在本文的蒸馏消融中直接对比:其单 GPU、从零蒸馏的做法被证明在人形上明显更差。

模型架构

无 VLM,backbone 是从头训练的小型 GRU+MLP / CNN 网络(延续四足前作架构,规模基本不变):

  • Oracle(特权)策略
    • Scandot 编码器:MLP,输入 s^scandot_t ∈ R^{11×19},输出 32 维地形 embedding。
    • 状态估计器:GRU+MLP,用本体感知 s^proprio_t ∈ R^43(roll/pitch、base 角速度、各关节位置与速度)+ 上一动作 a_{t-1} ∈ R^19 估计线速度 v̂_t ∈ R^3
    • Actor:单层 GRU(hidden 256)+ MLP [512, 256, 128](CELU 激活),输入地形 embedding + 估计速度 + 本体感知,输出全身 19 个关节的目标位置 a_t
    • Value 网络与 actor 同构,但直接用仿真里的真值线速度(特权信息)。
    • PPO 优化([65])。
  • 学生(parkour)策略:GRU 状态估计器与 actor 直接从 oracle 权重初始化(非随机初始化),scandot 编码器替换为随机初始化的 CNN 深度编码器:channels [16, 32, 32]、kernel [5, 4, 3]、stride [2, 2, 1]、MaxPool、输出 embedding 32 维,输入深度图 I_t ∈ R^{48×64}(真实/仿真中均从 480×640 原始分辨率降采样而来)。
  • Action head:连续目标关节位置(19 维,覆盖腿+臂+腰),经各关节独立 kp/kd 的 PD 控制器转矩输出;不是离散 token / diffusion / flow。
  • Cross-embodiment:无——仅 Unitree H1 单一本体,未做跨本体设计或声明。

数据

无任何离线数据集或动作参考/MoCap;全部数据来自 IsaacGym 仿真 rollout(PPO 在线交互 + DAgger 蒸馏):

  • 并行规模:4096 个仿真环境(H1 机器人)同时训练/采样。
  • 地形:10 种类型(jump up/down、leap、hurdle、stairs up/down、slope、tilted ramp、discrete、wave),排布成 10 行 × 40 列网格,每列固定一种障碍、每行难度线性递增;自动课程——机器人走完 ≥3/4 子地形长度则升级难度,走不到 1/2 则降级。
  • 障碍关键参数范围(训练/测试,Table 6):跳高 0.2–0.5m / 0.2–0.6m;下落高度 0.1–0.6m / 0.2–0.6m;跨沟长度 0.2–1.2m / 0.2–1.2m;坡度 0.2–0.42rad / 0.2–0.4rad;上楼梯高 0.1–0.3m / 0.1–0.3m、长 0.3–0.5m / 0.3–0.5m;栏架高 0.05–0.5m / 0.1–0.5m;斜坡角 0.2–0.5rad / 0.2–0.4rad。
  • 域随机化(Table 3,4096 个环境各自采样):附加质量 [-1.0, 5.0]kg;质心 x [-0.1,0.1]/y [-0.15,0.15]/z [-0.2,0.2] m;摩擦系数 [-0.2, 2.0](原文即如此,未做二次说明);电机强度 [0.8, 1.2];本体感知延迟 [0.005, 0.045]s;深度相机 FoV [86°, 90°]、延迟 [0.06, 0.12]s、位置 x [0.1,0.12]/y [-0.02,-0.015]/z [0.64,0.7] m、roll/pitch/yaw [-0.1,0.1]/[0.77,0.99]/[-0.1,0.1] rad。
  • 仿真-真实深度图差距:仿真侧对渲染深度图施加 clipping + 多级高斯噪声 + 随机 artifact 来模拟 RealSense D435i 噪声模式;真实侧对采到的立体深度图做 clipping + hole filling + 空间/时间平滑(RealSense 内置滤波)。
  • 蒸馏的动作标注:DAgger,教师(oracle 特权策略)在学生轨迹上实时提供连续动作标签,学生-教师动作用 L1 loss 对齐;不涉及人工/人类动作标注。
  • 纯 sim-to-real zero-shot,无真机数据采集,无与其他数据源的 co-training。

训练方法

三阶段流水线,全程无动作参考:

  1. 平地行走预训练:在带分形噪声高度场的平地上用 PPO 训练一个跟随 x/y/yaw 速度指令的行走策略(指令范围 x∈[-0.8,2.0]m/s、y∈[-0.8,0.8]m/s、yaw∈[-1,1]rad/s);reward=任务项(速度跟踪+能耗)+正则项(力矩/关节加速度/速度/接触力惩罚)+安全项(臂/腰/髋偏转惩罚、双脚防并拢、动作变化率)。为让机器人在直线跑酷赛道上仍保留转向能力,设计自动转向指令v_yaw^cmd=α_yaw·(θ_goal-θ),角度差≥π/2 时前向指令强制为 0。
  2. Oracle 跑酷策略训练:在同一 reward 基础上加两项:穿透惩罚(针对 jump/leap 边缘投机行为,引入虚拟障碍与穿透深度 d(p)r_penetrate=α_penetrate·Σ_p d(p)·‖v(p)‖α_penetrate=-5×10⁻³);踏步引导 reward(针对楼梯,鼓励踩在台阶中点,r_step=α_step·(-ln‖d_x‖)α_step=6)。10 种地形自动课程下用 PPO 训练。
  3. 蒸馏(DAgger):学生 GRU/MLP 权重从 oracle 初始化(非随机)+ 随机初始化 CNN 深度编码器;用 4×Nvidia 3090、4 进程(1 训练进程持续加载学生轨迹与教师动作标签,3 采集进程用 oracle 作教师收集并标注学生轨迹,进程间共享文件系统通信)加速;L1 loss 对齐连续动作。消融证明「从 oracle 初始化」与「多卡加速」两者同时缺一不可(单卡或从零蒸馏均显著更差,见评测部分)。

PPO 超参(Table 5):clip 0.2、GAE λ 0.95、学习率 3e-5、折扣因子 0.99、最小策略 std 0.2、4096 并行环境、每 batch 24 步、5 epoch、4 mini-batch。

部署为纯 zero-shot sim-to-real,真机上不做任何微调。

Infra(训练 / 推理工程)

  • 蒸馏训练:4×Nvidia 3090(消费级 GPU),24 小时训练预算下对比吞吐——单卡方案 24 小时仅处理 4.147×10⁶ transitions,4 卡方案达 432×10⁶ transitions(约 104 倍,非线性于卡数,反映 IsaacGym 深度图渲染是单卡管线的主要瓶颈)。RL 预训练(Stage 1/2,无需渲染深度图,scandot 直接存于 GPU 显存)所用 GPU 数量与训练时长论文未披露。精度未披露(默认应为 fp32)。
  • 推理部署:Unitree H1(19 关节,含臂+腰),机载 12 核 Intel i7 NUC(无 GPU),视觉编码器与其余网络跑在两个独立 Python 进程,经 Cyclone DDS + ROS2 通信与收发电机指令。深度图来自头部 Intel RealSense D435i,480×640 原始分辨率降采样到 48×64。视觉编码器进程 10Hz 出图像 latent;GRU 主策略网络 50Hz 运行;本体感知经 Cyclone DDS 以 500Hz 发送;电机内置 PD 控制器以 1000Hz 计算力矩。目标关节位置按力矩上限做 clip 保护:clip(q_target, (kd·q̇-τ_max)/kp+q, (kd·q̇+τ_max)/kp+q)
  • 关节 kp/kd/力矩上限(Table 8):肩 pitch/roll kp30·kd1·40Nm;肩 yaw、肘 kp20·kd0.5·18Nm;躯干 kp200·kd3·200Nm;髋 yaw kp60·kd1.5·200Nm;髋 roll/pitch kp220·kd4·200Nm;膝 kp320·kd4·300Nm;踝 kp40·kd2·40Nm。

评测 benchmark

仿真:分形噪声 vs. “feet air time” reward 消融(Table 2/9/10,每种地形=3 段连接子赛道、难度线性递增,总长 14.4m;成功率=10 台机器人中跑完最大难度的比例,v2 文本注明按 10 次跑取平均):

技能Fractal(本文)成功率/距离feet_air_time 成功率/距离
Jump up90% / 14.3m80% / 9.81m
Leap80% / 14.0m50% / 13.4m
Stairs up100% / 14.4m90% / 13.6m
Hurdle100% / 14.4m20% / 12.1m
Jump down100% / 14.4m100% / 14.4m
Slope100% / 14.4m100% / 14.4m
Stairs down100% / 14.4m100% / 14.4m
Discrete100% / 14.4m100% / 14.4m
Wave100% / 14.4m30% / 11.6m
Tilted ramp100% / 14.4m100% / 14.4m

结论:分形噪声在 hurdle、leap、jump up、wave 上明显优于 feet_air_time reward(后者与部分技能的运动模式冲突),其余技能两者打平。

蒸馏方法消融(Table 11–13,24 小时训练预算,v2 文本注明每设置跑 20 trials):

技能From scratch单 GPU(无 oracle 加速)本文(oracle 初始化+4GPU)
Jump up0% / 2.6m40% / 8.6m85% / 13.8m
Leap0% / 2.8m45% / 10.2m80% / 14.0m
Stairs up5% / 3.4m65% / 9.8m100% / 14.4m
Hurdle10% / 7.3m25% / 7.2m95% / 14.1m
Jump down15% / 7.6m80% / 13.2m100% / 14.4m
Slope20% / 5.1m70% / 9.8m100% / 14.4m
Stairs down0% / 2.4m65% / 9.2m100% / 14.4m
Discrete0% / 2.3m75% / 11.6m100% / 14.4m
Wave10% / 6.7m85% / 13.1m100% / 14.4m
Tilted ramp5% / 5.5m85% / 12.9m100% / 14.4m

真实世界:室内定量实验对比本文视觉跑酷策略 / 盲行走策略 / Unitree H1 自带 MPC 控制器(并用 H1 官方 UI 把抬脚高度调高以帮助其越障)在 4 个最难任务上的表现(Figure 4,v2 文本注明每配置跑 10 trials)——原文以柱状图图片给出具体数字,正文未提供可提取的逐任务成功率表格,此处只能定性转述「本文策略在 4 个任务上均取得最佳表现」,不编造图中读数。真实世界能力的文字化描述:跳上 0.42m 平台、跨 0.8m 沟、越 0.25m 泡沫栏架、走 0.2m/0.5m 缘石坡道及楼梯、野外奔跑达 1.8m/s。论文未与同期其他人形跑酷系统做直接数值对比(同类工作在当时尚不存在覆盖全部 10 种地形的单一人形策略),基线仅为自身消融 + H1 出厂 MPC。

创新点与影响

  • 贡献(原文自述):(1) 覆盖 ≥10 种人类可通过地形的统一人形跑酷学习系统,全程无动作参考;(2) 用地形分形噪声替代「feet air time」reward/动作先验,让抬脚步态自然涌现,避免多技能 reward 工程互相冲突;(3) 证明「从 oracle 初始化学生 + 4-GPU DAgger 加速」对人形(相比四足自由度更高、稳定裕度更小)蒸馏视觉策略是必要组合,单卡或从零蒸馏均显著更差;(4) 验证手臂被遥操作覆盖(跳出策略分布)时不破坏下肢跑酷平衡,为迁移到移动操作任务铺路。
  • 影响:把 CoRL’23 四足特权蒸馏范式(robot-parkour-learning)首次扩展到全尺寸人形(Unitree H1),用单一策略统一 10 种地形且零动作参考,为同期依赖动作模仿/feet-air-time 的人形全身控制路线(如 exbodyh2o-human2humanoid)提供了「纯地形随机化也能涌现敏捷人形步态」的反例证据。
  • 作者自陈局限:依赖人工构造的仿真地形,难以在无额外训练的情况下泛化到未见过的地形类型;跑酷是极高难度的全身控制任务,若要进一步支持更复杂的操作(manipulation)同时保持跑酷能力,需要额外调优以避免破坏视觉/运动系统;未来方向是研究如何在保留极限运动能力的同时协同训练操作技能。

原始链接

一手源存档(sources/)