一句话定位
PBHC(论文自称的方法名,项目/仓库对外叫 KungfuBot)用一条”视频抓取 → 物理过滤 → 接触校正 → IK 重定向”的动作处理流水线,配合一个把跟踪容差 σ 显式建模成双层优化(bi-level optimization)问题、在线自适应收紧的跟踪奖励机制,让 Unitree G1 人形机器人零样本 sim-to-real 学会拳击组合拳、跳踢、360 度回旋踢、太极等高动态动作;NeurIPS 2025 收录。
背景与定位
人形机器人模仿人类动作(motion imitation)这条线此前的方法——ASAP、OmniH2O、ExBody2、HumanPlus 等——普遍只能稳定跟踪低速、平滑的动作:一是人类动捕/视频重建出的参考动作常违反机器人的关节限位、动力学约束,直接拿来跟踪训练会落入不可行解空间;二是跟踪奖励里的容差参数(tracking factor/σ)通常靠人工试错固定,对不同难度的动作缺乏统一的选取依据,也没有随训练进度调整的机制。已有的应对思路各有局限:OmniH2O/ExBody2 用一个预训练的特权模仿策略或语言标签去筛掉不可行动作,构造”干净”数据集,但预训练该 teacher 本身成本不低;ExBody2 用跟踪误差衡量动作难度但仍需先训一版初始策略;ASAP引入残差动作模型补偿 sim-to-real 动力学 gap,但需要 4 个训练阶段外加真机动捕系统记录真实机器人状态做残差训练数据。
本文属于同一个”物理引导的人形全身模仿控制”范式,贡献分两块:(i) 一条尽量把物理约束前移到数据处理阶段的动作处理流水线;(ii) 把”选多大的跟踪容差”从人工调参形式化为一个双层优化问题,推导出理论最优 σ 应等于收敛后跟踪误差的均值,并设计一个在线 EMA 反馈的自适应更新规则,替代人工/固定容差调参,构成一个不需要 teacher-student 预训练、不需要真机动捕的两阶段(离线动作处理 + 单阶段 RL 训练)框架。后续工作 KungfuBot2(arXiv 2509.16638,同一仓库支持)把方法从单动作模仿扩展到通用动作跟踪。
模型架构
策略骨干:非 VLM/无视觉输入,是纯本体感知(proprioception)驱动的 MLP 策略,PPO 训练的非对称 actor-critic:
- Actor 观测 s_actor:5 步历史的本体状态 s_prop + 时间相位变量 φ_t(φ=0 表示动作起点,φ=1 表示终点),维度共 380(关节位置 23×5、关节速度 23×5、根角速度 3×5、根投影重力 3×5、动作历史 23×5、相位 1×5)。Actor MLP 结构 [512, 256, 128],激活 ELU。
- Critic 观测 s_critic:在 actor 观测基础上额外拼接根线速度、参考动作的身体位置、当前与参考身体位置之差,以及一组域随机化物理参数(基座质心偏移、连杆质量、刚度、阻尼、摩擦系数、控制延迟),维度共 630。Critic MLP 结构 [768, 512, 128]。
- Action space:a_t ∈ R^23,PD 控制器的目标关节角(G1 机器人 23 个可控自由度,不含双手各 3 个手腕自由度)。
动作头:连续目标关节位置(非离散 token、非 diffusion/flow),PD 控制器把目标位置转成电机力矩;PD 增益按关节分组给定(如肩部 kp=100/kd=2.0,膝盖 kp=150/kd=4.0,踝关节 kp=40/kd=2.0,腰部 kp=400/kd=5.0,详见论文 Table 9)。
跟踪奖励的核心机制——自适应跟踪因子(Adaptive Motion Tracking):多数跟踪奖励项采用指数形式 r(x) = exp(-x/σ),x 为跟踪误差(如关节角 MSE),σ 为”跟踪因子”控制容差。论文把”选 σ”形式化为双层优化:外层最大化收敛后策略的负累计跟踪误差 J^ex(x*) = Σ(-x_i*),内层策略在给定 σ 下最大化简化累计奖励 J^in(x,σ)=Σexp(-x_i/σ) 加上其余效应项 R(x)(线性形式)。用隐函数梯度求解,证明最优 σ* 等于收敛后误差序列的均值 σ* = (Σx_i*)/N(完整推导见论文 Appendix A)。由于 σ* 与 x* 存在循环依赖无法直接求解,论文设计在线自适应更新:维护瞬时跟踪误差的 EMA 估计 x̂,每步令 σ ← min(σ, x̂),即 σ 只减不增、随误差下降而收紧,形成误差估计与容差收紧的反馈闭环,收敛到理论最优附近。
记忆/一致性:无显式 world model/memory 模块;用参考状态初始化(Reference State Initialization, RSI)从参考动作的随机时间相位初始化机器人状态,加速不同动作阶段的并行学习;奖励向量化(reward vectorization)——不把多个奖励项加权成单一标量,而是每个奖励分量 r_i 各自对应一个 value head V_i(s),多头 critic 独立估计各分量的回报,聚合后计算 advantage,用于稳定多目标价值估计(沿用 Xie et al. 2025 的做法)。
跨本体:单一本体 Unitree G1(23 自由度),未做跨本体/多机器人泛化实验。
数据
规模:13 条参考动作,分 easy/medium/hard 三档难度,帧数从 145(跳踢)到 610(Charleston 舞)不等(详见论文 Table 4),例如 Jabs punch 285 帧、Hooks punch 175 帧、Tai Chi 500 帧、360-degree spin 180 帧、Roundhouse kick 158 帧。
来源与混合比例:三类来源混合——(i) 单目视频(本文自建的动作处理流水线产出,13 条中多数来自 video);(ii) 开源动捕数据集 AMASS(如 Bruce Lee’s pose、Roundhouse kick、Side kick);(iii) LAFAN(如 Horse-stance pose、Charleston dance)。开源数据集的动作只部分走本文流水线(接触掩码估计、动作校正、重定向三步,跳过视频估计与物理过滤两步)。
动作处理流水线(四步):
- SMPL 动作估计:用 GVHMR 从单目视频重建 SMPL 格式动作,其重力-视角坐标系天然对齐重力、避免相机坐标系导致的躯干倾斜问题,并通过预测脚部静止概率缓解滑步伪影。
- 物理过滤(filtering):借鉴 IPMAN 提出的”质心(CoM)—压力中心(CoP)投影距离越近越稳定”准则,定义稳定帧判据 Δd_t = ||CoM_proj - CoP_proj|| < ε_stab(ε_stab=0.1),并要求首尾帧稳定、最大连续不稳定帧数 < ε_N=100;论文对 10 条候选动作做过滤实验:4 条被拒、6 条被接受,被拒动作的最大 Episode Length Ratio(ELR,训练后平均 episode 长度/参考动作长度)仅 54%,验证了过滤准则对”不可跟踪动作”的筛除效果。
- 接触掩码校正(contact-aware correction):基于零速度假设估计脚踝接触掩码 c_t = I[||p_{t+1}-p_t||² < ε_vel] · I[p_{t,z} < ε_height](ε_vel=0.002, ε_height=0.2),标注准确率 91.4%(10 条人工标注动作上评估);据此对全局平移做竖直方向的漂浮伪影校正 ψ_z^corr = ψ_z - Δh_t(Δh_t 取 SMPL mesh 顶点最低 z 坐标),再用 EMA 平滑校正引入的帧间抖动。
- 动作重定向:用 Mink(差分 IK)方法把处理后的 SMPL 动作重定向到 G1 机器人,同时兼顾末端执行器轨迹对齐与关节限位约束(仓库里也支持切换用 PHC 的重定向管线)。
Action-labeling:无人工动作标注,跟踪目标直接是重定向后的参考关节角/身体位置/速度序列;接触标签由零速度假设自动估计而非人工标注。
Sim-vs-real:训练在 IsaacGym 仿真环境中完成,全部零样本迁移到真机,无任何微调(zero-shot sim-to-real);训练中做域随机化(friction、PD gain、link mass、ankle inertia、base CoM offset、ERFI、control delay 等,详见下方 Infra 一节),并先在 MuJoCo 做 sim-to-sim 验证后再上真机。
Co-training:无跨任务/跨动作联合训练——论文自己在 Limitations 中指出,每个策略只针对单一动作训练,尚不支持多动作统一策略。
训练方法
目标函数:PPO(Schulman et al. 2017)+ 混合奖励 r,由任务跟踪奖励与正则化奖励构成(完整奖励表见论文 Table 6)。任务奖励主项包括关节位置/速度指数跟踪、身体位置/旋转/速度/角速度指数跟踪、VR 三点跟踪(权重 1.6)、脚部位置跟踪(权重 1.0)、最大关节位置误差跟踪(权重 1.0)、接触掩码跟踪(1 - ||c-ĉ||₁/2,权重 0.5);正则化项含关节位置/速度/力矩软限位惩罚(分别 -10.0/-5.0/-5.0)、滑步惩罚(-1.0)、脚部接触力惩罚(-0.01)、悬空时间惩罚(T_air>0.3s 时 -1.0)、绊倒惩罚(-2.0)、力矩惩罚(-1e-6)、动作变化率惩罚(-0.02)、碰撞(-30)、提前终止(-200)。
多阶段流程:整体是两阶段——(1) 离线动作处理(4 步流水线,见”数据”节);(2) 单阶段 RL 训练(无需先训 teacher 再蒸馏 student,区别于 OmniH2O/ExBody2 的 teacher-student 范式)。
RL/imitation:纯 RL 模仿学习(非对抗式模仿,不用 GAN/AMP),核心创新是”自适应跟踪因子”机制(见”模型架构”节的双层优化推导与 σ ← min(σ, x̂) 更新规则)。
课程学习:论文另设计两条课程,与自适应跟踪因子机制并行:
- 终止课程(Termination Curriculum):早期 episode 终止阈值 θ 较宽松(初值 θ=1.5),随训练按 θ ← clip(θ·(1-δ), θ_min, θ_max) 逐渐收紧(θ_min=0.3, θ_max=2.0, 衰减率 δ=2.5e-5),逐步提高动作偏差容忍度的严格程度。
- 惩罚课程(Penalty Curriculum):正则化项权重 α 从 0.1 逐步增长到上限 1.0(α ← clip(α·(1+δ), 0, 1.0),增长率 δ=1.0e-4),早期弱正则化便于探索,后期强正则化保证物理合理性。
关键超参(PPO,论文 Table 8):Adam 优化器,batch size 4096,4 个 mini-batch,5 个 epoch/迭代,entropy coefficient 0.01,value loss coefficient 1.0,clip param 0.2,max grad norm 1.0,init noise std 0.8,learning rate 1e-3,desired KL 0.01,GAE λ=0.95,γ=0.99。关节软限位比例 α=0.95(相对硬限位对称缩放)。
Infra(训练 / 推理工程)
训练硬件:单机单卡——24 核 Intel i7-13700 CPU(5.2GHz)+ 32GB RAM + 单张 NVIDIA GeForce RTX 4090,Ubuntu 20.04;每个动作对应策略训练 27 小时(单卡单动作,13 个动作各自独立训练一个策略,未披露是否并行跑多卡/多动作)。
Baseline 训练成本对照(用于突显 PBHC 单阶段训练的效率优势):OmniH2O 的 teacher/student 两阶段分别训练 20/10 小时;ExBody2 同样 teacher/student 20/10 小时;MaskedMimic 仅用其三阶段流程中的第一阶段,训练 18 小时。
并行化/精度:训练环境为 IsaacGym(GPU 并行仿真),未披露具体并行环境数、是否用混合精度。
域随机化(Table 8):摩擦系数 U(0.2, 1.2),PD 增益 U(0.9, 1.1),连杆质量 U(0.9, 1.1)×默认值,踝部惯量 U(0.9, 1.1)×默认值,基座质心偏移 U(-0.05, 0.05)m,ERFI 0.05×力矩上限,控制延迟 U(0, 40)ms;外部扰动:随机推力间隔 [5,10]s、推力速度 0.1m/s。踝关节惯量为提升仿真数值稳定性被手动固定为 5e-3。
推理/部署:真机为 Unitree G1,机载运动控制板通过 DDS 协议 + 以太网把传感器数据传给外部 PC;PC 维护观测历史、执行策略推理、把目标关节角回传控制板下发电机指令。论文未披露具体推理帧率/控制频率(Hz)或延迟数值,仅通过与 MuJoCo sim-to-sim 平台的指标对比(见下)验证部署一致性。
评测 benchmark
仿真主实验(Table 1,与三条 baseline:OmniH2O、ExBody2、MaskedMimic 对比;MaskedMimic 因不考虑部分可观测性和动作平滑性、不可直接部署真机,被论文定位为”oracle 式下界”而非直接对比对象;三档难度各用 3 个随机种子训练、每设置评测 1000 条 rollout episode):
| 难度 | 指标 | OmniH2O | ExBody2 | Ours (PBHC) | MaskedMimic(Oracle) |
|---|---|---|---|---|---|
| Easy | E_g-mpbpe(mm)↓ | 233.54 | 588.22 | 53.25 | 41.79 |
| Easy | E_mpjpe(1e-3 rad)↓ | 1805.10 | 4014.40 | 725.62 | 739.96 |
| Medium | E_g-mpbpe(mm)↓ | 433.64 | 619.84 | 126.48 | 150.92 |
| Medium | E_mpjpe(1e-3 rad)↓ | 2333.90 | 3738.70 | 1043.30 | 934.25 |
| Hard | E_g-mpbpe(mm)↓ | 446.17 | 689.68 | 290.36 | 47.74 |
| Hard | E_mpjpe(1e-3 rad)↓ | 1939.50 | 4037.40 | 1326.60 | 829.02 |
(完整六项指标 E_g-mpbpe/E_mpbpe/E_mpjpe/E_mpbve/E_mpbae/E_mpjve 及各自标准差见论文 Table 1;PBHC 在三档难度上全面优于 OmniH2O 与 ExBody2,但在 Hard 档上仍明显落后于不考虑物理可部署性的 MaskedMimic oracle。)
动作过滤消融(Q1):10 条候选动作里 4 条被物理过滤剔除、6 条通过;训练后接受动作的 ELR 明显更高,被拒动作最高 ELR 仅 54%。
自适应跟踪因子消融(Q3,Table 12,四条固定容差配置 Coarse/Medium/UpperBound/LowerBound 对照自适应机制):以 Jabs punch 为例,Ours E_mpbpe=28.00mm,优于 Coarse 36.76mm、Medium 30.93mm,与 Upperbound 28.72mm/Lowerbound 28.97mm 相当;但在 Bruce Lee’s pose 上 Ours E_g-mpbpe=196.22mm 显著优于 Medium 的 470.24mm,说明固定容差在不同动作间难以稳定取到最优点,而自适应机制在所有动作上都接近最优。
接触掩码消融(Table 13):以接触掩码误差 E_contact-mask 及其余指标衡量。Charleston dance 上效果明显:E_contact-mask 有掩码 217.82 vs 无掩码 633.91,E_mpbpe 43.09mm vs 76.13mm;Jump kick 上同样明显:E_mpbpe 42.58mm vs 170.28mm,E_mpbve 9.48 vs 16.92mm/frame。Roundhouse kick 上 E_contact-mask 差距较小(243.16 vs 250.10),且 E_mpbve/E_mpbae 两项去掉接触掩码后反而略降(6.85→6.16mm/frame、7.33→6.46mm/frame),说明该项设计的收益在不同动作间不完全单调,但论文整体以 Charleston dance、Jump kick 上的显著差距论证接触掩码设计的有效性。
真机部署定量结果(Table 2,太极动作 10 次试验,与 MuJoCo sim-to-sim 平台对比):
| 平台 | E_mpbpe(mm)↓ | E_mpjpe(1e-3 rad)↓ | E_mpbve(mm/frame)↓ | E_mpbae(mm/frame²)↓ | E_mpjve(1e-3 rad/frame)↓ |
|---|---|---|---|---|---|
| MuJoCo | 33.18±2.72 | 1061.24±83.27 | 2.96±0.342 | 2.90±0.498 | 67.71±6.747 |
| Real | 36.64±2.59 | 1130.05±9.478 | 3.01±0.126 | 3.12±0.056 | 65.68±1.972 |
真机指标与仿真高度接近,验证 zero-shot sim-to-real 迁移的稳定性。真机上还定性展示了拳击组合拳(刺拳、勾拳、马步冲拳)、多种踢法(前踢、跳踢、侧踢、后踢、回旋踢)、360 度回旋、深蹲拉伸、舞蹈与太极等动作。
创新点与影响
贡献:(1) 把”跟踪容差该设多大”从人工试错形式化为双层优化问题并给出解析解(最优 σ 等于收敛后误差均值),提供了一个此前该领域缺失的理论依据;(2) 基于该解析解设计的在线 EMA 自适应更新规则,替代人工调参或需要预训练 teacher 的固定容差方案,用单阶段 RL 就能训出可零样本部署的策略;(3) 一条把物理约束(CoM-CoP 稳定性、接触掩码)前移到动作数据处理阶段的流水线,量化验证了过滤/校正对可跟踪性的提升(被拒动作 ELR≤54%、接触掩码标注准确率 91.4%);(4) 在真实 Unitree G1 上首次展示了成套武术/舞蹈类高动态动作的零样本 sim-to-real 部署。
论文自陈局限:(i) 缺乏环境感知能力(无地形感知、无避障),限制了在非结构化真实环境中的部署;(ii) 每个策略只针对单一参考动作训练,尚未支持一个策略泛化到多样动作库,作者将”保持高动态性能同时扩展到更广泛技能”列为未来方向——这一方向由同一团队的后续工作 KungfuBot2(arXiv 2509.16638,2025-09,同一 GitHub 仓库已支持通用动作跟踪)接续。
原始链接
- arXiv: https://arxiv.org/abs/2506.12851
- PDF: https://arxiv.org/pdf/2506.12851
- 项目页: https://kungfubot.github.io/
- GitHub: https://github.com/TeleHuman/PBHC
- 后续工作 KungfuBot2: https://arxiv.org/pdf/2509.16638
一手源存档(sources/)
- kungfubot—github-readme — GitHub README 快照(含 KungfuBot2 后续工作信息、仓库文件夹结构、License、Acknowledgements)
- arXiv 原文 PDF:https://arxiv.org/pdf/2506.12851(arXiv 原文 PDF,不入 git)