一句话定位
BeyondMimic 用一套统一 MDP + 同一份超参把 LAFAN1 里几分钟长的人类动作参考训练成能上真机(Unitree G1)、达到 SOTA 动作质量的跟踪策略(跳跃转体、冲刺、侧空翻),再把选出的策略离线蒸馏进单一”状态-动作联合扩散”策略,靠测试时的 loss 引导(classifier guidance)零样本完成路径导航、摇杆遥操、避障等下游任务——号称首个把 loss-guided diffusion 用到真实人形整体控制的框架。
背景与定位
这是 UC Berkeley Hybrid Robotics(Liao / Huang / Sreenath)与 Stanford(Truong / Tevet / C. Karen Liu)合作的工作,属于 DeepMimic 范式(从人类动作参考学习自然、动力学可行的整体控制)在真机上的延展。论文自陈补齐了两块缺口:(1) 一个可规模化、高质量、能做极端动态动作、且不靠过度域随机化的运动跟踪框架;(2) 一个能把多个学到的动作原语蒸馏进单一策略、并在测试时组合它们解下游任务的方法。
- 跟踪侧对标单动作专用工作:asap(real-to-sim delta action,易过拟合短动作)、KungfuBot、HuB(精调域随机化,但只单动作);以及多动作跟踪 phc-perpetual-humanoid-control(PHC,动画界标杆)、OmniH2O / Exbody / HumanPlus(质量退化明显)、twist(偏静态)、gmt(牺牲全局轨迹换鲁棒)。论文主张:真机上”多动作 + 高质量 + 高动态”此前未被同时实现。
- 扩散侧承接 diffusion-policy 一脉:与”规划器+低层控制器”两段式(存在 planning-control gap)区分,也与仅学 state→action 分布、缺测试时引导机制的 hugwbc(HugWBC,人形扩散策略在线蒸馏)区分。BeyondMimic 走第三条路线——状态-动作联合扩散,直接复用 Diffuse-CLoC / PDP 的鲁棒离线蒸馏,把 Diffuse-CLoC 从物理动画搬到真实机器人。
模型架构
框架分两阶段,各自一套模型。
阶段一:运动跟踪策略 π(RL 策略)
- backbone:MLP 策略(PPO 训练,rsl_rl),无历史——观测是单时间步向量。用非对称 actor-critic 提效。
- 跟踪目标(tracking goal):不追绝对身体位姿(避免 sim-to-real 全局漂移把风格搞坏),而是选一个 reference body b_ref(root/torso)做锚点,把每个目标身体的期望位姿锚定为 T̂_b = T_anchor · T_bref⁻¹ · T_{b,motion};T_anchor 保高度、对齐 yaw、把 xy 原点平移到机器人下方。期望 twist 不变。只跟踪一个子集 B_target(近距离身体不必全追)。
- 观测 o = [c, ξ_bref, root twist, joint pos, joint vel, a_last]:c=[动作参考的关节位置/速度](仅作相位信息,策略不直接追关节值);ξ_bref ∈ ℝ⁹ 是锚点位姿跟踪误差(3 维位置误差 + 旋转误差矩阵前两列)。当无需漂移补偿或状态估计不可靠时,线性位姿误差与线性 root twist 可省。critic 额外喂各身体相对 b_ref 的位姿以直接估计笛卡尔跟踪误差。
- action-conditioning:动作是归一化关节位置设定点 q_j = q̄_j + α_j·a_j,α_j = 0.25·τ_{j,max}/k_{p,j}。低增益下这些设定点不当”目标位置”,而是生成目标力矩的中间量,且不被关节运动学限位裁剪。
- 关节阻抗(低阻抗、贴硬件):k_p = I·ω_n²、k_d = 2·I·ζ·ω_n,取阻尼比 ζ=2(过阻尼,因只算电机 armature 会低估惯量)、自然频率 ω_n=10 Hz(促进柔顺),I = k_g²·I_motor 为反射惯量。
阶段二:引导扩散策略(状态-动作联合扩散)
- backbone:Transformer decoder,6 层、4 注意力头、512 维 embedding,共 19.95M 参数。基于 Diffuse-CLoC 的 state-action co-diffusion。
- 预测未来轨迹 τ_t = [a_t, s_{t+1}, …, s_{t+H}, a_{t+H}],look-ahead 视界 H=16,条件为历史观测 O_t(N=4 步 state-action pairs)。动作预测视界通过 loss masking 限到 8 步。
- 状态/动作用独立的噪声调度 k=(k_s, k_a)。训练时预测干净轨迹 x_{0,θ}(MSE loss),推理按 DDPM 更新迭代去噪。
- 引导(classifier / loss guidance):用 Bayes 把条件分布 score 拆成无条件 score + 引导项,引导项 = 任务代价函数的负梯度 −∇_τ G_τ^c(τ),p(τ*|τ) ∝ exp(−G_τ^c(τ))。单一预训练模型靠不同 cost 在测试时适配不同任务,无需重训。
- 状态表示(关键消融):Body-Pos(全局 root 位姿 + 所有关节的笛卡尔位置/速度)vs Joint-Rot(关节角/角速度)——最终选 Body-Pos。
数据
- 跟踪训练:Unitree-retargeted 的 LAFAN1 数据集(HuggingFace
lvhaidong/LAFAN1_Retargeting_Dataset),含 40 条几分钟长的参考,每条一个大类、内含多个不同动作。随机选 25 条(保证每类至少一条),sim-to-sim 全部可完整跑完;受测试场地限制,另从中挑 29 条高难度片段(动态、富接触)上真机验证。另混入 asap 的 Cristiano Ronaldo 庆祝、KungfuBot 的侧踢、HuB 的单腿平衡/燕式平衡等单动作短片。 - 项目页披露:展示的 24 个片段来自在 14 条不同的 ~3 分钟序列上训练的策略,全部用完全相同的 MDP 设置与超参。
- 扩散训练:AMASS + LAFAN1 中”多样步行动作”的子集。先为每个动作技能训练运动跟踪控制器以生成动作标签(action labeling),再仿 PDP / Diffuse-CLoC 用专家策略 rollout 收集离线数据集——关键差异是加了 action delay 域随机化(因为扩散模型多步去噪导致观测→执行有延迟,测试时在延迟驱动下运行)。
- 动作预处理:把 retargeted CSV(30 fps)经正运动学转成含 body pose / velocity / acceleration 的 npz,走 WandB registry 管理。
训练方法
- 跟踪策略:PPO(rsl_rl),IsaacSim 4.5.0 + Isaac Lab 2.1.0,任务
Tracking-Flat-G1-v0,全程单一 MDP 配置 + 一套超参跨所有动作。- 奖励:DeepMimic 式任务奖励(对每个 target body 算位置/旋转/线速度/角速度四类误差,MSE 后经高斯核 exp(−ē_χ/σ_χ²) 归一化再求和)+ 仅三项正则惩罚(关节软限位 r_limit、动作率平滑 r_smooth 抗抖动、末端自碰撞 r_contact)。可选加锚点全局跟踪奖励。
- 自适应采样(核心训练技巧):把整段动作起始索引切成每段 1 秒的 S 个 bin,按经验失败统计采样(失败率用 EMA 平滑);用非因果指数衰减核 k(τ)=γ^τ 把临近失败权重加大;再与均匀分布按比例 λ 混合以防灾难性遗忘。让训练多采难段、少采易段。
- 终止/重置:锚点身体高度或姿态(pitch/roll)误差超阈、或末端身体高度显著偏离参考即终止;重置时从自适应采样的相位初始化到对应参考构型 + 随机扰动。
- 域随机化:仅三项——地面摩擦系数、默认关节位置 q̄_j(同时作用于动作与观测,模拟关节偏置标定误差)、躯干质心位置;外加环境扰动。作者强调刻意避免过度域随机化(贴准建模 + 定向随机化,而非 real-to-sim 适配或逐动作调随机化参数)。
- 扩散策略:标准 DDPM 去噪训练,MSE loss 预测干净轨迹;20 去噪步、注意力 dropout 0.3。三个下游 cost 函数:
- 摇杆:G = ½·Σ‖V_xy(τ) − g_v‖²(平面 root 速度匹配目标)。
- 路径点:(1−e^{−2d})‖P_x − g_p‖² + e^{−2d}‖V_x‖²,近目标时加大速度惩罚保证到点停下(d 为到目标距离,梯度 detach)。
- 避障:对身体位置建 SDF,用松弛障碍函数 B(x,δ)(x≥δ 取 −ln x,否则二次外推)在 denoising 每步用 CppAD 自动求导得梯度。
Infra(训练 / 推理工程)
- 训练硬件 / GPU 数 / GPU-hours:未披露(论文只给收敛迭代数:长序列加自适应采样约 10k 迭代收敛,不加则 30k 迭代仍失败;Ronaldo 1.5k)。仿真器 IsaacSim / Isaac Lab(sim-to-sim 校验用 MuJoCo)。
- 跟踪策略推理(真机,onboard):Unitree G1,部署代码用 C++ 实时优化;策略用 ONNX Runtime 跑在机器人 CPU 上,每步推理 < 1.0 ms,无缝嵌入实时估计-控制环。全状态估计 500 Hz(广义动量观测器 + Kalman 滤波),不用外部动捕做跟踪;极端富接触动作(如从地上起身)另接 LiDAR-inertial odometry 做位置校正或干脆去掉依赖状态估计的观测。
- 扩散策略推理(offboard):TensorRT 跑在 NVIDIA RTX 4060 Mobile GPU,因延迟在独立线程异步推理,每步约 20 ms(20 去噪步)。联合扩散模型评测时用动捕数据提供环境上下文(算 cost 用的路径点/障碍物位置)并改善状态估计。
- 精度、并行策略:未披露。
评测 benchmark
论文以真机定性演示 + 两个消融为主,未给与外部 baseline 的定量头对头表(而是强调”同一套超参跨所有动作”胜过逐动作专用的 ASAP/KungfuBot/HuB)。
- 真机动作范围(定性,Unitree G1,Table I):四类——(a) 前人展示过的短动态动作(Ronaldo 庆祝、侧踢),可手动切换连做 5 次不掉稳定性/质量(前作只单次);(b) 强平衡静态动作(单腿站、燕式平衡),与 HuB 逐动作调参不同,本框架同超参完成;(c) 极端动态、前所未见动作(单/双腿跳、连续两个侧空翻、往返冲刺、180°/360° 转体跳),且是三分钟长参考里的一部分;(d) 风格化表现性动作(Charleston 舞、太空步、走转爬、老年步态、羽毛球/网球),保留原动作的时序、姿态、表情。
- 自适应采样消融(Table II,收敛迭代数):不加 AS → 加 AS:Ronaldo 3k→1.5k、燕式平衡 2.8k→1.8k;dance1(侧空翻)、dance2(跳转)、fightAndSports1(平衡)在不加 AS 时直接失败,加 AS 后分别 8k / 9k / 10k 收敛。所有长序列不加 AS 在 MuJoCo sim-to-sim 里 30k 迭代仍失败。
- 扩散状态表示消融(Table III,成功率 %,每项 50 次):Walk+Perturb / Joystick Control——Body-Pos State 100 / 80,Joint-Rot State 72 / 0。Joint-Rot 虽更 Markovian,但关节位置的小误差沿运动链累积、更易被扩散预测误差放大;加引导后 Joint-Rot 的摇杆控制会迅速崩掉(base controller 不够鲁棒,引导把它推出分布)。评测任务定义:Walk-Perturb(15 s 步行,每秒施加 0–0.5 m/s 瞬时 root 速度扰动,测仿真跌倒率);Joystick(前/后/左转/右转各 3 s);跌倒=头高 < 0.2 m。
创新点与影响
- 贡献:(1) 开源的可规模化运动跟踪框架——统一 MDP + 单套超参,就能在真机上训出鲁棒、高质量、极端动态的多动作跟踪策略;(2) 首个把 loss-guided(classifier)diffusion 用于真实人形整体控制,靠测试时简单 loss 函数支持零样本多下游任务;(3) 从原始动捕到真机部署的端到端 pipeline(跟踪→扩散蒸馏→部署)。相较逐动作专用工作,最大卖点是”不做 real-to-sim 适配、不逐动作调域随机化参数”仍拿到小 sim-to-real gap,靠的是精准建模+定向随机化+观测/动作空间设计+低延迟 C++ 框架。
- 意外发现:扩散策略在 OOD 场景(跌倒、被龙门架挡住)表现”惰性/温和”,人可安全地把机器人抱回分布内即恢复——不像 RL 策略在这类情况常出错乱危险行为,对真实部署的人机安全有利。
- 作者自陈局限:① 偶发失败源于状态估计漂移,尤其末端接触假设被违背时(起身动作、部分扩散恢复模式),通用状态估计器仍是 open problem;② action-based 扩散模型难在不同技能间过渡——把技能看成流形上的曲线,classifier guidance 能”吸附”到别的曲线,但目标技能在流形上太远时模型会卡在当前模式;③ 跟踪代码可在同型号机器人上复现,但更广泛泛化未验证。
原始链接
- 论文(arXiv abs):https://arxiv.org/abs/2508.08241
- 论文 PDF:https://arxiv.org/pdf/2508.08241
- 项目页:https://beyondmimic.github.io/
- 跟踪训练代码(GitHub,MIT):https://github.com/HybridRobotics/whole_body_tracking
- sim-to-sim / sim-to-real 部署控制器:https://github.com/HybridRobotics/motion_tracking_controller
- 视频:https://youtu.be/RS_MtKVIAzY
- 第三方复现(mjlab / MuJoCo-Warp):https://github.com/mujocolab/mjlab
- 数据依赖:Unitree-retargeted LAFAN1(HF
lvhaidong/LAFAN1_Retargeting_Dataset)、AMASS
一手源存档(sources/)
- beyondmimic—github-readme — GitHub whole_body_tracking README(fetched 2026-07-16)
- beyondmimic—project-page — beyondmimic.github.io 项目页快照(fetched 2026-07-16)
- arXiv 全文(arXiv:2508.08241 原文 HTML/PDF,不入 git)