一句话综述
这一族解决的是同一个基础问题:怎么让一台真实的全尺寸人形机器人做出人一样多样、协调、有表现力的全身动作——走、蹲、踢、跳、舞、搬箱、被推不倒。它的技术主线可以一句话概括:把图形学里”物理仿真角色模仿海量 MoCap”的成熟配方,一步步”落地化”到真机硬件上。落地化要跨过四道坎——真机没有特权状态(线速度、全局位置拿不到)、硬件力矩/自由度远不如仿真角色、AMASS/CMU 这类数据里大量动作真机根本做不了、以及仿真到真机的动力学 gap——这一族的每一篇工作,几乎都是在这四道坎里挑一两道去攻。从 2023 年 Berkeley 把 Transformer 搬上 Digit、2024 年 exbody 用”上半身模仿+下半身跟速度”打开表现性控制、h2o-human2humanoid/omnih2o/humanplus 把”人到人形实时遥操作”跑通,到 hover 用一个策略统一所有命令接口、asap 用残差动作补 sim-to-real gap、gmt/twist/beyondmimic 把通用运动跟踪推到 SOTA 保真度,再到 omniretarget 从源头解决数据质量、bfm-zero 用无监督 RL 训出人形”行为基础模型”、sonic 沿数据/模型/算力三轴一次性放大——整族在三年里从”单个技能 demo”收敛成”通用底层控制器 + 数据引擎 + 基础模型”的完整栈。
家族全景与谱系时间线
整族的血统可以拆成两个上游源头,再在 2024 年汇流:
- 图形学血统:DeepMimic → AMP/ASE → UHC → phc-perpetual-humanoid-control(PHC,2023)。这条线在纯仿真里把”单策略模仿整个 AMASS”做到极致(PHC 无外力 98.9%),并贡献了整族反复复用的两块底座——运动模仿器(motion tracker) 与 失败恢复原语。
- 真机 locomotion 血统:real-world-humanoid-locomotion-rl(Berkeley,2023)第一次把因果 Transformer + 大规模并行 RL + 零样本 sim-to-real 做到全尺寸人形(Digit)稳定户外行走。这条线贡献了 teacher(state)→student(observation) 蒸馏 + 域随机化 + 用历史观测隐式估计世界 的工程范式。
两条线在 2024 汇流成”人类 MoCap → 重定向 → goal-conditioned RL → 真机全身控制”这一主范式,随后逐年分化:
| 年份 | 里程碑 | 代表工作 | 解决的核心矛盾 |
|---|---|---|---|
| 2023 | 图形学模仿器 + 真机 locomotion | phc-perpetual-humanoid-control、real-world-humanoid-locomotion-rl | 单策略模仿整库 / Transformer 上真机 |
| 2024 上 | 表现性解耦控制 | exbody | 人机形态差异导致的过约束 → 上/下半身目标解耦 |
| 2024 中 | 人到人形实时遥操作 | h2o-human2humanoid、omnih2o、humanplus、wococo、masked-humanoid-controller | 只用 RGB/VR 稀疏输入驱动真机全身 |
| 2024 末 | 统一控制器 / 语言驱动 / 视觉跑酷 | hover、exbody2、mobile-television、uh-1、harmon、humanoid-parkour-learning、idp3-improved-3d-diffusion-policy | 命令接口碎片化 → 一个策略降维到任意子集 |
| 2025 上 | Sim-to-real 攻坚 / 命令空间扩展 / 遥操作硬件 | asap、hugwbc、homie、hub-extreme-balance、humanoid-getup、amo、twist、falcon | 动力学 gap / 步态细粒度 / 免 IK 遥操作 / 极限平衡 |
| 2025 中 | 通用运动跟踪成为”基础任务” | gmt、unitracker、skillblender、leverb、clone-teleoperation、kungfubot | 单策略跟遍多样技能 / VLA 分层 / 闭环漂移 |
| 2025 末 | 数据引擎 / 引导扩散 / 行为基础模型 / scaling | omniretarget、beyondmimic、bfm-zero、sonic、resmimic、visualmimic、physhsi | 数据质量>奖励工程 / 测试时组合 / 无监督 BFM / 三轴放大 |
| 2026 | 人形操作基础模型 / 产品化 | psi-0-humanoid-loco-manipulation、onex-neo-redwood | 人类视频+真机两阶段学 / 整机厂 VLA+世界模型 |
一条贯穿全族的暗线:机器人本体的迁移。2023–2024 几乎全在 Unitree H1(19 DoF)(外加 Berkeley 的 Digit 30 DoF);2024 末起随 Unitree G1(23–29 DoF、身高约 1.32 m) 上市,2025 年后的工作(asap/gmt/twist/beyondmimic/bfm-zero/hugwbc 之外的绝大多数)几乎全部切到 G1——G1 更小更便宜、摔了不心疼,直接催生了敏捷动作(空翻、侧踢、C 罗庆祝跳)这一波研究。
主力成员头对头
下表横切最核心的十余个成员(按”低层控制器”这一维度可比的工作)。数字全部来自各页一手抠取。
| 工作 | 机器人/DoF | 策略架构 | 数据 | 训练范式 | 标志性数字 | 一句定位 |
|---|---|---|---|---|---|---|
| phc-perpetual-humanoid-control | SMPL 24 刚体(仿真)/后扩 H1·G1 | MLP [1024,512]×4 原语 + composer | AMASS 11313 条/40h | PPO + PMCP 渐进扩容 | 无外力模仿 98.9%;单 A100 7 天/100 亿样本;28.8 MB;>30 FPS | 图形学运动模仿器底座 |
| real-world-humanoid-locomotion-rl | Digit 30 DoF | 因果 Transformer 4 block/1.4M 参数/context 16 | 仿真 RL 100 亿样本/天 | teacher(state)→student(obs) + KL 退火 | 4×A100;50 Hz/1 kHz;一周户外零跌倒 | Transformer 序列策略上真机 |
| exbody | H1 19 DoF | Actor-Critic MLP | CMU 780 clip/3.7h | goal-cond RL(上身模仿+下身跟速度) | 真机 roll+pitch 0.051 rad(vs AMP 0.087);4096 envs | 表现性全身控制开山 |
| h2o-human2humanoid | H1 19 DoF | 纯 MLP(state R¹³⁸,8 关键点) | AMASS 40h,13k→10k→~8.5k(sim-to-data 清洗) | PPO 直接 RL | 成功率 72.5%(特权上界 85.5%);RGB+HybrIK 30 Hz | 首个学习式实时全身遥操作 |
| omnih2o | H1 19 DoF | MLP [512,256,128] + 25 步历史 | AMASS 增广 14k;OmniH2O-6 40 min | teacher→DAgger 学生 | 成功率 94.10%(teacher 94.77%);真机 MPJPE 47.94;3 点 VR;20 ms 延迟 | kinematic pose 作通用接口 |
| humanplus | 自研 H1 33 DoF(含双灵巧手) | 两个 decoder-only Transformer(HST+HIT) | AMASS 40h/11000+;≤40 条演示 | HST=PPO 零样本;HIT=BC + 前向动力学正则 | 抗推力 32/44/70/100 N,恢复 1.2 s;穿鞋走路 60% 唯一解 | 单目 RGB 全身影随数据管线 |
| hover | H1 19 DoF/51.5 kg | oracle MLP → student MLP(掩码命令) | AMASS retarget ~8k 条 | oracle RL → DAgger 多模态蒸馏 | >15 模式;teacher RTX4090 100k iter 23.3h、student 0.27h;逐模式 7/12 指标胜 specialist | 统一多模态神经全身控制器 |
| exbody2 | G1 23 DoF/H1 21 DoF | MLP [512,256,128](student [1024,1024,512]) | CMU 子集 D₂₅₀ 最优 | teacher PPO → student DAgger;CVAE 续接 | E_vel 0.1891(vs ExBody 0.3083);CVAE 跑 43s;50 Hz/500 Hz | 全身跟踪 + 数据 curation |
| hugwbc | H1 19 DoF | AAC 全 MLP + 状态估计器 | 纯 RL(无离线数据) | PPO + 对称损失 + 干预训练 | 命令空间 K×B(步频/抬脚/相位/占空比);RTX4090 16h;干预 p=0.005 | 细粒度通用命令空间 |
| amo | G1 29 DoF + Dex3 手 | MLP φ(冻结)+ 下身 RL + ACT 上身 | 轨迹优化(Crocoddyl BoxFDDP)合成参考 | teacher-student + IL | 躯干 roll 范围 ±0.47(exbody2 仅 ±0.06);OOD yaw±2/高度 0.4m | 轨迹优化参考扩展工作空间 |
| asap | G1 23 DoF(锁腕) | 跟踪策略 + 残差 delta-action 模型 | 自录视频/TairanTestbed;真机 4-DoF 踝 100 片段 | 两阶段:预训 + delta 微调 | 跟踪误差最多 -52.7%;LeBron OOD 全局误差 -29.6%;采数损坏 2 台 G1 | 残差动作补 sim-to-real gap |
| twist | G1 23 DoF | MLP [512,512,256,128] SiLU | AMASS+OMOMO >15k/42h + 自采 150 | teacher(2s 未来)→student(单帧) RL+BC | RTX4090 1-2 天;端到端 0.9s;末端扰动 [0,20]N | 统一控制器实时协调遥操作 |
| gmt | G1 23 DoF/1.32m | conv 编码器 z128 + Motion MoE | AMASS+LAFAN1 8925 clip/33.12h | teacher PPO(MoE)→DAgger;Adaptive Sampling | RTX4090 teacher 3d/student 1d;6.8B 样本;vs exbody2 mpkpe 42 vs 50 | 单策略通用运动跟踪 |
| beyondmimic | G1 | 跟踪 MLP(无历史)+ 引导扩散 Transformer | LAFAN1 40 条几分钟参考 | 统一 MDP 同超参 PPO → 扩散蒸馏 | 扩散 6L/4H/512/19.95M;ONNX CPU <1ms;扩散 RTX4060 20ms | loss 引导扩散做下游任务 |
| bfm-zero | G1 29 DoF | FB 表征 Transformer 残差块/440.5M | LAFAN1 40 段;在线仿真 rollout | 离策略无监督 RL(FB + FB-CPR) | 潜维 d=256;192M 环境步/UTD16;few-shot CEM 单腿负重 15s+ | 人形行为基础模型(可提示) |
| omniretarget | G1/H1/T1 | 重定向优化器 + 极简 RL | OMOMO/LAFAN1/自采,生成 >8-9h | Sequential SOCP + BeyondMimic 5 奖励 | 穿透 0.00cm、脚滑 0;下游成功率 82.2%;4 项域随机化 | 保交互重定向数据引擎 |
| clone-teleoperation | G1 29 DoF | MoE(L=3,N=4,top-2)student | Cloned 345 motions | teacher MLP → student MoE DAgger | 直线漂移 5.1cm/8.9m;teacher A800 24h/student 3090Ti 48h | 闭环 LiDAR 修正遥操作 |
子范式一:运动模仿器底座(PHC 与图形学血统)
整族有一个”隐形的地基”:phc-perpetual-humanoid-control(PHC)。它在纯物理仿真里解决了”单一策略模仿整个 AMASS”这个问题,且不施加任何外力(对比前作 UHC 靠残差外力 RFC 才 97%,PHC 无外力 98.9% 反而更高、加速度误差更低)。它的两个产物被下游反复复用:
- PMCP(渐进乘性控制策略):PNN 渐进扩容(每次专攻更难的失败子集、冻结旧原语避免灾难性遗忘)+ MCP 乘性专家组合 + 独立的失败恢复原语(爬起、走回、恢复跟踪),4 个原语最优。
- 只用 3D 关键点即可模仿(让物理仿真代做 IK),噪声视频输入下仍 90%+ 成功——这直接启发了后续用 RGB/VR 稀疏关键点驱动真机的一整条遥操作线。
PHC 的仓库后来加了 SMPL-X(含手指)与 Unitree H1/G1 支持,成为大量真机全身控制工作的”底层动作跟踪器”。它是这一族与图形学社区之间的桥:DeepMimic 的模仿 + AMP 的对抗动作先验 + Isaac Gym 的大规模并行这套组合,几乎每篇后续工作都能看到影子(例如 physhsi 直接用 AMP 学场景交互、phc-perpetual-humanoid-control 的关键点跟踪思路被 h2o-human2humanoid 继承为 8 关键点目标态)。
子范式二:真机 locomotion 与”盲”控制
另一条地基来自 real-world-humanoid-locomotion-rl(Berkeley):把 causal Transformer 当人形控制器,用观测-动作历史做 GPT 式 in-context 适应,替代显式状态估计器;纯仿真训练、零样本上真机、一周户外零跌倒。它确立了两个被整族继承的工程范式:
- teacher(state)→student(observation) 蒸馏:先用特权全状态训个快而准的 teacher,再蒸馏到只看真机可得观测的 student(KL 权重沿训练退火到 0)。这套后来在 omnih2o/hover/exbody2/gmt/clone-teleoperation 里演化成各种变体(见下”设计模式”节)。
- 用历史观测隐式估计世界:真机拿不到线速度/全局位置,就用一段观测历史让网络自己推——omnih2o 的 25 步历史、exbody2 的 25 帧、gmt 的 21 帧都是这个思路的直接后代,且都验证了”历史步数有甜点、过长反而变差”。
这条 locomotion 线在真机敏捷/接触方向上还衍生出几支:humanoid-parkour-learning(H1 视觉跑酷,用地形分形噪声替代运动参考让脚自动抬高,跳 0.42m 平台、跨 0.8m 沟)、wococo(把任意任务分解成”接触阶段”序列、不依赖动作参考就跑通跳石/搬箱/攀爬)、humanoid-getup(HumanUP,首个真机学习式起身策略,两阶段”发现→跟踪”课程)。它们共同点是摆脱对 MoCap 参考的依赖,靠奖励/课程直接学——这与主范式的”模仿人类动作”形成互补的另一极。
子范式三:表现性 / 解耦全身控制
主范式的起点是 exbody(RSS 2024)的一个反直觉洞见:不要精确模仿参考动作的下半身。人类下半身特征直接套到形态差异巨大的 H1 上会过约束、导致脆弱抖动的策略。ExBody 把目标空间拆成”表现目标 𝒢ᵉ(只管上半身 9 关节 + 6 关键点)严格模仿”与”根运动目标 𝒢ᵐ(速度/姿态/高度)放松跟踪”,既保表现力又保行走鲁棒。这个上/下半身解耦思想后来分成了两派:
- 保留解耦、把它做深:mobile-television(PMP,上半身交给 IK、下半身 RL,用 CVAE 把未来上身动作编码成 64 维隐向量喂下身,解决”彻底解耦会失衡”)、homie(下肢 RL 策略在任意上半身姿态扰动下稳走+蹲到任意高度,配 $0.5k 等构外骨骼、完全 MoCap-free)、amo(用轨迹优化合成”弯腰触地”这类 MoCap 里没有的参考,躯干可控范围碾压 exbody2)、falcon(双智能体:下肢稳走 + 上肢末端跟踪 + 隐式力补偿,抗 0-100N 外力)、skillblender(预训练走/够/蹲/踏四原语再混合)。
- 放弃解耦、回到全身跟踪:exbody2 把 ExBody 从”上身模仿+下身跟速度”升级为真·全身运动跟踪(teacher PPO → student DAgger + 局部关键点跟踪 + 速度解耦 + CVAE 续接),并给出”数据 curation 比数据规模更重要”的经典结论——250 条精选 CMU 子集(D₂₅₀)训出的策略在 OOD 上反超 500 条/全量 CMU。
hugwbc 是这一支的集大成者之一:它把命令空间从”少数固定步态”扩成任务命令 × 行为命令(步频、抬脚高度、身高、前倾、腰旋转、相位偏移、占空比),一套策略连续可调地跑走/跑/跳/站四步态;再用干预训练(上半身以小概率被均匀噪声接管、屏蔽上身奖励)让外部控制器可随时接管上半身而不伤下肢——把控制器变成 loco-manipulation 的通用底座(RTX4090 仅 16h)。
子范式四:人到人形重定向与实时遥操作
这是整族最”出圈”的一支,也是标题里 H2O·HumanPlus 的所在。核心问题:怎么用便宜的传感器(RGB 相机 / VR 头显 / 动捕套装)实时把人的全身动作映射到真机上——既为遥操作,也为大规模采操作数据。三条并行路线在 2024 年几乎同时跑通:
| 工作 | 输入接口 | 感知前端 | 关键机制 | 学到的额外能力 |
|---|---|---|---|---|
| h2o-human2humanoid | 第三人称 RGB | HybrIK 30Hz + MoCap 测根速 | sim-to-data 清洗(特权模仿器筛不可行动作 13k→8.5k) | 首个学习式实时全身遥操作 |
| omnih2o | 3 点 VR(头+双手) | Vision Pro / ZED VIO | 25 步历史去掉全局线速度(摆脱 MoCap);DAgger | 语言/GPT-4o/扩散策略五接口 + OmniH2O-6 数据集 |
| humanplus | 单目 RGB 影随 | WHAM 25fps + HaMeR 10fps | HST(RL 低层)+HIT(BC+前向动力学正则) | 双灵巧手操作 + 穿鞋走路 |
三者共享 phc-perpetual-humanoid-control/exbody 的 SMPL+AMASS 技术栈与”特权模仿器筛数据”思想,差异在输入稀疏度(RGB 全关键点 → VR 3 点 → 单目影随)和学生怎么训(H2O 直接 RL、OmniH2O/HumanPlus 用蒸馏/BC)。OmniH2O 的关键贡献是把 kinematic pose 确立为通用接口——同一个 50Hz 策略被 VR/RGB/语言/GPT-4o/扩散策略五种上层共同驱动。
2025 年这一支继续深化,都在补前作的短板:
- twist(CoRL 2025):用穿动捕套装拿高质量输入,一个统一控制器做协调全身(蹲搬箱、踢球、跳华尔兹),系统性证明 teacher(2s 未来帧)→student(单帧) 的 RL+BC 蒸馏 ≫ 纯 RL ≫ DAgger;末端扰动训练让纯跟踪策略学会施力。
- clone-teleoperation(CoRL 2025):只用 AVP 头显 3 点,但把 student 换成 MoE(走 vs 蹲的冲突模式分给不同专家)+ LiDAR 闭环修正(FAST-LIO2 把长距离漂移压到 5.1cm/8.9m),补上前作”开环漂移”的致命伤。
- masked-humanoid-controller(MHC):用一个 LSTM 跟踪”任意子集被 mask 的目标”,把 joystick/VR/视频三种模态统一成”部分指定的运动指令”——与 hover 的掩码思想异曲同工,但走 RL 多模态而非蒸馏。
- 语言/视频驱动的生成派:uh-1(从 16.38 万段视频挖出 240.3h/20.7M 帧 Humanoid-X,VQ-VAE+18 层 Transformer 做文本→动作 token)、harmon(PhysDiff 生成 + IK 重定向 + GPT-4V 补全手指头部,语言→GR1 动作)。
子范式五:统一控制器、通用跟踪器与行为基础模型
如果说子范式四是”把接口做便宜”,这一支是”把策略做通用”——一个策略吃下所有技能/所有命令模式。演化脉络清晰:
HOVER:统一命令接口。 hover(NVIDIA GEAR,ICRA 2025)点破前作的核心矛盾——exbody/H2O/omnih2o/humanplus 都在做 motion tracking,却各用一套 command space(root 速度 / 关节角 / 关键点位置),互不兼容。HOVER 的洞见:full-body kinematic 模仿是所有这些任务的公共抽象。先 RL 训一个吃全身运动学的 oracle,再用 DAgger + 随机命令掩码蒸馏成一个能”降维到任意命令子集”的 generalist。反直觉结论:generalist 不牺牲反而逐项超过 为单一模式专门训练的 specialist(每模式 7/12 指标占优)。
GMT / UniTracker:单策略跟遍多样技能。 gmt 用 Adaptive Sampling(完成度驱动的采样课程,把训练力气压到高误差难动作)+ Motion MoE(不同动作流形分区专精)+ 2s 未来窗口卷积编码,一个策略在真机上跟遍走/高踢/功夫/舞蹈(8925 clip/33.12h),跟踪精度全面超 exbody2。unitracker 走另一条路:三阶段(特权 teacher → CVAE 学生 → 残差微调),用 CVAE 显式建模人类动作分布多样性,单策略跟 8179 条 AMASS 并泛化到文本生成/单目视频动作。
BeyondMimic:统一 MDP + 引导扩散。 beyondmimic 主张”同一套 MDP 和超参就能把任意 LAFAN1 参考训成 SOTA 质量策略”(侧空翻、冲刺、转体跳),再把学到的技能离线蒸馏进一个状态-动作联合扩散策略,靠测试时 loss 引导(classifier guidance)零样本做路径导航/摇杆/避障——首个把 loss-guided diffusion 用到真机人形整体控制。它证明了后来被 omniretarget 复用的关键结论:参考足够干净时,极简奖励(5 项)就够。
BFM-Zero:无监督行为基础模型。 bfm-zero(CMU+Meta,2025-11)是范式跳变——不走 teacher-student 蒸馏,而用离策略无监督 RL(Forward-Backward 表征 + FB-CPR)把动作追踪、位姿到达、奖励优化统一嵌入同一个潜空间 Z,训练全程不依赖任何任务特定 reward。部署时零样本被”提示”(reward/goal/motion 三种输入走同一套 z 计算),还能在潜空间做 few-shot CEM 适应新任务(单腿负重站 15s+)。它补齐了 FB-CPR 此前只在仿真虚拟角色验证、缺的三块真机拼图:非对称 history 训练、域随机化、辅助安全奖励。
SONIC:三轴 scaling。 sonic(NVIDIA,2025-11)把”物理仿真运动跟踪”当可扩展基础任务,沿数据(700h/100M+ 帧)、模型(1.2M→42M 参数)、算力(128 GPU)一次性放大,训单一通用策略;再用统一 token 空间把机器人动作/人体动作/遥操作/视频/文本/音乐乃至 VLA(groot-n1 N1.5)全接到同一策略上——不用为每个技能设计奖励,也不用蒸馏。
ResMimic:在通用底座上加残差。 resmimic 直接站在 gmt 肩上:先用 GMT 打底做任务无关跟踪,再学一个轻量残差策略感知物体、修正 GMT 输出,把”能模仿动作”升级到”能精确做负重搬运/起坐”的接触式 loco-manipulation。
子范式六:Sim-to-real 攻坚(残差 · 极限 · 敏捷)
这一支专攻第四道坎——仿真里学会的高动态动作迁到真机就退化。它们不追求通用,而是死磕”真机上做出以前做不出的动作”。
ASAP:学残差动作。 asap 的关键选择是学残差动作(delta action)而非残差动力学或显式 SysID:用真机 rollout 训一个 π^Δ 补偿动力学失配,冻结后注入仿真微调跟踪策略,部署时丢弃 π^Δ。它证明 RL 学的 π^Δ 能捕捉逐关节非均匀、左右不对称的结构化 gap(下肢>上肢、踝 pitch 最大),显著优于均匀动作噪声/DR,让真机 G1 做出 C 罗 Siuuu 跳、LeBron Silencer、1.5m 前跳(跟踪误差最多 -52.7%)。它的现实教训也很有名:敏捷动作让电机过热、采数中损坏两台 G1,被迫把全 23-DoF delta 退化到 4-DoF 踝版。它还开源了多仿真器框架 HumanoidVerse。
KungfuBot / HuB:精调容差与极限平衡。 kungfubot(PBHC)把跟踪容差 σ 显式建模成双层优化、在线自适应收紧,配”视频→物理过滤→接触校正→IK”流水线,让 G1 学会拳击组合、360° 回旋踢、太极。hub-extreme-balance(HuB,CoRL 2025 Oral)用参考精修 + balance-aware 学习 + sim-to-real 鲁棒三件套,做燕式平衡、李小龙侧踢等极限准静态单腿平衡(真机 24/25 成功,而 H2O/OmniH2O 基线几乎全败)。
PhysHSI:场景交互的 sim-to-real。 physhsi 用 AMP 从少量 MoCap 学搬箱/坐椅/躺床/起身四类长时程任务,靠 LiDAR 粗定位 + AprilTag 精定位零样本上真机,实测 AMP 路线比”从零 RL 调奖励”和”逐帧跟踪”两条基线都更泛化、更像人。
子范式七:数据引擎——重定向从软惩罚到硬约束
整族越到后期越意识到:下游 RL 的天花板是重定向数据的质量。重定向(把人的 SMPL 动作映射到机器人骨架)这道工序的演化本身就是一条主线:
| 阶段 | 代表 | 重定向方法 | 可行性过滤 | 遗留问题 |
|---|---|---|---|---|
| 关节角直映 | exbody、humanplus | 四元数→轴角映射 / SMPL-X Euler 角直接复制 | 关键词启发式筛选 | DoF 不匹配丢信息 |
| shape+motion 两阶段 | h2o-human2humanoid、omnih2o | 拟合匹配机器人的 SMPL 体型 β’ → 梯度下降匹配 12 对应关节 | sim-to-data:特权模仿器筛不可行动作 | 关键点匹配、不建模物体/环境交互 |
| 轨迹优化合成 | amo | Crocoddyl BoxFDDP 解动力学可行全身参考 | 优化本身保证可行 | 只覆盖设计的指令分布 |
| 保交互硬约束 | omniretarget | 交互网格 + Laplacian 变形能量 + 全套硬约束(非穿透/脚粘滞/关节限位) | 硬约束内建 | 逐帧优化、噪声源鲁棒性 |
omniretarget(ICRA 2026 最佳论文)是这条线的当前终点:它把范式从”用复杂奖励工程去打补丁修复劣质参考”转向”从源头用有原则的数据生成解决问题”。用交互网格显式保留人-物-地形接触关系、把非穿透/脚粘滞/关节速度限位全部作为硬约束统一进单个优化,产出的参考穿透 0.00cm、脚滑 0,让下游 RL 只用 5 条奖励 + 4 项域随机化 + 零调参 + 无课程就能零样本上真机做 30 秒长的搬椅爬台+parkour 翻滚。它还能从单条演示自动增广出跨物体位姿/尺寸/地形高度/机器人本体的一族轨迹——直接呼应并复用了 beyondmimic 的”数据干净则奖励极简”结论。这一支还有个隐形基础设施 twist 衍生的 GMR(General Motion Retargeting)做实时重定向。
上层化:从底层控制器到 VLA / 世界模型 / agent
到 2025–2026,底层全身控制器成熟到可以当”轮子”,上层开始接语言、视觉、规划:
- 分层 VLA:leverb 是首个面向人形 WBC 的分层”隐动作”VLA——视觉-语言 System-2(LeVERB-VL,102.6M)把指令+视觉编码成 10Hz 的隐式”动词”,反应式 System-1(LeVERB-A,1.1M)以 50Hz 解码成关节动作,全程合成数据训练、零样本上 G1。visualmimic 走”任务无关低层关键点跟踪器 + 任务相关高层视觉策略”的分层,只看自我中心深度+本体感知就生成关键点指令。
- 人形操作基础模型:psi-0-humanoid-loco-manipulation(USC PSI,2026)把”从人类第一视角视频学语义/视觉表征”与”在真机数据上学关节空间控制”显式拆成两阶段(而非混合共训),仅 800h 人类视频 + 30h 真机数据,在 8 个长时序任务上比用 10 倍数据的 GR00T N1.6 高 40%+。
- 智能体系统:being-0 给 H1-2 设计云端 GPT-4o 规划 + 本地 VLM Connector 接地 + 模块化技能库(RL 步态 + ACT 操作)三层 agent,长程任务完成率 84.4%。
- 产品化闭环:onex-neo-redwood(1X NEO)是”整机厂自研 VLA(Redwood AI)+ 世界模型(1XWM,从离线评测器演进为视频生成即策略)“路线在人形上最具体的产品案例。
- 操作侧的视觉策略:idp3-improved-3d-diffusion-policy 把 3D 扩散策略从世界系改到相机系(egocentric),让 GR1 只用单场景人类遥操数据就把抓取/倒水/擦桌零样本泛化到野外——它更偏”上半身操作”,但常与本族全身控制器组合成完整系统。
七个反复出现的设计模式
横切全族,可以抽出七个几乎人人都用的”配方零件”:
- goal-conditioned RL + 目标关节位置动作:策略输出各关节 PD 目标位置,PD 控制器(真机常 200Hz–1kHz)转力矩;策略本身几乎统一跑 50 Hz。从 phc-perpetual-humanoid-control 到 bfm-zero 无一例外。
- teacher-student 蒸馏,但学生怎么学分五派:纯 RL(h2o-human2humanoid/humanplus HST)、DAgger(omnih2o/hover/exbody2/gmt/clone-teleoperation)、RL+BC 混合(twist,证明优于前两者)、CVAE 学生(unitracker)、残差微调(asap/resmimic/unitracker)。DAgger 是主流,因为直接用 RL 训带长历史的学生会因输入复杂度爆炸而学不出(omnih2o 实测去 DAgger 成功率从 94% 崩到 47%)。
- 局部 vs 全局关键点跟踪:早期 H2O 用全局关键点会随时间漂移、误差累积;exbody2 起改用局部关键点 + 速度解耦,gmt 进一步把局部关键点对齐到机器人 heading——成为事实标准。
- 历史观测替代特权线速度:真机拿不到线速度就堆历史让网络自己推。步数有甜点:omnih2o 25 步、exbody2 25 帧、gmt 21 帧、clone-teleoperation 25 帧、hugwbc 5 帧——普遍 25 帧左右,过长反而变差。
- 奖励三段式 + 域随机化:奖励几乎都是 task(跟踪)+ regularization(防抖/可 sim2real 步态)+ penalty(越界/终止)三类求和;域随机化标配摩擦、连杆质量、PD 增益、控制延迟、周期推力。趋势是域随机化越用越少——omniretarget 只用 4 项,因为它把功夫花在数据质量上。
- 数据 curation > 数据规模:exbody2(250 条最优)、clone-teleoperation(345 条胜 OmniH2O 8k+)、h2o-human2humanoid(sim-to-data 清洗后更少数据反而更好)、[gmt] 反复验证——不是越多越好,噪声动作会拖垮可行动作的跟踪精度。
- Isaac Gym/Lab 大规模并行 + 单卡可训:仿真几乎全是 IsaacGym(后期迁 IsaacLab/IsaacSim/Genesis/MuJoCo-Warp),并行环境标配 4096;且多篇强调单张 RTX 4090 即可训(hover/gmt/twist/hugwbc/homie),把入门门槛压得很低。
家族走向
综合各页作者自陈的局限与开源动向,这一族正在朝四个方向收敛:
- 从”跟踪 teacher 蒸馏”转向”无监督/自监督基础模型”:bfm-zero 的 FB 表征、sonic 的三轴 scaling、psi-0-humanoid-loco-manipulation 的两阶段人类视频+真机,共同指向”不再逐任务绑定、训一个可提示/可组合的通用策略”。scaling law(动捕规模 × 仿真数据 × 网络容量)目前仍是空白,是明确的下一个问题。
- 从”奖励工程”转向”数据引擎”:omniretarget/beyondmimic 证明干净参考 + 极简奖励就够,重定向与数据增广(尤其保交互、跨本体)成为新的竞争焦点。
- 接触与操作是最后一块硬骨头:几乎所有通用跟踪工作(gmt/hover)都自陈”缺接触密集技能”(倒地起身、地面翻滚、负重搬运),resmimic/falcon/amo/omniretarget 正从残差学习、力自适应、轨迹优化、保交互数据四个角度补这块。
- 硬件是绕不开的物理天花板:asap 采数损坏两台 G1、twist 电机 5-10 分钟过热、humanplus/hugwbc 受 H1 构型限制、多篇缺力/触觉反馈——敏捷与耐久之间的权衡,最终要硬件迭代来解。整机厂路线(onex-neo-redwood)与学术开源栈(HumanoidVerse、Holosoma、BFM-Zero、TWIST 全开源)正从两端逼近同一个目标:一台真的能干活、也真的买得起的人形。