一句话定位
UH-1 从 16.38 万段互联网人体视频里挖出一个 2070 万帧、240.3 小时的 Humanoid-X 数据集(视频-文本-人体姿态-人形关键点-人形动作五元组),再用 VQ-VAE 把人形动作离散化成 token、训练一个 18 层 Transformer 做「文本 → 动作 token」自回归生成——用「从海量视频里学」替代「大规模强化学习」或「昂贵遥操作」这两条人形控制主流路线,在 Unitree H1-2 上把 12 条自然语言指令(打拳、鼓掌、弹吉他、拉小提琴……)跑到近 100% 成功率(Humanoids 2025 Oral)。
背景与定位
人形全身控制此前主要靠两条路:
- 大规模强化学习(Humanoid Parkour Learning、Humanoid-Gym 等)——只覆盖运动/跳跃等有限技能,难泛化到日常任务;
- 遥操作 / 人体动作模仿(H2O、ExBody)——需人类采集动作数据,规模化成本高。
UH-1 的立场是「机器人操作数据太贵,但人体视频遍地都是」——沿用 RT-2/OpenVLA 一类「从海量非机器人数据学习可迁移表征」的范式,但把它第一次系统搬到人形姿态控制上。与两阶段方案(先生成人体动作再重定向到机器人,如 MotionGPT、Harmon)不同,UH-1 用单一 Transformer 把文本直接映射到可执行人形动作/关键点,跳过中间人体动作生成步骤。数据构建沿用与 H2O 相近的 SMPL 重定向技术栈,但数据源从人工整理的 MoCap(AMASS 40 小时)换成了自动化流水线挖出的互联网视频(240.3 小时、163.8K 段)。
模型架构
UH-1 Transformer(EMB policy backbone):18 层 Transformer,16 个注意力头,隐藏维度 1024;输入为 CLIP 文本编码器给出的语言 embedding l,自回归解码离散动作 token 序列 S=[s1,...,s_{T/k},End],建模 P(si | s1:i-1, l),训练目标是整个数据集上的负对数似然。
动作 tokenizer(VQ-VAE):沿用 [T2M-GPT] 架构——1D 卷积 + 残差块 + ReLU 的编码器/解码器,stride-2 卷积做时域下采样、最近邻插值做上采样;codebook 大小 2048×512(2048 个 code、每个 512 维),时域下采样率 k=4(每 4 帧动作压成 1 个 token),训练时动作序列裁剪到长度 T=64。重建损失在标准 L1 之外新增两项人形专属正则:一阶差分损失(约束相邻帧变化的一致性,提升动作平滑度)和根位置正则项;总损失 L=L_recon+L_embed+αL_commit。
两种可切换的控制模式(同一 Transformer,只是输出目标不同):
- text-to-keypoint:生成 12 个人-机共有关节(左右髋/膝/踝/肩/肘/腕)的 3D 关键点
P_robot,喂给下游 goal-conditioned RL 策略做闭环控制; - text-to-action:直接生成 27 维 DoF 目标位置序列
A_robot做开环控制(经 PD 控制器转矩控)。
goal-conditioned RL 控制策略(把关键点转成可部署动作):观测空间含机器人本体感知(根朝向、角速度、当前 DoF 位置);目标空间含 P_robot、q_robot(DoF 位置)与根运动目标;用 PPO 训练,奖励含模仿类(DoF 位置、关键点位置、根线速度、根横滚俯仰、偏航)与正则类(高度、悬空时间、拖拽、接触力、绊倒、DoF 加速度/动作变化率/能耗、碰撞、DoF 限位、DoF 偏差、竖直线速度、水平角速度、重力投影等 14 项)两大类共 19 项奖励,具体权重见论文 Table 2/3。仿真器为 Isaac Gym,环境数 6192 并行;PPO 超参:折扣因子 0.99、GAE 0.95、每轮 rollout 21 步、5 epoch/rollout、4 minibatch/epoch、学习率 1e-3、Adam 优化器。
其余组件:3D 人体姿态用 VIBE(视频级 SMPL 参数回归);人体→人形关节映射固定为 12 个共有关节,先在 T-pose 下优化 SMPL 体型参数 β 让人体关节位置逼近人形(Adam 优化 + |βi|<5 限幅防过度形变),再对每帧用 Adam 求逆运动学解出 27 维 DoF(λ=0.05 的平滑正则)。文本编码用 CLIP 文本编码器。
数据
Humanoid-X 规模:163.8K 段动作样本,跨越 240.3 小时视频、2070 万帧,词汇量 11,897(含 3206 个不同动词)。每条样本含 5 种模态 ⟨V(视频), T(文本), P_human(SMPL 人体姿态), P_robot(人形关键点), A_robot(人形动作)⟩。
来源构成(论文 Table 1,按片段数/帧数/时长/词汇量列出 11 个数据源):AIST(1.5K/0.3M/3.2h)、AMASS(13.4K/2.0M/27.4h)、Charades(9.3K/1.0M/1.0h)、EgoBody(1.0K/0.4M/4.0h)、GRAB(1.3K/0.4M/3.8h)、HAA500(5.2K/0.3M/2.9h)、HuMMan(0.7K/0.1M/1.0h)、IDEA400(12.5K/2.6M/24.0h)、Kinetics700(68.6K/5.2M/72.4h,占比最大)、Motion-X Video(40.6K/7.9M/72.9h)、Online Video/自采集 YouTube(17.8K/2.3M/32.6h)。互联网视频经 Google Cloud API(YouTube Data API v3)用 400+ 条自定义搜索词(武术、健身、体育、舞蹈、乐器演奏、日常动作、动物启发动作、康复训练等类别)逐类检索 top-20 视频获取。
清洗流水线:原视频先降采样到 20 FPS,YOLOv8 做单人检测(只保留恰好 1 人的帧),再用逐帧灰度差过滤静止片段(帧间小阈值 + 批次大阈值的双层判据保连续性),拼出 ≥64 连续帧的片段,共产出 163,800 个视频片段。文本标注:用 Video-LLaMA 抽 8 帧、按专门设计的动作导向 prompt(禁止描述外貌)生成一句话动作描述。
Sim vs real:全部原始数据来自真实互联网视频,重定向到人形关键点后用 Isaac Gym 仿真训练 RL 策略;无仿真合成动作数据。数据未来计划完全开源(论文成文时尚未发布),实际已在 HF 以 USC-GVL/Humanoid-X(文本/关键点/动作三个 zip 全量释出,人体姿态仅释出 Charades/Kinetics700/YouTube 子集,原始视频因版权不释出)与 train/test/val 切分发布;HF 数据卡显示当前 parquet 视图共 176,674 行(train 141K / val 8.83K / test 26.5K),与论文正文 163.8K 略有差异(HF 端口径可能含后续增补或不同粒度计数),总文件大小 41.3GB。
训练方法
两阶段流水线:(1) 先训练 UH-1 Action Tokenizer(VQ-VAE,重建损失),(2) 再训练 UH-1 Transformer 做「文本→动作 token」自回归生成(负对数似然);两个模型都可先在 HumanoidML3D(HumanML3D 转人形版)训练/评测,再用 Humanoid-X 全量数据做预训练+微调。
动作离散化(tokenization):与语言 token 不同,人形动作相邻帧变化很小,因此不逐帧编码,而是把连续 k=4 帧的动作片段编码进单个 token,兼顾平滑过渡与学习难度。
RL 策略训练:goal-conditioned PPO,训练数据为 AMASS 中筛选出的 CMU MoCap 子集(排除涉及物理交互、重物或崎岖地形的动作),奖励与超参见「模型架构」节。
关键消融:
- 数据规模消融:在 Humanoid-X 上取 1%/10%/25%/50%/75%/100% 训练,FID 从 0.689 降到 0.463、Diversity 从 5.900 升到 6.149,单调改善,证明视频规模化确有效。
- 预训练收益:先在 Humanoid-X 预训练再在 HumanoidML3D 微调,相比只在 HumanoidML3D 训练,FID 从 0.445 降到 0.379、MM Dist 从 3.249 降到 3.232、Diversity 从 10.157 升到 10.221。
- codebook 大小消融:512→1024→2048,FID 从 0.539 降到 0.463,Diversity 从 6.050 升到 6.149,受限算力未试更大词表。
- 架构消融(Transformer vs Diffusion):同数据上训练文本条件人形运动扩散模型对比,Transformer FID 0.379 < Diffusion 0.624,MM Dist 3.232 < 5.536,证明 Transformer 在大规模数据上更具可扩展性。
Infra(训练 / 推理工程)
- UH-1 Action Tokenizer / Transformer 训练:单张 NVIDIA RTX 6000 Ada GPU。在 HumanoidML3D(Humanoid-X 的子集)上训练分别约 8 小时 / 30 小时;在全量 Humanoid-X 上训练分别约 40 小时 / 400 小时。多卡/并行策略、精度:未披露。
- goal-conditioned RL 策略训练:Isaac Gym,6192 并行环境;GPU 型号/卡数/GPU-hours:未披露。
- 推理/控制频率:论文未给出具体 FPS/Hz 数字;人体姿态视频降采样标准化为 20 FPS,人形动作数据以 50 FPS 存储;真实机器人闭环控制频率未披露具体数值。
- 真实机器人本体:Unitree H1-2;上半身开环控制 + 预训练下肢运动策略配合下半身,PD 控制器转矩由官方文档给出的标准 Kp/Kd。
评测 benchmark
HumanoidML3D 基准(Table 1,vs 两阶段基线,20 次重复评测取均值±95% CI):
| 方法 | FID↓ | MM Dist↓ | Diversity↑ | R Precision↑ |
|---|---|---|---|---|
| Oracle(真值) | 0.005±.001 | 3.140±.010 | 9.846±.062 | 0.780±.003 |
| MDM | 0.582±.051 | 5.921±.034 | 10.122±.078 | 0.617±.007 |
| T2M-GPT | 0.667±.109 | 3.401±.017 | 10.328±.099 | 0.734±.004 |
| UH-1(本文) | 0.445±.078 | 3.249±.016 | 10.157±.106 | 0.761±.003 |
UH-1 相比两阶段基线 FID 降低超过 23%,Diversity 与最优基线相当。
真实机器人任务成功率(Table 3,12 条指令 × 每条 10 次试验,Unitree H1-2):Boxing 90%/70%(keypoint/action 两种模式)、Clapping 100%/100%、Cross Arms 80%/80%、Embrace 100%/100%、Golf Putt 90%/100%、Open Bottle & Drink 100%/100%、Play Guitar 100%/100%、Play Violin 100%/80%、Pray 100%/100%、Left Hand Punch 100%/100%、Right Hand Punch 100%/90%、Wave to Friend 100%/100%;两种模式在绝大多数指令上都拿到 100%,仅 Boxing/Cross Arms/Golf Putt/Play Violin/Right Hand Punch 等个别指令低于 100%(最低 70%),论文称整体「近 100%」成功率。
仿真两模式对比(§5.4,每任务各随机生成 100 条 keypoint/action 序列评测,与上面真实机器人任务是独立实验):text-to-keypoint 均值成功率 94.3%(94.33%),text-to-action 均值成功率 89.8%(89.83%),两种模式均超 89%;text-to-keypoint 因带闭环全身控制策略而略更鲁棒。
其余消融结果见「训练方法」节(数据规模、预训练收益、codebook 大小、Transformer vs Diffusion 四组)。
创新点与影响
贡献:
- Humanoid-X:首个专为人形通用姿态控制设计、从互联网视频规模化构建的大数据集(163.8K 样本、2070 万帧、240.3 小时),提供视频-文本-人体姿态-人形关键点-人形动作五元组全流程标注。
- UH-1:用 Transformer + 动作 token 化把语言指令直接映射为可执行人形动作/关键点,提供 text-to-keypoint(闭环)与 text-to-action(开环)两种可互换控制模式,并给出针对人形动作特性(帧间平滑、根位置正则)的 VQ-VAE 定制改进。
- 用数据规模消融实证「从海量视频里学」能显著提升人形控制的文本泛化能力,且在真实 H1-2 机器人上达到近 100% 成功率的可靠部署。
作者自陈局限:仅研究人形姿态控制(pose control),不涉及人形操作/抓取(loco-manipulation);受算力限制未尝试更大 codebook 词表;未来计划把该流水线扩展到从互联网视频学习人形 loco-manipulation。
影响:作为把「互联网视频规模化」范式从机器人操作(RT-2/OpenVLA 一路)迁移到人形全身姿态控制的早期代表工作之一,被 IEEE-RAS Humanoids 2025 接收为 Oral;数据集与模型权重(USC-GVL/Humanoid-X、USC-GVL/UH-1)已在 HuggingFace 公开。
原始链接
- arXiv(摘要 / PDF 全文):https://arxiv.org/abs/2412.14172
- PDF:https://arxiv.org/pdf/2412.14172
- 项目主页:https://usc-gvl.github.io/UH-1/
- 官方代码:https://github.com/sihengz02/UH-1
- HF 模型权重:https://huggingface.co/USC-GVL/UH-1
- HF 数据集:https://huggingface.co/datasets/USC-GVL/Humanoid-X
- 会议:IEEE-RAS 24th International Conference on Humanoid Robots (Humanoids) 2025, Oral Presentation, DOI 10.1109/Humanoids65713.2025.11203143
一手源存档(sources/)
- uh-1—project-page — 项目主页快照(usc-gvl.github.io/UH-1,摘要/演示技能/数据集流水线示意/BibTeX)
- uh-1—github-readme — 官方 GitHub README 快照(环境搭建、推理/可视化/RL 训练命令、关键点维度说明)
- uh-1—hf-dataset-card — HF 数据集卡快照(Humanoid-X 释出范围与切分说明)
- uh-1—hf-model-card — HF 模型卡快照(UH1_Transformer.pth / UH1_Action_Tokenizer.pth 权重说明)
- arXiv 原文 PDF(2412.14172,不入 git):见上「原始链接」