一句话定位
CLONE 是一套闭环 MoE 全身人形遥操作系统:只用一台商用 MR 头显(Apple Vision Pro)给出的头部 3D 位置 + 双手腕 6D 位姿这三点输入,经 teacher-student 蒸馏出的 MoE 学生策略生成协调的全身动作,并用 LiDAR 里程计(FAST-LIO2)做实时闭环误差修正,把长距离遥操作的位置漂移压到厘米级;在 Unitree G1(29 自由度)真机上验证。BIGAI + 北京理工大学 + 北京大学,2025 年 8 月被 CoRL 2025 接收。
背景与定位
问题范式仍是人形整机遥操作 + 长时程 loco-manipulation 数据采集,此前工作被作者归纳为两个未解难题:
- 协调性 vs 稳定性的取舍:多数系统把上下半身控制解耦(如早期 exoskeleton/VR 方案)以求稳定,但牺牲了”边走边够”之类需要全身联动的自然动作;依赖动作捕捉数据训练的路线(h2o-human2humanoid、omnih2o 等)虽保留协调性,却常因动作分布保守、且普遍不建模手部朝向而限制精细操作。
- 开环导致的位置漂移:人形双足的复杂足地交互和非完整动力学使里程计估计困难,此前系统缺乏机器人全局位置的实时反馈,误差随步数累积,长时程任务最终失控。
CLONE 沿用 omnih2o 的 teacher-student 蒸馏范式和奖励/域随机化基座,但把学生策略换成 MoE 架构(应对”走路 vs 下蹲”等冲突性运动模式,而非用单一 MLP 强行拟合),并额外接入 LiDAR 里程计 + AVP 里程计做闭环误差修正,是同期 asap、gmt 等”动作跟踪”MoE/RL 路线在遥操作(teleoperation)而非自主动作模仿场景下的对应工作;与不依赖任何 motion prior、走”关节匹配外骨骼”路线的 homie 相比,CLONE 仍是视觉/MoCap 驱动的学习式路线,核心创新在闭环漂移修正与 MoE 学生策略,而非硬件层面绕开 IK。
模型架构
控制接口:仅 3 个跟踪点——头部 3D 位置 + 双手腕 6D 位姿(位置+朝向),全部来自 AVP 头显,无需额外硬件或标定。
Teacher 策略 π_tea:MLP,利用仿真里的特权信息训练。观测 o_tea = [s_tea, o_task, a_t, o_env],其中特权状态 s_tea = [p_t, θ_t, v_t, ω_t] 含全身各连杆的关节角、6D 位姿、线速度、角速度;任务观测 o_task 含参考动作与当前状态的差值(位置/朝向/线速度/角速度)及参考目标值;环境观测含地面摩擦系数、机器人质量分布。输出 a_{t+1} ∈ R^29(G1 全身 29 个关节目标位置),经 PD 控制驱动。
Student 策略 π_stu(MoE,部署到真机的模型):只用真实可得观测 a_{t+1} = π_stu(s_stu[t-25:t], a[t-25:t], o_task_t)。状态序列含过去 25 帧的关节位置 q、关节速度 q̇、根部角速度 ω_root、根部重力向量 g(IMU 采集);任务观测含头/双腕当前与目标位置差、目标位置、目标速度、当前/目标腕部朝向。
- MoE 设计:L=3 层,每层 N=4 个专家,每个专家是独立前馈子层(MLP,维度 2048→512→512→256);路由器逐层为每个输入生成专家权重分布,取 top-k=2 个专家加权求和
f = Σ w_i·E_i(·)。用负载均衡损失L_balance = Σ_l Σ_e [max(p_e-(1+ε)/N,0) + min((1-ε)/N-p_e,0)](p_e为专家 e 的期望激活概率)防止路由塌缩到少数专家。 - 消融基线 Clone†:把学生策略换成单一 MLP(2048→1024→512→512),对照 MoE 的价值。
- AMP 判别器:3 层 MLP(256,256,256),在线更新,用于约束下半身运动自然性(见训练方法)。
闭环误差修正:机器人侧用 FAST-LIO2(IMU+LiDAR 紧耦合迭代卡尔曼滤波,Livox mid360 传感器)估计全局位置 p;操作者侧用 AVP 自带里程计估计 p̂;二者差值 p - p̂ 送入学生策略的任务观测,并设计对应奖励项驱动策略主动消除该差值。LiDAR 运行在 10 Hz,学生策略运行在 50 Hz,策略在每个时间步使用最新可得的里程计位置(异步、非严格同步)。
数据
训练数据集 Cloned(区别于框架名 CLONE)由三部分构成:
- (i) 增强版 AMASS 子集:从 AMASS 中筛掉物理不可行动作,挑选上下半身工作空间大的动作作为”oracle motions”,再通过拼接身体部位、加速片段等动作编辑手段扩充,得到 149 条精选序列。
- (ii) 自采动作:用 IMU 式 Xsens 动捕系统采集的 14 条自定义序列,专门补齐连续过渡和多样上肢姿态的覆盖缺口。
- (iii) 手部朝向增强:程序化生成 6D 腕部目标,用 **SLERP(球面线性插值)**平滑,为遥操作提供连贯自然的手部朝向监督(此前动捕数据集普遍缺失这一维度)。
三者合计构成 345 个运动片段(论文 D.3 节明确对比:Cloned 为 345 motions)。对照组 Clone*(消融)改用 **OmniH2O 原始数据集(8k+ motions)**训练同一 MoE 架构,结果反而在”下蹲拾物”等任务上失败摔倒——作者据此论证:小而精的数据集在此任务上优于大而未针对性设计的数据集(Clone 仅用约 20% 的数据量即达到更好效果)。全部训练在 IsaacGym 仿真中进行,无真实机器人采集的动作数据用于策略学习(真机数据仅用于评测)。
训练方法
形式化为 MDP M={S,A,T,R},动作空间 A∈R^29(G1 全身关节角),用 PPO 优化。
两阶段 teacher-student 蒸馏(沿用 omnih2o 框架):先训练特权信息可用的 teacher MLP,再蒸馏出仅用真实观测的 student MoE。
奖励与域随机化:基座沿用 OmniH2O 的奖励项和域随机化范围(力矩/关节位置速度限位、跌倒终止、动作率、脚部空中时间/打滑/朝向、姿态跟踪、速度跟踪等,权重表见 Appendix B),并新增两项针对真实遥操作的增强:
- 速度相关的 SDE 噪声:对头部位置施加
dP_head = ṗ_head·dt + (‖ṗ_head‖/c_vel + c_min)·dW(W 为标准维纳过程),模拟”移动越快、LiDAR 里程计误差越大”的真实特性,噪声位置周期性重置并限制最大偏移;具体常数 c_vel、c_min 数值论文未披露。 - AMP(Adversarial Motion Priors)奖励(权重 500):由于 CLONE 只提供上半身参考(头+双腕),下半身行为缺乏显式监督,用 AMP 正则化下肢运动使其自然、稳定。
- 域随机化范围(部分,Table A2):摩擦系数 U(0.6,2.0)、基座质心偏移 U(-0.04,0.04) m、连杆质量 U(0.7,1.25)×默认、P/D 增益 U(0.85,1.15)×默认、控制延迟 U(0,20) ms、全局步延迟 U(0,80) ms、随机出生距离 U(0,2.0) m、随机朝向 U(-20°,20°)、每 5s 以 1.5 m/s 推机器人一次。
数据增强(Appendix C.1):过滤物理不可行的 AMASS 动作,选大工作空间动作为 oracle,再拼接躯体部位/加速序列生成更多组合。
Infra(训练 / 推理工程)
- 仿真训练:IsaacGym。Teacher 用 8192 个并行环境训练 1M 迭代(约 480K 仿真步、约 20K PPO 步),单张 A800 GPU,约 24 小时。Student(MoE)用 4096 个并行环境训练 600K 迭代,单张 RTX 3090 Ti,约 48 小时。
- 真机部署硬件:Unitree G1 EDU(29 自由度版),Apple Vision Pro,Livox mid360 LiDAR(挂载于 G1 板载 PC2),一台 Linux 服务器 PC;G1 与服务器经路由器以太网连接,AVP 经同一路由器 Wi-Fi 连接。
- 推理频率:学生策略在真机上以 50 Hz 运行;LiDAR 里程计(FAST-LIO2)以 10 Hz 更新;底层指令中继脚本(
lowcmd_publisher.py)以 1 kHz 转发给机器人电机(据 GitHub 部署文档)。 - 精度/其它:论文未披露训练精度(fp16/fp32/bf16 等)及具体 GPU 显存占用。
评测 benchmark
真机实验(Unitree G1):
- 直线路径全局位置跟踪(3 m/6 m/8.9 m,各 10 次试验):平均跟踪误差 5.1 cm,8.9 m 处最大偏差 12.0 cm。独立样本 t 检验:3m vs 6m(t=0.165, p=0.871)、6m vs 8.9m(t=0.048, p=0.963),各距离间无显著性能退化。
- 曲线路径跟踪(10 m、两个 90° 转弯,6 次试验):平均误差 20 cm(最大 27 cm),平均旋转漂移 2°。
- 长时程混合导航:超 15 m 的复杂路径,含前进、转弯、侧移,机器人全程紧跟操作者并以最小漂移回到起点(定性展示,Fig.6)。
- 全身动作跟踪(定性):挥手、下蹲、从蹲姿站起、跳跃等动作均可实时跟踪;论文承认跳跃等高动态动作跟踪保真度相对较弱。
仿真评测(Cloned 数据集,Table 1,五项指标:成功率 SR、绝对关键点位置误差 E_mpkpe、根相对关键点位置误差 E_r-mpkpe、速度误差 E_vel、手部朝向误差 E_hand-rot):
| 方法 | SR | E_mpkpe (mm) | E_r-mpkpe (mm) | E_vel (mm/s) | E_hand-rot |
|---|---|---|---|---|---|
| Clone†(MLP 学生策略) | 100% | 113.97 | 35.55 | 245.11 | 4.73 |
| Clone*(训练于 OmniH2O 数据,8k+ motions) | 100% | 102.20 | 41.07 | 309.65 | 4.61 |
| Clone(完整版,MoE + Cloned) | 100% | 87.84 | 33.30 | 227.17 | 3.61 |
消融(Table A3):
- 历史长度:History5(93.97/31.99/236.12/3.80)、History50(135.60/41.33/286.66/12.23)、History25(即最终 Clone,87.84/33.30/227.17/3.61)——过长历史反而使精度和手部朝向误差大幅变差。
- 架构:Clone(L=1)(134.06/37.56/270.14/7.22,参数量不足以学习多样运动)、Clone(N=8)(89.21/30.90/251.10/4.26,与 L=3/N=4 相近但专家利用率仅约一半、冗余)、Clone(L=3,N=4)(87.84/33.30/227.17/3.61,最终选择,兼顾训练成本与性能)。
多姿态跟踪(头部高度 1.2m 站立到 0.6m 深蹲、每 0.1m 一档):Clone 在绝对位置精度(MPKPE)上不如两个基线,但在局部动作保真度(R-MPKPE、速度误差、手部朝向)上全面优于基线——作者解读为 Clone 更偏好”忠实复现参考动作细节”而非”全局位置绝对精确”的取舍。
专家激活分析:第一层中专家 1、2 主要在站立动作激活,专家 3、4 在下蹲动作激活;跳跃、出拳等高动态动作会激活全部 4 个专家(协同处理)。N=8 时仅约一半专家被激活(说明 8 个专家对当前数据分布冗余,4 个足够);L=1/4/5 均能形成专家分化,但最终选 L=3 兼顾训练成本与效果。
创新点与影响
- 首个 MoE 框架用于协调全身遥操作:直接应对”走路 vs 蹲下”等冲突性运动模式在单一策略里的建模难题,优于此前单一 MLP 架构。
- 首次为人形遥操作引入 LiDAR 闭环误差修正:把此前开环系统(h2o-human2humanoid、omnih2o、exbody2 等)的位置漂移问题在长时程任务中实测压到 5.1cm/8.9m 级别,且统计检验显示误差不随距离显著恶化。
- 仅用 AVP 头显的 3 点信号(头 3D + 双腕 6D)驱动全身协调运动,包括此前系统难以做到的”蹲地拾物”等组合动作,部署门槛低于全身动捕方案。
- 数据质量 > 数据规模的证据:仅 345 条精心设计的 Cloned 动作(约为 OmniH2O 8k+ motions 的 20%)即在关键任务(下蹲拾物)上超过用大规模但未针对性设计数据训练的同架构模型。
- 作者自陈局限:①极简输入(仅头+双腕)本质上限制了某些场景下的精细稳定性控制;②在跳跃等高动态动作上性能下降,作者归因于训练数据覆盖不足与平衡控制的固有难度;作者提出的后续方向是引入额外传感模态、扩充动作数据集并为动态行为设计专门奖励。
- 2025 年 8 月被 CoRL 2025 接收;代码仓库截至存档时仅开放早期 checkpoint 与部署说明,完整训练/推理代码计划与 RoboVerse 项目联合发布,尚未完全开源(见下方 GitHub README 存档的 TODO List)。
原始链接
- arXiv: https://arxiv.org/abs/2506.08931 (PDF: https://arxiv.org/pdf/2506.08931)
- 项目页(含全部演示视频与 BibTeX): https://humanoid-clone.github.io/
- GitHub(含部署文档 deploy/README.md): https://github.com/humanoid-clone/CLONE/
一手源存档(sources/)
- clone-teleoperation—project-page — 项目页快照,含摘要、演示视频清单、方法总览三步骤(sources/embodied/2025/clone-teleoperation—project-page.md)
- clone-teleoperation—github-readme — GitHub README + deploy/README 部署文档快照,含真机硬件配置、频率细节(sources/embodied/2025/clone-teleoperation—github-readme.md)
- 论文全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)