一句话定位

HOMIE 是一套人形机器人整机遥操作驾驶舱(cockpit):把一个 RL 训练的下肢 loco-manipulation 策略(能在任意连续变化的上半身姿态下稳定行走 + 蹲到任意高度)与一套总价约 $0.5k 的等构外骨骼硬件(同构机械臂 + 15-DoF 动感手套 + 脚踏板)拼在一起,让单个操作者不用 IK、不用 MoCap、不用双手就能全身精确操控 Unitree G1 / Fourier GR-1。Shanghai AI Lab(OpenRobotLab)+ 港中文 MMLab,RSS 2025

背景与定位

问题范式是人形整机 loco-manipulation 遥操作 + 数据采集:既要有能扩大操作工作空间的鲁棒下肢策略,又要有让单人同时精确控制上肢操纵 + 下肢移动的手段。作者把已有工作的短板归成三类(对照 Tab. I):

  • 只操控上半身(OpenTeleVision、AnyTeleop、ACE、OpenTeach 等):机器人不能自由移动或蹲下调姿,工作空间受限。
  • 有 loco-manipulation 但依赖 MoCap / motion prior(HumanPlus、H2O/OmniH2O、Mobile-TeleVision、ExBody 线,见 humanoid-wbc):普遍做不到蹲到指定高度,且要用视觉估姿(精度差)或让操作者用身体带动机器人(大场景下难维持精确)。
  • 主流用视觉估姿 + IK 或异构外骨骼 + FK/IK:位姿估计和 IK 迭代都引入误差,牺牲精度与可靠性。

HOMIE 的定位是把”低成本 + 高精度关节匹配(joint-matching)+ 灵巧手 + loco-manip + 整机 + 无 MoCap”这些优点首次凑齐。方法学上,下肢策略属 RL locomotion / whole-body control 家族(PPO + 大规模并行仿真 + 域随机化 + 零样本 sim-to-real),硬件属 isomorphic exoskeleton 遥操作家族(GELLO / AirExo 的关节匹配思路,但接上灵巧手套)。与同期 asapgmt 等”跟踪人类动作”路线不同,HOMIE 不跟踪参考动作、不用任何 motion prior,而是用课程学习直接把”任意上半身姿态”当扰动来训。

模型架构

系统含两个策略:遥操作时用低层策略 πloco,自主执行时用模仿学习策略 πauto。

低层 loco 策略 πloco(本文核心)——只控制下半身,上半身 7-DoF/臂关节由外骨骼读数直接设定(joint-matching,不进网络、不做 IK):

  • 命令 C_t = [v_x, ω_yaw, h]:前进/后退速度、转向速度、躯干目标高度;网络里命令向量为 4 维(Dim([C_t,ω_t,g_t])=4+3+3=10)。
  • 观测 O_t = [C_t, ω_t, g_t, q_t, q̇_t, a_{t-1}]ω_t 躯干角速度、g_t 重力在躯干系投影、q_t/q̇_t 全身关节角/角速度、a_{t-1} 上一步动作;实际输入堆叠 6 帧历史 O_{t-5:t}
  • 动作 a_t 与下肢关节一一对应(维度 N_lower),经 PD 转力矩 τ = Kp·(a - q0) - Kd·q̇ 驱动电机。
  • 网络(沿用 HIMLoco 的 HIM 架构,全 3 层 MLP):估计器 E = 编码器(6×(10+2·N_joints+N_lower)→256→256→35)+ target 网络(→256→256→32)+ proto Embedding(64,32),用对比学习(SwaV 式原型)一步估计速度(3)+隐变量(32);actor N35+10+2·N_joints+N_lower→512→256→256→N_lower);critic C3+10+…→512→256→256→1)。
  • 零样本 sim-to-real;部署控制频率 50 Hz,与训练一致。

自主策略 πauto(IL):采用 Seer(predictive inverse dynamics model,自回归 transformer)。多视角图像过 MAE 预训练 ViT-B 编码器、本体状态过 MLP,拼成 token → transformer encoder → 自回归产隐码 → 三个回归头分别输出上臂关节 / 灵巧手 / 高度命令,用 SmoothL1 loss。序列长 7,视觉预见步 + 动作预测步各为 3,bfloat16 推理。

硬件(对 G1 与 GR-1 各设计一套):3D 打印 PLA。①同构外骨骼臂:每臂 7-DoF(肩 3 + 肘 1 + 腕 3),每关节一颗 DYNAMIXEL XL330-M288-T 舵机,读/调精度 0.09°,按机器人 URDF 关节坐标系比例对齐。②动感手套:基于 Project-Homunculus,每指 3 组 Hall 传感器 + 钕磁铁,共 15-DoF(指尖 pitch α、指腹 pitch β、指腹 yaw γ),角度-读数非线性(指数型),可插拔、可跨机器人复用,已在 Inspire RH56DFTP 上测过。③脚踏板:3 个小踏板(0932 电位器,量程 270°、实际行程 40°)分别控 [0,±ω][H_min,H_max][0,±V],加两个模式切换微动开关(前后/左右)——用脚给移动命令,解放双手去做上肢操纵。

数据

  • 完全 MoCap-free:不用 AMASS、不做动作 retarget、无任何 motion prior——这是相对 humanoid-wbc 整条线的关键区别。
  • RL 训练数据(仿真自采):Isaac Gym,4096 个并行环境。上半身目标姿态每 1 秒重采一次并做均匀插值过渡(否则机器人在连续运动下难保持平衡);命令每 4 秒重采一次,其中 1/3 环境练蹲、2/3 环境练站立/行走,同一环境在蹲/走间切换以学会平滑过渡。
  • 域随机化(Tab. VII,G1/GR-1 同参):力矩偏置 [-0.05,0.05] N·m、躯干负载 [-5,10] kg、手部负载 [-0.1,0.3] kg(专门增强握物能力)、CoM 偏移 [-0.1,0.1] m、连杆质量 ×[0.8,1.2]、摩擦 [0.1,2.0]、恢复系数 [0,1]、Kp/Kd ×[0.9,1.1]、推力 [-0.5,0.5] m/s,以及若干观测噪声。
  • 关键参数(Tab. VIII):G1 行走目标高度 0.74 m、GR-1 0.90 m;X 线速度范围 [-0.8,1.2] m/s、Y [-0.5,0.5](GR-1 [-0.8,0.8])、Yaw [-0.8,0.8] rad/s(GR-1 [-1.0,1.0]);蹲高命令范围 G1 [-0.24,0.74]、GR-1 [-0.30,0.90]。
  • IL 数据:两个任务 Squat Pick / Pick & Place,每任务 50 条 episode,以 10 Hz 采 RGB 图 + 机器人状态 q_t + 上半身命令 q_upper + 移动命令 C_t

训练方法

RL 主干:PPO,基于 HIM([Hybrid Internal Model])+ legged_gym/rsl_rl/HIMLoco 代码。三大自研技巧:

  1. 上半身姿态课程(upper-body pose curriculum):用上肢动作比例 r_a(0 起、每当速度跟踪 reward 达阈值 +0.05、最终到 1)调采样范围;先从分布 p(x|r_a)=20(1-r_a)e^{-20(1-r_a)x}/(1-e^{-20(1-r_a)}) 采出 r_a',再 a_i ~ U(0, r_a'),让难度从”几乎不动上肢”平滑过渡到”上肢在 [0,1] 全范围乱动”。消融显示比无课程 / U(0,r_a) 式课程收敛更快、跟踪误差更小。
  2. 高度跟踪奖励 r_knee(Eq.4,权重 -0.75)r_knee = -‖(h_r,t - h_t)·(归一化膝关节位置 - 1/2)‖,把高度误差和膝关节归一化位置耦合——h_r<h_t 时鼓励屈膝、h_r>h_t 时鼓励伸膝,给蹲高提供明确梯度;比单纯放大 base-height 跟踪奖励收敛更快、且不拖累其它 reward。base height tracking reward 权重 2.0。
  3. 对称利用(symmetry utilization,源自 Su et al. 2024):对每条 transition 关于机器人 x-z 平面做镜像(翻转左右关节位置/速度/动作及转向速度),镜像样本一并入 rollout;再加对称损失 L_sym^actor = MSE(a_t, a'_t)L_sym^critic = MSE(V_t, V'_t)。消融显示对称数据增强把训练加速 10× 以上,对称损失防止策略靠牺牲左右对称来”偷解”。

奖励表(Tab. VI)另含 x/y 速度跟踪(1.5/1.0)、角速度跟踪(2.0/1.0)、姿态、动作率、髋/踝偏离、feet air time / clearance / 平行 / slip / 接触力等一大批正则项,G1 与 GR-1 权重”大体相同”(体现框架通用性)。训练中还发现调小踝关节 Kp 能缓解 stand-still 奖励导致的起停不稳。

IL 训练:Seer 在 8× A100 上训 40 epoch,取验证 loss 最低的 checkpoint。

Infra(训练 / 推理工程)

  • 训练:单张 Nvidia RTX 4090,Isaac Gym 4096 环境,每个策略约 3 小时即可训到可直接部署(消融评测用 2k step、1000 环境、20 s、3 个随机种子)。
  • πloco 推理/部署:直接跑在 G1 板载 Nvidia Jetson Orin(275 TOPS)50 Hz。一台纯 CPU 主机经 4 条数据线读同构臂/左右手套/踏板,把 q_upperC_tWi-Fi TCP 发给 G1;D455 相机 640×480 @ ~30 Hz 回传。受 TCP/硬件限制,臂关节目标以 10 Hz 更新、再插值 50 次平滑驱动上半身;若机器人能收更高频信号,系统可支持 >200 Hz
  • πauto 推理/部署:主机装 RTX 4080,走有线以太网 TCP(传图更快),整环路 10 Hz;D455 头部相机 + 2× D435 臂部相机。
  • 硬件采集频率(Tab. III):外骨骼 0.26 kHz、手套 0.3 kHz、踏板 0.5 kHz(115200 波特、12-bit 精度)。
  • sim→sim:Isaac Gym → Isaac Sim(GRUtopia),核心是对齐关节序(深度优先↔广度优先)与四元数约定(xyzw↔wxyz)。

评测 benchmark

跨机器人 loco 策略收敛(Tab. II,2k step):

指标Unitree G1Fourier GR-1
线速度误差 (m/s)0.1940.273
角速度误差 (rad/s)0.4510.540
高度误差 (m)0.0220.038
对称损失0.0190.009
存活时间 (s)19.94719.960

上肢遥操作输出频率(Tab. IV,输出到机器人的臂/手频率,越高越流畅):

系统硬件臂 (Hz)手 (Hz)
Telekinesis2× RTX 3080 Ti1624
AnyTeleopRTX 3090125111
OpenTeleVisionM2 芯片6060
HOMIE无 GPU/SoC263293

→ 位姿获取比前作快 200%+,且不需要 GPU/SoC。

硬件成本(Tab. III):外骨骼 $430 + 手套 $30/只 + 踏板 $20,整套约 $0.5k(Tab. I 里唯一同时满足 loco-manip ✓ / 整机 ✓ / 无 MoCap ✓ / 关节匹配灵巧手追踪 / 低成本的系统)。

任务完成时间:与 VR 方案 OpenTeleVision 比 4 个桌面任务(Pick & Place / Scan Barcode / Hand Over / Open Oven,3 操作者 × 3 次),HOMIE 完成时间约为对方一半(~2× 加速),在需要径向/纵深移动的任务上差距更明显。

IL 成功率(Tab. V,各测 15 次):Squat Pick 73.3%、Pick & Place 80.0%

真机能力展示:蹲取低架物、跨货架搬箱、单手互递、后退开烤箱、双臂搬花、把约 60 kg(约两倍机器人体重)坐椅上的人推走、双机器人协作递苹果等。

创新点与影响

  • 首个人形整机 loco-manipulation 遥操作驾驶舱,单人即可全身操控并完成多样任务。
  • 首次实现”在任意连续变化的上半身姿态下鲁棒 loco-manipulation(含蹲到任意高度)且不用任何 motion prior”——用课程学习把上半身姿态当扰动,绕开了整条 MoCap-retarget 依赖,pipeline 更简、可换机器人(G1/GR-1 仅改高度范围与少量机身尺寸值)。
  • 同构外骨骼 + 15-DoF 手套 → 免 IK、零 retargeting 误差、成本仅 $0.5k、无需 GPU 就能高频输出,把任务完成时间近乎减半;手套可插拔复用、可适配多种灵巧手。
  • 全套开源(HomieRL 训练 + HomieHardware 设计/PCB + HomieDeploy 部署,CC BY-NC-SA 4.0),对低成本人形数据采集与遥操作是可复现的参考实现。
  • 作者自陈局限:①策略仍无法可靠穿越多样地形(接 PIM 训楼梯,仿真能过、真机因头部 LiDAR 晃动 + 高程图分辨率低导致 sim2real gap 而撞台阶);②15-DoF 手套的拇指设计不完全贴合人手解剖,操控某些灵巧手不够直觉顺滑;③无力反馈,限制需要精细触觉交互的场景。

原始链接

一手源存档(sources/)

  • homie—github-readme — GitHub README 快照(sources/embodied/2025/homie—github-readme.md)
  • homie—project-page — 项目页快照,含 RSS 2025、RTX 4090 ~3h、对称加速 >10×、~2× 遥操作提速等(sources/embodied/2025/homie—project-page.md)
  • 论文全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)