一句话定位
HOMIE 是一套人形机器人整机遥操作驾驶舱(cockpit):把一个 RL 训练的下肢 loco-manipulation 策略(能在任意连续变化的上半身姿态下稳定行走 + 蹲到任意高度)与一套总价约 $0.5k 的等构外骨骼硬件(同构机械臂 + 15-DoF 动感手套 + 脚踏板)拼在一起,让单个操作者不用 IK、不用 MoCap、不用双手就能全身精确操控 Unitree G1 / Fourier GR-1。Shanghai AI Lab(OpenRobotLab)+ 港中文 MMLab,RSS 2025。
背景与定位
问题范式是人形整机 loco-manipulation 遥操作 + 数据采集:既要有能扩大操作工作空间的鲁棒下肢策略,又要有让单人同时精确控制上肢操纵 + 下肢移动的手段。作者把已有工作的短板归成三类(对照 Tab. I):
- 只操控上半身(OpenTeleVision、AnyTeleop、ACE、OpenTeach 等):机器人不能自由移动或蹲下调姿,工作空间受限。
- 有 loco-manipulation 但依赖 MoCap / motion prior(HumanPlus、H2O/OmniH2O、Mobile-TeleVision、ExBody 线,见 humanoid-wbc):普遍做不到蹲到指定高度,且要用视觉估姿(精度差)或让操作者用身体带动机器人(大场景下难维持精确)。
- 主流用视觉估姿 + IK 或异构外骨骼 + FK/IK:位姿估计和 IK 迭代都引入误差,牺牲精度与可靠性。
HOMIE 的定位是把”低成本 + 高精度关节匹配(joint-matching)+ 灵巧手 + loco-manip + 整机 + 无 MoCap”这些优点首次凑齐。方法学上,下肢策略属 RL locomotion / whole-body control 家族(PPO + 大规模并行仿真 + 域随机化 + 零样本 sim-to-real),硬件属 isomorphic exoskeleton 遥操作家族(GELLO / AirExo 的关节匹配思路,但接上灵巧手套)。与同期 asap、gmt 等”跟踪人类动作”路线不同,HOMIE 不跟踪参考动作、不用任何 motion prior,而是用课程学习直接把”任意上半身姿态”当扰动来训。
模型架构
系统含两个策略:遥操作时用低层策略 πloco,自主执行时用模仿学习策略 πauto。
低层 loco 策略 πloco(本文核心)——只控制下半身,上半身 7-DoF/臂关节由外骨骼读数直接设定(joint-matching,不进网络、不做 IK):
- 命令
C_t = [v_x, ω_yaw, h]:前进/后退速度、转向速度、躯干目标高度;网络里命令向量为 4 维(Dim([C_t,ω_t,g_t])=4+3+3=10)。 - 观测
O_t = [C_t, ω_t, g_t, q_t, q̇_t, a_{t-1}],ω_t躯干角速度、g_t重力在躯干系投影、q_t/q̇_t全身关节角/角速度、a_{t-1}上一步动作;实际输入堆叠 6 帧历史O_{t-5:t}。 - 动作
a_t与下肢关节一一对应(维度N_lower),经 PD 转力矩τ = Kp·(a - q0) - Kd·q̇驱动电机。 - 网络(沿用 HIMLoco 的 HIM 架构,全 3 层 MLP):估计器
E= 编码器(6×(10+2·N_joints+N_lower)→256→256→35)+ target 网络(→256→256→32)+ protoEmbedding(64,32),用对比学习(SwaV 式原型)一步估计速度(3)+隐变量(32);actorN(35+10+2·N_joints+N_lower→512→256→256→N_lower);criticC(3+10+…→512→256→256→1)。 - 可零样本 sim-to-real;部署控制频率 50 Hz,与训练一致。
自主策略 πauto(IL):采用 Seer(predictive inverse dynamics model,自回归 transformer)。多视角图像过 MAE 预训练 ViT-B 编码器、本体状态过 MLP,拼成 token → transformer encoder → 自回归产隐码 → 三个回归头分别输出上臂关节 / 灵巧手 / 高度命令,用 SmoothL1 loss。序列长 7,视觉预见步 + 动作预测步各为 3,bfloat16 推理。
硬件(对 G1 与 GR-1 各设计一套):3D 打印 PLA。①同构外骨骼臂:每臂 7-DoF(肩 3 + 肘 1 + 腕 3),每关节一颗 DYNAMIXEL XL330-M288-T 舵机,读/调精度 0.09°,按机器人 URDF 关节坐标系比例对齐。②动感手套:基于 Project-Homunculus,每指 3 组 Hall 传感器 + 钕磁铁,共 15-DoF(指尖 pitch α、指腹 pitch β、指腹 yaw γ),角度-读数非线性(指数型),可插拔、可跨机器人复用,已在 Inspire RH56DFTP 上测过。③脚踏板:3 个小踏板(0932 电位器,量程 270°、实际行程 40°)分别控 [0,±ω]、[H_min,H_max]、[0,±V],加两个模式切换微动开关(前后/左右)——用脚给移动命令,解放双手去做上肢操纵。
数据
- 完全 MoCap-free:不用 AMASS、不做动作 retarget、无任何 motion prior——这是相对 humanoid-wbc 整条线的关键区别。
- RL 训练数据(仿真自采):Isaac Gym,4096 个并行环境。上半身目标姿态每 1 秒重采一次并做均匀插值过渡(否则机器人在连续运动下难保持平衡);命令每 4 秒重采一次,其中 1/3 环境练蹲、2/3 环境练站立/行走,同一环境在蹲/走间切换以学会平滑过渡。
- 域随机化(Tab. VII,G1/GR-1 同参):力矩偏置 [-0.05,0.05] N·m、躯干负载 [-5,10] kg、手部负载 [-0.1,0.3] kg(专门增强握物能力)、CoM 偏移 [-0.1,0.1] m、连杆质量 ×[0.8,1.2]、摩擦 [0.1,2.0]、恢复系数 [0,1]、Kp/Kd ×[0.9,1.1]、推力 [-0.5,0.5] m/s,以及若干观测噪声。
- 关键参数(Tab. VIII):G1 行走目标高度 0.74 m、GR-1 0.90 m;X 线速度范围 [-0.8,1.2] m/s、Y [-0.5,0.5](GR-1 [-0.8,0.8])、Yaw [-0.8,0.8] rad/s(GR-1 [-1.0,1.0]);蹲高命令范围 G1 [-0.24,0.74]、GR-1 [-0.30,0.90]。
- IL 数据:两个任务 Squat Pick / Pick & Place,每任务 50 条 episode,以 10 Hz 采 RGB 图 + 机器人状态
q_t+ 上半身命令q_upper+ 移动命令C_t。
训练方法
RL 主干:PPO,基于 HIM([Hybrid Internal Model])+ legged_gym/rsl_rl/HIMLoco 代码。三大自研技巧:
- 上半身姿态课程(upper-body pose curriculum):用上肢动作比例
r_a(0 起、每当速度跟踪 reward 达阈值 +0.05、最终到 1)调采样范围;先从分布p(x|r_a)=20(1-r_a)e^{-20(1-r_a)x}/(1-e^{-20(1-r_a)})采出r_a',再a_i ~ U(0, r_a'),让难度从”几乎不动上肢”平滑过渡到”上肢在 [0,1] 全范围乱动”。消融显示比无课程 /U(0,r_a)式课程收敛更快、跟踪误差更小。 - 高度跟踪奖励
r_knee(Eq.4,权重 -0.75):r_knee = -‖(h_r,t - h_t)·(归一化膝关节位置 - 1/2)‖,把高度误差和膝关节归一化位置耦合——h_r<h_t时鼓励屈膝、h_r>h_t时鼓励伸膝,给蹲高提供明确梯度;比单纯放大 base-height 跟踪奖励收敛更快、且不拖累其它 reward。base height tracking reward 权重 2.0。 - 对称利用(symmetry utilization,源自 Su et al. 2024):对每条 transition 关于机器人 x-z 平面做镜像(翻转左右关节位置/速度/动作及转向速度),镜像样本一并入 rollout;再加对称损失
L_sym^actor = MSE(a_t, a'_t)、L_sym^critic = MSE(V_t, V'_t)。消融显示对称数据增强把训练加速 10× 以上,对称损失防止策略靠牺牲左右对称来”偷解”。
奖励表(Tab. VI)另含 x/y 速度跟踪(1.5/1.0)、角速度跟踪(2.0/1.0)、姿态、动作率、髋/踝偏离、feet air time / clearance / 平行 / slip / 接触力等一大批正则项,G1 与 GR-1 权重”大体相同”(体现框架通用性)。训练中还发现调小踝关节 Kp 能缓解 stand-still 奖励导致的起停不稳。
IL 训练:Seer 在 8× A100 上训 40 epoch,取验证 loss 最低的 checkpoint。
Infra(训练 / 推理工程)
- 训练:单张 Nvidia RTX 4090,Isaac Gym 4096 环境,每个策略约 3 小时即可训到可直接部署(消融评测用 2k step、1000 环境、20 s、3 个随机种子)。
- πloco 推理/部署:直接跑在 G1 板载 Nvidia Jetson Orin(275 TOPS),50 Hz。一台纯 CPU 主机经 4 条数据线读同构臂/左右手套/踏板,把
q_upper与C_t经 Wi-Fi TCP 发给 G1;D455 相机 640×480 @ ~30 Hz 回传。受 TCP/硬件限制,臂关节目标以 10 Hz 更新、再插值 50 次平滑驱动上半身;若机器人能收更高频信号,系统可支持 >200 Hz。 - πauto 推理/部署:主机装 RTX 4080,走有线以太网 TCP(传图更快),整环路 10 Hz;D455 头部相机 + 2× D435 臂部相机。
- 硬件采集频率(Tab. III):外骨骼 0.26 kHz、手套 0.3 kHz、踏板 0.5 kHz(115200 波特、12-bit 精度)。
- sim→sim:Isaac Gym → Isaac Sim(GRUtopia),核心是对齐关节序(深度优先↔广度优先)与四元数约定(xyzw↔wxyz)。
评测 benchmark
跨机器人 loco 策略收敛(Tab. II,2k step):
| 指标 | Unitree G1 | Fourier GR-1 |
|---|---|---|
| 线速度误差 (m/s) | 0.194 | 0.273 |
| 角速度误差 (rad/s) | 0.451 | 0.540 |
| 高度误差 (m) | 0.022 | 0.038 |
| 对称损失 | 0.019 | 0.009 |
| 存活时间 (s) | 19.947 | 19.960 |
上肢遥操作输出频率(Tab. IV,输出到机器人的臂/手频率,越高越流畅):
| 系统 | 硬件 | 臂 (Hz) | 手 (Hz) |
|---|---|---|---|
| Telekinesis | 2× RTX 3080 Ti | 16 | 24 |
| AnyTeleop | RTX 3090 | 125 | 111 |
| OpenTeleVision | M2 芯片 | 60 | 60 |
| HOMIE | 无 GPU/SoC | 263 | 293 |
→ 位姿获取比前作快 200%+,且不需要 GPU/SoC。
硬件成本(Tab. III):外骨骼 $430 + 手套 $30/只 + 踏板 $20,整套约 $0.5k(Tab. I 里唯一同时满足 loco-manip ✓ / 整机 ✓ / 无 MoCap ✓ / 关节匹配灵巧手追踪 / 低成本的系统)。
任务完成时间:与 VR 方案 OpenTeleVision 比 4 个桌面任务(Pick & Place / Scan Barcode / Hand Over / Open Oven,3 操作者 × 3 次),HOMIE 完成时间约为对方一半(~2× 加速),在需要径向/纵深移动的任务上差距更明显。
IL 成功率(Tab. V,各测 15 次):Squat Pick 73.3%、Pick & Place 80.0%。
真机能力展示:蹲取低架物、跨货架搬箱、单手互递、后退开烤箱、双臂搬花、把约 60 kg(约两倍机器人体重)坐椅上的人推走、双机器人协作递苹果等。
创新点与影响
- 首个人形整机 loco-manipulation 遥操作驾驶舱,单人即可全身操控并完成多样任务。
- 首次实现”在任意连续变化的上半身姿态下鲁棒 loco-manipulation(含蹲到任意高度)且不用任何 motion prior”——用课程学习把上半身姿态当扰动,绕开了整条 MoCap-retarget 依赖,pipeline 更简、可换机器人(G1/GR-1 仅改高度范围与少量机身尺寸值)。
- 同构外骨骼 + 15-DoF 手套 → 免 IK、零 retargeting 误差、成本仅 $0.5k、无需 GPU 就能高频输出,把任务完成时间近乎减半;手套可插拔复用、可适配多种灵巧手。
- 全套开源(HomieRL 训练 + HomieHardware 设计/PCB + HomieDeploy 部署,CC BY-NC-SA 4.0),对低成本人形数据采集与遥操作是可复现的参考实现。
- 作者自陈局限:①策略仍无法可靠穿越多样地形(接 PIM 训楼梯,仿真能过、真机因头部 LiDAR 晃动 + 高程图分辨率低导致 sim2real gap 而撞台阶);②15-DoF 手套的拇指设计不完全贴合人手解剖,操控某些灵巧手不够直觉顺滑;③无力反馈,限制需要精细触觉交互的场景。
原始链接
- arXiv: https://arxiv.org/abs/2502.13013 (PDF: https://arxiv.org/pdf/2502.13013)
- 项目页(含 RSS 2025 标注与全部视频): https://homietele.github.io/
- GitHub(OpenHomie,含 HomieRL/HomieHardware/HomieDeploy): https://github.com/OpenRobotLab/OpenHomie
- 演示视频: https://www.youtube.com/watch?v=FxkGmjyMc5g
一手源存档(sources/)
- homie—github-readme — GitHub README 快照(sources/embodied/2025/homie—github-readme.md)
- homie—project-page — 项目页快照,含 RSS 2025、RTX 4090 ~3h、对称加速 >10×、~2× 遥操作提速等(sources/embodied/2025/homie—project-page.md)
- 论文全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)