一句话定位
两阶段残差学习框架:先用大规模人类动捕数据训一个任务无关的通用动作跟踪(GMT)策略打底,再学一个轻量残差策略去感知物体、修正 GMT 输出,从而不改底座、不做逐任务奖励设计就把人形机器人从”能模仿人的动作”升级到”能精确完成负重搬运/起立/坐下等全身接触式 loco-manipulation”。
背景与定位
这项工作站在两条已有技术线的交汇点上。一条是通用动作跟踪(GMT):twist、gmt 等工作证明在大规模人类动捕数据(AMASS 等)上训练的单一策略,可以让人形机器人高保真复现走路、踢腿、舞蹈等多样动作,但这些策略对被操作物体一无所知——它们的观测里根本没有物体状态。另一条是人形 loco-manipulation:此前工作(Dao et al. 的模块化搬箱子 sim-to-real 流水线、Liu et al. 的 Opt2Skill)依赖任务专属的阶段式控制器或手工轨迹优化流水线,扩展性差;beyondmimic 等基于引导扩散的动作跟踪虽通用但同样不显式建模物体。VideoMimic 往前走了一步(重建静态环境、实现”坐椅子”等情境化动作),但仍局限于静态场景,不覆盖动态物体交互。
作者的核心洞察是:人形机器人做不同任务时,平衡、迈步、伸手等大部分全身动作是共享的,只有精细的物体交互部分才需要任务特化的修正——这正是残差学习范式的用武之地。残差学习本身在机器人学中不新鲜(早期用于修正手工控制器/MPC,asap 用残差学习补偿仿真-真实动力学落差),但把它接在一个预训练 GMT 策略上、用于注入物体感知(而非补偿动力学误差),是本文与 ASAP 等前作的关键区别。这也呼应了 π0、LBM 等机器人操作领域”大规模预训练 + 后训练”范式——作者明确指出这种 pretrain-posttrain 范式在人形全身控制里此前基本没人做过。
模型架构
两阶段结构:
- Stage I(GMT 基座策略 π_GMT):输入机器人本体感知 s_t^r 与人类参考动作 ŝ_t^r,输出粗动作 a_t^gmt = π_GMT(s_t^r, ŝ_t^r),为目标关节角,经 PD 控制器下发。本体感知定义为 [θ_t, ω_t, q_t, q̇_t, a_t^hist]{t-10:t}(根朝向、根角速度、29 维关节位置 q_t∈R²⁹、关节速度、近期动作历史,取最近 10 帧窗口);参考动作输入为 [p̂_t, θ̂_t, q̂_t]{t-10:t+10}(根平移、根朝向、关节位置,覆盖过去 10 帧到未来 10 帧,让策略能预判即将到来的目标,跟踪更平滑)。论文强调 ResMimic 是通用框架,可接入任意 GMT 策略作为基座,本文给出的是一种具体实现(训练策略沿用 twist 的动作跟踪奖励设计)。
- Stage II(残差策略 π_Res):在冻结/预训练好的 π_GMT 之上,额外输入物体状态 s_t^o 与物体参考轨迹 ŝ_t^o,输出残差动作 Δa_t^res∈R²⁹:π_Res(s_t^r, s_t^o, ŝ_t^r, ŝ_t^o) = Δa_t^res。最终下发动作为两者相加 a_t = a_t^gmt + Δa_t^res。物体状态 s_t^o=[p_t^o, θ_t^o, v_t^o, ω_t^o](根平移、根朝向、根速度、根角速度),物体参考轨迹同样取 t-10:t+10 窗口。
网络初始化:训练开始时人形已经能较好模仿参考动作,残差策略理想输出应接近零;因此 PPO actor 最后一层用带小 gain 的 Xavier uniform 初始化,让残差初始输出趋近于零,避免破坏已经学好的 GMT 基座行为。
动作空间:29 维关节目标位置(Δa_t^res∈R²⁹ 与 a_t^gmt 维度一致),两阶段都用 PPO 训练。
机器人本体:真实 Unitree G1,29 自由度,身高约 1.3 m。
具体网络结构(层数/隐藏维度):未披露(论文只给出观测/动作维度与初始化方式,无 MLP/backbone 具体架构描述)。
数据
- Stage I(GMT)训练数据:公开动捕数据集 AMASS + OMOMO,合计 超过 15,000 个片段(约 42 小时);过滤掉爬楼梯等真机不可行的动作。经运动学重定向工具 GMR(General Motion Retargeting) 把人类动作转成人形参考动作数据集 {Ŝ_i^r}。
- Stage II(残差策略)训练数据:用 OptiTrack 动捕系统同步采集人类动作 + 物体动作,覆盖论文设计的 4 个任务(Kneel 单膝跪地举箱、Carry 搬箱上背、Squat 蹲姿全身接触举箱、Chair 举起椅子)。人类动作同样经 GMR 重定向得到 ŝ_t^r,物体动作直接作为 ŝ_t^o,两者组成完整参考轨迹 {(ŝ_t^r, ŝ_t^o)}。
- 具体每任务片段数/时长:未披露。
- sim vs real:两阶段训练均在 IsaacGym 里进行(利用其大规模并行加速数据采集);随后做 sim-to-sim 迁移到 MuJoCo(作为更接近真实物理的评测代理);最终部署到真实 Unitree G1。
- 数据质量问题:作者明确指出运动学重定向会引入具身差异(embodiment gap)——手与椅子穿模、手与箱子悬空接触等(Fig. 2),这是残差策略需要用虚拟力课程去克服的噪声来源,而非干净数据。
训练方法
- 两阶段残差学习,均用 PPO 优化:
- Stage I 目标:最大化动作跟踪奖励 E[Σγ^(t-1) r_t^m];r_t^m 沿用 twist 的设计,由任务奖励+惩罚项+正则项三部分组成;训练中施加 domain randomization 促进 sim-to-real。
- Stage II 目标:最大化组合奖励 E[Σγ^(t-1)(r_t^m + r_t^o)](实现中进一步加入接触奖励 r_t^c)。直接复用 Stage I 的 r^m 和 domain randomization,不为物体/动作奖励的相对权重做逐任务调参——这是论文强调的”去任务专属工程化”的关键设计。
- 物体跟踪奖励(点云版本):不用传统的物体位姿差奖励 r_t^o=exp(-λ_p‖p_t^o-p̂_t^o‖₂)+w·exp(-λ_θ‖θ_t^o⊖θ̂_t^o‖₂)(该式对平移/旋转要手调相对权重 w),而是从物体网格表面采样 N 个点,计算当前与参考点云差:r_t^o=exp(-λ_o Σ_{i=1}^N ‖P[i]_t - P̂[i]_t‖₂)。这同时覆盖平移和旋转误差,奖励曲面更平滑,省去任务专属权重调节。
- 接触奖励:把接触位置离散到有意义的身体链接(躯干、髋、手臂,不含脚——脚主要与地面接触);从参考人-物交互轨迹得到 oracle 接触标签 ĉ_t[i]=1(‖d̂_t[i]‖<σ_c)(链接 i 与物体表面距离小于阈值 σ_c 即判定接触);接触奖励 r_t^c=Σ_i ĉ_t[i]·exp(-λ/f_t[i])(f_t[i] 为该链接的接触力)。
- 虚拟物体力课程(Virtual Object Force Curriculum):受 DexMachina 启发。训练早期,因重定向参考存在穿模、或物体质量偏重,策略容易把物体撞倒或干脆后撤回避(陷入局部最优)。解法是用 PD 控制器施加虚拟力/力矩,把物体主动拉向参考轨迹:F_t=k_p(p̂_t^o-p_t^o)-k_d v_t^o,T_t=k_p(θ̂_t^o⊖θ_t^o)-k_d ω_t^o;增益 (k_p, k_d) 随训练逐步衰减——早期靠虚拟力稳住物体让策略敢于接触,后期强迫策略独立完成任务。(具体 k_p/k_d 数值、衰减 schedule:未披露)
- 早停(Early Termination):在常规的人体姿态越界/意外落地早停基础上,新增两条针对物体交互的条件:(i) 物体网格与参考偏差超过阈值 ‖P_t-P̂_t‖₂>σ_o;(ii) 任一必需的身体-物体接触连续丢失超过 10 帧。
- 对照基线(同套奖励,公平对比):Base Policy(直接部署 GMT,无物体信息);Train from Scratch(单阶段 RL 从零同时学人体与物体跟踪);Base Policy + Finetune(直接微调 GMT 权重去跟踪物体,但因 GMT 架构本身不接受物体输入,微调策略拿不到显式物体观测)。
Infra(训练 / 推理工程)
- 训练模拟器:IsaacGym,用于大规模并行加速数据采集(具体并行环境数、GPU 型号与数量、训练总 GPU-小时:未披露)。
- 精度:未披露(论文未提混合精度/fp16 等信息)。
- Sim-to-sim 评测:训练完成后迁移到 MuJoCo 评测泛化性,作为比 IsaacGym 更贴近真实物理的代理基准。
- 真机部署:Unitree G1,29 自由度,1.3 m 高;支持 blind 部署(无物体状态输入,仅本体感知 + 人类参考动作)与 non-blind 部署(额外接入 MoCap 物体状态)。控制频率、板载算力、端到端推理延迟:未披露。
- 训练收敛速度:论文用”训练迭代数”而非 wall-clock 时间衡量收敛速度,以消除硬件差异带来的干扰(迭代数定义为奖励基本停止上升的时间点)。
评测 benchmark
Sim-to-sim(IsaacGym 训练 → MuJoCo 评测)四任务对比,Table I:
| 方法 | 任务 | SR↑ | 收敛迭代↓ | E_o↓(物体跟踪误差) | E_m↓(link 跟踪误差) | E_j↓(关节跟踪误差) |
|---|---|---|---|---|---|---|
| Base Policy | Kneel/Carry/Squat/Chair | 0%/0%/40%/0% | − | 0.76/0.29/0.19/1.19 | 3.30/2.47/0.93/30.18 | 0.28/1.19/0.90/1.20 |
| Base Policy(均值) | — | 10% | − | 0.61 | 9.22 | 0.89 |
| Train from Scratch(均值) | — | 0% | 4500 | 0.76 | 7.04 | 5.84 |
| Finetune(均值) | — | 7.5% | 2400 | 0.46 | 3.44 | 2.30 |
| ResMimic(均值,Ours) | — | 92.5% | 1300 | 0.12 | 0.13 | 1.29 |
ResMimic 各任务成功率:Kneel 90%(2000 迭代)、Carry 100%(1000 迭代)、Squat 80%(1500 迭代)、Chair 100%(700 迭代)。
要点(对应论文自设的三个研究问题 Q1-Q3):
- Q1:GMT 单独部署仅 10% 成功率(关节跟踪误差 E_j 反而略低,因其训练目标就是跟踪人体关节,但物体跟踪误差 E_o 和整体任务完成度都很差)——说明 GMT 提供强初始化,但不具备物体感知无法独立完成任务。
- Q2:Train from Scratch 在 MuJoCo 里完全失败(0% SR)、收敛也慢得多;IsaacGym→MuJoCo 的 sim-to-sim 对比(Fig. 5,Chair 与 Carry 任务)显示 scratch 训练的策略在 IsaacGym 中部分成功但迁移到 MuJoCo 后崩溃,而 ResMimic 迁移后性能几乎不掉——验证了 GMT 预训练带来的泛化与鲁棒性对跨越 sim-to-sim gap 至关重要。
- Q3:Finetune 优于 Train from Scratch 但仍远不及 ResMimic 也不如直接部署 GMT 基座(SR 仅 7.5%)——关键限制是微调策略架构上无法接入额外的物体观测,且微调容易破坏 GMT 已学到的泛化能力,导致跨任务不稳定;Fig. 5 显示微调策略在 Chair-Lift 任务上 IsaacGym 里能成功但 MuJoCo 里失败。
真实机器人评测(定性,无量化成功率表):
- 负重能力:搬运 4.5 kg 箱子;G1 手腕承重上限约 2.5 kg,证明必须依靠全身接触才能完成该负重任务。
- 泛化:举起 4.5 kg 和 5.5 kg 两把不同的椅子,展示对不规则形状重物的实例级泛化。
- 表现性动作:单膝跪地拾箱、搬箱上背等展现全身表现力;坐下-站起椅子展示物体交互超越”搬运”范畴、同时维持平衡与环境接触。
- Non-blind(带 MoCap 物体状态)部署额外验证:(i) 从随机初始物体位姿抓取(Fig. 4a,覆盖 11 次试验);(ii) 自主连续执行多次 loco-manipulation;(iii) 对外部扰动的反应性行为。
- 与基线的真机定性对比(Fig. 6):Base Policy 能表面模仿动作但无物体感知(在参考数据本身有瑕疵时问题更明显);Train from Scratch 与 Finetune 因 sim-to-real gap 完全失败。
消融(均为定性,无量化表格):
- 虚拟物体控制器(Fig. 7):去掉它时,参考动作中的穿模会导致机器人一接触就把物体撞倒、触发早停、拿到低物体奖励,策略很快陷入”后撤回避而非接触”的局部最优;加上虚拟力课程后,物体在训练早期被稳定住,策略得以跨越参考数据缺陷、收敛到精确操作策略。
- 接触奖励(Fig. 8,NCR=无接触奖励 vs CR=有接触奖励):举箱子存在两种策略——(1) 仅靠手腕/手;(2) 像人类示范那样躯干+手臂协同接触。无接触奖励时策略收敛到策略(1),在 IsaacGym 里可能成功但无法迁移到 MuJoCo 与真机;加上接触奖励后策略收敛到躯干+手臂协同的策略(2),与人类示范更一致,sim-to-sim 与 sim-to-real 迁移都更好(论文附带躯干接触力曲线佐证,具体数值未给出)。
创新点与影响
- 贡献:把”大规模预训练 + 轻量后训练”这一在机器人操作(π0、LBM)和图形学(隐空间编辑)里已验证有效的范式,首次系统性地搬到人形全身控制领域——用 GMT 当任务无关的运动先验,用残差策略专注注入物体感知,从而避免逐任务奖励工程。配套的三个具体设计(点云物体跟踪奖励、接触奖励、虚拟力课程)都直接服务于”让残差学习在噪声参考数据和重物体下也能稳定收敛”这一目标。
- 改变了什么:实验直接证伪了两个”看似合理”的替代方案——从零训练和微调 GMT 骨干——在 sim-to-sim(IsaacGym→MuJoCo)和真机上都不可行,只有”冻结 GMT + 残差”路线能跨越这些 gap。真机上验证了全身接触对超出末端执行器承重上限(G1 手腕限重 2.5 kg vs 实际搬运 4.5-5.5 kg 负载)的必要性,把”人形能做的负重操作”往前推了一步。
- 作者自述局限(散见于正文,非独立 Limitations 章节):(1) GMT 基座本身不具备物体感知,独立部署时任务成功率仅 10%;(2) 直接微调 GMT 的路径受限于其架构无法接收额外物体观测,且微调倾向于覆盖掉 GMT 已有的泛化能力,导致跨任务不稳定;(3) 方法仍然依赖运动学重定向生成的参考轨迹,而这些参考本身含有穿模、悬浮接触等具身差异瑕疵——虚拟力课程是绕过而非根治这一问题;(4) 真实机器人上没有报告量化的任务成功率或跨 trial 统计(除 Fig.4 的 11 次随机位姿试验外均为定性演示),消融研究(虚拟物体控制器、接触奖励)也只给出定性对比而非数值表。
- 开放计划:作者承诺发布 GPU 加速仿真基础设施、sim-to-sim 评测原型与动作数据;代码已在 GitHub(amazon-far/ResMimic,Apache-2.0)公开,构建于 TWIST2 代码库之上。
原始链接
- arXiv abs:https://arxiv.org/abs/2510.05070
- arXiv PDF:https://arxiv.org/pdf/2510.05070
- 项目页:https://resmimic.github.io/
- 代码:https://github.com/amazon-far/ResMimic
- 视频:https://www.youtube.com/watch?v=dadOH-TpbRk
一手源存档(sources/)
- resmimic—project-page — 项目页快照(sources/embodied/2025/resmimic—project-page.md)
- resmimic—github-readme — GitHub README(sources/embodied/2025/resmimic—github-readme.md)
- arXiv 2510.05070 全文(arXiv 原文 PDF/HTML,不入 git;引用见上方链接)