一句话定位
OmniRetarget 是一个”保交互”的人形动作重定向数据生成引擎:用交互网格(interaction mesh)+ 硬约束优化把人类演示重定向到机器人,同时显式保留人-物-地形的空间与接触关系,并能从单条演示自动增广出跨物体位姿/尺寸/地形高度/机器人本体的大批高质量轨迹;由此得到的干净参考让一个只用 5 条奖励 + 4 项域随机化、无课程学习的本体感知 RL 策略在 Unitree G1 上零样本 sim-to-real 完成搬箱、爬平台、翻滚等长达 30 秒的敏捷全身 loco-manipulation。ICRA 2026 最佳会议论文奖 + 机器人操作与运动最佳论文奖。
背景与定位
主流的人形复杂技能学习范式是”把人类动作重定向成运动学参考 → 用它做 DeepMimic 式模仿 RL”。瓶颈在数据:现有重定向管线(ASAP 依赖的 PHC、TWIST 用的 GMR、VideoMimic 等)大多用无约束或软惩罚优化,产出脚滑(foot skating)、穿模(penetration)等物理不可行伪影;更关键的是它们只做关键点匹配,不显式建模人-物、人-环境的接触关系,重定向后的物体/地形交互不再成立。低质量参考迫使下游 RL 要么手工清洗数据,要么堆一大堆 ad-hoc 正则(接触时长、腾空时间等)来补救,调参既繁琐又脆弱。
论文把范式从”用复杂奖励工程去打补丁修复劣质参考”转向”从源头用有原则的数据生成解决问题”。它借鉴图形学里的交互网格(Ho et al. 2010)与接触丰富操作的轨迹优化数据增广(Yang et al. RSS 2025,本文一作前作)思路。RL 侧则直接沿用 BeyondMimic 证明的结论——参考足够干净时,极简奖励即可高质量跟踪——把 BeyondMimic 的奖励/超参原封不动 out-of-the-box 用上。最接近的前作是 IMMA(Nakaoka & Komura, Humanoids 2012),同样用交互网格保留身体部位空间关系,但未开源、且忽略运动学限位与环境/物体交互。OmniRetarget 的差异化:把脚部粘滞、非穿透、关节/速度限位等全部硬约束统一进单个优化,并显式保留环境与物体交互,还支持数据增广(见 Table I 对比)。
模型架构
OmniRetarget 不是一个神经网络”模型”,而是重定向优化器 + 极简 RL 策略两段式管线。
重定向引擎(核心,EMB 的”动作/数据生成”侧):
- 交互网格:对”用户定义的关键关节点 + 物体/环境表面随机采样点”做 Delaunay 四面体化(用 Si & Gärtner 的约束 Delaunay),构成体积网格。物体/环境表面采样密度高于身体关节,以更准地维持接触。
- 优化目标:最小化源(人+物+地形)网格与目标(机器人+同一物体/环境点)网格之间的 Laplacian 变形能量(式 2),即每个关键点相对其邻居加权平均的差(uniform 权重
w_ij = 1/|N(i)|)在源/目标间的变化。机器人关键点由配置q_t(浮动基座四元数+平移 + 全部关节角)经正运动学得到。 - 硬约束(式 3b–3e):碰撞对的有向距离函数
φ_j(q_t) ≥ 0(非穿透)、关节限位q_min ≤ q_t ≤ q_max、速度限位v_min·dt ≤ q_t − q_{t-1} ≤ v_max·dt、支撑脚粘滞p_t^F = p_{t-1}^F(源动作 xy 水平速度低于 1 cm/s 判为支撑相)。目标里还含‖q_t − q_{t-1}‖_Q²的时序平滑项。 - 求解器:逐帧顺序求解,自定义 SQP 式 / Sequential SOCP——每帧内把目标二次近似、硬约束在上一迭代解处线性化,迭代最多 10 次至收敛;每帧用上一帧最优解
q*_{t-1}热启动。四元数浮动基座姿态的导数(S³ 流形微分几何)交给 Drake 的自动微分处理。 - 跨本体:同一管线只改”关键点对应关系 + 机器人碰撞模型”即可适配 Unitree G1 / H1、Booster T1 三种本体(Fig. 2)。
- 数据增广机制:固定源网格
P^source、改动P^target后重解优化即得新的运动学可行轨迹。物体增广要在物体局部坐标系里建交互网格(保证 Laplacian 坐标对物体全局旋转/平移不变,物体转 180° 时物体帧下 Laplacian 坐标不变);物体初始位姿增广用指数衰减调度(式 14)把新初始位姿融回原轨迹。为避免”整机随物体刚体平移”的平凡解,加入‖q_t − q̄*_t‖_W(式 4,W 重罚下半身)并约束初始脚位姿匹配名义轨迹(式 5)。
RL 策略(EMB 的 policy 侧):
- 极简**本体感知(proprioceptive-only)**策略,对场景/物体信息”盲”,只靠精确跟踪参考轨迹。
- 观测:参考关节位/速、参考骨盆位置/朝向误差;本体的骨盆线/角速度、关节位/速;上一步动作。敏捷动作下(状态估计不可靠时)屏蔽骨盆线位置误差与线速度。
- backbone 与训练算法沿用 BeyondMimic(PPO 系);开源实现 Holosoma 框架里同时支持 PPO 与 FastSAC。
数据
- 源数据集:OMOMO(人-物操作,SMPL 格式)、LAFAN1(纯运动,BVH 骨架层级)、以及自采 in-house MoCap(人-地形交互,BVH)。SMPL 数据用”直接缩放”(
α = h_robot/h_demo全局高度比)而非 PHC/VideoMimic 的”模型拟合”。 - 生成规模:全量重定向轨迹 >8 小时(arXiv v1 摘要;项目页更新版写作 >9 小时)。按基准明细:OMOMO 搬箱 2.78 小时 + in-house MoCap 1 小时 + LAFAN1 4.6 小时 将开源。
- 公开数据集(HF):因 LAFAN1 授权限制不发布其重定向结果(改为开源重定向代码让用户自行重定向)。实际发布 4.0 小时:
robot-object3.0h(源 OMOMO)+robot-terrain0.5h(in-house MoCap)+robot-object-terrain0.5h(in-house MoCap)。每条.npz含fps与qpos [T, D]:机器人位姿 36D(浮动基座 7D + 29 关节)+ 可选物体位姿 7D,故 D=36(无物体)或 43(含物体)。 - 增广评测:单条名义演示可增广为跨物体位姿/尺寸/地形高度的一族轨迹。在全量增广数据上训练+评测得 79.1% 成功率,与只在名义动作上评测的 82.2% 相当——说明运动学增广大幅扩大覆盖而不显著掉点。
- 动作标注:无需人工标注;接触/支撑相由源动作速度阈值自动判定,接触关系由交互网格几何自动保留。
训练方法
重定向侧:见”模型架构”——逐帧 Sequential SOCP,Laplacian 变形能量为目标,全套硬约束,Drake 自动微分,热启动。
RL 侧(极简公式,关键卖点):
- 仅 5 条奖励:① Body Tracking(DeepMimic 式,跟踪身体位置/朝向/线速度/角速度);② Object Tracking(适用时,物体位置/朝向,超参同 body tracking);③ Action Rate(惩罚动作剧变);④ Soft Joint Limit(惩罚关节越限);⑤ Self-Collision(每个 body 自碰撞力 >1 N 给二值惩罚)。权重/超参全部照搬 BeyondMimic、零调参。
- 终止条件:身体跟踪偏差过大即终止;物体 loco-manipulation 中物体偏离参考 >1.0 m 或 >45° 时终止(仅在策略已达到合理身体跟踪后启用)。
- 域随机化(仅 4 项,对比前作的一大堆):躯干 COM 位置(x ±0.025 m / y ±0.05 m / z ±0.075 m)、关节默认位 ±0.01 rad、随机推力 0.3 m/s 与 0.78 rad/s 持续 1–3 s、观测噪声(Rot6D 朝向 ±0.05、线速度 ±0.5 m/s、角速度 ±0.2 rad/s、关节位 ±0.01 rad、关节速 ±0.5 rad/s)。物体侧另随机化质量 0.1–2 kg、质心 ±0.08 m、惯量 50–150%、形状 ±10%。不用 RFI、电机 PD、动作延迟等。
- 策略分组:相近动作合并加速训练——所有搬箱动作共享一个多任务策略;爬平台每条参考一个策略。无课程学习,无超参调优。
Infra(训练 / 推理工程)
- 重定向求解:Drake(含自动微分)+ 自定义 Sequential SOCP 求解器,逐帧顺序求解、每帧≤10 次迭代、上一帧解热启动;GPU/求解耗时/机时未披露。
- RL 训练:开源框架 Holosoma,多仿真器支持 IsaacGym / IsaacSim / MuJoCo Warp(MJWarp)训练、MuJoCo 仅推理;算法 PPO 与 FastSAC;本体支持 G1 与 Booster T1。具体 GPU 型号/数量、GPU-hours、并行策略、精度均未披露。
- 推理/部署:Unitree G1 上零样本 sim-to-real,纯本体感知(无视觉/LIDAR),项目页强调”所有机器人视频为实时(real-time)“。具体控制频率 Hz / 时延 / 边缘硬件未披露。
- 论文未给训练卡数、机时、吞吐等工程数字——这是本文(重定向方法论为主)的披露盲区。
评测 benchmark
重定向运动学质量(Table II,Unitree G1;越低越好除接触保持外):
- Robot-Object(重定向自 OMOMO):
- 穿透时长/最大深度:OmniRetarget 0.00 / 1.34 cm vs PHC 0.68 / 5.11、GMR 0.83 / 8.50、VideoMimic 0.60 / 7.48。
- 脚滑时长/最大速度:OmniRetarget 0 / 0 vs 各基线均 >0(如 VideoMimic 0.12 / 1.50 cm/s)。
- 接触保持:OmniRetarget 0.96,GMR 0.99(最高,但因关键点匹配把手压进物体内部反而带来大穿透)。
- 下游 RL 成功率:OmniRetarget 82.20% ±9.74% > PHC 71.28%、GMR 50.83%、VideoMimic 3.85%。
- Robot-Terrain(重定向自 in-house MoCap):
- 穿透 OmniRetarget 0.01 / 1.37 cm,脚滑 0 / 0,接触保持 0.72。
- 下游 RL 成功率 94.73% ±22.33% > GMR 78.94%、PHC 52.63%、VideoMimic 51.75%。
- Robot-Only(重定向自 LAFAN1,对比 Unitree 官方 LAFAN1 重定向数据集):
- OmniRetarget 穿透 0.00 / 1.07 cm、脚滑 0/0,均优于 Unitree 官方 0.09 / 3.22;两者下游成功率都 100%。
下游 RL(V-B):选 39 条挑战性动作、用 BeyondMimic 同一超参无手调训练。OmniRetarget 各任务成功率最高、领先基线 >10% 且方差更低。地形交互中”接触保持与成功率成正比”,PHC 地形接触保持骤降近 50% 导致成功率低。失败分布(VI-E):地形爬升需要更精确参考,PHC/VideoMimic 近半动作全败、GMR 败 4 条、OmniRetarget 仅败 1 条(作者归因于极简 RL 公式,认为课程学习可解)。
旗舰演示:受 Boston Dynamics Atlas 工具使用启发的 30 秒多阶段序列——机器人搬 4.6 kg 椅子到平台、以椅为踏石爬上、跃下并做 parkour 翻滚缓冲落地;动态爬 0.9 m 高平台(robot 身高 70%);斜坡爬行。
创新点与影响
- 首个”保交互”的人形重定向框架:在单个约束优化里同时处理机器人-物体-地形交互并强制硬物理约束(非穿透、脚粘滞、关节/速度限位),补上 IMMA 未开源、忽略限位与环境交互的空白。
- 系统性数据增广:把单条人类演示自动扩成跨物体位姿/尺寸/地形高度/机器人本体的大规模高质量轨迹族——这是 loco-manipulation 数据增广此前”largely unexplored”的方向;关键 trick 是在物体局部帧建交互网格 + 锚定下半身避免平凡刚体解。
- 验证”数据质量 > 奖励工程”:干净参考让 RL 用 5 奖励 + 4 域随机化 + 零调参 + 无课程就能零样本上真机,直接呼应并复用 BeyondMimic 的极简公式。
- 开源:代码(Holosoma,Apache-2.0,含重定向/训练/部署,支持 IsaacGym/IsaacSim/MJWarp/MuJoCo、PPO/FastSAC)+ HF 数据集(4 小时,MIT)。ICRA 2026 最佳会议论文奖 + 机器人操作与运动最佳论文奖。
- 作者自陈局限:① 当前逐帧优化,未做整条轨迹联合优化——面对更嘈杂动作源(如视频数据)鲁棒性受限,是未来方向;② 极简 RL 公式在极难动作上仍会偶发失败(地形爬升 39 选 1 失败),需课程学习补足;③ SOCP 约束线性化偶尔带来轻微穿透(数值仍很小,可由 RL 修复)。
原始链接
- arXiv:https://arxiv.org/abs/2509.26633 (v1, 2025-09-30, cs.RO, CC BY 4.0)
- PDF:https://arxiv.org/pdf/2509.26633
- 项目页:https://omniretarget.github.io/
- 代码(Holosoma, Apache-2.0):https://github.com/amazon-far/holosoma
- 数据集(HF, MIT, 4h):https://huggingface.co/datasets/omniretarget/OmniRetarget_Dataset
- 旗舰演示视频:https://www.youtube.com/watch?v=5ZYFTfGHH8Q
一手源存档(sources/)
- omniretarget—project-page — 项目页(含 ICRA 2026 双奖、作者/单位、摘要、增广/基线对比 demo 列表)
- omniretarget—github-readme — Holosoma GitHub README(框架结构、多仿真器、PPO/FastSAC、demo 脚本)
- omniretarget—hf-dataset-card — HF 数据集卡(4h 子集明细、npz 格式、qpos 维度、许可)
- arXiv 全文见上方链接(arXiv 原文 PDF,不入 git)