一句话定位

Mobile-TeleVision(PMP,Predictive Motion Priors)把人形机器人上半身控制彻底交给 IK/动作重定向、下半身控制交给 RL,再用一个在 AMASS 重定向数据上训练的 CVAE 把”未来上半身动作”编码成 64 维隐向量喂给下半身策略做条件,从而在不牺牲 7-DoF 手臂操作精度的前提下解决”上下身彻底解耦会失衡”的问题,配合 Apple Vision Pro 立体视觉遥操作,在真机 Unitree H1 上完成推轮椅、抗过肩箱、进电梯、开冰箱送水、放微波炉等负重/精细双任务全身动作(ICRA 2025)。

背景与定位

这篇工作站在人形机器人”全身控制精度 vs 鲁棒性”矛盾的正中间。此前一批基于 RL 的全身控制方案——exbody(表现目标/根运动目标解耦但上半身仍走 RL 映射)、humanplus(transformer 影随+模仿)、omnih2o(目标条件通用策略)、h2o-human2humanoid(实时人到人形遥操作)——都用单一 RL 策略输出全身动作,作者认为这类方法”RL 不适合高自由度位置/朝向控制”,尤其在动态行走场景下手臂动作会不可预测,且 RL 倾向于收敛到少数几个模式、牺牲表现力。

论文的核心主张是反过来做:上半身用经典 IK + 动作重定向直接控制(不经过 RL),下半身仍用 PPO 学鲁棒行走;但纯粹解耦会丢失上下身之间的耦合信息,导致失衡(此前工作 [2,8,3] 已指出这一点)。作者把这个耦合问题当成表示学习问题解——用 CVAE 从过去的上半身动作预测未来动作,把这个”预测性动作先验”(Predictive Motion Priors, PMP)的隐向量作为下半身 RL 策略的一路观测输入,替代真正做全身 RL 所需的显式全身奖励。

真机遥操作栈直接复用 open-television(Cheng et al., CoRL 2024,Open-TeleVision:沉浸式主动视觉反馈遥操作)的主动颈部 + 立体相机 + Apple Vision Pro 流水线,本文只新增下半身运动指令的输入方式。一作 Xuxin Cheng 同时也是 ExBody 与 Open-TeleVision 的作者,三篇工作构成同一个课题组(UCSD Xiaolong Wang 组)逐步推进”遥操作 + 全身控制”的连续叙事;Xiaolong Wang 本人同时挂 UCSD 与 NVIDIA 双重身份。

模型架构

这不是一个 VLA / 视觉条件策略,而是纯本体感知 RL 下半身控制器 + 非学习式上半身 IK 控制器的组合,视觉只用于操作员的 VR 沉浸显示,不进入机器人策略的输入。

解耦策略结构 π = [π^upper, π^lower]:

  • π^upper(开环,非学习):遥操作时由 Apple Vision Pro 追踪的手/头姿态经 IK + 动作重定向直接映射为上半身目标关节角 q^upper;训练时(RL 阶段)由采样自重定向动作数据集的目标关节角配合课程系数插值给出。真机 H1(含定制灵巧手与主动颈)上半身共 27 个关节,仿真中的 Fourier GR1 上半身共 19 个关节;对比表中”Arm DoFs”一栏 PMP=7(每臂 7 自由度,直接控制,不经 RL),高于 ExBody 的 4、OmniH2O 的 5、HumanPlus 的 5。
  • π^lower(PPO 训练):观测本体感知 s_t = [q_t, q̇_t, ω_t, g_t, a_{t-1}](关节位置/速度、base 角速度、投影重力、上一步动作,a_{t-1}∈ℝ¹²),另加步态周期信号与 PMP 隐向量 z_t 作为辅助观测;输出下半身 12 个关节的 PD 目标位置(H1、GR1 均为 12 个下肢关节)。RL 框架/网络具体隐藏层维度本文未披露。

PMP:Predictive Motion Priors(CVAE)

  • 结构:先验模型 R、编码器 E、解码器 D 均为三层 MLP;隐向量 z_t ∈ ℝ^H,H = 64
  • 输入:以时刻 t 为界的历史窗口 M⁰ = q^upper_{t-W:t-1} 与未来窗口 M¹ = q^upper_{t:t+W-1};训练时编码器 E(z|M⁰,M¹) 近似后验、解码器 D 从 z_t 与 M⁰ 重建 M¹,目标为标准 CVAE ELBO(重建项 + KL(E‖R));RL 阶段真正使用的是只依赖历史的先验 R(z|M⁰),因为未来动作在部署时不可得。
  • 窗口长度 W 对应真实时间 1 秒:H1 控制频率下 W = 50(即 50Hz),GR1 控制频率下 W = 100(即 100Hz,由同一”1 秒”关系换算得出)。

课程式上半身难度调度:定义每条动作 i 的难度系数 α_i,插值目标 q^upper_curriculum = q_0 + α_i(q^upper_target − q_0)(q_0 为默认关节位置);每个 episode 结束按存活时间调整:存活时间 ≥ 90% 总时长则 α_i += 0.05,否则 α_i −= 0.01。这是本文用来降低高难度动作探索负担的关键机制(见消融 “w/o curriculum”:α 恒为 1)。

数据

  • 动作数据集 M:沿用 exbodyAMASS(Mahmood et al., ICCV 2019 人体动作捕捉库)的过滤与重定向流程(局部旋转 → 机器人关节角映射),本文未重新给出重定向后数据集的具体小时数/片段数/帧数——规模数字继承自 ExBody 的处理流程,未在本文正文重新披露。
  • 训练机器人目标:真机 Unitree H1(真实部署 + 仿真评测)与仿真中的 Fourier GR1(仅仿真,未上真机)。
  • 无遥操作采集数据参与 CVAE/RL 训练——遥操作只在部署/评测阶段使用;真机手腕跟踪精度评测(Table IV)采集自 4 类桌面任务(分拣 Sorting、插入 Insertion、折叠 Folding、卸货 Unloading)各 20 条轨迹,相当于每任务约 30 分钟、50Hz 控制频率下的手臂运动数据。
  • 无 sim-to-real 域随机化细节或数据配比披露;课程系数 α_i 是按动作片段自适应调整的训练时调度量,不是静态数据混合比例。

训练方法

三阶段流水线:

  1. 数据预处理:复用 ExBody 的过滤 + 重定向流程,把 AMASS 局部旋转矩阵映射为机器人关节角,得到重定向数据集 M。
  2. CVAE(PMP)预训练:在重定向的上半身动作序列上自回归式地学习”由历史窗口预测未来窗口”,目标为 CVAE ELBO(见上);训练完成后编码器/解码器不再参与 RL 阶段,只用先验模型 R 在线计算 z_t。
  3. 下半身 RL 训练(PPO,Schulman et al. 2017):环境每个 episode 开始时从数据集 M 随机采样一条上半身动作序列,直接作为 PD 目标驱动上半身(按课程系数 α_i 插值),RL 只优化下半身 12 关节动作;奖励设计沿用 exbody 的奖励项,并额外加入显式的步态周期性奖励(参考 Zhang et al. 2024 与 Margolis & Agrawal, CoRL 2023 的步态奖励设计)。

消融变量:w/o motion prior(去掉 PMP 隐向量 z_t 的条件输入)、w/o motion curriculum(α 恒为 1,取消渐进课程)——用于分别验证运动先验与课程调度各自的贡献。

Infra(训练 / 推理工程)

论文正文未披露仿真器名称、GPU 型号与数量、并行环境数、训练迭代步数/总时长等训练算力信息——未披露。 可确认的实时数字:真机 H1 下半身控制回路频率 50Hz(Table IV 明确标注”50 Hz control frequency”);GR1 由 CVAE 窗口关系换算控制频率约 100Hz(W=100 对应 1 秒)。推理侧无额外 FPS/延迟数字披露;系统在遥操作闭环下以上述控制频率实时运行,支撑真机连续演示(含跨州远程遥操作片段,见项目页 Cross-Country 视频,但未给出网络延迟数字)。

评测 benchmark

Table I(与既有全身控制方法对比,作者自定标准)

方法Arm DoFs直接精细操作(PrManip)鲁棒行走(≥10s)
PMP(本文)7
ExBody4
OmniH2O5
HumanPlus5

仿真对比(Table II,每条动作采样 5 条轨迹取均值,指标越低越好)

  • H1:PMP 上半身关节位置误差 E_jpe=0.02355,优于 ExBody 0.03125 与 ExBody(Whole) 0.03788;上半身加速度 E_acc=5.07,远优于 ExBody 11.93 / ExBody(Whole) 9.97。代价:线速度跟踪 E_vel=0.01296,劣于 ExBody 0.00784 / ExBody(Whole) 0.00782(解耦对行走指令跟踪确有牺牲);但投影重力(稳定性)E_g=1.301,反而优于 ExBody 1.367 与 ExBody(Whole) 1.454,且明显优于两个消融版本(w/o motion prior 1.585,w/o curriculum 1.597),说明运动先验+课程对稳定性的贡献相较”完全解耦但无先验”的方案是实打实的。
  • GR1:PMP 相对自研 ExBody 复现版几乎全指标占优——E_jpe 0.00730 vs 0.01006,E_vel 0.00409 vs 0.00978,E_g 0.420 vs 0.835。
  • 扰动鲁棒性测试(Fig.3,定性百分比):随扰动增大,PMP 相比 ExBody 精度(E_jpe)平均领先约 40%;运动先验 + 课程使稳定性(投影重力)指标提升约 25%

真机推力鲁棒性测试(Table III,每组 10 次推力取均值)

  • 行走中被推:PMP 最大俯仰角速度 0.253 rad/s(w/o motion prior 为 0.296);俯仰偏移区间 (-0.152, 0.035)(对照 (-0.138, 0.050));恢复时间 0.59s(对照 0.66s)。
  • 静止站立被推:PMP 最大俯仰角速度 0.241 rad/s(对照 0.331);俯仰偏移区间 (-0.150, 0.029)(对照 (-0.161, 0.051));恢复时间 4.46s(对照 5.38s)。

真机手臂跟踪精度(Table IV,20 条轨迹/任务,Vision Pro 目标腕位姿 vs 机器人正运动学腕位姿)

任务x(m)y(m)z(m)roll(rad)pitch(rad)yaw(rad)
Sorting0.011-0.0320.0080.0020.0400.016
Insertion0.027-0.0180.006-0.021-0.0090.036
Folding0.044-0.0180.002-0.013-0.0100.171
Unloading0.027-0.0280.008-0.0450.0400.093

无基线方法在真机上直接对比(真机部分只报告 PMP 自身数字及 w/o motion prior 消融)。

创新点与影响

  • 把”上下身彻底解耦会失稳”这个此前工作反复提到但没解决的问题,转化为一个具体的表示学习方案(CVAE 预测性运动先验),用一个 64 维隐向量把即将发生的上半身动作”预告”给下半身 RL 策略,是本文的核心贡献。
  • Table I 是作者自己给出的定位声明:同期方法中,PMP 是唯一同时做到”高自由度手臂(7)+ 直接精细操作(不经 RL 映射)+ 鲁棒行走(≥10s)“三者兼得的方案;ExBody/OmniH2O 有鲁棒行走但手臂操作仍经 RL 映射,HumanPlus 两者都不满足该表的标准。
  • 真机演示覆盖了此前同类工作少见的负重 + 精细动作同时发生的任务组合:与人共推轮椅、扛滑板车行走、进出电梯、开冰箱取送水瓶、把餐盒放进微波炉——这些是论文用来支撑”可负重、可精细操作、可移动”三者共存的具体证据。
  • 论文自陈的局限(原文 Section VI):上下身解耦让机器人无法完成某些需要真正全身协同的敏捷动作;当前人形硬件自由度仍远少于人类,用 RL 追踪敏捷全身动作在工程上”非常有挑战”;解耦策略仍要求遥操作员同时给出行走指令与手臂/手部动作,给操作员带来额外负担,作者明确表示”需要更好的人机交互接口来解决这一问题”。

原始链接

一手源存档(sources/)

  • mobile-television—project-page — 项目页快照(ICRA 2025、演示视频分区、Abstract、BibTeX)
  • arXiv 原文 PDF(arXiv 2412.07773,不入 git)