一句话定位

CMU(Zipeng Fu、Xuxin Cheng、Deepak Pathak)用单个 RL 策略同时输出四足腿关节和机械臂关节的目标位置——而不是像行业惯例那样把”腿的运动控制”和”臂的操作控制”拆成两个分层模块——并提出 Advantage Mixing(用因果结构分解优势函数加速训练)与 Regularized Online Adaptation(去掉两阶段 teacher-student 训练、用正则项在线联合训练特权信息编码器与自适应模块)两个方法,在一台成本仅 6K 美元的 Unitree Go1 + WidowX 250s 自制腿臂机器人上实现了腿臂协同的动态全身控制(爬高抓取、钻杆、扔垃圾、擦白板等),CoRL 2022 Oral、Best Systems Paper Award Finalist(前 0.79%)。

背景与定位

传统腿式机械臂(legged manipulator)控制走的是分层路线:一个模块管腿的运动(locomotion),一个模块管臂的操作(manipulation),两者靠工程接口耦合。这类方案的问题是协调需要大量手工工程、误差会跨模块传播导致动作不连贯,也不符合生物学证据——文献显示人类四肢间存在很强的运动协同(motor synergies,Bernstein 70 年前的工作)。同期的可比工作 Ma et al.(RA-L 2022, ANYmal + 臂)用 MPC 追踪末端执行器位置、RL 稳定平衡,但腿(RL)和臂(model-based)仍是分离模块,没有展示动态运动;Ahn et al. 的 SayCan(saycan)用语言模型分步调度移动+操作,但每一步内部仍是解耦执行。

这篇论文的定位是”学习式全身控制”(learned whole-body control)路线的开山之作:用一个神经网络端到端输出腿+臂全部关节目标,让 RL 自己发现协同(如末端执行器指令低时机身下蹲、指令高时站直伸展来扩大工作空间;机身受扰动时用臂辅助平衡)。方法论上直接承袭作者自己实验室的两条线:Regularized Online Adaptation 是 rma-rapid-motor-adaptation(RMA,Kumar/Fu/Pathak/Malik, RSS 2021)两阶段 teacher-student sim-to-real 范式的正则化改进(论文原话:“RMA is a special case of Regularized Online Adaptation, in which λ is set to be constant zero and adaptation module φ starts training only after convergence”);能耗降低 reward 沿用了同组 Fu 等《Minimizing energy consumption leads to the emergence of gaits in legged robots》(CoRL 2021)的能耗惩罚设计。同年同组的后续工作 walk-these-ways 走的是相邻但不同的路线——用可调步态参数把”同一任务的多解”显式编码进策略,解决的是纯 locomotion 的 OOD 泛化;本文解决的是腿+臂的协同问题。

模型架构

统一策略 π:一个 MLP,非分层、非模块化,同时输出腿和臂的目标关节位置。

  • 输入状态 s_t ∈ R^75(与环境外部性 latent z_t ∈ R^20 拼接后送入网络):
    • 机身状态 s_base_t ∈ R^5(roll、pitch、机身角速度)
    • 臂状态 s_arm_t ∈ R^12(6 个臂关节的位置+速度)
    • 腿状态 s_leg_t ∈ R^28(12 个腿关节的位置+速度,加脚触地指示)
    • 上一步动作 a_{t-1} ∈ R^18(12 腿 + 6 臂)
    • 末端执行器位姿指令 [p_cmd, o_cmd] ∈ SE(3)(用球坐标 (l,p,y) 参数化位置,方向从 SO(3) 均匀采样)
    • 机身速度指令 [v_x_cmd, ω_yaw_cmd]
  • 网络结构:第一隐藏层 128 维,之后分裂成两个 head,各 2 个 128 维隐藏层;两 head 输出拼接为腿动作 a_leg_t ∈ R^12 和臂动作 a_arm_t ∈ R^6(关节空间位置控制,经 PD 控制器转矩矩:腿 Kp=50/Kd=1,臂 Kp=5/Kd=0.5)。论文特别强调用关节空间控制而非臂的操作空间控制(operational space control),理由是能学到自碰撞规避、sim-to-real gap 更小。
  • Regularized Online Adaptation 的两个额外模块
    • 特权信息编码器 μ:输入仿真中才有的环境外部性 e_t(机身/末端执行器负载、机身质心、腿臂电机强度、摩擦),预测环境外部性 latent z^μ_t ∈ R^20,与 π 联合用 RL 端到端训练。
    • 自适应模块 φ:只用最近 10 步的机上观测历史(s_{t-10:t-1}, a_{t-11:t-2})在线估计 z^φ_t,在线模仿 z^μ;训练损失里加正则项 λ‖z^μ − sg[z^φ]‖² + ‖sg[z^μ] − z^φ‖²(λ 为拉格朗日乘子,用对偶梯度下降更新),去掉了 RMA 那种”教师先收敛、学生再模仿”的两阶段串行流程。
  • 机器人本体:Unitree Go1 四足(12 可驱动 DoF)+ Interbotix WidowX 250s 6-DoF 臂(带平行夹爪)刚性固定在机身上,共 19 DoF;RealSense D435 挂在夹爪附近提供 RGB。硬件总成本约 6K 美元(相比 Boston Dynamics Spot Arm 或 ANYmal+定制臂的 >100K 美元)。

数据

纯 sim-to-real 强化学习工作,没有真机采集的训练数据,“数据”即仿真采样分布:

  • 仿真器:Nvidia isaac-gym,规模化并行环境。
  • 训练规模:10,000 次迭代 / 训练批次,累计 20 亿(2 billion)samples、20 万次梯度更新;Table 8 超参给出并行环境数 5000、每训练批次每环境 40 步、每批次 5 个学习 epoch、4 个 mini-batch。
  • 地形:分形噪声(fractal noise)生成的粗糙地形(octaves=2,lacunarity=2.0,gain=0.25,frequency=10Hz,amplitude=0.15m),用以替代复杂 reward 强制脚部抬离地面间隙。
  • 指令采样(Table 2,训练范围 / 测试范围):v_x_cmd 训练 [0, 0.9] m/s / 测试 [0.8, 1.0];ω_yaw_cmd 训练 [-1, 1] / 测试 [-1,-0.7]∪[0.7,1];末端执行器球坐标半径 l 训练 [0.2, 0.7] / 测试 [0.6, 0.8],俯仰 p 训练/测试均 [-2π/5, 2π/5],偏航 y 均 [-3π/5, 3π/5];末端指令切换周期 T_traj 训练 [1,3]s / 测试 [0.5,1]s。
  • 环境参数域随机化(Table 3,训练 / 测试范围):机身额外负载 [-0.5,3.0] / [5.0,6.0] kg;末端执行器负载 [0,0.1] / [0.2,0.3] kg;机身质心偏移 [-0.15,0.15] / 0.20m;臂电机强度 [0.7,1.3] / [0.6,1.4];腿电机强度 [0.9,1.1] / [0.7,1.3];摩擦系数 [0.25,1.75] / [0.05,2.5]——测试范围刻意设为部分超出训练范围(OOD)以检验自适应鲁棒性。
  • 动作标注 / sim-vs-real:全流程 sim-only RL 训练,真机零微调(zero-shot sim-to-real)部署;真机数据仅用于事后的定性分析(如身体姿态与末端指令的相关性分析)而非训练。

训练方法

  • 目标函数:标准折扣期望回报 RL 目标,reward = 操作 reward r_manip + 运动 reward r_loco,二者都由 command-following + energy + alive 三项组成(Table 1):
    • Command following:操作项 0.5·exp(-‖[p,o]-[p_cmd,o_cmd]‖₁);运动项 -0.5·|v_x-v_x_cmd| + 0.15·exp(-|ω_yaw-ω_yaw_cmd|)。
    • Energy:操作项 -0.004·Σ_{arm joints}|τ_j·q̇_j|;运动项 -0.00005·Σ_{leg joints}(τ_i·q̇_i)²(沿用同组 Fu 等 CoRL 2021 能耗惩罚设计,用二次型鼓励腿各关节能耗更低且方差更小)。
    • Alive:操作项 0;运动项 0.2+0.5·v_x_cmd。
  • Advantage Mixing(解决训练局部极小值):策略优化目标里,臂动作的 log-prob 权重优势为 A_manip + βA_loco,腿动作的权重优势为 βA_manip + A_loco,β 是从 0 线性增到 1 的课程参数(β=min(t/T_mix, 1))。直觉:先把操作回报的差异主要归因于臂动作、运动回报的差异归因于腿动作,再逐渐把两者的优势加权求和混合,诱导出”先各自学会、再融合协同”的隐式课程,用 PPO 优化整个目标。
  • Regularized Online Adaptation(解决 sim-to-real 现实性缺口 realizability gap):联合优化 L(θ_π,θ_μ,θ_φ) = -J(θ_π,θ_μ) + λ‖z^μ-sg[z^φ]‖² + ‖sg[z^μ]-z^φ‖²,用对偶梯度下降交替更新 π/μ 和 φ;每 H=20 次迭代切换一次角色(Algorithm 1);正则强度 λ 按线性课程从 0 增到 1:λ = min(max((itr-5000)/5000, 0), 1)。
  • PPO 超参(Table 8):clip range 0.2,学习率 2e-4,折扣因子 0.99,GAE λ 0.95,并行环境数 5000,每批次每环境步数 40,每批次学习 epoch 5,mini-batch 数 4,最小策略标准差 0.2。

Infra(训练 / 推理工程)

  • 训练侧:Nvidia isaac-gym 并行仿真,仿真频率 200Hz,控制/策略频率 50Hz。GPU 型号、卡数、GPU-hours 论文未披露(只给出总 20 亿样本 / 20 万梯度更新 / 10000 迭代的规模指标)。
  • 推理侧(真机部署):策略与自适应模块权重固定后直接搭载 Go1 机身;两个模块均在 Raspberry Pi 4 上以 50Hz 联合推理;WidowX 250s 臂的软件栈跑在 Nvidia TX2 上(Interbotix 官方 ROS 代码库 interbotix_ros_manipulators);Pi 与 TX2 间用 UDP 通信。整机由 Go1 自带电池供电(含 WidowX,功耗 60W),完全无缆(untethered)。
  • 视觉跟踪相机参数(Table 9):RealSense D435,分辨率 640×400,采集频率 10Hz。
  • 单次网络推理延迟、端到端控制时延等具体数值论文未披露(只给出 50Hz 闭环控制频率)。

评测 benchmark

全部数字取自论文正文(仿真定量对比 + 真机定量任务),测试范围见 Table 2/3(含 OOD 段):

统一策略 vs. 分离/不协同策略(Table 4,仿真,1000 episode × 3 随机种子)

方法Survival↑Base Accel↓Vel Error↓EE Error↓Tot. Energy↓
Unified (Ours)97.1±0.611.00±0.030.31±0.030.63±0.0250±0.90
Separate(腿/臂分离策略)92.0±0.901.40±0.040.43±0.070.92±0.1051±0.30
Uncoordinated(同网络但只用各自 reward 训各自 head)94.9±0.611.03±0.010.33±0.010.73±0.0250±0.28

统一策略在相近能耗下各项指标全面占优,尤其 EE Error 比 Separate 低 32%。

全身协同的量化证据(Table 5,仿真)

方法臂工作空间(m³)↑受扰存活率↑(1.0 m/s 初速扰动)
Unified (Ours)0.82±0.020.87±0.04
Separate0.58±0.100.64±0.06
Uncoordinated0.65±0.020.77±0.06

统一策略下腿的弯曲/伸展让臂工作空间扩大约 40%(相对 Separate),臂也反过来帮机身在受扰时维持更高存活率。

Sim2Real 方法对比(Table 6,仿真,OOD 测试范围 Table 3)

方法Realizability Gap↓ ‖z^μ-z^φ‖²Survival↑Base Accel↓Vel Error↓EE Error↓Tot. Energy↓
Domain Randomization(无 z)95.8±0.20.44±0.000.46±0.000.40±0.0021.9±0.53
RMA [Kumar et al. 2021]0.31±0.0195.2±0.20.54±0.020.44±0.000.26±0.0427.3±0.95
Regularized Online Adapt(Ours)2e-4±0.0097.4±0.10.51±0.020.39±0.010.21±0.0025.9±0.56
Expert w/ Reg.(用特权信息,带正则)97.8±0.20.52±0.020.40±0.010.21±0.0025.8±0.49
Expert w/o Reg.(用特权信息,无正则,性能上界)98.3±0.20.51±0.020.39±0.000.21±0.0025.6±0.30

本文方法的 latent 模仿误差比 RMA 低 3 个数量级(2e-4 vs 0.31),EE Error 相比 RMA 降低约 20%,且几乎追平使用特权信息的 Expert 上界(Domain Randomization 一栏的低能耗/低加速度是因为它在困难环境下直接学会”站着不动”的退化解,并非真正鲁棒)。

真机视觉引导抓取任务(Table 7,AprilTag 定位反馈,每设置 10 次真机试验,对比 baseline = 内置 Go1 MPC 控制器 + WidowX 操作空间 IK 求解器,记为 MPC+IK)

任务难度方法成功率↑平均完成时间(TTC)↓MPC+IK 自碰撞率 / IK 失败率
Easy(3 个采样点)Ours0.85s
EasyMPC+IK0.317sIK 失败率 0.4 / 自碰撞率 0.3
Hard(5 个采样点,贴近前脚难够到)Ours0.85.6s
HardMPC+IK0.122.0sIK 失败率 0.2 / 自碰撞率 0.5

本文方法用关节空间控制不存在 IK 求解失败问题;论文报告的自碰撞率为 0。MPC+IK 的失败主要来自 IK 奇异解与自碰撞,尤其在 hard 任务(目标点贴近机身)时更严重;本文方法的 TTC 也更短,因为在线 IK + 操作空间控制计算量更大。

开环示教复现(定性,Fig.7):机器人在不平坦草地上按预设末端轨迹(从 p=(0.5,-0.5,-1.2) 到 p_end=(0.55,-0.9,0.4),T_traj=2.5s)拾取水杯,同时以 v_x_cmd=0.35 m/s 前进;随末端指令从高处移向机身下方,机身自然出现俯仰、翻滚、偏航的协同动作来辅助臂够到目标。

创新点与影响

  • 贡献:(1) 提出用单个神经网络策略同时输出腿+臂全部关节目标的”统一策略”(unified policy)范式,取代腿臂控制解耦的行业惯例;(2) Advantage Mixing——利用操作/运动动作空间的因果依赖分解优势函数,解决高自由度全身控制训练中的局部极小值/信度分配难题;(3) Regularized Online Adaptation——用拉格朗日正则项联合在线训练特权信息编码器与自适应模块,去掉两阶段 teacher-student 的串行流程,缩小 sim-to-real 的”现实性缺口”(realizability gap);(4) 给出一套约 6K 美元的低成本自制腿式机械臂硬件方案(对比行业 >100K 美元方案),降低学术界复现门槛。
  • 改变了什么:把”legged manipulator 的腿臂协同”从模型式分层控制(如 Ma et al. RA-L 2022 的 MPC+RL 混合)转向纯学习式端到端全身控制,是该子方向的早期奠基工作之一;Regularized Online Adaptation 作为 RMA 的正则化推广,为后续 sim-to-real 自适应方法提供了一个可比基线(论文明确指出 RMA 是其特例)。CoRL 2022 Oral、Best Systems Paper Award Finalist(前 0.79%),媒体报道包括 New Scientist、Popular Science 等。
  • 作者自陈局限:(1) 目前只展示了对刚性物体的初步物体交互(拾取、按按钮、擦拭),把遮挡(occlusion)、软体物体等通用物体交互纳入统一策略仍是开放难题;(2) 现有方法尚未加入视觉输入端到端训练策略(真机的视觉引导用的是独立脚本化的 AprilTag 反馈控制器,而非策略本身接收视觉输入);(3) 尚未探索用前腿攀爬障碍物以够到桌面等更复杂的全身协调场景。作者认为本文是朝这些方向迈出的第一步。

原始链接

一手源存档(sources/)