一句话定位
CMU(Zipeng Fu、Xuxin Cheng、Deepak Pathak)用单个 RL 策略同时输出四足腿关节和机械臂关节的目标位置——而不是像行业惯例那样把”腿的运动控制”和”臂的操作控制”拆成两个分层模块——并提出 Advantage Mixing(用因果结构分解优势函数加速训练)与 Regularized Online Adaptation(去掉两阶段 teacher-student 训练、用正则项在线联合训练特权信息编码器与自适应模块)两个方法,在一台成本仅 6K 美元的 Unitree Go1 + WidowX 250s 自制腿臂机器人上实现了腿臂协同的动态全身控制(爬高抓取、钻杆、扔垃圾、擦白板等),CoRL 2022 Oral、Best Systems Paper Award Finalist(前 0.79%)。
背景与定位
传统腿式机械臂(legged manipulator)控制走的是分层路线:一个模块管腿的运动(locomotion),一个模块管臂的操作(manipulation),两者靠工程接口耦合。这类方案的问题是协调需要大量手工工程、误差会跨模块传播导致动作不连贯,也不符合生物学证据——文献显示人类四肢间存在很强的运动协同(motor synergies,Bernstein 70 年前的工作)。同期的可比工作 Ma et al.(RA-L 2022, ANYmal + 臂)用 MPC 追踪末端执行器位置、RL 稳定平衡,但腿(RL)和臂(model-based)仍是分离模块,没有展示动态运动;Ahn et al. 的 SayCan(saycan)用语言模型分步调度移动+操作,但每一步内部仍是解耦执行。
这篇论文的定位是”学习式全身控制”(learned whole-body control)路线的开山之作:用一个神经网络端到端输出腿+臂全部关节目标,让 RL 自己发现协同(如末端执行器指令低时机身下蹲、指令高时站直伸展来扩大工作空间;机身受扰动时用臂辅助平衡)。方法论上直接承袭作者自己实验室的两条线:Regularized Online Adaptation 是 rma-rapid-motor-adaptation(RMA,Kumar/Fu/Pathak/Malik, RSS 2021)两阶段 teacher-student sim-to-real 范式的正则化改进(论文原话:“RMA is a special case of Regularized Online Adaptation, in which λ is set to be constant zero and adaptation module φ starts training only after convergence”);能耗降低 reward 沿用了同组 Fu 等《Minimizing energy consumption leads to the emergence of gaits in legged robots》(CoRL 2021)的能耗惩罚设计。同年同组的后续工作 walk-these-ways 走的是相邻但不同的路线——用可调步态参数把”同一任务的多解”显式编码进策略,解决的是纯 locomotion 的 OOD 泛化;本文解决的是腿+臂的协同问题。
模型架构
统一策略 π:一个 MLP,非分层、非模块化,同时输出腿和臂的目标关节位置。
- 输入状态 s_t ∈ R^75(与环境外部性 latent z_t ∈ R^20 拼接后送入网络):
- 机身状态 s_base_t ∈ R^5(roll、pitch、机身角速度)
- 臂状态 s_arm_t ∈ R^12(6 个臂关节的位置+速度)
- 腿状态 s_leg_t ∈ R^28(12 个腿关节的位置+速度,加脚触地指示)
- 上一步动作 a_{t-1} ∈ R^18(12 腿 + 6 臂)
- 末端执行器位姿指令 [p_cmd, o_cmd] ∈ SE(3)(用球坐标 (l,p,y) 参数化位置,方向从 SO(3) 均匀采样)
- 机身速度指令 [v_x_cmd, ω_yaw_cmd]
- 网络结构:第一隐藏层 128 维,之后分裂成两个 head,各 2 个 128 维隐藏层;两 head 输出拼接为腿动作 a_leg_t ∈ R^12 和臂动作 a_arm_t ∈ R^6(关节空间位置控制,经 PD 控制器转矩矩:腿 Kp=50/Kd=1,臂 Kp=5/Kd=0.5)。论文特别强调用关节空间控制而非臂的操作空间控制(operational space control),理由是能学到自碰撞规避、sim-to-real gap 更小。
- Regularized Online Adaptation 的两个额外模块:
- 特权信息编码器 μ:输入仿真中才有的环境外部性 e_t(机身/末端执行器负载、机身质心、腿臂电机强度、摩擦),预测环境外部性 latent z^μ_t ∈ R^20,与 π 联合用 RL 端到端训练。
- 自适应模块 φ:只用最近 10 步的机上观测历史(s_{t-10:t-1}, a_{t-11:t-2})在线估计 z^φ_t,在线模仿 z^μ;训练损失里加正则项 λ‖z^μ − sg[z^φ]‖² + ‖sg[z^μ] − z^φ‖²(λ 为拉格朗日乘子,用对偶梯度下降更新),去掉了 RMA 那种”教师先收敛、学生再模仿”的两阶段串行流程。
- 机器人本体:Unitree Go1 四足(12 可驱动 DoF)+ Interbotix WidowX 250s 6-DoF 臂(带平行夹爪)刚性固定在机身上,共 19 DoF;RealSense D435 挂在夹爪附近提供 RGB。硬件总成本约 6K 美元(相比 Boston Dynamics Spot Arm 或 ANYmal+定制臂的 >100K 美元)。
数据
纯 sim-to-real 强化学习工作,没有真机采集的训练数据,“数据”即仿真采样分布:
- 仿真器:Nvidia isaac-gym,规模化并行环境。
- 训练规模:10,000 次迭代 / 训练批次,累计 20 亿(2 billion)samples、20 万次梯度更新;Table 8 超参给出并行环境数 5000、每训练批次每环境 40 步、每批次 5 个学习 epoch、4 个 mini-batch。
- 地形:分形噪声(fractal noise)生成的粗糙地形(octaves=2,lacunarity=2.0,gain=0.25,frequency=10Hz,amplitude=0.15m),用以替代复杂 reward 强制脚部抬离地面间隙。
- 指令采样(Table 2,训练范围 / 测试范围):v_x_cmd 训练 [0, 0.9] m/s / 测试 [0.8, 1.0];ω_yaw_cmd 训练 [-1, 1] / 测试 [-1,-0.7]∪[0.7,1];末端执行器球坐标半径 l 训练 [0.2, 0.7] / 测试 [0.6, 0.8],俯仰 p 训练/测试均 [-2π/5, 2π/5],偏航 y 均 [-3π/5, 3π/5];末端指令切换周期 T_traj 训练 [1,3]s / 测试 [0.5,1]s。
- 环境参数域随机化(Table 3,训练 / 测试范围):机身额外负载 [-0.5,3.0] / [5.0,6.0] kg;末端执行器负载 [0,0.1] / [0.2,0.3] kg;机身质心偏移 [-0.15,0.15] / 0.20m;臂电机强度 [0.7,1.3] / [0.6,1.4];腿电机强度 [0.9,1.1] / [0.7,1.3];摩擦系数 [0.25,1.75] / [0.05,2.5]——测试范围刻意设为部分超出训练范围(OOD)以检验自适应鲁棒性。
- 动作标注 / sim-vs-real:全流程 sim-only RL 训练,真机零微调(zero-shot sim-to-real)部署;真机数据仅用于事后的定性分析(如身体姿态与末端指令的相关性分析)而非训练。
训练方法
- 目标函数:标准折扣期望回报 RL 目标,reward = 操作 reward r_manip + 运动 reward r_loco,二者都由 command-following + energy + alive 三项组成(Table 1):
- Command following:操作项 0.5·exp(-‖[p,o]-[p_cmd,o_cmd]‖₁);运动项 -0.5·|v_x-v_x_cmd| + 0.15·exp(-|ω_yaw-ω_yaw_cmd|)。
- Energy:操作项 -0.004·Σ_{arm joints}|τ_j·q̇_j|;运动项 -0.00005·Σ_{leg joints}(τ_i·q̇_i)²(沿用同组 Fu 等 CoRL 2021 能耗惩罚设计,用二次型鼓励腿各关节能耗更低且方差更小)。
- Alive:操作项 0;运动项 0.2+0.5·v_x_cmd。
- Advantage Mixing(解决训练局部极小值):策略优化目标里,臂动作的 log-prob 权重优势为 A_manip + βA_loco,腿动作的权重优势为 βA_manip + A_loco,β 是从 0 线性增到 1 的课程参数(β=min(t/T_mix, 1))。直觉:先把操作回报的差异主要归因于臂动作、运动回报的差异归因于腿动作,再逐渐把两者的优势加权求和混合,诱导出”先各自学会、再融合协同”的隐式课程,用 PPO 优化整个目标。
- Regularized Online Adaptation(解决 sim-to-real 现实性缺口 realizability gap):联合优化 L(θ_π,θ_μ,θ_φ) = -J(θ_π,θ_μ) + λ‖z^μ-sg[z^φ]‖² + ‖sg[z^μ]-z^φ‖²,用对偶梯度下降交替更新 π/μ 和 φ;每 H=20 次迭代切换一次角色(Algorithm 1);正则强度 λ 按线性课程从 0 增到 1:λ = min(max((itr-5000)/5000, 0), 1)。
- PPO 超参(Table 8):clip range 0.2,学习率 2e-4,折扣因子 0.99,GAE λ 0.95,并行环境数 5000,每批次每环境步数 40,每批次学习 epoch 5,mini-batch 数 4,最小策略标准差 0.2。
Infra(训练 / 推理工程)
- 训练侧:Nvidia isaac-gym 并行仿真,仿真频率 200Hz,控制/策略频率 50Hz。GPU 型号、卡数、GPU-hours 论文未披露(只给出总 20 亿样本 / 20 万梯度更新 / 10000 迭代的规模指标)。
- 推理侧(真机部署):策略与自适应模块权重固定后直接搭载 Go1 机身;两个模块均在 Raspberry Pi 4 上以 50Hz 联合推理;WidowX 250s 臂的软件栈跑在 Nvidia TX2 上(Interbotix 官方 ROS 代码库 interbotix_ros_manipulators);Pi 与 TX2 间用 UDP 通信。整机由 Go1 自带电池供电(含 WidowX,功耗 60W),完全无缆(untethered)。
- 视觉跟踪相机参数(Table 9):RealSense D435,分辨率 640×400,采集频率 10Hz。
- 单次网络推理延迟、端到端控制时延等具体数值论文未披露(只给出 50Hz 闭环控制频率)。
评测 benchmark
全部数字取自论文正文(仿真定量对比 + 真机定量任务),测试范围见 Table 2/3(含 OOD 段):
统一策略 vs. 分离/不协同策略(Table 4,仿真,1000 episode × 3 随机种子):
| 方法 | Survival↑ | Base Accel↓ | Vel Error↓ | EE Error↓ | Tot. Energy↓ |
|---|---|---|---|---|---|
| Unified (Ours) | 97.1±0.61 | 1.00±0.03 | 0.31±0.03 | 0.63±0.02 | 50±0.90 |
| Separate(腿/臂分离策略) | 92.0±0.90 | 1.40±0.04 | 0.43±0.07 | 0.92±0.10 | 51±0.30 |
| Uncoordinated(同网络但只用各自 reward 训各自 head) | 94.9±0.61 | 1.03±0.01 | 0.33±0.01 | 0.73±0.02 | 50±0.28 |
统一策略在相近能耗下各项指标全面占优,尤其 EE Error 比 Separate 低 32%。
全身协同的量化证据(Table 5,仿真):
| 方法 | 臂工作空间(m³)↑ | 受扰存活率↑(1.0 m/s 初速扰动) |
|---|---|---|
| Unified (Ours) | 0.82±0.02 | 0.87±0.04 |
| Separate | 0.58±0.10 | 0.64±0.06 |
| Uncoordinated | 0.65±0.02 | 0.77±0.06 |
统一策略下腿的弯曲/伸展让臂工作空间扩大约 40%(相对 Separate),臂也反过来帮机身在受扰时维持更高存活率。
Sim2Real 方法对比(Table 6,仿真,OOD 测试范围 Table 3):
| 方法 | Realizability Gap↓ ‖z^μ-z^φ‖² | Survival↑ | Base Accel↓ | Vel Error↓ | EE Error↓ | Tot. Energy↓ |
|---|---|---|---|---|---|---|
| Domain Randomization(无 z) | — | 95.8±0.2 | 0.44±0.00 | 0.46±0.00 | 0.40±0.00 | 21.9±0.53 |
| RMA [Kumar et al. 2021] | 0.31±0.01 | 95.2±0.2 | 0.54±0.02 | 0.44±0.00 | 0.26±0.04 | 27.3±0.95 |
| Regularized Online Adapt(Ours) | 2e-4±0.00 | 97.4±0.1 | 0.51±0.02 | 0.39±0.01 | 0.21±0.00 | 25.9±0.56 |
| Expert w/ Reg.(用特权信息,带正则) | — | 97.8±0.2 | 0.52±0.02 | 0.40±0.01 | 0.21±0.00 | 25.8±0.49 |
| Expert w/o Reg.(用特权信息,无正则,性能上界) | — | 98.3±0.2 | 0.51±0.02 | 0.39±0.00 | 0.21±0.00 | 25.6±0.30 |
本文方法的 latent 模仿误差比 RMA 低 3 个数量级(2e-4 vs 0.31),EE Error 相比 RMA 降低约 20%,且几乎追平使用特权信息的 Expert 上界(Domain Randomization 一栏的低能耗/低加速度是因为它在困难环境下直接学会”站着不动”的退化解,并非真正鲁棒)。
真机视觉引导抓取任务(Table 7,AprilTag 定位反馈,每设置 10 次真机试验,对比 baseline = 内置 Go1 MPC 控制器 + WidowX 操作空间 IK 求解器,记为 MPC+IK):
| 任务难度 | 方法 | 成功率↑ | 平均完成时间(TTC)↓ | MPC+IK 自碰撞率 / IK 失败率 |
|---|---|---|---|---|
| Easy(3 个采样点) | Ours | 0.8 | 5s | — |
| Easy | MPC+IK | 0.3 | 17s | IK 失败率 0.4 / 自碰撞率 0.3 |
| Hard(5 个采样点,贴近前脚难够到) | Ours | 0.8 | 5.6s | — |
| Hard | MPC+IK | 0.1 | 22.0s | IK 失败率 0.2 / 自碰撞率 0.5 |
本文方法用关节空间控制不存在 IK 求解失败问题;论文报告的自碰撞率为 0。MPC+IK 的失败主要来自 IK 奇异解与自碰撞,尤其在 hard 任务(目标点贴近机身)时更严重;本文方法的 TTC 也更短,因为在线 IK + 操作空间控制计算量更大。
开环示教复现(定性,Fig.7):机器人在不平坦草地上按预设末端轨迹(从 p=(0.5,-0.5,-1.2) 到 p_end=(0.55,-0.9,0.4),T_traj=2.5s)拾取水杯,同时以 v_x_cmd=0.35 m/s 前进;随末端指令从高处移向机身下方,机身自然出现俯仰、翻滚、偏航的协同动作来辅助臂够到目标。
创新点与影响
- 贡献:(1) 提出用单个神经网络策略同时输出腿+臂全部关节目标的”统一策略”(unified policy)范式,取代腿臂控制解耦的行业惯例;(2) Advantage Mixing——利用操作/运动动作空间的因果依赖分解优势函数,解决高自由度全身控制训练中的局部极小值/信度分配难题;(3) Regularized Online Adaptation——用拉格朗日正则项联合在线训练特权信息编码器与自适应模块,去掉两阶段 teacher-student 的串行流程,缩小 sim-to-real 的”现实性缺口”(realizability gap);(4) 给出一套约 6K 美元的低成本自制腿式机械臂硬件方案(对比行业 >100K 美元方案),降低学术界复现门槛。
- 改变了什么:把”legged manipulator 的腿臂协同”从模型式分层控制(如 Ma et al. RA-L 2022 的 MPC+RL 混合)转向纯学习式端到端全身控制,是该子方向的早期奠基工作之一;Regularized Online Adaptation 作为 RMA 的正则化推广,为后续 sim-to-real 自适应方法提供了一个可比基线(论文明确指出 RMA 是其特例)。CoRL 2022 Oral、Best Systems Paper Award Finalist(前 0.79%),媒体报道包括 New Scientist、Popular Science 等。
- 作者自陈局限:(1) 目前只展示了对刚性物体的初步物体交互(拾取、按按钮、擦拭),把遮挡(occlusion)、软体物体等通用物体交互纳入统一策略仍是开放难题;(2) 现有方法尚未加入视觉输入端到端训练策略(真机的视觉引导用的是独立脚本化的 AprilTag 反馈控制器,而非策略本身接收视觉输入);(3) 尚未探索用前腿攀爬障碍物以够到桌面等更复杂的全身协调场景。作者认为本文是朝这些方向迈出的第一步。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2210.10044
- arXiv PDF:https://arxiv.org/pdf/2210.10044
- OpenReview(CoRL 2022):https://openreview.net/forum?id=zldI4UpuG7v
- 项目主页(视频/摘要/媒体报道):https://manipulation-locomotion.github.io/
- 代码仓库:https://github.com/MarkFzp/Deep-Whole-Body-Control
一手源存档(sources/)
- deep-whole-body-control-loco-manipulation—project-page — 项目主页(摘要、CoRL 2022 Oral + Best Systems Paper Award Finalist、demo 视频分类、媒体报道、bibtex)
- deep-whole-body-control-loco-manipulation—github-readme — GitHub README(仅标题/作者/引用信息的占位说明)
- arXiv 原文 PDF(2210.10044,不入 git):见上方 arXiv 链接