一句话定位

ETH Zurich Robotic Systems Lab(Jenelten、He、Hutter;Farshidian 现就职 Boston Dynamics AI Institute)提出的四足混合控制架构:训练时让一个模型驱动的轨迹优化器 TAMOLS 在线滚动生成参考足点和身体轨迹,一个纯 MLP 的强化学习策略去跟踪它,从而把 TO 的精确落脚与地形泛化能力,和 RL 的鲁棒恢复能力拼在了一起;2023 年 9 月挂 arXiv,2024 年发表于 Science Robotics(Vol. 9, Issue 86, eadh5401)。

背景与定位

腿足运动控制长期存在两条并行路线:轨迹优化(TO,如作者组自己的 TAMOLS、以及 Grandia et al. 2023 的非线性 MPC)依赖运动学/动力学模型做落脚点与身体位姿的滚动优化,精度高、跨地形泛化好,但一旦模型假设被违反(打滑、地面塌陷、贴图漂移)就容易失控,且现实中不管规划器多快也追不上它自己造成的误差(论文原话:参考轨迹通常以 5–100 Hz 更新,却要在 400–1000 Hz 上被跟踪执行)。RL 路线(如 learning-to-walk-in-minutes-massively-parallel-rl 的大规模并行端到端训练、learning-robust-perceptive-locomotion-wild 的教师-学生蒸馏)鲁棒性极强,但在垫脚石、缝隙这类”有效落脚点稀疏”的地形上因奖励稀疏、探索困难而普遍失败,此前只能靠专门过拟合单一地形的策略解决。

DTC 的思路是把 TO 的解当作在线生成的”参考”(而非离线专家演示):沿用 DeepLoco(Peng et al. 2017)式的高层规划器+低层跟踪器分层结构,但高层不是学出来的落脚点生成网络,而是直接调用 TAMOLS 的优化解;训练里策略只观测这个解的一小部分(落脚点 xy 坐标、触地时刻的期望关节角、接触相位),而不是完整地形高程图,用意是让策略学到的是”如何跟踪”而不是”如何依赖某一种感知表示”。与同组稍后的 anymal-parkour-agile-navigation(技能分离+高层选择器做导航级跑酷)相比,DTC 解决的是更底层的问题——不做路径规划或技能切换,只做单一步态下的精确落脚跟踪,因此可以直接对比并替换掉 TAMOLS/MPC 里的任意一个模型驱动规划器而无需重新训练。归类 locomotion-nav

模型架构

不是 VLA/VLM 架构,而是”模型驱动规划器(在线)+ 纯本体感觉 RL 跟踪策略(离线训练/在线部署)“的两层混合结构。

  • 高层(模型驱动):TAMOLS(地形感知运动优化,Jenelten et al. 2022,作者组自己此前的工作)——同时优化落脚点与身体位姿,运动学/动力学做了简化以支持快速求解;本文为其新增了 CPU 并行求解多个优化问题的能力、pybind11 python 接口,并假设”测得的接触状态=期望接触状态”以摆脱最脆弱的接触估计模块。部署时也可替换为 Grandia et al. 2023 的非线性 MPC(更完整运动学,计算更贵)。
  • 低层(策略网络):策略 π(a|o) ~ N(μ_θ(o), σ_θ),μ_θ 由 3 层隐藏层、每层 512 neuron 的 MLP 生成,标准差是独立于观测的参数层;价值函数 V(o, õ) 同结构 MLP(3×512),采用非对称 actor-critic(critic 见特权观测,actor 只见带噪声观测)。
  • 动作空间:12 维连续目标关节位置(四足×三关节),经 PD 控制器跟踪,策略/部署统一 50 Hz。不使用离散 token 化、diffusion 或 flow 动作头。
  • 观测融合(无图像/CNN 编码器):本体感觉(base twist 6 维、重力向量 3、关节位置 12、关节速度 12、上一步动作 12)+ TO 解的一小部分(4 个落脚点 xy 坐标共 8 维、触地时刻的期望关节角 12 维用解析逆运动学 IK 算出、期望接触状态 4、当前相位剩余时间 4、参考 twist 3)+ 一条高度扫描线(40 维,沿”当前足端位置→目标落脚点”连线采样,而非围绕机体或足端的稀疏高程图/CNN),特点是可以把地图漂移建模成逐脚独立量、且不给策略暴露完整地形信息以防止过拟合某种感知表示。特权观测另加优化后 base 位姿/twist/加速度、consistency reward、外部 base 力矩/足端力、摩擦系数、高度漂移,只供 critic 使用。策略里刻意不提供优化后的 base 位姿参考(发现这样对建图误差更不敏感,也让策略与具体用哪个 TO 方法解耦)。
  • 无跨本体设计:只训练单一 ANYmal 四足本体,在两台 ANYmal C(默认各配 4× Intel RealSense D435 深度相机,其中一台换装 2× Robosense Bpearl 激光雷达用于室外实验)和一台 ANYmal D(默认配 8× 同型号深度相机)上分别训练独立策略,非通用多机器人基座策略。

数据

训练不依赖任何真实数据集或离线演示轨迹,全部数据来自仿真滚动 + TAMOLS 在线求解生成的参考运动:

  • 并行规模:64² = 4096 个并行机器人环境,训练 90000 epoch(约两周挂钟时间),每 epoch 45 次学习迭代、每次迭代对应 0.02 s 仿真步。
  • 累计参考轨迹时长:考虑到 TO 并非每个 policy step 都重算(仅在触地/跌倒/被推/换指令时重算),换算下来累计生成并学习了约 **8295 天(≈23 年)**的优化轨迹。
  • 地形规模12 种地形类型(楼梯、斜坡+缝隙组合、金字塔、坡度粗糙地形、垫脚石、随机位姿物体、倾斜箱面、圆环、坑、横梁、悬浮随机位姿物体、栈板),每种 10 个难度等级1200 个地形块,每块 8×8 m²,总面积 76800 m²(论文原话:约合 14 个美式足球场或 10 个标准足球场,摘要里四舍五入写作”超过 76000 m²”)。
  • 标签来源:没有离线动作标签;关节位置目标由解析 IK 实时算出,落脚点/身体轨迹由 TAMOLS 在线优化给出(论文特意用”reference”而非”expert”来强调这是在线生成、非离线专家数据)。
  • 纯仿真训练,零样本部署到真机:无 sim/real 协同训练;靠 domain randomization(摩擦系数 μU(0.1,1.2) 逐腿采样、外部 base 力矩U(−15,15)、外部足端力U(−2,2) N、10 s 后 twist 扰动U(−1,1) m/s、elevation map 噪声/漂移用近似 Laplace 分布逐脚独立采样、每 8 s 重采样一次)弥合 sim-to-real gap。

训练方法

  • 算法:自定义版 PPO(Proximal Policy Optimization),非对称 actor-critic。训练环境基本沿用 learning-to-walk-in-minutes-massively-parallel-rl(Rudin et al. 2021)的大规模并行仿真 + 地形课程学习框架。
  • 奖励设计三类:
    • tracking(对 TAMOLS 参考的跟踪):base 位置/旋转/线速度/角速度/线加速度/角加速度用指数型”soft”跟踪奖励(权重均为 1,σ 分别为 1200 / 90 / 10 / 1 / 0.05 / 0.005);落脚点用对数型”hard”跟踪奖励 r_pi = −ln(‖p_i*−p_i‖² + ε)(权重 6,ε=1e−5),且每个步态周期每条腿最多计一次,防止”拖脚”式作弊。
    • consistency(权重 20):鼓励相邻两次 TO 解相似,专门抑制 RL 常见的”因少数机器人拒绝行动反而拿高分”式犹豫不前局部最优。
    • regularization:foot power 惩罚(−0.02,防蹭脚/碰撞)、joint power 惩罚(−0.025,防乱用力)、action rate 惩罚(−0.02)、joint acceleration 惩罚(−1e−6)。
  • TO 更新频率是关键工程决策:训练中 TO 只在每次触地(约每 0.465 s 一次摆动相后)重新求解,而非每个 policy step 都重算——这既防止”策略摆烂、TO 自适应到不可行状态形成局部最优”,又把计算成本降低约 23 倍;机器人跌倒(平均每 18 s 一次)、被推(10 s 后)或指令切换(每 episode 3 次)时也会强制触发重新求解,以保证策略学会应对不同更新率。
  • PPO 超参数(论文 Table 1):batch size = 45×4096 = 184320;mini-batch = 4×4096 = 16384;每次更新 5 epoch;clip range 0.2;entropy 系数 0.0035;折扣因子 γ=0.99;GAE-λ=0.95;期望 KL 散度 0.01;学习率自适应。
  • 关键消融:若观测中去掉”触地时期望关节角(IK 结果)“这一项,训练收敛速度与落脚跟踪精度(Fig. 7D 用 foothold reward 和地形课程等级衡量)显著下降——网络被迫隐式学逆运动学,作者认为这是 IK 本身难学的证据。

Infra(训练 / 推理工程)

  • 训练:仿真与反向传播跑在 GPU 上,TAMOLS 优化问题求解跑在 CPU 上(通过 pybind11 暴露的 python 接口,支持多问题并行求解);具体 GPU 型号/数量未披露。
  • 并行规模与耗时:4096 个并行机器人,总训练 两周(90000 epoch);策略约 1 天(6000 epoch)后即可部署,3 天(20000 epoch)达到峰值性能的 90%,2 周(90000 epoch)完全收敛。
  • 吞吐对比:DTC 每 epoch 耗时 0.9 s,对应 27 仿真秒/真实秒;对照 baseline-rl-1(learning-robust-perceptive-locomotion-wild,1000 并行机器人、5 天训 4000 epoch、每 epoch 5 s)吞吐 46 仿真秒/真实秒——DTC 虽然每天多生成 1.6 年的参考运动量,吞吐只比 baseline 慢 1.7 倍。
  • 推理/部署:策略以 50 Hz 部署,无需微调;运动优化器在独立线程里以能达到的最大频率跑——配 trotting 步态的 TAMOLS 约 400 Hz,替换成 baseline-to-2(非线性 MPC)约 100 Hz,均快于策略频率;策略每步从线程池取最新解,并向前外推 Δt=0.02 s。真机上运动优化 + 策略前向推理都跑在单台 Intel Core i7-8850H 机载计算机上;高程建图单独跑在机载 NVIDIA Jetson 上。三台真机:两台 ANYmal C(默认 4× Intel RealSense D435 深度相机,其中一台换装 2× Robosense Bpearl 激光雷达用于室外实验)、一台 ANYmal D(默认 8× 同型号深度相机)。

评测 benchmark

对照四个基线:baseline-to-1 = TAMOLS、baseline-to-2 = 非线性 MPC(Grandia et al. 2023)、baseline-rl-1 = 教师学生蒸馏策略(即 learning-robust-perceptive-locomotion-wild)、baseline-rl-2 = 大规模并行 RL 策略(即 learning-to-walk-in-minutes-massively-parallel-rl);除标注外均为真实机器人实验。

  • 落脚跟踪精度:平地 8 种朝向速度(±1.0/±0.8/±0.6/±0.4 m/s)下平均跟踪误差 2.3 cm(标准差 0.48 cm,配 TAMOLS);换成 baseline-to-2 的更宽站姿下平均误差 3 cm

  • 爬箱高度:配 TAMOLS 可靠爬升高度约 0.40 m(受限于 TAMOLS 简化运动学假设,怕膝关节碰撞);换用运动学更完整的 baseline-to-2 后爬升到 0.48 m——比 baseline-rl-1 能爬的高度高 50%,比 baseline-rl-2 报告的高度高 380%(5 次重复实验均成功)。

  • 鲁棒性对比模型驱动基线:可移动倾斜盖板实验(地图/里程计误差最大达 0.4 m)3 次重复全部平衡成功;湿滑+可移动+可变形障碍组成的障碍道(约 45 s 通过时长)5 次重复无一跌倒;盲走两级台阶(每级 0.18 m 高、0.29 m 宽,速度 ±0.5/±0.75/±1.0 m/s)3 次往返全部靠学到的摆动反射通过,鲁棒性与 baseline-rl-1(专门的教师学生复杂训练)相当;“暗藏缝隙陷阱地板”实验中,单独部署的 baseline-to-1(TAMOLS)在右前脚踩空后触发的启发式恢复策略失效并跌倒,DTC 用同一个高层规划器但叠加了学到的恢复/反射技能,成功穿过陷阱;baseline-to-1、baseline-to-2、DTC 三者各自重复 5 次,每种方法自身的结果都保持一致(consistent)。

  • 鲁棒性对比 RL 基线:0.1 m 小缝隙 DTC 100% 成功率(10 次重复),baseline-rl-1 无法跨越;升级到 4 个各 0.6 m 宽的连续缝隙、以及 1.8 m 长横梁,DTC 仍 100% 成功率(各 4 次重复);baseline-rl-1 在窄横梁(1.0 m)上也失败。

  • 垫脚石:0.2×0.2 m² 接触面的 2.0 m 长垫脚石场地,10 次通过全部准确踩中规划落脚点;两块随机加高的垫脚石变体 4/4 通过;由 0.31×0.2×0.2 m³ 和 0.51×0.2×0.2 m³ 松动木块连接三个平台(路径 a→b→a→b→c→a)的最难变体,仅踩偏一次但未导致失败。

  • 仿真 parkour 对比:在此前被证明 baseline-rl-1/2 都无法通过的障碍 parkour(引自 Grandia et al. 2023)上,DTC 能以 1 m/s 往返穿越,比 baseline-to-1 快 20%

  • 优化器更新频率消融(120 地形 × 8 seed × 4096 机器人,20 s/episode):更新频率从 1 Hz 提到 50 Hz,失败率下降 7.11 个百分点,成功率提升 4.25 个百分点

  • 全地形仿真对比:在全部 120 个地形上,DTC 显著优于 baseline-rl-2;用同一训练环境重训的 baseline-rl-2(称 baseline-rl-3)能在”落脚点密集”地形(楼梯、坑、粗糙斜坡、圆环)追平 DTC,但在”落脚点稀疏”地形(垫脚石、横梁、缝隙、栈板)上仍明显落后。

  • 地图漂移消融:模拟 elevation map 漂移 0–0.5 m,跟踪误差随漂移近似线性增长;粗糙地形上漂移 <0.1 m 时成功率不变、更大漂移后线性下降;平地上成功/失败率几乎不受漂移影响。

创新点与影响

  • 首次把”在线”模型驱动轨迹优化(而非离线专家演示或采样式生成模型)直接接入 RL 训练循环作为参考信号,用非对称 actor-critic 训出一个只看局部落脚点/关节角/高度扫描线的跟踪策略,兼得 TO 的精确落脚与泛化能力、RL 的鲁棒恢复能力。
  • 证明了同一个跟踪策略可以零样本跨两种完全不同的规划器(400 Hz 的 TAMOLS 与 100 Hz 的非线性 MPC)部署而不用重新训练,因为观测里只暴露了对规划器选择”不敏感”的落脚点子集,而非完整身体轨迹。
  • 用一个简单的 3×512 MLP + 非对称 actor-critic,达到了此前需要复杂教师-学生蒸馏结构(baseline-rl-1)才能实现的鲁棒性水平,且能处理教师学生结构较难应对的视觉噪声/漂移。
  • 论文自陈局限:(1) 训练所需 epoch 数并不比同类统一 RL 策略更省样本,作者认为落脚精度本身就是难学的技能;(2) 受限于 TAMOLS 的简化运动学假设,DTC+TAMOLS 组合能可靠爬升的高度上限只有 0.40 m,要爬更高必须换算力更贵的 MPC 规划器;(3) 某些障碍可能诱使规划器给出训练时从未见过的落脚模式,此时跟踪性能会下降;(4) 逆运动学被证明是网络难以隐式学到的部分,作者建议未来利用解析 IK 的先验结构;(5) 作者明确声明这不是 TO+RL 融合的”通用配方”,只是众多可能路径之一;训练/部署都固定单一 trotting 步态,未探索策略自主提出接触时序(步态)的可能性。

原始链接

一手源存档(sources/)

  • arXiv 原文 PDF,不入 git(已读取全文用于本页六维度撰写)
  • 代码归档快照