一句话定位

ETH Zurich(联合 KAIST、Intel)的 Science Robotics 后续工作:在 learning-quadrupedal-locomotion-challenging-terrain 的纯本体感觉 teacher-student 框架上,加入一个带注意力门控的 GRU belief encoder 融合外部感知(高程图高度采样)与本体感觉,让机器人在外感可靠时提前预判地形加速通过、外感失效/误导时无缝退化为纯本体感觉运动,在阿尔卑斯山一小时徒步路线与 DARPA 地下挑战赛中实现零跌倒部署。

背景与定位

延续同组的 privileged learning(teacher-student 蒸馏) 范式,核心突破是解决”如何融合不可靠的外部感知”这一此前被搁置的问题:

  • 前作 learning-quadrupedal-locomotion-challenging-terrain(Lee et al. 2020)证明纯本体感觉盲式控制器足够鲁棒,但因为看不到地形只能”先踩后判断”,速度和越障能力天然受限,作者在该文讨论中已预告要往 hybrid proprioceptive-exteroceptive 方向走——本文正是这个后续。
  • 此前给腿足机器人加外感知的方法(如 Gangapurwala et al. RLOC,学习足点规划器+model-based 全身控制)假设高程图质量可靠,遇到雪、水、植被、反光地面、遮挡、位姿漂移等真实野外场景导致的地图错误/缺失时会失效;主流方案要么彻底放弃室外场景用外感知(只用本体感觉),要么加启发式反射规则打补丁。
  • 本文的方法论创新是用一个可学习的、端到端训练的注意力门控 belief state encoder 取代启发式规则,让网络自己学会”何时信外感知、何时退回本体感觉”,而不是显式建模地图不确定性。
  • 训练范式仍是三阶段:teacher(RL,特权信息)→ student(模仿+重构,belief encoder)→ 真机零样本部署,与前作一脉相承但 student 的核心模块从 TCN 换成了带门控的 GRU,且新增了 exteroceptive 输入通路。

模型架构

总体沿用 teacher-student 两段蒸馏,teacher 用 RL 在仿真里训练(可见特权信息),distill 成只用真机可得传感器输入的 student,零样本部署。

Teacher policy

  • 观测 o_teacher = (o^p, o^e, s^priv):本体感觉 o^p(机体速度/姿态、关节位置历史 3 步/速度历史 2 步/目标历史 2 步、CPG 相位)、外感知 o^e(每只脚周围 5 个半径 {0.08, 0.16, 0.26, 0.36, 0.48} m 的高度采样,采样点数 {6,8,10,12,16},每脚 52 维 ×4 脚 = 208 维)、特权状态 s^priv(接触状态/力/法向、摩擦系数、大腿小腿接触、外力外扭矩、摆动相时长,Table S3 合计 50 维)。
  • 三个 MLP 组件:外感知编码器 g_e(隐藏层 {80,60})把 208 维外感知压缩为 96 维(24×4,每脚 24 维);特权编码器 g_p(隐藏层 {64,32})把特权状态压成 24 维;两路 latent 与本体感觉拼接后送入主干 MLP(三隐藏层 {256,160,128},LeakyReLU 激活)输出动作分布均值,用 PPO 训练为高斯策略。
  • 动作空间沿用 CPG(central pattern generator)风格:每条腿 l 维护相位 φ_l,动作为相位偏移 Δφ_l(4 维)+ 残差关节目标 Δq_i(12 维)=16 维,经解析逆运动学转换为最终关节目标。

Student policy(核心创新:注意力门控 belief encoder)

  • 只能访问带噪声的本体感觉 o^p 和噪声化的高度采样 õ^e
  • Belief encoder = 一个 2 层堆叠、每层 50 个隐藏单元的 GRU + 注意力门:
    • b_t', h_{t+1} = RNN(o^p_t, l^e_t, h_t)l^e_t = g_e(õ^e_t) 为噪声外感知的 latent)
    • α = σ(g_a(b_t'))(注意力门,sigmoid 输出)
    • b_t = g_b(b_t') + α ⊙ l^e_t(门控残差连接,g_ag_b 各为 2 隐藏层 {64,64} 的 MLP)
    • belief state b_t 维度 = 96(重构外感知目标) + 24(重构特权信息目标) = 120 维,注意力向量 α 为 96 维
  • 门控机制让网络显式学习”外感知可信时通过 skip connection 放行,外感知不可信/噪声大时门关闭、退化为纯本体感觉推理”,belief decoder(仅训练/分析用)用同一个门重构外感知高度采样和特权信息,产生重构损失。
  • Student 主干 MLP 结构与 teacher 完全一致({256,160,128}),初始化直接复用 teacher 训好的权重以加速训练。
  • RNN 训练用 Truncated Backpropagation Through Time (TBPTT),截断步长 10。

数据

训练数据全部来自仿真程序化生成(RaiSim 中的 ANYmal-C 模型 + 学到的执行器网络),无真实机器人采集的训练数据:

  • 地形类型(S4):rough(Perlin 噪声)、rough discrete、large steps(仅两级高度,h∈[0,0.4]m)、grid steps(h∈[0.05,0.4]m,步宽 d∈[0.2,0.7]m)、stairs 共 4 种(standard/open/ledged/random;台阶深 d∈[0.25,1.0]m,高 h∈[0.01,0.22]m;random stair 按 e~N(1.0,0.2) 缩放深/高)、boxes(多个最大高 0.25m 的方块,随机位置与偏航角)。台阶用方块而非高度图建模,因为高度图无法表示垂直台阶面,作者观察到策略会利用高度图的非垂直边缘取巧导致 sim-to-real 差。
  • 域随机化:机身/腿部质量、初始关节位置/速度、初始机体朝向/速度、外加力矩、偶发的低摩擦系数(模拟打滑)。
  • 终止条件:机体与地面碰撞、机体倾角过大、关节力矩超限。
  • 外感知噪声模型(Height sample noise, S8):对每个采样点的位置和高度值分别注入噪声,噪声分三个作用域——逐采样点(每步重采样)、逐脚(每步/每 episode 固定两种)、逐 episode;并定义 三种地图质量条件:nominal(正常建图)、offset(模拟位姿漂移/可变形地形导致的大偏移)、noisy(模拟遮挡/建图完全失败的大噪声),三者在每个 episode 开始按 60% / 30% / 10% 概率随机选择;此外训练地形被切分成网格 cell,各 cell 附加不同的高度采样偏移以模拟植被/深雪等区域间地形属性突变,噪声幅度随训练进度线性增大(student curriculum factor)。
  • 规模:teacher 阶段 1000 个并行仿真环境,每次迭代收集 250 步轨迹;student 阶段 300 个并行环境,每次迭代收集 400 步轨迹。
  • 无 sim-to-real 混合训练数据,也无人类示教数据;完全靠 zero-shot sim-to-real 迁移,真机部署阶段无 fine-tuning。

训练方法

三阶段:teacher RL → student 模仿+重构蒸馏 → 真机零样本部署,与 learning-quadrupedal-locomotion-challenging-terrain 同一大范式,关键差异在 student 引入外感知与门控 belief encoder。

  • Teacher 训练:用 PPO 优化,动作建模为高斯策略 a_t ~ N(π_θ(o_t), σI)。超参(Table S1):学习率 5.0e-4、学习率衰减 gamma 0.9999、折扣因子 0.996、每次更新 learning epoch 2、GAE-λ 0.95、clip ratio 0.2、entropy 系数 0.005、batch size 8300。奖励项:跟随目标线速度/角速度/正交速度惩罚、机体运动惩罚、足端离地净空、大小腿碰撞惩罚、关节速度加速度惩罚、关节约束、目标平滑度(一二阶差分)、力矩惩罚、打滑惩罚,加权求和为 r = 0.75(r_lv+r_av+r_lvo) + r_b + 0.003 r_fc + 0.1 r_co + 0.001 r_j + 0.08 r_jc + 0.003 r_s + 1.0e-6 r_τ + 0.003 r_slip
  • 课程学习:两套课程叠加——(1) 地形难度自适应课程(沿用前作的粒子滤波方法);(2) 域随机化幅度与部分奖励项系数按 c_{k+1} = (c_k)^d(收敛率 d=0.98)单调递增趋近 1。
  • Student 训练(监督蒸馏):损失 = 行为克隆损失 + 0.5×重构损失L_bc + 0.5·L_re),行为克隆损失为 student 动作与 teacher 动作的平方距离,重构损失为 belief decoder 重构的外感知/特权信息与真实值的平方距离。超参(Table S2):学习率 5.0e-4、TBPTT 截断步长 10、learning epoch 2。student 训练日程:前 10 epoch 只用平地(无外感知噪声),之后启用自适应地形课程;20 epoch 后 student 噪声课程因子线性增大直到 100 epoch 稳定为 1.0。
  • 动作 tokenization:无离散化,动作直接为连续 16 维(4 相位偏移 + 12 关节残差)。
  • 消融验证门控必要性(S9):对比 4 种 belief encoder——GRU+门、GRU 无门、MLP+门、MLP 无门。结果:GRU 全面优于 MLP(MLP 无法重构特权信息);门控结构在 GRU 和 MLP 上都持续提升性能。

Infra(训练 / 推理工程)

  • 仿真器:RaiSim(刚体+接触动力学),沿用前作的 ANYmal-C 执行器网络模型缩小 sim-to-real gap。
  • 训练硬件规格(GPU 数量/型号、总训练小时数、分布式并行方式):论文正文与补充材料均未披露(仅给出并行环境数与迭代步数,未给出具体计算设备与训练时长,这与其 2020 前作在 Table S1 中明确写出”i7-8700K+RTX 2080”形成对比)。
  • 推理/部署:ANYmal C 机器人,两种传感器配置零样本切换、无需重新训练——2× Robosense Bpearl 环形 LiDAR4× Intel RealSense D435 深度相机;策略用 PyTorch 训练,部署时策略推理频率 50 Hz;机器人自建 robot-centric 2.5D 高程图,更新频率 20 Hz(自研 GPU 并行点云处理管线,Kalman 滤波式更新 + 漂移补偿 + 光线投射,以维持高速运动下建图的一致性与实时性);策略在无地图信息处随机采样填充高度值。
  • 同一策略权重覆盖两种深度传感模态,无需针对传感器微调,验证了高程图作为传感器无关抽象层的有效性。

评测 benchmark

以下数据均来自本论文正文与补充材料(Science Robotics 7(62), eabk2822),基线为同组 2020 年发表的纯本体感觉控制器(Lee et al., learning-quadrupedal-locomotion-challenging-terrain)。

  • 真实世界部署:阿尔卑斯山、森林、地下洞穴、城市等多季节复杂环境部署,全程零跌倒;能原生沿任意方向/朝向通过楼梯(无需像 Boston Dynamics Spot 那样切换专用模式并对齐楼梯方向)。
  • 阿尔卑斯徒步实验:Etzel 山 2.2 km 环线,爬升 120 m,坡度最陡达 38%;机器人 31 分钟登顶(官方指示牌人类预期时间 35 分钟),全程 78 分钟完成(徒步向导预估难度”困难”路线用时 76 分钟),中途仅因鞋套脱落和换电池暂停,无一次跌倒。
  • DARPA 地下挑战赛(CERBERUS 队):本控制器作为默认控制器,驱动 4 台 ANYmal 在隧道/城市/洞穴三类赛道累计探索超 1700 m,零跌倒;团队获得决赛第一名。
  • 固定高度台阶通过率(10 cm 高木质台阶,12–36.5 cm 范围,各高度 10 次试验,5 秒内翻越计成功):基线在 20 cm 台阶处成功率开始下降(前腿常卡住、后腿常无法完全抬上);本文控制器可靠翻越至 30.5 cm;超过 32 cm 时控制器会主动犹豫不前进(判断该高度接近机器人物理极限、代价过高)。
  • 障碍道实验(斜坡台 20 cm 高、抬升台 20 cm 高、楼梯 17 cm 高×29 cm 深、方块堆 20×20 cm):本文控制器平顺通过全程无需人工干预,用时 33 秒;基线在三处障碍全部卡住,需人工抬起/推动才能继续,用时 75 秒(含人工协助)
  • 最大运动速度(平地与 20 cm 台阶上):本文控制器前向/侧向速度 1.2 m/s,基线仅 0.6 m/s(2 倍);转向角速度本文 3 rad/s vs 基线 0.6 rad/s(5 倍);越过台阶时本文控制器速度无明显下降,基线则严重受阻。
  • 仿真定量对比(S2,41×41 地形参数网格 × 300 次试验/组,固定前向速度 0.7 m/s、10 秒内走完 4 m 计成功):论文以图表(Fig. S1 A/B)呈现,本文控制器可通过的地形参数范围(grid steps 与 stairs 两类)显著宽于基线,未在正文给出单一汇总百分比。
  • 门控消融定量结果(S9,Table S4/S5,各配置 5 seeds×100 次试验)
    • 动作差异(student vs teacher 动作平方距离):小噪声条件下 10 种地形上 GRU+门 全面小于 GRU 无门(如 rough 地形 0.690±0.40 vs 0.746±0.40;grid steps 1.444±0.56 vs 1.674±0.58);大噪声条件下两者趋于接近(如 rough 0.879±0.46 vs 0.997±0.44),验证门控在外感知不可靠时会关闭跳连、退化为近似纯本体感觉模型。
    • 高度重构误差同样呈现”小噪声下有门更准、大噪声下两者接近”的模式(Table S5)。
    • 台阶通过率(100 次试验/组,0.8 m/s 定速指令):GRU+门 在小噪声和大噪声条件下均优于其余三种配置,且小噪声下与 GRU 无门的差距大于大噪声条件,进一步支持”门控能在外感知可靠时更充分利用外感知”的结论。

创新点与影响

贡献

  • 提出注意力门控 belief state encoder,首次用端到端学习(而非启发式规则)解决”何时信任、多大程度融合外部感知”的问题,让单一策略在外感知可靠时预判加速、外感知失效/误导时无缝退化为鲁棒的纯本体感觉运动。
  • 通过大量真实野外部署(含定量台阶/障碍道/速度对比实验与阿尔卑斯徒步、DARPA SubT 竞赛级任务)验证了该方法相对纯本体感觉基线在速度(2–5 倍)与越障能力(约 1.5 倍台阶高度)上的显著提升,同时保持零失败的鲁棒性。
  • belief decoder 的内省能力:论文通过遮挡传感器、软性障碍(泡沫块)、透明障碍(亚克力板)、湿滑平台等受控实验,可视化展示 belief state 如何在接触后修正对地形高度/摩擦的估计,并因 GRU 的循环结构保留跨时间步的记忆。
  • 用高程图(而非原始点云/深度图)做外感知抽象层,使方法与具体深度传感器解耦——同一策略零样本适配 LiDAR 与立体相机两种硬件。

作者自述局限

  • 当前策略只隐式利用不确定性来推断地形,未显式建模不确定性;在悬崖边缘/垫脚石等因遮挡导致地图信息不足的场景,策略会默认假设连续地表,可能踏空跌落——作者认为显式不确定性估计(如学习探地行为)是未来方向。
  • 高程图这一中间表征丢弃了原始传感器数据中可能蕴含的材质/纹理信息;且建图依赖未与网络联合训练的经典位姿估计模块,作者认为把原始感知处理端到端纳入网络训练可能进一步提升速度与鲁棒性。
  • 无法完成需要显著偏离正常行走模式的运动任务,例如从窄洞中卡住的腿部恢复,或攀爬高台阶以外的高处。

原始链接

一手源存档(sources/)