一句话定位

DreamWaQ 提出”隐式地形想象”(implicit terrain imagination):用一个非对称 actor-critic 架构,配合共享编码器的上下文辅助估计网络(CENet),让只依赖本体感受(IMU + 关节编码器)的四足机器人策略在训练中隐式推断出高度图、摩擦力、扰动力等特权信息,无需相机或 LiDAR 即可稳健穿越崎岖地形,并在 Unitree A1 上完成 430m/465m(含 22m 爬升)的室外长距离穿越。

背景与定位

四足机器人的地形穿越此前分两条路线:一是靠外感知(相机/LiDAR)建高程图再规划,但相机在恶劣天气/光照下会失效,LiDAR 也难以分辨雪地、深草等材质属性带来的”看起来能走但其实不能走”或反之的误判;二是只用本体感受,通过 teacher-student 蒸馏隐式估计环境,如 rma-rapid-motor-adaptation(RMA)与 learning-quadrupedal-locomotion-challenging-terrain(Lee et al. 2020)。这类两阶段蒸馏方法有两个问题:behavior cloning 把学生策略的性能上界锁死在教师策略之下;教师与学生顺序训练,数据效率低,且学生策略在蒸馏阶段难以探索到教师早期学习时踩过的失败状态(论文称之为”表征学习瓶颈”)。

DreamWaQ(KAIST Urban Robotics Lab,Nahrendra / Yu / Myung,accepted ICRA 2023)的立场是放弃显式两阶段蒸馏,改用非对称 actor-critic(asymmetric actor-critic)一次性联合训练:策略(actor)只吃本体历史观测,价值网络(critic)吃特权状态(含高度图与扰动力),让 actor 与 critic 的博弈过程本身逼迫策略隐式”想象”出地形属性,训练效率因此显著提升(只需一个训练阶段,而非教师-学生两阶段)。同期同样基于 Isaac Gym + 大规模并行 RL + 地形课程的工作是 learning-to-walk-in-minutes-massively-parallel-rl(Rudin et al.),DreamWaQ 直接复用其开源仿真与地形课程实现;稍晚的 extreme-parkour-legged-robotsrobot-parkour-learning 把类似”本体+外感 teacher-student”范式推向跑酷等更极限地形,但仍依赖视觉外感知,DreamWaQ 的定位则始终是纯本体感受、零视觉/LiDAR 传感器下的鲁棒行走。

模型架构

(RL 运动策略,非 VLA/世界模型,无 VLM)

  • 建模为 POMDP:策略 π_φ(a_t | o_t^H, v_t, z_t) 输出动作 a_t(12×1 关节角增量),输入为过去 H=5 步的本体观测历史 o_t^H、CENet 估计的机身线速度 v_t、上下文向量(latent)z_t。单步观测 o_t = [ω_t, g_t, c_t, θ_t, θ̇_t, a_{t-1}]^T,即机身角速度、体坐标系重力向量、速度指令、12 个关节角、12 个关节角速度、上一步动作的拼接。
  • 非对称 actor-critic:actor 只看本体历史 o_t^H(+ 估计的 v_t、z_t);critic 看特权状态 s_t = [o_t, v_t, d_t, h_t]^T,多出随机扰动力 d_t 与机身周围高度图扫描 h_t(仅 critic/训练可见,actor 被迫隐式推断)。动作头为标准连续关节位置目标:θ_des = θ_stand + a_t,交给 PD 控制器跟踪,不是离散 token 或 diffusion/flow。
  • 网络规模(Fig. 1):policy(actor)为 MLP 512-256-128 隐层,输出 12(关节动作);value(critic)为 MLP 512-256-128 隐层,输出 1;隐层激活函数均为 ELU;策略用 PPO 优化。
  • CENet(Context-aided Estimator Network):单编码器 + 多头解码器架构(Fig. 2)。编码器(MLP,128-64 隐层)吃历史本体观测 o_t^H,输出一个 19 维向量,拆成 z_t(16 维上下文向量)与 v_t(3 维机身线速度估计)。第一个解码头做速度估计(MSE 对齐仿真真值速度);第二支路是 β-VAE 自编码器,重建下一步观测 õ_{t+1},从而联合学习机器人的正向/反向动力学,提升估计准确度;VAE 先验取标准正态分布(因所有观测已归一化为零均值单位方差)。
  • CENet 混合损失 L_CE = L_est + L_VAE,其中 L_est = MSE(ṽ_t, v_t),L_VAE = MSE(õ_{t+1}, o_{t+1}) + β·D_KL(q(z_t|o_t^H) ‖ p(z_t))。
  • AdaBoot(自适应 bootstrapping):训练时以概率 p_boot 让策略吃 CENet 的估计值而非仿真真值(bootstrap),p_boot = 1 − tanh(CV(R)),CV 是 m 个域随机化并行环境 episodic reward 的变异系数(标准差/均值)——reward 方差小(策略已收敛较好)时提高 bootstrap 概率强化对不精确估计的鲁棒性,方差大(策略尚未学好)时降低,避免早期估计噪声破坏策略学习。

数据

纯仿真训练 + 零样本仿真到真机迁移,无真实世界采集数据用于训练:

  • 仿真器:Isaac Gym,基于 learning-to-walk-in-minutes-massively-parallel-rl(Rudin et al.)的开源实现;4096 个域随机化 agent 并行训练,共训 1000 次迭代
  • 地形课程:复用 game-inspired curriculum(同 Rudin et al.),含平地、粗糙地、离散地形、楼梯四类,楼梯倾角覆盖 [0°, 22°] 十档难度;额外叠加 grid-adaptive curriculum(复用 Margolis et al. Rapid Locomotion 的课程设计)改善低速转弯、减少绊脚。
  • 域随机化范围(Table II):payload [−1, 2] kg;Kp 系数 [0.9, 1.1];Kd 系数 [0.9, 1.1];电机强度系数 [0.9, 1.1];质心偏移 [−50, 50] mm;摩擦系数 [0.2, 1.25](无量纲);系统延迟 [0.0, 15.0] ms。
  • 特权信息(仅 critic/CENet 训练监督用,不进 actor 输入):机身周围高度图扫描 h_t、随机施加的扰动力 d_t、仿真给出的真值机身线速度 v_t(作 CENet 速度估计头的监督标签)。
  • 真机部署无需任何额外真实数据采集或再训练:策略与 CENet 权重直接零样本迁移到 Unitree A1。

训练方法

  • 算法:policy gradient,用 PPO 优化 actor,clip range 0.2、广义优势估计(GAE)λ=0.95、折扣因子 γ=0.99;Adam 优化器,学习率 1e-3。
  • 联合同步训练:policy、value、CENet 三个网络在同一训练循环里同步优化,而非教师-学生的两阶段串行流程;数据效率因此显著提升,策略也能在训练中探索所有可能轨迹,增强泛化。
  • 奖励函数(Table I,12 项加权求和 r_t = Σ r_i·w_i):线速度跟踪 exp(−4(v_cmd_xy − v_xy)²) 权重 1.0;角速度跟踪 exp(−4(ω_cmd_yaw − ω_yaw)²) 权重 0.5;线速度(z) v_z² 权重 −2.0;角速度(xy) ω_xy² 权重 −0.05;姿态 |g|² 权重 −0.2;关节加速度 θ̈² 权重 −2.5×10⁻⁷;关节功率 |τ||θ̇| 权重 −2×10⁻⁵;机身高度 (h_des−h)² 权重 −1.0;足端离地间隙 (p_des_f,z,k − p_f,z,k)²·v_f,xy,k 权重 −0.01;动作变化率 (a_t−a_{t-1})² 权重 −0.01;平滑度 (a_t−2a_{t-1}+a_{t-2})² 权重 −0.01;功率分配(原创项)var(τ·θ̇)² 权重 −1×10⁻⁵,惩罚各电机功耗方差过大以降低部分电机过热风险。
  • 对照方法(均用相同网络架构与固定初始随机种子,仅训练机制不同,保证公平比较):Baseline(无适应机制)、AdaptationNet(RMA 式 teacher-student,CNN+MLP 编码环境因子)、EstimatorNet(并发训练一个仅显式估计机身状态、无上下文估计的估计器网络)、DreamWaQ w/o AdaBoot、DreamWaQ w/ AdaBoot。

Infra(训练 / 推理工程)

  • 训练硬件:单机桌面 PC,Intel Core i7-8700 CPU @ 3.20 GHz + 32 GB RAM + 单张 NVIDIA RTX 3060Ti(无多卡/多机训练)。
  • 训练吞吐:得益于 Isaac Gym 4096 路并行仿真,DreamWaQ 训练约 1 小时生成的数据量相当于现实世界约 46 天 训练所需的数据量。
  • 真机硬件:Unitree A1;板载 Intel NUC 承担估计与控制全流程,通过 PyBind 接口下发关节角指令;额外挂载的带电池机载 PC 增加约 500g 负载。
  • 推理频率:策略与 CENet 在真机上同步以 50Hz 运行;期望关节角由 PD 控制器以 200Hz 跟踪,比例/微分增益 Kp=28、Kd=0.7。
  • 无相机/深度传感器/LiDAR,仅 IMU + 关节编码器,推理端不依赖任何外感知硬件。

评测 benchmark

  • 学习曲线(Fig. 3,10 个随机种子均值±标准差):DreamWaQ 全程优于 Baseline / AdaptationNet / EstimatorNet,且逼近”神谕(oracle)“策略(可直接读取高度图的上界参照);EstimatorNet 前期均值奖励一度高于 AdaptationNet,但随迭代数增加、遇到更难地形后性能显著下滑,而 DreamWaQ 始终稳定领先。

  • 指令跟踪精度(Gazebo 仿真,10 分钟随机指令,均匀采样自 [−1.0, 1.0]、每 10 秒切换一次,每个控制器用不同随机种子重复 5 次):以绝对跟踪误差(ATE)为指标;配对 t 检验(Fig. 4 箱线图)显示 DreamWaQ 相对所有基线的跟踪误差改进具统计显著性(p < 10⁻⁴),AdaBoot 相较无 AdaBoot 版本也有显著提升;论文未给出具体误差数值,仅以箱线图呈现。

  • 鲁棒性测试(Table III,随机方向推力扰动,存活率=30 分钟随机行走内存活时间占比):

    方法最大可承受推力 (m/s)存活率 (%)
    Baseline0.511 ± 0.05320.51 ± 6.44
    AdaptationNet0.714 ± 0.09682.37 ± 2.49
    EstimatorNet0.871 ± 0.12480.92 ± 5.73
    DreamWaQ w/o AdaBoot1.015 ± 0.12190.71 ± 1.25
    DreamWaQ w/ AdaBoot1.121 ± 0.16495.23 ± 1.61

    DreamWaQ(含 AdaBoot)相比 Baseline,最大抗推速度提升约 2.2 倍、30 分钟存活率提升约 4.6 倍(20.51% → 95.23%)。

  • CENet vs EstimatorNet 估计误差(Fig. 5,仿真楼梯环境定性对比):平地正常行走时两者估计误差都较小;但机器人在楼梯上绊脚时,EstimatorNet 的速度估计明显失准,而 CENet 因 β-VAE 自编码带来的正-反向动力学联合学习,估计误差显著更小,帮助机器人安全完成爬楼。

  • 真实世界长距离行走(Fig. 6/7):

    • Course A(校园内草坪,多坡地与可形变地形):全长 430m,含楼梯与可形变斜坡;在雨后湿滑条件下测试,机器人脚部曾被厚植被缠绕,通过增大关节功率脱困,湿滑楼梯与泥泞斜坡均未受影响地通过。
    • Course B(校园内山丘):全长 465m,累计爬升达 22m,由沥青路面、碎石与坡道组成;测试正值夏季,前腿电机因持续爬坡容易过热进入保护模式,需人工降速指令;最终 10 分钟内完成全程并到达山顶。
    • 两条轨迹均由机身顶部的 10Hz RTK-GPS 记录。
    • 项目主页补充(论文正文未提及):Course B 最大坡度达 36°;DreamWaQ 被 KAIST “DreamSTEP” 战队用作四足机器人运动控制器,赢得 ICRA 2023 Autonomous Quadrupedal Robot Challenge 冠军,并获 CNN Tech for Good、KBS、IEEE Spectrum Video Friday 等媒体报道。

创新点与影响

  • 贡献:(1) 用非对称 actor-critic 一次性联合训练替代传统 teacher-student 两阶段蒸馏,让策略在训练中隐式”想象”高度图/摩擦力/扰动力等特权地形信息,避免 BC 蒸馏对学生性能设下的天花板与两阶段训练的数据低效;(2) 提出 CENet——共享编码器同时输出速度估计头与 β-VAE 上下文头,联合学习正-反向动力学以提升状态估计精度,且推理时同步运行、架构简化;(3) 提出 AdaBoot,用 episodic reward 的变异系数自适应调节 bootstrap 概率,解决”训练早期该不该信任估计器输出”的两难;(4) 首次证明比 ANYmal 小得多的 Unitree A1,在纯本体感受、零外感传感器下,可持续走过山地与庭院等真实非结构化地形超过 400m。
  • 改变了什么:把”非对称 actor-critic 隐式想象特权信息、单阶段联合训练”确立为纯本体感受运动学习的一条可行路线,区别于此前主流的显式两阶段 teacher-student 蒸馏;论文的 CENet 联合估计设计与 AdaBoot 自适应 bootstrapping 思路被同组后续工作(如同作者的 “Robust Recovery Motion Control for Quadrupedal Robots via Learned Terrain Imagination”,RSS 2023 workshop)延续。
  • 论文自陈局限:DreamWaQ 的地形适应机制依赖”先用腿撞上障碍物”才能触发适应,难以应对如高台阶等更复杂结构;作者明确指出后续需要把外感知(exteroception)重新引入运动系统,在接触障碍物前就完成步态规划。

原始链接

一手源存档(sources/)

  • dreamwaq—project-site — 项目主页文本快照(摘要、实验视频清单、ICRA 2023 挑战赛夺冠、媒体报道、相关后续工作)
  • 论文全文 PDF:arxiv.org/pdf/2301.10602(arXiv 原文 PDF,不入 git)