一句话定位

ETH Zurich Robotic Systems Lab(Pascal Roth、Julian Nubert、Fan Yang、Marco Hutter;Mayank Mittal 同时挂靠 NVIDIA)提出的端到端局部路径规划器:用两个独立 ResNet-18 分别编码深度图与语义图(30 类语义按可通行性编码进 RGB 色彩空间,而非 one-hot),融合目标位置嵌入后由轻量 CNN+MLP 输出稀疏关键点路径与碰撞概率,训练用 Imperative Learning(Bi-Level Optimization:网络权重与轨迹优化器联合端到端优化,针对可微语义代价图直接优化规划任务目标而非做逐帧监督)。纯仿真训练(Matterport3D/CARLA/NVIDIA Warehouse,约 8 万条起止点对),零真实数据,零样本部署到 ANYmal 四足机器人,相比纯几何基线 iPlanner 语义可通行性代价平均下降 38.02%。2023 年 10 月挂 arXiv,2024 年发表于 ICRA。

背景与定位

本文直接建立在同组 Yang et al. 的 iPlanner(RSS 2023)之上——iPlanner 首次把 Imperative Learning 范式引入局部路径规划,用可微轨迹优化器(TO)做 Bi-Level Optimization 端到端训练规划网络,但仅用深度图作输入,纯几何域,且论文自述”需要真实世界数据弥合仿真-真实差距才能安全应用”。ViPlanner 的核心动机是指出纯几何规划的两个盲区:(1) 无法区分几何外观相同但可通行性不同的地形(如泥地 vs 混凝土);(2) 会把楼梯等”几何上是障碍、实际可通行”的结构误判为障碍物。本文通过引入语义图输入、重新设计轨迹损失(新增考虑机器人宽度的可通行性损失、新增高度损失)、以及全自动化的仿真数据生成流水线(Halton 序列采样替代 iPlanner 依赖人工路径的随机位姿采样),首次让基于 Imperative Learning 的规划器实现零样本 sim-to-real(不需要真实数据混入训练,这是相对 iPlanner 与同类 RL 方法 [8] Hoeller et al. 的直接改进)。

同一实验室的感知式行走线路——learning-robust-perceptive-locomotion-wild(Miki et al., Science Robotics 2022)用教师-学生蒸馏训练行走层面的地形适应,anymal-parkour-agile-navigation(Hoeller/Rudin et al., 2023)在此基础上做跑酷级分层导航——都依赖高程图(elevation map)表示地形;本文与之路线不同,直接用逐帧深度+语义图像做端到端规划,不构建全局或局部高程图,作者称这一设计能处理高程图无法表达的场景(如悬空障碍下的可通行空间)。另一条同期视觉导航路线——vint-foundation-model-visual-navigation/nomad-goal-masked-diffusion-navigation(Berkeley/Stanford,面向轮式机器人的目标图像条件导航基础模型)——解决的是”给一张目标图像找路”的拓扑导航问题;本文解决的是给定度量目标点、逐帧避障穿行复杂地形的局部规划问题,两条线关注点不同、互补。归类 locomotion-nav

模型架构

两阶段流水线:第一阶段是感知+规划网络(推理时唯一激活的部分),第二阶段是仅训练时使用的轨迹优化器(Trajectory Optimizer, TO,沿用 iPlanner 的可微 TO 公式,本文未重新展开推导)。

感知网络(Perception Networks)

  • 深度图 D_t 与语义图 S_t 各配一个独立 ResNet-18,从头训练、不共享权重,输出嵌入 O^D, O^S ∈ R^{C_I×M}(具体通道数 C_I、空间维度 M 论文未给出数值,标注为未披露)。
  • 推理时两路测量先统一变换到同一相机坐标系;语义图 S_t 由单独的语义分割网络(Mask2Former,实验部分详述)从原始 RGB 实时生成,训练时则直接用仿真渲染的语义标签图。

语义编码(30 类 RGB 色彩空间编码)

  • 不用 one-hot,而是把 30 个导航常见语义类别按可通行性分组,直接编码进 RGB 色彩空间,使可通行性相近的类别在色彩空间中也相近:
    • c_free(可通行):人行道、人行横道、地板、楼梯
    • c_mid1:砂砾、沙地、雪地
    • c_mid2:地形(草地、泥地)
    • c_mid3:道路
    • c_obs(障碍,四组):人/动物/车辆/火车/摩托车/自行车;建筑/墙/栅栏/桥/隧道/家具/树/水面;柱子/交通标志/红绿灯/长椅;天空/天花板/未知
    • 代价值范围 0–2。

目标嵌入与融合

  • 目标位置 p_t^G 经一个线性层映射为高维嵌入 O_t^P ∈ R^{C_G×M}(C_G ≥ 3,具体数值未披露),与 O^D、O^S 拼接得到组合嵌入 Ô_t ∈ R^{(2C_I+C_G)×M},作为规划网络输入。

规划网络(Planning Network)

  • 轻量 CNN + MLP,两个输出头:
    • 路径头:预测稀疏关键点路径 K_t ∈ R^{n_k×3}(关键点数 n_k 未披露具体数值),作为轨迹优化器的输入;
    • 碰撞概率头:估计路径碰撞风险 µ,作为安全冗余(避免单纯提高障碍违规损失导致规划过度保守)。仅碰撞概率 <δ_µ=0.5 的轨迹在线上执行。

训练时轨迹损失(仅训练阶段,推理不需要)

  • 总损失 L(τ) = C(τ,µ)(碰撞项,BCE)+ T(τ)(轨迹项);T(τ)=αT^T+βT^G+γT^M+δT^H,其中 T^M 沿用 iPlanner 的运动损失,本文新增/重构了 T^T、T^G、T^H:
    • 可通行性损失 T^T(新,考虑机器人物理宽度):不仅在路径中心点 p_i^K 处评估代价图,还在垂直路径方向 ±机器人宽度 w^R 处各评估一次,三点代价均值作为损失——相比 iPlanner 只用中心点的近似,能感知机器人整体宽度是否会蹭到障碍。
    • 目标损失 T^G(重构,对数缩放):T^G=log(‖p_n^K−p_i^G‖₂+1.0),限制远距离目标点对损失的过大影响。
    • 高度损失 T^H(新):约束路径高度维持机器人基座高度 h^R,避免规划出”绕障碍上方/下方穿过”这类不现实的机动。
  • 语义代价图 M 仅训练时构建:环境网格化后按类别赋代价值,先做高斯滤波去除分类误差、再用带符号距离场梯度平滑类别边界、抑制大片同代价区域的梯度消失问题(如户外大范围空地)。

数据

纯仿真、全自动生成,零真实训练数据。

  • 仿真平台:NVIDIA Omniverse,机器人本体用 ANYmal + Orbit 框架提供的预训练 RL 行走策略(非本文训练内容)。
  • 环境来源与规模:11 个 Matterport3D 室内场景(均值约 36×33m)+ 1 个 CARLA 城市户外场景(400×400m)+ 3 个 NVIDIA Warehouse 仓库场景(均值约 25×35m);作者为把这两个数据集接入 Omniverse 自行开发了新插件。
  • 起止点对生成(约 8 万对):不同于 iPlanner 依赖人工预定义路径附近的随机位姿采样,本文用 Halton 序列在环境内可达位置全自动采样相机视点,并按最大化可通行空间覆盖率的角度渲染图像;目标点随机放置在采样的相机中心点上,可达性通过在所有中心点间建图、剔除穿越高代价区域的连接来判定;数据生成流水线可配置目标点相对相机视场角(FoV)的分布比例,以保证训练时障碍规避信号充分。
  • 配比:三类环境(11 Matterport + 1 CARLA + 3 Warehouse)共约 80k start-goal pairs,论文未进一步拆分各环境的具体条数占比。
  • 真实数据:训练阶段完全不用;唯一涉及真实数据的是推理时的语义分割网络(Mask2Former)在苏黎世当地采集的小规模图像集上做了微调,用于把真实 RGB 图转成语义图,规划器本身未见过任何真实数据。

训练方法

  • 目标函数:Bi-Level Optimization(BLO)——外层优化网络权重 θ,内层由可微轨迹优化器(TO,沿用 iPlanner 公式)求解给定代价图下的最优轨迹,两者联合端到端优化,这是 Imperative Learning 范式的核心(相比传统 IL/RL,不需要专家演示、不需要在线试错采样奖励)。
  • 优化器:SGD + 学习率调度 + early-stopping。
  • 对照训练:iPlanner 基线在本文的新数据生成流水线上从头重新训练(而非直接用作者原始 checkpoint),保证与 Ours(Geom)/Ours(Sem) 数据同源可比;Ours(Geom) 只用深度输入,Ours(Sem) 融合深度+语义输入,用于消融语义信息的贡献。
  • 语义代价因子范围 0–2(见”模型架构”)。

Infra(训练 / 推理工程)

  • 训练硬件:单张 NVIDIA RTX 3090,训练耗时约 6 小时。GPU 数量、并行策略、混合精度设置论文未披露(单卡训练,未提及分布式)。
  • 推理硬件:ANYmal 机器人搭载 NVIDIA Jetson Orin AGX
  • 推理频率:语义分割网络(Mask2Former)异步运行,约 3Hz 生成语义图;规划器复用最近一次语义图,独立以 10Hz 运行,两者解耦以避免语义分割延迟拖慢规划频率。

评测 benchmark

仿真定量对比(Table II,三环境各 500 条随机起止点、iPlanner vs Ours(Geom) vs Ours(Sem),指标为几何代价图损失 / 语义代价图损失 / 到达目标率(≤0.5m 阈值)):

场景方法Geom. LossSem. LossGoal Reached
Matterport3DiPlanner1.77 ± 0.3791.29 ± 0.37655.37%
Matterport3DOurs (Geom)1.76 ± 0.5431.27 ± 0.53871.05%
Matterport3DOurs (Sem)1.70 ± 0.4121.19 ± 0.41071.60%
CARLAiPlanner1.15 ± 0.6531.17 ± 0.66979.59%
CARLAOurs (Geom)1.03 ± 0.5791.06 ± 0.70895.91%
CARLAOurs (Sem)1.00 ± 0.6020.69 ± 0.53087.75%
WarehouseiPlanner0.90 ± 0.5441.793 ± 1.27486.56%
WarehouseOurs (Geom)0.82 ± 0.4361.641 ± 1.28388.72%
WarehouseOurs (Sem)0.71 ± 0.3960.96 ± 1.04185.58%
  • 几何域对比(Ours(Geom) vs iPlanner,同数据训练):两代价图损失均一致下降,Matterport3D 与 CARLA 上到达目标率平均提升约 16 个百分点(作者将其归因于可通行性损失中引入机器人宽度、以及代价图平滑方式的差异,而非语义信息)。仓库环境空间开阔、路径本就容易到达,提升不明显。
  • 语义域效果(Ours(Sem) vs iPlanner):CARLA 与 Warehouse 上语义损失平均下降 38.02%(摘要与正文一致口径),因为道路等语义障碍在几何上不可见,仅几何规划器无法感知;同时 Ours(Sem) 在 CARLA/Warehouse 上到达率略低于 Ours(Geom)(如 CARLA 87.75% vs 95.91%),作者解释为语义感知让规划器对高代价区域(如马路、仓库工作区)更保守,而非无视约束直冲目标。结论部分另提到”语义融合最多使语义可通行性损失下降约 42%“(较正文 38.02% 的表述略高,可能取自单一环境的最大降幅而非平均值,论文未明确给出该数字对应哪个环境)。
  • 真实世界实验(定性,无量化成功率表):(1) 苏黎世城市户外场景,规划器正确选择过人行横道再沿人行道前进,能识别几何上不可见但语义上高代价的区域(如马路);(2) 楼梯场景,iPlanner 因把楼梯误判为障碍、碰撞概率估计 >0.98(超过 δ_µ=0.5 阈值)而拒绝执行、导致机器人停止,ViPlanner 正确识别楼梯可通行并完成导航。两组实验均为纯仿真训练后零样本部署,未给出数值化成功率或轨迹跟踪误差。
  • 基线仅对比 iPlanner 一种几何规划器;未与同类语义感知规划方法(如论文引用的 Frey et al. Wild Visual Navigation [26])做直接数值对比。

创新点与影响

贡献(论文自述):(1) 用无监督 Imperative Learning 方法构建语义感知局部规划器;(2) 通过在端到端训练中融合预训练语义分割网络输出与几何输入,实现从仿真到真实世界的零样本迁移;(3) 在仿真与真实环境(ANYmal 四足机器人)中对比几何基线 iPlanner 做定量与定性评测;(4) 开源代码,含可扩展至室内外环境的数据生成与规划器评测流水线(基于 NVIDIA Omniverse)。

改变了什么:把 Imperative Learning 范式从纯几何域(iPlanner)扩展到几何+语义多域,且是首个在该范式下摆脱”需要真实数据弥合 sim-to-real gap”限制的规划器——通过重新设计的可通行性/目标/高度损失与自动化 Halton 采样数据生成,使规划器能纯仿真训练后直接部署真机,并能像楼梯这类”几何看似障碍、实际可通行”的场景做出正确判断,这是纯几何规划器结构性做不到的。

论文自陈局限(结论部分):(1) 当前语义代价值为手工设定(Table I 的固定代价),未来计划去除手工代价、改用开放词汇(open-vocabulary)表示使代价图更通用;(2) 尚未系统评估规划器对语义分割误差的敏感性;(3) 规划器逐帧决策、无显式记忆机制,未来计划引入记忆以增强一致性、避免”忘记”曾经感知到但当前视野外的障碍。

原始链接

一手源存档(sources/)