一句话定位

CityNav 是首个基于真实城市 3D 扫描(剑桥 + 伯明翰,SensatUrban 点云)的大规模空中视觉-语言导航(aerial VLN)数据集:32,637 条人类无人机飞行示范轨迹配自然语言目标描述,覆盖 4.65 km²;论文同时提出把 OpenStreetMap 地标信息编码成「地理语义地图(GSM)」喂给三个基线模型,让 test-unseen 上 AerialVLN 的成功率从 1.79% 提到 6.72%,但离人类水平(~88% SR)仍有巨大差距。

背景与定位

VLN 范式从室内图结构导航(R2R/REVERIE/SOON 等)扩展到室外地面导航(TouchDown、Talk2Nav),再到空中导航;此前的空中 VLN 数据集要么是虚拟小场景(LANI)、卫星图 + 人机对话(AVDN),要么是合成 3D 城市(AerialVLN)。CityNav 是第一个把空中 VLN 搬到真实城市 3D 扫描数据上的数据集,逼迫 agent 理解真实地标名称/位置与目标之间的空间关系,而不是记忆合成场景的固定布局。vault 内可与地面/腿式 VLN 代表 navid-video-vlm-vlnnavila-legged-robot-vla-navigation 对照阅读;目标描述直接复用同一作者组此前发布的 CityRefer(NeurIPS 2023,35,196 条描述 / 5,800 个物体,基于同一 SensatUrban 点云做 3D 视觉定位,本 vault 暂无独立页面)。范式关键词:real-world aerial VLN、geographic semantic map、imitation learning from human demonstrations。

模型架构

CityNav 本体是「仿真环境 + 数据集 + 三个基线策略 + 一个地图辅助表示」,不是单一模型:

CityFlight 仿真环境

  • 基于 SensatUrban 真实 3D 点云渲染,用开源 WebGL 点云渲染器 Potree 实现网页端可视化,支持众包手动操作采集。
  • Agent 状态为 5D 位姿 p=(x,y,z,θ,ψ)(空间坐标 + 俯仰/偏航角);飞行高度上限 200 米
  • 离散动作空间 A={前进(5m)、左转(30°)、右转(30°)、上升(2m)、下降(2m)、停止},与 OpenStreetMap 实时同步显示,支持”3D 坐标 ↔ 真实世界 2D 地图坐标”互转、以及”按地标名取地图片段”两个查询函数。

三个基线导航策略(第 4.1 节,均以模仿学习方式训练)

  • Seq2Seq:GRU 循环策略,ht=GRU([zRGB, zdepth, ztext], ht-1);zRGB/zdepth 各由一个 ResNet-50(分别 ImageNet 预训练、PointGoalNav 预训练)编码,ztext 由 LSTM 编码;动作经线性层从 ht 预测。
  • CMA(Cross-Modal Attention):在 Seq2Seq 基础上加 Bi-LSTM + 跨模态注意力模块,融合 RGB/depth/text 三路表征。
  • AerialVLN:在 CMA 上引入 look-ahead guidance(前瞻步数=10),训练时让策略学习朝未来若干步方向移动,是当时空中 VLN 的 SOTA。

地理语义地图(GSM)辅助表示(第 4.2 节)

  • 5 个类别通道:当前视野、已探索区域、地标、潜在目标、周围物体。当前视野/已探索区域来自 GNSS 坐标;地标是从 OpenStreetMap 检索的地物 segment;潜在目标与周围物体由 Grounding DINO 检测;地标/物体名称由 GPT-3.5 在导航开始前从描述文本中抽取。
  • 编码器 E:5 层 2D 卷积(通道 32→64→128→64→32,kernel 3、stride 1、padding 1,每层接 ReLU + max-pooling),输入 224×224,输出 zmap。
  • 集成方式:zmap 拼接进 Seq2Seq/CMA/AerialVLN 三个模型的 GRU 输入序列 [zRGB, zdepth, zmap],即插即用不改动基线主干。

GitHub 官方代码库额外披露的「MGP」管线(与 arXiv v3 正文的 GSM 描述不完全一致,见下方存档):官方代码仓 citynav-arxiv 的 README 描述的默认训练目标是一个称为 MGP(Map-based Goal Predictor) 的模型,在 GroundingDINO+GPT-3.5 之外还接入了 MobileSAMSet-of-Mark(SEEM+Semantic-SAM+segment-anything) 以及 LLaVA-1.6-34B(用 set-of-mark prompting 做候选坐标精炼);其 README 给出的 test-unseen checkpoint 表现(MGP w/ HD:NE 93.8、SR 6.38%、OSR 26.04%、SPL 6.08)优于 arXiv 正文 Table 2 中 AerialVLN+GSM 的数字(NE 85.1、SR 6.72%、OSR 18.21%、SPL 5.16,OSR 反而更低)。由于该 LLaVA/MobileSAM 管线未出现在已抓取的 arXiv v3 全文中,此处仅作为 GitHub 一手来源的独立记录,不代表 arXiv 论文正文的方法。

数据

  • 规模:32,637 条人类示范轨迹(描述-轨迹一一对应),覆盖 4.65 km²,来自 剑桥(Cambridge)与伯明翰(Birmingham) 两座真实城市的 SensatUrban 3D 扫描点云。
  • 切分:train 22,002 条 / val-seen 2,498 条(与 train 共享同 24 个场景);val-unseen 2,826 条(4 个未见场景);test-unseen 5,311 条(6 个未见场景)。
  • 目标描述来源:复用 CityRefer 数据集(35,196 条自然语言表达 / 5,800 个物体,同样标注在 SensatUrban 点云上),每条描述至少含一个地标并描述目标与周边物体的空间关系。
  • 目标类型分布:48.3% 建筑、40.7% 汽车、7.4% 地面、3.6% 停车场。
  • 任务设定:起点在目标 500 米半径内随机选取,高度随机 100–150 米;目标到起点距离分布在 50–500 米(典型约 200 米);成功判据为在目标 20 米球形半径内停止。
  • 轨迹长度:平均 240 步动作,同类数据集中最长(AVDN 49 步、AerialVLN 230 步);论文 Table 1 对比:CityNav 总指令长度 17.8M(AerialVLN 5.6M、AVDN 0.9M、LANI 0.1M),词表 6.4k(AerialVLN 4.5k)。
  • 采集流程:通过 Amazon MTurk171 名通过资格测试的标注员参与,采用三阶段质控——资格测试(剔除未达目标或耗时超均值 2 倍者)→ 初次采集(18.4% 轨迹未达成功标准被剔除)→ 补采(补采后仍有 7.2% 目标未达标被彻底移除)。共耗费 711 个工时、时薪 $12.83,总成本 $9,123
  • 人类导航策略统计(附录):人类示范轨迹(HD)直接飞越地标的比例为 36.3%(最短路径 SP 为 24.6%);20 米半径内经过地标 HD 35.5% vs SP 24.0%;40 米半径内 HD 62.5% vs SP 51.9%——表明人类会主动绕地标飞行以缩小搜索范围,这也是 HD 训练数据鲁棒性更强的原因之一。
  • 平均飞行高度:人类操作轨迹平均 3D 高度 35.96 米,普遍高于建筑物高度、临近目标时逐渐降低。

训练方法

  • 目标:模仿学习——交叉熵动作分类损失;AerialVLN 额外用 MSE 损失度量目标点与当前位置的距离。
  • 主训练配置(正文 §5.1):三个基线(含/不含 GSM)均在 train 集上用 Adam5 个 epoch、学习率 1.5×10⁻³、batch size 12 训练;RGB/depth 编码器分别用 ImageNet 预训练和 PointGoalNav 预训练的 ResNet-50(权重冻结与否论文未明确区分说明)。
  • AerialVLN look-ahead 步数:10(附录 C.3)。
  • 人类示范 vs 最短路径消融(Table 3,均用 AerialVLN+GSM):8k 规模下 HD(NE 92.8/SR 5.27/OSR 15.59/SPL 5.21)优于 SP(NE 99.1/SR 4.43/OSR 13.49/SPL 4.36);22k 规模下差距更大——HD(NE 85.1/SR 6.72/OSR 18.21/SPL 5.16)vs SP(NE 95.1/SR 4.96/OSR 15.22/SPL 4.85),说明数据量增加时 HD 的优势被放大。
  • 噪声鲁棒性(Table 4):对 agent 位置加 ±100 米高斯噪声后,HD 训练的模型(NE 95.0/SR 4.92/OSR 12.77/SPL 4.79)仍明显优于 SP 训练模型(NE 123.1/SR 2.37/OSR 6.88/SPL 2.35),差距随噪声进一步拉大。
  • GSM 消融(Table 5,AerialVLN+GSM 为完整版:NE 85.1/SR 6.72/OSR 18.21/SPL 5.16):去掉地标通道影响最大(NE 190.7/SR 0.60/OSR 6.94/SPL 0.56);去掉潜在目标通道次之(NE 92.8/SR 3.97/OSR 13.08/SPL 3.86);去掉周围物体通道影响最小(NE 87.5/SR 5.17/OSR 15.16/SPL 5.10)。

Infra(训练 / 推理工程)

  • 训练硬件:单张 GeForce RTX 4090 GPU(附录 C.3 明确披露);另致谢使用了 Institute of Science Tokyo 的 TSUBAME4.0 超算,但未说明具体用于哪部分实验、未披露卡数与 GPU-hours。
  • 并行 / 精度:未披露(论文未提混合精度、分布式训练细节)。
  • 推理 / 控制频率:CityFlight 是离散动作逐步 rollout 的仿真环境(每步对应一次前进/转向/升降指令),论文未报告实际 FPS、控制 Hz 或延迟数字;GSM 各检测/分割/LLM 组件(Grounding DINO、GPT-3.5)的推理耗时也未披露。
  • 边缘部署:未披露(纯仿真评测,无真机部署实验)。

评测 benchmark

主结果(Table 2,NE↓/SR↑/OSR↑/SPL↑,val-seen / val-unseen / test-unseen)

Methodval-seen NE/SR/OSR/SPLval-unseen NE/SR/OSR/SPLtest-unseen NE/SR/OSR/SPL
Seq2Seq257.1/1.81/7.89/1.58317.4/0.79/8.82/0.61245.3/1.50/8.34/1.30
Seq2Seq+GSM58.5/8.43/17.31/7.2878.6/5.13/10.90/4.6598.1/3.81/13.92/2.79
CMA240.8/0.95/9.42/0.92268.8/0.65/7.86/0.63252.6/0.82/9.70/0.79
CMA+GSM68.0/6.25/13.28/5.4075.9/4.38/9.29/3.9094.6/4.68/12.01/4.05
AerialVLN185.2/1.73/3.45/0.59192.8/1.18/2.83/0.44187.7/1.79/3.83/0.62
AerialVLN+GSM56.6/10.16/22.20/7.8972.7/6.35/15.24/5.0685.1/6.72/18.21/5.16
Human9.1/89.31/96.40/60.179.4/88.39/95.54/62.669.8/87.86/95.29/57.04

GSM 对全部三个基线在全部三个 split 上均带来一致提升,AerialVLN+GSM 综合最优;但即便如此,与人类(约 88–89% SR)之间仍是数量级差距。

类别级结果(附录 Table 6,test-unseen,AerialVLN+GSM 为例):building SR 6.52%、car SR 7.65%、ground SR 5.94%、其他 SR 3.64%;对应人类 SR 分别为 85.64%/95.39%/82.40%/76.97%——ground 与 others 类别对基线最难,GSM 能缓解但差距仍大。

灾难场景鲁棒性(附录 Table 7,模拟洪水淹没):所有模型性能均下降,但 GSM 带来的相对提升依然保持(如 AerialVLN+GSM NE 84.9/SR 6.80/OSR 18.46/SPL 6.68,仍优于 AerialVLN 的 188.6/1.46/4.65/1.38)。

数据集横向对比(Table 1):CityNav 在真实性(Real=✓)、轨迹数(32,637)、指令数(32,637)、总长度(17.8M)、词表(6.4k)等维度均超过此前空中 VLN 数据集 LANI/AVDN/AerialVLN。

创新点与影响

  • 贡献:(1) 首个基于真实城市 3D 扫描(而非合成场景)的大规模空中 VLN 数据集,32,637 条人类示范轨迹是当时同类数据集中规模最大者;(2) 提出 GSM——一种可即插即用接入现有 VLN 模型的地理语义地图辅助表示,一致提升三个代表性基线的导航表现;(3) 系统性分析人类示范 vs 最短路径训练的必要性、噪声鲁棒性、类别级表现与灾难场景泛化。
  • 改变了什么:把空中 VLN 的评测基准从合成城市(AerialVLN)迁移到真实城市尺度,逼迫模型学习真实地标名称/位置的语言 grounding;论文相关工作部分显示其后续同类研究(如 EmbodiedCity、OpenFly、CityEQA)均引用 CityNav 作为该方向的参照点。
  • 作者自述局限:数据集覆盖仅剑桥与伯明翰两城,相对全球城市规模仍有限,扩展需要降低户外 3D 扫描成本。
  • 未来方向(作者自述):探索大场景中多 agent 协同搜索目标(当前标注员各自独立作业,MTurk 上多人协同采集本身较难);将空中、地面、室内导航统一到同一框架(三者所需 3D 扫描粒度差异巨大,是主要难点)。

原始链接

一手源存档(sources/)

  • citynav-aerial-vln—project-page — 项目主页快照(概述、MGP 方法描述、BibTeX)
  • citynav-aerial-vln—github-readme — 官方代码仓 README(环境搭建、MGP/GSM 训练脚本、pretrained checkpoint 表)
  • arXiv 2406.14240 v3 全文(HTML/PDF,2025-08-02 修订版):见上方 arXiv 链接(arXiv 原文,不入 git)