一句话定位

VLFM 是一个零训练(zero-shot)的物体目标导航(ObjectNav)框架:机器人边走边用深度图建占据栅格找「前沿」(explored/unexplored 边界),同时用冻结的 BLIP-2 直接对 RGB 观测算「这张图像和 Seems like there is a <target> ahead. 这句话有多像」的余弦相似度,把这个分数铺成一张语言接地的价值地图(value map),每一步选价值最高的前沿点走,检测到目标物体后收敛过去——不训练任何任务专用策略,在 Gibson/HM3D/MP3D 三个 Habitat 基准上把当时的零样本 SOTA 依次刷高 11.7%/8.1%/3.3% SPL,在 Gibson、MP3D 上甚至超过为该任务专门训练过的监督方法;并在 Boston Dynamics Spot 机器人上完成了真实办公楼的部署。ICRA 2024 最佳认知机器人论文。

背景与定位

ObjectNav 要解决的问题是:机器人只凭第一视角 RGB-D 和里程计,去一个从没见过的环境里找一个指定类别的物体(如「找一张床」),成功判据是在 500 步内、距目标 1 米内喊停。传统做法要么是端到端强化学习/模仿学习策略(在训练类别上过拟合、只认闭集类别),要么是先建语义地图再规划(同样绑定训练类别)。VLFM 站在零样本语义导航这条线上,前身工作包括 CLIP on Wheels(CoW,探索最近前沿直到 CLIP/开放词表检测器发现目标)、LGX 和 ESC(把附近物体检测结果转成文字喂给 LLM 去判断哪个前沿更可能有目标)、SemUtil(用 BERT 把前沿附近物体类别名嵌入后与目标类别名比较)。

VLFM 的关键分歧点是:不把视觉先转成文字再做语义推理,而是用视觉-语言模型(BLIP-2)直接从 RGB 图像和文本 prompt 算相似度分数,省掉「检测器把画面转成物体列表」这一道信息瓶颈,也省掉调用 LLM/BERT 的额外算力(论文强调 BLIP-2 可以直接跑在一台消费级笔记本上,不需要连远程服务器)。范式命名:frontier-based exploration + VLM 直接图文相似度打分的价值地图,用来替代前人依赖 LLM/BERT 做纯文本语义推理这一步。实验平台复用 Habitat 模拟器与其上的 Gibson/HM3D/MP3D 数据集;与同期同样面向导航的基础模型路线(如 ViNT 用图像目标做跨本体导航基础模型)相比,VLFM 走的是完全不训练导航策略本身、只把预训练 VLM 接到经典前沿探索框架里的路子。

模型架构

VLFM 不是端到端网络,而是一套模块化流水线,分初始化、探索、目标导航三个阶段:

  • 前沿地图(frontier map):用深度图 + 里程计把当前观测转成点云,滤掉过矮/过高的点作为障碍,投影到 2D 栅格得到占据地图;标出已探索/未探索区域的边界,取边界中点作为候选「前沿」(frontier waypoint)。
  • 价值地图(value map,核心贡献):与前沿地图同尺寸的 2D 栅格,但有两个通道——语义价值通道和置信度通道。
    • 语义价值:用冻结的 BLIP-2(适配自 CLIP 的图文检索模型)计算当前 RGB 观测与文本 prompt "Seems like there is a <target_object> ahead." 的余弦相似度,作为该视野扇形区域(camera FOV 的锥形 mask,并用深度图剔除被障碍物遮挡的部分)内像素的语义值。
    • 置信度:像素在相机视野内离光轴的角度 θ 越大,置信度越低(光轴上置信度为 1,视野左右边缘为 0,具体形式是关于 θ 与相机水平 FOV 的函数)。当同一片区域被重复观测到时,新旧语义值按各自置信度做加权平均融合(而不是直接覆盖或简单平均),新置信度也做类似的偏向高置信度一方的加权更新。
    • 每一步:① 生成当前姿态下的 FOV 锥形 mask;② 用深度图排除被遮挡区域;③ 用 BLIP-2 算相似度更新语义值通道;④ 用置信度加权平均融合新旧值。
  • 物体检测:COCO 类别用 YOLOv7,其余开放词表类别用 Grounding-DINO(YOLOv7 在 COCO 类上检测效果更好,其余交给 Grounding-DINO 的开放词表能力);检测到目标后用 Mobile-SAM 从边界框中抠出轮廓,结合深度图找到目标上离机器人最近的点作为导航终点。
  • 路点导航(waypoint navigation):用 Point Goal Navigation(PointNav)策略把机器人从当前位置带到「下一个前沿点」或「检测到的目标点」——策略只吃深度图和相对目标的距离/朝向,不用 RGB,用 **Variable Experience Rollout(VER)**这套分布式深度强化学习算法训练。作者强调这一模块是可插拔的:真实机器人部署时直接换成 Boston Dynamics 官方 API,不用 PointNav。
  • 所有组件(BLIP-2、YOLOv7、Grounding-DINO、Mobile-SAM、PointNav 策略)均为预训练/冻结,VLFM 本身不做任何联合训练或微调,是纯粹的**推理时组合(inference-time composition)**架构。

数据

VLFM 不需要任何任务专用训练数据——BLIP-2、YOLOv7、Grounding-DINO、Mobile-SAM 全部使用各自公开发布的预训练权重,直接零样本调用。唯一需要训练的组件是 PointNav 路点跟踪策略:

  • 训练数据:HM3D 数据集的 train split(场景,非 ObjectNav 任务标注),PointNav 是纯几何任务(给定相对坐标走过去),不需要语义标注,动作序列由 RL 自我探索产生,不依赖人工示范。
  • 评测数据(非训练,仅用于测试 VLFM 整体表现):
    • Gibson ObjectNav 验证集(SemExp 版本):1000 episodes,5 个场景
    • HM3D 验证集:2000 episodes,20 个场景,6 个物体类别
    • MP3D 验证集:2195 episodes,11 个场景,21 个物体类别
  • 论文指出 MP3D 场景视觉保真度明显低于 HM3D,而 Gibson 场景经过人工修复、没有空洞/伪影——这是 VLFM 在三者上表现差异的部分原因(见评测部分)。

训练方法

VLFM 本身没有任务级别的训练/微调步骤——它是纯推理时流水线,唯一的训练发生在 PointNav 子策略上:

  • PointNav 策略训练:用 VER(Variable Experience Rollout,一种分布式 on-policy 深度强化学习算法)训练,超参数与 VER 原论文一致;4 张 GPU、每张 64 个 worker,训练 25 亿步(2.5 billion steps),耗时约 7 天。策略只用深度图 + 相对里程计(无 RGB)。
  • 价值地图更新规则(消融验证,见评测部分):像素级新旧值融合方式对比了「直接覆盖」「无权重平均」「置信度加权平均」三种,最终采用置信度加权平均。
  • 文本 prompt 设计:固定模板 "Seems like there is a <target_object> ahead.",未做 prompt 搜索/调优的消融披露。
  • 动作空间move_forward(0.25m)、turn_left/turn_right(30°)、look_up/look_down(30°)、stop;成功判据为 500 步内在目标 1 米范围内调用 stop

Infra(训练 / 推理工程)

  • PointNav 训练算力4 GPU(型号未披露)、每 GPU 64 个并行 worker,训练 2.5B 步、约 7 天
  • VLFM 本体(BLIP-2 + YOLOv7 + Grounding-DINO + Mobile-SAM)推理:论文未披露仿真评测阶段具体的 GPU 型号/FPS/延迟数字。
  • 真实机器人部署(Spot):全部模型(BLIP-2、Grounding-DINO、Mobile-SAM、外加深度估计用的 ZoeDepth)加载并实时运行在一台配备 RTX 4090 MaxQ Mobile GPU(16GB 显存)的笔记本电脑上;因夹爪相机深度感知范围有限,用 ZoeDepth 从 RGB 估计深度图来近似目标路点距离,机身自带深度相机仍用于前沿探索的障碍检测;路点跟踪不用 PointNav 而是调用 Boston Dynamics 官方 API。控制频率/端到端延迟数字未披露。

评测 benchmark

主结果(Table I,零样本 vs. 监督训练方法对比,指标为 SPL / SR,单位 %)

方法训练方式Gibson SPL/SRHM3D SPL/SRMP3D SPL/SR
PONI(监督)ObjectNav41.0 / 73.612.1 / 31.8
PIRLNav(监督,77k 人类示范+RL)ObjectNav27.1 / 64.1
RegQLearn(监督)ObjectNav31.3 / 63.7
SemExp(监督)ObjectNav33.9 / 65.7
ZSON(零样本,图像目标迁移)ImageNav12.6 / 25.54.8 / 15.3
CoW(零样本)3.7 / 7.4
ESC(零样本,LLM 文本推理)22.3 / 39.214.2 / 28.7
SemUtil(零样本,BERT 文本推理)40.5 / 69.3
VLFM(本文,零样本)52.2 / 84.030.4 / 52.517.5 / 36.4
  • 相较此前零样本 SOTA:Gibson 上比 SemUtil +11.7% SPL / +14.7% SR;HM3D 上比 ESC +8.1% SPL / +13.3% SR;MP3D 上比 ESC +3.3% SPL / +7.7% SR
  • 在 Gibson、MP3D 上甚至超过专门训练的监督方法:Gibson 上比 SemExp +19.2% SPL / +19.0% SR;MP3D 上比 PONI +5.4% SPL / +4.6% SR
  • HM3D 上唯一略输给的是 PIRLNav(SR 低 11.6 个百分点,但 SPL 反高 3.3 个百点)——PIRLNav 用 77k 条人类示范做过模仿学习+RL 微调、且能上下楼梯,而 VLFM 完全零样本、且因里程计不提供楼层坐标而无法处理跨楼层导航:论文披露因此在 HM3D 失败 14.6%、MP3D 失败 9.6% 的 episode(均因需要爬楼梯才能找到目标)。

消融:价值地图融合方式(Table II,三个数据集 SPL/SR)

融合方式GibsonHM3DMP3D
Replacement(直接覆盖)48.0 / 76.126.5 / 44.516.6 / 31.7
Unweighted avg.(等权平均)50.9 / 83.030.0 / 51.817.1 / 35.0
Weighted avg.(置信度加权,本文采用)52.2 / 84.030.4 / 52.517.5 / 36.4

置信度加权平均在三个数据集上都优于另外两种融合方式。

真实世界部署:在 Spot 机器人上完成办公楼定性演示(microwave/potted plant/toilet 等目标),论文未报告真实世界的量化成功率/SPL 数字,只给出定性视频与失败模式讨论(对检测器误检敏感、对语义线索稀疏的同质化环境敏感,如空荡办公室里从远处找厕所较难)。

创新点与影响

  • 用 VLM 图文相似度直接替代「检测转文字→LLM/BERT 语义推理」这条链路:此前 LGX/ESC/SemUtil 都要先把视觉观测转成文字(物体检测标签),再靠 LLM 或 BERT 做纯文本推理评估前沿;VLFM 指出这一步转换本身是信息瓶颈,改用 BLIP-2 直接对 RGB 图像和文本 prompt 打分,同时省去了对远程 LLM 服务器的依赖,模型可以整体跑在一台消费级笔记本上。
  • 置信度加权的时序融合价值地图:把单帧 VLM 打分转成一张可持续更新、空间接地的地图表示,用视角几何(离光轴角度)导出的置信度做加权平均,消融证明比直接覆盖或等权平均更好。
  • 零训练即超越有监督基线:在 Gibson、MP3D 上不仅刷新零样本 SOTA,还超过专门为 ObjectNav 训练过的监督方法(SemExp、PONI),说明预训练 VLM 的通用语义先验足以替代任务专属训练在这类基准上的收益。
  • 从仿真到真实机器人的零样本迁移:VLFM 各组件均基于大规模真实世界数据预训练(而非纯仿真训练),因此可以直接部署到 Boston Dynamics Spot 上完成真实办公楼导航,是论文强调的「零样本方法更易部署到真实世界」这一论点的具体证据。
  • 作者自陈局限:(1) 假设目标物体在机器人默认相机高度下可见,不会主动转头、开抽屉等交互式搜索;(2) 价值地图里的语义信息是任务专属的(每次任务重新构建),无法在同一张地图上连续执行多个不同目标的语义导航任务,也无法直接服务于需要语言指定路径的 vision-language navigation 这类任务;(3) 因缺乏楼层坐标,当前实现只支持单层建筑,在需要上下楼梯的 episode 上系统性失败(HM3D 14.6%、MP3D 9.6%);(4) 对目标检测器的误检没有额外过滤,在语义线索稀疏的同质化环境中表现下降。
  • 该论文获 ICRA 2024 认知机器人方向最佳论文,此前在 CoRL 2023 Language and Robot Learning workshop 展示过。

原始链接

一手源存档(sources/)