一句话定位

Mobility VLA 是一个零训练、纯组合式的分层导航系统:上层让长上下文 VLM(Gemini 1.5 Pro)直接”看”一段人走过的演示导览视频(连同旁白与用户的多模态指令),在视频里指出”去哪一帧”;下层用经典结构从运动(COLMAP)离线建出的拓扑图 + 实时视觉定位 + Dijkstra 最短路 + iLQR MPC,把这个目标帧转成每一步的路点动作。在 836 m² 真实办公室里,它把此前无法解决的”复杂推理”和”多模态”指令端到端成功率做到 86% 和 90%(比基线高 26–60 个百分点)。

背景与定位

作者把”给机器人一段导览视频作为环境先验、再用自然语言/图像下达指令”的任务范式命名为 MIN(Multimodal Instruction Navigation)及其带导览视频的变体 MINT(MIN with Tours)——这是相对于经典 ObjNav / VLN(如 NaVid 走的 VLN-CE 路线)的一个新分支:VLN 类任务的指令通常直接点名物体或地点(“去沙发”),而 MINT 允许”我该把这个还回哪里?“这种不指名地点、需要常识推理,甚至”这个我不想要了,帮帮我”这种必须看图才能确定目的地的指令。

论文指出 VLM 单独解决 MINT 有两个结构性障碍:(1) 多数 VLM 的输入图像数受上下文长度限制,难以吃下大环境的完整导览视频;(2) 直接让 VLM 吐出机器人动作是它预训练分布之外的查询,零样本表现很差(RQ3 实验证实:直接输出路点动作 SR=0%)。Mobility VLA 的解法是分层解耦:长上下文 VLM 只负责语义理解与目标定位(借助 Gemini 1.5 Pro 的百万 token 上下文吃下完整视频),经典拓扑图/控制只负责把目标转成精确的度量动作——这与同期 NaVILA”中层用语言动作解耦高层语言推理与低层运动控制”的思路同源,但 Mobility VLA 更进一步:完全不训练任何网络,高层是纯 prompting,低层是纯经典 SLAM/图搜索/控制,全系统零梯度更新。

对比基线包括复现 NLMap 式的 CLIP/OWL-ViT 检索方案,以及”先把导览视频逐帧转成文字描述、再用纯文本 LLM 找目标帧”的 Text-Only 变体。

模型架构

整体是”高层长上下文 VLM + 低层拓扑图控制”的两级流水线,二者之间没有可训练的桥接网络:

  • 离线阶段——拓扑图构建:用 COLMAP(structure-from-motion)从导览视频的每一帧 fᵢ 恢复近似 6-DoF 相机位姿,构成图 G=(V,E):顶点 vᵢ 对应帧 fᵢ 及其位姿;若目标顶点在源顶点”前方”(偏离源顶点朝向 <90°)且距离 <2m,则加一条有向边。定位用自研的分层可视化定位:先用全局图像描述子做 k-近邻粗筛候选帧,再做局部特征匹配得到 2D-3D 对应,解 PnP 得到位姿 T;论文用离线精确 COLMAP 定位作为 ground truth 评估,median ATE = 0.056 m
  • 在线高层策略 h(F,N,d,I)→g:把导览视频全部帧(图像)与旁白 N 交织成一个 prompt,附加”这是你现在看到的画面”当前观测、可选的图像指令 I 和文本指令 d,一次性喂给 Gemini 1.5 Pro,模型直接返回一个整数目标帧索引 g(不生成中间自然语言链,直接吐帧号)。这是纯 zero-shot in-context 用法,Gemini 1.5 Pro 权重不做任何微调。
  • 在线低层策略 l(a|G,O,g)→a:给定目标帧对应顶点 v_g,每个时间步用当前相机观测 O 定位到起点顶点 v_s 与位姿 T,Dijkstra 求 G 上 v_s→v_g 的最短路径 S,取路径下一顶点 v₁ 相对 T 的位姿差,输出 embodiment-agnostic 路点动作 a=(Δx, Δy, Δθ)(机体系下的纵向平移、横向平移、绕竖轴旋转)。
  • 执行:轮式移动操作机器人(mobile manipulator)用基于 iLQR 的 MPC(Google 的 trajax 库)把路点动作转成轮速指令并避障。
  • 全系统无可训练的桥接层/动作头——这是与其他 VLA(如把动作离散化为 token 让 VLM 直接输出的路线)最大的架构区别。

数据

Mobility VLA 不训练任何模型参数,“数据”仅指每个部署环境一次性录制的演示导览视频(作为拓扑图与高层 VLM 上下文的输入),以及评测用的指令集与仿真重建资料:

  • 真实办公环境导览:手柄遥操作采集,所有走廊双向各走一遍,时长约 16 分钟948 帧 @ 1Hz;在第 5:28 帧标注旁白 “Temp desk for everyone”、第 7:14 帧标注 “Lewis’ desk”,用于验证个性化导航。
  • 家庭环境导览(智能手机采集):用 Google Pixel 6 手持录制,75 秒、224 帧 @ 3Hz,与机器人相机分布完全不同(验证跨传感器泛化)。
  • 评测指令:众包收集 57 条用户指令,分 4 类——Reasoning-Free (RF) 20 条、Reasoning-Required (RR) 15 条、Small Objects (SO) 12 条、Multimodal (MM) 10 条;RR 类指令不点名具体物体/地点,MM 类指令若无图像模态几乎无法确定目标。
  • 大规模仿真评测数据:用 Sony A7 IV + Rokinon 12mm 广角镜头沿办公室走廊各方向拍摄 3,244 张图像,COLMAP 求位姿与内参,训练 ZipNeRF 重建高保真数字孪生;用 [64] 的方法从 NeRF 蒸馏出网格,再在 Blender 里手工搭建碰撞网格;渲染相机与真实机器人相机内参对齐。仿真评测选取 20 条语言指令(RF/RR 各 10)× 50 个随机起点。
  • 环境覆盖:836 m² 真实办公室(人流密集、堆满架子/桌椅等杂物)+ 家庭样式环境;不涉及跨机器人本体的联合数据混合或动作标注(因为不训练策略网络)。

训练方法

本工作不训练/微调任何神经网络参数——这是它与大多数 VLA 论文的关键区别:

  • 高层 VLM(Gemini 1.5 Pro)是纯 in-context prompting:把交织的”帧+旁白+当前观测+(可选)图像指令+文本指令”序列一次性喂进模型,直接读出整数目标帧号,无需任何针对导航任务的微调或提示词工程之外的训练。
  • 低层策略完全是经典方法组合:COLMAP(离线 SfM 建图)+ 自研分层可视化定位(k-NN 全局检索 + 局部特征匹配 + PnP)+ Dijkstra 最短路 + iLQR-MPC(trajax)路点跟踪,全部无学习成分。
  • 因此没有”多阶段训练 pipeline / RL / 模仿学习 / 动作 tokenization / 蒸馏”等常规 VLA 训练要素;论文的”训练”只体现在离线为每个新环境重新跑一次 SfM 建图,属于部署时的一次性预处理而非模型训练。

Infra(训练 / 推理工程)

  • 训练算力:不适用——无参数训练,Gemini 1.5 Pro 为现成 API 调用,论文未披露其自身训练算力(不在本工作范围)。
  • 推理延迟(高层 VLM 目标查找):每次查询 10–30 秒;作者指出导览视频 token 占输入 token 的约 99.9%,理论上可以缓存以大幅提速,但当前版本每次调用都要重新上传全部 948 张导览图像。
  • 推理延迟(低层拓扑图控制)0.19 ± 0.047 秒/步(仿真 Office 环境测得),相比之下若让 Gemini 1.5 Pro 直接输出路点动作(RQ3 消融基线),每一步都要重新上传全部 948 张导览图像,耗时 25.90 ± 8.36 秒/步——单纯为了移动 1 米就要付出这个延迟,且实测该基线几乎总是输出”前进”、不响应实际相机观测(0% 成功率)。
  • 机器人本体:轮式移动操作机器人,搭载 iLQR-based MPC(trajax)执行路点动作并避障;板载算力需求”轻”,因为 VLM 推理在云端完成,机器人只需 RGB 相机。
  • 定位精度:分层可视化定位相对离线精确 COLMAP 的 median ATE = 0.056 m;当观测图像模糊或特征稀疏时定位会退化为回退到上一已知位姿(论文称这一失效未影响端到端结果,因为很快会收到清晰帧)。

评测 benchmark

以下均为论文一手实验结果。

① 真实办公室端到端(RQ1,Table 2,每类别抽 5 条指令 × 4 个随机起点,起点距目标 ≥20m)

指标RFRRSOMM
高层目标查找 SR80%80%40%85%
低层到达 SR100%100%100%100%
端到端 SR80%80%40%85%
SPL0.590.690.380.64

Small Object 类明显偏低,作者归因于导览视频分辨率不足以分辨小物体。低层到达 100% 成功率验证了拓扑图对导览视频录制数月后(物体、家具、光照均已变化)的鲁棒性。个性化验证:同样问”带我去临时工位”,因用户自称”Lewis”与”访客”分别被正确带到 7:14 帧与 5:28 帧两个不同目标。

② 大规模仿真(NeRF 重建的 Office 环境,Table 8,20 条指令×50 起点=1000 次评测)

高层目标查找 SR 90%(RF、RR 均为 90%)、低层到达 SR 100%,端到端 SR 90%,SPL 0.83(RF)/0.84(RR),累计 900 次成功端到端执行

③ 家庭环境(智能手机导览,Table 6,5 条指令×4 起点)

端到端 SR 100%,SPL 0.87——用手机随手录一段视频即可让机器人立即可用。

④ 高层方法对比(RQ2,Table 3,高层目标查找 SR)

方法RFRRSOMM
CLIP-based retrieval (NLMap 式 OWL-ViT+CLIP)35%33%25%20%
Text-Only Mobility VLA(先转文字导览再用 LLM 找帧)70%60%50%30%
Mobility VLA(本文)95%86%42%90%

⑤ VLM 与帧率消融(Table 4,高层目标查找 SR):0.2 FPS 下 GPT-4V(RF60/RR53/SO17/MM30) < GPT-4o(75/40/25/50) < Gemini 1.5 Pro(95/67/36/60);提到 1 FPS 时 GPT-4V、GPT-4o 均超出 token 限制报错,只有 Gemini 1.5 Pro(百万 token 上下文)能跑(95/86/42/90)。

⑥ 拓扑图必要性消融(RQ3,Table 5,仿真 Office):直接让 Gemini 1.5 Pro 输出路点动作(“left/forward/right”)SR=0%(几乎总输出”前进”);目标帧索引+拓扑图(本文方法)SR=90%,SPL 0.84,单步推理时间 0.19±0.047s vs 直接输出路点动作的 25.90±8.36s。

⑦ 文本 vs 多模态指令/导览消融(Table 7):Text Tour(文字导览)+GPT-4o:文本指令/图像指令均 SR 0.10;+Gemini 1.5 Pro:均 0.20。Multimodal Tour(视频导览)+GPT-4o:均超 token 限制;+Gemini 1.5 Pro:文本指令 0.40,图像指令(本文设定) 0.90——证明多模态指令必须配多模态导览视频才能发挥效果,替换成图像 caption 会显著掉点。

创新点与影响

  • 提出新任务范式 MIN/MINT:把 ObjNav/VLN 的指令空间从纯语言扩展到”语言+图像”多模态,并显式引入”用户导览视频作为环境先验”这一贴近真实用户使用习惯的设定(新买机器人时带它逛一圈)。
  • 完全组合式、零训练地解决了此前”无法用零样本 VLM 直接做导航”的问题:把 VLM 限定在其训练分布内最擅长的任务(在长视频里找一帧)、把度量级动作生成完全交给经典 SLAM/图搜索/控制,从而绕开了 VLM 直接输出动作分布外(OOD)导致的失败模式(RQ3 中 0% vs 90% 的对比是直接证据)。
  • 展示了极低部署门槛:手机拍一段视频即可用于家庭环境,且拓扑图对环境的物理变化(数月后的家具、光照差异)具有鲁棒性。
  • 验证了长上下文是解锁这一能力的关键:只有 Gemini 1.5 Pro 的百万 token 上下文能吃下完整帧率的导览视频,帧率降低或换用上下文更短的 GPT-4V/GPT-4o 都会显著掉点或直接超限。
  • 作者自陈局限:(1) 缺乏自主探索能力,依赖预录导览,未来可接入前沿探索或基于扩散的探索算法;(2) 高层 VLM 推理需 10–30 秒,造成用户等待的不自然交互体验,作者指出导览视频占输入 token 的 99.9%、理论上可缓存以提速;(3) Small Object 类成功率明显偏低(40–42%),受限于导览视频分辨率。论文末尾还展示了 Gemini 1.5 Pro 具备把多模态指令拆解为”去冰箱查看→报告结果”这类复合动作计划的初步能力,作为未来工作方向。

原始链接

一手源存档(sources/)

  • 未发现官方博客 / GitHub / HuggingFace / 项目主页(Google DeepMind 未为本工作发布代码或独立项目页;已用 Bing 搜索核实)。
  • arXiv 原文(2407.07775,arXiv 原文 PDF,不入 git)——见上方 PDF 链接。