一句话定位

Uni-LaViRA 是一套完全不训练的具身导航智能体架构:把导航拆成”语言动作(方向决策)→ 视觉动作(像素级目标定位)→ 机器人动作(几何反投影+控制)“三级翻译,两个通用 MLLM(Gemini-3.1-Pro 做语言、Qwen3.5-27B 做视觉定位)零样本跑通 VLN-CE/ObjectNav/EQA/Aerial-VLN 四大任务家族和轮式/四足/人形/自研无人机四种真实机身,配合 TODO List Memory(显式待办清单防止长指令注意力漂移)和 Second Chance Backtrack(带失败证据的回退重规划)两个 agent-loop 机制,在六个 benchmark 上零训练打平甚至超过消耗百万级轨迹、千卡时训练的导航基础模型。

背景与定位

过去两年具身导航的主流答案是把 NaVidUni-NaVidNaVILA 这条线继续放大——用更大的 VLA 基础模型吃更多机器人轨迹(从不到 100 万条涨到超过 1600 万条),换取 VLN-CE R2R 上 SR 从 40% 以下爬到 ~70%,事实上是在验证”导航的 scaling law”。Uni-LaViRA 反对的不是 scaling,而是”必须靠机器人数据训练才能获得跨任务、跨机身泛化”这个前提:论文提出一个结构性论证——判断一个具身任务能否免训练,关键看它的动作空间是否落在预训练 MLLM 的”自然输出流形”内。长时程灵巧操作的关节力矩、接触力这类连续数值序列 MLLM 预训练时很少见到,必须端到端学习;而导航本质是”非接触”的空间决策,可以完全化约成方向语言 + 像素坐标,两者都是 MLLM 预训练阶段就反复产出的表示形式。

本文是会议版 LaViRA(arXiv:2510.19655,仅验证 VLN-CE 单任务、两种机身)的期刊扩展,补上三个瓶颈:(L1) 单任务→四任务家族统一 prompt/action set/controller 栈;(L2) 长指令注意力漂移(RxR 平均指令长度约为 R2R 的 4 倍,~120 词)→ TODO List Memory;(L3) 错误恢复是”盲重试”(丢弃失败子轨迹)→ Second Chance Backtrack(把失败证据带回重规划)。同时把真实机身部署从 2 种扩到 4 种(轮式、四足、人形、自研 UAV),并新增 1800 组失败模式分类和推理成本分析。

模型架构

三层架构,上面两层都是通用 MLLM 直接 prompt,不做任何微调,唯一的机身相关模块在最底层:

  • Language Action(语言动作,高层规划):ϕ_lang = Gemini-3.1-Pro,每步调用一次。输入任务描述 𝒯、当前 waypoint 原地旋转拍到的四视角全景观测 {front, left, right, back}(UAV 是五个固定相机含俯视,直接给出五视角)、结构化历史 ℋ_t(此前 waypoint + 简要 caption + 历史 RGB 序列)。输出离散工具调用之一:turn(dir)(dir∈{front,left,right,back})、backtrack(wp_k)(触发 SCB)、go_stair(up/down)double_check(stop)(候选停止点,同一 MLLM 二次核验目标条件才终止)。每次调用打包成 JSON,含 progress_analysis、action_reasoning 字段及 TDM 更新。
  • Vision Action(视觉动作,中层视觉定位):ϕ_vis = Qwen3.5-27B(主配置;边缘设备用 Qwen3.5-9B-Q4)。输入任务描述、语言动作给出的 progress 描述、选定方向对应的单视角图像 I_t^dir。输出 select(bbox/point)(选定视角上的 2D 框,框不适用时退化为像素点)+ target_desc(text)(简短文字描述,如”通往卧室的门口”)。直接在原始像素上定位,不依赖预训练 waypoint predictor,prompt 显式劝阻”过近目标”以抑制贪心热力图跟随的局部极小行为。
  • Robot Action(低层控制,唯一机身相关模块):π_robot 是确定性几何控制器。取视觉框内代表像素 (u*,v*),用该像素深度 d_t 结合内参 K 反投影到相机系三维点,再用当前位姿变换到世界系,在全局累积地图上做短程路径规划后交给机身原生控制器执行。地面机器人用 2D 占据栅格 + Fast-Marching(FMM)规划;UAV 用 3D voxel 栅格 + 可见性图搜索。跨机身部署只替换这一层,ϕ_lang / ϕ_vis 逐字节复用。
  • 输出流形核心公式:𝒜_t = π_robot(ϕ_vis(ϕ_lang(𝒯,𝒪_t,ℋ_t)), D_t, K, pose_t)。仿真中地面机器人离散动作集为 move_forward(0.25m)/turn_left/right(30°)/stop;UAV 用 3D waypoint (x,y,z) 命令。

TODO List Memory (TDM):维护有序列表 L_t = [ℓ_t^(1),…,ℓ_t^(n_t)],每项是 (content, status∈{pending,completed}, result) 三元组。episode 开始时 ϕ_lang 调用一次生成初始清单(全 pending);此后每步同一次 MLLM 调用先输出更新操作集 U_t(update/rewrite/add/remove 四种),再基于更新后的列表做下一步动作决策——todo 更新与动作决策共享一次调用但用独立的 reasoning_todo / reasoning_action 字段,防止两种推理模式互相干扰。任何标记 completed 但没给出具体 result 的项会被 parser 回滚。纯 prompt 层实现,不引入任何参数。

Second Chance Backtrack (SCB):每次 ϕ_lang 被调用的位置都在全局占据地图上标记为 waypoint,存入固定大小 buffer。动作集因此始终包含 backtrack(wp_k)。触发后控制器先用 FMM/可见性图规划把机身物理送回 wp_k(路径基于最新地图,不是原访问时的旧认知),到达后发起专门的”二次规划”调用,显式提供三类证据:原始任务描述+wp_k 处全景图、当初离开 wp_k 时选的失败方向、wp_k 与死胡同之间的第一人称轨迹图像序列 Π_k^fail。MLLM 被要求诊断失败原因后从剩余方向里选新方向,而不是盲目排除失败方向后随机再选。SCB 与 TDM 正交:回退时 TODO 清单保留,二次规划调用允许把失败子目标重新标为 pending 或改写描述。

数据

训练数据:零。 全流程无任何机器人轨迹训练、无参数更新,ϕ_lang 与 ϕ_vis 都是公开 API 纯推理调用。仿真评测覆盖六个标准 benchmark,均为已有公开数据集(非自建/自采集):VLN-CE R2R、RxR(Matterport3D 场景),HM3D-v2、HM3D-OVON(Habitat-Matterport3D 场景),MP3D-EQA(Matterport3D),OpenUAV(AirSim,含城市/城镇/森林等户外场景)。每个任务从官方 val-unseen(或 OpenUAV 的 UM unseen-map test)按 stratified 采样抽 100 episode 子集(R2R/RxR 按指令+轨迹长度分层,HM3D-v2 按目标类别,HM3D-OVON 按语义类别,MP3D-EQA 按问题类型,OpenUAV 按 Easy/Hard 路径类型分层),MLLM 输出随机,故对每个 benchmark 跑 3 个独立种子取 mean±std。论文用两条公开 baseline 复现验证该 100-episode 子集是官方全量集的忠实代理:34 个有全量参照的 metric 格子里 21 个(62%)落在 ±2 绝对分内,31 个(91%)落在 ±5 内,残差全部集中在动态范围最大的 OpenUAV 上。真实机器人部署阶段(第五节)同样零训练,只做约 15 分钟/机身的手眼标定+棋盘格对齐。

训练方法

严格来说没有”训练”——上层两个 MLLM 全程冻结权重、纯推理调用,唯一的”方法”是 prompt engineering + 确定性几何控制器:

  • Language Action 每步单次调用同时产出 TDM 更新算子和下一步导航动作(Eq. 5–7),用独立 reasoning 字段分离两种推理模式。
  • SCB 二次规划 是在 backtrack 触发后插入的专用 ϕ_lang 调用,显式喂入失败子轨迹图像序列作为诊断证据。
  • OpenUAV 专属适配(纯 prompt 层,不引入新参数):全景扩到五视角(加俯视相机,因为空中目标常在飞行路径上方或下方);新增 direction-constrained 模块,当 Vision Action 定位置信度低时触发,让 Language Action 显式基于初始位姿、当前位姿、全局目标方向推理,深度通道提供避障距离估计。
  • 算法 1(One episode of Uni-LaViRA)完整给出单 episode 的推理循环:TDM 初始化 → 逐步查询 ϕ_lang(同时产出 TDM 更新和动作)→ stop 则终止 / backtrack 则触发 SCB 回退重规划 → ϕ_vis 定位 → π_robot 执行,循环内没有任何一步触碰可学习参数。

Infra(训练 / 推理工程)

训练:无,GPU-hours = 0。 这是论文刻意强调的核心权衡——“用每次评测的边际成本替换掉训练的一次性固定成本”。作为对比基准(均为其他工作自报数据,非本文实测):NavFoM 用 56×NVIDIA H100 训练约 72 小时,合计 4,032 H100-hours;OmniNav 14,592 GPU-hours;ABot-N0 6,144 GPU-hours;NaVILA 1,152 GPU-hours。论文按 H100 BF16 40% MFU(~989 TFLOPS)估算,NavFoM 训练消耗约 5.7 ZFLOPs(5.7×10²¹ FLOPs),相当于约 570 次完整六任务 Uni-LaViRA 评测(每次六任务评测约 10 EFLOPs),而一般研究项目累计跑不到几十次六任务评测,远低于这个 570 次的盈亏平衡点。

仿真评测算力:8×NVIDIA RTX 4090 GPU 并行跑 rollout(仅用于 Habitat/AirSim 仿真物理与渲染,不涉及模型训练)。

单次调用成本(1,800 条轨迹全量池实测,Full 配置,Gemini-3.1-Pro 做 LA、Qwen3.5-27B 做 VA):LA 平均输入 22,305 token / 输出 1,618 token(其中 88.7% 是 reasoning-trace token),对应约 9.6 PFLOPs/次;VA 平均输入 ~990 token / 输出 ~110 token(无 reasoning trace),约 59 TFLOPs/次。一次六任务全量评测消耗的约 10 EFLOPs 中,93.2% 落在 LA prefill,6.0% 在 LA reasoning token,0.8% 在 LA 可见输出,VA 占比不到 0.1%——输入上下文长度是主导杠杆。

推理延迟/吞吐:六任务 600-episode 全量跑在 40 个并行 API worker 上耗时 5–7 小时;单次 LA 调用 API 健康时 30–60 秒、拥塞时 80–150 秒(网络往返 + reasoning token 解码主导),本地规划器与控制器每步耗时均 < 10ms。

真实机身推理硬件(第五节,各机身逐字节复用同一套 LA/VA 模型,仅替换控制器):

  • Agilex Cobot Magic(轮式双臂):机载 RTX 4090,单卡跑 Qwen3.5-27B-Q4 同时承担 LA 与 VA,运行期间零远程 API 调用。
  • Unitree G1(人形):机载 Jetson Orin NX 跑 Qwen3.5-9B-Q4(LA+VA),NavDP 输出的 (v_x,v_y,ω_z) 速度指令以 1 Hz 采样执行,原生步态控制器不重训。
  • Unitree Go1(四足):与 G1 共享同款 Jetson Orin NX + Qwen3.5-9B-Q4 组合。
  • 自研四旋翼 UAV:Jetson Orin NX 仅做传感器 I/O,LA(Gemini-3.1-Pro)与 VA(Qwen3.5-27B)都走远程 API,因热/重量预算排除机载大模型推理;单次 LA 调用健康时 30–60 秒、拥塞时最长 150 秒,为此把规划视界拉长到约 5 米/次调用,视界太短会导致”悬停等重规划”。 三种地面机器人上四视角/五视角机身相关部分之外的 Robot Action 层用 NavDP(而非仿真时的 FMM)把 RGB-D 观测转成机身系短程轨迹,由平台原生速度控制器跟踪;UAV 用 PX4 位置控制环(3D waypoint 而非平面速度)。

评测 benchmark

六个 benchmark、零训练单一架构下的 SR(全部为本文实测,mean±std over 3 seeds):

任务数据集SR/ACC对比
VLN-CER2R val-unseen60.7±2.1% (NE 3.66±0.26m,两组最低)超零样本最强 baseline LaViRA(38.3%)22.4 点;打平 JanusVLN(60.5%,训练);超 NavFoM(56.2%,~8M 轨迹)4.5 点;落后 OmniNav(69.5%)/ABot-N0(66.4%)/SPAN-Nav(66.3%)
VLN-CERxR val-unseen(平均指令~120词)51.3±2.3%接近 NaVILA(49.3%);落后 NavFoM(57.4%)、JanusVLN(56.2%)5–6 点
ObjectNavHM3D-v277.7±2.1% SR / 46.1±1.8% SPL超训练最强 baseline FiLM-Nav(77.0% SR)0.7 点,SPL 高 4.8 点;超 Uni-NaVid(73.7%)、OpenFMNav(54.9%)22.8 点
ObjectNav(开放词表)HM3D-OVON60.0±6.1% SR / 40.5±1.1% SPL超 OmniNav(59.2%)0.8 点、ABot-N0(54.0%)6.0 点
EQAMP3D-EQA54.7±2.3% ACC超训练最强 baseline Uni-NaVid(47.3%)7.4 点;失败主因是最终问答步细粒度视觉识别错误(如深棕/黑色混淆),而非导航本身
Aerial-VLNOpenUAV UM(Full)40.00±3.46% SR / 30.37±2.23% SPL超 NavFoM +33.7 SR/+24.7 SPL,约 9 倍于 TravelUAV SR,超训练最强 AerialVLA(37.6% SR/28.2% SPL);Easy 子集落后 AerialVLA 2.3 点,Hard 子集(>250m 轨迹)反超 8.9 SR/6.5 SPL;OSR 67.3%(约三分之二 episode 到达目标附近),27 点 OSR–SR 落差源于高空飞行难以确认地面级线索

六个 benchmark 中,除 R2R/RxR 仍落后专用多任务 VLA 外,其余四个(HM3D-v2、HM3D-OVON、MP3D-EQA、OpenUAV)零训练超过已报道最强训练基础模型。

消融(TDM/SCB,Full vs. w/o TDM vs. w/o SCB vs. w/o both,3 seeds mean±std SR):Full 在六项全部领先,单独关掉任一机制都掉到 49–52% 附近(R2R 上 Full 60.7% vs 三种缺省配置 49–50%),两机制强互补。逐任务边际贡献 Δ:TDM 在长指令/问答类任务上占优——R2R +11.4、RxR +6.6、MP3D-EQA +6.0、OpenUAV +5.67(Hard 子集扩大到约 +10);SCB 在室内多房间探索类任务上占优——HM3D-v2 +9.0、HM3D-OVON +5.3;R2R/RxR 上两者旗鼓相当(R2R:ΔTDM +11.4 vs ΔSCB +10.7;RxR:+6.6 vs +7.0);OpenUAV 上 SCB 边际贡献仅 +2.00,触发episode占比小,是局部恢复机制而非持续驱动力。

失败模式分类(1,800 条 trial 池化,按最终状态几何规则自动归类):Early stop on wrong target 占全部 trial 17.7%/占失败 45.8%(平均在 11.9m/217 步后误停,距目标约 11m,RxR 上占 34%、R2R 占 26%,长指令易混淆已定位地标);Reached but missed STOP 占 9.6%/24.7%(oracle_success=1 但越过 3m 成功环后继续走,HM3D-OVON 17%、HM3D-v2 10% 最突出);Wrong answer(仅 EQA)占 7.6%/19.5%(导航到位但末端视觉细节判断错误);Approached but undershot 占 2.7%/6.9%;Wandered and lost 占 1.2%/3.2%(合计几何尾部约占失败 10%,源于深度伪影/FMM 死角/无限循环遍历)。

创新点与影响

  • 核心贡献:把导航的通用性来源从”数据规模”转向”结构性分解”——证明只要动作空间落在预训练 MLLM 的自然输出流形内(离散方向语言 + 像素级视觉目标),导航就可以完全交给 agent 推理而不需要额外机器人数据训练,四个任务家族、四种真实机身共享同一套零训练 Language/Vision Action Model。
  • 两个新 agent-loop 机制:TODO List Memory 把长时程规划外化成可重读的结构化清单(而非塞进不断增长的对话历史),直接解决长指令注意力漂移;Second Chance Backtrack 把”错误”从要丢弃的噪声变成要利用的诊断证据,把单程导航变成自我纠错过程。
  • 跨机身工程成本极低:新增一种真实机身平均只需约 40 人时(2h 传感器标定 + 4–6h 控制器适配 + 2h 联调),相比重训一版 VLA 所需的数百 GPU-hours 是数量级差异;三种地面机器人共享逐字节相同的 panoramic prompt,论文认为这是”该分解抽象掉了视角/机身差异”的直接证据。
  • 作者自陈局限(原文 Limitation and Future Work):(i) 最强 backbone(Gemini-3.1-Pro)是闭源的,开源替代仍有明显差距,计划蒸馏 agent 轨迹到开源 backbone 做自托管;(ii) 大范围区域(“走廊”)的定位比具体物体(“沙发”)更不可靠,计划让 Vision Action 在置信度低时调用 SAM / Grounding DINO 作为辅助工具而非替代;(iii) 长指令任务(RxR)仍落后训练 VLA 一段明显差距,是训练无关设计的主要残留短板,计划用层级化子目标压缩 + 更长上下文 backbone 扩展 TDM;(iv) 动态障碍物/行人目前只靠反应式底层控制处理,行人意图推理需要提升到 Language Action 层面才能实现真正的社交导航。

原始链接

一手源存档(sources/)