一句话定位

NaVILA 把「视觉语言导航(VLN)」搬到腿式机器人身上,用两级解耦框架打通「人话指令 → 关节力矩」:上层一个基于 VILA 的 8B VLM 把 RGB 视频观测翻译成中层语言动作(如 “move forward 75cm”、“turn right 30 degrees”),下层一个基于 LiDAR 的实时视觉 locomotion RL 策略把这句话执行成腿关节动作;同一个 VLM 换下层策略即可跨 Go2 四足 / H1、G1、Booster T1 人形,真机 25 条指令拿到 88% 成功率。

背景与定位

范式:两级 VLA(hierarchical VLA),中层动作用「语言」而非量化低层指令表达。GR-2rt-2、OpenVLA 这类「VLM 直接吐量化低层动作」的端到端 VLA 不同,NaVILA 主张:LLM/VLM 本就是在自然语言上训练的,把推理硬压成精确的非语言动作会牺牲推理能力,因此把动作留在语言域,再交给一个专门的运动策略去落地。这条思路借了 SpatialRGPT、SpatialVLM 的空间距离推理能力(同组 Cheng et al.),把导航拆成「高层语言规划」与「低层运动控制」两个时间尺度。

它直接对标两条线:

  • VLN-CE(连续环境视觉语言导航):R2R-CE / RxR-CE 这类 Habitat 基准。以往强方法(BEVBert、ETPNav、HNR 等)依赖仿真预训练 waypoint predictor + 全景 + 深度 + 里程计,泛化受限于仿真数据;NaVILA 只用单目 RGB就追平甚至超过它们。单视角 VLN 的直接前作是 NaVid(Zhang et al. 2024,同样单视角 RGB 视频 VLM),NaVILA 在 R2R-CE SR 上比它高约 17 个点。
  • 腿式机器人基础模型 / locomotion:QUAR-VLA(四足 VLA)、把 VLM 当技能选择器的工作,以及纯本体感觉或视觉 locomotion RL(Lee et al. 2020、Miki et al. 2022)。NaVILA 的差异是同时做复杂指令理解 + 全运动控制,且 locomotion 策略用 LiDAR、单阶段 RL。

三点框架优势(论文自陈):(i) 低层执行与 VLA 解耦,换低层策略即可换机器人;(ii) 中层语言动作让训练能吃进真人视频、QA 等异构数据,不过拟合到特定低层指令;(iii) 双频率——大 VLM 低频出高层命令,locomotion 策略实时跑,负责避障与鲁棒性。

作者 An-Chieh Cheng、Yandong Ji、Zhaojing Yang(共一)等,Xiaolong Wang / Sifei Liu / Hongxu Yin 共同指导,UC San Diego / USC / NVIDIA。发表于 RSS 2025

模型架构

两级架构:高层 NaVILA-8B VLM(语言动作)+ 低层视觉 locomotion RL 策略(关节位置)。

高层 VLA(NaVILA-8B)

  • 骨架 = VILA 家族的 image-based VLM:SigLIP 视觉编码器 + MLP projector(下采样视觉 token 后映射到语言域)+ Llama-3-8B LLM,自回归生成。预训练权重 navila-siglip-llama3-8b-v1.5-pretrain(VILA1.5 stage-2 模型起训)。作者刻意不用 video encoder——图文数据充足、泛化更强,视频靠均匀抽帧塞进 image VLM。
  • 导航 prompt / 记忆设计:把不同时刻的帧分两类角色——第 N 帧(当前观测,用于即时决策)与前 N−1 帧(历史记忆,用于跟踪进度)。做法是先取最近一帧作 current observation,再从前面帧里均匀采样(保证首帧一定入选),并用纯文本线索区分(a video of historical observations: / current observation:),不引入额外特殊 token(区别于 NaVid),坚持输入输出都在语言域以保留 LLM 推理力。实验里记忆帧数 N 从 8 到 64 都测过。
  • 动作头 = 语言:VLM 直接输出一句带空间量的自然语言动作。推理端用一个正则表达式解析器从输出里抠出动作类型(forward / turn left / turn right / stop)与参数(距离 cm / 角度 degree);作者称全部实验中所有动作都能成功匹配映射。
  • 可跨本体:同一个 VLM 不重训,换下层策略即部署到 Unitree Go2(四足)、H1 / G1、Booster T1(人形)。

低层视觉 locomotion 策略(以 Go2 为例)

  • 平台:Unitree Go2,18 DoF(base 6 + 每腿 3×4=12);训练时放开 base 6 DoF,策略只控 12 个腿关节电机。头部底座装 Unitree L1 LiDAR,15Hz 广播点云。
  • 命令接口:VLM 输出固定动作词 {move forward, turn left, turn right, stop},被 cast 成固定命令速度 {v_x, +ω, −ω, 0},按对应时长执行以对齐 VLM 给的数值。
  • 动作 / 观测空间:动作空间是目标关节位置(经刚度/阻尼转力矩)。用 PPO非对称 actor-critic:critic 观测含本体感觉 + 当前速度命令 + 特权地形高度扫描;actor 观测去掉线速度(真机拿不到),改用一段本体感觉历史隐式推断,并读 LiDAR 生成的高度图感知周围地形。
  • LiDAR 高度图:L1 FOV 广,构建 2.5D 高度图(Table 12:32 channels,垂直 0–90°、水平 −180–180°、水平分辨率 4°、voxel 0.06m,X∈[−0.8,0.2]、Y∈[−0.8,0.8]、Z∈[0.05,0.5]m);每 voxel 取范围内最低值,再对最近 5 帧点云做 max filter 平滑。LiDAR 相比深度/RGB 能可靠探测透明玻璃强光下的障碍。

数据

SFT 数据混合四路(论文 Sec 2.1):真人视频导航 + 仿真导航 + 辅助导航 + 通用 VQA。 模块化设计便于加新数据源。

  1. 真人 touring 视频(YouTube):从 2K 条第一视角 touring 视频出发,用 entropy-based sampling(Lin et al. 2023)处理成 20K 条轨迹;用 Mast3R 做 in-the-wild 度量位姿估计抽出逐步动作,再用 VILA 做 caption + GPT-4o(OpenAI)改写生成自然语言指令。作用:把「连续设定下拿不到连续动作标签」这个老问题用度量位姿估计解掉,注入真实世界行为。
  2. 仿真导航(R2R-CE + RxR-CE,Habitat):唯二可用的连续 VLN 数据集,用 shortest path follower 生成沿测地最短路的动作序列,得到逐步导航视频(每样本 = N 帧视频 + 时刻 N 的 oracle 动作)。为鼓励 LLM 输出连续距离/角度值,合并连续同类动作(如两个 forward 25cm → forward 50cm,最多合 3 个);并对 stop 动作欠采样做 rebalancing。
  3. 辅助导航数据:EnvDrop 增广指令(Tan et al. 2019)+ 一个自建辅助任务「导航轨迹摘要」(给轨迹视频让 LLM 反推指令);再加 ScanQA(真实 3D 扫描 QA,用多视角 RGB)提升空间场景理解。
  4. 通用 VQA:ShareGPT4V、Video-ChatGPT 等图/视频 VQA,保持通用能力不退化。

HF 上开源了 envdrop / scanqa / r2r / rxr / human 的标注(a8cheng/NaVILA-Dataset);YouTube 真人视频因版权只放 video ID + 标注,用 yt-dlp 自行下载抽帧。

训练方法

  • VLA SFT:从 VILA stage-2(已过视觉语言语料预训练)模型起,把上述四路 SFT 混合数据训整个 VLM 一个 epoch,视觉编码器 / connector / LLM 三部分全部解冻。指令微调阶段用 cosine decay 学习率 + warm-up(前两阶段超参沿用 VILA;正文以公式给出具体数值,此处不复述)。
  • locomotion 策略:Isaac Sim + Isaac Lab 里用 PPO 单阶段 RL 训练(区别于主流 teacher-student 两阶段蒸馏——单阶段更省时、且策略直接与环境交互能探索新策略),训完直接零样本部署真机。奖励(Table 10)含线/角速度跟踪(权重各 1.5)、线速度 z 惩罚 −2.0、角速度 xy 惩罚 −0.05、平躺姿态 −2.0、身高 −5.0、能量/关节加速度/滑脚等;域随机化(Table 11)覆盖 body mass [−3,3]、地面摩擦 [0.4,4.0]、电机强度 [0.9,1.1]、系统延迟等。在 flat / rough / slope / obstacle 四类地形上训练以求鲁棒。
  • 推理端量化(Appx I):对 FP16 的 NaVILA-8B 用 AWQW4A16(仅权重低比特),显存减半、速度约 +40%、导航能力基本不掉,目标是把模型直接塞进机器人省掉图传延迟(留作 future work)。

Infra(训练 / 推理工程)

  • locomotion RL 训练吞吐:借 Isaac Lab 的 ray-casting,视觉 RL 策略训练在单张 RTX 4090 上达 >60K FPS
  • VLA 训练算力(Appx C4):前两阶段沿用 VILA 设置——在 16 个 A100 节点(每节点 8 卡) 上训 8B 模型,connector 初始化 4h、视觉语言预训练 30h;NaVILA 特有的视觉指令微调阶段在 4 个 A100 节点上跑 18h(推理为单张 RTX 4090、约 1 FPS)。
  • 推理时延(RTX 4090,1737 context token + 10 生成 token,R2R-CE 样本,Table 13)
    • FP16:总时延 594.58 ms,GPU 显存 18.5 GB
    • W4A16(AWQ):总时延 367.80 ms,显存 8.6 GB
    • VLA 单次推理约 0.6s;真机每个动作间等待约 1s(= 图传时间 + VLA 推理),演示视频均 1x 无加速。
  • 控制频率:LiDAR 点云 15Hz;locomotion 策略实时运行;高层 VLM 低频出命令(双频率设计)。

评测 benchmark

R2R-CE Val-Unseen(单视角 RGB,Table 1):NE 5.22 / OS 62.5 / SR 54.0 / SPL 49.0。超过所有不依赖仿真预训练 waypoint predictor 的方法,且是首个仅用单目 RGB 就追平/超过用全景 + 深度 + 里程计 + waypoint 方法的 VLN agent。对比单视角前作 NaVid(SR 37.0)高 17 个点。(同表 RxR-CE Val-Unseen 训练版:NE 6.77 / SR 49.3 / SPL 44.0 / nDTW 58.8。)

RxR-CE 跨数据集零样本(只训 R2R,Table 2):NE 8.78 / OS 46.8 / SR 34.3 / SPL 28.2,比 NaVid(SR 23.8)高约 10 个点

ScanQA Validation 空间理解(Table 3):NaVILA-64frames Bleu-4 16.9 / Rouge 49.3 / CIDEr 102.7 / Meteor 20.1 / EM 28.6,比 2D VLA 前 SOTA NaviLLM(CIDEr 75.9)高约 20 分(CIDEr),并超过需 3D 扫描/RGBD+位姿输入的 3D-LMM(LEO 101.4、Scene-LLM 80.0),而 NaVILA 只用多视角 RGB。

VLN-CE-Isaac(自建高保真基准,Table 4):从 R2R Val-Unseen 的 1839 条轨迹里选 1077 条可通行、高质量 mesh 轨迹;引入真实关节运动与物理交互。结果:

  • Go2:Vision SR 50.2 vs Blind SR 36.2(+14);
  • H1:Vision SR 45.3 vs Blind SR 24.4(+21);
  • Oracle(假设完美执行)SR 51.3;去掉 Oracle 低层策略后 Go2 掉约 15 点、H1 掉约 27 点,说明低层控制真实难度。H1 因体型大整体低于 Go2。

真机(25 条指令 ×3 次,Workspace/Home/Outdoor,Table 5):整体 88% 成功率,复杂指令 75%。分环境 SR:Workspace Simple 1.00 / Complex 0.80,Home 1.00 / 0.67,Outdoor 1.00 / 0.83,全面碾压 GPT-4o baseline。去掉真人视频后户外 SR 掉到 0.00,验证真人视频对户外泛化的作用。G1 人形用同一 VLA 不重训也跑通。

关键消融:无 label rebalancing → R2R SR 30.0(vs 49.7);无真人视频 → SR 49.7(vs 54.0,OS/SR/SPL 各约 +5);无 RxR → R2R SR 47.7(RxR 对 R2R 帮助不大);记忆帧 R2R 上 8 帧足够、ScanQA 上 8→64 帧 CIDEr 95.1→102.7 单调上升;W4A16 量化 SR 49.7→48.2(小幅)。

创新点与影响

  • 两级语言动作 VLA:把中层动作表达成自然语言(含空间量),既保住 VLM 推理能力、又让训练能吃真人视频 / QA 等异构源,还天然跨本体(换低层策略即换机器人)——这套「VLM 出语言 waypoint + 运动策略执行」范式成为后续腿式 VLN 的常见骨架。
  • 首个把 VLN 做到腿式机器人全运动控制:以往 VLN 停在高层规划或轮式,NaVILA 打通到腿关节,且证明单目 RGB 足以超越多传感器 + waypoint 方法。
  • 单阶段 LiDAR 视觉 locomotion 策略:免 teacher-student 蒸馏,用 LiDAR 高度图解决透明玻璃 / 强光下的安全避障,sim-to-real 直接部署。
  • VLN-CE-Isaac 基准:首个面向腿式机器人、含真实低层控制与物理交互的高保真 VLN 基准(Habitat 允许 10cm 缝隙穿行,对腿式不现实)。
  • 局限(论文自陈):仍有真机失败案例(初期跟对指令但最终没到正确目标);image-based VLM token 量大、计算重,限制历史帧数量,寄望长上下文 LLM;泛化与空间理解还需更大规模、更真实的仿真训练。

原始链接

一手源存档(sources/)