一句话定位
NaVILA 把「视觉语言导航(VLN)」搬到腿式机器人身上,用两级解耦框架打通「人话指令 → 关节力矩」:上层一个基于 VILA 的 8B VLM 把 RGB 视频观测翻译成中层语言动作(如 “move forward 75cm”、“turn right 30 degrees”),下层一个基于 LiDAR 的实时视觉 locomotion RL 策略把这句话执行成腿关节动作;同一个 VLM 换下层策略即可跨 Go2 四足 / H1、G1、Booster T1 人形,真机 25 条指令拿到 88% 成功率。
背景与定位
范式:两级 VLA(hierarchical VLA),中层动作用「语言」而非量化低层指令表达。 与 GR-2、rt-2、OpenVLA 这类「VLM 直接吐量化低层动作」的端到端 VLA 不同,NaVILA 主张:LLM/VLM 本就是在自然语言上训练的,把推理硬压成精确的非语言动作会牺牲推理能力,因此把动作留在语言域,再交给一个专门的运动策略去落地。这条思路借了 SpatialRGPT、SpatialVLM 的空间距离推理能力(同组 Cheng et al.),把导航拆成「高层语言规划」与「低层运动控制」两个时间尺度。
它直接对标两条线:
- VLN-CE(连续环境视觉语言导航):R2R-CE / RxR-CE 这类 Habitat 基准。以往强方法(BEVBert、ETPNav、HNR 等)依赖仿真预训练 waypoint predictor + 全景 + 深度 + 里程计,泛化受限于仿真数据;NaVILA 只用单目 RGB就追平甚至超过它们。单视角 VLN 的直接前作是 NaVid(Zhang et al. 2024,同样单视角 RGB 视频 VLM),NaVILA 在 R2R-CE SR 上比它高约 17 个点。
- 腿式机器人基础模型 / locomotion:QUAR-VLA(四足 VLA)、把 VLM 当技能选择器的工作,以及纯本体感觉或视觉 locomotion RL(Lee et al. 2020、Miki et al. 2022)。NaVILA 的差异是同时做复杂指令理解 + 全运动控制,且 locomotion 策略用 LiDAR、单阶段 RL。
三点框架优势(论文自陈):(i) 低层执行与 VLA 解耦,换低层策略即可换机器人;(ii) 中层语言动作让训练能吃进真人视频、QA 等异构数据,不过拟合到特定低层指令;(iii) 双频率——大 VLM 低频出高层命令,locomotion 策略实时跑,负责避障与鲁棒性。
作者 An-Chieh Cheng、Yandong Ji、Zhaojing Yang(共一)等,Xiaolong Wang / Sifei Liu / Hongxu Yin 共同指导,UC San Diego / USC / NVIDIA。发表于 RSS 2025。
模型架构
两级架构:高层 NaVILA-8B VLM(语言动作)+ 低层视觉 locomotion RL 策略(关节位置)。
高层 VLA(NaVILA-8B)
- 骨架 = VILA 家族的 image-based VLM:SigLIP 视觉编码器 + MLP projector(下采样视觉 token 后映射到语言域)+ Llama-3-8B LLM,自回归生成。预训练权重
navila-siglip-llama3-8b-v1.5-pretrain(VILA1.5 stage-2 模型起训)。作者刻意不用 video encoder——图文数据充足、泛化更强,视频靠均匀抽帧塞进 image VLM。 - 导航 prompt / 记忆设计:把不同时刻的帧分两类角色——第 N 帧(当前观测,用于即时决策)与前 N−1 帧(历史记忆,用于跟踪进度)。做法是先取最近一帧作 current observation,再从前面帧里均匀采样(保证首帧一定入选),并用纯文本线索区分(
a video of historical observations:/current observation:),不引入额外特殊 token(区别于 NaVid),坚持输入输出都在语言域以保留 LLM 推理力。实验里记忆帧数 N 从 8 到 64 都测过。 - 动作头 = 语言:VLM 直接输出一句带空间量的自然语言动作。推理端用一个正则表达式解析器从输出里抠出动作类型(forward / turn left / turn right / stop)与参数(距离 cm / 角度 degree);作者称全部实验中所有动作都能成功匹配映射。
- 可跨本体:同一个 VLM 不重训,换下层策略即部署到 Unitree Go2(四足)、H1 / G1、Booster T1(人形)。
低层视觉 locomotion 策略(以 Go2 为例)
- 平台:Unitree Go2,18 DoF(base 6 + 每腿 3×4=12);训练时放开 base 6 DoF,策略只控 12 个腿关节电机。头部底座装 Unitree L1 LiDAR,15Hz 广播点云。
- 命令接口:VLM 输出固定动作词 {move forward, turn left, turn right, stop},被 cast 成固定命令速度 {v_x, +ω, −ω, 0},按对应时长执行以对齐 VLM 给的数值。
- 动作 / 观测空间:动作空间是目标关节位置(经刚度/阻尼转力矩)。用 PPO 的非对称 actor-critic:critic 观测含本体感觉 + 当前速度命令 + 特权地形高度扫描;actor 观测去掉线速度(真机拿不到),改用一段本体感觉历史隐式推断,并读 LiDAR 生成的高度图感知周围地形。
- LiDAR 高度图:L1 FOV 广,构建 2.5D 高度图(Table 12:32 channels,垂直 0–90°、水平 −180–180°、水平分辨率 4°、voxel 0.06m,X∈[−0.8,0.2]、Y∈[−0.8,0.8]、Z∈[0.05,0.5]m);每 voxel 取范围内最低值,再对最近 5 帧点云做 max filter 平滑。LiDAR 相比深度/RGB 能可靠探测透明玻璃与强光下的障碍。
数据
SFT 数据混合四路(论文 Sec 2.1):真人视频导航 + 仿真导航 + 辅助导航 + 通用 VQA。 模块化设计便于加新数据源。
- 真人 touring 视频(YouTube):从 2K 条第一视角 touring 视频出发,用 entropy-based sampling(Lin et al. 2023)处理成 20K 条轨迹;用 Mast3R 做 in-the-wild 度量位姿估计抽出逐步动作,再用 VILA 做 caption + GPT-4o(OpenAI)改写生成自然语言指令。作用:把「连续设定下拿不到连续动作标签」这个老问题用度量位姿估计解掉,注入真实世界行为。
- 仿真导航(R2R-CE + RxR-CE,Habitat):唯二可用的连续 VLN 数据集,用 shortest path follower 生成沿测地最短路的动作序列,得到逐步导航视频(每样本 = N 帧视频 + 时刻 N 的 oracle 动作)。为鼓励 LLM 输出连续距离/角度值,合并连续同类动作(如两个 forward 25cm → forward 50cm,最多合 3 个);并对 stop 动作欠采样做 rebalancing。
- 辅助导航数据:EnvDrop 增广指令(Tan et al. 2019)+ 一个自建辅助任务「导航轨迹摘要」(给轨迹视频让 LLM 反推指令);再加 ScanQA(真实 3D 扫描 QA,用多视角 RGB)提升空间场景理解。
- 通用 VQA:ShareGPT4V、Video-ChatGPT 等图/视频 VQA,保持通用能力不退化。
HF 上开源了 envdrop / scanqa / r2r / rxr / human 的标注(a8cheng/NaVILA-Dataset);YouTube 真人视频因版权只放 video ID + 标注,用 yt-dlp 自行下载抽帧。
训练方法
- VLA SFT:从 VILA stage-2(已过视觉语言语料预训练)模型起,把上述四路 SFT 混合数据训整个 VLM 一个 epoch,视觉编码器 / connector / LLM 三部分全部解冻。指令微调阶段用 cosine decay 学习率 + warm-up(前两阶段超参沿用 VILA;正文以公式给出具体数值,此处不复述)。
- locomotion 策略:Isaac Sim + Isaac Lab 里用 PPO 单阶段 RL 训练(区别于主流 teacher-student 两阶段蒸馏——单阶段更省时、且策略直接与环境交互能探索新策略),训完直接零样本部署真机。奖励(Table 10)含线/角速度跟踪(权重各 1.5)、线速度 z 惩罚 −2.0、角速度 xy 惩罚 −0.05、平躺姿态 −2.0、身高 −5.0、能量/关节加速度/滑脚等;域随机化(Table 11)覆盖 body mass [−3,3]、地面摩擦 [0.4,4.0]、电机强度 [0.9,1.1]、系统延迟等。在 flat / rough / slope / obstacle 四类地形上训练以求鲁棒。
- 推理端量化(Appx I):对 FP16 的 NaVILA-8B 用 AWQ 转 W4A16(仅权重低比特),显存减半、速度约 +40%、导航能力基本不掉,目标是把模型直接塞进机器人省掉图传延迟(留作 future work)。
Infra(训练 / 推理工程)
- locomotion RL 训练吞吐:借 Isaac Lab 的 ray-casting,视觉 RL 策略训练在单张 RTX 4090 上达 >60K FPS。
- VLA 训练算力(Appx C4):前两阶段沿用 VILA 设置——在 16 个 A100 节点(每节点 8 卡) 上训 8B 模型,connector 初始化 4h、视觉语言预训练 30h;NaVILA 特有的视觉指令微调阶段在 4 个 A100 节点上跑 18h(推理为单张 RTX 4090、约 1 FPS)。
- 推理时延(RTX 4090,1737 context token + 10 生成 token,R2R-CE 样本,Table 13):
- FP16:总时延 594.58 ms,GPU 显存 18.5 GB;
- W4A16(AWQ):总时延 367.80 ms,显存 8.6 GB。
- VLA 单次推理约 0.6s;真机每个动作间等待约 1s(= 图传时间 + VLA 推理),演示视频均 1x 无加速。
- 控制频率:LiDAR 点云 15Hz;locomotion 策略实时运行;高层 VLM 低频出命令(双频率设计)。
评测 benchmark
R2R-CE Val-Unseen(单视角 RGB,Table 1):NE 5.22 / OS 62.5 / SR 54.0 / SPL 49.0。超过所有不依赖仿真预训练 waypoint predictor 的方法,且是首个仅用单目 RGB 就追平/超过用全景 + 深度 + 里程计 + waypoint 方法的 VLN agent。对比单视角前作 NaVid(SR 37.0)高 17 个点。(同表 RxR-CE Val-Unseen 训练版:NE 6.77 / SR 49.3 / SPL 44.0 / nDTW 58.8。)
RxR-CE 跨数据集零样本(只训 R2R,Table 2):NE 8.78 / OS 46.8 / SR 34.3 / SPL 28.2,比 NaVid(SR 23.8)高约 10 个点。
ScanQA Validation 空间理解(Table 3):NaVILA-64frames Bleu-4 16.9 / Rouge 49.3 / CIDEr 102.7 / Meteor 20.1 / EM 28.6,比 2D VLA 前 SOTA NaviLLM(CIDEr 75.9)高约 20 分(CIDEr),并超过需 3D 扫描/RGBD+位姿输入的 3D-LMM(LEO 101.4、Scene-LLM 80.0),而 NaVILA 只用多视角 RGB。
VLN-CE-Isaac(自建高保真基准,Table 4):从 R2R Val-Unseen 的 1839 条轨迹里选 1077 条可通行、高质量 mesh 轨迹;引入真实关节运动与物理交互。结果:
- Go2:Vision SR 50.2 vs Blind SR 36.2(+14);
- H1:Vision SR 45.3 vs Blind SR 24.4(+21);
- Oracle(假设完美执行)SR 51.3;去掉 Oracle 低层策略后 Go2 掉约 15 点、H1 掉约 27 点,说明低层控制真实难度。H1 因体型大整体低于 Go2。
真机(25 条指令 ×3 次,Workspace/Home/Outdoor,Table 5):整体 88% 成功率,复杂指令 75%。分环境 SR:Workspace Simple 1.00 / Complex 0.80,Home 1.00 / 0.67,Outdoor 1.00 / 0.83,全面碾压 GPT-4o baseline。去掉真人视频后户外 SR 掉到 0.00,验证真人视频对户外泛化的作用。G1 人形用同一 VLA 不重训也跑通。
关键消融:无 label rebalancing → R2R SR 30.0(vs 49.7);无真人视频 → SR 49.7(vs 54.0,OS/SR/SPL 各约 +5);无 RxR → R2R SR 47.7(RxR 对 R2R 帮助不大);记忆帧 R2R 上 8 帧足够、ScanQA 上 8→64 帧 CIDEr 95.1→102.7 单调上升;W4A16 量化 SR 49.7→48.2(小幅)。
创新点与影响
- 两级语言动作 VLA:把中层动作表达成自然语言(含空间量),既保住 VLM 推理能力、又让训练能吃真人视频 / QA 等异构源,还天然跨本体(换低层策略即换机器人)——这套「VLM 出语言 waypoint + 运动策略执行」范式成为后续腿式 VLN 的常见骨架。
- 首个把 VLN 做到腿式机器人全运动控制:以往 VLN 停在高层规划或轮式,NaVILA 打通到腿关节,且证明单目 RGB 足以超越多传感器 + waypoint 方法。
- 单阶段 LiDAR 视觉 locomotion 策略:免 teacher-student 蒸馏,用 LiDAR 高度图解决透明玻璃 / 强光下的安全避障,sim-to-real 直接部署。
- VLN-CE-Isaac 基准:首个面向腿式机器人、含真实低层控制与物理交互的高保真 VLN 基准(Habitat 允许 10cm 缝隙穿行,对腿式不现实)。
- 局限(论文自陈):仍有真机失败案例(初期跟对指令但最终没到正确目标);image-based VLM token 量大、计算重,限制历史帧数量,寄望长上下文 LLM;泛化与空间理解还需更大规模、更真实的仿真训练。
原始链接
- 论文(arXiv abs):https://arxiv.org/abs/2412.04453
- 论文 PDF:https://arxiv.org/pdf/2412.04453
- 项目主页:https://navila-bot.github.io/
- 代码(VLA / 高层):https://github.com/AnjieCheng/NaVILA
- 代码(低层 locomotion):https://github.com/yang-zj1026/legged-loco
- 基准 VLN-CE-Isaac / NaVILA-Bench:https://github.com/yang-zj1026/VLN-CE-Isaac ,https://github.com/yang-zj1026/NaVILA-Bench
- 模型权重(8 帧 checkpoint):https://huggingface.co/a8cheng/navila-llama3-8b-8f
- 预训练起点:https://huggingface.co/a8cheng/navila-siglip-llama3-8b-v1.5-pretrain
- 数据集标注:https://huggingface.co/datasets/a8cheng/NaVILA-Dataset
一手源存档(sources/)
- navila-legged-robot-vla-navigation—github-readme — GitHub README 快照(RSS’25、SigLIP+Llama3-8B 预训练权重、训练/评测流程、数据结构)
- navila-legged-robot-vla-navigation—project-page — 项目主页快照(TL;DR、四点 highlights、Go2/G1/T1 真机结果、致谢)
- arXiv 原文 PDF(arXiv:2412.04453,不入 git):https://arxiv.org/pdf/2412.04453