一句话定位

Uni-NaVid 是第一个统一四种具身导航任务(VLN、ObjectNav、EQA、人物跟随)到单一视频 VLA 模型的方案:仅吃单目 RGB 视频流 + 自由语言指令,用同一套 next-token-prediction 在线输出未来 4 步低层动作或语言回答;训练用 861 个场景采集的 3.6M 导航样本(+2.3M 网络 VQA 数据 co-training,共 5.9M),推理靠在线视觉 token 合并做到约 5 Hz / 0.2s 单次前向,在四个任务的公开 benchmark 上全面刷新 SOTA,并在真实 Unitree GO2 机器狗上零样本完成混合长程指令。RSS 2025。

背景与定位

具身导航长期分裂成四条互不相通的任务线——VLN(跟随语言指令到目的地)、ObjectNav(找物体)、EQA(导航后回答问题)、人物跟随(识别并跟踪移动目标)——此前工作要么只做单任务专用模型,要么在离散图 + 预定义路点的简化设定下做初步统一(如 NaviLLM、InstructNav、VLMaps),牺牲了输出灵活性、难以支撑真实机器人的连续控制。

Uni-NaVid 由同一 PKU-EPIC / Galbot / BAAI 团队在前作 NaVid(RSS 2024,首个视频 VLM 做 VLN-CE、RGB-only、砍掉里程计/深度/地图)之上做任务级扩展:把 NaVid 的”视频输入→语言化动作输出”范式从单一 VLN 任务,推广到四个任务的统一输入输出格式,并针对长视频历史新增了在线视觉 token 分级合并机制以支撑更长时序、更高频的在线部署。论文将其定位为”完整栈(full-stack)导航智能体”,是继 NaVid 之后向通用导航生成式模型迈进的下一步。

模型架构

Policy backbone = 视频 VLM:视觉编码器(EVA-CLIP)+ 跨模态投影器 + LLM(Vicuna-7B),继承 NaVid/LLaMA-VID 一脉但用分级 grid pooling 取代 NaVid 的 instruction-queried token 分支。

  • 视觉编码: 每帧经 EVA-CLIP 得到视觉 token Xt ∈ R^(256×C)(patch 数 Nx=256,对应 224×224 输入分辨率,与 HF 权重目录名 uninavid-7b-full-224-video-fps-1-grid-2 一致),再经跨模态投影器 P_V 对齐到语言空间,得到 observation token E^V_t。
  • 在线视觉 token 合并(Online Visual Token Merging,核心设计): 借鉴 Atkinson-Shiffrin 记忆模型,把视觉 token 按时间距当前帧的远近分三类,各自用不同 grid pooling 比例压缩:
    • 当前帧(curr):α=2,256→64 tokens
    • 短期记忆(short,缓冲区长度 B=64 帧):α=8,每帧压到4 tokens
    • 长期记忆(long):α=16,每帧压到1 token。 新帧到达时,当前帧的旧 token 池化进短期记忆,短期记忆里最老的一帧再池化成 1 个长期 token;若该长期 token 与已有最新长期 token 的余弦相似度 > τ=0.95,则按已合并帧数 K 做加权平均合并(而非新增),否则新插入——由此长期记忆长度 M 远小于 T-B-1,实现计算量不随时序线性增长。
  • 动作头: 特殊 token <NAV> 提示 LLM 切到导航模式,输入格式为 {长期帧}{短期帧}{当前帧}<NAV>{指令},一次性输出 4 个离散动作 token(foresight prediction,k=4),动作集合为 {FORWARD, TURN-LEFT, TURN-RIGHT, STOP}(FORWARD=25cm,转向=30°,与主流 Habitat 设定一致)。相比逐步预测,一次出 4 步支持异步、非阻塞执行。
  • 多任务共享同一输出空间: EQA 任务下模型先输出动作到达目标区域并 STOP,再去掉 <NAV> token、用导航历史直接查询问题得到语言回答;VLN/ObjectNav/Following 均只输出动作 token。

数据

训练总量 5.9M:3.6M 导航样本(4 个子任务)+ 2.3M 网络视频 QA/caption 数据(co-training,来自 ScanQA、LLaMA-VID 与 Panda-70M 一类数据集)。导航数据全部来自 861 个合成场景(Habitat-Matterport 3D + Matterport 3D),机器人高度范围 0.88–1.25m、半径 0.1–0.6m 随机化以避免过拟合特定机身。

四个子任务明细(均在 Habitat 模拟器中采集):

  • VLN(2.4M): 基于 VLN-CE R2R + RxR。其中 0.64M 为跟随 GT 轨迹渲染的样本;1.69M 用 DAgger 采集(部署训练中的 Uni-NaVid 到训练集环境,用确定性路径规划器给专家动作纠偏,获得更贴近部署分布的多样轨迹);另有 70k 低层动作指令子集(从已采集的短轨迹(<20 步)中采样,把指令改写成”前进 4 步、右转 3 步”式的低层描述)。
  • ObjectNav(483k): 在 HM3D 训练集中部署 L3MVN 做 rollout 采集成功轨迹(目标类别:chair, couch, TV, toilet, bed, plant),指令模板”Search for a/an [Object].”。论文指出若改用最短路径渲染样本,SR 骤降到 30.1%——因为模型学不到探索/纠错能力,必须用 rollout 轨迹。
  • EQA(240k 视频-动作 + 10k 视频-问答 = 250k): 基于 MP3D-EQA 数据集,视频-动作样本渲染自 GT 轨迹(问题当指令),视频-问答样本渲染完整轨迹并用 GT 答案做监督。
  • 人物跟随(544k): 基于 Habitat 3.0 社交导航环境自建,每个 episode 随机 2–6 个人、随机分配目标 ID 与指令、随机生成多个路点,机器人须持续跟踪目标位置并避障。

指令增强: 用 ChatGPT 对原始模板化指令做复述改写(保持语义、丰富句式),带来 VLN +2.31% SR、ObjectNav +3.7% SR 的增益。数据规模消融(Fig. 5b)显示从 3M 扩到 6M 样本各任务性能持续提升,但 3M→6M 段增益边际递减,作者归因于模拟器数据多样性有限。

训练方法

  • 两阶段流程(沿用 NaVid 策略):第一阶段只训跨模态投影器(Image QA 数据,来自 LLaMA-VID 与 Panda-70M);第二阶段联合训练投影器 + LLM,先用 Video QA 数据,再用采集到的导航数据。
  • EVA-CLIP、Vicuna-7B 均加载各自预训练权重,仅优化可训练参数,训练 1 个 epoch
  • 视频采样率 1 FPS(去除相邻帧冗余)。
  • 消融验证的关键设计(Table 9,四任务 SR/ACC):
    • 去掉 <NAV> special token:VLN 35.2 / ObjNav 69.1 / EQA 20.4 / Follow 55.1(相比全量 48.7/73.7/47.3/61.2 全面下降,EQA 掉幅最大——模型分不清该输出动作还是直接回答);
    • 去掉 VQA 数据:VLN 40.5 / ObjNav 50.6 / EQA 1.19 / Follow 58.8(EQA 几乎归零,因为回答问题的语言能力严重依赖网络 VQA 数据);
    • 仅当前帧记忆(无短期/长期):VLN 9.61(相对全量 -80.3% SR)/ ObjNav 44.3 / EQA 32.5 / Follow 56.3(Follow 仅 -8% SR,因为跟随任务更依赖近期帧而非长历史);
    • 当前+短期(无长期):VLN 39.7 / ObjNav 67.8 / EQA 44.1 / Follow 59.7。
  • token 数与 τ 消融(Table 15,supplementary,默认当前帧 64 token / 短期每帧 4 token / τ=0.95):当前帧降到 4 token:VLN 43.4 / ObjNav 50.2 / EQA 40.5(Follow 全部失败,标记”-”);当前帧再降到 1 token:VLN 35.1 / ObjNav 45.3 / EQA 31.2(Follow 仍全部失败)——论文指出人物跟随任务因当前帧 token 太少而无法捕捉人体运动信息;短期记忆降到每帧 1 token:VLN 46.2 / ObjNav 69.2 / EQA 44.9 / Follow 60.3(低于默认全量但未崩溃);τ=0.9 时 VLN 40.2 / ObjNav 70.0 / EQA 43.2 / Follow 57.8,τ=0.95(默认)VLN 48.7 / ObjNav 73.7 / EQA 47.3 / Follow 61.2,τ=0.99 时 VLN 49.6 / ObjNav 70.2 / EQA 48.1 / Follow 57.2(τ 越大保留越多长期 token,多数任务受益但并非单调)。

Infra(训练 / 推理工程)

  • 训练: 40 张 NVIDIA H800,约 35 小时,合计 1400 GPU-hours,1 epoch。并行策略/精度论文未披露
  • 推理(离线单次前向): 平均 约 0.2 秒生成下 4 步动作(对比同类视频 LLM 如 LLaMA-VID / NaVid 依赖耗时的 QFormer 操作,随视频变长耗时显著增长;Uni-NaVid 因在线 token 合并保持近乎恒定的推理时间——见论文 Fig. 9 时间分析)。
  • 推理(真实部署,单卡 A100): 模型部署在远端服务器(NVIDIA A100),机器人通过 Wi-Fi 异步上传压缩图像、接收动作指令;模型侧推理约 0.2s,加上网络传输(图像发送+指令接收)约 0.3s;GitHub 开源代码口径称在单张 A100 上整体可达约 5 Hz 推理速度,与论文 Conclusion 所述”5 Hz 平均速度”一致。
  • 真实机器人平台: Unitree GO2 机器狗,头部搭载 Intel RealSense D455(仅用 RGB,640×480,90° HFOV),背部搭载便携 Wi-Fi 用于和远端服务器通信;机身自带 LiDAR-L1 仅用于本地运动规划(避障/底层控制),不作为模型输入——模型本身不依赖任何里程计或深度。
  • 非阻塞执行: 每次推理输出 4 个动作命令,机器人顺序执行同时持续上传新图像;若同一时刻有多批命令生成,机器人优先执行最新一批(反映最新规划结果)。

评测 benchmark

以下数字全部来自 arXiv 论文正文与补充材料表格。

① VLN-CE R2R Val-Unseen(Table 2,仅 S.RGB 输入组内对比):

方法观测TLNE↓OS↑SR↑SPL↑
Seq2SeqRGB+Depth9.307.7737.025.022.0
CMARGB+Depth8.647.3740.032.030.0
NaVidRGB only7.635.4749.137.435.9
Uni-NaVidRGB only9.715.5853.347.042.7

对比 NaVid(同为仅 RGB 训练在 VLN 数据上的视频 VLM),SR +25.7%(相对提升,(47.0-37.4)/37.4)。用全景+里程计+深度、高层动作空间的 ETPNav(SR 57.0/SPL 49.0)仍领先,但 Uni-NaVid 仅用单目 RGB + 低层动作即可缩小到同一量级的差距。

② VLN-CE RxR Val-Unseen(Table 3): Uni-NaVid TL 15.8 / NE 6.24 / OS 55.5 / SR 48.7 / SPL 40.9,对比 NaVid(SR 23.8 / SPL 21.2)与零样本 A²Nav(SR 16.8 / SPL 6.3),均大幅领先。

③ HM3D ObjectNav(Table 4): Uni-NaVid SR 73.7 / SPL 37.1;此前最佳 PIRLNav-IL-RL SR 70.4 / SPL 34.1。SR +4.7%、SPL +8.8%(相对提升)。

④ MP3D-EQA(Table 5): Uni-NaVid 在连续环境(C.E.,更难,无预定义路点图)设定下 ACC 47.3,仍高于在离散环境(D.E.,简化设定)下评测的 NaviLLM(ACC 44.5);给定 GT 导航轨迹时 Uni-NaVid ACC 提升到 54.4(同条件下 NaviLLM 47.4、EQA(habitat-lab) 46.0)。

⑤ Human Following Dataset(自建,基于 HM3D,Table 6): Uni-NaVid SR 61.21 / FR 71.93 / CR 2.07;最佳基线 IBVS†(用模拟器 GT bbox)SR 50.58 / FR 68.89 / CR 0.80。SR +21.0%、FR +4.4%(相对提升,即使基线用了 GT bbox 而 Uni-NaVid 全靠隐式感知)。

⑥ ScanQA 具身视频问答(Table 7): Uni-NaVid EM 28.01 / BLEU-1 46.85 / ROUGE 45.74 / METEOR 19.24 / CIDEr 94.72,相比此前最佳(NaviLLM/BridgeQA)分别提升 BLEU-1 +17.9%、ROUGE +5.7%、METEOR +16.2%、CIDEr +13.1%;EM 指标(要求精确匹配)不利于该模型的开放式生成风格,故略低于 BridgeQA 的 31.29。

⑦ 通用视频问答(MSVD-QA/MSRVTT-QA/ActivityNet-QA,Table 8): Acc/Score 分别为 69.6/3.9、59.3/3.5、51.4/3.7,与专用视频 LLM(ST-LLM 等)比处于同一档位、部分指标(ActivityNet-QA)反超。

⑧ 真实世界 VLN(Table 10,两类各 25 条指令): 简单指令(单一路标)NaVid 80% vs Uni-NaVid 92%;复杂指令(多条简单指令组合)NaVid 20% vs Uni-NaVid 84%

⑨ 补充实验(Supplementary):

  • 跨数据集 RxR(Table 11,训练时排除 RxR): Uni-NaVid SR 29.5 / SPL 28.1(显著低于含 RxR 训练时的 48.7/40.9,作者归因于 RxR 轨迹长度分布(2–20m)远比 R2R(约 10m 均匀)多样);
  • HM3D-OVON 开放词表 ObjectNav(Table 12,零样本): Val Unseen SR 39.5/SPL 19.8,优于零样本基线 VLFM(SR 35.2/SPL 19.6)与 DAgRL+OD(SR 37.1/SPL 19.8);
  • OpenEQA(Table 13): Uni-NaVid ALL 40.3(ScanNet 41.4 / HM3D 38.1),接近 GPT-4V 多帧方案(49.6),远低于人类(86.8);
  • 跨环境人物跟随(Table 14): HF-HSSD SR 81.65/FR 89.34/CR 1.33,HF-MP3D SR 69.80/FR 78.96/CR 2.99,均优于 IBVS/PoliFormer 各变体。

创新点与影响

  • 首个统一四种具身导航任务的视频 VLA:把 VLN、ObjectNav、EQA、人物跟随的输入输出格式统一到同一 token 序列上做联合训练,论文消融证明多任务学习带来协同增益(VLN/ObjectNav/EQA 增益明显、Following 增益较小,因其更依赖近期而非历史)。
  • 在线视觉 token 分级合并:用”当前/短期/长期”三级记忆 + 相似度阈值合并,把视频历史压缩到远小于原始长度的 token 数,在维持长时序信息的同时把单次推理稳定在约 0.2s(~5Hz),显著优于依赖 QFormer 类操作、随视频变长而变慢的既有视频 LLM。
  • foresight 多步预测支持非阻塞真实部署:一次输出 4 步动作 + 异步执行/上传,解决了纯逐步推理在真实机器人上的阻塞延迟问题。
  • 作者自述局限(Conclusion):论文明确表示未来方向是把该统一建模进一步扩展到操作(manipulation)与导航的联合技能学习,当前仅覆盖导航侧四任务;ObjectNav 未引入强化学习微调(作者提到 PIRLNav/Poliformer 式 RL 后训练可能进一步提升,本工作未做);跨数据集实验(Table 11)显示模型对训练时未见过的轨迹长度分布仍有明显性能损失,暴露了纯模拟数据在轨迹多样性上的局限。

原始链接

一手源存档(sources/)