一句话定位
在导航基座模型 NavFoM 上,给具身视觉追踪(EVT)任务加一个只花一个 token 的”极坐标思维链”(Polar-CoT)和一个置信度门控的目标身份记忆(TIM),让模型在严重遮挡、多个外观相似的干扰者面前仍能保住”到底在追谁”。
背景与定位
具身视觉追踪(Embodied Visual Tracking, EVT)要求智能体依据视觉观测持续追随一个动态目标,早期方法是”视觉基础模型(SAM/GroundingDINO 等)做感知 + 强化学习做规划”的解耦范式。近两年出现了 VLA 化的端到端方案:TrackVLA(该论文一代)把识别与规划统一进一个 VLA 框架,用锚点式扩散策略解码轨迹;LOVON 则用 LLM 做高层规划、拆解指令给低层运动模型执行。作者指出这两个代表性方法都缺乏显式的空间推理能力和长时程目标身份记忆,在复杂/无结构场景(尤其严重遮挡或多个视觉相似的干扰物)下会失败。
TrackVLA++ 的定位是给 TrackVLA 这条线补上”推理”与”记忆”两块短板,骨架直接建立在导航基础模型 NavFoM 之上,面向的评测集是同一批作者此前发布的 EVT-Bench,以及 Gym-UnrealCV 基准。论文强调其思维链设计与操作(manipulation)类 VLA 常见的”生成详细文本计划 / 物体边界框 / 子目标图像”式 CoT 不同——那类做法推理开销大,不适合追踪这种高动态任务,因此本文把推理压缩成一个 token。
模型架构
TrackVLA++ 是构建在导航基础模型 NavFoM 之上的端到端 VLA,LLM 主干为 Qwen2-7B。
- 观测编码:多视角(N 路相机)在线视频流经 SigLIP + DINOv2 双编码器提取视觉特征,再用 grid pooling 策略生成两种分辨率的表征——当前帧高分辨率精细特征
V_fine ∈ R^{64×C},历史帧粗粒度特征V_coarse ∈ R^{4×C}(C 为通道维度)。 - 双记忆结构:短期记忆沿用 TrackVLA 的滑动窗口做法,取 k=32 帧拼成当前追踪序列
V_track = {V_{T-k}^coarse, ..., V_{T-1}^coarse, V_T^fine};长期记忆则是本文新增的定长 Target Identification Memory(TIM)。两路特征经同一个 2 层 MLP 投影器P(·)映射进 LLM 的 latent 空间,分别得到E_T^V和E_T^M。 - Polar-CoT(极坐标思维链):把智能体可感知的环形视野(半径 0.6m–5.0m)离散化为 60 个角度 × 30 个距离 的网格,每个”角度×距离”组合对应词表里唯一的一个特殊 token;词表额外扩展一个
<invalid>token,用来显式标记目标被遮挡或超出视野。视觉 embeddingE_T^V、长期记忆 embeddingE_T^M与语言 tokenE^L拼接后送入 LLM,只生成一个 reasoning tokenE_T^CoT = LLM(Concat[E_T^M, E_T^V, E^L])。与常见 CoT(生成文本计划、bbox 等中间产物)相比,这个设计的核心卖点是”只多花一个 token 的推理开销”,且在多相机场景下天然规避了不同视角边界框互相冲突/冗余的问题。 - Target Identification Memory(TIM):置信度门控的记忆更新,
M_T^TIM = (1-w_T)·M_{T-1}^TIM + w_T·f_{T-1},候选特征f_{T-1}是 Polar-CoT 预测出的目标区域对应的精细视觉特征;权重w_T = C_{T-1} / (C̄_{T-2} + C_{T-1}),其中C̄_{T-2}是历史平均置信度。置信度C_{T-1} = 1 - H(softmax(P)) / log K由 reasoning token 在 K 大小词表上 logits 的归一化熵定义——分布越接近 one-hot(确信),C→1,更新权重越大;分布越平坦(不确定),C→0,记忆更新被抑制。<invalid>token 会强制把该步置信度置零,从而冻结记忆、保留上一个可靠状态直到目标被重新确信识别。TIM 初始为空态,T=2时用首个有效特征f_1初始化。默认 TIM 用 4 个 token 编码。 - 动作头:reasoning token、更新后的 TIM token、视觉 token、语言 token 拼接后再过一次 LLM,得到 action token
E_T^pred = LLM(Concat[E_T^M, E_T^V, E^L, E_T^CoT]),由 MLP 动作头解码出 8 个未来 waypoint 组成的轨迹W_T,每个 waypoint 是智能体自中心坐标系下的(x, y, θ)(位移 + 朝向变化)。 - 训练目标:
L = L_traj + α·L_reason + β·L_text,α=0.2, β=0.5(经验设定);L_traj是预测 waypoint 与真值 waypoint 的 MSE 求和;L_reason是 reasoning token 的对数似然(交叉熵);L_text是常规文本预测损失(用于 QA 协同训练部分)。
数据
- Polar-CoT 追踪数据:在 Habitat 3.0 模拟器中,基于 EVT-Bench 训练集划分,构造了 100 万条多视角具身视觉追踪样本。每条样本包含多视角 RGB 追踪历史、目标描述、Polar-CoT 标注(每个时间步目标相对角度 θ、距离 d)以及对应的专家轨迹
W_gt。若目标在某视角下的语义掩码像素数低于阈值 2500 像素,该视角被标记为遮挡/过远,打上<invalid>标签。数据增强上对相机位置、高度、视场角(FoV)做随机化,同时对相机视角本身做随机采样(前置相机数据始终保留,其余视角随机采样)以增加多样性。 - QA 协同训练数据:沿用 TrackVLA 的做法,追踪数据与 QA 数据按 1:1 配比共训,以增强开放世界识别能力。QA 部分共 100 万条,构成为:29.4 万条来自 SYNTH-PEDES 的人物身份识别样本、20.5 万条基于图像的 QA 样本、50.1 万条基于视频的 QA 样本(取自公开数据集)。
- 合计:追踪数据(100 万)+ QA 数据(100 万)= 200 万条训练样本,仅训练 1 个 epoch(参照 VLM 训练惯例)。
- 论文特别指出:NavFoM 用了 1000 万条轨迹训练,而 TrackVLA++ 用少得多的数据量就在 EVT-Bench 上全面超过 NavFoM,强调其数据效率。
训练方法
- 单阶段端到端训练,联合优化轨迹规划损失(MSE)、推理 token 损失(交叉熵)与文本 QA 损失,权重 α=0.2、β=0.5。
- 训练数据整体只跑 1 个 epoch。
- TIM 的记忆更新不是通过额外训练的门控网络学出来的,而是由 Polar-CoT 输出 token 的**分类置信度(归一化熵)**直接解析式地计算权重——这是一种推理时的确定性更新规则,而非可学习参数;唯一被训练的是产生高质量、置信度可靠的 reasoning token 分布这件事本身(通过
L_reason)。 - 消融确认:Polar-CoT 模块单独把 DT split SR 从 65.2% 提到 71.2%(+6.0%);TIM(4 token)在此基础上再贡献 +2.8%(71.2%→74.0%)。
Infra(训练 / 推理工程)
- 训练:8 张 NVIDIA H100 GPU,训练约 1 天,总计 192 GPU-hours。并行策略、精度设置论文未披露。
- 部署硬件:真机搭载在 Unitree GO2 四足机器人上,配 4 个 SG3S11AFxK 相机做多视角 RGB 流采集;视频流传到装有 NVIDIA RTX 4090 的远程服务器上做推理(生成 Polar-CoT token 与轨迹 waypoint)。
- 推理速度:TrackVLA++ 4.8 FPS,与 NavFoM(5.1 FPS)相当;比 SoM+GPT-4o 这类基于 GPT 的基线快约 48×。Polar-CoT 模块本身带来的开销是 4.8 FPS vs 不带 Polar-CoT 时的 5.2 FPS(约 -0.4 FPS),换来识别准确率从 83.0%→87.5%。
- 控制 Hz / 端到端延迟数值:论文未披露。
评测 benchmark
EVT-Bench(Table I,SR↑/TR↑/CR↓,STT=单目标追踪、DT=干扰追踪、AT=歧义追踪)
单视角(single view)对比 IBVS†、PoliFormer†、EVT/EVT‡(SoM+GPT-4o 做感知)、Uni-NaVid、TrackVLA、NavFoM(single view):
| 方法 | STT SR | STT TR | STT CR | DT SR | DT TR | DT CR | AT SR | AT TR | AT CR |
|---|---|---|---|---|---|---|---|---|---|
| TrackVLA | 85.1 | 78.6 | 1.65 | 57.6 | 63.2 | 5.80 | 50.2 | 63.7 | 17.1 |
| NavFoM(single view) | 85.0 | 80.5 | - | 61.4 | 68.2 | - | - | - | - |
| Ours(single view) | 86.0 | 81.0 | 2.10 | 66.5 | 68.8 | 4.71 | 51.2 | 63.4 | 15.9 |
四视角(four views)对比 NavFoM(four views):
| 方法 | STT SR | STT TR | STT CR | DT SR | DT TR | DT CR | AT SR | AT TR | AT CR |
|---|---|---|---|---|---|---|---|---|---|
| NavFoM(four views) | 88.4 | 80.7 | - | 62.0 | 67.9 | - | - | - | - |
| Ours(four views) | 90.9 | 82.7 | 1.50 | 74.0 | 73.7 | 3.51 | 55.9 | 63.8 | 15.1 |
即论文摘要所述:DT split 上四视角设置相对上一代最优方法(NavFoM four views 62.0%)提升到 74.0%,提升 +12 个百分点;单视角设置相对上一代最优方法(NavFoM single view 61.4%,而非 TrackVLA 的 57.6%)提升到 66.5%,+5.1 个百分点。
Gym-UnrealCV 零样本泛化(Table II,前视单相机,EL↑ 最大 500 / SR↑):对比 DiMP、SARL、AD-VAT、AD-VAT+、TS、EVT、TrackVLA。TrackVLA++ 在 Single Target / Unseen Objects 两项取得满分(EL=500, SR=1.00,与 TrackVLA 打平),在更难的 Distractor 项上 EL=484, SR=0.92,优于 TrackVLA 的 EL=474, SR=0.91。
视觉识别基准(Table III,SYNTH-PEDES 未见过的人物图像二选一,ACC↑/FPS↑):对比 RexSeek(54.3%,1.1FPS)、LISA++(78.2%,0.6FPS)、SoM+GPT-4o(82.4%,0.1FPS)、TrackVLA(80.7%,10FPS)、NavFoM(84.0%,5.1FPS)。TrackVLA++(去掉 Polar-CoT 的消融版本)83%/5.2FPS;完整 TrackVLA++ 达到 87.5% / 4.8FPS,SOTA 准确率,速度仍保持在同量级。
真实世界(V-C):在 Obstacle(遮挡再识别)、Winding Path(复杂蜿蜒轨迹)、Distractor(人形干扰者)三个真机场景上,TrackVLA++ 相对 TrackVLA 的成功率分别提升 14%、7%、17%(论文以柱状图给出,未列具体成功率数值表)。
消融(Table IV,EVT-Bench DT split 四视角,SR↑/TR↑/CR↓):
| 配置 | SR | TR | CR |
|---|---|---|---|
| TrackVLA(基线) | 57.6 | 63.2 | 5.80 |
| NavFoM(four views) | 62.0 | 67.9 | - |
| TrackVLA++(完整) | 74.0 | 73.7 | 3.51 |
| w/o Polar-CoT & TIM | 65.2 | 64.8 | 8.17 |
| w/o TIM(仅 Polar-CoT) | 71.2 | 69.8 | 4.74 |
| w TIM(16 tokens,而非默认 4) | 74.2(+0.2) | 73.4(-0.3) | 3.27(-0.24) |
结论:Polar-CoT 单独贡献 SR +6.0%(65.2%→71.2%),TIM(4 token)再贡献 +2.8%(71.2%→74.0%);把 TIM token 数从 4 扩到 16 几乎没有额外增益,说明 4 个 token 已经足够紧凑地保住目标身份表征。
创新点与影响
- Polar-CoT:把 EVT 任务的空间推理压缩成”一个 token”的极坐标离散表示(角度×距离网格 +
<invalid>标记),既避免了操作类 VLA 常见 CoT(文本计划/bbox/子目标图像)的推理开销,又天然解决了多相机场景下 bbox 式方法容易出现的跨视角冲突/冗余问题。 - TIM:用 reasoning token 的分类置信度(归一化熵)做门控权重,以解析式(无需额外可学习门控网络)的方式实现”高置信度才更新记忆、低置信度冻结记忆”的长时程目标身份保持机制,直接针对”严重遮挡 + 外观相似干扰物”这一失败模式设计。
- 用远少于 NavFoM(1000 万轨迹 vs 本文约 200 万样本,其中一半是 QA)的训练数据,在 EVT-Bench 全部子任务、单/多相机设置下取得 SOTA,体现方法本身(而非单纯堆数据规模)带来的增益。
- 论文自述局限:未给出显式的失败模式分析或跨数据集(超出 EVT-Bench/Gym-UnrealCV 之外)的更广泛泛化实验;TIM token 数增至 16 未带来提升的原因未做进一步机制性解释,只归因于”4 token 已足够紧凑”。项目页面代码/权重在本次抓取时未公开(GitHub、HuggingFace 链接均为空)。
原始链接
- arXiv 摘要页: https://arxiv.org/abs/2510.07134
- arXiv PDF: https://arxiv.org/pdf/2510.07134
- 项目页: https://pku-epic.github.io/TrackVLA-plus-plus-Web/
一手源存档(sources/)
- trackvla-plus-plus—project-page — 项目主页快照(sources/embodied/2025/trackvla-plus-plus—project-page.md)
- arXiv 原文 PDF/HTML(https://arxiv.org/abs/2510.07134),不入 git