一句话定位

PIVOT 把”用 VLM 做机器人控制/空间定位”重新表述成一个纯视觉多选题:在图像上叠加编号的候选动作(箭头/圆圈),让现成的 GPT-4V / Gemini 直接”选号”,再把被选中候选的分布重新拟合、生成下一轮更聚焦的候选并重复迭代——全程不训练任何网络参数,把连续动作输出问题转化成 VLM 最擅长的”看图选择题”。

背景与定位

这项工作要解决的核心矛盾是:VLM(GPT-4V、Gemini)只会吐文本,但机器人控制、定位、轨迹这些任务天然需要连续坐标输出。此前把 LLM/VLM 接入机器人的路线大体分两支——一支是 PaLM-E 式把动作直接编码进模型输出空间再微调(如 RT-2 把动作离散化成文本 token 微调 VLM),需要机器人专有训练数据;另一支是纯高层规划/生成代码/生成奖励(Code as Policies、VoxPoser、Language to Rewards 等),把底层控制留给下游控制器。PIVOT 走第三条路:不训练、不生成代码,直接让 VLM 在图像空间里做视觉定位式的选择

其直接技术前身是 Set-of-Mark prompting(Yang et al. 2023,用编号 mask 标注图像让 GPT-4V 做视觉定位)与”红圈可以让 CLIP 聚焦”(Shtedritski et al. 2023)——PIVOT 的区别在于候选不是外部感知系统生成的固定标注,而是从一个动作分布里采样、并随迭代不断按 VLM 反馈重新拟合,本质上是把交叉熵方法(CEM)搬到了”视觉提示”这一层,不需要任何独立感知模型或 VLM 之外的组件。同期的 Mobility VLA 走的是相反的分层解耦思路(长上下文 VLM 只负责在导览视频里找目标帧、经典 SLAM 做度量控制),而 PIVOT 让 VLM 本身直接生成看似连续的空间输出,两者代表了”零训练接入 VLM 做具身任务”的两种不同范式。

模型架构

PIVOT 本身不是一个模型,而是一个围绕现成 VLM 的迭代视觉提示算法(无需训练任何网络)

  • 核心映射 Ω(I, a₁:ₘ) → (Î, w₁:ₘ):给定图像观测 I 和一组候选动作 a₁:ₘ ∈ 动作空间 A,把每个候选投影为图像上的可视化标注(默认用从机器人本体或图像中心发出的编号箭头;3D 任务里箭头颜色/圆圈大小编码深度——偏红/圈小=远离相机前进,偏蓝/圈大=靠近相机后退),并给每个标注一个数字标签 w_j。
  • 优化目标:max_{a∈A,w} P_VLM(w | Î, ℓ),即找到一个动作使 VLM 选中它对应的标签,ℓ 为自然语言任务指令。
  • 迭代算法(Algorithm 1):初始化动作分布 A⁽⁰⁾=A;每轮 (a) 从 P_A⁽ⁱ⁾ 采样 M 个候选动作,(b) 用 Ω 投影标注到图像,(c) 用一次 VQA 查询 VLM(GPT-4V 为主,也测了 Gemini)“哪些编号最适合完成任务”,(d) 对被选中的候选拟合一个各向同性高斯分布作为下一轮 P_A⁽ⁱ⁺¹⁾;达到最大迭代数 N 后返回最优动作。文本提示用 chain-of-thought 让 VLM 先推理再总结出编号列表。
  • 鲁棒并行调用(3.3 节):单次 PIVOT 容易陷入局部最优,因此并行跑 E 个独立 PIVOT 实例得到 E 个候选动作,再用两种方式聚合:① 对 E 个候选重新拟合一个分布,② 再查询一次 VLM 从 E 个候选里选最优——论文默认用前者。
  • 动作空间随任务而变:移动操作机器人导航用 2D 方向(箭头从图像底部中心发出);移动操作机械臂 / Franka 机械臂操作用 4D 相对笛卡尔末端位姿 (x, y, z, 抓爪二值),箭头从末端执行器位置发出,z 维用颜色/箭头长度编码,旋转自由度固定不表达(论文明确指出这是视觉提示难以表达高维旋转的局限);RAVENS 仿真里则是俯视图上的取放像素坐标。
  • 默认超参:默认 10 个采样候选(消融显示样本数与视觉清晰度的权衡:更多样本覆盖更好但会造成图像上标注拥挤遮挡导致优化变差);文本提示顺序默认”前言 → 图像 → 任务描述”(消融中略优于其他顺序);分布拟合为各向同性高斯

数据

PIVOT 不训练任何网络,因此没有传统意义上的训练数据集;论文的”数据”全部是评测/消融用的采集或复用数据集

  • 移动操作机器人导航离线数据集:作者自建 60 条样本,来自实体机器人在室内环境的导航日志,人工标注图像空间中的目标位置真值;分三类——视野内寻物(in-view finding)、语义理解(semantic understanding,指令隐式指代视野内物体)、视野外寻物(out-of-view finding,目标当前不在视野但在过去帧中出现过)。
  • 移动操作机器人操作离线数据:复用 RT-X 数据集Open X-Embodiment)里的示范轨迹,抓取任务采样 10 条 episode,“移近”交互任务采样 30 条 episode,用余弦相似度对比 PIVOT 选出的动作方向与人类示范动作方向。
  • RefCOCO 视觉定位评测:从 RefCOCO testA split 随机抽取 1000 条样本,用 3 轮 PIVOT 迭代评测 GPT-4V 的指代定位精度。
  • 视觉标注鲁棒性合成数据集(附录 G):两套程序生成数据——① 白底 CV2 箭头(不同颜色/粗细/箭头大小/绝对方向组合);② 真实机器人场景里叠加物体指代箭头,物体按难度分 Easy/Medium/Hard/Very Hard 四档。
  • 实机评测(导航、操作、Franka、RAVENS)不需要预采集训练集,是在线闭环执行;无 sim-to-real 迁移、无跨本体联合数据混合(因为不存在需要联合训练的策略网络)。

训练方法

全文核心结论之一就是零训练:PIVOT 直接调用现成的 GPT-4V(默认)和 Gemini(用于规模消融),不做任何微调、LoRA、prompt-tuning 或蒸馏。所谓”方法”完全体现在推理时的提示词工程与迭代优化流程:

  • 文本提示消融(附录 D,Figure 13,操作领域):比较 zero-shot vs few-shot、chain-of-thought vs direct 四种组合,论文原话”neither is a panacea, though zero-shot chain of thought performs best, few-shot direct prompting performs similarly and is significantly more token efficient”——四种组合的平均响应长度分布在约 12–1049 字符之间,CoT 类响应明显长于 Direct 类(因需要先写出推理过程),但受限于图表标注方式,四个具体数值与四种组合的一一对应关系未能从 PDF 提取中可靠还原,故不在此逐一列出。
  • 视觉提示消融:对比”仅文本选项”(如操作任务里退化为选择 move “right”/“left”/“up”/“down” 四个文本方向)与 PIVOT 的图像标注方式,PIVOT 大幅优于纯文本基线(Figure 6b、Figure 7b)。
  • 迭代优化消融:迭代次数从 0/1 增加到 2、3 轮,配合并行调用数从 0 增加到 2、3,三个领域(导航、操作、RefCOCO)均一致地显示更多迭代 + 更多并行调用带来更高精度/成功率,且二者叠加效果最佳。
  • 规模消融(4.5 节):用 Gemini 家族 4 个不同尺寸(标记 a→d,参数量递增,具体数值未披露)在离线操作/导航评测上测第一轮视觉提示表现,观察到性能随模型尺寸单调提升——论文以此论证 PIVOT 是一个能随基座 VLM 能力提升而自动变强的框架,而非需要专门再训练的方法。

Infra(训练 / 推理工程)

  • 训练算力:不适用——无参数训练,直接调用 GPT-4V / Gemini 商用 API,论文未披露底层 VLM 自身的训练算力。
  • 推理:论文未披露具体的 QPS / 延迟 / 单次调用 token 数等工程指标;已知每轮迭代对每个并行实例需要至少一次 VLM 视觉问答调用,3 迭代 × 3 并行 = 最多 9 次 VLM 调用完成一次动作决策(不含内部可能的重试)。
  • 机器人本体:移动操作机器人(头部相机,导航 2D 动作 / 操作 4D 末端笛卡尔+抓爪)、Franka 机械臂(腕部相机,4D 相对笛卡尔+抓爪)、RAVENS 仿真(俯视相机,取放像素坐标)——均为闭环执行,无板载模型推理需求(计算在 VLM 云端完成)。
  • 未披露:GPU/加速卡配置、控制频率(Hz)、端到端单步延迟。

评测 benchmark

以下数值均取自论文正文与附录的一手实验(原始基线仅有”无迭代/无并行”这一档,论文未与其他已发表 VLA 方法做直接数值对比)。

① 移动操作机器人导航成功率(Table 1,真实机器人,4 个场景)

任务0 迭代 0 并行3 迭代 0 并行0 迭代 3 并行3 迭代 3 并行
去有纸巾盒的橙色桌子25%50%75%75%
不碰障碍去木质长椅25%50%75%50%
去更暗的房间25%50%75%100%
找地方坐下写字75%50%100%75%

② 移动操作机器人操作(Table 2,真实机器人,3 个任务,Reach / Steps / Grasp,“0 迭代 0 并行 → 3 迭代 0 并行 → 3 迭代 3 并行”):Pick coke can 的 Reach 50%→67%→100%、Grasp 0.0%→33%→67%、Steps 4.5→3.0→3.0;Bring the orange to the X 的 Reach 20%→80%→67%(该任务无 Grasp 指标);Sort the apple 的 Reach 67%→100%→75%(同样无 Grasp 指标)。三个任务均在”3 迭代 3 并行”或”3 迭代 0 并行”档位取得该任务的最佳 Reach,验证迭代与并行调用普遍提升抓取相关任务的成功率(但个别档位如 Bring-orange 在”3 迭代 3 并行”反而略低于”3 迭代 0 并行”)。

③ Franka 机械臂操作(Table 5,7 个任务,XY / YZ 到达成功率 / Steps):平均 XY 到达成功率从 25%(0 迭代 0 并行)→ 28%(3 迭代 0 并行)→ 34%(3 迭代 3 并行);平均 YZ 到达成功率 38% → 31% → 59%;平均完成步数 7.8 → 3.5 → 4.4。

④ 导航离线评测(Table 3/4,L2 误差,越低越好):视野内任务从 1 迭代 0 并行的 0.21±0.002 降到 3 迭代 3 并行的 0.17±0.009(最优);语义任务从 0.23±0.012 降到 0.19±0.025(1 迭代 0 并行)附近,3 迭代 3 并行为 0.19±0.01;视野外任务提升有限且不单调——最低点出现在 1 迭代 3 并行(0.37±0.01),继续增加迭代数/并行数未再改善(3 迭代 3 并行为 0.39±0.05),论文正文明确指出”增加并行调用或迭代次数在视野外任务上没有进一步带来显著提升”。图像标注 vs 纯文本基线对比(Table 4,均为 1 迭代 0 并行):视野内 0.21±0.002(图像)vs 0.26±0.15(文本),语义 0.23±0.012 vs 0.35±0.14,视野外 0.44±0.04 vs 0.46±0.31——图像标注方式误差更低且方差显著更小。

⑤ RefCOCO 视觉定位(Figure 5,1000 条 testA 样本,3 轮迭代):论文报告归一化 L2 距离与”选中圆圈落在真值框内”的准确率两个指标,图中显示首轮迭代已有较强表现,后续迭代带来适度提升(论文未给出可摘录的具体数字表格,仅以曲线图呈现)。

⑥ Gemini 规模消融(Figure 8):4 个 Gemini 尺寸(a→d,参数量递增)在操作(取物、把物体移到另一物体旁)和导航离线评测上的余弦相似度/L2 误差均随模型尺寸单调改善,验证 PIVOT 性能随基座 VLM 能力提升而自动提升。

⑦ 视觉标注鲁棒性(附录 G,Table 6/7):合成箭头方向分类(Table 6,白底 CV2 箭头)中,箭头粗细(2/4/6px)与箭头头大小(0.1/0.3/0.5)两个维度下 GPT-4V 对绝对方向的分类准确率普遍在 84–100%;但按具体对角方向(up-right/down-right/up-left/down-left)拆分时波动更大,多数在 50–100% 之间,其中蓝色箭头的 down-right 方向骤降到 17%(论文未特别解释此异常)。真实场景物体指代箭头选择(Table 7)随物体难度整体下降:Easy 档(盘子/箱子/方块)多数颜色下为 89–100%(但 orange 仅 0%);Very Hard 档(刷子等偏门物体)多数颜色降到 0–44%——反映 VLM 对箭头风格与场景/物体复杂度的敏感性。

基线对比范围有限:论文并未与 RT-2、Code as Policies、VoxPoser 等同类零样本/少样本具身方法做统一数值对比,主要消融对象是”迭代次数/并行数/文本-only/图像标注方式”等自身内部变体。

创新点与影响

  • 提出一种完全零训练、仅靠迭代视觉提示就能让现成 VLM(GPT-4V/Gemini)输出连续空间动作(机器人控制指令、定位坐标)的通用框架,把”输出连续值”问题转化为 VLM 最擅长的”多选题视觉问答”,不需要机器人专有数据、代码生成或独立感知模型。
  • 用交叉熵方法式的迭代重采样-重拟合,把 Set-of-Mark 式的单轮视觉标注扩展为在线优化循环,实验证明迭代次数与并行调用数二者叠加带来最大增益。
  • 通过 Gemini 多尺寸消融实证展示了该方法随基座 VLM 能力提升而自动改进(无需重新设计算法),为”更好的通用 VLM 出现后同一套 prompting 框架自动获益”提供了直接证据。
  • 论文自陈局限(4.6 节):(1) 3D/深度理解薄弱——尝试用颜色/标签大小编码深度,但当前 VLM 均无法可靠地基于深度做出选择,旋转等更高维空间进一步困难;(2) 交互与精细控制——闭环视觉运动任务中随着相机靠近目标物体,遮挡加剧导致抓取/推动等精细判断退化(如”物体被遮挡时不知道该不该抓”);(3) 贪婪/短视行为——多步决策任务中 VLM 倾向优先接近后续目标而非当前子目标(如”把苹果移到香蕉旁”却先靠近香蕉);(4) 视觉-语言连接推理错误——自回归解码导致 VLM 先输出编号、再”编造”看似合理但对应错误的推理过程。作者将这些列为未来工作方向(更复杂视觉标注、鲁棒优化工具、历史上下文引导等),而非通过本文方法本身解决。
  • 项目页面(2026-07-16 复核)显示:论文未公开 GitHub 训练/推理代码仓库,仅提供论文 PDF 与一个 HuggingFace Gradio 演示 Space(pivot-prompt/pivot-prompt-demo),且该 Space 当前处于 runtime error 状态、无法访问。

原始链接

一手源存档(sources/)

  • pivot—project-page — 项目主页快照(摘要、作者列表、演示 Space 现状确认为 runtime error,fetched 2026-07-16)
  • 论文全文见上述 arXiv 链接(arXiv 原文 PDF,不入 git)——HTML 版本不可用(LaTeX 转换失败,arxiv.org/html/2402.07872v1 404),已用 PDF 全文(pdftotext -layout)核对全部表格数值。