一句话定位
RoboVQA 是 Google DeepMind 提出的一套跨具身、长时程机器人视觉问答(VQA)数据集 + 基准 + 采集方法论:在 3 栋办公楼里用机器人、人手、人手持抓取工具 3 种具身持续执行任意用户长时程请求,把数据吞吐做到传统自顶向下逐步采集方法的 2.2 倍(机器人)/ 13.8 倍(人体),产出 829,502 条 (视频,文本) 对;同时提出**干预率(intervention rate)**这一可分解为「认知」与「物理」两部分的真机评测指标,并训练了一个基于 VideoCoCa 的视频条件模型 RoboVQA-VideoCoCa(383M)来验证数据与指标的有效性。
背景与定位
2023 年前后,PaLM-E、SayCan 等工作已证明大模型可以做机器人高层推理,但作者提出一个尖锐的问题:这些在通用多模态数据集上训练的 SOTA VLM,零样本(zero-shot)直接搬到真实机器人场景时到底表现如何?RoboVQA 的答案是:差距很大——这也是论文的核心论点,即真实世界的落地仍需要新的大规模数据采集,而不是仅靠更强的通用 VLM。
与此前「自顶向下」的窄域采集范式(如 RT-1/SayCan 用小规模固定的 60 个任务清单)不同,RoboVQA 采用「自底向上」范式:真实用户在办公楼里提出任意长时程请求(“can you make me a coffee please?“),操作员遥操作机器人完成,再靠众包做事后(hindsight)时间分段与指令标注,最后从已知的过去/未来任务序列自动免费生成多种类型的问答对——这一构造方式本身就是一种链式思考(Chain-of-Thought)监督,将高层目标分解为可观察的中间步骤。
对比同期数据集:Ego4D(同为第一视角、密集叙述标注)是最相似的先驱,但 RoboVQA 的差异在于同一环境下同时采集人类和机器人交互,且聚焦机器人可执行的任务;TEACh 同样含交互式对话但数据在仿真环境采集,RoboVQA 则在真实厨房/办公环境。论文也与 SayCan、Grounded Decoding 两种「LLM + 视觉可供性函数」规划方法直接对比,并将 RoboVQA-VideoCoCa 反过来作为它们的可供性函数使用。
模型架构
论文本身的核心贡献是数据集与基准,配套模型 RoboVQA-VideoCoCa 用于验证数据有效性:
- 骨干:由 VideoCoCa(一个从 CoCa 扩展出的视频语言模型)衍生而来,采用编码器-解码器架构,同时结合对比预训练(类似 CLIP)与生成式预训练(类似 SimVLM)两种目标,在视频与文本模态之间建立联系。
- 规模:默认使用 VideoCoCa base,383M 参数;初始 checkpoint 为在图像描述(image-captioning)任务上预训练的权重(与 VideoCoCa 原论文一致),随后在 RoboVQA 视频-文本数据集上微调。
- 视频条件(ACTION 无关,纯感知-语言):本模型不输出底层动作,只做高层认知问答/规划文本输出;论文对比了 1/2/4/8/16 帧的输入配置,发现帧数越多时序建模越充分、误差越低,默认取 16 帧。
- 无独立动作头:真机部署时依赖外部策略(policy X,评测 #3 中用于闭环控制),论文未披露该策略的架构细节。
- 跨具身:模型不区分具身类型,直接在机器人+人手+人手持工具三种视频上联合训练/评测,验证知识可跨具身迁移。
数据
- 采集规模:3 栋办公楼、3 种具身(机器人、人单臂、人持抓取工具),共 238.0 小时视频(约 10 天);5,246 条长时程 episode、92,948 条中时程 episode。
- 指令多样性:29,520 条 unique 指令(=2,722 条 unique 长时程指令 + 26,798 条 unique 中时程指令)。
- 具身拆分:机器人 2,350 episode(44.8%,时长 185.3 小时);人类 2,896 episode(55.2%,时长 52.7 小时)。
- 建筑分布:Building 1 占 60.8%(3,190 episode)、Building 2 占 28.7%(1,507)、Building 3 占 9.2%(485)、未知建筑 1.2%(64)。
- 平均时长:长时程 episode 均值 102 秒(文本正文口径),中时程 episode 均值 14 秒(附录统计表口径为 14.2 秒,验证集 13.5 秒)。
- 训练/验证/测试划分:训练集 5,046 episode / 798,429 (video,text) 对;验证+测试合计约 100 episode / 18,248 对(人工评估自由文本答案成本高,故刻意控制验证/测试规模都在约 1,000 条 VQA 条目、来自各 50 个 episode);场景可有重叠但 episode 无重叠。
- VQA 任务类型:采集流程可自动生成 10 种问答子类型(Fig.1:规划/带上下文规划/成功正负例/可供性判别正负例/可供性生成/未来预测等),在基准图表中汇总展示为 8 大类(Planning、Planning with Context、5-Step Planning、Success、Discriminative Affordance、Generative Affordance、Past Description、Future Prediction)。
- 过滤/整理:为避免过于重复简单的长时程 episode,过滤掉连续 5 步以上完全相同中时程步骤的 episode,之后观察到泛化性提升。
- 语言统计(附录 IX-B,全量数据集口径):2,862 个 unique 物体、680 个 unique 动词、3,322 个 unique 位置/空间关系、901 个 unique 属性;另有附录 IX-E 一个独立的 LLM 提取分析(仅针对训练集短时程指令,方法与 IX-B 略有不同)报告 1,795 个物体、494 个动作、2,064 个位置、462 个属性——两组数字均直接来自原文,未做协调,仅口径不同。
- 动作标注:机器人 episode 含真实电机指令(用于低层策略),但本论文聚焦高层认知任务,未对动作做进一步标注披露。
- 无仿真数据:全部为真实环境采集,无 sim-to-real 混合。
- 数据配比实验(附录 IX-C,固定采集预算 50 万条 VQA 对话):
- 机器人-人类采集成本比 1.0 时:robot250k+human250k 混合在机器人测试集误差 62.4%,对比纯 robot 500k 的 62.7%(几乎无损失),但在人类测试集上混合模型误差 53.9% 远低于纯 robot 模型的 67.0%。
- 成本比 4.0 时:robot62k+human250k 混合在机器人测试集误差 65.3%,对比纯 robot 125k 的 63.5%;人类测试集上混合 51.1% vs 纯 robot 68.7%。
- 结论:固定预算下混入更便宜的人类数据几乎不损失机器人测试表现,同时显著提升跨具身泛化能力。
训练方法
- 目标函数:本质是视频到文本的生成式微调(类似字幕生成),把每种 VQA 任务都转化为「视频片段 + 问题 → 自由文本答案」的监督微调样本,不涉及策略强化学习(RL)。
- 数据生成即弱监督:VQA 问答对由已知的过去/未来任务时间序列自动生成,无需额外人工标注成本(“free” task augmentation)。
- 任务混合消融(Fig.7):对比仅用 planning 任务训练 vs 混合全部任务类型训练——仅 planning 任务下模型见到 3800 万条 planning 样本,而全任务混合下 planning 样本量只有约 1/8,但全任务混合训练在 planning 上误差反而更低(70.9% vs 77.2%),说明任务增强本身对性能有正迁移,且免费获得。
- 帧数消融(Fig.16/17):在 875k 样本(robot+human)上分别训练 1/2/4/8/16 帧输入的模型,16 帧相比 1 帧在全部任务上误差显著更低,验证视频(而非单帧图像)条件对细粒度时序 grounding 的必要性。
- 规划方法对比:论文额外用 RoboVQA-VideoCoCa 作为可供性函数(affordance function)接入 SayCan(短语级解码 + PaLM)与 Grounded Decoding(token 级解码 + PaLM)两种基线规划方法,对比端到端的 RoboVQA-VideoCoCa 与零样本 PaLM-E。
- 闭环价值函数用法:模型的 success/affordance 问答输出可当作通用视频价值函数使用(如判断”当前是否满足指令”),并可通过过滤 yes/no token 置信度进一步提升成功检测准确率(Fig.8)。
Infra(训练 / 推理工程)
- 训练算力:论文未披露 RoboVQA-VideoCoCa(383M)微调所用的 GPU 型号、数量与 GPU-hours;也未披露具体并行策略与训练精度。
- 推理延迟 / 部署形态(Fig.5 原文表格,按模型汇总):
- RoboVQA-VideoCoCa(383M,16 帧):推理时间 1s。
- PaLM-E-12B(零样本,SayCan/Fractal 微调版):推理时间 1s,但 PaLM-E-562B 版本推理约 30s、过慢无法实时部署,故真机评测改用 12B 版本。
- SayCan/PaLM(540B,语言预训练 + RoboVQA 可供性模型):推理耗时 150h+(覆盖约 3 万个可供性判断),因过慢仅用于离线评测(评测 #1),不参与真机在线评测(#2/#3)。
- Grounded Decoding/PaLM(540B):推理耗时 约 10s(覆盖 8 个可供性判断),同样因速度限制不参与真机在线评测。
- 数据采集吞吐(Fig.2,相对传统自顶向下逐步采集方法):机器人具身采集吞吐提升 2.2 倍,人体具身采集吞吐提升 13.8 倍(图中还有一个居中数据点 6.9 倍,对应论文未在正文单独点名的第二种人类具身子类型)。
评测 benchmark
Fig.5 长时程多轮规划基准(干预率,数值越低越好;cognitive=高层认知干预率,physical=底层物理干预率,average=两者均值):
评测 #1(100 个长时程 episode、共 854 个规划步,覆盖机器人+人类具身,全部为人工遥操作物理执行即 physical=100%):
| 模型 | 规模 | cognitive | average |
|---|---|---|---|
| SayCan/PaLM | 540B | 98.8% | 99.4% |
| Grounded Decoding/PaLM | 540B | 95.5% | 97.8% |
| PaLM-E(零样本,SayCan/Fractal 微调) | 12B | 81.4% | 90.7% |
| RoboVQA-VideoCoCa(本工作) | 383M | 44.0% | 72.0% |
即 RoboVQA-VideoCoCa 以 约 30 倍更小的模型规模(383M vs 12B),把认知干预率从 81.4% 降到 44.0%,相对下降约 46%(与摘要所述”比零样本 SOTA VLM 基线低 46%“一致)。
评测 #2(10 个长时程任务,真机在线、人类遥操作为物理策略):
| 模型 | cognitive | average |
|---|---|---|
| PaLM-E(12B,零样本) | 78.2% ± 7.6% | 92.8% |
| RoboVQA-VideoCoCa(本工作) | 47.67% ± 9.1% | 73.8% |
评测 #3(1 个长时程任务,真机在线、由 policy X 全自主闭环控制,任务域收窄为 Narrow/Easy):
- RoboVQA-VideoCoCa:cognitive 40.0%,physical 0%(简单任务),average 20.0%——首次把 average 干预率压到 50% 以下,验证认知模型可与真实底层策略闭环组合。
VQA 单题基准(Fig.4,误差率,人工评判 exact-match + 人工复核):定性结论——SOTA 零样本模型(PaLM-E-562B)在真实环境下误差率仍很高,“视频 VLM 显著优于单帧图像 VLM,全部 VQA 任务上平均误差率降低 19%“(摘要原文数字,具体每类任务的柱状数值论文未给出精确表格值)。
跨具身迁移(Fig.14/15):仅在人类数据上训练的模型在机器人测试集上误差 < 100%(说明具备一定跨具身泛化),机器人+人类联合训练在机器人测试集与人机联合测试集上均优于单一具身训练。
创新点与影响
贡献:
- 提出自底向上、真实用户驱动的长时程数据采集范式,相对传统自顶向下逐步采集吞吐提升 2.2×(机器人)/ 13.8×(人体),且证明混入低成本人类具身数据不损害、反而提升机器人任务表现。
- 发布 829,502 条 (视频,文本) 对的大规模跨具身 VQA 数据集(RoboVQA),29,520 条 unique 指令。
- 提出**干预率(intervention rate)**评测机制——分解为认知/物理两部分,让”允许人工兜底介入”的真机评测既能把任务做到完成,又能给出单一可比的性能数字,为不完美的模型提供可部署路径。
- 训练验证模型 RoboVQA-VideoCoCa(383M),以远小的规模超越零样本 SOTA VLM 基线(PaLM-E-12B/562B)46% 的认知干预率,并证明视频条件(16 帧)显著优于单帧图像条件。
论文自陈局限:
- 为避免过拟合,过滤掉了连续 5 步以上完全重复的简单长时程 episode,可能引入采样偏差。
- 未与纯人类数据集/基准(如 Ego4D、EpicKitchens)系统对比人机混合数据集/基准的有效性差异,作者留作未来工作。
原始链接
- 论文(arXiv abs):https://arxiv.org/abs/2311.00899
- 论文 PDF:https://arxiv.org/pdf/2311.00899
- 项目主页:https://robovqa.github.io/
- 代码(GitHub):https://github.com/google-deepmind/robovqa
- 数据集(HuggingFace,tfrecord):https://huggingface.co/datasets/Tianli/robovqa/tree/main/tfrecord
- 数据集(Google Cloud Storage):https://console.cloud.google.com/storage/browser/gdm-robovqa
一手源存档(sources/)
- robovqa—github-readme — GitHub README 快照(Colab 使用说明、许可协议)
- robovqa—project-page — 项目主页快照(评测表格来源说明、数据集/视频链接)
- arXiv 论文原文(PDF,不入 git):https://arxiv.org/pdf/2311.00899