一句话定位

系统综述「从互联网视频学机器人」(Learning from Videos, LfV)这个子领域:把用海量人类/网络视频(而非仅靠昂贵的机器人自采数据)来扩展通用机器人能力的方法,按视频知识提取(视频基础模型)→ 视频到机器人迁移(动作表征/分布偏移)→ 视频赋能哪个 RL 知识模态(策略/动力学模型/奖励函数/价值函数)三段式拆解,并给出数据集、benchmark 设计规范与未来方向。第一作者 Robert McCarthy(UCL),团队含 UCL、Weco AI、MIT(Yilun Du)。发表于 Journal of Artificial Intelligence Research(JAIR)2025 年第 83 卷第 12 篇,DOI 10.1613/jair.1.17400;arXiv v1 于 2024-04-30 提交,本页读的是 2025-07-23 的 v5(历经 v1→v5 五次修订)。

背景与定位

论文开篇提出机器人学习的「先有鸡先有蛋」困境:机器人能力有限导致真机数据难采(低效且危险),数据不足又反过来限制能力提升。相较于借助仿真(sim-to-real gap、场景/任务多样性难造)或人工遥操采集真机数据(如 Open X-EmbodimentDROIDRH20T),本综述聚焦第三条路径——互联网视频:其信息量(覆盖物理动力学与人类行为)、规模与多样性(远超最大开源机器人数据集)、以及相对待开发(不像文本/图像基础模型已被大量迁移到机器人)三点理由,论证视频是被低估的规模化资源。

正式定义 LfV 设定:给定视频数据集 D_video(片段 τ=(o₀,…,o_T),仅 RGB 观测、无动作标签,可选配语言标注)与机器人数据集 D_robot(含动作/奖励的转移元组),目标是用组合数据集 D_LfV={D_robot, D_video} 得到优于仅用 D_robot 训练的策略 π(a_t|s_t)。三大预期收益:(1) 泛化到 D_robot 覆盖之外的任务(视频提供高层任务步骤信息,机器人数据提供低层技能执行信息);(2) 涌现能力(类比 LLM 在网络文本上的涌现);(3) D_robot 分布内的数据效率与绝对性能提升。四大根本挑战:动作标签缺失、(人-机具身/视角/任务)分布偏移、低层信息(力/触觉/本体感)缺失、可控性与部分可观测性、以及视频固有的高维/噪声/冗余。

相关综述定位:区别于聚焦模仿学习(Ravichandar et al.)、离线 RL(Prudencio et al.)、机器人基础模型泛论(Yang et al. 2023 Foundation Models for Decision Making、Hu et al. 2023,对应本库 robot-learning-foundation-models-survey)或视频作为统一接口的立场文章(yang2024video)的工作,本文更聚焦”能否规模化到大规模异构互联网视频”与”能否带来通用机器人能力”两条主线。同期/后续的 VLA 综述(2024-05)从视觉-语言-动作模型架构切入,与本文的”视频知识模态”切入角度互补,可对照阅读。

模型架构

综述本身不训练模型,贡献是一套方法论分类学,核心概念是 RL「知识模态」(Knowledge Modality, KM:策略 π、价值函数 V/Q、动力学模型 p(s’|s,a)、奖励函数 r(s,a))与三种迁移机制(零样本泛化、微调/表征迁移、层级化条件化)。

4.1 视频基础模型三分类(提取视频知识的通用手段):

  • 视频编码器 p(z|τ):预测目标可以是视频自身变换(掩码自编码 MAE/VideoMAE)、辅助标签(物体框/分割)、或跨模态配对(语言标注)。方法上分预测式目标(预测下一帧)与联合嵌入式目标(对比学习,如 JEPA 系);SOTA 路线包括视频-文本对比损失、掩码自编码、VQ 自编码、师生蒸馏。
  • 视频预测模型 p(o_{t+1}|o_{t-k:t}) 及条件生成 p(τ|c):扩散模型(可并行多帧但采样慢,常在隐空间做扩散以省算力,pipeline 常含关键帧生成→插帧→超分三段)、自回归/掩码 transformer(在 VQ-AE 隐空间预测,掩码式用 MaskGIT 解码、比自回归更快且无 drifting);条件信息(语言、目标图、动作表征)可简化生成问题、便于机器人复用。
  • 视频到文本模型 p(text|τ):组合式管线(图像-语言模型逐帧问答 + LLM 汇总)、基于预训练 LLM 的适配器微调(先大规模视频-文本 next-token 预训练,再小规模指令微调)、原生多模态 any-to-any 序列模型。

4.2 动作表征分类学(应对视频缺动作标签的核心贡献):video 转移对 (o_t, o_{t+1}) 缺 a_t,综述定义”替代动作” â∈Â 并列出七类获取方式——单步隐动作(IDM 编码 o_t→o_{t+1} 差异,配 VQ 瓶颈防止 IDM 直接抄写整帧,代表工作含 Genie、Ye2024LatentAP 即 LAPA)、多步隐动作(如 MimicPlay 用 3D 人手轨迹做解码目标)、observations-as-action(用未来观测/子目标本身当动作,如 UniPi)、language-as-action(微调 VLM/LLM 输出语言动作)、视觉运动信息(光流、3D flow、点轨迹,如 ATM)、人体具身信息(人手位姿重定向到机器人)、IDM 伪动作标签(在机器人数据上训 IDM 再给视频打伪标签,如 VPT)。另设一节讨论如何用具身感知方法(embodiment-aware)、学习不变表征、可迁移抽象来专门应对分布偏移。

数据

第 5.1 节给出 Table 1 中现有视频数据集的规模对照(按时长降序,节选关键行):

数据集内容时长(小时)片段数标注方式采集方式
InternVidYouTube760,000230M生成式互联网
HD-VILA-100MYouTube370,000103MASR互联网
WTS-70MYouTube190,00070M元数据互联网
HowTo100M教学134,000136MASR互联网
YT-Temporal-180MYouTube未披露180MASR互联网
WebVid-10MYouTube52,00010MAlt-text互联网(作者标注:撰文时已不公开)
VideoCC3MYouTube18,0006MTransfer互联网(同上,已不公开)
100 Days of Hands动作3,10027k元数据互联网
Ego4D日常3,60028k人工人工采集
Ego-Exo4D技能1,4006k人工人工采集
Something-Something v2动作245221k人工人工采集
RoboVQA日常23098k人工人工采集
Epic-Kitchens-100烹饪100700人工人工采集

Figure 8 的对数坐标对比明确指出:InternVid(76 万小时/2.3 亿片段)是已知规模最大的互联网抓取视频集,Ego4D(3,600 小时)是已知规模最大的人工定制录制视频集,而 Open X-Embodiment(当时约 200 万条轨迹,作者按平均轨迹长 10 秒估算,折合约 5,556 小时)是已知规模最大的开源机器人数据集——即便是最大的机器人数据集,也比最大互联网视频集小两个数量级以上。

数据构建方法学(5.1.2):互联网抓取路线含查询构造(人类时间使用调研、众包、LLM 解析文本语料生成 query)→ 候选池后处理(去除跨场景剪辑、用元数据/光流/图文嵌入/真实感估计过滤低质)→ 合规处理(授权、匿名化、去偏)→ 重标注;自建录制路线含众包记录日常生活(Ego4D 系)或按文本指令表演(Something-Something、RoboVQA);标注上人工标注质量高但贵(口播标注优于打字标注),自动标注含 ASR、元数据/alt-text 迁移、图像描述/目标检测模型、以及 LLM 汇总多源信息。作者指出:现有互联网抓取集的语言标注质量普遍偏低,是当前限制。

训练方法

按第 4.3 节,综述用四条 RL 知识模态主线组织全部 LfV 训练方法:

  • 策略(4.3.1):表征迁移(视频预训练编码器接下游机器人 BC)、多模态联合模型(视频+机器人数据联合训练直接预测机器人动作)、Alternative-action 策略 π_alt(â|o)(在视频上用 BC 训练输出替代动作,行为次优时可加语言/目标条件,或用离线 RL)、Alternative-action 解码器 π(a|â,o)(学习型解码器用机器人数据的 (o,a,â,o’) 元组监督训练,或人工设计解码器如光流转动作、机械臂视觉箭头映射)、policy-as-video(语言条件视频预测器生成未来视频 + IDM 解码动作,如 UniPi/Video Language Planning)、IDM 伪动作方法(如 VPT,作者指出难以规模化到多样化互联网视频)。
  • 动力学模型(4.3.2):视频扩散架构(在人类视频上规模化)与自回归 transformer(在大规模互联网视频游戏数据上规模化,如 Genie)均显示随算力/模型规模良好扩展;动作条件化方式包括直接在视频+机器人数据上联合预训练(用机器人动作标签做条件)、或先训练替代动作条件预测器 p_alt(o’|o,â) 再建立 â→机器人动作空间的映射;下游适配含微调、“堆叠”新动作条件模块避免破坏预训练知识(Seo et al. 发现朴素微调会抹除预训练知识)、以及用大模型 score function 引导小模型生成;用途含充当模拟器生成合成数据、可微分模拟器做策略梯度回传、模型预测控制/树搜索规划。
  • 奖励函数(4.3.3):视频-语言模型奖励(双编码器视频-文本相似度、或 VQA 式让模型打分/RLAIF)、视频预测器奖励(用生成似然定义奖励鼓励匹配视频行为分布)、表征相似度奖励(时间对比表征测时间距离、或专门设计的具身/视角不变表征应对分布偏移)、势函数奖励塑形(用视频预训练价值函数做 potential-based shaping)、生成对抗模仿(GAIL 类在线匹配视频行为分布)。
  • 价值函数(4.3.4):TD-learning 路线需应对视频缺动作/奖励/目标标签(条件于替代动作、用启发式代理奖励如”距完成步数”、或子目标可达性);时间对比学习路线(如 VIP)隐式估计时间距离作为价值代理。

Infra(训练 / 推理工程)

作为综述,无自身训练 GPU 数量/GPU-hours/并行策略/精度披露(未披露)。工程侧讨论集中在第 6.3/6.4 节的定性分析:(1) 高维视频数据的算力需求是核心瓶颈,建议用隐空间预测(而非像素空间)缓解计算量与噪声冗余;长上下文高效架构(如状态空间模型、记忆压缩)被点名为未来方向。(2) 第 6.4 节明确指出大基础模型的推理延迟是限制实时高频机器人控制的一个未解问题(引用 Gato、RT-1 等工作),呼吁降低推理延迟的技术(如 MoE)。全文未给出任何具体的 FPS/控制频率/显卡型号数字——这些数字留给被综述的具体工作(如后续的 GR-2π0 等)。

评测 benchmark

本文不做自有实验,而是提出 LfV benchmark 设计规范并盘点现有 benchmark 缺口:

三类 benchmark 定义(5.2.1):

  • B_e = {M_eval}:策略可用任意 D_video、D_robot 训练,仅固定评测环境 M_eval——已有丰富选项,涵盖复杂游戏环境(MineDojo、NetHack)、机器人仿真器(CALVINMeta-WorldManiSkill2LIBERO、RoboHive、Isaac Gym、Colosseum)、具身 AI 仿真器(HabitatAI2-THORBEHAVIOR)、真机评测(ROBEL)。
  • B_e-r = {M_eval, D_robot}:额外固定机器人数据集——CALVIN/LIBERO 系提供演示/play 数据,ManiSkill2 含移动操作任务,Colosseum/RoboCasa 等提供多任务多环境及对应数据生成方法;Open X-EmbodimentDROID 等大规模真机数据集目前未配对固定 benchmark。
  • B_e-r-v = {M_eval, D_robot, D_video}:同时固定视频集——作者指出目前几乎不存在成熟选项。已知案例是 MineDojo 提供 730k 条 YouTube 视频作为 Minecraft 场景下的 D_video;此外不少工作通过”从 D_robot 剥离动作标签”人工构造 D_video(如 Seo et al.、Schmidt2023、Wen2023),但这种做法会忽略真实 LfV 场景中视频-机器人域间的分布偏移,是一种”玩具化”简化。

度量建议:D_robot 分布内性能、D_robot 分布内数据效率、D_robot 分布外泛化——三者可定量测;“涌现能力”这一收益则只能定性评估。作者的核心呼吁:建立更多样化的 M_eval(用程序化生成/LLM 辅助环境设计扩展任务多样性)、建立流行的 B_e-r 与 B_e-r-v 基准(当前不同工作各自选用不同 D_video,彼此难以横向比较)。

创新点与影响

贡献(据第 7 节):

  1. 明确建立 LfV 的基础概念——三大收益(泛化、涌现、分布内提升)与五大根本挑战(动作缺失、分布偏移、低层信息缺失、可控性/随机性/部分可观测、高维噪声冗余),为后续研究议程定调。
  2. 系统综述视频基础模型三分类(编码器/预测器/视频到文本)及其对机器人的四种可用方式(用预训练模型直接迁移、或借用其技术与数据集训练机器人专用模型)。
  3. 首次系统整理”动作表征”文献(单步/多步隐动作、observations/language-as-action、人体具身信息、IDM 伪标签),把此前分散的解法组织成一套分类学。
  4. 按知识模态(策略/动力学模型/奖励/价值函数)系统对比 LfV 方法的优劣与适用场景,明确指出策略与动力学模型是最有希望降低机器人数据依赖的目标,而奖励函数虽更易零样本迁移但收益上限较低。
  5. 提出 LfV 数据集与 benchmark 的设计规范(三类 benchmark 定义 B_e/B_e-r/B_e-r-v),指出当前领域在标注质量、benchmark 覆盖度上的具体缺口。
  6. 讨论”任何-to-任何序列模型”(monolithic)与层级化组合式(compositional)两条路线的权衡,主张两者并行探索。

作者自陈的局限与开放问题(第 6.4 节”Is Scaling Enough?“):即便视频数据无限扩展,LfV 仍受限于机器人数据本身的质量与覆盖(LfV 只是增强、并非替代机器人数据);安全与可靠性——深度学习模型对分布外场景的脆弱性,物理机器人对成功率的容错远低于生成式 AI 任务;长时程任务的记忆与规划能力尚无成熟方案(context 扩展或简单记忆库是否够用尚不明确);大基础模型的推理延迟限制实时高频控制;持续学习/在线适应能力仍是未解问题;深度学习是否具备真正的”推理”能力存在争议,若从根本受限,则规模化视频数据也无法弥补。作者明确将”scaling 是否足够走到通用机器人”定性为一个需要靠持续实验来回答的经验问题,而非已有定论。

原始链接

一手源存档(sources/)

  • 本文仅有 arXiv 一手来源(无独立官方博客/GitHub/项目页/HF 卡片可供归档),全文 PDF/HTML 属于 arXiv 原文,不入 git——已读版本见上方 arXiv HTML 链接(v5,2025-07-23)。