一句话定位

Google DeepMind 提出 Vid2Robot:把一段人类(或机器人)做任务的第三人称演示视频,通过 Perceiver-Resampler + 交叉注意力直接编码成任务条件,端到端输出机械臂动作,让机器人”看一遍人做就会做”而不必依赖语言指令;真机评测显示人类演示视频提示下比 bc-z 提升 20 个百分点,并涌现出跨物体动作迁移能力。

背景与定位

Vid2Robot 要解决的是视频条件(video-conditioned)机器人策略长期落后于语言条件策略的问题。作者指出此前视频条件方案面临三个瓶颈:(1) 原始视频是高维数据,训练/推理开销大;(2) 同一任务的人类演示在物体外观、背景干扰物、光照上差异巨大,任务规范的方差很高;(3) 带标注的成对视频数据稀缺。bc-z 曾提出用 ResNet18 + FiLM 编码视频/语言做任务条件,但其视频条件分支的泛化能力明显弱于语言条件(BC-Z 论文自身消融显示视频条件在 held-out 任务上仅 4% 成功率 vs 语言条件 32%);rt-1rt-2 等主流多任务操作模型则完全依赖语言条件,难以处理”open drawer / open jar with lid”这类同动词、动作差异巨大的场景。Vid2Robot 延续 BC-Z 的成对视频-轨迹训练范式,但用更大容量的 ViT + 交叉注意力架构替代 ResNet+FiLM,并新增三种自监督/对比辅助损失来对齐人类视频与机器人视频的语义表征,试图把视频条件策略的性能拉到与语言条件相当的水平。

模型架构

策略是编码器-解码器式的交叉注意力 Transformer,由四个模块组成:

  • Prompt Video Encoder(提示视频编码器):逐帧 ViT 图像编码器 φ_p + Perceiver Resampler ψ_p,输出 N 个 d 维 token 的集合 z_prompt,作为任务语义的浓缩表征。
  • Robot State Encoder(机器人状态编码器):结构与提示编码器相同(φ_s + ψ_s),编码当前帧及过去 k−1 帧构成的状态视频 S_t,输出 z_state;图像编码器权重在提示分支与状态分支之间共享(φ_p=φ_s=φ)。
  • State-Prompt Encoder:以状态编码 z_state 为 query、提示编码 z_prompt 为 key/value 做交叉注意力,融合出”提示感知的状态 token” z_state|prompt——例如提示视频演示”从篮子里拿苹果”,当前状态里有苹果、香蕉、橙子,交叉注意力学会关注苹果。
  • Robot Action Decoder:4 层交叉注意力 Transformer 解码器,用固定的动作位置 token(仿 ACT)做 query、z_state|prompt 做 key/value,单次前向输出全部动作维度(而非像 RT-1/RT-2 那样自回归解码),预测视野为 4 步;每个输出 token 投影到 256 维做 softmax 分类,取 argmax 作为该维度的离散动作值。
  • 交叉注意力的动机(论文给出具体算量):ViT-B/16 下 16 帧提示视频 + 8 帧状态视频、224×224 分辨率,若用标准自注意力,总 token 数 8×196+16×196=4704,注意力矩阵约 4704²≈22M 项;改用两个 64-latent 的 Perceiver Resampler 后,注意力矩阵降到 8×196×64+16×196×64≈0.3M 项,是交叉注意力被大量使用的直接工程动机。
  • 动作向量:11 维,涵盖 mode、gripper pose 及开合度、底盘位移与旋转,每维缩放到 [0,1] 后离散化为 256 个 bin;本研究中评测场景底盘保持静止。
  • 实现规模:Prompt/State Resampler 均为 2 层 Perceiver Resampler、64 个 latent;State-Prompt Encoder 与 Action Decoder 均为 4 层交叉注意力 Transformer(具体 embedding 维度 d 未披露)。

数据

  • 规模:合并三类来源后,共约 10 万条机器人视频约 1 万条人类视频,覆盖 rt-1rt-2 中出现的任务集合。
  • 三类成对数据构造方式
    1. Robot-Robot:从既有机器人轨迹数据集中,按自然语言任务指令把”同任务、不同环境”的两段机器人视频配对,复用已标注数据但缺乏演示方式的多样性。
    2. Hindsight Human-Robot:拿机器人轨迹数据集里的任务指令,请 1-5 名人类参与者按同一指令录制从机器人视角拍摄的演示视频;引入了人手左右、速度、随机相机角度带来的具身与速度差异,但不覆盖机器人侧的新任务。
    3. Co-located Human-Robot:人类与机器人在同一工作空间(客厅、带白板的会议室、带玩具工具的硬件工位、带台面/冰箱/水槽的厨房、储物区等)分别完成同一任务,被视为”金标准”数据但采集成本最高。
  • 预处理:每段视频随机采样 N=16 帧(固定含首尾帧)并按时间排序;状态视频固定为当前帧 + 前 k−1=7 帧共 8 帧,不足则复制首帧补齐;帧统一 resize 到 224×224,训练时做裁剪/亮度/对比度/色相/饱和度等光度增强。
  • 动作标签来源:机器人侧动作来自遥操作采集的真实关节/末端执行器轨迹(标签精确,非视频反推);人类演示视频本身不提供动作标签,只提供视觉任务条件。

训练方法

  • 主损失(行为克隆):对离散化为 256 bin 的动作做交叉熵分类损失 L_CE。
  • 三个辅助损失(均只用于表征对齐,不额外引入新标注)
    1. Video Alignment Loss(时序循环一致性 TCC):对提示视频与机器人视频的逐帧图像嵌入(经 alignment pooling 2 层 MLP 投影)做双向 soft-nearest-neighbor cycle-back 回归,鼓励图像编码器学到对具身、光照、背景、视角、干扰物不变但保留任务进度信息的表征。
    2. Prompt-Robot Video Contrastive Loss (VVCL):用 Attention Pooling 把 N 个 prompt token 汇聚成单一视频级嵌入,对同任务的 prompt-robot 视频对做 SigLIP 风格的对比损失(batch 内对角线为正例,非对角为负例,带可学习温度 τ 与偏置 b)。
    3. Video-Text Contrastive Loss (VTCL):延续 bc-z 的辅助语言回归思路,把 prompt/robot 视频嵌入分别与任务文本指令嵌入做 SigLIP 对比损失。
    • 总损失:四项损失简单平均,L = (L_CE + L_TCC + L_VVCL + L_VTCL) / 4。
  • 消融验证的关键结论:完整模型(含全部辅助损失)在 9 任务真机评测上综合成功率 61%,仅用主损失(无任何辅助损失)降到 45%;去掉 VTCL(语言对比损失)只比完整模型低 1-2 个百分点,说明视频对齐损失(TCC + VVCL)贡献了绝大部分增益,语言辅助监督并非必需。

Infra(训练 / 推理工程)

  • 实现框架:Jax。
  • 训练步数与优化器:训练 200K 步迭代,AdamW,初始学习率 8e-5,cosine 学习率调度,warmup 2000 步,末端学习率 1e-6
  • GPU/TPU 数量、精度、训练总算力:未披露。
  • 推理方式:动作解码器单次前向输出全部动作维度(非自回归),与 RT-1/RT-2 的自回归解码相比推理更快,但论文未给出具体 FPS/延迟数字或控制频率 Hz。
  • 本体:真实机械臂(配 IK 求解器控制手臂到目标夹爪位姿),论文未具体命名机器人型号;失败分析提到”IK 解有时会挡住机器人相机视野”。

评测 benchmark

真机评测,评测者为人类打分员,“成功”定义为策略正确执行提示视频中的任务指令且无需人工重置/纠错。

任务成功率(Table I,9 个任务,Robot 提示每行 72 次 rollout,Human 提示同样 72 次,共 288 次真机 rollout)

PrompterModelpickpick-place onplace intoopenclosemove nearknock overplace uprightOverall
RobotBC-Z75.0%50.0%61.5%16.7%66.7%44.0%58.3%50.0%52.6%
RobotVid2Robot75.0%58.8%50.0%91.7%100.0%33.3%41.7%16.7%54.9%
HumanBC-Z50.0%12.5%12.5%0.0%50.0%43.8%12.5%50.0%30.6%
HumanVid2Robot100.0%50.0%50.0%62.5%87.5%43.8%25.0%12.5%52.8%
  • Robot 提示下两者整体相当(52.6% vs 54.9%);Human 提示下 Vid2Robot(52.8%)比 BC-Z(30.6%)高约 20 个百分点——因为训练数据中机器人轨迹数量比人类视频多一个数量级,人类提示下的差距更能反映模型对视频语义的理解能力。

局部成功率分解(Fig.6,reach/grasp/release/terminate):Vid2Robot 到达正确物体 78%(比 BC-Z 高约 8 个百分点);抓取成功率 65% vs BC-Z 45%(高 20 个百分点,抓取是 rollout 中最难也最关键的一步);release 与 terminate 成功率均约 57%,说明一旦正确松开物体,模型几乎总能正确终止(BC-Z 无终止动作,固定步数运行)。

跨物体动作迁移(Table II,5 个任务 × 6 个 OOD 物体 × 4 名评测者 = 240 次 rollout):整体 Vid2Robot 34.2% vs BC-Z 17.5%;“place into”任务提升最大(29%→54%);“pick-place on”与”knock over”两项 BC-Z 完全 0% 成功而 Vid2Robot 达到 25-29%;“pick”任务两者相当(均 45.8%)。

辅助损失消融(Fig.8,9 任务 × 3 模型变体 × 3 评测者 × 2 rollout = 162 次):完整模型 61% > 去掉语言对比损失(VTCL)的变体(比完整模型低 1-2 个百分点)≫ 仅主损失(无任何辅助损失)45%

创新点与影响

  • 贡献:(1) 提出用交叉注意力 Transformer 端到端编码”人类或机器人演示的提示视频”作为任务规范,替代离散语言指令;(2) 设计三种辅助对比/对齐损失(TCC 视频对齐、VVCL 视频-视频对比、VTCL 视频-文本对比)联合训练以增强 prompt-robot 视频表征对齐;(3) 通过真机实验发现”跨物体动作迁移”这一涌现能力——给定一个物体上演示的动作(如”把可乐罐放正”),策略能把同一动作迁移到训练时从未见过与该动作配对的物体(绿罐、薯片袋、订书机、毛绒玩具)上。
  • 改变了什么:证明了在与语言条件方法(BC-Z)同等训练数据规模下,视频条件策略可以达到相近甚至更优的成功率(尤其在人类演示视频上大幅反超),为”通过看一次人类演示教会机器人新技能、无需详细语言描述”路线提供了真机层面的实证支持,是后续将人类视频规模化用于机器人策略学习(如从互联网 how-to 视频学习操作)研究方向的早期里程碑之一。
  • 作者自陈的局限(原文第 V 节):(1) 视频条件策略整体成功率仍落后于同类语言条件方法(如 RT-2)在已知任务集上的表现,本文只是”在同等设置下首次评测视频条件策略”这一里程碑;(2) 抓取阶段成功率明显下降,原因是仅靠机器人相机观测隐式估计深度,遮挡或夹爪出视野时信息不完整,作者建议未来融合多模态传感器;(3) 三类训练数据的演示视频均为精心采集的 5-20 秒短片段,尚未验证方法能否扩展到长时程演示或”in-the-wild”网络视频,需要新的视频-轨迹配对策略。

原始链接

一手源存档(sources/)

  • vid2robot—project-page — 项目主页(作者列表、视频画廊,无代码仓库链接)
  • arXiv 原文 PDF(2403.12943,不入 git):见上方 arXiv 链接