一句话定位

AVDC(Actions from Video Dense Correspondences)证明「视频生成即策略」这条路线可以完全甩开动作标签:先用一个文本条件视频扩散模型合成「机器人执行任务」的想象视频,再用现成的光流模型在合成帧之间求密集对应关系,把对应关系解算成物体/相机的 SE(3) 刚体变换,直接反推抓取/推动/移动指令;整条链路不需要任何逆动力学网络、不需要动作标注,训练视频可以是任意来源的 RGB(D)(含 YouTube 级人类视频),推理时只需首帧的一张深度图。同时它给出一个只用 4 块 GPU、一天内训完的开源高效视频建模框架,直接对标同类工作 UniPi 声称的 256 块 TPU pod。

背景与定位

延续 unipi-universal-policies-video 开创的「文本条件视频生成 = 策略规划」范式(UPDP:图像作通用状态接口、文本作通用任务规约),AVDC 指出这条路线里被两篇代表作(Finn & Levine 2017 的 visual foresight、UniPi)共同依赖的一个环节仍然昂贵:从合成视频里抠出可执行动作,要么训练一个「动作专属」的视频预测模型,要么训练一个任务专属的逆动力学模型(inverse-dynamics model),这两者都需要成对的动作标注数据。AVDC 的关键洞察是:很多机器人任务里的「从视频推动作」问题,本质上可以规约成求解「视频里物体/场景的一个刚体(SE(3))变换」,而这个变换可以用现成的光流(optical flow)+ 分割网络稳健求解,再交给现成的逆运动学(IK)与运动规划器执行——完全不需要学习任何动作相关的网络

作者把 AVDC 定位为 UniPi 的直接延伸(“Our approach extends UniPi”),坐标系:

  • unipi-universal-policies-video:同属「文本条件视频扩散做规划」范式,但 UniPi 靠一个学习的逆动力学网络把视频转成动作(需要动作标注训练该网络);AVDC 用光流 + 几何解算(无需学习、无需标注)取代这一步,并把训练成本从 UniPi/同类工作依赖的「超过 256 块 TPU pod」压到 4 块 GPU 一天。
  • VPT(Baker et al., 2022)、Escontrela et al. 2023:同属 action-free 预训练,但依赖与环境交互做强化学习;AVDC 不需要任何环境交互。
  • 密集对应关系(dense correspondence)文献(Dense Object Nets、Neural Descriptor Fields、NeRF-Supervision 等):这些工作证明 2D/3D 密集对应可稳健解出物体与操作臂的位姿;AVDC 把这类技术用在合成视频的相邻帧之间,作为动作推断的几何后端。
  • 后续影响:AVDC 的开源代码库(flow-diffusion/AVDC)被 UniPi 论文自己点名为其官方 Google 代码未开源情况下社区可复现的替代实现,是 genie-generative-interactive-environments 等一批 video-policy / 视频世界模型工作沿用的骨架之一。

模型架构

AVDC 分三个模块串联,均不含任何需要动作标签训练的组件(Figure 2):

① 文本条件视频生成(video diffusion planner)

  • backbone:Dhariwal & Nichol (2021) 图像扩散 U-Net 的视频化改版,downsample/upsample 块数对称;每个 ResNet 块内用**分解式时空卷积(factorized spatial-temporal convolution,follow Sun et al. 2015)**替代常规 3D 卷积——输入 5D 特征图 (B,H,W,T,C) 先做逐帧独立的 2D 空间卷积,再做逐空间位置独立的 1D 时间卷积,在不损失生成质量前提下显著提升训练/推理效率。
  • 首帧条件:把输入首帧 img0 在 RGB 通道维度与所有未来帧 img1:T 拼接(channel-wise concat),以增强对首帧的一致性。
  • 文本条件:固定预训练 CLIP-Text 编码器(63M 参数),输出接一个 Perceiver(2 层、8 个注意力头、每头 64 维、64 个输出 token、4 个 pooled 输出 token、最大序列长度 512、FFN 扩张因子 4)做 attention-pooling,聚合成一个向量后加到扩散模型的 time embedding 上;全文没有对文本用 cross-attention
  • 扩散目标:predict-v 参数化,beta schedule 用 cosine,损失 L2,min-SNR-gamma=5;训练/推理时间步均为 100 步(可用 DDIM 降到 10 步加速,见下);dropout=0,num head channels=32,学习率 1e-4,EMA 每 10 步更新一次、decay=0.999。
  • 每次预测固定 T=8 帧未来视频。
  • 三个领域的具体配置(论文 Table 4,4 块 32GB V100 上训练):
配置Meta-WorldiTHORBridge
参数量201M109M166M
分辨率128×12864×6448×64
base channels128128160
num res block233
attention resolutions(8,16)(4,8)(4,8)
channel mult(1,2,3,4,5)(1,2,4)(1,2,4)
batch size163232
training steps60k80k180k

② 光流估计(flow prediction)

  • 直接用现成的(off-the-shelf)GMFlow(Xu et al., 2022,一个专做光流预测的 Transformer 架构),对合成视频相邻帧 imgᵢ、imgᵢ₊₁ 预测像素级密集对应向量场,不做任何微调。作者也尝试过训练扩散模型直接预测光流,但效果不如「先生成视频、再用现成光流模型估计」的两阶段设计,推测是光流场缺乏空间/时间平滑性(如仅单个物体运动时光流稀疏),不适合高斯扩散建模。

③ 从光流+深度回归动作(action regression)

  • 只需首帧的深度图(不需要后续帧深度),假设物体做刚体运动:把目标点集 {xᵢ} 的初始 3D 位置(相机内参 + 首帧 RGBD 给出)与每帧光流提供的 2D 投影对应起来,解一个 L2 最小二乘,求逐帧刚体变换 Tₜ(Meta-World 操作臂设定用 RANSAC 过滤外点,只用内点解算)。
  • 物体操作 vs 导航是同一套算法的对偶用法:固定相机求物体变换(操作),或固定场景求相机(机器人)变换 Cₜ=(Tₜ)⁻¹(导航);导航设定额外把「找到目标后复制最后一帧」训练进扩散模型,并用整帧光流(而非物体 mask)估计变换。
  • 抓取/推动判定用简单启发式(垂直位移是否超过 10cm 决定 grasp 还是 push),抓取点在 Meta-World 里从物体 mask 采样 N=500 点取质心;导航里用「场景变换作用在正前方 1m 虚拟点」的位移方向映射到 MoveForward/RotateLeft/RotateRight/Done 四个离散动作。
  • 闭环重规划(replanning):Meta-World 中若机器人在连续 15 步内移动小于 1mm 且任务未完成,则重新跑一次「生成→光流→动作」全流程;iTHOR 中若内点数掉到初始采样点的 10% 以下则重规划。

数据

  • Meta-World(仿真机械臂操作,Sawyer):11 个任务 × 3 个相机位姿 × 每任务每相机 5 条演示 = 165 条视频用于训练视频扩散模型;仅为对比基线额外提供 15,216 条带动作标注的 frame-action pair(AVDC 本身不使用)。为隔离操作技能学习,给 AVDC 及其变体提供 GT 物体分割 mask(另有用 Language Segment-Anything 自动分割的消融,见评测节)。
  • iTHOR(仿真室内导航):12 类目标物体分布在 4 类房间(厨房/客厅/卧室/浴室);项目页披露训练视频数为 240 条(12 类目标物体);基线额外用 5,757 条带动作标注的 frame-action pair(AVDC 不使用)。
  • Visual Pusher(跨本体,人→机器人):仅用 198 条(项目页表述为约 200 条)无动作标注的人类推物视频训练视频扩散模型(与 Meta-World 相同 U-Net 架构,训练 10k 步),零样本迁移到仿真机器人推物任务,不做任何微调。
  • Bridge 数据集(真实世界厨房操作,Ebert et al. 2022):33,078 条WidowX 250 遥操作演示,仅 web 相机 RGB、无深度信息。真实机械臂(Franka Emika Panda + Intel RealSense D435)实验流程为「Bridge 预训练 → 20 条人类演示微调」;训练成本一节(G.1)另标注该阶段对应「40000 Bridge + 20 条人类视频」(与 Bridge 官方 33,078 条演示规模的口径差异未在文中解释,可能是按视频片段/子序列计数,原文未展开,如实转录)。
  • sim-vs-real / 跨本体:仿真两个环境(Meta-World、iTHOR)训练与评测均在仿真内;Visual Pusher 与 Bridge→Panda 两组实验专门验证「训练视频的本体(人手 / WidowX)与执行本体(仿真推块器 / Franka Panda)不同」时的跨本体迁移能力——这是 AVDC 相对需要同本体动作标注的方法的核心数据主张:训练视频全程不含任何与执行机器人相关的动作标签。

训练方法

  • 目标函数:标准条件视频扩散去噪目标 L_MSE=‖ϵ−ϵ_θ(√(1−β_t) img1:T+√β_t ϵ, t | txt)‖²,text/首帧作为条件,不涉及任何动作/奖励监督——属于纯生成式模仿(video-only imitation),不需要环境交互、不需要 RL。
  • 多阶段管线:(1)在对应领域视频集上训练首帧+文本条件视频扩散模型;(2)推理时用现成 GMFlow 做光流,现成 IK/运动规划器执行,这两步都不参与训练;(3)真实世界实验额外做「Bridge 预训练 → 20 条人类演示微调」两段式迁移。
  • 自适应帧采样(adaptable frame sampling,Meta-World/Bridge):训练时从整段视频里随机取一帧当首帧,再从首帧到末帧之间均匀采样 T−2 帧作为中间帧、末帧固定,而非取连续帧——利用「给定首帧,末帧与文本目标强相关、中间帧更不确定」的观察,显著提升学习效率,是能在 4 GPU 一天内训完的关键因素之一;iTHOR 则不做跳帧,直接取连续 T−1 帧(不足时复制末帧填充,让模型学会”找到目标即停止”)。
  • 动作侧完全无训练:与 UniPi 需要额外训练一个逆动力学网络不同,AVDC 的第②③步(GMFlow + 几何解算)是纯推理时的现成算法组合,不需要任何针对目标机器人/任务的动作监督。

Infra(训练 / 推理工程)

  • 训练硬件:全部实验统一在 4 块 32GB V100 GPU 上训练。
    • Meta-World:约 24 小时(165 条视频)
    • iTHOR:约 24 小时(240 条视频)
    • 真实世界(Bridge+Panda):48 小时 Bridge 预训练 + 4 小时 人类演示微调
    • 摘要里「4 GPU 一天训完高保真策略模型」的表述准确对应 Meta-World/iTHOR 规模;数据量大得多的 Bridge 需要约两天(作者原文明确指出”despite the large size of Bridge data…we can generate high-quality and consistent results with just two days of training”)。
  • 精度/并行策略:未披露(4 卡数据并行为最简配置,论文未给出混合精度等细节)。
  • 推理延迟(RTX 3080Ti,Meta-World 单次规划分解):
    • 文本条件视频生成:约 10.57 秒(平均每帧 1.51 秒,T=8 帧,100 步扩散采样)——管线中耗时最长的一步
    • 光流预测(单对相邻帧):平均 0.28 秒
    • 动作回归(光流+深度解算):平均 1.31 秒
    • 动作执行(控制器跑一步):平均 1.53 秒
    • 重规划成本:每轮规划约 18 秒,单回合最多重规划 5 次,故单回合规划总耗时 18–108 秒(RTX 3080Ti)。
  • 加速消融(DDIM):把扩散采样步数从 100 步降到 10 步(DDIM),视频生成提速 10×,Meta-World 整体成功率从 43.1%(100 步)降到 37.5%(10 步,降 5.6 个百分点),作者认为在时延敏感场景下这一权衡”值得”(还测试了 25/5/3 步,仅给出定性结果)。

评测 benchmark

Meta-World(11 任务,3 相机位姿 × 25 次/相机,论文 Table 1,单位:成功率%)

方法door-opendoor-closebasketballshelf-placebtn-pressbtn-press-topfaucet-closefaucet-openhandle-presshammerassemblyOverall
BC-Scratch21.336.00.00.034.712.018.717.337.30.01.316.2
BC-R3M1.358.70.00.036.04.018.722.728.00.00.015.4
UniPi(With Replan,baseline)0.036.00.00.06.70.04.09.313.34.00.06.1
AVDC(ID)0.036.00.00.00.00.04.09.313.34.00.06.1
AVDC(Flow)0.00.00.00.01.340.042.70.066.70.00.013.7
AVDC(No Replan)30.728.021.38.034.717.312.017.341.30.05.319.6
AVDC(Full)72.089.337.318.760.024.053.324.081.38.06.743.1

(BC-Scratch/BC-R3M/UniPi 均可访问动作标注,AVDC 系列不使用。原文 Table 1 中 “AVDC(ID)” 一行与 “UniPi(With Replan)” 一行在多数任务列数值相同或极接近——两者均是”用 AVDC 合成的视频 + 一个训练出来的逆动力学网络推动作”的同构管线,原文未进一步说明二者差异,如实转录不做额外推断。)AVDC(Full) 全面且大幅超过两个 BC baseline 与 UniPi baseline;AVDC(No Replan)→AVDC(Full) 的提升(19.6%→43.1%)验证闭环重规划的价值;AVDC(Flow)(扩散直接学光流)整体明显弱于两阶段设计(13.7% vs 43.1%),验证”先生成视频、再用现成光流模型求光流”优于”扩散直接建模光流分布”。

iTHOR(4 类房间 × 3 类目标 × 20 回合/目标,论文 Table 2,成功率%)

房间BC-ScratchBC-R3MAVDC
Kitchen1.70.026.7
Living Room3.30.023.3
Bedroom1.71.738.3
Bathroom1.70.036.7
Overall2.10.431.3

两个 BC baseline 在导航任务上几乎完全失效,AVDC 达到 31.3% 平均成功率。

跨本体零样本(Visual Pusher):仅用 198 条人类推物视频训练(无任何机器人动作标注、无微调),在仿真机器人推物任务上零样本成功率 90%(36/40 次)

分割消融(Meta-World,替换 GT mask 为自动分割):用 Language Segment-Anything(GroundingDINO+SAM)自动出物体 mask,11 任务平均成功率 34.5%,比 GT mask 的 43.1% 低 8.6 个百分点,主要归因于分割误差。

首帧条件方式 / 文本编码器消融(Bridge,以生成末帧 MSE 衡量):首帧按 RGB 通道拼接(cat_c,本文方法)在训练早期持续优于按时间维拼接(cat_t);CLIP-Text(63M)与 T5-base(110M)两种文本编码器生成质量差异不显著。

真实世界 Franka Emika Panda + Bridge(10 个场景,pick-and-place 到指定容器):定量上 10 次试验中 8 次失败(即成功率 20%,2/10);失败归因中 75%(8 次中的 6 次)源于视频扩散模型规划错误(抓错物体或放错目标),25%(2 次)源于视频生成的不连续性(物体在中间帧莫名消失)。

创新点与影响

  • 首次把「视频生成即策略」的动作推断环节完全去学习化:用现成光流(GMFlow)+ 深度几何解算替代逆动力学网络,使得整条管线除视频扩散模型外不需要任何针对动作的训练,训练数据可以是纯 RGB(无深度)、跨本体、甚至人类视频。
  • 开源高效视频建模框架:通过分解式时空卷积等架构优化,把此类视频策略模型的训练成本从 UniPi 依赖的「超过 256 块 TPU pod」压缩到 4 块 GPU 一天内(Bridge 规模约两天),大幅降低了这条研究路线的复现门槛,并被 UniPi 作者自己点名为社区参考实现。
  • 验证跨本体迁移:仅用约 200 条人类推物视频零样本迁移到仿真机器人(90% 成功率),以及 Bridge(WidowX)预训练 + 少量人类演示微调后部署到 Franka Panda,说明视频扩散规划器学到的是本体无关的场景动力学知识。
  • 作者自陈局限(Discussion 节原文):(1) 物体被机械臂大幅遮挡时容易丢失跟踪;(2) 光流预测在光照剧变或大幅物体位移下不稳定;(3) 抓取/接触面的确定仍依赖启发式,真实抓取姿态信息难以从人类视频直接迁移(人手与机器人手形差异);(4) 力信息(force)无法从 RGB 视频获取,是纯视觉方法的根本局限,留作未来结合真实交互数据的方向。

原始链接

一手源存档(sources/)