一句话定位

UniPi 把「序列决策 = 文本条件视频生成」这一范式落地:给定一句任务指令和当前观测帧,先用一个文本条件视频扩散模型把「未来会发生什么」合成成一段图像序列(这就是 planning),再用一个小的逆动力学模型(inverse dynamics)从相邻帧回归出具体动作去执行。它是「视频生成即策略 / 视频生成即世界模型」这条路线的奠基工作,用图像作为跨环境的统一状态-动作接口,用文本作为统一任务规约,从而绕开了 MDP 里「设计 reward + 各环境异构 state/action 空间」的老问题,并首次证明在互联网级 text-video 数据上预训练能把知识迁移到真实机器人视频规划。NeurIPS 2023 Spotlight。

背景与定位

2023 年初的背景:视觉/语言领域靠大规模预训练拿到了强 zero-shot 泛化(GPT-3、Flamingo、CLIP),但决策智能体一直被「环境多样性」卡住——MuJoCo 的关节连续控制和 Atari 的图像离散动作根本没法共享 state/action 空间。既有的「统一 token 序列建模」路线(gato-a-generalist-agent Gato)虽然把多环境塞进一个 token 序列,但作者认为这种自定义 token 化既不自然、也丢掉了预训练视觉语言模型里的知识,且只能在 state/action 空间相同的环境(如多个 Atari 游戏)里工作。

UniPi 的破题思路:把「图像序列(视频)」当成跨环境通用的观测-行为载体,把「文本」当成通用任务规约。为此它提出一个替代 MDP 的抽象 UPDP(Unified Predictive Decision Process,统一预测决策过程):一个元组 G = ⟨X, C, H, ρ⟩,X 是图像观测空间,C 是文本任务描述空间,H 是有限时域长度,ρ(·|x₀, c) 是一个条件视频生成器——直接对「给定首帧 x₀ 和任务 c 的 H 步图像轨迹」建分布。UPDP 相对 MDP 的三点区别:(1) 用图像作通用状态接口,免去为每个环境造复杂 state 表征;(2) 用文本任务规约取代实数 reward,免去跨环境的 reward 设计与迁移;(3) 把「任务无关的视频规划 ρ」与「环境相关的动作选择 π」解耦,让 planner 环境/本体无关、可复用可迁移可调试。这属于 generative video world model / planning-as-video-generation 范式。

坐标系:

  • video-diffusion-models-vdm(VDM,Ho et al. 2022):UniPi 视频扩散的基础架构直接沿用它的 Video U-Net([45])。
  • imagen-video(Imagen Video,[19]):UniPi 真实机器人实验的预训练数据与训练算法沿用它(14M video-text + 60M image-text + LAION-400M)。
  • Diffuser(Janner et al. ICML 2022,“Planning with Diffusion”,[21]):同作者线上的前作,用无条件扩散在关节 state-action 轨迹上做规划 + 单独 reward 模型选 plan;UniPi 的关键差异是扩散的是未来图像帧而非低维 state-action,从而能吃互联网视频、跨本体迁移。论文里把它作为 State-Based Diffusion baseline 复现。
  • Decision Diffuser(Ajay et al. [27]):条件扩散做 offline RL 的同期工作,同为 baseline 思路来源。
  • VPT([32]):也用逆动力学给无标注视频打动作标签,但 VPT 的逆动力学本身不支持基于模型的规划;UniPi 把「学世界模型」和「分层规划」在视频空间里合到一起做。
  • 后续影响:这套「文本→视频规划→逆动力学抽动作」的骨架被 genie-generative-interactive-environments、AVDC、UniSim、以及大量 video-policy / 世界模型工作继承。作者点名的开源复现是 flow-diffusion/AVDC(Google 内部代码未开源)。

模型架构

UniPi = 通用视频规划器 ρ(视频扩散)+ 任务专属动作生成器 π(逆动力学),是 diffusion-UPDP 的一个具体实例(论文 Fig. 2)。

通用视频规划器 ρ(video diffusion planner)

  • backbone:Video U-Net,架构与训练直接沿用 VDM [45]——3 个残差块、base channel 512、channel multiplier [1, 2, 4]、attention 分辨率 [6, 12, 24]、attention head 维度 64、conditioning embedding 维度 1024;噪声调度用 log-SNR,范围 [-20, 20]。
  • 文本条件:用 T5-XXL(4.6B 参数) 编码指令,取 pretrained language features;采样时用 classifier-free guidance,ŝ = (1+ω)·s(τ_k,k|c,x₀) − ω·s(τ_k,k),ω 控制文本+首帧条件强度。
  • 首帧约束(Conditional Video Synthesis):视频规划必须从「当前观测帧」出发。作者试过只在采样时把首帧钉死(Diffuser 式),发现后续帧会显著偏离观测;改为训练时就把首帧作为显式条件上下文喂进去,效果好得多。
  • 轨迹一致性 / Tiling(关键 trick):文本→视频模型天生会让场景随时间大幅变化,不利于抽动作。UniPi 复用一个时序超分(temporal super-resolution)视频扩散架构,把「被条件的那张观测帧」在时间轴上 tile(平铺复制到所有帧位),去噪每一帧时都把这张观测帧 channel-wise 拼接到当前带噪帧上,作为强信号维持底层环境状态跨时间一致。跨帧混合用时序卷积(temporal convolution)而非时序 attention,以保持局部时序一致性。
  • 分层规划(Hierarchical Planning):先沿时间轴稀疏采样生成粗粒度视频(“abstraction”),再用时序超分把帧插值加密成细粒度可执行 plan;coarse-to-fine 的超分同时进一步改善一致性。
  • 可调制规划(Flexible Behavioral Modulation):采样时可组合一个先验 h(τ) 施加测试期约束——可以是图像分类器(引导 plan 优化某任务),也可以是对某张目标图像的 Dirac delta(把 plan 导向特定状态)。

动作生成器 π(inverse dynamics)

  • 一个小模型,从相邻/输入图像帧回归动作,训练独立于 planner,可用单独的、更小甚至次优的(仿真器生成的)数据集训练。
  • 仿真机器人上直接预测 7 维控制量(6 个关节值 + 1 个离散接触动作),用 MSE。结构:1 层 3×3 卷积 → 3 层带残差的 3×3 卷积 → 全像素 mean-pooling → MLP(128, 7) 出最终控制。
  • 执行:合成 H 帧后逐帧用逆动力学抽 H 个动作。可闭环(每执行一步重新生成 H 个动作,即 MPC)或开环(顺序执行首次推理出的动作序列);本文所有实验为计算效率一律用开环控制器

各实验的具体配置(分辨率 T×H×W / 参数量)

  • 组合泛化 & 多任务(仿真机械臂):首帧条件视频扩散 10×48×64(每 8 帧抽 1 帧)1.7B + 时序超分 20×48×64(每 4 帧抽 1)1.7B。分辨率刻意选到「被操作物体(方块)清晰可见」。
  • 真实世界:微调 4 个在 Imagen Video 数据上预训练的时序超分模型——16×40×24(1.7B)、32×40×24(1.7B)、32×80×48(1.4B)、32×320×192(1.2B)

数据

  • 组合规划任务(PDSketch 环境 [23]):机器人先拿白块放进色碗上色,再按语言指令(如”把红块放到青块右边”)摆放。动作空间 = 6 关节值 + 1 离散接触动作。语言指令 70% 训练可见 / 30% 仅测试;块/碗/盘位置每回合全随机。视频模型训练用 20 万(200k)条脚本 agent 生成的语言指令视频;因只有一部分视频带动作标注,逆动力学模型只在 2 万(20k)条带标注视频上训练。
  • 多任务迁移(CLIPort 环境 [28]):从 [28] 取 10 个训练任务(put-block-in-bowl-unseen-colors、packing-unseen-google-objects-seq、assembling-kits-seq、tower-of-hanoi-seq 等),迁移到 3 个测试任务(put-block-in-bowl-seen-colors、packing-unseen-google-objects-group、packing-boxes-pairs-unseen-colors)。脚本 oracle 生成 200k 视频;逆动力学在这 200k 生成视频的动作标注上训练。
  • 真实世界迁移
    • 互联网预训练集(与 Imagen Video [19] 同款):1400 万(14M)video-text pair + 6000 万(60M)image-text pair + 公开 LAION-400M image-text
    • 真实机器人集Bridge 数据集 [29],7.2k video-text pair,用 task ID 当文本;按 80%/20% 切 train/test。
    • 流程:先在互联网集上预训练 UniPi,再在 Bridge train split 上微调。
  • sim-vs-real / co-training:仿真实验纯脚本 agent 数据;真实实验靠「互联网非机器人视频预训练 → 少量真实机器人数据微调」的知识迁移,是本文最核心的数据主张。

训练方法

  • 目标函数:文本+首帧条件的视频扩散去噪目标(连续时间扩散,forward q_k(τ_k|τ)=N(α_k τ, σ_k² I),学去噪器 s(τ_k,k|c,x₀)),采样用 classifier-free guidance。属于 offline / imitation 范式——从既有经验数据集 D={(xᵢ,aᵢ), x_H, c} 同时估计 ρ 和 π,不涉及在线 RL、不需要 reward 函数
  • 多阶段管线:(1) 训首帧条件视频扩散规划器;(2) 训时序超分模型(做分层加密 + 一致性);(3) 独立训逆动力学。真实实验额外加「互联网预训练 → Bridge 微调」两段。
  • 视频扩散超参2M steps,batch size 2048,学习率 1e-4,10k 步线性 warmup。首帧条件生成模型与时序超分模型各用 256 块 TPU-v4 芯片训练。首帧条件实现:把首帧复制到所有未来帧位,超分模型把这张复制的首帧 channel-wise 拼到带噪数据上(仿 Imagen [46])。
  • 逆动力学超参:Adam,梯度范数裁剪到 1,学习率 1e-4,2M steps,前 10k 步线性 warmup。
  • baselines 复现细节:Transformer BC(沿用多游戏决策 Transformer [26] 的 10M 结构,4 层 8 头 hidden 512,context 4、每 4 帧抽 1)、Transformer TT(预测未来 8 个控制)、State-Based Diffusion(把 Diffuser [21] 的未来控制在像素位复制后套 UniPi 同款 U-Net)。所有方法都用 T5 embedding 编码语言指令。

Infra(训练 / 推理工程)

  • 训练硬件:视频扩散规划器 + 时序超分模型各 256 块 TPU-v4;batch 2048、2M steps。逆动力学模型硬件未单独披露(结构极小)。GPU/TPU-hours 未披露。
  • 精度 / 并行策略:未披露(沿用 VDM/Imagen Video 训练栈)。
  • 推理:视频扩散较慢——生成一段高逼真视频可达约 1 分钟。论文指出可用扩散蒸馏(progressive distillation [44])加速,作者初步实验得到 16× 加速;也可换更快采样器。控制频率/边缘部署延迟未披露(所有实验为开环、仿真 PyBullet 关节控制器执行,超时 2 秒)。

评测 benchmark

表 1 — 组合环境任务完成率(%,Task Completion Accuracy;Seen/Novel × Place/Relation)

模型Seen PlaceSeen RelationNovel PlaceNovel Relation
State + Transformer BC [24]19.4±3.78.2±2.011.9±4.93.7±2.1
Image + Transformer BC [24]9.4±2.211.9±1.89.7±4.57.3±2.6
Image + TT [25]17.4±2.912.8±1.813.2±4.19.1±2.5
Diffuser [21]9.0±1.211.2±1.012.5±2.49.6±1.7
UniPi (Ours)59.1±2.553.2±2.060.1±3.946.1±3.0

UniPi 在所有列上碾压 baseline(约 3–6×),且在**未见组合(Novel)**上几乎不掉点,验证组合泛化。

表 2 — 消融(%,seen 的 place/relation 任务)

Frame ConditionFrame ConsistencyTemporal HierarchyPlaceRelation
13.2±3.212.4±2.4
52.4±2.934.7±2.6
53.2±3.039.4±2.8
59.1±2.553.2±2.0

三个组件各有增益:首帧条件(13→52)贡献最大,帧一致性/tiling 再补一档,时序分层对更需精细规划的 relation 任务提升明显(39→53)。

表 3 — 多任务 CLIPort 环境任务完成率(%)

模型Place BowlPack ObjectPack Pair
State + Transformer BC9.8±2.621.7±3.51.3±0.9
Image + Transformer BC5.3±1.95.7±2.17.8±2.6
Image + TT4.9±2.119.8±0.42.3±1.6
Diffuser14.8±2.915.9±2.710.5±2.4
UniPi (Ours)51.6±3.675.5±3.145.7±3.7

在 10 训练任务 → 3 未见测试任务的迁移上同样大幅领先。

表 4 — 真实环境视频生成质量(24×40,Bridge 数据)

设置CLIP Score ↑FID ↓FVD ↓Success ↑
无预训练24.43±0.0417.75±0.56288.02±10.4572.6%
互联网预训练24.54±0.0314.54±0.57264.66±13.6477.1%

互联网预训练在 FID/FVD 上明显更优、CLIP 略优,且能泛化到 Bridge 里不存在的新指令与新场景(Fig. 8),对背景变化(黑边裁剪、P 图物体)也更鲁棒(Fig. 9)。Success 用一个「取生成视频末帧判成败」的成功分类器作代理指标(作者指出 CLIP score 无法反映任务是否真正完成,呼吁更好的控制向生成指标)。

创新点与影响

  • 提出 UPDP 抽象:用「图像=通用状态接口、文本=通用任务规约、任务无关的视频规划 ρ 与环境相关的动作 π 解耦」替代 MDP,从抽象层面解掉「跨环境异构 state/action + reward 设计」两难。
  • 奠定「视频生成即策略/世界模型」范式:首次把序列决策明确 cast 成文本条件视频生成 + 逆动力学抽动作,论文自称是首个提出用图像作为通用 state/action 空间、实现跨本体(含人-机器人之间)广泛知识迁移的工作。这条骨架成为后续 AVDC / UniSim / Genie 等一大批 video-policy、生成式世界模型工作的母题。
  • 证明互联网视频预训练可迁移到真实机器人规划:14M+60M+LAION 预训练 → 7.2k Bridge 微调,FID/FVD/成功率全面提升并泛化到未见指令。
  • 把扩散规划从低维 state-action 提到像素视频:相较前作 Diffuser 在关节空间扩散,UniPi 在图像空间扩散使其能吃 YouTube 级无 state-action-reward 格式的数据;选扩散而非自回归也利于长时域与分层规划。plan 在人类可读的视频空间产出,便于验证与诊断。

作者自陈局限:(1) 视频扩散慢(约 1 分钟/段),需蒸馏(初步 16× 加速)或更快采样器补救;(2) 实验环境基本全可观测,部分可观测下视频模型可能幻觉出不符物理的物体/运动,需引入世界的语义知识、或与 LLM 结合缓解(列为未来方向);(3) 官方 Google 代码未开源,仅指向社区复现 AVDC。

原始链接

一手源存档(sources/)

  • unipi-universal-policies-video—project — 项目主页快照(含作者/单位、NeurIPS 2023 Spotlight、abstract、代码说明、citation)
  • arXiv 全文 PDF(arXiv:2302.00111v3,NeurIPS 2023 camera-ready):见上方 arXiv 链接,原文 PDF 不入 git。