一句话定位
UniPi 把「序列决策 = 文本条件视频生成」这一范式落地:给定一句任务指令和当前观测帧,先用一个文本条件视频扩散模型把「未来会发生什么」合成成一段图像序列(这就是 planning),再用一个小的逆动力学模型(inverse dynamics)从相邻帧回归出具体动作去执行。它是「视频生成即策略 / 视频生成即世界模型」这条路线的奠基工作,用图像作为跨环境的统一状态-动作接口,用文本作为统一任务规约,从而绕开了 MDP 里「设计 reward + 各环境异构 state/action 空间」的老问题,并首次证明在互联网级 text-video 数据上预训练能把知识迁移到真实机器人视频规划。NeurIPS 2023 Spotlight。
背景与定位
2023 年初的背景:视觉/语言领域靠大规模预训练拿到了强 zero-shot 泛化(GPT-3、Flamingo、CLIP),但决策智能体一直被「环境多样性」卡住——MuJoCo 的关节连续控制和 Atari 的图像离散动作根本没法共享 state/action 空间。既有的「统一 token 序列建模」路线(gato-a-generalist-agent Gato)虽然把多环境塞进一个 token 序列,但作者认为这种自定义 token 化既不自然、也丢掉了预训练视觉语言模型里的知识,且只能在 state/action 空间相同的环境(如多个 Atari 游戏)里工作。
UniPi 的破题思路:把「图像序列(视频)」当成跨环境通用的观测-行为载体,把「文本」当成通用任务规约。为此它提出一个替代 MDP 的抽象 UPDP(Unified Predictive Decision Process,统一预测决策过程):一个元组 G = ⟨X, C, H, ρ⟩,X 是图像观测空间,C 是文本任务描述空间,H 是有限时域长度,ρ(·|x₀, c) 是一个条件视频生成器——直接对「给定首帧 x₀ 和任务 c 的 H 步图像轨迹」建分布。UPDP 相对 MDP 的三点区别:(1) 用图像作通用状态接口,免去为每个环境造复杂 state 表征;(2) 用文本任务规约取代实数 reward,免去跨环境的 reward 设计与迁移;(3) 把「任务无关的视频规划 ρ」与「环境相关的动作选择 π」解耦,让 planner 环境/本体无关、可复用可迁移可调试。这属于 generative video world model / planning-as-video-generation 范式。
坐标系:
- video-diffusion-models-vdm(VDM,Ho et al. 2022):UniPi 视频扩散的基础架构直接沿用它的 Video U-Net([45])。
- imagen-video(Imagen Video,[19]):UniPi 真实机器人实验的预训练数据与训练算法沿用它(14M video-text + 60M image-text + LAION-400M)。
- Diffuser(Janner et al. ICML 2022,“Planning with Diffusion”,[21]):同作者线上的前作,用无条件扩散在关节 state-action 轨迹上做规划 + 单独 reward 模型选 plan;UniPi 的关键差异是扩散的是未来图像帧而非低维 state-action,从而能吃互联网视频、跨本体迁移。论文里把它作为 State-Based Diffusion baseline 复现。
- Decision Diffuser(Ajay et al. [27]):条件扩散做 offline RL 的同期工作,同为 baseline 思路来源。
- VPT([32]):也用逆动力学给无标注视频打动作标签,但 VPT 的逆动力学本身不支持基于模型的规划;UniPi 把「学世界模型」和「分层规划」在视频空间里合到一起做。
- 后续影响:这套「文本→视频规划→逆动力学抽动作」的骨架被 genie-generative-interactive-environments、AVDC、UniSim、以及大量 video-policy / 世界模型工作继承。作者点名的开源复现是 flow-diffusion/AVDC(Google 内部代码未开源)。
模型架构
UniPi = 通用视频规划器 ρ(视频扩散)+ 任务专属动作生成器 π(逆动力学),是 diffusion-UPDP 的一个具体实例(论文 Fig. 2)。
通用视频规划器 ρ(video diffusion planner)
- backbone:Video U-Net,架构与训练直接沿用 VDM [45]——3 个残差块、base channel 512、channel multiplier [1, 2, 4]、attention 分辨率 [6, 12, 24]、attention head 维度 64、conditioning embedding 维度 1024;噪声调度用 log-SNR,范围 [-20, 20]。
- 文本条件:用 T5-XXL(4.6B 参数) 编码指令,取 pretrained language features;采样时用 classifier-free guidance,ŝ = (1+ω)·s(τ_k,k|c,x₀) − ω·s(τ_k,k),ω 控制文本+首帧条件强度。
- 首帧约束(Conditional Video Synthesis):视频规划必须从「当前观测帧」出发。作者试过只在采样时把首帧钉死(Diffuser 式),发现后续帧会显著偏离观测;改为训练时就把首帧作为显式条件上下文喂进去,效果好得多。
- 轨迹一致性 / Tiling(关键 trick):文本→视频模型天生会让场景随时间大幅变化,不利于抽动作。UniPi 复用一个时序超分(temporal super-resolution)视频扩散架构,把「被条件的那张观测帧」在时间轴上 tile(平铺复制到所有帧位),去噪每一帧时都把这张观测帧 channel-wise 拼接到当前带噪帧上,作为强信号维持底层环境状态跨时间一致。跨帧混合用时序卷积(temporal convolution)而非时序 attention,以保持局部时序一致性。
- 分层规划(Hierarchical Planning):先沿时间轴稀疏采样生成粗粒度视频(“abstraction”),再用时序超分把帧插值加密成细粒度可执行 plan;coarse-to-fine 的超分同时进一步改善一致性。
- 可调制规划(Flexible Behavioral Modulation):采样时可组合一个先验 h(τ) 施加测试期约束——可以是图像分类器(引导 plan 优化某任务),也可以是对某张目标图像的 Dirac delta(把 plan 导向特定状态)。
动作生成器 π(inverse dynamics)
- 一个小模型,从相邻/输入图像帧回归动作,训练独立于 planner,可用单独的、更小甚至次优的(仿真器生成的)数据集训练。
- 仿真机器人上直接预测 7 维控制量(6 个关节值 + 1 个离散接触动作),用 MSE。结构:1 层 3×3 卷积 → 3 层带残差的 3×3 卷积 → 全像素 mean-pooling → MLP(128, 7) 出最终控制。
- 执行:合成 H 帧后逐帧用逆动力学抽 H 个动作。可闭环(每执行一步重新生成 H 个动作,即 MPC)或开环(顺序执行首次推理出的动作序列);本文所有实验为计算效率一律用开环控制器。
各实验的具体配置(分辨率 T×H×W / 参数量)
- 组合泛化 & 多任务(仿真机械臂):首帧条件视频扩散 10×48×64(每 8 帧抽 1 帧)1.7B + 时序超分 20×48×64(每 4 帧抽 1)1.7B。分辨率刻意选到「被操作物体(方块)清晰可见」。
- 真实世界:微调 4 个在 Imagen Video 数据上预训练的时序超分模型——16×40×24(1.7B)、32×40×24(1.7B)、32×80×48(1.4B)、32×320×192(1.2B)。
数据
- 组合规划任务(PDSketch 环境 [23]):机器人先拿白块放进色碗上色,再按语言指令(如”把红块放到青块右边”)摆放。动作空间 = 6 关节值 + 1 离散接触动作。语言指令 70% 训练可见 / 30% 仅测试;块/碗/盘位置每回合全随机。视频模型训练用 20 万(200k)条脚本 agent 生成的语言指令视频;因只有一部分视频带动作标注,逆动力学模型只在 2 万(20k)条带标注视频上训练。
- 多任务迁移(CLIPort 环境 [28]):从 [28] 取 10 个训练任务(put-block-in-bowl-unseen-colors、packing-unseen-google-objects-seq、assembling-kits-seq、tower-of-hanoi-seq 等),迁移到 3 个测试任务(put-block-in-bowl-seen-colors、packing-unseen-google-objects-group、packing-boxes-pairs-unseen-colors)。脚本 oracle 生成 200k 视频;逆动力学在这 200k 生成视频的动作标注上训练。
- 真实世界迁移:
- 互联网预训练集(与 Imagen Video [19] 同款):1400 万(14M)video-text pair + 6000 万(60M)image-text pair + 公开 LAION-400M image-text。
- 真实机器人集:Bridge 数据集 [29],7.2k video-text pair,用 task ID 当文本;按 80%/20% 切 train/test。
- 流程:先在互联网集上预训练 UniPi,再在 Bridge train split 上微调。
- sim-vs-real / co-training:仿真实验纯脚本 agent 数据;真实实验靠「互联网非机器人视频预训练 → 少量真实机器人数据微调」的知识迁移,是本文最核心的数据主张。
训练方法
- 目标函数:文本+首帧条件的视频扩散去噪目标(连续时间扩散,forward q_k(τ_k|τ)=N(α_k τ, σ_k² I),学去噪器 s(τ_k,k|c,x₀)),采样用 classifier-free guidance。属于 offline / imitation 范式——从既有经验数据集 D={(xᵢ,aᵢ), x_H, c} 同时估计 ρ 和 π,不涉及在线 RL、不需要 reward 函数。
- 多阶段管线:(1) 训首帧条件视频扩散规划器;(2) 训时序超分模型(做分层加密 + 一致性);(3) 独立训逆动力学。真实实验额外加「互联网预训练 → Bridge 微调」两段。
- 视频扩散超参:2M steps,batch size 2048,学习率 1e-4,10k 步线性 warmup。首帧条件生成模型与时序超分模型各用 256 块 TPU-v4 芯片训练。首帧条件实现:把首帧复制到所有未来帧位,超分模型把这张复制的首帧 channel-wise 拼到带噪数据上(仿 Imagen [46])。
- 逆动力学超参:Adam,梯度范数裁剪到 1,学习率 1e-4,2M steps,前 10k 步线性 warmup。
- baselines 复现细节:Transformer BC(沿用多游戏决策 Transformer [26] 的 10M 结构,4 层 8 头 hidden 512,context 4、每 4 帧抽 1)、Transformer TT(预测未来 8 个控制)、State-Based Diffusion(把 Diffuser [21] 的未来控制在像素位复制后套 UniPi 同款 U-Net)。所有方法都用 T5 embedding 编码语言指令。
Infra(训练 / 推理工程)
- 训练硬件:视频扩散规划器 + 时序超分模型各 256 块 TPU-v4;batch 2048、2M steps。逆动力学模型硬件未单独披露(结构极小)。GPU/TPU-hours 未披露。
- 精度 / 并行策略:未披露(沿用 VDM/Imagen Video 训练栈)。
- 推理:视频扩散较慢——生成一段高逼真视频可达约 1 分钟。论文指出可用扩散蒸馏(progressive distillation [44])加速,作者初步实验得到 16× 加速;也可换更快采样器。控制频率/边缘部署延迟未披露(所有实验为开环、仿真 PyBullet 关节控制器执行,超时 2 秒)。
评测 benchmark
表 1 — 组合环境任务完成率(%,Task Completion Accuracy;Seen/Novel × Place/Relation)
| 模型 | Seen Place | Seen Relation | Novel Place | Novel Relation |
|---|---|---|---|---|
| State + Transformer BC [24] | 19.4±3.7 | 8.2±2.0 | 11.9±4.9 | 3.7±2.1 |
| Image + Transformer BC [24] | 9.4±2.2 | 11.9±1.8 | 9.7±4.5 | 7.3±2.6 |
| Image + TT [25] | 17.4±2.9 | 12.8±1.8 | 13.2±4.1 | 9.1±2.5 |
| Diffuser [21] | 9.0±1.2 | 11.2±1.0 | 12.5±2.4 | 9.6±1.7 |
| UniPi (Ours) | 59.1±2.5 | 53.2±2.0 | 60.1±3.9 | 46.1±3.0 |
UniPi 在所有列上碾压 baseline(约 3–6×),且在**未见组合(Novel)**上几乎不掉点,验证组合泛化。
表 2 — 消融(%,seen 的 place/relation 任务)
| Frame Condition | Frame Consistency | Temporal Hierarchy | Place | Relation |
|---|---|---|---|---|
| 否 | 否 | 否 | 13.2±3.2 | 12.4±2.4 |
| 是 | 否 | 否 | 52.4±2.9 | 34.7±2.6 |
| 是 | 是 | 否 | 53.2±3.0 | 39.4±2.8 |
| 是 | 是 | 是 | 59.1±2.5 | 53.2±2.0 |
三个组件各有增益:首帧条件(13→52)贡献最大,帧一致性/tiling 再补一档,时序分层对更需精细规划的 relation 任务提升明显(39→53)。
表 3 — 多任务 CLIPort 环境任务完成率(%)
| 模型 | Place Bowl | Pack Object | Pack Pair |
|---|---|---|---|
| State + Transformer BC | 9.8±2.6 | 21.7±3.5 | 1.3±0.9 |
| Image + Transformer BC | 5.3±1.9 | 5.7±2.1 | 7.8±2.6 |
| Image + TT | 4.9±2.1 | 19.8±0.4 | 2.3±1.6 |
| Diffuser | 14.8±2.9 | 15.9±2.7 | 10.5±2.4 |
| UniPi (Ours) | 51.6±3.6 | 75.5±3.1 | 45.7±3.7 |
在 10 训练任务 → 3 未见测试任务的迁移上同样大幅领先。
表 4 — 真实环境视频生成质量(24×40,Bridge 数据)
| 设置 | CLIP Score ↑ | FID ↓ | FVD ↓ | Success ↑ |
|---|---|---|---|---|
| 无预训练 | 24.43±0.04 | 17.75±0.56 | 288.02±10.45 | 72.6% |
| 互联网预训练 | 24.54±0.03 | 14.54±0.57 | 264.66±13.64 | 77.1% |
互联网预训练在 FID/FVD 上明显更优、CLIP 略优,且能泛化到 Bridge 里不存在的新指令与新场景(Fig. 8),对背景变化(黑边裁剪、P 图物体)也更鲁棒(Fig. 9)。Success 用一个「取生成视频末帧判成败」的成功分类器作代理指标(作者指出 CLIP score 无法反映任务是否真正完成,呼吁更好的控制向生成指标)。
创新点与影响
- 提出 UPDP 抽象:用「图像=通用状态接口、文本=通用任务规约、任务无关的视频规划 ρ 与环境相关的动作 π 解耦」替代 MDP,从抽象层面解掉「跨环境异构 state/action + reward 设计」两难。
- 奠定「视频生成即策略/世界模型」范式:首次把序列决策明确 cast 成文本条件视频生成 + 逆动力学抽动作,论文自称是首个提出用图像作为通用 state/action 空间、实现跨本体(含人-机器人之间)广泛知识迁移的工作。这条骨架成为后续 AVDC / UniSim / Genie 等一大批 video-policy、生成式世界模型工作的母题。
- 证明互联网视频预训练可迁移到真实机器人规划:14M+60M+LAION 预训练 → 7.2k Bridge 微调,FID/FVD/成功率全面提升并泛化到未见指令。
- 把扩散规划从低维 state-action 提到像素视频:相较前作 Diffuser 在关节空间扩散,UniPi 在图像空间扩散使其能吃 YouTube 级无 state-action-reward 格式的数据;选扩散而非自回归也利于长时域与分层规划。plan 在人类可读的视频空间产出,便于验证与诊断。
作者自陈局限:(1) 视频扩散慢(约 1 分钟/段),需蒸馏(初步 16× 加速)或更快采样器补救;(2) 实验环境基本全可观测,部分可观测下视频模型可能幻觉出不符物理的物体/运动,需引入世界的语义知识、或与 LLM 结合缓解(列为未来方向);(3) 官方 Google 代码未开源,仅指向社区复现 AVDC。
原始链接
- 论文(arXiv abs):https://arxiv.org/abs/2302.00111
- 论文 PDF:https://arxiv.org/pdf/2302.00111
- 项目主页(视频 demo):https://universal-policy.github.io/unipi/
- 会议:NeurIPS 2023(Spotlight)
- 社区开源复现(非官方,作者点名):https://github.com/flow-diffusion/AVDC
一手源存档(sources/)
- unipi-universal-policies-video—project — 项目主页快照(含作者/单位、NeurIPS 2023 Spotlight、abstract、代码说明、citation)
- arXiv 全文 PDF(arXiv:2302.00111v3,NeurIPS 2023 camera-ready):见上方 arXiv 链接,原文 PDF 不入 git。