一句话定位

VLP(Video Language Planning)把长时域机器人规划 cast 成一次前向树搜索:用一个 VLM(PaLM-E)既当策略(提议下一步文本动作)又当价值函数(给候选未来状态打分),用一个文本条件视频扩散模型当动力学模型(把候选文本动作 rollout 成未来图像序列),搜索出的视频计划再经 goal-conditioned 策略逐帧转成机器人控制动作。核心贡献不是新模型,而是把 VLM 和 text-to-video 模型通过搜索组合起来,让计划质量随推理期计算预算(beam 数 × 分支因子)单调提升,在 Language Table / 7DoF 移动机械臂 / 14DoF 双臂 ALOHA 三种硬件上都验证了长时域任务成功率的大幅提升。

背景与定位

2023 年中的两条并行技术线各有短板:(1) LLM/VLM 做高层规划——palm-e 能把语言指令映射成分步文本子目标,但受限于文本表达能力,难以推理形状、物理、约束等底层动力学;(2) 文本条件视频生成模型(如 unipi-universal-policies-video)能合成体现物体运动/碰撞的未来帧序列,但只能生成短时域片段,直接扩展到长时域会失真。VLP 的思路是让两者互补:VLM 负责”接下来做什么”的高层语义决策,视频模型负责”世界如何演变”的底层动力学模拟,通过树搜索把两者拼成任意长的视频计划。

方法论坐标:

  • 直接沿用 unipi-universal-policies-video(Du et al. 2023b,UniPi)的文本条件视频扩散架构作为动力学模型 fVM,并把 UniPi 式”单次生成长视频”设为核心 baseline(对比中作者称为 UniPi baseline)。
  • VLM 策略/价值函数直接微调自 palm-e(Driess et al. 2023,12B 参数)。
  • 与最相近的同期工作 HiP(Compositional Foundation Models for Hierarchical Planning,Ajay et al. 2023)区分:HiP 也组合语言/视频/动作模型,但只逐步生成并执行一步计划;VLP 用前向搜索显式模拟和评估多步未来,能在更长的时域上推理。
  • 执行侧对比 rt-2(Brohan et al. 2023,VLA 直接微调长时域文本-动作对)、LAVA(Lynch et al. 2023,语言条件行为克隆)、palm-e 直接规划短文本片段。7DoF 移动机械臂上的 VLM 规划部分复用 saycan 式 few-shot PaLM 提示范式。
  • 后续影响脉络:这套”VLM 提议 + 视频模型 rollout + VLM 打分”的搜索式规划范式被视为生成式视频世界模型用于机器人规划的一个关键节点,介于 UniPi(无搜索、单模型规划)与更晚的 UniSim 等通用交互式模拟器之间。

模型架构

VLP 由三个可独立训练的子模块组成,通过 Algorithm 1 的树搜索粘合:

VLM 策略 π_VLM(x, g) → a(文本动作提议)

  • 实现方式沿用 palm-e:给定当前图像 tokenized embedding 和自然语言目标 g,查询 VLM 输出下一步文本动作。
  • 两种构造方式:(1) few-shot 提示,给 VLM 一组示例文本动作标签直接推理;(2) 在长轨迹中随机采样短片段 + 其抽象动作标签,微调 PaLM-E。
  • 采样温度 0.3(生成多个候选动作以供分支)。

文本条件视频扩散模型 f_VM(x, a) → x_{1:S}(动力学模型)

  • 架构与训练方法直接沿用 unipi-universal-policies-video(Du et al. 2023b)。
  • 各领域分别训练独立的文本-视频模型;每段短视频时序长度固定为 16 帧,跨模型统一 base channel width 256
  • Language Table:基础分辨率 24×40,逐级超分到 48×80 再到 192×320(progressive super-resolution)。
  • 7DoF 移动机械臂:基础分辨率 64×80,超分到 256×320,只在 RT-1 数据上微调。
  • 14DoF 双臂 ALOHA:视频模型同时输出 4 路相机视角,做法是把各视角 channel-wise 拼接后一起生成(多视角一致性由此获得)。
  • 采样用 DDIM:基础分辨率 64 步,超分辨率各级 4 步;base 模型 classifier-free guidance scale = 5

VLM 启发式函数 H_VLM(x, g) → 标量(价值函数 / 树搜索剪枝依据)

  • 同样微调自 palm-e(与策略共享同一个 12B 模型,联合微调预测启发式和策略两个头)。
  • 训练目标:给定长轨迹片段中某帧 x_t,预测”距轨迹终点/目标完成还剩多少步”;启发式取负的预测步数(越接近目标,值越高)。
  • 推理温度 0.0(确定性打分)。
  • 反 reward-hacking 机制:若某次视频 rollout 让启发式值一次性提升超过固定阈值(Language Table 阈值 50,ALOHA 阈值 15,该阈值凭经验挑选,以在保证长时域计划仍物理合理的前提下取最大值;7DoF 未披露具体阈值),直接丢弃该 rollout——防止搜索钻视频模型的物理不一致空子(如物体瞬移到目标位置)骗取高分。

Algorithm 1(树搜索,parallel hill climbing)

  • 超参:文本分支因子 A、视频分支因子 D、beam 数 B、规划时域 H。
  • 每步:对每个 beam 取当前帧 x,用 π_VLM 采样 A 个候选文本动作,每个动作用 f_VM 生成 D 个视频 rollout(共 A×D 个候选),用 H_VLM 选出启发式值最高的一个 append 到该 beam 的视频计划;每 5 步淘汰启发式值最低的 beam,用当前最高值 beam 复制替换。
  • Language Table 典型配置:规划时域 H=16,beam 数 B=2,文本/视频分支因子均为 4;单次完整规划耗时约 30 分钟,用 4 块 TPU 推理 pod 并行生成 16 段视频。
  • 7DoF 移动机械臂:beam 数改为 3;goal-conditioned 策略只用生成视频的最后一帧(而非每帧)。

Goal-conditioned 动作执行 π_control(x, x_g) → u

  • 沿用 LAVA(Lynch et al. 2023)架构,把 LAVA 原本的 CLIP 文本编码器换成 ResNet 图像编码器,条件为”下一帧目标图像”而非文本。
  • 训练:从配对的图像+底层控制轨迹 (x_{1:T}, u_{1:T}) 中随机采样当前帧 x_t 和未来帧 x_{t+h},训练 π_control(x_t, x_{t+h}) 预测 u_t。
  • 消融证明逐帧调用 goal policy(对合成视频的每一帧都调用一次,而不仅是末帧或用逆动力学)效果最好(见评测部分表 4)。

数据

  • Language Table(仿真+真实,2D 平面推块任务):训练约 1万(10,000)条长时域轨迹,覆盖数百个不同长时域目标;因需要自动化评测,最终选 3 个目标(Move to Area / Group by Color / Make a Line)做定量实验,这 3 个目标合计约 2万(20,000)条轨迹、约 40万(400,000)条短时域文本标签
  • 7DoF 移动机械臂:规划与执行实验直接用 rt-1 的数据集训练。泛化实验中,作者混训一个更大的文本-视频扩散模型,数据混合包括:本域 7DoF 移动机械臂数据、Bridge(Ebert et al. 2021)、rt-2 数据、Ego4D(Grauman et al. 2022,约 3000 小时第一人称视频)、EPIC-KITCHEN(Damen et al. 2018)、LAION-400M(图文对,用于迁移互联网世界知识)。
  • 14DoF 双臂 ALOHA(Zhao et al. 2023 硬件平台):约 1200 条人类遥操作演示,任务是厨房堆叠(先堆碗、再堆杯子在碗上、最后堆餐具在杯子上);每条演示标注约 20 条语言指令,合计约 2.5万(25,000)条短时域文本标签。
  • 数据构造特点:语言标签允许”不完整”——短时域片段可以带标签,长轨迹里也可以有缺失语言标签的片段(视频模型仍能从中学到动力学,即便没有文本监督)。评测集与 baseline 一致(相同 50 个随机场景/任务重复实验)。
  • sim-to-real 之间显式协同训练的具体比例未披露;三类硬件(Language Table / 7DoF / ALOHA)各自训练独立的视频与 VLM 模型,非跨域共享单一 checkpoint。

训练方法

  • 视频扩散模型:沿用 unipi-universal-policies-video(Du et al. 2023b)的模型架构与训练方法(本文未重新披露 batch size / 学习率等具体优化器超参);base 模型用 64 块 TPUv3 pod 训练 3 天,各级超分模型再用 64 块 TPUv3 pod 训练 1 天;每个领域各训一套独立模型。
  • VLM(12B PaLM-E):联合微调一个模型同时预测策略(文本动作)和启发式(步数估计)两个任务,每个领域用 64 块 TPUv3 pod 训练 1 天;各领域独立模型。
  • Goal-conditioned 策略(LAVA 架构):每个领域用 16 块 TPUv3 pod 训练 1 天
  • 训练范式:视频模型和 VLM 各自离线监督训练(模仿学习/回归),不涉及在线 RL、不需要显式 reward 函数;VLM 启发式的监督信号来自轨迹内的”剩余步数”标签(hindsight 式自监督,不需要外部标注)。
  • Baseline 训练细节:LAVA baseline 用相同 16 TPUv3 pod / 1 天设置,条件为长时域目标文本;UniPi baseline 沿用与 VLP 视频模型完全相同的架构和训练方式,但直接在长时域文本目标上训练(跳过 VLP 的搜索过程);RT-2 baseline 用 12B RT2-PaLM-E 架构,64 块 TPUv3 pod 训练 3 天。
  • 执行侧(closed-loop):用 receding horizon control(滚动时域控制)——每生成一个固定时域(如 H=16 或 2)的视频计划、执行若干步动作后,重新生成/replan 新的视频计划,以缓解长时域累积误差和单次规划无法覆盖任务全程的问题。

Infra(训练 / 推理工程)

  • 训练硬件:全部为 TPUv3 pod(非 GPU)。视频扩散模型 base + 超分各 64 块 TPUv3 pod;VLM(PaLM-E 12B)64 块 TPUv3 pod;goal-conditioned 策略 16 块 TPUv3 pod;RT-2 baseline 同为 64 块 TPUv3 pod。精确 TPU-hours、精度(bf16/fp32)与并行策略(数据/模型并行切分方式)未披露。
  • 推理(视频计划生成):Language Table 上完整一次树搜索(H=16, beam=2, 文本/视频分支因子各 4)耗时约 30 分钟,用 4 块 TPU 推理 pod 并行生成 16 段候选视频;DDIM 采样 base 64 步 + 超分各级 4 步。
  • 推理(闭环执行):VLP 完整执行一个环境评测约耗时 1 小时,相比之下 RT-2 baseline 约 0.5 小时(VLP 因需反复 replan 视频计划而更慢);控制频率/边缘设备延迟未披露,仿真执行统一给 1500 步的执行预算(提前完成则提前终止)。
  • 未披露具体的显存占用、单次视频生成的采样延迟拆解(base vs 各级超分)。

评测 benchmark

视频计划合成准确率(表 1,人工判定 50 段生成视频里是否有帧满足长时域目标;Sim / Real 两套环境 × Move to Area / Group by Color / Make a Line 三个任务)

模型Sim Move AreaSim Group ColorSim Make LineReal Move AreaReal Group ColorReal Make Line
UniPi2%4%2%4%12%4%
VLP(无价值函数,仅链式 VLM+视频)10%42%8%20%64%4%
VLP(完整版)58%98%66%78%100%56%

VLP 完整版全面碾压 UniPi(单模型直接生成长视频),也明显优于”仅用 VLM+视频链式生成、无启发式打分”的消融版本,说明分层结构(VLM 高层决策 + 视频动力学模拟)价值函数打分/搜索两者都是关键增益来源。

闭环执行性能(表 2,Reward / Task Completion;1500 步执行预算)

模型Move Area Reward/ComplGroup Color Reward/ComplMake Line Reward/Compl
UniPi30.8 / 0%44.0 / 4%44.0 / 4%
LAVA59.8 / 22%50.0 / 2%33.5 / 0%
RT-218.5 / 0%46.0 / 26%36.5 / 2%
PaLM-E36.5 / 0%43.5 / 2%26.2 / 0%
VLP(Ours)87.3 / 64%95.8 / 92%65.0 / 16%

作者指出任务时域很长(约 1500 步),多数 baseline 会中途”卡住”停止有效动作;VLP 全面领先所有 baseline。

规划预算的影响(表 3,Make Line 任务执行;beam/规划时域/分支因子 → Line Score/Completion)

Beams规划时域分支因子Line ScoreLine Completion
11448.90%
111653.32%
121658.18%
221665.016%

同一任务下,视频合成准确率随搜索预算的关系(图 3,Make Line 任务):

Beams文本分支视频分支视频合成成功率
1114%
11410%
14422%
24456%

两组数据一致地表明:增大 beam 数、规划时域或分支因子(即推理期计算预算)都能单调提升计划质量与执行成功率,代价是推理耗时线性增长。

从视频计划中抽取动作的方式对比(表 4,Group by Color 任务)

抽取方式ScoreCompletion
逆动力学(Inverse Dynamics)89.780%
Goal Policy(仅末帧)85.066%
Goal Policy(逐帧)95.892%

对每个短时域视频的每一帧都调用一次 goal-conditioned 策略,明显优于只用逆动力学或只在末帧调用 goal policy。

定性结果:7DoF 移动机械臂上能生成”开抽屉→放香蕉→放苹果→关抽屉”等多步计划并真实执行(Fig. 4/8);14DoF ALOHA 上能生成 4 相机一致的堆叠计划(碗→杯→餐具,Fig. 5);泛化到 3 个训练时未见过的新物体(橡皮甜甜圈、纸杯蛋糕、木制六边形)和新光照环境(新办公室,右侧光照显著更强),以及两个完全未训练过的新任务指令(“把驼鹿玩具移到绿色梨旁边""捡起士力架能量棒”)。

创新点与影响

  • 首次把 VLM 和文本条件视频生成模型通过前向树搜索显式组合,形成”VLM 既当策略又当价值函数、视频模型当动力学模型”的规划范式,区别于同期 HiP(逐步生成执行、无显式多步搜索)和前作 UniPi(单次生成整段长视频、无搜索/无价值函数)。
  • 验证了计划质量可随推理期计算预算(beam × 分支因子)单调扩展:这是论文反复强调的核心卖点——不需要重新训练模型,纯靠增加搜索预算就能大幅提升长时域任务成功率(视频合成准确率从 4% 到 56%,执行完成率相应提升)。
  • 提出反 reward-hacking 的启发式值裁剪机制,缓解视频动力学模型的物理不一致性(物体瞬移/凭空出现)被搜索过程钻空子利用的问题。
  • 验证跨硬件普适性:同一套算法框架在 Language Table(2D 平面)、7DoF 移动机械臂、14DoF 双臂 ALOHA(4 相机)三种差异巨大的硬件平台上都跑通,且能利用互联网规模的图文/视频数据(Ego4D、EPIC-KITCHEN、LAION-400M)实现对新物体、新光照、新任务指令的零样本泛化。
  • 作者自陈局限:(1) 用图像作为世界状态表征,无法编码物理/质量等隐变量,也不能完整捕捉 3D 状态,只能靠多视角视频或让启发式函数看整段视频部分缓解;(2) 视频动力学模型仿真不总是准确,观察到物体会凭空出现/消失/瞬移的失败案例,作者认为需要更大的视频模型、更多训练数据或显式的物理强化学习反馈来解决;(3) 迁移互联网知识到新任务时偶尔出错,如”捡起章鱼玩具”指令被视频模型误解读为把机械臂本身渲染成章鱼形态。

原始链接

一手源存档(sources/)

  • video-language-planning—project — 项目主页快照(abstract、作者/单位、全部结果视频描述、局限案例、相关工作列表、citation)
  • video-language-planning—github-readme — GitHub 仓库 README 快照(代码说明、数据集字段、citation)
  • arXiv 原文 PDF(arXiv:2310.10625v1):见上方 arXiv 链接,原文 PDF 不入 git。