一句话定位

iVideoGPT(Interactive VideoGPT)是清华 THUML(软件学院 BNRist)与华为诺亚方舟实验室 2024 年 5 月提出、NeurIPS 2024 收录的可交互、可扩展世界模型:把视觉观测、动作、奖励三种信号统一编码成一条 token 序列,用一个 GPT 式自回归 Transformer 做逐 token 预测,从而在”想象环境”里给智能体提供步级(step-level)交互。它的核心发明是压缩式 token 化(compressive tokenization)——一个条件 VQGAN 把未来帧基于上下文帧编码,token 数从每帧 16×16 降到 4×4,渐进 16× 压缩。基于此在 约 142 万条(1,417,954)人类+机器人操作轨迹上做无动作视频预训练,再微调为动作条件视频预测、视觉规划(MPC)、模型驱动强化学习(MBPO)三类下游世界模型,均达到或超过 SOTA。它是”AR Transformer 世界模型”这一路线的开源基石。

背景与定位

论文用图 2 把世界模型架构分成三类,点明 iVideoGPT 要填的缝隙:

  • (a) MBRL 的循环世界模型(Dreamer [Hafner]、MuZero [Schrittwieser]):递归架构天然支持”逐步以动作转移隐状态”,步级交互性强,但只擅长游戏/仿真等视觉简单数据,难以规模化建模真实世界数据。同类可玩世界模型见 gamengendeepmind-genie2diamonddecart-oasis
  • (b) 互联网级视频生成模型(VideoGPT、Stable Video Diffusion):能合成可控长视频,但用非因果的时间融合模块(3D 卷积/时间注意力),只能提供轨迹级交互——一次生成整段,粒度不足以让智能体逐步学精确技能。
  • (c) iVideoGPT 的选择:GPT 式自回归 Transformer,把每一步分别映射为一小段 token,兼顾可扩展与步级交互

与之最相关的两个”大规模世界模型”先驱是 UniSim(扩散)与 Genie(掩码生成),但二者均未开源;iVideoGPT 用通用 AR Transformer 框架,强调无需 adapter 等特定结构改动即可灵活接入多模态条件,并公开权重。与逐帧独立 token 化的多模态 LLM 不同,iVideoGPT 的压缩 token 化”解耦上下文与动力学”,让模型专注预测物体运动、同时维持场景时序一致——这一思路直接借鉴自本组前作 ContextWM(其条件跨注意力机制”similar to ContextWM”)。范式命名:interactive video prediction / autoregressive transformer world model / conditional-VQGAN compressive tokenization。同期”长时程稳定 rollout”的方法论工作见 diffusion-forcing,表征式世界模型见 dino-wm

模型架构

iVideoGPT = 一个压缩式 tokenizer(离散化视频帧)+ 一个自回归 Transformer(预测后续 token)。

压缩式 token 化(条件 VQGAN)

  • 双编解码器对 {(E_c, D_c), (E_p, D_p)}上下文编解码器独立编码前 T0 个上下文帧,每帧 N = 16×16 = 256 个 token;预测编解码器对未来帧只编码”动力学信息”(运动物体的位置/姿态),每帧仅 n = 4×4 = 16 个 token(n ≪ N),实现渐进 16× 序列长度压缩,加速 planning/RL 的 rollout。
  • 预测编码器用一个 4×4 卷积把 16×16 的 embedding 下采样到 4×4 再查码本;因此必须以上下文特征为条件,通过多尺度跨注意力(context 编码器抽取多层次上下文特征,prediction 编码器用 cross-attention 过滤出动力学、prediction 解码器用 cross-attention 逐级取回上下文重建场景)。跨注意力只在特征图 ≤ 阈值时启用(64px 用 16×16、256px 用 32×32),且在编、解码器两端对称施加;支持任意数目上下文帧(各帧特征拼接后做 cross-attention)。
  • tokenizer 配置:码本 8192、embedding 维 64、GroupNorm(32)、SiLU;下采样通道 64px 用 [128,256,512]、256px 用 [128,256,256,512,768](context/prediction 两套编解码器同架构,仅 prediction 端多一个 4×4 卷积瓶颈,非”context vs prediction”之别)。256px VQGAN 由 aMUSEd 预训练模型(openrail++)初始化;64px 不用判别器,等价于”VQVAE + 感知损失”。已发布 tokenizer 参数量 114M(64px)/ 310M(256px)
  • tokenizer 目标:L1 重建 + commitment + 感知损失(+ 256px 才加对抗损失),context 帧与 future 帧分别累加。

自回归 Transformer(交互预测)

  • token 序列插入 slot token[S1] 标记上下文帧起点、[S2] 标记未来帧起点;context 与 future 帧不共享 token id,词表 16,386 = 8192(context) + 8192(future) + 2(slot);总长 L = (N+1)T0 + (n+1)(T−T0) − 1
  • 骨干取 GPT-2 尺寸、但采用 LLaMA 架构(RoPE 旋转位置编码、SiLU)。两档:Small 138M(12 层/12 头/hidden 768/FFN 3072/dropout 0.1)与 Medium 436M(24 层/16 头/hidden 1024/FFN 4096)。多数实验用 138M,缩放分析用 436M。
  • 动作条件:动作经线性投影后加到 slot token embedding 上。奖励预测:不单独建预测器,而是在每个观测的最后一个 token 的隐状态上加线性头(多任务,MSE 损失,RL 里对奖励用 symlog 变换)。动作与奖励均可选,无动作预训练时不含。
  • 记忆/一致性:不训练模型生成上下文帧(损失只覆盖未来帧 token),把容量集中在动力学;条件化编码天然维持上下文时序一致、减轻闪烁。

数据

预训练数据:35 个数据集,来自 Open X-Embodiment(OXE) + Something-Something v2(SSv2),合计 1,417,954 条轨迹(~142 万)(论文表 4 Total)。OXE 侧仿照 Octo 做过滤+加权:剔除无图像流、移动机器人、重复过多、分辨率过低的子集;剩余按规模/多样性分”large/small”并赋采样权重;每子集留 1% 作验证。

采样权重(含轨迹数)关键项:

  • Fractal 12.8%(87,212)、Bridge 12.8%(28,935)、BC-Z 12.8%(43,264)、RoboNet 12.8%(82,649)
  • Kuka 8.5%(580,392,轨迹最多)、Language Table 4.2%(442,226)、Stanford MaskViT 4.2%(9,200)
  • SSv2 15.0%(120,581,人物-物体交互视频,验证”人类操作视频知识可迁移到机器人世界模型”;从 174 类中手选 95 类有明显运动的类别)
  • 其余 ~26 个小集各 0.5%(Taco Play / Jaco Play / Roboturk / Viola / Toto / FurnitureBench / …)

要点:tokenizer 用 OXE+SSv2 训(保证视觉多样性),Transformer 只用 OXE 训。按各数据集采集频率设不同 step size 对齐时序;数据增强用一致的 random resized crop + color jitter。OXE 约占 5TB 磁盘。许可证:OXE=Apache,RoboNet=CC-BY-4.0,BAIR=CC-BY-4.0,SSv2=Data License Agreement。

下游数据:BAIR robot pushing(43k 训/256 测,1 帧预测 15 帧);RoboNet(162k 视频/7 机械臂,256 测,2 帧预测 10 帧,与 OXE 重叠部分已滤除测试视频);VP²(Robosuite 5K 轨迹 + RoboDesk 35K 轨迹);Meta-World 6 任务。

训练方法

两阶段(对齐 LLM):无动作视频预训练 → 领域微调。

  • 预训练目标:交叉熵下一 token 预测,且只对未来帧 token 计损(不生成上下文帧),从第 (N+1)T0+1 个 token 起算。
  • 微调:对下游任务更新全模型(含 tokenizer),实测优于 PEFT(如 LoRA)——作者归因于预训练数据多样性不足、未必覆盖具体机器人场景。tokenizer 适配假设:由于 token 化解耦了动力学与上下文,虽下游会遇到没见过的机器人/夹爪,但”物理运动与交互”的基础知识跨场景共享,故只需微调 tokenizer、冻结 Transformer 即可迁移(BAIR 零样本实验验证)。
  • 关键超参
    • Transformer 预训练:7×10⁵ 步,batch 64,序列长 16,context 2,LR 1e-4 cosine,weight decay 0.01,grad clip 1.0,warmup 5000,AdamW,bf16;采样 temperature 1.0、top-k 100。
    • VQGAN 预训练:1×10⁶ 步,batch 64,LR 5e-4 constant,warmup 500,采样 future 帧 6 帧(省显存)。
  • 模型驱动 RL(MBPO 框架):以 iVideoGPT 为世界模型,用合成 rollout 扩充 replay buffer 训练标准 actor-critic,底座是 DrQ-v2;rollout horizon 10、real data ratio 0.5、rollout batch 32、每 200 env step rollout 一次;tokenizer/Transformer 分别每 40/10 env step 更新。解耦”模型 rollout”与”策略学习”,抛弃先进 MBRL 常用的”latent imagination”,是首次把 MBPO 成功用于视觉连续控制

Infra(训练 / 推理工程)

  • 框架:PyTorch + HuggingFace diffusers/transformers(Apache)。
  • 硬件:A100 + RTX 3090 集群,每个实验 4 GPU 并行、每卡 16 dataloader workers;64px 需 ≥24GB/卡,256px 需 40GB/卡
  • GPU-days(表 2,分 tokenizer/Transformer)
    • VQGAN:Pre-train 17、BAIR 2、RoboNet 8、VP² 4;(256px)Pre-train 16、RoboNet 9。
    • Transformer:Pre-train 19、BAIR 1.5、RoboNet 10、VP² 3;(256px)Pre-train 9、RoboNet 26。
    • 即 64px 完整预训练 ≈ 17+19 = 36 GPU-days(4 卡)。
  • 计算效率:压缩 token 化把自回归 Transformer 前向次数减少 16×(tokenization 消融里量化)。
  • 推理 FPS / control-Hz / 端侧延迟:论文未披露 FPS/控制频率/端侧延迟;仅表 8 给出生成时延——RTX 4090、batch 1 下压缩 token 化生成一段 rollout ≈ 1.11 s(标准 16×16 tokenizer 需 22.5 s,约 20× 慢),tokenize 0.29 s、detokenize 0.06 s、显存 2.33 GB。

评测 benchmark

视频预测(表 1,均值±标准差,3 次运行;LPIPS/SSIM ×100)

设置方法FVD↓PSNR↑SSIM↑LPIPS↓
BAIR 无动作 64pxMAGVIT62.019.378.712.3
VideoGPT / MaskViT / FitVid / MCVD103.3 / 93.7 / 93.6 / 89.5
iVideoGPT75.020.482.39.5
BAIR 动作条件 64pxMaskViT70.5
iVideoGPT60.824.590.25.0
RoboNet 动作条件 64pxFitVid62.528.289.32.4
GHVAE / SVG / MaskViT95.2 / 123.2 / 133.5
iVideoGPT63.227.890.64.9
RoboNet 动作条件 256pxMaskViT211.720.467.117.0
iVideoGPT197.923.880.814.7
  • 加动作条件让 BAIR 的 FVD 改善近 20%(75.0→60.8)。
  • iVideoGPT 与各任务 SOTA(BAIR 的 MAGVIT、RoboNet 的 FitVid)打平,同时独有”可扩展 + 步级交互”架构;显著优于同为逐帧 token 化的 MaskViT(缓解其时序不一致/闪烁)。

视觉规划(VP² benchmark,图 4):在两个 RoboDesk 任务上大幅超过所有基线,整体平均与最强的 SVG′ 相当;在 open slide 任务上偏弱——低分辨率(64px)+ 离散 token 化难以分辨”夹爪是否接触滑块把手”,MPC 采样大量候选易被”过自信”误判为成功(失败案例分析见附录 B.2)。

模型驱动 RL(Meta-World 6 任务,图 7,5 次运行 95% CI,20 评测 episode):不仅大幅优于其 model-free 对手 DrQ-v2 的样本效率,还匹配或超过 DreamerV3;据作者称是 MBPO 首次成功用于视觉连续控制

模型分析(4.4)

  • 零样本:大规模预训练 Transformer 无需微调即能在未见的 BAIR 上预测自然的夹爪运动(但会预测成预训练里的另一种夹爪);只适配 tokenizer、冻结 Transformer 即可迁移到新夹爪类型,画质≈全量微调。
  • 少样本:全量下游数据时预训练收益甚微,但在**数据稀缺(100 或 1000 条轨迹)**时优势显著——这对 MBRL 尤为关键。
  • 模型缩放:138M vs 436M,验证损失(困惑度)随模型增大持续下降且下降更快
  • token 化消融(RoboNet,同步数):纯 4×4 tokenizer 重建质量差;压缩 token 化相比标准 16×16 重建略降,但上下文更一致(利于视频预测)、且计算效率 16×

创新点与影响

  • 贡献:(1) 提出带压缩 token 化的自回归 Transformer 世界模型架构,兼顾可扩展与步级交互;(2) 在约 142 万条机器人+人类操作轨迹上预训练并开源权重(HF 上发布 64px/256px、无动作/目标条件/动作条件多档 checkpoint);(3) 一套模型在视频预测、视觉规划、MBRL 三类任务通吃。
  • 改变了什么:把”互联网级视频生成”与”MBRL 世界模型”两条线桥接起来;证明足够强的世界模型可以让 MBRL 算法极简化——直接用 MBPO 在图像空间做 rollout、无需 latent imagination 也能媲美 DreamerV3,简化了 MBRL 设计空间。
  • 作者自陈局限:公开机器人数据(含 OXE)多样性不足;压缩 token 化假设初始帧提供了足够上下文,在长视频、大幅相机运动场景会失效(可用关键帧抽取缓解);两阶段”token 化+预测”的离散化不可避免丢信息,在需要分辨细微接触的任务(open slide)上不如端到端模型(SVG′/FitVid);主实验分辨率偏低(64px)。
  • 后续:本组 2025 年 RLVR-World(NeurIPS 2025)证明 iVideoGPT 可用”可验证奖励强化学习(RLVR)“进一步提升。

原始链接

一手源存档(sources/)