一句话定位

Pandora 是 Maitrix.org(联合 UC San Diego、MBZUAI;作者含 Eric P. Xing/Zhiting Hu 团队)2024 年 6 月提出的通用世界模型:一个自回归-扩散混合模型,把”前序视频状态 + 自由文本动作”自回归地映射为”下一段视频状态”,允许在生成过程中任意时刻用自然语言插入动作做实时控制(区别于传统文生视频模型只能在开头给一次 prompt)。核心做法是复用现成预训练模型——Vicuna-7B-v1.5(经 Chat-UniVi 包装的自回归 LLM 主干)+ DynamiCrafter(图生视频扩散模型)——用两个 Q-Former 适配器缝合,只需轻量对齐 + 指令微调、无需从零训练。论文本身只有定性结果(作者原话:“we aim to report more quantitative results in the future”),无任何量化 benchmark 表格。

背景与定位

论文开篇给出的问题定位:LLM 擅长语言但缺乏对物理世界(如流体粘性影响流动)的真实理解;同期的文生视频模型(Stable Video Diffusion 等)画质高但没有交互式动作控制;已有的规模化交互世界模型如 gaia-1-wayve(自动驾驶)、unisim(机器人操作)、genie-generative-interactive-environments(2D 游戏)虽然做到了动作可控,但都局限于各自单一领域,动作/状态集合有限。Pandora 想做的是跨越这些领域边界的通用世界模型:域通用(indoor/outdoor、natural/urban、human/robot、2D/3D)、视频一致、且动作用自由文本(而非离散/领域专属动作空间)表达。

方法论上类比 LLM 的成功配方:“大规模预训练 + 指令微调”:预训练阶段分别复用已经在各自领域完成大规模预训练的 LLM 和文生视频模型(不用视频-动作序列重新预训练二者),指令微调阶段只用少量、精心构造的”状态-动作”序列数据教会模型实时可控性。论文承认更强的骨干(GPT-4、sora)预计会带来更好效果,Pandora 只是”迈向通用世界模型的一步”(论文标题 “Towards”)。范式命名:hybrid autoregressive-diffusion world model with free-text action conditioning

模型架构

状态转移建模:形式化为 $P(S_t \mid S_{t-1}, A_{t-1}, \ldots, S_1, A_1)$。每个状态 $S_i=(s_1,\ldots,s_N)$ 是单帧图像($i=1$ 时)或一段视频帧序列;每个动作 $A_i=(x_1,\ldots,x_M)$ 是一串自然语言文本 token——动作没有专门的离散动作词表,直接复用 LLM 自身的文本 tokenizer/embedding

两大核心组件

  • 自回归主干:源自预训练 LLM。具体用 Chat-UniVi(一个自带视觉编码器的 Vicuna-7B-v1.5)作为基座,即 7B 参数量级。
  • 视频生成器:源自预训练文生视频扩散模型 DynamiCrafter(图像+文本条件的视频扩散模型),每个视频片段固定生成 16 帧(由 DynamiCrafter 本身决定)。

缝合模块:一个视觉编码器 + 两个独立的 Q-Former 适配器——(1) 视觉编码器→LLM 主干的 Q-Former(编码前序状态 $S_{t-1}$ 的视觉信息),(2) LLM 主干→视频生成器的 Q-Former(把 LLM 输出embedding 转成视频生成器能理解的条件embedding)。GitHub 开源的 configuration.py 印证了这一结构:WorldModelConfig 组合了一个 Blip2QFormerConfig(适配器)、一个 ChatUniVi 子配置(默认 video_model_name_or_path="Chat-UniVi/Chat-UniVi")和一个 CLIPTextConfig 扩散文本编码器配置;diffusion_qformer_configqformer_config 的深拷贝(encoder_hidden_size 设为其 hidden_size),对应论文里两个 Q-Former 共享设计但用途不同。

单步前向流程:在时间步 $t$,自回归主干接受三组 embedding 输入——(1) 前序状态 $S_{t-1}$ 经视觉编码器+Q-Former 得到的视觉 embedding 序列;(2) 前序动作 $A_{t-1}$ 的文本 token embedding;(3) 一组可学习的 query embedding(长度、位置与要喂给视频生成器的输出embedding 一一对应,作用是”刺激”模型开始生成视频,思路借鉴 DreamLLM)。LLM 输出一串 embedding,经第二个 Q-Former 适配器转换后,喂给视频生成器(DynamiCrafter)生成视频片段 $S_t$。为提升与前序片段的一致性,视频生成器额外接收 $S_{t-1}$ 的最后 4 帧(若 $S_{t-1}$ 是初始单帧图像 $S_1$,则接收该单帧)作为条件;同时接收一个 FPS 数值控制生成视频的运动幅度。

冻结策略(由 configuration.py 默认值印证):Chat-UniVi(LLM+视觉编码器)与 DynamiCrafter(视频生成器)默认都 freeze=True;只有两个 Q-Former 适配器 + query embeddings 是训练对象(阶段 1),阶段 2 额外解冻视频生成器本身。

数据

阶段 1(预训练对齐):仅用 WebVid-10M 视频字幕数据集做对齐——对每个 (视频, 字幕) 样本,取视频首帧+字幕喂入 LLM+视觉编码器得到输出 embedding,同时把字幕喂入视频生成器自带的文本编码器得到 caption embedding,最小化两者的 L2 损失,只训练 Q-Former 适配器与 query embeddings,LLM 和视频生成器全程冻结。

阶段 2(指令微调):构造了一套 1.2M(约 123.3 万)条视频-动作序列数据(论文 Table 1),来自公开语料 + 模拟器两类源:

数据集类别条数
Panda-70MYouTube500k
Something-Something V2Human Activity188k
BridgeData V2Robot Arm33k
HM3DIndoor152k
MP3DIndoor70k
StreetLearnStreet view146k
CARLADriving75k
Coinrun2D Game30k
EPIC-KITCHENSKitchen39k
Total-1.2M
  • Panda-70M(真实 YouTube 视频):先做美学分 / 光流幅度 / 切镜检测 / 静止视频检测 / 片段长度五重过滤,再用 GPT-4 Turbo 对每段采样的 4 帧生成”聚焦动态描述”的字幕(而非通用场景字幕),得到 500k 视频-文本对。
  • Something-Something V2 / BridgeData V2 / EPIC-KITCHENS:既有动作标注数据集直接复用,合计 260k(188k+33k+39k)。
  • CARLA(自动驾驶模拟器):支持运行时灵活改环境(“Change the weather to Sunset”、“Add a car to the front”),采样 75k 视频-动作对。
  • MP3D / StreetLearn(室内/城市全景扫描):自建渲染环境,通过渐变相机位姿构造转向类动作(如 “turn right for 60 degrees”),并用 GPT-4 Turbo 生成场景描述,动作描述=转向指令+最终场景描述;分别得到 70k / 146k。
  • HM3D(真实室内场景 3D 数据集):用 Habitat-Lab 渲染并随机采样轨迹,得到 152k。
  • Coinrun:2D 游戏模拟数据 30k。

训练视频长度最长 5 秒(40 帧);推理时靠自回归结构外推到 8 秒(64 帧)。数据构成上真实/公开语料(Panda-70M+SSv2+BridgeData V2+EPIC-KITCHENS)约 760k,模拟器渲染数据(CARLA+MP3D+StreetLearn+HM3D+Coinrun)约 473k。

训练方法

两阶段流程,类比 LLM 的”预训练→指令微调”:

  1. 预训练(域通用性 + 生成一致性):不做视频-动作序列的从零预训练,而是直接复用已各自完成大规模预训练的 Chat-UniVi(Vicuna-7B-v1.5+视觉编码器)与 DynamiCrafter;仅用 WebVid-10M 训练两个 Q-Former 适配器 + query embeddings,最小化 LLM 输出 embedding 与视频生成器文本编码器 embedding 的 L2 距离,实现两个预训练模型表示空间的对齐。LLM、视频生成器本身冻结
  2. 指令微调(实时可控性):在上述 1.2M 条精细动态描述的视频-动作数据上,微调视频生成器 + query embeddings(其余组件仍冻结),最小化标准扩散损失,让模型学会依据任意时刻插入的自然语言动作预测后续视频状态。

无强化学习环节,纯生成式监督训练(L2 对齐损失 + 扩散损失)。论文未给出具体超参(batch size、学习率、优化器、训练步数/epoch 均未披露);唯一给出的量化训练设置是”小规模训练算力 vs 大规模训练算力”的对比消融(图 11,无具体数值,仅定性展示大算力下动作可控性和画质均提升,作者推测是因为更多数据能缓解字幕噪声)。

Infra(训练 / 推理工程)

论文全文未披露任何 GPU 型号/数量、GPU-hours、训练精度(FP16/BF16)、并行策略,也未给出推理 FPS / 控制频率 / 端到端延迟等工程数字——均为未披露。这与论文的技术报告/预览性质一致(无附录级工程细节表)。GitHub 仓库提供的是单机 Gradio 推理 demo(CUDA_VISIBLE_DEVICES={id} python gradio_app.py --ckpt_path {path}),不涉及分布式训练代码。

评测 benchmark

论文没有任何量化 benchmark——原文明确写道(§3 开篇):“We show qualitative results that demonstrate the core capabilities of Pandora as a world simulator… We aim to report more quantitative results in the future.”。全部结果为定性视频展示:

  • 跨域实时控制(图 3–6):室内/户外、人类/机器人、2D/3D 游戏场景下的动作响应视频,以及物理现象(风吹落叶、液体流动)的定性正确案例。
  • 动作可控性跨域迁移(图 7–8):仅在 Coinrun(唯一 2D 游戏训练源)学到的动作能应用到未见过的其他 2D 游戏;仅在 HM3D(室内扫描)学到的转向动作能应用到未见过的室外/奇幻场景。
  • 自回归生成更长视频(图 9):训练视频最长 5 秒/40 帧,推理时自回归外推生成 8 秒/64 帧视频。
  • 算力缩放消融(图 11):小规模 vs 大规模训练算力的定性对比,大算力下可控性”涌现”,无具体数字。
  • 失败案例(图 10,§3.4):视频一致性差、复杂场景模拟失败、常识/物理理解错误、指令跟随失败等定性展示。

创新点与影响

  • 贡献:(1) 提出首批面向通用(跨域)场景、支持生成过程中任意时刻自然语言动作控制的自回归-扩散混合世界模型架构,区别于”只在 t=0 给一次 prompt”的传统文生视频模型;(2) 提出”复用独立预训练的 LLM + 视频扩散模型、只做轻量适配器对齐+指令微调”的世界模型构建配方,规避从零联合训练视频-动作序列的高成本;(3) 定性证明动作可控性可以跨域迁移(在单一 2D 游戏/单一室内数据集上学到的动作,能泛化到训练时完全未见的其他游戏/场景);(4) 证明自回归主干可以突破扩散视频模型固定长度的限制,把 5 秒训练视频外推到 8 秒。
  • 改变了什么:把”LLM 指令微调”这套已被验证的配方搬到了通用世界模型构建上,为后续”拼接现成 LLM/VLM + 现成视频扩散模型”这条低成本路线提供了早期范例(相对于 GAIA-1/UniSim/Genie 各自领域内从零训练)。
  • 作者自陈局限(§3.4、Conclusion):Pandora 会在视频一致性、复杂场景模拟、常识/物理规律理解、指令跟随上出错(图 10);数据质量(动态描述的精确度)对效果影响很大——在有高质量模拟数据的领域(CARLA/HM3D/Coinrun)可控性好,但在依赖 GPT-4 Turbo 自动重新打字幕的公开视频领域(Panda-70M)噪声较大、效果较差,作者认为扩大训练规模能部分缓解该噪声(图 11 的算力消融支持这一假设,但未做严格量化验证);作者认为用更强骨干(GPT-4、Sora)能进一步提升效果;论文本身未给出任何量化 benchmark,是最明显的局限;未来计划纳入音频等其他模态。GitHub 显示模型权重目前因数据许可问题被隐藏(“We currently hide the model weights due to data license issue”),HF 仓库处于 gated(manual)状态。

原始链接

一手源存档(sources/)