一句话定位

Owl-1(Omni World modeL)把长视频生成重新表述为一个状态-观测-动力学(state-observation-dynamics)闭环世界模型:用一个持续演化的潜在状态变量 s_t 编码”到目前为止整段视频的全部历史”,再用视频扩散模型把 s_t “拍摄”成显式的视频片段 o_t,并进一步从 (s_t, o_t) 预测未来世界动力学 d_t 反过来更新 s_t——以此替代传统迭代式长视频生成里”只拿上一帧末尾画面当条件”的短视野方案;在 VBench-I2V / VBench-Long 上取得与同期 SOTA 方法相当的成绩,但由于其视频扩散主干本身就是 DynamiCrafter-1024,与直接使用 DynamiCrafter-1024 的基线相比总分(89.15 vs 90.25)反而略低,主要因 Dynamic Degree 掉分。

背景与定位

论文瞄准的问题是长视频生成中的一致性(consistency)。当时主流长视频生成范式可分三类:(1) 3D VAE 端到端压缩后单次扩散生成(OpenSora、Open-Sora-Plan 一类),一致性由扩散过程内生保证,但受算力限制视频长度有上限、扩展需重新训练;(2) divide-and-conquer——先生成关键帧再插帧,依赖长时长训练数据、缺乏可扩展性;(3) 时序自回归(temporal autoregressive)迭代生成——每轮用上一片段的末帧图像作为下一轮生成的条件(如 SEINE、DynamiCrafter 的迭代用法、StreamingT2V)。Owl-1 属于第三类,但指出其核心缺陷:末帧只携带”短期细粒度”信息(画面平滑衔接),却丢失了角色身份、场景风格等长期一致性所需的历史信息,导致长视野下内容漂移。

Owl-1 的解法是把视频生成显式建模为世界模型:视频是”演化中的世界”的观测,一致性应该由世界本身的连贯性来保证,而不是靠像素级的末帧拼接。这一思路借鉴了具身智能领域的世界模型(如 Ha & Schmidhuber 式 latent world model),并与自动驾驶世界模型(drivedreamer-2drive-occworld类工作)、具身世界模型共享”用隐状态驱动环境演化预测”的范式,但此前这类模型只能预测结构化动作(如自动驾驶的轨迹/占据栅格),Owl-1 把这一范式推广到用自然语言表达的通用世界动力学,服务于开放域长视频生成而非单一任务。同时期的通用视频世界模型/游戏引擎方向(如 deepmind-genie2、GameNGen、Decart Oasis)多聚焦交互式实时可玩性;Owl-1 的落点则是非交互式的长视频质量与一致性,核心创新是”潜在状态作为综合条件”而非”末帧作为条件”。其实现依赖一个预训练的大型多模态模型(chameleon,Meta FAIR 的 mixed-modal early-fusion 基础模型)来承担状态-观测-动力学序列的自回归建模,并用预训练视频扩散模型 DynamiCrafter-1024 作为”状态解码器”把潜状态”拍摄”成视频。

模型架构

Owl-1 由两个预训练组件拼接而成,外加一套序列化接口:

核心变量三元组(对应正文 Eq.1-3):

  • 潜在状态 s_t:纯隐式表征,编码”当前 + 全部历史”信息,s_{t+1} = g(s_t, d_t)。
  • 观测 o_t:由状态解码器 D 显式解码,o_t = D(s_t, o_{t-1})(同时吃上一帧观测保证短期平滑,主要一致性由 s_t 负责)。
  • 世界动力学 d_t:由 f(·) 从 (s_t, o_t) 预测得到的自然语言文本,代表驱动世界演化的下一步动态描述;可展开证明 s_{t+1} 实际上是全部历史观测 (s_0, o_0, …, o_t) 的函数 h(·)(Eq.4),即状态天然聚合了完整历史。

LMM(承担 f(·)、g(·),即状态-观测-动力学的自回归 backbone)chameleon(mixed-modal early-fusion foundation model)。

  • 输入/输出序列格式:Seq = […, s_t, o_t, d_t, …],三元组按 (状态, 观测, 动力学) 顺序交替喂给 LMM。
  • 潜在状态 s_t 用一组可学习 query embedding(长度 Q=128)作为输入 token(因其无 ground truth、不能离散量化)。
  • 观测 o_t:把当前 4 秒片段均匀采样出关键帧(每片段采 2 帧),用 LMM 自带的预训练 VQVAE 转成视觉 token。
  • 动力学 d_t:直接用 LMM 的文本 tokenizer 转成离散文本 token。
  • 微调方式:LoRA,rank=8,约 798M 可训练参数

状态解码器 D(承担视频观测的显式生成):DynamiCrafter-1024(预训练图生视频扩散模型),全部参数参与微调。去噪目标为标准 ε-预测 MSE loss,条件输入为潜状态 s_t 与上一观测 o_{t-1}(Eq.8:‖ε − ε̂_D(o_{t,m}, m, s_t, o_{t-1})‖²)。

辅助模型:VBench-Long 的首帧生成需要”图像+文本”输入(DynamiCrafter 的要求),论文额外用 SD2.1-v(Stable Diffusion 2.1)从文本 prompt 生成长视频的第一帧。

参数规模:LMM 的 LoRA 可训练参数约 798M,加上 DynamiCrafter 的全部参数,总可训练参数约 2B

视频切分:每个视频按固定 4 秒切成片段作为一个观测 o_t。

动作/控制条件:Owl-1 本身不含机器人式离散动作条件;其”控制”体现在可用用户输入的控制信号替换预测出的动力学 d_t(文本形式),从而引导场景演化方向(论文中未做定量实验,仅作为设计动机提出)。

场景转场控制:训练时对属于新场景的片段人为丢弃末帧图像条件(只保留潜状态 s_t 作为条件),使模型同时具备”可控场景转场”能力——生成时同理,只需省略图像条件即可切场景;论文附录 C 中长视频转场间隔设为约 2 个视频扩散片段(约 4 秒/场)。

数据

通用视频生成数据(Stage 1 对齐 + Stage 2 生成式预训练共用)

  • WebVid:>1000 万条带字幕视频,总时长约 5.2 万小时;随机采样约 40 万条用于训练。
  • Panda-70M:7000 万条视频,平均时长 8 秒,字幕来自多个跨模态教师模型的自动标注管线;随机采样约 200 万条用于训练。
  • 两者合计 240 万条视频,Stage 1(对齐)与 Stage 2(生成式预训练)各训练 1 万次迭代。(原文正文将该合并数据集写作 “Panda10m”,核对采样量 40 万 + 200 万 = 240 万与其一致,应为对 Panda-70M 采样子集的笔误性简写,非另一独立数据集。)

密集视频描述数据(Stage 3 世界模型训练):由于缺乏专门刻画”视频演化动力学”的数据集,用两个密集视频描述数据集替代:

  • ActivityNet Captions:2 万条 YouTube 视频,10 万条描述标注,平均时长 120 秒;多数视频含 3 个以上标注事件(各带时间跨度 + 人工撰写句子),平均每条标注 13.5 词
  • Vript:1.2 万条高分辨率视频,40 万+ 片段,以”视频剧本”形式密集标注;平均片段时长 11 秒,平均描述 145 词
  • Stage 3 合计使用两者训练集共 2 万条视频,训练 1000 步(对比 Stage 1/2 各 1 万次迭代,数据量与训练步数都显著更小,是论文明确标注的世界模型能力瓶颈)。

动作/动力学标注来源:世界动力学 d_t 直接取自密集描述数据集的人工/半自动标注文本(ActivityNet 的事件句子、Vript 的分段脚本),而非模型自行生成的伪标签。

图文/图像先验协同:由于视频扩散模型(DynamiCrafter)与 SD2.1-v 均为预训练权重,二者各自的图文预训练数据未在本文重新披露(继承自各自原论文)。

训练方法

三阶段训练(应对”LMM 与视频扩散模型分别预训练、难以直接对齐”以及”长时长+密集描述视频数据稀缺”两个挑战):

Stage 1:对齐(Alignment)——冻结视频扩散模型,只训练 LMM。输入序列 Seq_align = [I, t, s_0, o_0, t, …, s_t, o_t, t, …](每个三元组复用同一条整段视频的文本描述 t,因通用数据集无逐片段密集字幕)。监督信号为 L2 对齐损失 L_align = MSE(s_t, T(t)),即让 LMM 输出的状态向量逼近视频扩散模型文本编码器 T 对同一文本的编码,为下一阶段提供良好初始化。

Stage 2:生成式预训练(Generative Pretraining)——联合微调 LMM 与视频扩散模型;丢弃 Stage 1 的 MSE 对齐损失,改用状态 s_t 直接替换视频扩散模型原有的文本条件,只用扩散去噪损失 L_pretrain 监督(Eq.8)。目的是训练视频扩散模型作为”状态解码器”的能力,把潜状态”拍摄”成真实视频观测。

Stage 3:世界模型训练(World Model Training)——在小规模长时长+密集描述数据(ActivityNet Captions + Vript)上继续微调 LMM 与视频扩散模型,序列变为 Seq = [I, t, s_0, o_0, d_0, …, s_t, o_t, d_t, …],把密集描述作为世界动力学 d_t 显式纳入。用下一 token 预测(next-token prediction)+ teacher forcing 在文本 ground truth 上监督 d_t;同时保留 Stage 2 的扩散去噪目标(Eq.8)联合训练。

三阶段迭代数分别为:Stage1 = 1万次迭代,Stage2 = 1万次迭代,Stage3 = 1000步。

Infra(训练 / 推理工程)

  • 训练硬件:8 × NVIDIA A800(80GB 显存)。
  • 训练时长:三阶段分别耗时 1 天、5 天、1 天(总计约 7 天)。
  • 并行策略 / 精度:论文未披露(无 FSDP/DeepSpeed/混合精度等细节)。
  • 推理 FPS / control-Hz / 延迟:未披露(论文未报告生成一个片段或完整长视频所需的推理时间)。
  • 可训练参数量:LMM LoRA ≈ 798M + DynamiCrafter 全参数微调,合计约 2B 可训练参数(LMM 与视频扩散模型自身完整参数量未在本文单独列出,继承自 Chameleon / DynamiCrafter 原论文)。

评测 benchmark

所有数值取自论文 Table 1(VBench-I2V,生成 2 秒短视频)与 Table 2(VBench-Long,生成 7 秒长视频):

VBench-I2V(Owl-1 vs. 基线,10 维指标 + 总分): Owl-1 = Video-Image Subj. Consist. 97.40 / Video-Image Bkgd. Consist. 97.29 / Subject Consist. 97.28 / Bkgd. Consist. 98.54 / Motion Smoothness 98.92 / Dynamic Degree 21.63 / Aesthetic Quality 61.89 / Imaging Quality 69.66 / Temporal Flickering 98.69 / Total Score 89.15。 对比基线 Total Score:VideoCrafter-I2V 85.14、ConsistI2V 86.84、SEINE-512×512 88.42、I2VGen-XL 88.48、Animate-Anything 89.76、SVD-XT-1.0 89.87、DynamiCrafter-1024 90.25(Owl-1 自身的视频扩散主干,未加 Owl-1 的世界模型层,反而分数更高)。论文承认 Owl-1 在 Motion Smoothness / Background Consistency / Temporal Flickering 上占优,但 Dynamic Degree 明显低于 DynamiCrafter(21.63 vs 47.40),归因于训练视频里高运动幅度样本不足。

VBench-Long(Owl-1 vs. 基线,17 维指标 + 总分): Owl-1 = Subject Consistency 98.29 / Background Consistency 98.61 / Temporal Flickering 99.84 / Motion Smoothness 99.35 / Dynamic Degree 13.19 / Aesthetic Quality 60.64 / Imaging Quality 66.33 / Object Class 91.31 / Multiple Objects 43.04 / Human Action 85.67 / Color 87.92 / Spatial Relationship 67.58 / Scene 51.46 / Appearance Style 24.83 / Temporal Style 24.25 / Overall Consistency 25.10 / Total Score 79.65。 对比基线 Total Score(由低到高):Mira 71.87、Open-Sora-Plan 78.00、Open-Sora 79.76、Mochi-1 80.13、CogVideoX 81.61、Kling 81.85、Vchitect-2.0 82.24、Gen-3 82.32、MiniMax 83.41。Owl-1(79.65)排在 Mira、Open-Sora-Plan 之后位列倒数第三,与 Open-Sora(79.76)基本持平,主要被 Dynamic Degree(13.19,全表最低,其余基线约 42~71)拖累;但在 Subject/Background Consistency、Temporal Flickering 上均为全表最高或接近最高,印证论文”潜状态提升一致性、但动态幅度下降”的核心权衡(trade-off)说法。

世界模型能力(4.4 节):论文明确指出”当前尚无评测视频生成世界模型的基准”,因此该部分仅做定性可视化(3 个场景 × 每场 8 秒 × 共 24 秒的长视频样例),未给出定量指标。

创新点与影响

贡献:(1) 首次把长视频生成显式建模为状态-观测-动力学闭环世界模型,用持续演化的潜状态取代”末帧条件”,理论上证明该状态天然聚合全部历史观测(Eq.4);(2) 用预训练 LMM(Chameleon)统一承担状态更新与动力学预测两个函数,用预训练视频扩散模型(DynamiCrafter)作为”状态解码器”/ “摄影师”,复用两类大模型的预训练能力;(3) 设计三阶段训练方案,专门应对”长时长+密集描述视频数据稀缺”问题——只需少量数据(2万条、1000步)做世界模型微调即可,大量训练仍在通用短视频数据上完成;(4) 副产品:训练时对场景转场处丢弃图像条件的技巧,使模型天然具备可控场景转场能力。

局限(论文自述):微调后视频扩散模型的 Dynamic Degree 明显下降(运动幅度变小/更静态),在两个基准上均是短板;预测出的世界动力学存在一定重复性,作者归因于密集描述训练数据本身的重复性;世界模型能力目前没有可用基准,只能定性评估;未来工作方向是在更大规模、高质量、体现世界演化过程的密集描述长视频数据上扩大训练规模。

代码状态:截至本页存档(2026-07-16),GitHub 仓库(huang-yh/Owl)仅含论文与演示 GIF,训练/推理代码”即将发布”(We will release the code soon),尚未开源。

原始链接

一手源存档(sources/)