一句话定位

VideoPhy 是 UCLA + Google Research 2024 年 6 月提出的第一个专门评估”生成视频是否遵守物理常识”的基准:不看画质、不看 FVD,而是拿 688 条覆盖固-固/固-流/流-流物质交互的 caption,让 9 个文生视频(T2V)模型各生成视频,再由人工按两个二值指标——语义遵循 SA(视频是否符合文本)+ 物理合理性 PC(运动是否符合直觉物理)——打分。结论刺眼:最好的模型 Pika 也只有 19.7% 的样本同时满足 SA=1、PC=1,说明当时的视频生成模型远不是”通用物理世界模拟器”。论文同时训练了一个开源自动评估器 VideoCon-Physics,用来把这套评估规模化。ICLR 2025 收录。

背景与定位

彼时 Sora、deepmind-genie2 等把视频生成模型宣传为”世界模拟器 / world simulator”,UniPi、Genie 一路更是直接拿视频生成去训能行动、规划的智能体。但一个基本问题没人系统回答过:这些生成视频到底有多遵守物理规律? VideoPhy 就是来填这个空。

论文先论证已有指标为何不够用:

  • FVD(Fréchet Video Distance)需要参考真实视频(新场景难获取)、偏向画质、且检测不出不真实的运动;
  • CLIPScore 只在共享表征空间里量文本-帧语义相似度,无法评估物理;
  • VBench / EvalCrafter 等综合基准拆出运动流畅度、背景一致性等许多维度,但唯独没有针对”是否遵守物理定律”

VideoPhy 的定位是把”物理常识”(intuitive physics,PIQA [Bisk 2020]、发展心理学一路的”直觉物理”)落到视频生成评测上——不追求精确动力学方程,而是依赖人类日常经验判断(水往低处流、木头浮在水上形状不变)。范式命名:physical-commonsense benchmark + 视频-语言自动评估器。它是世界模型”可评测性”方向的一块基石,与 cosmos-predict 这类物理世界生成模型形成”生成方 vs 评测方”的对照。其后续 VideoPhy-2(arXiv 2503.06800,ICLR 2026)把评测升级为更难的动作中心(action-centric)设定。

模型架构

本文是基准 + 自动评估器论文,“架构”分两块:数据集构造流水线与 VideoCon-Physics 评估模型。

基准构造(3 阶段流水线)

  • Stage 1 · LLM 生成 caption:用 GPT-4 生成约 1000 条描述真实世界动态的候选 caption,按物质交互分三类——solid-solid、solid-fluid、fluid-fluid(流体细分无粘/有粘,如水 vs 蜂蜜;固体覆盖刚体、弹性体、沙、金属、雪等本构模型)。
  • Stage 2 · 人工核验:作者按三条准则过滤(表述清晰、避免过度复杂、准确落在目标交互类别),并剔除相变(冰化水)、磁效应等复杂现象,最终留下 688 条:solid-solid 289 / solid-fluid 291 / fluid-fluid 108。
  • Stage 3 · 难度标注:两位物理仿真方向资深博士生独立把每条 caption 标为 easy(0) / hard(1)(依据用 SOTA 物理引擎模拟该物体/运动的感知复杂度,如非牛顿流体番茄酱比牛顿流体水难模拟),分歧 <5% 讨论达成一致。得 easy 366 / hard 322(难度只在类内可比、不跨类比较)。

评估指标:SA ∈ {0,1}(文本是否语义落地到帧)、PC ∈ {0,1}(运动/状态是否符合真实物理);两者被当作相互独立的维度标注,主报联合指标 SA=1,PC=1 的样本占比。PC 完全 grounded 在视频里、与 SA 无关;静态场景也按其在真实世界是否物理合理来判(不自然的颗粒噪声算 PC 差)。

VideoCon-Physics 自动评估器

  • 骨干:在 VideoCon(7B 生成式视频-文本模型,本身建在 mPLUG-Owl-Video / LLaMA-7B-video 之上、专为真实视频语义遵循评估训练)上微调而来。
  • 打分方式:给定多模态模板 T_t(x)——SA 任务喂 (视频 V, caption C)、PC 任务只喂视频 V——让模型生成 Yes/No,取归一化概率 p(Yes)/(p(Yes)+p(No)) 作为分数。
  • 多任务单分类器:SA 与 PC 合在一个 VideoCon-Physics 里多任务训练;作者试过为两任务分别训分类器,无额外收益
  • 判据:用模型预测与人工标注在测试 prompt 上的 ROC-AUC 衡量自动评估器好坏。

数据

  • 规模(Table 1):688 caption、138 个 unique action、9 个 T2V 模型、9300 条生成视频30500 条人工标注;caption 平均长度 8.5 词。
  • 类别构成:物质交互 3 类(solid-solid 289 / solid-fluid 291 / fluid-fluid 108);复杂度 2 档(easy 366 / hard 322)。
  • 被测 9 个 T2V 模型:开源 ZeroScope、LaVIE、VideoCrafter2、OpenSora、StableVideoDiffusion(SVD-T2I2V);闭源 Gen-2(Runway)、Lumiere-T2V、Lumiere-T2I2V(Google)、Pika。其中 T2I2V 指”文本→图→视频”级联。Sora、Genmo 因无 API 接入未纳入。
  • 标注划分:688 prompt 平均切成 344 train / 344 test(保持物质态与难度分布一致)。
    • Benchmarking(测试集):每个测试 prompt × 每个模型生成 1 条视频,3 位标注员判 SA/PC 取多数票,共收 18500+ 条标注;标注员间一致性 SA 75% / PC 70%(PC 更主观)。
    • VideoCon-Physics 训练集:每个训练 prompt × 每个模型采 2 条视频、1 位标注员判,共 12000+ 条(SA、PC 各半)。
  • 标注人力:Amazon Mechanical Turk 合格工人,$18/小时;标注员具高中物理水平即可(靠日常经验而非高等物理);全部标注合计花费 $2800
  • 公开数据(README):训练集约 4600 条实例公开(video_url/caption/states_of_matter/complexity/sa/pc),Lumiere 部分待授权。

训练方法

  • 目标函数:微调 VideoCon,最大化在多模态模板下 SA、PC 任务的 Yes/No 对数似然。
  • LoRA 配置(Appendix K):对注意力块全部层(QKVO + gate/up/down 投影)做 LoRA,r=32、α=32、dropout=0.05;训 5 epochs,Adam,峰值 lr 1e-4(50 步线性 warmup + 线性衰减);32 帧输入、resize 到 224×224(把视频切 32 段、每段取中间帧)。
  • 训练与推理时把 LoRA merge/unload 回主干以提效(README 提供脚本)。
  • 被测生成模型的推理配置(Table 9,用于产出待评视频,非本文训练):如 VideoCrafter2 320×512 / 32 帧 / guidance 12 / 50 步 DDIM;Lumiere 1024×1024 / 80 帧 / 256 步;Pika 640×1088 / 72 帧;SVD-T2I2V 1024×576 / 25 帧等。

Infra(训练 / 推理工程)

  • VideoCon-Physics 训练硬件2 张 A6000 GPU,总 batch size 32,LoRA 微调 5 epochs。GPU-hours、精度未披露。
  • 推理工程:自动评估器按 32 帧、224×224 输入产出 Yes/No 概率分数;具体 FPS / 延迟 / 吞吐未披露
  • 被测 T2V 模型的具体训练 infra 不在本文范围(本文只做评测),其推理仅给了分辨率/帧数/采样步(见上)。

评测 benchmark

人工评测主结果(Table 2,测试集 344 prompt,联合 SA=1,PC=1 % / SA % / PC %)

模型类型SA=1,PC=1SAPC
Pika闭源19.741.136.5
VideoCrafter2开源19.048.534.6
LaVIE开源15.748.728.0
Lumiere-T2I2V闭源12.548.525.0
SVD-T2I2V开源11.942.430.8
ZeroScope开源11.930.232.6
Lumiere-T2V闭源9.038.427.9
Gen-2 (Runway)闭源7.626.627.2
OpenSora开源4.918.023.5
  • 总冠军 Pika 也仅 19.7% 联合达标,VideoCrafter2 紧随 19.0%——证明当时模型远非物理世界模拟器。
  • PC 最高:Pika 36.5% / VideoCrafter2 34.6%。SA 最高(整体):LaVIE 48.7% / VideoCrafter2 48.5% / Lumiere-T2I2V 48.5%(Lumiere-T2I2V 在 easy 子集 SA 达 56.6%,作者据此称级联 T2I2V 在遵循文本上有效)。OpenSora 全面垫底。
  • 按物质态:所有模型在 solid-solid 最差(最好的 Pika 联合仅 13.6%);VideoCrafter2 在 solid-fluid 最强——说明性能强依赖场景物质态。
  • 按难度(Table 3):所有模型从 easy→hard 的 SA、PC 双降,越难模拟的 caption 也越难通过条件控制。

自动评估器 ROC-AUC(Table 4,与人工判断的一致性)

方法ROC-AUC SAROC-AUC PC
Random5050
GPT-4-Vision(8 帧多图零样本)5353
VideoCon(零样本)6554
Gemini-1.5-Pro-Vision(整视频零样本)7358
VideoCon-Physics(本文)8273
  • VideoCon-Physics 比零样本 VideoCon +17(SA)/ +19(PC),比 Gemini-1.5-Pro-Vision +9(SA)/ +15(PC)
  • GPT-4V 判物理几乎等于瞎猜(PC 53);Gemini SA 尚可(73)但 PC 近随机(58)——现有多模态基座普遍不会判物理常识。
  • 对未见生成模型泛化(Table 5,用 6 模型标注训练、在 Lumiere-T2V/T2I2V/Pika 上测):VideoCon-Physics SA 79 / PC 72,vs 零样本 VideoCon SA 64 / PC 57,各 +15。

后续 leaderboard 扩充(README,非原论文):人工榜后加入 CogVideoX-5B(39.6% 联合 / SA 63.3 / PC 53,登顶)、CogVideoX-2B、Luma Dream Machine(2024-10);自动榜增补 Mochi、HunyuanVideo。

典型物理违例分类(定性分析):守恒质量违背、牛顿第一定律违背、牛顿第二定律违背、固体本构定律违背(刚体形变)、流体本构定律违背、非物理穿透。

创新点与影响

  • 首个物理常识视频生成基准:把评测从”画质/语义”推进到”是否遵守物理”,用两个可解释的二值指标(SA/PC)+ 联合指标给出统一口径;688 条按物质态×复杂度精细分层的 prompt 让诊断可细粒度归因(solid-solid 最难、hard caption 更差)。
  • VideoCon-Physics 开源自动评估器:把昂贵的人工评测规模化,ROC-AUC 大幅超 GPT-4V / Gemini-1.5-Pro,并能泛化到未见模型;论文明确其三大下游用途——候选模型选型、数据过滤、作为后训练(RLHF/AI feedback)的奖励模型
  • 实证”世界模拟器”叙事的差距:用 19.7% 的联合达标率给当时被神化的视频生成”物理理解”泼了冷水,成为后续 cosmos-predict、物理感知视频生成工作的常引基准。
  • 论文自述局限:人工 PC 标注偏主观(一致性仅 70%,源于对物理违例容忍度不同);只覆盖固/流基本交互,刻意排除相变、磁效应等复杂现象;难度标注只在类内可比;自动评估器训练数据对某些模型(如 Pika)可能不足,导致其在自动榜上排名偏低(README 自承)。

原始链接

一手源存档(sources/)

  • videophy—github-readme — GitHub README 快照(含人工/自动双 leaderboard、训练/推理流程、引用),fetched 2026-07-16
  • arXiv 原文全文(HTML v1 / PDF 2406.03520)已通读,正文与附录 J/K/L 数字均取自此;arXiv 原文 PDF,不入 git,见上方 arXiv 链接。