一句话定位
VideoPhy 是 UCLA + Google Research 2024 年 6 月提出的第一个专门评估”生成视频是否遵守物理常识”的基准:不看画质、不看 FVD,而是拿 688 条覆盖固-固/固-流/流-流物质交互的 caption,让 9 个文生视频(T2V)模型各生成视频,再由人工按两个二值指标——语义遵循 SA(视频是否符合文本)+ 物理合理性 PC(运动是否符合直觉物理)——打分。结论刺眼:最好的模型 Pika 也只有 19.7% 的样本同时满足 SA=1、PC=1,说明当时的视频生成模型远不是”通用物理世界模拟器”。论文同时训练了一个开源自动评估器 VideoCon-Physics,用来把这套评估规模化。ICLR 2025 收录。
背景与定位
彼时 Sora、deepmind-genie2 等把视频生成模型宣传为”世界模拟器 / world simulator”,UniPi、Genie 一路更是直接拿视频生成去训能行动、规划的智能体。但一个基本问题没人系统回答过:这些生成视频到底有多遵守物理规律? VideoPhy 就是来填这个空。
论文先论证已有指标为何不够用:
- FVD(Fréchet Video Distance)需要参考真实视频(新场景难获取)、偏向画质、且检测不出不真实的运动;
- CLIPScore 只在共享表征空间里量文本-帧语义相似度,无法评估物理;
- VBench / EvalCrafter 等综合基准拆出运动流畅度、背景一致性等许多维度,但唯独没有针对”是否遵守物理定律”。
VideoPhy 的定位是把”物理常识”(intuitive physics,PIQA [Bisk 2020]、发展心理学一路的”直觉物理”)落到视频生成评测上——不追求精确动力学方程,而是依赖人类日常经验判断(水往低处流、木头浮在水上形状不变)。范式命名:physical-commonsense benchmark + 视频-语言自动评估器。它是世界模型”可评测性”方向的一块基石,与 cosmos-predict 这类物理世界生成模型形成”生成方 vs 评测方”的对照。其后续 VideoPhy-2(arXiv 2503.06800,ICLR 2026)把评测升级为更难的动作中心(action-centric)设定。
模型架构
本文是基准 + 自动评估器论文,“架构”分两块:数据集构造流水线与 VideoCon-Physics 评估模型。
基准构造(3 阶段流水线)
- Stage 1 · LLM 生成 caption:用 GPT-4 生成约 1000 条描述真实世界动态的候选 caption,按物质交互分三类——solid-solid、solid-fluid、fluid-fluid(流体细分无粘/有粘,如水 vs 蜂蜜;固体覆盖刚体、弹性体、沙、金属、雪等本构模型)。
- Stage 2 · 人工核验:作者按三条准则过滤(表述清晰、避免过度复杂、准确落在目标交互类别),并剔除相变(冰化水)、磁效应等复杂现象,最终留下 688 条:solid-solid 289 / solid-fluid 291 / fluid-fluid 108。
- Stage 3 · 难度标注:两位物理仿真方向资深博士生独立把每条 caption 标为 easy(0) / hard(1)(依据用 SOTA 物理引擎模拟该物体/运动的感知复杂度,如非牛顿流体番茄酱比牛顿流体水难模拟),分歧 <5% 讨论达成一致。得 easy 366 / hard 322(难度只在类内可比、不跨类比较)。
评估指标:SA ∈ {0,1}(文本是否语义落地到帧)、PC ∈ {0,1}(运动/状态是否符合真实物理);两者被当作相互独立的维度标注,主报联合指标 SA=1,PC=1 的样本占比。PC 完全 grounded 在视频里、与 SA 无关;静态场景也按其在真实世界是否物理合理来判(不自然的颗粒噪声算 PC 差)。
VideoCon-Physics 自动评估器
- 骨干:在 VideoCon(7B 生成式视频-文本模型,本身建在 mPLUG-Owl-Video / LLaMA-7B-video 之上、专为真实视频语义遵循评估训练)上微调而来。
- 打分方式:给定多模态模板 T_t(x)——SA 任务喂 (视频 V, caption C)、PC 任务只喂视频 V——让模型生成 Yes/No,取归一化概率
p(Yes)/(p(Yes)+p(No))作为分数。 - 多任务单分类器:SA 与 PC 合在一个 VideoCon-Physics 里多任务训练;作者试过为两任务分别训分类器,无额外收益。
- 判据:用模型预测与人工标注在测试 prompt 上的 ROC-AUC 衡量自动评估器好坏。
数据
- 规模(Table 1):688 caption、138 个 unique action、9 个 T2V 模型、9300 条生成视频、30500 条人工标注;caption 平均长度 8.5 词。
- 类别构成:物质交互 3 类(solid-solid 289 / solid-fluid 291 / fluid-fluid 108);复杂度 2 档(easy 366 / hard 322)。
- 被测 9 个 T2V 模型:开源 ZeroScope、LaVIE、VideoCrafter2、OpenSora、StableVideoDiffusion(SVD-T2I2V);闭源 Gen-2(Runway)、Lumiere-T2V、Lumiere-T2I2V(Google)、Pika。其中 T2I2V 指”文本→图→视频”级联。Sora、Genmo 因无 API 接入未纳入。
- 标注划分:688 prompt 平均切成 344 train / 344 test(保持物质态与难度分布一致)。
- Benchmarking(测试集):每个测试 prompt × 每个模型生成 1 条视频,3 位标注员判 SA/PC 取多数票,共收 18500+ 条标注;标注员间一致性 SA 75% / PC 70%(PC 更主观)。
- VideoCon-Physics 训练集:每个训练 prompt × 每个模型采 2 条视频、1 位标注员判,共 12000+ 条(SA、PC 各半)。
- 标注人力:Amazon Mechanical Turk 合格工人,$18/小时;标注员具高中物理水平即可(靠日常经验而非高等物理);全部标注合计花费 $2800。
- 公开数据(README):训练集约 4600 条实例公开(video_url/caption/states_of_matter/complexity/sa/pc),Lumiere 部分待授权。
训练方法
- 目标函数:微调 VideoCon,最大化在多模态模板下 SA、PC 任务的 Yes/No 对数似然。
- LoRA 配置(Appendix K):对注意力块全部层(QKVO + gate/up/down 投影)做 LoRA,r=32、α=32、dropout=0.05;训 5 epochs,Adam,峰值 lr 1e-4(50 步线性 warmup + 线性衰减);32 帧输入、resize 到 224×224(把视频切 32 段、每段取中间帧)。
- 训练与推理时把 LoRA merge/unload 回主干以提效(README 提供脚本)。
- 被测生成模型的推理配置(Table 9,用于产出待评视频,非本文训练):如 VideoCrafter2 320×512 / 32 帧 / guidance 12 / 50 步 DDIM;Lumiere 1024×1024 / 80 帧 / 256 步;Pika 640×1088 / 72 帧;SVD-T2I2V 1024×576 / 25 帧等。
Infra(训练 / 推理工程)
- VideoCon-Physics 训练硬件:2 张 A6000 GPU,总 batch size 32,LoRA 微调 5 epochs。GPU-hours、精度未披露。
- 推理工程:自动评估器按 32 帧、224×224 输入产出 Yes/No 概率分数;具体 FPS / 延迟 / 吞吐未披露。
- 被测 T2V 模型的具体训练 infra 不在本文范围(本文只做评测),其推理仅给了分辨率/帧数/采样步(见上)。
评测 benchmark
人工评测主结果(Table 2,测试集 344 prompt,联合 SA=1,PC=1 % / SA % / PC %)
| 模型 | 类型 | SA=1,PC=1 | SA | PC |
|---|---|---|---|---|
| Pika | 闭源 | 19.7 | 41.1 | 36.5 |
| VideoCrafter2 | 开源 | 19.0 | 48.5 | 34.6 |
| LaVIE | 开源 | 15.7 | 48.7 | 28.0 |
| Lumiere-T2I2V | 闭源 | 12.5 | 48.5 | 25.0 |
| SVD-T2I2V | 开源 | 11.9 | 42.4 | 30.8 |
| ZeroScope | 开源 | 11.9 | 30.2 | 32.6 |
| Lumiere-T2V | 闭源 | 9.0 | 38.4 | 27.9 |
| Gen-2 (Runway) | 闭源 | 7.6 | 26.6 | 27.2 |
| OpenSora | 开源 | 4.9 | 18.0 | 23.5 |
- 总冠军 Pika 也仅 19.7% 联合达标,VideoCrafter2 紧随 19.0%——证明当时模型远非物理世界模拟器。
- PC 最高:Pika 36.5% / VideoCrafter2 34.6%。SA 最高(整体):LaVIE 48.7% / VideoCrafter2 48.5% / Lumiere-T2I2V 48.5%(Lumiere-T2I2V 在 easy 子集 SA 达 56.6%,作者据此称级联 T2I2V 在遵循文本上有效)。OpenSora 全面垫底。
- 按物质态:所有模型在 solid-solid 最差(最好的 Pika 联合仅 13.6%);VideoCrafter2 在 solid-fluid 最强——说明性能强依赖场景物质态。
- 按难度(Table 3):所有模型从 easy→hard 的 SA、PC 双降,越难模拟的 caption 也越难通过条件控制。
自动评估器 ROC-AUC(Table 4,与人工判断的一致性)
| 方法 | ROC-AUC SA | ROC-AUC PC |
|---|---|---|
| Random | 50 | 50 |
| GPT-4-Vision(8 帧多图零样本) | 53 | 53 |
| VideoCon(零样本) | 65 | 54 |
| Gemini-1.5-Pro-Vision(整视频零样本) | 73 | 58 |
| VideoCon-Physics(本文) | 82 | 73 |
- VideoCon-Physics 比零样本 VideoCon +17(SA)/ +19(PC),比 Gemini-1.5-Pro-Vision +9(SA)/ +15(PC)。
- GPT-4V 判物理几乎等于瞎猜(PC 53);Gemini SA 尚可(73)但 PC 近随机(58)——现有多模态基座普遍不会判物理常识。
- 对未见生成模型泛化(Table 5,用 6 模型标注训练、在 Lumiere-T2V/T2I2V/Pika 上测):VideoCon-Physics SA 79 / PC 72,vs 零样本 VideoCon SA 64 / PC 57,各 +15。
后续 leaderboard 扩充(README,非原论文):人工榜后加入 CogVideoX-5B(39.6% 联合 / SA 63.3 / PC 53,登顶)、CogVideoX-2B、Luma Dream Machine(2024-10);自动榜增补 Mochi、HunyuanVideo。
典型物理违例分类(定性分析):守恒质量违背、牛顿第一定律违背、牛顿第二定律违背、固体本构定律违背(刚体形变)、流体本构定律违背、非物理穿透。
创新点与影响
- 首个物理常识视频生成基准:把评测从”画质/语义”推进到”是否遵守物理”,用两个可解释的二值指标(SA/PC)+ 联合指标给出统一口径;688 条按物质态×复杂度精细分层的 prompt 让诊断可细粒度归因(solid-solid 最难、hard caption 更差)。
- VideoCon-Physics 开源自动评估器:把昂贵的人工评测规模化,ROC-AUC 大幅超 GPT-4V / Gemini-1.5-Pro,并能泛化到未见模型;论文明确其三大下游用途——候选模型选型、数据过滤、作为后训练(RLHF/AI feedback)的奖励模型。
- 实证”世界模拟器”叙事的差距:用 19.7% 的联合达标率给当时被神化的视频生成”物理理解”泼了冷水,成为后续 cosmos-predict、物理感知视频生成工作的常引基准。
- 论文自述局限:人工 PC 标注偏主观(一致性仅 70%,源于对物理违例容忍度不同);只覆盖固/流基本交互,刻意排除相变、磁效应等复杂现象;难度标注只在类内可比;自动评估器训练数据对某些模型(如 Pika)可能不足,导致其在自动榜上排名偏低(README 自承)。
原始链接
- arXiv 论文:https://arxiv.org/abs/2406.03520 (PDF:https://arxiv.org/pdf/2406.03520)
- GitHub(数据/代码/leaderboard):https://github.com/Hritikbansal/videophy
- 自动评估器权重 🤗:https://huggingface.co/videophysics/videocon_physics
- 测试集 🤗:https://huggingface.co/datasets/videophysics/videophy_test_public | 训练集 🤗:https://huggingface.co/datasets/videophysics/videophy_train_public
- 项目主页 https://videophy.github.io/ (截至 2026-07-16 返回 404,已失效;canonical 用 arXiv)
- 后续工作 VideoPhy-2:https://arxiv.org/abs/2503.06800 | https://videophy2.github.io/
一手源存档(sources/)
- videophy—github-readme — GitHub README 快照(含人工/自动双 leaderboard、训练/推理流程、引用),fetched 2026-07-16
- arXiv 原文全文(HTML v1 / PDF 2406.03520)已通读,正文与附录 J/K/L 数字均取自此;arXiv 原文 PDF,不入 git,见上方 arXiv 链接。