一句话定位

PhyGenBench 是上海 AI Lab(OpenGVLab)联合上交大、港大、港中文 2024 年 10 月提出的160 条物理常识文生视频(T2V)基准,覆盖力学、光学、热学、材料属性四大类共 27 条物理定律;配套提出 PhyGenEval——一个用 GPT-4o + 多种 VLM 做”单帧→多帧→全视频”三级递进判分的自动评估框架,与人工评分总体相关系数达到 Spearman ρ=0.81。结论与 videophy 一致但更细粒度:即便最强的 Gen-3,PCA(物理常识对齐)平均分也只有 0.51,证明当前 T2V 模型离”世界模拟器”还很远,且单纯放大模型或做 prompt 工程都解决不了动态物理现象的理解缺陷。

背景与定位

Sora 等 T2V 模型的进展让”视频生成模型 = 通用世界模拟器”的叙事流行起来,但认知心理学认为构建世界模拟器的基础是理解”直觉物理”(intuitive physics)——不要求精确物理方程,只要求符合人类日常经验的合理性(如石头会沉、水会往低处流)。已有评测体系存在两个缺口:基准缺口——VBench、EvalCrafter、T2V-CompBench 等聚焦画质/运动流畅度/组合语义,唯独不测”是否遵守物理定律”;评估指标缺口——FVD 需要参考视频且检测不出不合理运动,直接用视频 VLM(VideoScore 等)评判物理常识时,由于这些 VLM 本身不具备针对性的物理理解能力,表现很差(Spearman ρ 仅 0.19-0.20)。

同期最接近的工作是 videophy(UCLA/Google,2024-06,688 条固-固/固-流/流-流物质交互 prompt,人工评 SA/PC 二值指标)。PhyGenBench 与其的两点区别(论文 Appendix A.2 自述):① 覆盖更全——videophy 只测三类物质交互,遗漏相变、材料属性等常见物理定律;PhyGenBench 用 27 条命名物理定律做标注,VLM 更容易利用;② prompt 更适合生成——PhyGenBench 的平均 SA 分 0.80 显著高于 videophy 的 0.63(见下方”数据”节对比表),因为 videophy 的 prompt 偏简略或包含内部机构(如”手表发条”)等 T2V 模型难以渲染的场景,而 PhyGenBench 经过增强、多样化和人工质检环节打磨。范式命名:物理常识基准 + 分层 VLM 评估器,与 cosmos-predict 这类以生成侧追求”世界模拟器”的工作构成”生成 vs 评测”的对照。

模型架构

本文不训练生成模型,核心产出是基准数据集 PhyGenBench + 自动评估框架 PhyGenEval,两者都以流水线/框架形式呈现:“架构”落在评估框架的分层设计上:

PhyGenBench 的分类体系(27 条物理定律、4 大域、160 条 prompt)

  • 力学(Mechanics):7 条常见力学定律——重力、浮力、固体压强、大气压强、弹性、摩擦力、表面张力,40 条 prompt。
  • 光学(Optics):6 类光现象——反射、折射、散射、色散、干涉与衍射、直线传播,50 条 prompt。
  • 热学(Thermal):6 种相变——凝固、熔化、液化、沸腾、凝华、升华,30 条 prompt。
  • 材料属性(Material Properties):5 条物理性质(颜色、硬度、溶解度、可燃性、焰色反应)+ 3 条化学性质(酸碱性、氧化还原电位、脱水性),40 条 prompt。
  • 每条 prompt 严格保持与单一物理现象一一对应,避免多定律混杂给人工/机器评估带来歧义。

PhyGenEval 三级递进评估框架(物理常识对齐 PCA 部分)

  1. 关键物理现象检测(Key Physical Phenomena Detection,单图级):GPT-4o 依据输入 prompt 与对应物理定律,生成一条检索 prompt p_r 和一组物理相关问题 Q;用 VQAScore 定位关键帧 I_i(前后各扩展 2 帧,共 5 帧窗口以增强鲁棒性);评分公式 S_key = Σ_q max_{i-2≤j≤i+2}(VLM(I_j,q) + VLM(I_j,p_r))。区分单调过程(如”温度持续上升熔化”,只用末帧一个问题,得分 0-1)与非单调过程(如”鸡蛋撞石头”,用中间关键帧+末帧两个问题,得分 0-3,离散化为 [1, 1.5, 2.25])。
  2. 物理顺序验证(Physics Order Verification,多图级):GPT-4o 生成检索 prompt p_r 及三条问题 q1/q2/q3,分别验证”首帧→关键帧”、“关键帧→末帧”、“首帧→末帧”三段因果顺序是否正确(如”蛋先碰石头,后碎裂”不能反过来);S_beforeS_after 用 GPT-4o 或 LLaVA-Interleave(多图 VLM)计算,S_order = S_before + S_after + S_all,整数 0-3。
  3. 整体自然度评估(Overall Naturalness Evaluation,全视频级):先参照 DEVIL 建立通用评分标准 g_gen,再用 prompt p、物理定律 l、g_gen 引导 GPT-4o 生成该 prompt 专属的细化标准 g_spec;video VLM(GPT-4o 或 InternVideo2)据此对整段视频打分 S_natural = VLM(I_{0:-1}, p, l, g_spec),四档选项(Completely Fantastical→Almost Realistic)映射为 0-3 分。
  4. 总分计算:三段分数各自离散化到 4 档后取平均、向下取整;为鲁棒性,S_order 同时用 GPT-4o 和 LLaVA-Interleave 计算、S_natural 同时用 GPT-4o 和 InternVideo2 计算,最终分是两套方法的集成(ensemble)。

语义对齐(Semantic Alignment,SA)评估:先用 GPT-4o 从原始 prompt 抽取物体与动作,再分两问评估——Q1 判断物体完整出现程度(0/1/2 三档:全部出现/部分缺失/完全不出现),Q2 判断指定动作是否发生(0/1 二值),二者组合得到 SA 分,避免直接让 VLM 混淆”语义对不对”与”物理对不对”两件事。

数据

  • 规模(Appendix A.1,Table 3):27 条物理定律、4 大域(光学 50 / 力学 40 / 热学 30 / 材料 40)、总计 160 条 caption8 个 T2V 模型共生成 1280 条视频、165 个 unique object、42 个 unique action、平均 caption 长度 18.75 词
  • 构造流程(5 阶段):① Conceptualization——参照物理教材(Halliday et al. Fundamentals of Physics)按四大域选定关键物理常识;② Prompt Engineering——为每条定律手工构造初版 T2V prompt;③ Prompt Augmentation——补充物体/动作细节以提升生成质量,同时刻意避免提前”剧透”预期物理现象;④ Diversity Enhancement——参照 T2V-CompBench 用 GPT-4o 做物体替换以增加多样性;⑤ Quality Control——人工审核 prompt 与物理定律的准确性,并用当前 T2V 模型试跑以确认 prompt 语义足够简单可生成。
  • videophy 的定量对比(Appendix A.2,Table 4,SA 分数):CogVideoX-5B 在 VideoPhy 上 SA=0.48,在 PhyGenBench 上 SA=0.78;Vchitect2.0 分别为 0.63 / 0.84;Kling 分别为 0.77 / 0.89;三模型平均 0.63(VideoPhy) vs 0.80(PhyGenBench)——说明 PhyGenBench 的 prompt 更容易被 T2V 模型准确渲染,从而让”物理是否正确”的判断更干净、不被”语义没对齐”污染。
  • 被测 T2V 模型的生成配置(Appendix C.1,Table 5):Open-Sora V1.2(4s/24fps/1280×720)、CogVideoX-2B(6s/8fps/720×480)、CogVideoX-5B(6s/8fps/640×360)、LaVie(4s/8fps/512×320)、Vchitect2.0(5s/8fps/768×432)、Pika(3s/24fps/1280×720)、Gen-3(11s/24fps/1280×768)、Kling(5s/30fps/1280×720)。
  • 人工评估采样:8 个 T2V 模型 × 随机抽取的 64 条 prompt = 512 条视频,3 位标注员各给 0-3 整数分(语义分+物理分),取平均后向上取整为最终人工分。
  • 本文不训练任何生成/评估网络参数(评估器全部基于现成 GPT-4o / VQAScore / LLaVA-Interleave / InternVideo2 组合调用),因此没有”co-training 数据配比”意义上的训练集。

训练方法

本文没有可训练的神经网络参数——PhyGenEval 是纯 prompt 工程 + 现成模型组合调用的评估流水线,不涉及梯度更新:

  • 用 GPT-4o(版本 gpt4o-0513,README 注明)生成检索 prompt、物理问题、专属自然度评分标准,属于”LLM 生成评估用 prompt/rubric”而非训练。
  • VQAScore、LLaVA-Interleave-dpo-7B、InternVideo2(InternVideo2-Stage2-1B-224p-f4)均直接调用官方开源权重做推理,不做微调。
  • 论文在 Discussion(Appendix D)里额外做了三组”能否用现有手段解决 PhyGenBench 挑战”的对照实验(非本文方法训练,而是验证性分析):
    • Scaling:CogVideoX 5B vs 2B——静态场景(如干涉衍射产生的彩色气泡、铁生锈氧化)有明显提升,但力学域(Mechanics)进步有限,两者都无法准确渲染”足球弹跳”这类动态物理。
    • Prompt Rewriting(Table 11):用 GPT 给原 prompt 追加预期物理结果的描述后重新生成——CogVideoX-5B 平均分从 0.45 升到 0.52,Kling 从 0.49 升到 0.56,但作者指出这只能解决”焰色反应”等简单问题,对”蛋碎""石头下沉”等复杂物理过程仍无效。
    • VEnhancer 视频增强的鲁棒性检验(Table 12):Vchitect2.0 经 VEnhancer 提升视觉质量、VBench 分数超过 Kling 后,PhyGenBench 分数几乎不变(0.45→0.45),论文报告增强前后的分数间 Spearman 相关系数高达 0.86(原文未细说该系数具体按哪个维度计算,推测是同一模型增强前后四个物理域分数的对应关系),说明 PhyGenEval 对”画质提升但物理理解未提升”的场景具有鲁棒性,能把”物理正确性”和”画质/流畅度”两件事解耦开。

Infra(训练 / 推理工程)

  • 训练:本文不训练任何模型,无 GPU-hours / 并行策略 / 精度配置可言。
  • 推理硬件(GitHub README):PhyGenEval 的三级评估(VQAScore 单图打分、LLaVA-Interleave 多图问答、InternVideo2 视频问答)均只需单张 A100-80G即可运行;若只用闭源 GPT-4o 路线,只需配置 VQAScore 环境 + API Key,无需 GPU 密集型开源模型环境。
  • 推理延迟/吞吐:未披露(README 只给出运行脚本与所需环境,没有给出具体耗时或 QPS)。
  • 被测 8 个 T2V 生成模型本身的训练 infra 不在本文范围内(本文只做评测,不训练生成模型)。

评测 benchmark

与人工评分的相关性(Table 1,Kendall τ / Spearman ρ,四指标方法 DEVIL / VideoPhy / VideoScore / PhyGenEval 对比)

MetricMechanics τ/ρOptics τ/ρThermal τ/ρMaterial τ/ρOverall τ/ρ
DEVIL0.15/0.160.03/0.030.10/0.110.27/0.290.17/0.18
VideoPhy0.00/−0.03−0.15/−0.140.08/0.080.13/0.140.03/0.04
VideoScore0.18/0.200.07/0.080.14/0.150.14/0.150.17/0.19
PhyGenEval0.72/0.750.76/0.770.73/0.750.81/0.840.78/0.81
  • PhyGenEval 总体 Spearman ρ=0.81、Kendall τ=0.78,大幅超过三个基线(它们大多接近 0 或仅 0.17-0.19),案例分析显示 VideoScore/DEVIL/VideoPhy 会把”运动流畅但违反物理”(如鸡蛋撞石头表现出橡胶弹性、石头浮在水面)误判为物理正确,且都无法识别”铜燃烧焰色应为绿色而非红色”这类领域特定物理常识错误。

8 个 T2V 模型的 PCA(物理常识对齐)主结果(Table 2)

ModelSizeMechanics↑Optics↑Thermal↑Material↑Average↑Human↑
CogVideoX2B0.380.430.340.390.390.31
CogVideoX5B0.390.550.400.420.450.37
Open-Sora V1.21.1B0.430.500.440.370.440.35
LaVie860M0.300.440.380.320.360.30
Vchitect 2.02B0.410.560.440.370.450.36
Pika-0.350.560.430.390.440.36
Gen-3-0.450.570.490.510.510.48
Kling-0.450.580.500.400.490.44
  • 最强模型 Gen-3 平均 PCA 也仅 0.51;所有模型在光学域表现最好(归因于预训练数据里光学知识显式且丰富),在力学/热学/材料域普遍偏弱;开源模型中 Vchitect2.0、CogVideoX-5B 优于 Pika,LaVie 全面垫底。
  • 语义对齐(SA)侧结果(Appendix C.2,Table 7):8 模型 SA 分普遍较高(Kling 人工 SA 达 0.89 最高),说明 PhyGenBench 的 prompt 本身对模型友好,让 PCA 分数更能干净地反映”物理理解”而非”语义没对齐”。
  • SA 评估方法本身的消融(Table 6):PhyGenEval 用 GPT-4o 的两阶段策略在 SA 相关性上总体 τ=0.53/ρ=0.56,显著优于用 Grid-LLaVA 直接单阶段打分的 T2V-CompBench 基线(τ=0.35/ρ=0.39);即便把 VLM 换成开源 Grid-LLaVA、只保留两阶段策略(PhyGenEval(Grid-LLaVA)),也能到 τ=0.42/ρ=0.44,证明”两阶段拆解”本身(而不仅是换更强 VLM)带来增益。
  • PCA 三段消融(Table 9):单独 PhyGenEval-S(单帧检测)τ=0.56/ρ=0.61、PhyGenEval-M(顺序验证)τ=0.55/ρ=0.60、PhyGenEval-V(自然度)τ=0.42/ρ=0.46;任意两段组合(SM/SV/MV)均不及三段全用的完整 PhyGenEval(τ=0.78/ρ=0.81),证明三级设计缺一不可。
  • 开源 vs 闭源 VLM 消融(Table 10):纯开源模型组合(LLaVA-Interleave + InternVideo2)PhyGenEval(Open)达 τ=0.62/ρ=0.66;纯 GPT-4o 路线 PhyGenEval(GPT4o)达 τ=0.66/ρ=0.71;两者集成后的完整 PhyGenEval 达到最佳的 τ=0.78/ρ=0.81——即便只用开源模型也有较高可用相关性,论文因此推荐用户做集成。
  • 一阶段 vs 两阶段策略消融(Table 8,针对自然度评估):两阶段策略(LLM 先生成专属评分标准再打分)相比一阶段策略(所有 prompt 共用同一套通用评分模板,即 DEVIL 的做法)在 InternVideo2 和 GPT-4o 上均有明显提升,例如 PhyGenEval-V(GPT) 从一阶段 τ=0.19/ρ=0.21 提升到两阶段 τ=0.53/ρ=0.58。

创新点与影响

  • 首个覆盖四大物理域、27 条命名定律的 T2V 物理常识基准:相比 videophy 只测物质交互三类(固-固/固-流/流-流),PhyGenBench 补上了光学、热学、材料属性等常见但此前被忽视的物理域,且每条 prompt 与单一物理定律严格对应,降低标注歧义。
  • 三级递进 VLM 评估框架 PhyGenEval:把”物理是否正确”拆解为可分别自动化的三问——关键现象是否出现、事件顺序是否符合因果、整体是否自然——每一级用 GPT-4o 生成的定制化检索 prompt/问题/评分标准来”降维”给 VLM,使得整体与人工评分相关性(ρ=0.81)远超直接让通用视频 VLM 打分的做法(VideoScore ρ 仅 0.19)。
  • 实证”规模化/prompt 工程都救不了物理理解”:通过 scaling(CogVideo 2B→5B)、prompt 改写、VEnhancer 画质增强三组对照实验,分别证明——放大模型只解决静态场景、动态物理仍难;prompt 改写只解决”焰色反应”类简单问题;画质提升与物理理解基本无关(前后排名 Spearman 相关高达 0.86,说明两者解耦)——从而把”视频生成 = 世界模拟器”叙事的差距钉在了具体数字上(Gen-3 也只有 0.51)。
  • 论文自述局限:PhyGenBench 规模仍偏小(160 条 prompt、8 个模型),评估计算成本较高(需要 GPT-4o API 或多个开源 VLM 环境的集成才能达到最佳相关性);PCA 的三级流程设计依赖 GPT-4o 生成的检索 prompt/评分标准质量,存在对 GPT-4o 能力的隐性依赖;论文未纳入 Sora、Genmo 等无公开 API 的模型。

原始链接

一手源存档(sources/)

  • phygenbench—github-readme — GitHub README 快照(含 leaderboard、三级评估运行脚本、GPT-4o 版本注记),fetched 2026-07-16
  • phygenbench—project-page — 项目主页快照(含定性视频样例描述、与 Table 2 略有出入的页面表格及归档说明),fetched 2026-07-16
  • arXiv 原文全文(HTML v1,2410.05363)已通读,正文与附录 A/B/C/D 数字均取自此;arXiv 原文 PDF,不入 git,见上方 arXiv 链接。