一句话定位

PhyWorldBench 是马里兰大学与 NVIDIA 联合提出的文本到视频(T2V)物理真实性评测基准——10 大物理类别 × 5 子类 = 50 个细分类别,每子类 7 个场景、每场景 3 档详略提示词,合计 1,050 条精心标注的 prompt,覆盖基础物理、复合物理,以及故意违反物理规律的”反物理”(Anti-Physics)三个层级;同时提出零样本 Context-Aware Prompt(CAP)MLLM 评测法,在 **12 个主流 T2V 模型(5 闭源 + 7 开源)**上共生成 12,600 段视频做人工 + 自动双评测。

背景与定位

这是physics-iq、VideoPhy、PhyGenBench、DEVIL 一脉的T2V 物理常识评测基准,但路线与 physics-iq 不同:physics-iq 用真实拍摄视频做 i2v 续写、测的是”给定过去 3 秒能否预测未来 5 秒”;PhyWorldBench 走纯文本条件的端到端 T2V 路线,直接测”prompt → 视频”的物理保真度,并额外引入反物理提示词这一诊断工具——如果模型对”违反物理”的指令仍然按现实规律生成(而不是尝试遵循指令、失败),说明它只是在复现训练数据里的常见模式而非真正理解物理定律。

论文 Table 1 与三个前作的量化对比:VideoPhy(5 类,688 条 prompt)、PhyGenBench(27 类,160 条)、Physics-IQ(5 类,396 条)、PhyWorldBench(50 类,1050 条)——覆盖面和标注量明显扩大。作者还指出已有专用评测器不适配自己的场景多样性:PhyGenEval 假设固定的事件发生顺序,VideoCon-Physics(VideoPhy 训练出的评测器)只在自家 benchmark 上训练、迁移性差,因此都被排除对比,转而设计自己的零样本 Context-Aware Prompt(CAP)评测法。

模型架构

这是一篇基准 / 方法论论文,不训练任何生成模型;“架构”即基准构造流程 + 评测协议 + CAP 评测器三件套。

三阶段数据集构造流水线(Dataset Creation Pipeline)

  1. 物理类别定义:物理学专家与作者协作,划分三层级——基础物理(Fundamental Physics:基本定律,如物体运动、能量转移、光学)、复合物理(Composite Physics:多原理交织的真实现象,如人体运动)、反物理(Anti-Physics:故意违反现实物理的场景)。
  2. Prompt 创建:每个主类(10 个)分 5 个子类,每子类展开 7 个场景,每个场景配 3 档 prompt——Event Prompt(简洁事件描述)、Physics-Enhanced Prompt(自然融入物理现象,不显式写物理定律)、Detailed Narrative Prompt(由 LLM 基于 Event Prompt 生成,加入更丰富的视觉/情境细节)。先用 GPT-4o + Gemini-1.5-Pro 生成 20 条 Event Prompt 候选,人工按多样性和物理代表性挑 7 条,再由人类专家迭代校准、并做伦理审查。
  3. 标准创建(Standard Creation):每条 prompt 配 Yes/No 评测标准,分两类——Basic Standards(物体数量是否正确、事件/动作是否被准确呈现)与 Key Standards(该现实事件本应触发的具体物理现象是否在视频中被满足)。据此定义 Semantic Adherence (SA)Physical Commonsense (PC) 两个二值指标(沿用 VideoPhy / PhyGenBench 的定义),并报告 SA=1、PC=1、以及两者同时成立(Both)的比例。

Context-Aware Prompt(CAP)零样本评测器

  • 观察:MLLM(GPT-o1、Gemini 等)倾向于”合理化”不真实内容,除非被告知视频是 AI 生成的——这个上下文提示会显著提升物理真实性判断的准确率。
  • 方法:两步 Chain-of-Thought 提示——第一步让 MLLM 描述视频中的 Object / Event / Observations(不预设视频有问题),第二步基于该描述 + 明确物理标准清单,逐条给出 Yes/No 结构化判断(JSON 格式,含 Objects / Event / Standard_1 / Standard_2 / … 字段)。均匀采样 8 帧作为 MLLM 输入。
  • 中立性校验:在物理正确的视频上测假阳性率,SA 仅变化 0.001(0.188→0.187)、PC 变化 0.014(0.172→0.186),说明 CAP 不会显著增加对正确视频的误判。

数据

  • 规模:1,050 条 prompt = 10 主类 × 5 子类 × 7 场景 × 3 档详略(Event / Physics-Enhanced / Detailed Narrative)。HuggingFace 数据集(phyworldbench/phyworldbench)以 350 条场景为行(10×5×7)、每行含 Prompt/Physics/Detailed/Detailed_long 等多档文本字段,总 350 examples、dataset_size 457,059 bytes(纯文本,体积很小)。
  • 来源与标注:本科/研究生计算机专业学生做 prompt 标注(Event Prompt + Physics-Enhanced Prompt),Detailed Prompt 由 GPT-4o 按固定 query(见论文 Table 11)生成后人工核验,全部再经作者最终审核;Standard 标注(Basic + Key Standards)同样由学生完成、作者复核。
  • 10 主类的具体构成(Appendix N):
    • 基础物理(6 主类):Object Motion and Kinematics、Interaction Dynamics、Energy Conservation、Fluid and Particle Dynamics、Lighting and Shadows、Deformations and Elasticity;
    • 复合物理(3 主类):Scale and Proportions、Rigid Body Dynamics、Human and Animal Motion;
    • 反物理(1 主类):Anti-Physics(5 子类:Defying Gravity、Energy Creation or Perpetual Motion、Object Phasing and Surreal Interactions、Time Reversal and Alteration、Infinite Duplication and Division)。
  • 生成视频规模:对 12 个被评测模型各生成 1,050 段视频,共 12,600 段生成视频用于实验(这些生成视频本身不是基准的一部分,只是实验产物;HuggingFace 上额外公开了约 1 万段供复现)。
  • 人工评测:Amazon Mechanical Turk,每段视频由 3 名独立标注员按”物体存在性/事件呈现/关键物理现象”做 Yes/No,多数票定案,标注员时薪 $18。
  • 许可:策展的 prompt / caption / 人工标注按 MIT License 发布;生成视频的许可跟随各自模型厂商条款(Hunyuan 为 Tencent 社区许可、LTX-Video 为 RAIL-M、CogVideo v1.5 / Open-Sora v2.0 / Wanx v2.1 为 Apache-2.0、Step-Video-T2V / Open-Sora-Plan v1.3 为 MIT),第三方代码/数据不随基准再分发。

训练方法

本工作不训练生成模型,“方法”是评测流水线本身:

  • 对比自动指标基线:Qwen-VL-2.0、Gemini-2.0-Flash、GPT-4o、GPT-o1 直接问答,以及 CAP 的两个消融——CAP(w/o CoT)(去掉两步链式思考,直接问答案)、CAP(w/o Context)(不告知 MLLM 视频可能是低质量生成的)。
  • CAP 微调实验(Appendix C):对标注视频做 80/20 train/test 切分微调,Qwen-VL-2.0 从 CAP 零样本 77.5→82.3(SA)、74.5→79.1(PC);GPT-4o 从 78.5→84.7(SA)、73.9→80.7(PC),证明有监督微调能进一步大幅提升评测器精度。
  • 对比 fine-tuned VideoCon-Physics:VideoCon-Physics 在 VideoPhy 上微调后达 82.0 SA / 73.0 PC;CAP 在 PhyWorldBench 上零样本即达 80.3 SA / 75.1 PC(PC 更高),凸显 CAP 在域外场景的鲁棒性(注意两者测试集不同,仅作量级参考)。

Infra(训练 / 推理工程)

  • 训练算力:不适用——本工作不训练生成模型,也未披露 CAP 微调实验(Appendix C)所用 GPU 数量/时长。
  • 视频生成侧:开源模型采样时间与物理得分呈正相关——Hunyuan 720p 约 40 分钟/视频、Wanx-2.1 约 1 小时/视频,两者在 Both 指标上也排名靠前;将 Open-Sora 采样步数从 50 提升到 200 步可显著提升物理得分(论文未给出具体提升数值,只定性描述”significant boost”)。
  • MLLM 评测侧:每段视频均匀采样 8 帧输入 MLLM;GPT-o1 / GPT-4o / Gemini-2.0-Flash 等闭源 MLLM 对极少数视频拒绝评测,拒答率低于 3%。
  • GPU 数量 / 并行 / 精度:未披露(不适用,闭源商用模型经供应商网页/API 调用,开源模型走各自官方仓库默认配置)。

评测 benchmark

主结果(论文 Table 3,10 物理大类聚合成 Fundamental / Composite / Anti-Physics 三档 + Overall,SA/PC/Both)

模型Fund. SAFund. PCFund. BothComp. SAComp. PCComp. BothAnti SAAnti PCAnti BothOverall SAOverall PCOverall Both
闭源 Sora-Turbo0.4380.3150.2460.3610.2150.1880.1360.0780.0390.3840.2610.208
Gen-30.3200.2280.1610.2580.1420.1030.1080.0290.0200.2800.1830.130
Kling-1.60.4170.2990.2350.3120.1750.1390.1250.0730.0420.3570.2410.188
Pika 2.00.5870.3750.3120.4790.2740.2390.2280.0430.0110.5210.3140.262
Luma0.4640.2590.2200.3280.1990.1600.0560.0000.0000.3850.2180.184
开源 Hunyuan 720p0.3850.2780.2050.3420.2640.1990.0820.0210.0100.3440.2500.185
Open-Sora 2.00.4340.2680.2050.2790.2020.1540.0560.0210.0100.3480.2230.170
Open-Sora-Plan 1.30.1750.1360.0960.1590.0570.0440.0690.0590.0390.1580.1040.075
CogVideo-5B0.4190.2660.1920.3080.2070.1540.0620.0210.0000.3510.2250.163
Step-video-T2V0.3530.2450.1890.3330.2510.1910.0850.0210.0200.3200.2240.173
Wanx-2.10.3890.2710.2200.3230.2350.1870.0820.0170.0110.3390.2350.189
LTX-Video0.2210.1020.0800.1770.0710.0420.0760.0110.0000.1940.0850.062

(表中 12 行合计 5 闭源 + 7 开源;论文摘要写”twelve…five open-source and five proprietary”、Table 3 标题写”10 video generation models”,均与实际列出的 12 个模型行不一致,属原文笔误,此处以 Table 3 实际行数为准。)Pika 2.0 总分第一(0.262);开源中 Wanx-2.1 在 Both 上最好(0.189)、Hunyuan 720p 在 PC 上最好(0.250)、CogVideo-5B 在 SA 上最好(0.351),且开源最好成绩已超过部分闭源模型。所有模型均呈现 Fundamental > Composite > Anti-Physics 的性能递减,反物理场景下 Both 指标普遍逼近 0(Luma、CogVideo-5B、LTX-Video 甚至为 0.000)。

Prompt 类型效应(Table 4,仅测 7 个开源模型的 Both 指标,避免闭源模型内部 prompt 优化干扰):Physics-Enhanced Prompt 普遍优于 Event Prompt 与 Detailed Narrative Prompt——如 Wanx-2.1 三档为 0.175/0.202/0.190,Hunyuan 720p 为 0.159/0.198/0.155——说明”显式写入物理现象”比单纯”写细节”更能提升物理保真度。

CAP 评测器 ROC-AUC(Table 2,对人工标注的拟合优度)

指标Qwen-VL-2.0Gemini-2.0-FlashGPT-4oGPT-o1CAP(w/o CoT)CAP(w/o Context)CAP
SA72.474.672.175.476.377.380.3
PC59.860.960.161.673.665.675.1

CAP(GPT-o1 驱动)比标准 GPT-o1 在 PC 上绝对提升 13.5;Precision/Recall(Table 5)CAP 在 SA 上 75.8/83.1、PC 上 74.8/79.3,均优于全部基线与消融项。换成其他底座 MLLM 也一致提升(Table 6):Qwen-VL-2.0 72.4→78.6(SA)/59.8→74.1(PC),Gemini-2.0-Flash 74.6→79.9/60.9→74.0,GPT-4o 72.1→78.5/60.1→73.9。

模型规模消融(Table 7,隔离同架构不同尺寸):Cosmos 14B 全面优于 Cosmos 7B(Overall Both 0.184 vs 0.178),CogVideo-5B 优于 CogVideo-1.5B(0.163 vs 0.150),确认参数规模扩大对 SA/PC 均有正向增益。

Leaderboard(Table 12,人工评测 vs CAP):开源榜单一致——Wanx > Hunyuan > Step-Video-T2V > Open-Sora > CogVideo > Open-Sora-Plan > LTX-Video;闭源榜单仅第 2/3 名对调——人工评测 Sora-Turbo 排第 2、Kling 排第 3,CAP 则反过来,原因是 Kling 的电影感风格会让 CAP 偏向打高分(尽管物理正确性中等),而人工标注员被明确要求只看物理合理性,因此惩罚这类”美学伪装”更严格。

创新点与影响

  • 迄今最大、最细粒度的 T2V 物理评测基准:50 个精细物理类别、1,050 条 prompt、12 个模型、12,600 段生成视频,规模显著超过 VideoPhy / PhyGenBench / Physics-IQ。
  • 反物理(Anti-Physics)类别是本文的核心诊断创新:通过让模型执行”违反物理”的指令,区分”真正理解物理规律”与”单纯复现训练数据里的常见模式”——论文发现模型普遍会把反物理 prompt “合理化”回正常物理结果(如”酒杯里的酒重力反转”被生成成静止画面),而非尝试执行指令后失败。
  • CAP:简单的”上下文告知 + 两步链式思考”零样本 MLLM 评测法,无需任何微调即可大幅逼近甚至超过专用微调评测器(VideoCon-Physics)在域外场景下的表现,且经中立性校验不会显著抬高假阳性率。
  • 关键发现:(1) 性能沿 Fundamental → Composite → Anti-Physics 单调递减;(2) 物理增强型 prompt 比”堆砌细节”更有效,纯粹的 prompt 精细化不能解决深层物理理解缺陷;(3) 模型对”突变式”物理事件(碰撞破碎、玻璃杯摔碎)系统性地抹平为连续平滑的动画,回避剧烈状态转变;(4) 电影感美学与物理合理性存在权衡——Sora、Gen-3、Pika 等偏好夸张流畅的运动,牺牲真实物理;(5) 多物体交互场景(如”羽毛和石头同时落下但石头快得多”)显著提高失败率,模型倾向把物体当独立个体而非受统一物理定律支配的系统。
  • 作者自陈局限:1,050 条 prompt 仍难覆盖某些高度专精/复杂交互领域;CAP 对画面精美(柔和布光、动态运镜)的视频存在轻微美学偏好,且在模糊/边界案例上可能过度自信,与人工标注员的不确定性形成对比。
  • 项目页显示本文已被 ICLR 2026 接收为 Oral(NVIDIA Deep Imagination Research 官方项目页信息,反映的是晚于本文抓取的 arXiv v1 的后续修订版——v2/v3 分别提交于 2026-02、2026-05,其摘要措辞也把”12 个模型”改写为”10 个模型”,本页数据仍以可完整读取的 v1 全文 [Table 3 实际行数] 为准)。

原始链接

一手源存档(sources/)