一句话定位
PhyWorldBench 是马里兰大学与 NVIDIA 联合提出的文本到视频(T2V)物理真实性评测基准——10 大物理类别 × 5 子类 = 50 个细分类别,每子类 7 个场景、每场景 3 档详略提示词,合计 1,050 条精心标注的 prompt,覆盖基础物理、复合物理,以及故意违反物理规律的”反物理”(Anti-Physics)三个层级;同时提出零样本 Context-Aware Prompt(CAP)MLLM 评测法,在 **12 个主流 T2V 模型(5 闭源 + 7 开源)**上共生成 12,600 段视频做人工 + 自动双评测。
背景与定位
这是physics-iq、VideoPhy、PhyGenBench、DEVIL 一脉的T2V 物理常识评测基准,但路线与 physics-iq 不同:physics-iq 用真实拍摄视频做 i2v 续写、测的是”给定过去 3 秒能否预测未来 5 秒”;PhyWorldBench 走纯文本条件的端到端 T2V 路线,直接测”prompt → 视频”的物理保真度,并额外引入反物理提示词这一诊断工具——如果模型对”违反物理”的指令仍然按现实规律生成(而不是尝试遵循指令、失败),说明它只是在复现训练数据里的常见模式而非真正理解物理定律。
论文 Table 1 与三个前作的量化对比:VideoPhy(5 类,688 条 prompt)、PhyGenBench(27 类,160 条)、Physics-IQ(5 类,396 条)、PhyWorldBench(50 类,1050 条)——覆盖面和标注量明显扩大。作者还指出已有专用评测器不适配自己的场景多样性:PhyGenEval 假设固定的事件发生顺序,VideoCon-Physics(VideoPhy 训练出的评测器)只在自家 benchmark 上训练、迁移性差,因此都被排除对比,转而设计自己的零样本 Context-Aware Prompt(CAP)评测法。
模型架构
这是一篇基准 / 方法论论文,不训练任何生成模型;“架构”即基准构造流程 + 评测协议 + CAP 评测器三件套。
三阶段数据集构造流水线(Dataset Creation Pipeline)
- 物理类别定义:物理学专家与作者协作,划分三层级——基础物理(Fundamental Physics:基本定律,如物体运动、能量转移、光学)、复合物理(Composite Physics:多原理交织的真实现象,如人体运动)、反物理(Anti-Physics:故意违反现实物理的场景)。
- Prompt 创建:每个主类(10 个)分 5 个子类,每子类展开 7 个场景,每个场景配 3 档 prompt——Event Prompt(简洁事件描述)、Physics-Enhanced Prompt(自然融入物理现象,不显式写物理定律)、Detailed Narrative Prompt(由 LLM 基于 Event Prompt 生成,加入更丰富的视觉/情境细节)。先用 GPT-4o + Gemini-1.5-Pro 生成 20 条 Event Prompt 候选,人工按多样性和物理代表性挑 7 条,再由人类专家迭代校准、并做伦理审查。
- 标准创建(Standard Creation):每条 prompt 配 Yes/No 评测标准,分两类——Basic Standards(物体数量是否正确、事件/动作是否被准确呈现)与 Key Standards(该现实事件本应触发的具体物理现象是否在视频中被满足)。据此定义 Semantic Adherence (SA) 和 Physical Commonsense (PC) 两个二值指标(沿用 VideoPhy / PhyGenBench 的定义),并报告 SA=1、PC=1、以及两者同时成立(Both)的比例。
Context-Aware Prompt(CAP)零样本评测器
- 观察:MLLM(GPT-o1、Gemini 等)倾向于”合理化”不真实内容,除非被告知视频是 AI 生成的——这个上下文提示会显著提升物理真实性判断的准确率。
- 方法:两步 Chain-of-Thought 提示——第一步让 MLLM 描述视频中的 Object / Event / Observations(不预设视频有问题),第二步基于该描述 + 明确物理标准清单,逐条给出 Yes/No 结构化判断(JSON 格式,含 Objects / Event / Standard_1 / Standard_2 / … 字段)。均匀采样 8 帧作为 MLLM 输入。
- 中立性校验:在物理正确的视频上测假阳性率,SA 仅变化 0.001(0.188→0.187)、PC 变化 0.014(0.172→0.186),说明 CAP 不会显著增加对正确视频的误判。
数据
- 规模:1,050 条 prompt = 10 主类 × 5 子类 × 7 场景 × 3 档详略(Event / Physics-Enhanced / Detailed Narrative)。HuggingFace 数据集(
phyworldbench/phyworldbench)以 350 条场景为行(10×5×7)、每行含Prompt/Physics/Detailed/Detailed_long等多档文本字段,总 350 examples、dataset_size 457,059 bytes(纯文本,体积很小)。 - 来源与标注:本科/研究生计算机专业学生做 prompt 标注(Event Prompt + Physics-Enhanced Prompt),Detailed Prompt 由 GPT-4o 按固定 query(见论文 Table 11)生成后人工核验,全部再经作者最终审核;Standard 标注(Basic + Key Standards)同样由学生完成、作者复核。
- 10 主类的具体构成(Appendix N):
- 基础物理(6 主类):Object Motion and Kinematics、Interaction Dynamics、Energy Conservation、Fluid and Particle Dynamics、Lighting and Shadows、Deformations and Elasticity;
- 复合物理(3 主类):Scale and Proportions、Rigid Body Dynamics、Human and Animal Motion;
- 反物理(1 主类):Anti-Physics(5 子类:Defying Gravity、Energy Creation or Perpetual Motion、Object Phasing and Surreal Interactions、Time Reversal and Alteration、Infinite Duplication and Division)。
- 生成视频规模:对 12 个被评测模型各生成 1,050 段视频,共 12,600 段生成视频用于实验(这些生成视频本身不是基准的一部分,只是实验产物;HuggingFace 上额外公开了约 1 万段供复现)。
- 人工评测:Amazon Mechanical Turk,每段视频由 3 名独立标注员按”物体存在性/事件呈现/关键物理现象”做 Yes/No,多数票定案,标注员时薪 $18。
- 许可:策展的 prompt / caption / 人工标注按 MIT License 发布;生成视频的许可跟随各自模型厂商条款(Hunyuan 为 Tencent 社区许可、LTX-Video 为 RAIL-M、CogVideo v1.5 / Open-Sora v2.0 / Wanx v2.1 为 Apache-2.0、Step-Video-T2V / Open-Sora-Plan v1.3 为 MIT),第三方代码/数据不随基准再分发。
训练方法
本工作不训练生成模型,“方法”是评测流水线本身:
- 对比自动指标基线:Qwen-VL-2.0、Gemini-2.0-Flash、GPT-4o、GPT-o1 直接问答,以及 CAP 的两个消融——CAP(w/o CoT)(去掉两步链式思考,直接问答案)、CAP(w/o Context)(不告知 MLLM 视频可能是低质量生成的)。
- CAP 微调实验(Appendix C):对标注视频做 80/20 train/test 切分微调,Qwen-VL-2.0 从 CAP 零样本 77.5→82.3(SA)、74.5→79.1(PC);GPT-4o 从 78.5→84.7(SA)、73.9→80.7(PC),证明有监督微调能进一步大幅提升评测器精度。
- 对比 fine-tuned VideoCon-Physics:VideoCon-Physics 在 VideoPhy 上微调后达 82.0 SA / 73.0 PC;CAP 在 PhyWorldBench 上零样本即达 80.3 SA / 75.1 PC(PC 更高),凸显 CAP 在域外场景的鲁棒性(注意两者测试集不同,仅作量级参考)。
Infra(训练 / 推理工程)
- 训练算力:不适用——本工作不训练生成模型,也未披露 CAP 微调实验(Appendix C)所用 GPU 数量/时长。
- 视频生成侧:开源模型采样时间与物理得分呈正相关——Hunyuan 720p 约 40 分钟/视频、Wanx-2.1 约 1 小时/视频,两者在 Both 指标上也排名靠前;将 Open-Sora 采样步数从 50 提升到 200 步可显著提升物理得分(论文未给出具体提升数值,只定性描述”significant boost”)。
- MLLM 评测侧:每段视频均匀采样 8 帧输入 MLLM;GPT-o1 / GPT-4o / Gemini-2.0-Flash 等闭源 MLLM 对极少数视频拒绝评测,拒答率低于 3%。
- GPU 数量 / 并行 / 精度:未披露(不适用,闭源商用模型经供应商网页/API 调用,开源模型走各自官方仓库默认配置)。
评测 benchmark
主结果(论文 Table 3,10 物理大类聚合成 Fundamental / Composite / Anti-Physics 三档 + Overall,SA/PC/Both):
| 模型 | Fund. SA | Fund. PC | Fund. Both | Comp. SA | Comp. PC | Comp. Both | Anti SA | Anti PC | Anti Both | Overall SA | Overall PC | Overall Both |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 闭源 Sora-Turbo | 0.438 | 0.315 | 0.246 | 0.361 | 0.215 | 0.188 | 0.136 | 0.078 | 0.039 | 0.384 | 0.261 | 0.208 |
| Gen-3 | 0.320 | 0.228 | 0.161 | 0.258 | 0.142 | 0.103 | 0.108 | 0.029 | 0.020 | 0.280 | 0.183 | 0.130 |
| Kling-1.6 | 0.417 | 0.299 | 0.235 | 0.312 | 0.175 | 0.139 | 0.125 | 0.073 | 0.042 | 0.357 | 0.241 | 0.188 |
| Pika 2.0 | 0.587 | 0.375 | 0.312 | 0.479 | 0.274 | 0.239 | 0.228 | 0.043 | 0.011 | 0.521 | 0.314 | 0.262 |
| Luma | 0.464 | 0.259 | 0.220 | 0.328 | 0.199 | 0.160 | 0.056 | 0.000 | 0.000 | 0.385 | 0.218 | 0.184 |
| 开源 Hunyuan 720p | 0.385 | 0.278 | 0.205 | 0.342 | 0.264 | 0.199 | 0.082 | 0.021 | 0.010 | 0.344 | 0.250 | 0.185 |
| Open-Sora 2.0 | 0.434 | 0.268 | 0.205 | 0.279 | 0.202 | 0.154 | 0.056 | 0.021 | 0.010 | 0.348 | 0.223 | 0.170 |
| Open-Sora-Plan 1.3 | 0.175 | 0.136 | 0.096 | 0.159 | 0.057 | 0.044 | 0.069 | 0.059 | 0.039 | 0.158 | 0.104 | 0.075 |
| CogVideo-5B | 0.419 | 0.266 | 0.192 | 0.308 | 0.207 | 0.154 | 0.062 | 0.021 | 0.000 | 0.351 | 0.225 | 0.163 |
| Step-video-T2V | 0.353 | 0.245 | 0.189 | 0.333 | 0.251 | 0.191 | 0.085 | 0.021 | 0.020 | 0.320 | 0.224 | 0.173 |
| Wanx-2.1 | 0.389 | 0.271 | 0.220 | 0.323 | 0.235 | 0.187 | 0.082 | 0.017 | 0.011 | 0.339 | 0.235 | 0.189 |
| LTX-Video | 0.221 | 0.102 | 0.080 | 0.177 | 0.071 | 0.042 | 0.076 | 0.011 | 0.000 | 0.194 | 0.085 | 0.062 |
(表中 12 行合计 5 闭源 + 7 开源;论文摘要写”twelve…five open-source and five proprietary”、Table 3 标题写”10 video generation models”,均与实际列出的 12 个模型行不一致,属原文笔误,此处以 Table 3 实际行数为准。)Pika 2.0 总分第一(0.262);开源中 Wanx-2.1 在 Both 上最好(0.189)、Hunyuan 720p 在 PC 上最好(0.250)、CogVideo-5B 在 SA 上最好(0.351),且开源最好成绩已超过部分闭源模型。所有模型均呈现 Fundamental > Composite > Anti-Physics 的性能递减,反物理场景下 Both 指标普遍逼近 0(Luma、CogVideo-5B、LTX-Video 甚至为 0.000)。
Prompt 类型效应(Table 4,仅测 7 个开源模型的 Both 指标,避免闭源模型内部 prompt 优化干扰):Physics-Enhanced Prompt 普遍优于 Event Prompt 与 Detailed Narrative Prompt——如 Wanx-2.1 三档为 0.175/0.202/0.190,Hunyuan 720p 为 0.159/0.198/0.155——说明”显式写入物理现象”比单纯”写细节”更能提升物理保真度。
CAP 评测器 ROC-AUC(Table 2,对人工标注的拟合优度):
| 指标 | Qwen-VL-2.0 | Gemini-2.0-Flash | GPT-4o | GPT-o1 | CAP(w/o CoT) | CAP(w/o Context) | CAP |
|---|---|---|---|---|---|---|---|
| SA | 72.4 | 74.6 | 72.1 | 75.4 | 76.3 | 77.3 | 80.3 |
| PC | 59.8 | 60.9 | 60.1 | 61.6 | 73.6 | 65.6 | 75.1 |
CAP(GPT-o1 驱动)比标准 GPT-o1 在 PC 上绝对提升 13.5;Precision/Recall(Table 5)CAP 在 SA 上 75.8/83.1、PC 上 74.8/79.3,均优于全部基线与消融项。换成其他底座 MLLM 也一致提升(Table 6):Qwen-VL-2.0 72.4→78.6(SA)/59.8→74.1(PC),Gemini-2.0-Flash 74.6→79.9/60.9→74.0,GPT-4o 72.1→78.5/60.1→73.9。
模型规模消融(Table 7,隔离同架构不同尺寸):Cosmos 14B 全面优于 Cosmos 7B(Overall Both 0.184 vs 0.178),CogVideo-5B 优于 CogVideo-1.5B(0.163 vs 0.150),确认参数规模扩大对 SA/PC 均有正向增益。
Leaderboard(Table 12,人工评测 vs CAP):开源榜单一致——Wanx > Hunyuan > Step-Video-T2V > Open-Sora > CogVideo > Open-Sora-Plan > LTX-Video;闭源榜单仅第 2/3 名对调——人工评测 Sora-Turbo 排第 2、Kling 排第 3,CAP 则反过来,原因是 Kling 的电影感风格会让 CAP 偏向打高分(尽管物理正确性中等),而人工标注员被明确要求只看物理合理性,因此惩罚这类”美学伪装”更严格。
创新点与影响
- 迄今最大、最细粒度的 T2V 物理评测基准:50 个精细物理类别、1,050 条 prompt、12 个模型、12,600 段生成视频,规模显著超过 VideoPhy / PhyGenBench / Physics-IQ。
- 反物理(Anti-Physics)类别是本文的核心诊断创新:通过让模型执行”违反物理”的指令,区分”真正理解物理规律”与”单纯复现训练数据里的常见模式”——论文发现模型普遍会把反物理 prompt “合理化”回正常物理结果(如”酒杯里的酒重力反转”被生成成静止画面),而非尝试执行指令后失败。
- CAP:简单的”上下文告知 + 两步链式思考”零样本 MLLM 评测法,无需任何微调即可大幅逼近甚至超过专用微调评测器(VideoCon-Physics)在域外场景下的表现,且经中立性校验不会显著抬高假阳性率。
- 关键发现:(1) 性能沿 Fundamental → Composite → Anti-Physics 单调递减;(2) 物理增强型 prompt 比”堆砌细节”更有效,纯粹的 prompt 精细化不能解决深层物理理解缺陷;(3) 模型对”突变式”物理事件(碰撞破碎、玻璃杯摔碎)系统性地抹平为连续平滑的动画,回避剧烈状态转变;(4) 电影感美学与物理合理性存在权衡——Sora、Gen-3、Pika 等偏好夸张流畅的运动,牺牲真实物理;(5) 多物体交互场景(如”羽毛和石头同时落下但石头快得多”)显著提高失败率,模型倾向把物体当独立个体而非受统一物理定律支配的系统。
- 作者自陈局限:1,050 条 prompt 仍难覆盖某些高度专精/复杂交互领域;CAP 对画面精美(柔和布光、动态运镜)的视频存在轻微美学偏好,且在模糊/边界案例上可能过度自信,与人工标注员的不确定性形成对比。
- 项目页显示本文已被 ICLR 2026 接收为 Oral(NVIDIA Deep Imagination Research 官方项目页信息,反映的是晚于本文抓取的 arXiv v1 的后续修订版——v2/v3 分别提交于 2026-02、2026-05,其摘要措辞也把”12 个模型”改写为”10 个模型”,本页数据仍以可完整读取的 v1 全文 [Table 3 实际行数] 为准)。
原始链接
- 论文(arXiv 2507.13428):https://arxiv.org/abs/2507.13428
- PDF:https://arxiv.org/pdf/2507.13428
- 项目页(NVIDIA Deep Imagination Research):https://research.nvidia.com/labs/dir/phyworldbench/
- 代码(GitHub,作者 g-jing 维护的官方仓库):https://github.com/g-jing/phy-world-bench
- 数据集(HuggingFace):https://huggingface.co/datasets/phyworldbench/phyworldbench
一手源存档(sources/)
- phyworldbench—github-readme — GitHub README 快照(评测流水线三组件用法、目录结构、引用)
- phyworldbench—project-page — NVIDIA 项目页快照(摘要、ICLR 2026 Oral 标注、各图表说明)
- phyworldbench—hf-dataset-card — HuggingFace 数据集卡快照(字段结构、样本数、许可)
- 论文全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)