一句话定位

新加坡国立大学 Show Lab 提出 IPV-Bench——首个把”反现实/不可能视频”(违反物理、生物、地理、社会常识的场景)系统化的基准,用 4 大域 14 类的分类体系同时探测两件事:T2V 模型能否遵照提示生成这类反常场景(IPV-Txt,260 条 prompt)、Video-LLM 能否看懂这类场景(IPV-Vid,902 段精选视频 + 650 段真实视频),发现当前最强生成模型也只有 37.3% 的视频能同时做到”画质合格 + 忠实呈现不可能现象”,最强理解模型在开放式问答上得分不到 50%。

背景与定位

这是 physics-iqphyworldbench、VideoPhy、PhyGenBench 一脉的物理/常识合理性评测在方法论上的补集:那几个基准问的是”生成的视频有多符合物理规律”,本文反过来问”生成的视频能有多符合物理规律——而且是故意的、可控的”。作者的论证逻辑是:真实世界视频天然分布在”物理合理”这一侧,模型只需要记忆/检索训练集中的常见模式就能生成看似合理的画面;而”不可能视频”是分布外(out-of-real-world-distribution)数据,要求模型真正学习物理/生物/社会规律后再推理着去刻意打破它,而不是简单套用记忆。这与 sora、Kling 等模型被官方定位为”世界模拟器”(world simulator)的叙事直接对话——如果模型真的建立了世界模型,那么按指令生成一个反物理场景应该和生成一个正常场景一样可控,而不是被”拉回”到训练分布内的正常结果。

论文与既有 T2V / Video-LLM 基准的定位差异见原文 Table 1:GenVideo、GenVidBench、LOKI 做 AIGC 检测;vbench、VideoPhy、PhyGenBench 做视频生成的物理/质量评测;SEED-Bench、Video-Bench、MV-Bench、TempCompass 做视频理解评测——但没有一个基准同时覆盖”反常视频数据 + 反常文本描述 + 生成与理解双任务”,IPV-Bench 是本文声称首个同时满足这四项的基准。

模型架构

这是一篇基准 / 评测方法论论文,不训练任何生成或理解模型;“架构”即分类体系 + 数据构造流程 + 三级理解任务 + LLM-judge 评分协议四件套,被评测的模型都是现成的第三方 T2V / Video-LLM。

IPV 分类体系(Taxonomy)

四大域、合计 14 个子类

  1. 物理定律(6 子类):力学、热学、光学、流体、材料属性、守恒定律——如”往半杯牛奶的杯子里倒牛奶,杯中牛奶量却完全不变”(违反质量守恒)。
  2. 生物定律(3 子类):生物能力(如人扇动手臂飞上天)、形态学(如马从四条腿逐渐长到八条腿)、拟人化(如煎蛋张嘴说话)。
  3. 地理定律(2 子类):气候天气异常、地形环境异常——如”一座山被削平成完美高原,树木和积雪却完好保留在新的平面上”。
  4. 社会定律(3 子类):常识违背(如程序员突然开始吃键盘)、魔法效果(如手电筒一照玻璃杯就碎)、历史错位(如爱因斯坦与特朗普在白宫握手)。

双组件基准结构

  • IPV-Txt:基于分类体系构造的 260 条高质量文本 prompt,用于评测 T2V 模型的”反常提示遵循”能力。
  • IPV-Vid902 段精选高质量不可能视频(供理解任务的核心测试集),另配 650 段真实世界视频(供 Judgment 二分类任务做 1:1 平衡)。

三级理解任务(难度递增)

  1. Judgment(判别):二分类问”这段视频是否由 AI 生成”,1:1 合成/真实视频比例,指标 Accuracy + F1。
  2. MCQA(多选):从若干选项中选出最准确描述视频中不可能现象的答案;干扰项由 GPT-4o 结合详细标注 + 视频帧生成,确保干扰项也具体、也含视觉元素,避免模型靠简单视觉定位作弊。
  3. OpenQA(开放问答):不给任何提示,要求模型自主指出”视频中哪个内容/事件使其在现实中不可能或反常”,最贴近”模型是否真正理解”而非”能否从选项中蒙对”。

LLM-judge 评分协议(OpenQA)

采用 justification-then-score 两步法:评估器(默认 GPT-4o,另配 Claude-3.5-Sonnet 避免 GPT-4o 自评偏差)先给出模型答案与标注真值之间的匹配/不匹配理由,再据此打 0–1 的语义对齐分(1.0 完全对齐、0.8–0.9 良好、0.5–0.7 部分、0.1–0.4 弱、0.0 无对齐);论文强调”先说理由再打分”这一步对评分稳定性是关键,直接让 LLM 打分会不稳定。

IPV-Score(生成侧指标)

人工标注每段生成视频两个二值维度——画质是否合格是否忠实呈现了不可能现象——IPV-Score = 同时满足两者的视频占比,用来避免”只优化画质但不遵循 prompt”或”遵循 prompt 但画质崩坏”的模型被高估。

数据

  • IPV-Txt 构造(迭代式 taxonomy-prompt 协同演化):
    • 初始化:参考 VideoPhy / PhyGenBench 等文献 + GPT-4o 头脑风暴搭初始分类。
    • LLM 生成:用 GPT-4o、Claude-3.5、Gemini-1.5 三个 LLM 生成候选场景,强调”原创场景”而非简单替换名词。
    • 众包补充:“outlier”场景由 15 名跨计算机科学/经济/艺术/教育背景的参与者填写问卷收集,人均耗时 31 分钟,问卷中明确要求”禁止使用 LLM”以保证数据真实性,最终收集 150 条人工 prompt 反哺分类体系。
    • 质量控制:按清晰度、可及性(排除过于晦涩的场景)、相关性(去重/合并相似样本)、可视化性(排除纯听觉类描述)四维筛选。
    • 语言润色:参考 HunyuanVideo / CogVideoX 的 prompt 改写策略,用 GPT-4o 把描述改写得更长、更细节化、更结构化,以适配 T2V 模型输入习惯。
  • IPV-Vid 收集三来源
    1. T2V 生成:用 IPV-Txt 的 260 条 prompt 驱动 10 个 SOTA T2V 模型(开源:Open-Sora、HunyuanVideo、CogVideoX、Mochi 1、LTX、Pyramid-Flow;闭源:Sora、Kling、Luma、Hailuo)各生成一批,合计产出 2,600 段合成视频。
    2. 网络视频收集:从 Sora/Hailuo 等模型的社区站点及 Twitter(X) 上标注为”AI 生成”的分享视频中人工筛选,收集 155 段
    3. 真实世界视频:以 OpenVid 为底库,用 CLIP 以生成视频为 query 检索内容相似的真实视频,再按时长/画幅/美学分过滤、排除卡通风格/明显 logo/字幕的视频,收集 650 段用于 Judgment 任务的真实一侧。
  • 人工过滤与标注(自建标注工具,详见 Appendix A.1):对 2,600 + 155 段候选视频按”画质合格”(排除模糊、闪烁、美学差、运动不足、风格不一致)与”语义反常”(保留确实违反现实规律的场景)双重标准筛选,得到最终 902 段 IPV-Vid 核心视频;再对留存视频标注 1) 空间/时间异常类型、2) 分类体系标签、3) 不可能现象的文字说明。
  • MCQA/OpenQA 质量把关:由于两任务都借助 GPT-4o 构造/评分,另抽取 100 个样本由人类回答同样的问题,其分数/准确率作为”金标准”参照(Table 3 中 Human 行:MCQA 准确率 94.0、OpenQA 经 GPT-4o 评估器打分 82.7,未报告 Claude 评估器下的人类分数)。
  • 数据集在 HuggingFace 以 showlab/ImpossibleVideos 发布,size_categories: 1K<n<10K,license MIT。

训练方法

本工作不训练任何模型,“方法”即评测协议本身:

  • 生成侧:对 10 个 T2V 模型统一喂 IPV-Txt 的 260 条 prompt,人工标注”画质”与”prompt 遵循”两个二值维度算 IPV-Score;作者说明目前依赖人工标注保证结果可靠性,一套自动评测方法仍在打磨中(论文 Appendix B.2 给出了一个自动策略的初步分析,尚未开源)。
  • 理解侧:对 9 个 Video-LLM(含 2 个闭源)跑三级任务;MCQA 干扰项生成、OpenQA 评分均由 GPT-4o/Claude-3.5-Sonnet 驱动的 LLM-judge 完成,且通过双评估器(GPT-4o + Claude)互相校验以缓解 GPT-4o 既当选手又当裁判的自评偏差。
  • 被复现的具体模型版本(GitHub README “Reproduce” 章节明确列出):Video-LLaVA=LanguageBind/Video-LLaVA-7B-hf、Oryx=Oryx-1.5-7B、InternVL-2.5=OpenGVLab/InternVL2_5-8B-MPO、NVILA=Efficient-Large-Model/NVILA-8B、LongVU=Vision-CAIR/LongVU_Qwen2_7B、Qwen2-VL=Qwen/Qwen2-VL-7B-Instruct、LLaVA-Next=lmms-lab/LLaVA-Video-7B-Qwen2、GPT=gpt-4o、Gemini=gemini-1.5-flash

Infra(训练 / 推理工程)

  • 训练算力:不适用——本文不训练任何模型。
  • 数据构造人力:众包问卷 15 人、人均 31 分钟;MCQA/OpenQA 人工金标准抽样 100 条;视频人工过滤/标注走自建标注工具(Appendix A.1),具体标注人数/工时未披露。
  • 推理侧:10 个 T2V 模型、9 个 Video-LLM 均走各自官方 API/开源权重默认配置生成或推理,论文未披露具体 GPU 型号、数量或推理延迟;唯一披露的推理配置细节是 GPT-4o 在理解任务中仅用 1 FPS 采样,论文特别指出即便如此 GPT-4o 仍是 OpenQA 最强模型,说明帧率/上下文窗口大小并非当前瓶颈。
  • GPU 数量、精度、并行策略:未披露。

评测 benchmark

生成侧(论文 Table 2,IPV-Txt 上人工标注的 Visual Quality / Prompt Following,及综合 IPV-Score,按 Physical/Biological/Social/Geographical 四域 + Overall 报告,数值为百分比)

模型Overall Visual QualityOverall Prompt FollowingIPV-Score
LTX(开源)52.316.510.0
Open-Sora(开源)51.526.515.8
Pyramid-Flow(开源)88.520.819.6
CogVideoX-1.5(开源)41.539.216.9
Mochi 1(开源)69.250.837.3(第一)
HunyuanVideo(开源)92.729.226.2
Luma(闭源)88.017.114.3
Sora(闭源)98.426.025.2
Kling 1.5(闭源)96.127.526.7
Hailuo(闭源)95.837.736.2(第二)

最强模型 Mochi 1 也只有 37.3% 的生成视频同时做到”画质合格 + 忠实呈现不可能现象”,其余模型全部更差。且”画质”与”prompt 遵循”能力明显不平衡:Luma 画质高(88.0)但 prompt 遵循极低(17.1);反过来 Mochi 1(开源)prompt 遵循反而超过多数闭源模型。

理解侧(论文 Table 3,Judgment 用 Acc/F1,四域 MC/Open 用准确率或 LLM-judge 打分×100,Overall 含 GPT-4o 与 Claude 两种评估器)

模型Judgment Acc/F1Overall MCOverall Open (GPT-4o 评)Overall Open(C)(Claude 评)
Random50.0 / 50.020.0--
Human(100 样本金标准)-94.082.7-
Video-LLaVA(开源)72.7 / 72.9(F1 最高)26.814.218.7
Oryx(开源)58.6 / 44.660.418.722.7
InternVL-2.5(开源)56.5 / 69.762.433.032.5
NVILA(开源)72.6 / 64.062.626.830.6
LongVU(开源)70.3 / 68.073.321.925.4
Qwen2-VL(开源)76.2/71.1(Acc 全场最高)71.431.733.7
LLaVA-Next(开源)73.2 / 70.486.4(MC 最高)34.438.6
Gemini-1.5-Flash(闭源)73.1 / 64.084.442.536.8
GPT-4o(闭源)拒答 Yes/No79.749.1(Open 最高)45.1(Open(C) 最高)

要点:Qwen2-VL 的 Judgment 准确率(76.2%)比 Gemini-1.5-Flash 高 3.1 个百分点;LLaVA-Next 的 MCQA 准确率(86.4%)反超 GPT-4o 和 Gemini;但开放问答上 GPT-4o 全面最强(两种评估器下都排第一),Video-LLaVA 的 MCQA 准确率只有 26.8%,接近随机猜测基线(20.0%)。GPT-4o 会拒绝对 Judgment 任务给出简单的 Yes/No 回答,作者为保证公平未对其做针对性 prompt 调优。

空间 vs 时间推理拆分(论文 Table 4):所有模型在需要时间维度推理的视频上得分都系统性低于空间/世界知识类视频——例如 GPT-4o 空间 MC/Open 为 90.6/75.2,时间维度降到 75.6/59.1;配备高帧率的视频专家模型 LongVU(Spatial 85.7/42.6 vs Temporal 68.5/22.7)并未因帧率优势获得明显收益;反而基于图像的模型(LLaVA-Next、GPT-4o)在两个维度上都排名靠前——论文认为这说明”更精细的时间建模模块”而非”简单扩大上下文窗口/帧率”才是解决时间推理短板的关键。

创新点与影响

  • 首个”反常视频”双任务基准:把”不可能/反现实场景”这一此前被物理评测基准(如 phyworldbenchphysics-iq)忽视的维度系统化,同时覆盖生成侧(IPV-Txt)与理解侧(IPV-Vid),并首次显式纳入生物、地理、社会三类超越”物理定律”范畴的反常场景。
  • IPV-Score:把”画质”和”prompt 遵循”拆成两个正交维度再取交集,避免高画质但不听指令、或听指令但画质崩坏的模型被误判为强。
  • justification-then-score LLM-judge 协议:先给理由再打分,显著提升 OpenQA 打分稳定性,且用双评估器(GPT-4o + Claude-3.5-Sonnet)互证缓解自评偏差。
  • 关键发现:(1) 当前最强 T2V 模型生成不可能视频的综合达标率不到四成(Mochi 1 37.3%);(2) 模型在”遵循反常 prompt”与”生成质量”上普遍失衡;(3) 失败模式有两类——反常 prompt 触发画质劣化(分布外输入),或模型把语义元素画对了但仍把动态”拉回”现实规律(创造力被物理先验压制);(4) 理解侧的核心瓶颈是时间维度推理而非静态世界知识,且提高帧率/扩大上下文窗口不能自动解决这一瓶颈。
  • 作者自陈局限:生成侧的自动评测方法仍在开发中,当前主结果依赖人工标注;GPT-4o 同时是被评模型与评估器之一,存在潜在自评偏差(已用 Claude 交叉验证缓解但未完全消除);GPT-4o 拒绝直接回答 Judgment 任务的 Yes/No 问题,未做针对性 prompt 调优以保证跨模型公平,但也意味着该模型在此任务上的可比性打了折扣。
  • 已被 ICML 2025 接收(GitHub 仓库 2025-05-01 news 确认)。

原始链接

一手源存档(sources/)