一句话定位
新加坡国立大学 Show Lab 提出 IPV-Bench——首个把”反现实/不可能视频”(违反物理、生物、地理、社会常识的场景)系统化的基准,用 4 大域 14 类的分类体系同时探测两件事:T2V 模型能否遵照提示生成这类反常场景(IPV-Txt,260 条 prompt)、Video-LLM 能否看懂这类场景(IPV-Vid,902 段精选视频 + 650 段真实视频),发现当前最强生成模型也只有 37.3% 的视频能同时做到”画质合格 + 忠实呈现不可能现象”,最强理解模型在开放式问答上得分不到 50%。
背景与定位
这是 physics-iq、phyworldbench、VideoPhy、PhyGenBench 一脉的物理/常识合理性评测在方法论上的补集:那几个基准问的是”生成的视频有多符合物理规律”,本文反过来问”生成的视频能有多不符合物理规律——而且是故意的、可控的”。作者的论证逻辑是:真实世界视频天然分布在”物理合理”这一侧,模型只需要记忆/检索训练集中的常见模式就能生成看似合理的画面;而”不可能视频”是分布外(out-of-real-world-distribution)数据,要求模型真正学习物理/生物/社会规律后再推理着去刻意打破它,而不是简单套用记忆。这与 sora、Kling 等模型被官方定位为”世界模拟器”(world simulator)的叙事直接对话——如果模型真的建立了世界模型,那么按指令生成一个反物理场景应该和生成一个正常场景一样可控,而不是被”拉回”到训练分布内的正常结果。
论文与既有 T2V / Video-LLM 基准的定位差异见原文 Table 1:GenVideo、GenVidBench、LOKI 做 AIGC 检测;vbench、VideoPhy、PhyGenBench 做视频生成的物理/质量评测;SEED-Bench、Video-Bench、MV-Bench、TempCompass 做视频理解评测——但没有一个基准同时覆盖”反常视频数据 + 反常文本描述 + 生成与理解双任务”,IPV-Bench 是本文声称首个同时满足这四项的基准。
模型架构
这是一篇基准 / 评测方法论论文,不训练任何生成或理解模型;“架构”即分类体系 + 数据构造流程 + 三级理解任务 + LLM-judge 评分协议四件套,被评测的模型都是现成的第三方 T2V / Video-LLM。
IPV 分类体系(Taxonomy)
四大域、合计 14 个子类:
- 物理定律(6 子类):力学、热学、光学、流体、材料属性、守恒定律——如”往半杯牛奶的杯子里倒牛奶,杯中牛奶量却完全不变”(违反质量守恒)。
- 生物定律(3 子类):生物能力(如人扇动手臂飞上天)、形态学(如马从四条腿逐渐长到八条腿)、拟人化(如煎蛋张嘴说话)。
- 地理定律(2 子类):气候天气异常、地形环境异常——如”一座山被削平成完美高原,树木和积雪却完好保留在新的平面上”。
- 社会定律(3 子类):常识违背(如程序员突然开始吃键盘)、魔法效果(如手电筒一照玻璃杯就碎)、历史错位(如爱因斯坦与特朗普在白宫握手)。
双组件基准结构
- IPV-Txt:基于分类体系构造的 260 条高质量文本 prompt,用于评测 T2V 模型的”反常提示遵循”能力。
- IPV-Vid:902 段精选高质量不可能视频(供理解任务的核心测试集),另配 650 段真实世界视频(供 Judgment 二分类任务做 1:1 平衡)。
三级理解任务(难度递增)
- Judgment(判别):二分类问”这段视频是否由 AI 生成”,1:1 合成/真实视频比例,指标 Accuracy + F1。
- MCQA(多选):从若干选项中选出最准确描述视频中不可能现象的答案;干扰项由 GPT-4o 结合详细标注 + 视频帧生成,确保干扰项也具体、也含视觉元素,避免模型靠简单视觉定位作弊。
- OpenQA(开放问答):不给任何提示,要求模型自主指出”视频中哪个内容/事件使其在现实中不可能或反常”,最贴近”模型是否真正理解”而非”能否从选项中蒙对”。
LLM-judge 评分协议(OpenQA)
采用 justification-then-score 两步法:评估器(默认 GPT-4o,另配 Claude-3.5-Sonnet 避免 GPT-4o 自评偏差)先给出模型答案与标注真值之间的匹配/不匹配理由,再据此打 0–1 的语义对齐分(1.0 完全对齐、0.8–0.9 良好、0.5–0.7 部分、0.1–0.4 弱、0.0 无对齐);论文强调”先说理由再打分”这一步对评分稳定性是关键,直接让 LLM 打分会不稳定。
IPV-Score(生成侧指标)
人工标注每段生成视频两个二值维度——画质是否合格、是否忠实呈现了不可能现象——IPV-Score = 同时满足两者的视频占比,用来避免”只优化画质但不遵循 prompt”或”遵循 prompt 但画质崩坏”的模型被高估。
数据
- IPV-Txt 构造(迭代式 taxonomy-prompt 协同演化):
- 初始化:参考 VideoPhy / PhyGenBench 等文献 + GPT-4o 头脑风暴搭初始分类。
- LLM 生成:用 GPT-4o、Claude-3.5、Gemini-1.5 三个 LLM 生成候选场景,强调”原创场景”而非简单替换名词。
- 众包补充:“outlier”场景由 15 名跨计算机科学/经济/艺术/教育背景的参与者填写问卷收集,人均耗时 31 分钟,问卷中明确要求”禁止使用 LLM”以保证数据真实性,最终收集 150 条人工 prompt 反哺分类体系。
- 质量控制:按清晰度、可及性(排除过于晦涩的场景)、相关性(去重/合并相似样本)、可视化性(排除纯听觉类描述)四维筛选。
- 语言润色:参考 HunyuanVideo / CogVideoX 的 prompt 改写策略,用 GPT-4o 把描述改写得更长、更细节化、更结构化,以适配 T2V 模型输入习惯。
- IPV-Vid 收集三来源:
- T2V 生成:用 IPV-Txt 的 260 条 prompt 驱动 10 个 SOTA T2V 模型(开源:Open-Sora、HunyuanVideo、CogVideoX、Mochi 1、LTX、Pyramid-Flow;闭源:Sora、Kling、Luma、Hailuo)各生成一批,合计产出 2,600 段合成视频。
- 网络视频收集:从 Sora/Hailuo 等模型的社区站点及 Twitter(X) 上标注为”AI 生成”的分享视频中人工筛选,收集 155 段。
- 真实世界视频:以 OpenVid 为底库,用 CLIP 以生成视频为 query 检索内容相似的真实视频,再按时长/画幅/美学分过滤、排除卡通风格/明显 logo/字幕的视频,收集 650 段用于 Judgment 任务的真实一侧。
- 人工过滤与标注(自建标注工具,详见 Appendix A.1):对 2,600 + 155 段候选视频按”画质合格”(排除模糊、闪烁、美学差、运动不足、风格不一致)与”语义反常”(保留确实违反现实规律的场景)双重标准筛选,得到最终 902 段 IPV-Vid 核心视频;再对留存视频标注 1) 空间/时间异常类型、2) 分类体系标签、3) 不可能现象的文字说明。
- MCQA/OpenQA 质量把关:由于两任务都借助 GPT-4o 构造/评分,另抽取 100 个样本由人类回答同样的问题,其分数/准确率作为”金标准”参照(Table 3 中 Human 行:MCQA 准确率 94.0、OpenQA 经 GPT-4o 评估器打分 82.7,未报告 Claude 评估器下的人类分数)。
- 数据集在 HuggingFace 以
showlab/ImpossibleVideos发布,size_categories: 1K<n<10K,license MIT。
训练方法
本工作不训练任何模型,“方法”即评测协议本身:
- 生成侧:对 10 个 T2V 模型统一喂 IPV-Txt 的 260 条 prompt,人工标注”画质”与”prompt 遵循”两个二值维度算 IPV-Score;作者说明目前依赖人工标注保证结果可靠性,一套自动评测方法仍在打磨中(论文 Appendix B.2 给出了一个自动策略的初步分析,尚未开源)。
- 理解侧:对 9 个 Video-LLM(含 2 个闭源)跑三级任务;MCQA 干扰项生成、OpenQA 评分均由 GPT-4o/Claude-3.5-Sonnet 驱动的 LLM-judge 完成,且通过双评估器(GPT-4o + Claude)互相校验以缓解 GPT-4o 既当选手又当裁判的自评偏差。
- 被复现的具体模型版本(GitHub README “Reproduce” 章节明确列出):Video-LLaVA=
LanguageBind/Video-LLaVA-7B-hf、Oryx=Oryx-1.5-7B、InternVL-2.5=OpenGVLab/InternVL2_5-8B-MPO、NVILA=Efficient-Large-Model/NVILA-8B、LongVU=Vision-CAIR/LongVU_Qwen2_7B、Qwen2-VL=Qwen/Qwen2-VL-7B-Instruct、LLaVA-Next=lmms-lab/LLaVA-Video-7B-Qwen2、GPT=gpt-4o、Gemini=gemini-1.5-flash。
Infra(训练 / 推理工程)
- 训练算力:不适用——本文不训练任何模型。
- 数据构造人力:众包问卷 15 人、人均 31 分钟;MCQA/OpenQA 人工金标准抽样 100 条;视频人工过滤/标注走自建标注工具(Appendix A.1),具体标注人数/工时未披露。
- 推理侧:10 个 T2V 模型、9 个 Video-LLM 均走各自官方 API/开源权重默认配置生成或推理,论文未披露具体 GPU 型号、数量或推理延迟;唯一披露的推理配置细节是 GPT-4o 在理解任务中仅用 1 FPS 采样,论文特别指出即便如此 GPT-4o 仍是 OpenQA 最强模型,说明帧率/上下文窗口大小并非当前瓶颈。
- GPU 数量、精度、并行策略:未披露。
评测 benchmark
生成侧(论文 Table 2,IPV-Txt 上人工标注的 Visual Quality / Prompt Following,及综合 IPV-Score,按 Physical/Biological/Social/Geographical 四域 + Overall 报告,数值为百分比):
| 模型 | Overall Visual Quality | Overall Prompt Following | IPV-Score |
|---|---|---|---|
| LTX(开源) | 52.3 | 16.5 | 10.0 |
| Open-Sora(开源) | 51.5 | 26.5 | 15.8 |
| Pyramid-Flow(开源) | 88.5 | 20.8 | 19.6 |
| CogVideoX-1.5(开源) | 41.5 | 39.2 | 16.9 |
| Mochi 1(开源) | 69.2 | 50.8 | 37.3(第一) |
| HunyuanVideo(开源) | 92.7 | 29.2 | 26.2 |
| Luma(闭源) | 88.0 | 17.1 | 14.3 |
| Sora(闭源) | 98.4 | 26.0 | 25.2 |
| Kling 1.5(闭源) | 96.1 | 27.5 | 26.7 |
| Hailuo(闭源) | 95.8 | 37.7 | 36.2(第二) |
最强模型 Mochi 1 也只有 37.3% 的生成视频同时做到”画质合格 + 忠实呈现不可能现象”,其余模型全部更差。且”画质”与”prompt 遵循”能力明显不平衡:Luma 画质高(88.0)但 prompt 遵循极低(17.1);反过来 Mochi 1(开源)prompt 遵循反而超过多数闭源模型。
理解侧(论文 Table 3,Judgment 用 Acc/F1,四域 MC/Open 用准确率或 LLM-judge 打分×100,Overall 含 GPT-4o 与 Claude 两种评估器):
| 模型 | Judgment Acc/F1 | Overall MC | Overall Open (GPT-4o 评) | Overall Open(C)(Claude 评) |
|---|---|---|---|---|
| Random | 50.0 / 50.0 | 20.0 | - | - |
| Human(100 样本金标准) | - | 94.0 | 82.7 | - |
| Video-LLaVA(开源) | 72.7 / 72.9(F1 最高) | 26.8 | 14.2 | 18.7 |
| Oryx(开源) | 58.6 / 44.6 | 60.4 | 18.7 | 22.7 |
| InternVL-2.5(开源) | 56.5 / 69.7 | 62.4 | 33.0 | 32.5 |
| NVILA(开源) | 72.6 / 64.0 | 62.6 | 26.8 | 30.6 |
| LongVU(开源) | 70.3 / 68.0 | 73.3 | 21.9 | 25.4 |
| Qwen2-VL(开源) | 76.2/71.1(Acc 全场最高) | 71.4 | 31.7 | 33.7 |
| LLaVA-Next(开源) | 73.2 / 70.4 | 86.4(MC 最高) | 34.4 | 38.6 |
| Gemini-1.5-Flash(闭源) | 73.1 / 64.0 | 84.4 | 42.5 | 36.8 |
| GPT-4o(闭源) | 拒答 Yes/No | 79.7 | 49.1(Open 最高) | 45.1(Open(C) 最高) |
要点:Qwen2-VL 的 Judgment 准确率(76.2%)比 Gemini-1.5-Flash 高 3.1 个百分点;LLaVA-Next 的 MCQA 准确率(86.4%)反超 GPT-4o 和 Gemini;但开放问答上 GPT-4o 全面最强(两种评估器下都排第一),Video-LLaVA 的 MCQA 准确率只有 26.8%,接近随机猜测基线(20.0%)。GPT-4o 会拒绝对 Judgment 任务给出简单的 Yes/No 回答,作者为保证公平未对其做针对性 prompt 调优。
空间 vs 时间推理拆分(论文 Table 4):所有模型在需要时间维度推理的视频上得分都系统性低于空间/世界知识类视频——例如 GPT-4o 空间 MC/Open 为 90.6/75.2,时间维度降到 75.6/59.1;配备高帧率的视频专家模型 LongVU(Spatial 85.7/42.6 vs Temporal 68.5/22.7)并未因帧率优势获得明显收益;反而基于图像的模型(LLaVA-Next、GPT-4o)在两个维度上都排名靠前——论文认为这说明”更精细的时间建模模块”而非”简单扩大上下文窗口/帧率”才是解决时间推理短板的关键。
创新点与影响
- 首个”反常视频”双任务基准:把”不可能/反现实场景”这一此前被物理评测基准(如 phyworldbench、physics-iq)忽视的维度系统化,同时覆盖生成侧(IPV-Txt)与理解侧(IPV-Vid),并首次显式纳入生物、地理、社会三类超越”物理定律”范畴的反常场景。
- IPV-Score:把”画质”和”prompt 遵循”拆成两个正交维度再取交集,避免高画质但不听指令、或听指令但画质崩坏的模型被误判为强。
- justification-then-score LLM-judge 协议:先给理由再打分,显著提升 OpenQA 打分稳定性,且用双评估器(GPT-4o + Claude-3.5-Sonnet)互证缓解自评偏差。
- 关键发现:(1) 当前最强 T2V 模型生成不可能视频的综合达标率不到四成(Mochi 1 37.3%);(2) 模型在”遵循反常 prompt”与”生成质量”上普遍失衡;(3) 失败模式有两类——反常 prompt 触发画质劣化(分布外输入),或模型把语义元素画对了但仍把动态”拉回”现实规律(创造力被物理先验压制);(4) 理解侧的核心瓶颈是时间维度推理而非静态世界知识,且提高帧率/扩大上下文窗口不能自动解决这一瓶颈。
- 作者自陈局限:生成侧的自动评测方法仍在开发中,当前主结果依赖人工标注;GPT-4o 同时是被评模型与评估器之一,存在潜在自评偏差(已用 Claude 交叉验证缓解但未完全消除);GPT-4o 拒绝直接回答 Judgment 任务的 Yes/No 问题,未做针对性 prompt 调优以保证跨模型公平,但也意味着该模型在此任务上的可比性打了折扣。
- 已被 ICML 2025 接收(GitHub 仓库 2025-05-01 news 确认)。
原始链接
- 论文(arXiv 2503.14378):https://arxiv.org/abs/2503.14378
- PDF:https://arxiv.org/pdf/2503.14378
- 项目页:https://showlab.github.io/Impossible-Videos/
- 代码(GitHub,showlab 官方仓库):https://github.com/showlab/Impossible-Videos
- 数据集(HuggingFace):https://huggingface.co/datasets/showlab/ImpossibleVideos
一手源存档(sources/)
- impossible-videos—project-page — 项目页快照(作者信息、示例视频列表、benchmark 统计图说明)
- impossible-videos—github-readme — GitHub README 快照(仓库文件结构、复现用具体模型版本清单)
- impossible-videos—hf-card — HuggingFace 数据集卡快照(license、任务类别、复现步骤)
- 论文全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)