一句话定位
Physics-IQ 是 Google DeepMind(一作在 GDM 期间完成,现属 INSAIT / Sofia University)提出的真实世界视频续写基准,用来量化生成式视频模型到底有没有学到物理规律。核心做法:拍 66 个精心设计的物理场景(固体力学 / 流体 / 光学 / 热力学 / 磁学),每个从左 / 中 / 右三视角各拍两遍、共 396 段 8 秒 4K/30fps 真实视频,把前 3 秒给模型做条件、要它预测后 5 秒,再用四个专门的运动定位 / 时序 / 幅度 / 像素指标算出归一化的 Physics-IQ score(真实两遍之间的物理随机性 = 100% 上限)。结论:Sora / Runway / Pika / Lumiere / SVD / VideoPoet 六大模型物理理解都严重不足(最好 24.1%),且视觉真实度与物理理解不相关。论文发表于 WACV 2026(pp. 948–958)。
背景与定位
这篇属于世界模型评测 / intuitive-physics benchmark 范式,直接切入”视频模型是不是世界模型”这场争论。
- 支持派:下一帧预测这个训练任务本身就逼模型理解物理——不懂轨迹、重力、流体就没法预测下一帧;类比 LLM 靠 next-token 学会语法语义;predictive coding(von Helmholtz、Friston)也认为大脑本质在做预测。一句话:“successful prediction signals successful understanding”。
- 反对派:看视频是被动过程,模型无法干预、观察不到因果效应(不像小孩玩玩具),难以从相关性中分离因果;而且视频模型经历的是”数字世界”而非具身系统的真实世界;视觉真实只需复现训练数据里的常见模式,是捷径学习(shortcut learning)而非理解。
已有物理推理基准几乎都用合成数据:Physion / Physion++(碰撞、稳定性)、CRAFT、IntPhys(因果、物体恒存)、CoPhy、CLEVRER(反事实 / 因果)、ESPRIT、PhyWorld(Kang et al.,“How far is video generation from world model”)。VideoPhy、PhyGenBench 走文本描述而非视觉数据;LLMPhy 把 LLM 接非可微物理仿真器;NVIDIA cosmos-predict(Cosmos world foundation model platform)面向具身 AI。Physics-IQ 的差异化:用真实拍摄视频消除 real-vs-synthetic 分布偏移,三视角、用两遍拍摄测得的物理方差当上限、OOD 场景(不能靠记忆训练集解决),提供一个更严格的评测设计。
模型架构
这是一篇基准 / 方法论论文,不训练任何模型;“架构”即基准的三件套:数据集构造 + 评测协议 + 指标设计。
数据集构造
- 规模:396 段视频 = 66 场景 × 3 视角 × 2 takes,每段 8 秒。
- 拍摄参数:30 FPS、分辨率 3840×2160(4K,16:9)、Sony Alpha a6400 相机 + 16–50mm 镜头;三视角 left / center / right;静态机位、无镜头运动(这点让运动检测可以用简单像素阈值实现)。
- 五大物理类别:solid mechanics、fluid dynamics、optics、thermodynamics、magnetism;覆盖碰撞、物体连续 / 遮挡 / 恒存、流体、链式反应、受力(重力)轨迹、材料属性与反应、光影反射、磁性等事件。
- 物理方差(physical variance):每个场景在相同条件下拍两遍(take 1 / take 2),捕捉真实世界固有的随机性(混沌运动、摩擦微差、力的轨迹扰动)。两遍之差就是”能合理期待模型达到的上限”,归一化后 = 100%。
评测协议
- 把 8 秒视频切成 3 秒条件 + 5 秒测试(ground truth)。
- Switch frame = 条件段最后一帧,逐场景手动挑选:既给足物理事件与物体信息,又保证正确预测必须懂物理(如多米诺场景选在第一块刚被推倒、尚未碰到第二块的瞬间)。
- i2v 模型(Runway Gen 3、Pika 1.0、Sora)只给 switch frame;multiframe / v2v 模型(VideoPoet、Lumiere)给最多 3 秒条件帧。
- 可选文本 caption:描述条件段但不泄露未来如何演化。Stable Video Diffusion 是唯一不接受文本条件的模型。
四个物理理解指标
- Spatial IoU(动作发生在哪):像素强度跨帧变化过阈值得二值 h×w×t “运动掩码视频”(Algorithm 2:背景差分 + 自适应更新 + 形态学开闭),沿时间用 max 塌成 h×w 运动图,与真实运动图算 IoU。最宽松,只看位置。
- Spatiotemporal IoU(哪 + 何时):不塌时间,逐帧比对两段运动掩码视频再对 t 取平均。Spatial 高但这个低 = 位置对、时机错。
- Weighted spatial IoU(哪 + 动了多少):时间维用加权平均(而非 max)塌成运动图,按 Σmin/Σmax 计。能区分钟摆(同处反复动)与滚球(只过一次)。
- MSE(怎么动 / 像素保真):逐像素平方差,对物体变色等物理不可能事件重罚;单看数值难解释,论文用 Fig.10 给直觉。
四者合成 Physics-IQ score(MSE 取负号),并归一化使物理方差 = 100%。Physics-IQ score 与”四指标平均排名”的 Spearman 相关 = −.87(p<.005),说明聚合成单分基本保序。
视觉真实度指标(MLLM)
用 Gemini 1.5 Pro 做 2AFC(two-alternative forced-choice,心理物理学金标准):给它同场景的真实 + 生成一对视频(随机序),让它指认哪个是生成的。准确率 = MLLM score,chance = 50%;越接近 50% 说明越难分辨、生成越真实。评测 prompt 见附录(还带了句”做得好给你 100 刀小费”)。
被评测的 8 个模型变体
VideoPoet(i2v + multiframe,LLM 式、因果模型)、Lumiere(i2v + multiframe,时空扩散)、Runway Gen 3(i2v)、Pika 1.0(i2v)、Stable Video Diffusion(i2v)、Sora(i2v)。VideoPoet 与 Lumiere 有超分阶段,实验中跳过超分(低分输出已够测物理)。各模型 FPS 8–30、分辨率 128×128 到 1280×768 不等(详见下表),用线性插值(Algorithm 1)把 Physics-IQ 视频对齐到各模型偏好的 FPS / 分辨率。Luma 与 Veo2 未纳入:Luma 使用条款禁止 benchmarking,Veo2 当时未公开可用。
| 模型 | 文本条件 | 多帧条件 | 单帧条件 | FPS | 分辨率 |
|---|---|---|---|---|---|
| VideoPoet (i2v) | ✓ | ✗ | ✓ | 8 | 128×224 |
| VideoPoet (multiframe) | ✓ | ✓ | ✗ | 8 | 128×224 |
| Lumiere (i2v) | ✓ | ✗ | ✓ | 16 | 128×128 |
| Lumiere (multiframe) | ✓ | ✓ | ✗ | 16 | 128×128 |
| Stable Video Diffusion (i2v) | ✗ | ✗ | ✓ | 8 | 1024×576 |
| Runway Gen 3 (i2v) | ✓ | ✗ | ✓ | 24 | 1280×768 |
| Pika 1.0 (i2v) | ✓ | ✗ | ✓ | 24 | 1280×720 |
| Sora (i2v) | ✓ | ✗ | ✓ | 30 | 854×480 |
数据
基准本身就是数据,无训练数据。要点复述:396 段真实视频、66 场景、5 类物理、8 秒、30fps、4K、三视角、每场景两遍。全部真实拍摄(无合成 / 无仿真),静态机位。数据集 + 评测代码 Apache-2.0 / CC-BY 开源;原始数据托管在 Google Cloud Storage(physics-iq-benchmark bucket),提供 30/24/16/8 FPS 变体。切分为 full-videos / split-videos(conditioning + testing)/ switch-frames / video-masks 四块。
训练方法
无模型训练——本工作不做参数学习,“方法”是评测流水线:切分 → 生成续写 → 生成运动掩码 → 计算四指标 → 用物理方差归一化 → 合成 Physics-IQ score,另用 Gemini 1.5 Pro 2AFC 测视觉真实度。两段辅助算法:Algorithm 1(线性插值改 FPS + 可选 resize)、Algorithm 2(背景差分 + 自适应背景更新 α + 阈值 τ + 形态学开闭生成二值运动掩码)。被测模型均为各家现成模型,Physics-IQ 只在其上做零样本推理评测。
Infra(训练 / 推理工程)
- 训练算力:无(不训练模型)。
- 数据采集 infra:受控环境 + Sony Alpha a6400 相机三机位同步拍摄(录制设置见论文 Fig.8)。
- 推理:各被测视频模型生成 5 秒续写;论文未披露具体 GPU / 时延 / FPS 等推理工程数字(多为闭源 API 模型,如 Sora / Runway / Pika)。评测端指标计算为 CPU 侧视频处理,仓库要求
ffprobe(ffmpeg),Linux 环境,Python(uv / pip)。GPU 数量 / GPU-hours / 并行 / 精度:未披露(不适用)。
评测 benchmark
主结果(论文 Table 1,结果冻结于 2025-02-19):Physics-IQ score 归一化到物理方差 = 100.0。
| 模型 | Spatial IoU↑ | Spatiotemp IoU↑ | Weighted-spatial IoU↑ | MSE↓ | Physics-IQ↑ |
|---|---|---|---|---|---|
| Physical Variance(上限) | 0.645 | 0.512 | 0.626 | 0.002 | 100.0 |
| VideoPoet (multiframe) | 0.245 | 0.143 | 0.054 | 0.010 | 24.1 |
| Runway Gen 3 (i2v) | 0.220 | 0.109 | 0.044 | 0.015 | 18.4 |
| Lumiere (multiframe) | 0.170 | 0.146 | 0.034 | 0.013 | 18.2 |
| VideoPoet (i2v) | 0.175 | 0.106 | 0.057 | 0.012 | 18.0 |
| Lumiere (i2v) | 0.138 | 0.165 | 0.024 | 0.016 | 17.1 |
| Stable Video Diffusion (i2v) | 0.139 | 0.054 | 0.088 | 0.021 | 13.5 |
| Pika 1.0 (i2v) | 0.151 | 0.034 | 0.026 | 0.014 | 9.5 |
| Sora (i2v) | 0.142 | 0.041 | 0.055 | 0.036 | 8.7 |
- 最好只有 24.1%,离 100% 上限差得远——现役最强视频模型物理理解严重不足。
- VideoPoet(multiframe)夺冠,且它是因果模型;有两版本的模型里 multiframe > i2v(有时序信息应更利于预测未来),符合预期。
- VideoPoet(multiframe)按 Table 1 加粗仅 2 项最优(Spatial IoU 0.245、MSE 0.010);Spatiotemporal IoU 最优为 Lumiere (i2v)(0.165)、Weighted-spatial IoU 最优为 Stable Video Diffusion(0.088)(论文正文却称 VideoPoet mf「4 项中 3 项最优」,与其自家 Table 1 加粗自相矛盾)——SVD 爱”动得多”但常物理不合理、位置 / 时序差(Spatial / Spatiotemporal IoU 弱),印证没有任何单指标能独立使用。
- Sora 综合垫底(8.7):画面常最精美,但频繁出现镜头切换 / 转场(尽管被要求静态机位不换镜头),被多指标重罚;论文认为若未来版本更守 prompt,其分数会大幅提升。
分类别(Fig.6):无一类别”已解决”;Spatial IoU(最宽松,只看位置)普遍高于更严的 Spatiotemporal / Weighted-spatial IoU;即便简单的 MSE 也显出真实视频与模型预测的大差距。项目页补充”流体一般好于固体力学”。
视觉真实度(MLLM 2AFC,越接近 50% 越真实):
- Sora = 55.6%(最真实,最难被 Gemini 分辨,显著领先)
- Runway Gen 3 = 74.8%
- VideoPoet (multiframe) = 77.3%
- Lumiere (multiframe) = 86.9%(最容易被识破)
核心相关性结论:视觉真实度与物理理解不相关——Pearson r = −0.46,p = .247(不显著)。Sora 视觉最真实却物理理解最差,直接证明”能生成逼真视频 ≠ 懂物理”。
仓库最新 leaderboard(GDM 官方仓库,重跑并改进过若干细节,数值略高于论文):VideoPoet-mf 29.5% / i2v 20.3%;Lumiere-mf 23.0% / i2v 19.0%;Runway Gen 3 22.8%;SVD 14.8%;Pika 13.0%;Sora 10.0%。后续被 NVIDIA Cosmos3、Magi-1、Wan2.2、Sora2 等新模型持续刷榜(v2v 最高已至 60%+),并衍生出改进 prompt / 指标的 Physics-IQ Verified(Rädsch et al., arXiv 2606.18943)。
创新点与影响
- 首个真实世界(非合成)物理理解视频基准,消除 real-vs-synthetic 分布偏移这一系统性 confound;三视角 + 两遍拍摄给出物理方差这一有原则的性能上限。
- 解耦的四指标(哪 / 何时 / 多少 / 怎么)+ 聚合 Physics-IQ score,比 PSNR/SSIM/FVD/LPIPS 更贴近”物理正确性”(后者只测外观 / 统计 / 感知,不罚物理不可能事件)。
- 关键发现:“visual realism does not imply physical understanding”——两者统计不相关;即便最强模型也远低于方差上限。但部分场景已能解(如 VideoPoet 抹玻璃上的油漆、Runway 往橡皮鸭上倒红液),说明纯观察学部分物理并非不可能。
- 有趣观察:幻觉——Runway 把浸入水中的火柴变出一支被点燃的蜡烛(每帧都高清但时序物理不可能);更强模型的幻觉至少与场景一致(火柴→蜡烛)而非随机。数据集偏见——Lumiere 把红色台球桌自动改成常见的绿色;Sora 常带转场,暗示其训练偏艺术视频。
- 作者自陈局限:所有指标都是代理,无一直接量化物理量;MLLM 指标受底层模型能力限制(Gemini 常能识破生成视频但给出的理由往往是错的);指标偏保守,重罚幻觉 / 镜头移动 / 转场(Sora 因此吃亏),作者认为在浮夸的深度学习领域基准宁可从严。
- 展望:更大模型 + 更大数据能否”解决”物理理解,还是会撞上”不交互就无法进一步理解世界”的天花板,尚无定论;也可能靠推理时算力(多采样)改善——若如此则引出”从模型视角看,现实只是无穷多可能之一?”
- 影响:已成为视频 / 世界模型物理能力的常用评测口径,被 NVIDIA Cosmos、Magi-1 等后续工作直接报告 Physics-IQ 分数,并催生 Physics-IQ Verified 与官方 leaderboard。
原始链接
- 论文(arXiv 2501.09038,WACV 2026):https://arxiv.org/abs/2501.09038
- PDF:https://arxiv.org/pdf/2501.09038
- 项目页:https://physics-iq.github.io/
- 代码 / 数据 / leaderboard(GitHub,google-deepmind):https://github.com/google-deepmind/physics-IQ-benchmark
- 数据集(Google Cloud Storage bucket):https://console.cloud.google.com/storage/browser/physics-iq-benchmark
- 衍生:Physics-IQ Verified(arXiv 2606.18943);leaderboard 亦托管于 https://physics-iq-verified.anates.ai
一手源存档(sources/)
- physics-iq—github-readme — GitHub README 快照(含双 leaderboard、Verified workflow、引用、许可)
- physics-iq—project-page — 项目页快照(摘要、TL;DR、BibTeX、示例列表)
- 论文全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)