一句话定位
VideoPhy-2 是 videophy 的升级版——把评测对象从”材质交互”换成197 个真实世界动作(打网球、后空翻、掰断一根木棍……),配 3940 条 LLM 生成 caption、6800 段生成视频、10.2 万条人工标注,逼着 7 个主流文生视频模型交卷。结果依然刺眼:最好的 Wan2.1-14B 在全集上联合达标(语义遵循 SA≥4 且物理合理 PC≥4)也只有 32.6%,切到专挑弱点造出来的 hard 子集直接腰斩到 22%(论文摘要口径,Wan2.1 本身 21.9%)。细粒度分析显示模型最不擅长的是动量与质量守恒类物理定律。论文同时把评测蒸馏进一个 7B 自动评估器 VideoPhy-2-AutoEval,多任务打分 SA/PC/物理规则遵循度。ICLR 2026 收录。
背景与定位
Sora、luma-ray2、Wan2.1 这类模型被包装成”世界模拟器”的候选,但 videophy(2024-06)已经证明它们在材质交互上离及格线很远。VideoPhy-2 要回答的问题更进一步:换成人类真实动作(体育、物体操作),评测更长、更复杂、多事件的 caption 时,模型表现是否依旧糟糕?
论文明确对标三条已有路线并指出各自的短板:
- physics-iq:拿真实视频前几帧续写,跟真实视频后续帧比相似度——只能测视频续写而非开放式文生视频,且难扩展到多事件复杂场景;
- phygenbench:160 条人工设计 prompt,规模小、且强行把一条 prompt 绑死一条物理定律(“石头放水面”→浮力),但真实物理往往多定律交织,其自动评测 PhyGenEval 依赖顺序调用 VLM,易不一致;
- WorldSimBench:拿数值解算器去对齐视频模型输出,存在 sim-to-real gap。
VideoPhy-2 的解法:动作为中心(action-centric)+ 纯真实世界视频(不用仿真引擎)+ 5 级李克特量表 + 显式物理规则标注,并且延续 VideoPhy 的自动评估器路线,把评测规模化。范式命名:action-centric physical-commonsense benchmark,是”生成方 vs 评测方”对照谱系里 videophy 之后的第二块基石,姊妹篇是同期的 cosmos-predict 一类物理世界生成模型。
模型架构
本文核心产出是数据集构造流水线 + 自动评估器,不提出新的视频生成架构:
数据集构造(4 阶段流水线)
- Stage 1(种子动作):从 Kinetics、UCF-101、SSv2 汇总 600+ 候选动作,两组具 STEM 背景的学生作者独立标注”是否适合测物理常识”,交集后剩 232 个,再用 Gemini-2.0-Flash-Exp 去重语义重复,定稿 197 个动作(143 个体育/身体活动 + 54 个物体交互)。
- Stage 2(LLM 生成 prompt):Gemini-2.0-Flash-Exp 为每个动作独立生成 20 条 prompt,要求聚焦”可视觉落地的物理交互”、排除情绪/嗅觉等非视觉细节、鼓励多事件长句(如”弓箭手拉满弓再松开,箭直线飞行命中靶心”而非简单的”弓箭手射箭”),共得 3940 条 caption;同时用 Cosmos 的 Mistral-NeMo-12B-Instruct prompt-upsampler 把原始 caption 扩写成更长的 dense caption。
- Stage 3(候选物理规则生成):不直接从文本 prompt 推物理规则(因为模型语义遵循本就不稳),而是先用待测模型生成视频,再用 Gemini-2.0-Flash-Exp 给视频生成 caption,最后基于视频 caption 生成 3 条候选物理规则/定律;人工标注阶段还允许标注员补充规则外的违例。
- Stage 4(hard 子集构造):用 CogVideoX-5B 生成全部 caption 对应视频,挑出该模型联合表现为 0 的 60 个动作(如铁饼投掷动量传递、走钢丝平衡、后空滚翻等复杂动作/状态变化),对应 1200 条 prompt,作为 hard 子集——这一”模型辅助选难例”策略类比 Humanity’s Last Exam、ZeroBench。
评测指标:SA(语义遵循)与 PC(物理合理性)各自独立打 1-5 分(区别于 videophy 把二者合成单任务,本文认为让标注员同时看 prompt 判断 PC 会引入偏差,故拆成两个独立任务);PR(物理规则)三分类:违反(0) / 遵循(1) / 无法判定(2)。主指标为联合表现(SA≥4 且 PC≥4 的视频占比),不用后验 PC|SA 分数(防止”1000 条只对 1 条却 100% 后验”的博弈)。
VideoPhy-2-AutoEval(7B):以 videophy 的 VideoCon-Physics(本身建在 VideoCon/mPLUG-Owl-Video/LLaMA-7B-video 之上)为基座,用 LoRA 继续微调成一个共享骨干的多任务模型,同时输出 SA 分数(1-5)、PC 分数(1-5)、物理规则分类(0/1/2),三任务共享骨干以实现知识迁移。
数据
- 动作 & caption 规模:197 个动作、3940 条 caption(比 videophy 的 688 条多 5.72×),原始 caption 平均 16 词、upsample 后 138 词(分别是 VideoPhy 的 1.88× 与 16.2×)。
- 动作类别:体育/身体活动 143 个、物体交互 54 个;hard 子集 60 个动作 / 1200 条 prompt。
- 生成视频规模:对 7 个待测 T2V 模型共生成 6800 段视频。
- 人工标注总量:102K 条(基准测试集 + AutoEval 训练集合计)。基准测试阶段收集 SA 10.2K / PC 10.2K / PR 30.6K,标注花费 $2600;AutoEval 训练集另收集约 50K 条标注,花费 $3515。标注员:Amazon Mechanical Turk 12 人,$18/小时,通过资质测试;每段视频 3 人标注取多数票/平均后四舍五入,标注者一致性 75%-80%。
- train/test 切分:test 590 条 prompt(197 动作 × 3 caption/动作),用于基准评测;train 3350 条 prompt(197 动作 × 17 caption/动作),用于训练 AutoEval——从 3350 条中每条采样 HunyuanVideo-13B / Cosmos-Diffusion-7B / CogVideoX-5B 三个”较强”模型之一生成的 1 段视频标注。
- 待测模型生成量:除 Sora、Ray2 外每模型 590 段视频;Sora 因无官方 API,人工用 Sora 网页版随机抽 60 条生成;Ray2 因 API 预算有限只生成 394 段(每动作 2 条 caption)。
- 物理规则来源:不从文本 prompt 直接推导(防止规则脱离实际生成内容),而是”先给生成视频配 caption,再从视频 caption 推物理规则”的两步法;人工标注阶段可补充规则库之外的违例,并用 Gemini-2.0-Flash-Exp 转写成规范化的规则陈述。
- 相关性检验(Table 3,Pearson):SA/PC 与美学分(LAION 分类器)、运动质量(RAFT 光流)几乎不相关(SA-美学 0.1、SA-运动 0.02;PC-美学 0.09、PC-运动 0.002;PC-SA 0.14)——说明”堆美学/运动质量”刷不动这个基准。
训练方法
- 视频生成端:本文不训练视频生成模型,只是标准化地调用 7 个现成 T2V 模型(开源 CogVideoX-5B、VideoCrafter2、HunyuanVideo-13B、Cosmos-Diffusion-7B、Wan2.1-14B;闭源 Sora、Luma Ray2)生成短视频(<6s),除受限于 CLIP 77-token 上限的 HunyuanVideo-13B、VideoCrafter2 外均使用 upsample 后的长 caption。
- VideoPhy-2-AutoEval 微调:以 VideoCon-Physics(7B)为基座做 LoRA 微调,覆盖全部 Transformer block 的 QKVO + gate/up/down 权重矩阵,r=α=32、dropout=0.05;训 3 epoch,取验证集最优 checkpoint;Adam 优化器,50 步线性 warmup 后线性衰减;对峰值学习率做网格搜索 {5e-5, 1e-4, 5e-4, 1e-3},选中 5e-4 效果最好。
- 多任务联合训练:SA、PC、物理规则分类三任务共享同一骨干联合训练(而非分任务单独训),以实现任务间知识迁移。
Infra(训练 / 推理工程)
- VideoPhy-2-AutoEval 训练硬件:4 张 Nvidia A6000 GPU,全局 batch size 64;GPU-hours、训练精度(bf16/fp16/fp32)未披露。
- AutoEval 推理:未披露具体 FPS/延迟/吞吐。
- 被测视频生成模型的推理配置(Table 8,用于产出待评视频,非本文训练;仅覆盖 5 个自托管开源模型,Sora/Ray2 走网页/API 未披露具体推理参数):
| 模型 | Caption 类型 | FPS(时长) | 分辨率 | 帧数 | Guidance Scale | 采样步数 | Scheduler | 精度 |
|---|---|---|---|---|---|---|---|---|
| Wan2.1-14B | Upsampled | 16 (4s) | 832×480 | 61 | 5 | 50 | FlowUniPCMultistepScheduler | bf16 |
| CogVideoX-5B | Upsampled | 8 (6s) | 480×720 | 49 | 6 | 50 | CogVideoXDPMScheduler | bf16 |
| Cosmos-Diffusion-7B | Upsampled | 24 (5s) | 576×576 | 120 | 7 | 60 | - | bf16 |
| HunyuanVideo-13B | Original(≤77 token) | 15 (4s) | 320×512 | 61 | 6 | 50 | FlowMatchEulerDiscreteScheduler | fp16 |
| VideoCrafter2-1.4B | Original(≤77 token) | 10 (3s) | 320×512 | 32 | 12 | 50 | DDIM | fp32 |
评测 benchmark
人工评测主结果(Table 2,联合表现 % = SA≥4 且 PC≥4;All / Hard / PA 体育 / OI 物体交互)
| 模型 | 类型 | All | Hard | PA | OI |
|---|---|---|---|---|---|
| Wan2.1-14B | 开源 | 32.6 | 21.9 | 31.5 | 36.2 |
| CogVideoX-5B | 开源 | 25.0 | 0.0 | 24.6 | 26.1 |
| Cosmos-Diffusion-7B | 开源 | 24.1 | 10.9 | 22.6 | 27.4 |
| Sora | 闭源* | 23.3 | 5.3 | 22.2 | 26.7 |
| Ray2 | 闭源 | 20.3 | 8.3 | 21.0 | 18.5 |
| HunyuanVideo-13B | 开源 | 17.2 | 6.2 | 17.6 | 15.9 |
| VideoCrafter-2 | 开源 | 10.5 | 2.9 | 10.1 | 13.1 |
* Sora 仅在 60 条随机子集(网页版人工生成)上评测。
- Wan2.1-14B 全面登顶,作者归因于其多模态训练数据的多样性与强运动过滤,能在更多样的动作上保持视频质量。
- 闭源不代表更强:Ray2 全面落后于 Wan2.1、CogVideoX-5B 两个开源模型。
- Cosmos-Diffusion-7B 在 hard 子集拿到第二(10.9%),反超参数更大的 HunyuanVideo-13B——作者推测与其训练数据里人类动作、合成仿真数据占比高有关。
- 体育活动(PA)普遍比物体交互(OI)更难,各模型在 PA 上得分系统性低于 OI,作者建议后续数据构建应加强体育视频采集。
- 物理定律细粒度违反分析(Figure 5):动量守恒(线动量/角动量)与质量守恒是最常被违反的定律,违反率约 40%;相对地,反射与浮力相关规则违反率低于 20%,属于模型”相对掌握”的部分。
VideoPhy-2-AutoEval 效果(对比基线:VideoCon-Physics、VideoCon、VideoLlava、VideoScore、Gemini-2.0-Flash-Exp)
- 打分相关性(Table 4,Pearson×100,unseen prompts / unseen video models):VideoPhy-2-AutoEval 平均 42.0 / 41.0(SA 47.0/45.0,PC 37.0/37.0),相对最优基线 VideoCon-Physics(28.5/26.5)提升 +47.4% / +49.0%;相对 Gemini-2.0-Flash-Exp(18.5/21.0)提升 +127.0% / +107.1%(PC 维度提升最猛,达 +236.4% / +281.8%)。
- 联合分数判断(Table 5,Acc/F1):unseen prompts 平均 65.1(Acc 79.1,F1 51.1)vs VideoCon-Physics 39.1(Acc 75.6,F1 2.6,说明基线几乎判不出”物理不合格”的正例),相对提升 +66.4%;unseen video models 平均 62.8 vs 39.6,提升 +49.1%。
- 物理规则三分类准确率(Table 6):VideoPhy-2-AutoEval 在 unseen prompts / unseen video models 上分别达 78.7% / 72.9%,相对 Gemini-2.0-Flash-Exp(59.2%/57.1%,随机基线 34.5%/31.2%)提升 +32.9% / +27.7%。
创新点与影响
- 把物理常识评测从”材质”升级到”动作”:197 个真实世界动作、3940 条多事件长 caption,比 videophy 规模扩大 5.72×、caption 长度扩大最多 16.2×,逼近真实使用场景的复杂度。
- 拆分 SA/PC 为独立标注任务:显式指出”同任务里让标注员同时看 prompt 判物理”会引入偏差,是对 videophy 方法论的直接修正。
- 首次给视频生成引入细粒度、可解释的”物理定律违反率”诊断:不再是笼统的合格/不合格,而是能定位到”模型最不擅长动量/质量守恒”这类具体薄弱环节,为后续训练提供明确改进方向。
- 模型辅助构造 hard 子集:用弱模型(CogVideoX-5B)的失败样本反向筛出对所有模型都难的 60 个动作,类比 Humanity’s Last Exam / ZeroBench 的难例构造思路,让基准难度可持续对抗模型进步。
- VideoPhy-2-AutoEval 把评测规模化:相对 SOTA 通用多模态模型 Gemini-2.0-Flash-Exp 在 PC 判断上有 +236% 的相关性提升,证明”物理常识判断”仍是通用 VLM 的系统性短板,需要专门蒸馏。
- 论文自陈的局限/取舍:Sora 因无 API 只测了 60/590 条子集、Ray2 因预算限制只测 394/590 条,两个闭源模型的分数可能因抽样量小而有误差;标注者一致性 75%-80%,物理合理性判断本身带有主观性;物理规则由 LLM(Gemini-2.0-Flash-Exp)从视频 caption 生成再人工核验,存在”规则可能无法在视频中判定”的 CBD(cannot be determined)类别,说明规则覆盖并非100%精确 grounded。
原始链接
- arXiv 论文:https://arxiv.org/abs/2503.06800 (PDF:https://arxiv.org/pdf/2503.06800)
- 项目主页:https://videophy2.github.io/
- GitHub(VideoPhy-2 子目录,代码/自动评估器推理脚本):https://github.com/Hritikbansal/videophy/tree/main/VIDEOPHY2
- 自动评估器权重 🤗:https://huggingface.co/videophysics/videophy_2_auto
- 训练集 🤗:https://huggingface.co/datasets/videophysics/videophy2_train | 测试集 🤗:https://huggingface.co/datasets/videophysics/videophy2_test
- 前作 VideoPhy:videophy(arXiv 2406.03520)
一手源存档(sources/)
- videophy-2—github-readme — GitHub VIDEOPHY2 子目录 README 快照(人工榜单、AutoEval 安装/推理/训练说明),fetched 2026-07-16
- videophy-2—project-page — 项目主页快照(定性违例示例、榜单、图表说明),fetched 2026-07-16
- videophy-2—hf-card — 自动评估器 HF model card 快照(确认 base_model=videocon_physics、MIT 协议),fetched 2026-07-16
- arXiv 原文全文(HTML v1,2503.06800)已通读,正文 Table 1-6 及附录 A/H/L 数字均取自此;arXiv 原文 PDF,不入 git,见上方 arXiv 链接。