一句话定位
VBench-2.0 是 vbench 团队(Shanghai AI Lab + NTU S-Lab)的下一代视频生成评测基准,把评测重心从”表面保真度”(画面美学、时序平滑、基础文本对齐——VBench 已经衡量到饱和)转向”内在保真度”:人体解剖正确性、物理定律遵循、常识推理、创意构图、复杂指令可控性;5 大类拆成 18 个细粒度维度,每个维度绑定专属 VLM/LLM 评测流水线或专用异常检测模型,并用大规模人类偏好标注逐维度验证对齐度。
(版本说明:本文最初 2025-03 挂出 v1,2025-08 更新为 v2(改成 IEEE 期刊格式投稿,新增作者 Lulu Gu),v2 对 Instance Preservation 维度的评测方法做了实质性升级,本页正文与数字以 v2 为准,仅训练超参数等 v2 精简掉但未与之矛盾的细节标注引用自 v1 附录。)
背景与定位
VBench(arXiv:2311.17982)用 16 个维度衡量”生成视频看起来是否真实”(temporal consistency、aesthetic quality、基础 prompt adherence),但作者观察到:随着 Sora、Kling、HunyuanVideo、Veo 2 等模型进步,这些维度已逐渐饱和——模型画面越来越以假乱真,却仍在违反物理规律、编造不合理动作、丢失/重复物体计数、无法维持人体解剖结构。论文把前者称为 superficial faithfulness(表面保真度),后者称为 intrinsic faithfulness(内在保真度),并主张后者才是”视频生成通向世界模型”的下一个前沿——要把视频生成用于 AI 辅助电影制作、具身智能仿真环境,模型必须真正理解并遵循真实世界的物理与常识规律,而不只是”看起来对”。
同期专项基准各管一块:phygenbench(arXiv:2410.05363)只测物理概念理解,T2V-CompBench 只测组合性,StoryEval 只测叙事能力;VBench-2.0 的定位是把这些拆散的专项能力收进一个统一、可复现、经人类对齐验证的评测套件(论文 Table I 对比:VBench-2.0 是首个同时覆盖 Composition/Commonsense/Physics/Human Anatomy/Complex Prompt 五个”内在保真度”细分项的基准)。VBench、VBench++(arXiv:2411.13503,扩展 I2V/长视频/可信度)、VBench-2.0 三代共享同一个 GitHub 仓库(Vchitect/VBench),互为补充而非互相替代——论文结论明确建议”VBench 测表面保真度 + VBench-2.0 测内在保真度”两者并用。
模型架构
VBench-2.0 本身不是生成模型,而是评测方法套件:5 大类 18 个细粒度维度,每个维度绑定一套专属评测 pipeline,统一分两种评测范式(论文式 1-2):
- Text Description Alignment(适合复杂/抽象语义,如多步剧情、微妙人际互动):VLM 先在特定 system prompt 引导下对视频生成聚焦某方面的描述性 caption,再由 LLM 把该 caption 与参考文本(原始 prompt / 预定义答案 / 元数据)比对,输出二元判断(是/否)。公式:
Answer = LLM(VLM(V|S_v), T|S_l)。 - Video-Based Multi-Question Answering:针对可直接视觉核验的单一显著概念,构造多个互补/冗余问题让 VLM 逐一回答(如动态属性维度问:“树叶最初是否主要为红色?""最终是否变为绿色?""颜色是否发生了变化?”),减少偶然误判;按维度设计取平均分或”全对才得分”两种打分方式。
- 默认判别模型(除非维度另有说明):VLM = LLaVA-Video-7B(caption 生成 + 直接 VQA),LLM = Qwen2.5-7B-Instruct(文本对齐判断,仅输出 yes/no)。
专用异常检测模型(论文明确说这类维度目前的通用 VLM/LLM 无法胜任可靠评委,因为真实视频训练数据里没有生成视频常见的异常/非自然实体状态,且 VLM 本身在物体计数、3D 理解上表现欠佳):
- Human Anatomy:预训练 ViT-base 骨干 + 分类头(
cls_token过 MLP 输出二分类),训练 3 个独立检测器分别针对人体躯干、手部、面部异常;推理时先用 YOLO-World 检测视频中所有人体实例,再检测手/脸并抠 patch 送入对应检测器,只要三者之一判为异常即标记该人体异常,最终得分 = 未被标记异常的帧占比。 - Instance Preservation(v2 版方法,相较 v1 版”YOLO-World 逐帧计数”是实质性升级):基于 Qwen2.5-VL-3B-Instruct 微调出的 clip 级实体异常检测器,用多选题格式让 VLM 判断给定片段是否包含实体突然合并/分裂/出现/消失等异常(A=是/B=否),一段视频只有所有 clip 都判定正常才得 1 分;训练数据混合真实视频与生成视频(采样自 CogVideo、HunyuanVideo、Wan2.1、StepVideo 并人工标注异常样本),用 LoRA 微调以保持泛化能力,避免过拟合到有限规模的生成视频训练数据。
- Geometry / Multi-View Consistency:SIFT 提取逐帧关键点特征 → FLANN 跨帧匹配 → RANSAC 剔除误匹配 → RAFT 估计相机运动速度,按运动强度和帧率动态调整特征匹配的跨帧间隔(因无法获得生成视频的显式 3D ground truth,用两个 2D 指标——特征匹配稳定度 + 相机运动速度——模拟 3D 一致性)。
- Camera Motion:把 VBench++ 的相机运动分类法扩展到九类(新增 “Orbit” 与 “Oblique shot, airborne dolly movement” 两类),用 CoTracker-v2 做点跟踪 + 定制启发式规则判定(不同相机运动在跟踪点上呈现不同规律,如 pan left 会让所有点整体右移)。
5 大类 → 18 维度映射(论文 + GitHub Total Score 公式):
- Human Fidelity = avg(Human Anatomy, Human Clothes, Human Identity)
- Creativity = avg(Diversity, Composition)
- Controllability = avg(Dynamic Spatial Relationship, Dynamic Attribute, Motion Order Understanding, Human Interaction, Complex Landscape, Complex Plot, Camera Motion)
- Physics = avg(Mechanics, Thermotics, Material, Multi-View Consistency)
- Commonsense = avg(Motion Rationality, Instance Preservation)
- Total Score = 0.2 × (以上五个 Score 之和)(该加权公式来自 GitHub 仓库
scripts/cal_final_score.py说明,论文正文未给出显式权重公式)
数据
- Prompt Suite:每个维度约 70 条专属 prompt(18 维 × ~70 ≈ 1260 条),刻意做”解耦设计”——如 Dynamic Spatial Relationship / Dynamic Attribute 每条 prompt 只允许一个实体移动或改变一个属性,避免多物体交互能力干扰单一能力的测量;Human Interaction 只选物理接触类交互(如”握手”)而非难以视觉核验的模糊社交场景(如”野餐”);Motion Rationality 的反例专挑视觉上可核验的失败模式(假吃饭食物不变、假走路不前进、假切割物体不裂开),排除口型同步等难以视觉判定的情形。
- Physics(State Change):基于 Mechanics(如重力、浮力、应力)、Thermotics(如汽化、冰冻,并额外加入基于材料熔点/沸点/凝固点的具体温度约束,如”-90°C 干冰升华延时摄影”提高难度)、Material(如色彩混合、溶解性)三类设计 prompt。
- Multi-View Consistency:prompt 覆盖物体级与场景级双重结构。
- Diversity:给定一条 prompt,从模型采样 20 段视频,用基于 VGG-19 特征的 style/content diversity 指标衡量组内差异(该维度本身的 prompt 数量:v1 版附录称从其余维度精选约 10 条 prompt 专测多样性,v2 版正文未重复该细节)。
- Complex Plot:prompt 描述五幕多阶段叙事(150+ 字),人工拆分为 5 条剧情要素作为 ground truth,逐条匹配视频 caption 中出现的剧情元素,按匹配到的元素数离散化打分。
- Human Anatomy 异常检测训练数据:真实样本约 1,000 段网络人体运动视频(YOLO-World 提取人体/手部/面部 patch 作正样本);生成样本用 CogVideo + HunyuanVideo 生成约 1,000 段人体运动视频,YOLO-World 提取 patch 后人工精细标注;负样本采自 HumanRefiner 数据集。三个检测器合计训练样本约 150K 帧级真实+生成人体数据(v1 版论文附录进一步给出人体/手部/面部三个检测器各自训练样本量约 80K / 30K / 40K,v2 版正文未重复此细分但检测器设计本身未变)。
- Instance Preservation 训练数据:正常样本采自与 prompt 主题一致的真实视频,异常样本采样多个生成模型(CogVideo、HunyuanVideo、Wan2.1、StepVideo)并人工标注,虚拟+真实数据混合训练以缩小 sim-to-real 差距。
- 人类偏好标注:延续 VBench 范式——每条 prompt、4 个被评测模型采样 5 组视频,每组 4 视频两两配对产生 6 对比较(
(A,B) (A,C) (A,D) (B,C) (B,D) (C,D)),标注顺序随机化消偏;质量保证抽检 20% 标注对,要求成功率 ≥95%;累计投入 15.75 人时 + 284 小时 / 18 名标注员的标注工时;部分维度(涉及内容分布对比,如 Diversity)标注格式改为每组 20 段视频两组对比。 - 无 sim-to-real、无跨模态 co-training——VBench-2.0 本身不训练生成模型,只标注/评测四个待评模型生成的视频。
训练方法
VBench-2.0 自身不训练生成模型;“训练”仅体现在两个专用异常检测器上:
- Human Anatomy 检测器:ViT-base 骨干 + MLP 分类头(v1 版附录给出超参数:batch size 128、学习率 1×10⁻⁴、AdamW、30 epochs、用 focal loss 缓解正负样本不均衡;v2 版正文未重复这些超参数)。
- Instance Preservation 检测器:基于 Qwen2.5-VL-3B-Instruct,用 LoRA 微调(避免全参微调在有限规模生成视频数据上过拟合、丧失对更长视频的泛化能力),多选题格式输出片段级异常判断。
- 人类对齐验证方法:对每个维度分别计算 4 个模型的 win ratio(VBench-2.0 自动打分口径 vs. 人类标注口径),线性拟合并计算相关系数(详见评测部分)。
- Prompt Refiner:对 Kling 1.6、HunyuanVideo、CogVideoX-1.5 三个模型统一套用改造自 CogVideoX 的 Prompt Refiner 预处理输入文本(Sora 未套用,作者推测 Sora 内部可能自带隐式 prompt 优化)。
- 方法论取舍(v2 新增 “Challenge, Current Solution and Future Work” 讨论):作者明确指出 fine-tuning-based 异常检测方法容易在有限规模生成数据上过拟合,且当前生成视频普遍不到 10 秒,微调出的模型难以泛化到未来更长视频;因此对大多数维度采用 non-fine-tuning 路线——把复杂问题拆解为 VLM 可理解的多个视觉现象 + 冗余提问,只在需要高层理解的维度接入 LLM;只有 Human Anatomy、Instance Preservation 这类”训练数据里没有异常样本、必须靠专家模型补位”的维度才引入微调的专用异常检测器。
- 无 RL、无 action tokenization(VBench-2.0 本身不是生成式模型)。
Infra(训练 / 推理工程)
- 异常检测器训练硬件:论文未披露具体 GPU 型号/数量/训练时长。
- 评测侧算力:GitHub
evaluate.sh原生支持 18 个维度分配到最多 8 张 GPU 并行评测(一维度一卡);单次评测总耗时未披露。 - 被评测的 4 个模型采样设置(论文 Table III + 正文):
| 模型 | 视频时长 | 分辨率 | 帧率 |
|---|---|---|---|
| HunyuanVideo | 5.3s(129 帧) | 720×1280 | 24 FPS |
| CogVideoX-1.5(5B 版) | 10.1s(161 帧) | 768×1360 | 16 FPS |
| Sora-480p | 5.0s(150 帧) | 480×854 | 30 FPS |
| Kling 1.6(标准 API 版) | 10.0s(241 帧) | 720×1280 | 24 FPS |
论文提到 HunyuanVideo、CogVideoX-1.5 这类模型单条视频采样耗时可超过 5 分钟(8×A100 GPU),这也是论文把每维度 prompt 数压到约 70 条(而非更大规模)的直接原因。
- 推理 FPS / 控制频率:不适用——VBench-2.0 是离线评测工具,不涉及实时推理或控制回路。
评测 benchmark
Table II(论文一手结果,v2 版数字):4 个 SOTA 视频生成模型在 18 个维度上的得分(%)——
Human Fidelity / Creativity / Physics 组:
| 维度 | HunyuanVideo | CogVideoX-1.5 | Sora-480p | Kling 1.6 |
|---|---|---|---|---|
| Human Anatomy | 88.58 | 59.72 | 86.45 | 86.99 |
| Human Clothes | 82.97 | 87.18 | 98.15 | 91.75 |
| Human Identity | 75.67 | 69.51 | 78.57 | 71.95 |
| Composition | 43.96 | 44.70 | 53.65 | 43.89 |
| Diversity | 39.73 | 42.61 | 67.48 | 53.26 |
| Mechanics | 76.09 | 80.80 | 62.22 | 65.55 |
| Material | 64.37 | 83.19 | 64.94 | 68.00 |
| Thermotics | 56.52 | 67.13 | 43.36 | 59.46 |
| Multi-View Consistency | 43.80 | 21.79 | 58.22 | 64.38 |
Controllability / Commonsense 组:
| 维度 | HunyuanVideo | CogVideoX-1.5 | Sora-480p | Kling 1.6 |
|---|---|---|---|---|
| Dynamic Spatial Relationship | 21.26 | 19.32 | 19.81 | 20.77 |
| Dynamic Attribute | 22.71 | 24.18 | 8.06 | 19.41 |
| Motion Order Understanding | 26.94 | 26.60 | 15.15 | 29.29 |
| Human Interaction | 66.67 | 72.33 | 58.00 | 72.00 |
| Complex Landscape | 18.89 | 20.00 | 15.33 | 17.33 |
| Complex Plot | 9.78 | 11.21 | 11.11 | 10.83 |
| Camera Motion | 33.95 | 33.33 | 27.16 | 61.73 |
| Motion Rationality | 34.48 | 33.91 | 34.48 | 38.51 |
| Instance Preservation | 92.40 | 82.46 | 94.15 | 92.40 |
(v1 旧版论文的 Motion Order Understanding/Human Interaction/Complex Landscape/Complex Plot/Instance Preservation 五列数字与上表略有出入,尤以 Instance Preservation 差异最大——v1 用 YOLO-World 帧级计数,得分普遍在 73-76%;v2 换成 Qwen2.5-VL-3B 的 clip 级异常检测器后普遍升到 82-94%,本页以 v2 为准。)
关键观察(论文 V-A/V-B):Sora 在 Human Fidelity/Creativity 强、Controllability/Physics/Commonsense 弱;Kling 1.6 各维度较均衡,Commonsense/Controllability/相机相关维度强;CogVideoX-1.5 在 Complex Landscape/Plot 与 Physics 强,但 Human Fidelity/Motion Rationality 弱;HunyuanVideo 整体偏弱但 Human Fidelity/Motion Rationality 强。所有 4 个模型在 Dynamic Spatial Relationship / Dynamic Attribute(约 80% 失败率)与 Complex Plot(约 10-11 分,满分 100)上普遍表现极差——前者归因于视频生成训练数据的 captioning 粒度不足以描述属性/位置的时序演变,后者归因于当前基础模型普遍只能生成 10 秒以内单镜头视频、难以承载多场景叙事。
人类对齐验证(Table IV,论文一手数值,“Correlation” 为各维度上 VBench-2.0 win ratio 与人类 win ratio 的相关系数):18 个维度全部对齐良好,多数 >90%—— Human Anatomy 95.46%、Human Clothes 90.89%、Human Identity 99.46%、Composition 81.70%(全场最低)、Diversity 94.53%、Mechanics 93.56%、Material 93.71%、Thermotics 93.86%、Multi-View Consistency 98.44%、Dynamic Spatial Relationship 97.36%、Dynamic Attribute 90.95%、Motion Order Understanding 99.31%、Human Interaction 89.28%、Complex Landscape 91.82%、Complex Plot 89.59%、Camera Motion 97.95%、Motion Rationality 87.97%(次低)、Instance Preservation 99.11%。
Prompt Engineering 洞察(V-C):Creativity vs. Controllability 存在权衡(Sora 创意强但可控性弱,其余三模型相反,作者推测其余模型的 Prompt Refiner 以牺牲多样性换取可控性);除 Sora 外,套用统一 Prompt Refiner 的模型在 Physics 维度表现均不差,说明”物理推理”的瓶颈可能更多在文本-视频对齐精度而非模型本身缺乏物理直觉;Human Fidelity/Camera Motion/Geometry/Commonsense 这类依赖模型内在视觉理解与先验知识的维度,不同 Prompt Refiner 之间无明显影响。
创新点与影响
- 首次把”内在保真度”系统化拆解为可复现、经人类对齐验证的 18 维度评测框架:区别于此前专项基准(PhyGenBench 只测物理、T2V-CompBench 只测组合性、StoryEval 只测叙事),VBench-2.0 是首个同时覆盖 Human Anatomy/Physics/Commonsense/Creativity/Complex Prompt 五类”内在保真度”的统一基准(论文 Table I)。
- 改进物理评测方法论:相比 PhyGenBench 依赖抽象物理术语(如”微重力环境”)让 VLM 做四选一,VBench-2.0 改用 GPT-4o 生成纯视觉可描述的物理现象文本(如”液体漂浮并形成气泡状”),并加入 pre-filtering 步骤排除初始状态就不符合 prompt 的无效样本。
- 开源人体异常检测与实体异常检测两套训练管线(含开源的人工标注数据集),可直接用作生成模型微调的反馈信号,而不仅是评测工具。
- 揭示”表面保真度 ≠ 内在保真度”的系统性错位(V-D):如 CogVideoX 在 VBench-2.0 多数维度表现不错,但 VBench 视觉质量分明显低于 Sora/HunyuanVideo;反之 HunyuanVideo 视觉质量出色,但在多个结构驱动维度(VBench-2.0)上仍有明显差距——提醒社区不能只用画面美学判断模型优劣。
- v2 新增的方法论反思(V-E “Challenge, Current Solution and Future Work”):作者坦言 Human Anatomy、Motion Rationality 这类维度当前的大模型(VLM/LLM)本身无法胜任可靠评委,根源有二——训练数据缺口(真实视频训练数据不含生成视频常见的异常状态)与能力局限(VLM 物体计数、3D 理解弱);并指出 fine-tuning 类专家模型虽准确率高,但容易过拟合到当前”不到 10 秒”的生成视频规模、难以泛化到未来更长视频,因此多数维度选择 non-fine-tuning 路线(拆解视觉现象 + 冗余提问 + 关键处接 LLM)。作者展望未来应有统一的 clip 级异常检测大模型、以及更彻底评估现有模型对物理规律和 3D 场景理解的下一代评测方法。
- 作者自陈局限(论文 Conclusion):截至发布时仅评测 4 个模型(Kling 1.6、Sora-480p、HunyuanVideo、CogVideoX-1.5),计划随新模型开源持续扩充(GitHub 仓库后续更新显示评测集已扩展到 6 个模型,但那是论文之外的仓库维护动作,非论文本身数字)。潜在负面社会影响部分:VBench-2.0 本身不生成视频,但评测过程不可避免涉及处理生成内容,作者强调随着生成模型能力增强需重视安全与伦理问题。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2503.21755
- arXiv PDF(默认指向最新 v2):https://arxiv.org/pdf/2503.21755
- arXiv v1 全文(2025-03,含 v2 已删减的附录 G/H/I/J 细节):https://arxiv.org/abs/2503.21755v1
- 项目主页:https://vchitect.github.io/VBench-2.0-project/
- GitHub(VBench/VBench++/VBench-2.0 monorepo,VBench-2.0 代码位于
VBench-2.0子目录):https://github.com/Vchitect/VBench/tree/master/VBench-2.0 - HuggingFace Leaderboard:https://huggingface.co/spaces/Vchitect/VBench_Leaderboard
- VBench-2.0 Arena(生成视频可视化 + 人类投票):https://huggingface.co/spaces/Vchitect/VBench2.0_Video_Arena
- 前作:vbench(arXiv:2311.17982);VBench++(TPAMI 2025)https://arxiv.org/abs/2411.13503
- 相关专项基准:phygenbench(arXiv:2410.05363,被本文在物理评测方法上直接扩展)
一手源存档(sources/)
- vbench-2.0—project-page — 项目主页快照(摘要、作者列表、雷达图说明、BibTeX),来源 https://vchitect.github.io/VBench-2.0-project/
- vbench-2.0—github-readme — GitHub README 快照(VBench-2.0 子目录 README 全文 + 父仓库 monorepo 概览,含 Total Score 计算公式、安装/使用说明、changelog、依赖工具列表),来源 https://github.com/Vchitect/VBench/tree/master/VBench-2.0
- 论文全文:arXiv:2503.21755(arXiv 原文 PDF,不入 git;正文数字以 v2(2025-08 修订,IEEE 期刊格式)全文为准,含 Table I-IV、附录级方法细节;部分 v2 精简掉但未与之矛盾的训练超参数取自 v1(2025-03)版附录 G.4,已在正文标注)