一句话定位

VBench(CVPR 2024 Highlight)是视频生成领域第一套把”生成质量”拆成 16 个解耦细粒度维度、每个维度配专属 prompt 集和专属评测方法、并用大规模人类偏好标注验证过对齐度的评测基准;因为它同时衡量时序一致性、运动质量、画面美学与语义/风格一致性,后来被大量视频世界模型(driving WM、game WM、通用视频生成模型)拿来当”感知保真度”的标准尺子复用。

背景与定位

VBench 出现之前,视频生成评测普遍沿用图像/视频生成的老指标——Inception Score、FID、Fréchet Video Distance(FVD)、CLIPSIM——论文指出这些指标与人类感知不一致;而视频质量评估(VQA)方法又是为真实视频设计的,忽略了生成视频特有的伪影问题。同期的并发工作 EvalCrafter、FETV 也在做视频生成评测,VBench 与它们的三点区别(论文 Related Works):①16 个维度、每维度专属 prompt;②逐维度做人类对齐验证;③同时提供跨维度与跨内容类别(8 类)的洞察。

VBench 不生成视频、不提出新架构,产出形态是基准协议——16 维评测方法套件 + 分维度 prompt 套件 + 人类偏好标注数据集。后续 VBench++(TPAMI 2025,arXiv:2411.13503)把范围扩展到图生视频(VBench-I2V)、长视频(VBench-Long)与可信度(fairness/bias/safety,VBench-Trustworthiness);VBench-2.0(arXiv:2503.21755)进一步把评测重心从”表面保真度”(像素质量、基础文本对齐)转向”内在保真度”(常识推理、物理真实感、人体运动、创意构图),拆成 5 大类 18 个细粒度能力维度,直接对齐世界模型评测的诉求。VBench 系列现已成为视频生成/视频世界模型论文的事实标准评测集,cosmos-predict、driving-WM(如 drive-wm-driving-into-the-future)、game-WM(如 skywork-matrix-game、tencent-hunyuan-gamecraft)等工作普遍引用 VBench 或其子集维度衡量生成视频的感知质量。

模型架构

VBench 本身不是生成模型,而是”评测方法套件”——为 16 个维度中的每一个绑定一个专用打分模型/pipeline:

Video Quality(不看文本对齐,只看视频本身好不好)

  • Temporal Quality(时序质量):
    • Subject Consistency:用 DINO 提取每帧特征,计算与首帧、与前一帧的余弦相似度均值(式 1)。
    • Background Consistency:同法但用 CLIP 图像编码器提取背景特征(式 2)。
    • Temporal Flickering:静态场景视频逐帧算平均绝对误差(MAE),归一化到 [0,1],255 减去后除以 255(式 3-4);用光流估计器(RAFT)过滤保留真正静态的视频。
    • Motion Smoothness:借用视频插帧模型(VFI,AMT)的运动先验——把偶数帧丢掉,用插帧模型重建,与真实丢帧算 MAE,MAE 越小说明真实运动越符合插帧模型假设的线性/二次运动规律。
    • Dynamic Degree:RAFT 估计光流强度,取最大 5% 光流均值判断是否静态,报告非静态视频占比。
  • Frame-Wise Quality(逐帧质量,与时序无关):
    • Aesthetic Quality:LAION Aesthetic Predictor 给每帧 0-10 分,归一化取均值。
    • Imaging Quality:MUSIQ(SPAQ 数据集训练)评估过曝/噪声/模糊等低层失真,归一化到 [0,1]。

Video-Condition Consistency(生成是否符合文本条件)

  • Semantics:Object Class / Multiple Objects(GRiT 检测)、Human Action(UMT,Kinetics-400 分类,top-5 logit>0.85 判定)、Color(GRiT 描述色彩+比对)、Spatial Relationship(GRiT 检测框 + IoU 规则,仿照 T2I-CompBench)、Scene(Tag2Text 场景描述比对)。
  • Style:Appearance Style(CLIP 图文余弦相似度)、Temporal Style(ViCLIP 视频-文本特征相似度,覆盖运镜风格如 zoom in/pan left)。
  • Overall Consistency:ViCLIP 计算通用视频-文本一致性作为辅助指标。

模型/权重全部复用现成开源工具(DINO、CLIP、RAFT、GRiT、Tag2Text、UMT、ViCLIP、AMT、LAION Aesthetic Predictor、MUSIQ),VBench 的贡献在于为每个维度选定专属工具、设计专属 prompt、并验证其与人类感知的对齐度,而非训练新模型。Total Score 计算(README):各维度先按 (score−min)/(max−min) 归一化;Quality Score = {subject/background consistency, temporal flickering, motion smoothness, aesthetic quality, imaging quality, dynamic degree} 加权平均;Semantic Score = {object class, multiple objects, human action, color, spatial relationship, scene, appearance style, temporal style, overall consistency} 加权平均;Total Score = w1·Quality + w2·Semantic(权重见 scripts/constant.py,论文本身未给出具体权重数值)。

数据

  • 分维度 Prompt Suite:16 个维度各自约 100 条专属 prompt,从对应素材库精心筛选/构造(如 Subject Consistency 用 COCO 80 类中挑 19 类可移动物体配动作;Object Class/Multiple Objects/Color/Spatial Relationship 用 COCO 物体类目重新组合;Human Action 从 Kinetics-400 挑 100 个动作互不重叠;Background Consistency/Scene 复用 Places365 场景列表;Temporal Flickering 用静态场景前缀 prompt,并用光流过滤确保真静态)。
  • 分内容类别 Prompt Suite:从互联网收集人类撰写的候选 prompt,用 LLM 做多标签分类(分类模板见 Table A3,人工校验后分类准确率约 95%),最终得到 8 类 × 100 条 = 800 条:Animal、Architecture、Food、Human、Lifestyle、Plant、Scenery、Vehicles。
  • 人类偏好标注:4 个 T2V 模型(LaVie、ModelScope、VideoCrafter、CogVideo)对每条 prompt 各生成一个视频,每条 prompt 采样 5 组共 4 视频,两两配对产生 6 对比较,即一个含 N 条 prompt 的维度产生 N×5×6 次成对人类比较,每次标注三选一(A 更好/B 更好/相同)。
  • 质量保证:五步流程——标注说明准备 → 预标注试跑(60 样本)→ 说明更新 → 标注者自查(每包 60 样本抽查 20%,错误率>10% 整包重标)→ 作者复查(同规则,若仍>10% 则整维度重标)。
  • VLM 微调数据:把 VBench 各维度打分线性映射到 0-10,与人类偏好标签组织成 30,000 条指令数据,用于微调 VideoChat。
  • Empirical Max/Min & WebVid-Avg 参照基线:Empirical Max 从 WebVid-10M 按 CLIP 文本相似度检索每条 prompt 的 top-5 真实视频(2 秒片段、8 FPS 采样)取最高分;Empirical Min 用随机高斯噪声片段(Video-Condition Consistency 维度)或真实视频帧拼接(Video Quality 维度)近似下界;WebVid-Avg 对检索到的 WebVid-10M 视频取各维度平均分,反映训练数据本身的质量水位。
  • 无 sim-to-real、无跨模态 co-training——VBench 本身不训练生成模型,只标注/评测已生成的视频。

训练方法

VBench 不训练生成模型;“训练”仅体现在两处衍生实验:

  • VLM Tuning(用人类偏好标注微调评测用 VLM):以 VideoChat-embed 为基线模型,用上述 30,000 条指令数据微调 3 epoch,学习率 2e-5,batch size 64;微调让 VLM 先通过 Chain-of-Thought 从 prompt 判断该关注哪些维度,再描述视频、再给出该维度 0-10 分。
  • 人类对齐验证方法:对每个维度分别计算 4 个模型的 win ratio(VBench 打分口径 vs. 人类标注口径),线性拟合并算 Spearman 相关系数 ρ;16 个维度全部展示出高相关(详见评测部分)。

无 RL、无 action tokenization(VBench 本身不是生成式模型)。

Infra(训练 / 推理工程)

  • VLM 微调硬件:VideoChat-embed 微调在 8×A100-80GB 上跑,约 1 小时完成 30,000 条指令数据的 3 epoch 训练。
  • 评测侧算力:评测脚本原生支持多卡并行(torchrun --nproc_per_node=${GPUS}vbench evaluate --ngpus=${GPUS}),具体单次评测的 GPU 数、耗时论文/README 均未披露
  • 推理 FPS / 控制频率:不适用——VBench 是离线评测工具,不涉及实时推理或控制回路。
  • 被评测的 4 个 T2V 模型采样设置(附录 J.1,供复现参考):LaVie 采 16 帧 512×512@8FPS,DDPM 250 步,seed=2,cfg=7;ModelScope 采 16 帧 256×256@8FPS;VideoCrafter(0.9/LVDM 版)采 16 帧 256×256@8FPS,seed=2;CogVideo 采 33 帧 480×480@10FPS(含序列生成+插帧+递归插帧全流程,prompt 需先译成中文),seed=2。

评测 benchmark

论文一手结果(Table 1,4 个 T2V 模型在 16 维度上的原始得分,及 Empirical Min/Max 参照):

维度LaVieModelScopeVideoCrafterCogVideoEmpirical MinEmpirical Max
Subject Consistency91.41%89.87%86.24%92.19%14.62%100.00%
Background Consistency97.47%95.29%92.88%95.42%26.15%100.00%
Temporal Flickering98.30%98.28%97.60%97.64%62.93%100.00%
Motion Smoothness96.38%95.79%91.79%96.47%70.60%99.75%
Dynamic Degree49.72%66.39%89.72%42.22%0.00%100.00%
Aesthetic Quality54.94%52.06%44.41%38.18%0.00%100.00%
Imaging Quality61.90%58.57%57.22%41.03%0.00%100.00%
Object Class91.82%82.25%87.34%73.40%0.00%100.00%
Multiple Objects33.32%38.98%25.93%18.11%0.00%100.00%
Human Action96.80%92.40%93.00%78.20%0.00%100.00%
Color86.39%81.72%78.84%79.57%0.00%100.00%
Spatial Relationship34.09%33.68%36.74%18.24%0.00%100.00%
Scene52.69%39.26%43.36%28.24%0.00%82.22%
Appearance Style23.56%23.39%21.57%22.01%0.09%28.55%
Temporal Style25.93%25.37%25.42%7.80%0.00%36.40%
Overall Consistency26.41%25.67%25.21%7.70%0.00%36.40%

人类对齐验证(Figure 5 / Table A5):16 个维度的 Spearman 相关系数 ρ 全部 >0.6,其中 11/16 个维度 >0.9——如 Motion Smoothness ρ=0.9980、Appearance Style ρ=0.9965、Multiple Objects ρ=0.9898、Aesthetic Quality ρ=0.9865、Subject Consistency ρ=0.9651;相对最低的是 Color(ρ=0.6073)与 Object Class(ρ=0.8037),Dynamic Degree(ρ=0.8209)居第三低。额外做了 Temporal Flickering 在三种不同动态程度基准(Dynamic/Semi-Dynamic/Static Benchmark)上的交叉验证,三者之间人类偏好 win ratio 两两相关约 99%,证明该维度排名不受视频动态程度干扰。

T2V vs. T2I(Figure 6a):选取 10 个能涵盖逐帧生成能力的维度,对比 4 个 T2V 模型与 3 个 T2I 模型(SD1.4、SD2.1、SDXL);T2V 模型在 Multiple Objects 与 Spatial Relationship(组合性)上显著落后于 T2I(尤其 SDXL),论文归因于组合能力训练数据不足、以及文本编码器较弱(T2V 常只用 CLIP ViT-L,T2I 用更大/更强的 OpenCLIP ViT-H/G)。

跨内容类别分析(Figure 7 / Table A7):8 类内容中,Human/Vehicle 等运动复杂类别在时序一致性维度上普遍偏低;Food 类别 Aesthetic Quality 得分最高(尽管在 WebVid-10M 中仅占 11% 数据量),而 Human 类别虽在 WebVid-10M 占比最高(26%)却表现最差——论文据此提出”大规模数据集中数据质量可能比数据量更重要”的观察。

leaderboard 演进(GitHub README,非论文本身):2024/08 leaderboard 已有 28 个 T2V + 12 个 I2V 模型;2024/09 增至 40 个 T2V(含长视频)模型、10 个长视频模型专属 leaderboard;2025/01 VBench Arena 上线,收录超过 180,000 条生成视频、支持 40 个模型的人类投票对比;当前 leaderboard 已纳入 Gen-3、Kling、Pika 等闭源商业模型(README 原文引导用户直接查 HuggingFace Leaderboard 获取最新数值,论文本身的 4 模型评测仅为 2023 年发布时的快照)。

创新点与影响

  • 首个把”视频生成质量”正式拆解为 16 个解耦维度并逐一验证人类对齐度的评测框架:相比 FVD/CLIPSIM 等单一数字指标,能同时暴露模型在时序一致性 vs. 动态程度之间的权衡(论文观察:擅长时序一致性的模型常常动态程度低,反之亦然),为后续架构/数据决策提供细粒度反馈而非笼统分数。
  • 人类偏好标注数据集全开源:不仅验证 VBench 自身,还被作者用于微调 VideoChat 提升其视频生成评测能力,展示了标注数据的二次利用价值。
  • 分内容类别评测揭示模型能力的隐藏分布不均——例如 CogVideo 在 Food 类别的美学表现远好于其整体平均分,提示”整体分数掩盖类别级强项”。
  • 长期演进为系列标准:VBench→VBench++(I2V/长视频/可信度)→VBench-2.0(内在保真度:常识推理、物理真实感、人体运动、创意构图),持续被视频世界模型/驾驶世界模型/游戏世界模型论文引用作为感知质量的标准评测集,客观上推动了”评测维度可解耦、可复现、可对齐人类”成为该领域的方法论共识。
  • 作者自陈局限(论文 Conclusion “Limitations and Future Work”):截至发布时仅评测 4 个开源 T2V 模型,计划随更多模型开源持续扩充;评测任务当时局限于文本到视频,作者明确提出未来要扩展到图生视频等任务(后续由 VBench++ 落实)。潜在负面社会影响部分作者也坦言:VBench 当前不评测安全性与公平性维度,提醒用户对开源视频生成模型保持谨慎(这一空白后续由 VBench-Trustworthiness 补上)。

原始链接

一手源存档(sources/)

  • vbench—github-readme — GitHub README 快照(VBench/VBench++/VBench-2.0 三代概览、Total Score 计算公式、leaderboard 演进时间线、依赖工具列表),来源 https://github.com/Vchitect/VBench
  • vbench—project-page — 项目主页快照(摘要、可视化图表说明、关联项目 Evaluation Agent),来源 https://vchitect.github.io/VBench-project/
  • 论文全文:arXiv:2311.17982(arXiv 原文 PDF,不入 git;正文数字取自 arXiv PDF 全文,含附录 G/H/I/J 关于评测方法公式、prompt 设计细节、人类标注流程与 VLM 微调实现细节)