一句话定位
VBench(CVPR 2024 Highlight)是视频生成领域第一套把”生成质量”拆成 16 个解耦细粒度维度、每个维度配专属 prompt 集和专属评测方法、并用大规模人类偏好标注验证过对齐度的评测基准;因为它同时衡量时序一致性、运动质量、画面美学与语义/风格一致性,后来被大量视频世界模型(driving WM、game WM、通用视频生成模型)拿来当”感知保真度”的标准尺子复用。
背景与定位
VBench 出现之前,视频生成评测普遍沿用图像/视频生成的老指标——Inception Score、FID、Fréchet Video Distance(FVD)、CLIPSIM——论文指出这些指标与人类感知不一致;而视频质量评估(VQA)方法又是为真实视频设计的,忽略了生成视频特有的伪影问题。同期的并发工作 EvalCrafter、FETV 也在做视频生成评测,VBench 与它们的三点区别(论文 Related Works):①16 个维度、每维度专属 prompt;②逐维度做人类对齐验证;③同时提供跨维度与跨内容类别(8 类)的洞察。
VBench 不生成视频、不提出新架构,产出形态是基准协议——16 维评测方法套件 + 分维度 prompt 套件 + 人类偏好标注数据集。后续 VBench++(TPAMI 2025,arXiv:2411.13503)把范围扩展到图生视频(VBench-I2V)、长视频(VBench-Long)与可信度(fairness/bias/safety,VBench-Trustworthiness);VBench-2.0(arXiv:2503.21755)进一步把评测重心从”表面保真度”(像素质量、基础文本对齐)转向”内在保真度”(常识推理、物理真实感、人体运动、创意构图),拆成 5 大类 18 个细粒度能力维度,直接对齐世界模型评测的诉求。VBench 系列现已成为视频生成/视频世界模型论文的事实标准评测集,cosmos-predict、driving-WM(如 drive-wm-driving-into-the-future)、game-WM(如 skywork-matrix-game、tencent-hunyuan-gamecraft)等工作普遍引用 VBench 或其子集维度衡量生成视频的感知质量。
模型架构
VBench 本身不是生成模型,而是”评测方法套件”——为 16 个维度中的每一个绑定一个专用打分模型/pipeline:
Video Quality(不看文本对齐,只看视频本身好不好)
- Temporal Quality(时序质量):
- Subject Consistency:用 DINO 提取每帧特征,计算与首帧、与前一帧的余弦相似度均值(式 1)。
- Background Consistency:同法但用 CLIP 图像编码器提取背景特征(式 2)。
- Temporal Flickering:静态场景视频逐帧算平均绝对误差(MAE),归一化到 [0,1],255 减去后除以 255(式 3-4);用光流估计器(RAFT)过滤保留真正静态的视频。
- Motion Smoothness:借用视频插帧模型(VFI,AMT)的运动先验——把偶数帧丢掉,用插帧模型重建,与真实丢帧算 MAE,MAE 越小说明真实运动越符合插帧模型假设的线性/二次运动规律。
- Dynamic Degree:RAFT 估计光流强度,取最大 5% 光流均值判断是否静态,报告非静态视频占比。
- Frame-Wise Quality(逐帧质量,与时序无关):
- Aesthetic Quality:LAION Aesthetic Predictor 给每帧 0-10 分,归一化取均值。
- Imaging Quality:MUSIQ(SPAQ 数据集训练)评估过曝/噪声/模糊等低层失真,归一化到 [0,1]。
Video-Condition Consistency(生成是否符合文本条件)
- Semantics:Object Class / Multiple Objects(GRiT 检测)、Human Action(UMT,Kinetics-400 分类,top-5 logit>0.85 判定)、Color(GRiT 描述色彩+比对)、Spatial Relationship(GRiT 检测框 + IoU 规则,仿照 T2I-CompBench)、Scene(Tag2Text 场景描述比对)。
- Style:Appearance Style(CLIP 图文余弦相似度)、Temporal Style(ViCLIP 视频-文本特征相似度,覆盖运镜风格如 zoom in/pan left)。
- Overall Consistency:ViCLIP 计算通用视频-文本一致性作为辅助指标。
模型/权重全部复用现成开源工具(DINO、CLIP、RAFT、GRiT、Tag2Text、UMT、ViCLIP、AMT、LAION Aesthetic Predictor、MUSIQ),VBench 的贡献在于为每个维度选定专属工具、设计专属 prompt、并验证其与人类感知的对齐度,而非训练新模型。Total Score 计算(README):各维度先按 (score−min)/(max−min) 归一化;Quality Score = {subject/background consistency, temporal flickering, motion smoothness, aesthetic quality, imaging quality, dynamic degree} 加权平均;Semantic Score = {object class, multiple objects, human action, color, spatial relationship, scene, appearance style, temporal style, overall consistency} 加权平均;Total Score = w1·Quality + w2·Semantic(权重见 scripts/constant.py,论文本身未给出具体权重数值)。
数据
- 分维度 Prompt Suite:16 个维度各自约 100 条专属 prompt,从对应素材库精心筛选/构造(如 Subject Consistency 用 COCO 80 类中挑 19 类可移动物体配动作;Object Class/Multiple Objects/Color/Spatial Relationship 用 COCO 物体类目重新组合;Human Action 从 Kinetics-400 挑 100 个动作互不重叠;Background Consistency/Scene 复用 Places365 场景列表;Temporal Flickering 用静态场景前缀 prompt,并用光流过滤确保真静态)。
- 分内容类别 Prompt Suite:从互联网收集人类撰写的候选 prompt,用 LLM 做多标签分类(分类模板见 Table A3,人工校验后分类准确率约 95%),最终得到 8 类 × 100 条 = 800 条:Animal、Architecture、Food、Human、Lifestyle、Plant、Scenery、Vehicles。
- 人类偏好标注:4 个 T2V 模型(LaVie、ModelScope、VideoCrafter、CogVideo)对每条 prompt 各生成一个视频,每条 prompt 采样 5 组共 4 视频,两两配对产生 6 对比较,即一个含 N 条 prompt 的维度产生 N×5×6 次成对人类比较,每次标注三选一(A 更好/B 更好/相同)。
- 质量保证:五步流程——标注说明准备 → 预标注试跑(60 样本)→ 说明更新 → 标注者自查(每包 60 样本抽查 20%,错误率>10% 整包重标)→ 作者复查(同规则,若仍>10% 则整维度重标)。
- VLM 微调数据:把 VBench 各维度打分线性映射到 0-10,与人类偏好标签组织成 30,000 条指令数据,用于微调 VideoChat。
- Empirical Max/Min & WebVid-Avg 参照基线:Empirical Max 从 WebVid-10M 按 CLIP 文本相似度检索每条 prompt 的 top-5 真实视频(2 秒片段、8 FPS 采样)取最高分;Empirical Min 用随机高斯噪声片段(Video-Condition Consistency 维度)或真实视频帧拼接(Video Quality 维度)近似下界;WebVid-Avg 对检索到的 WebVid-10M 视频取各维度平均分,反映训练数据本身的质量水位。
- 无 sim-to-real、无跨模态 co-training——VBench 本身不训练生成模型,只标注/评测已生成的视频。
训练方法
VBench 不训练生成模型;“训练”仅体现在两处衍生实验:
- VLM Tuning(用人类偏好标注微调评测用 VLM):以 VideoChat-embed 为基线模型,用上述 30,000 条指令数据微调 3 epoch,学习率 2e-5,batch size 64;微调让 VLM 先通过 Chain-of-Thought 从 prompt 判断该关注哪些维度,再描述视频、再给出该维度 0-10 分。
- 人类对齐验证方法:对每个维度分别计算 4 个模型的 win ratio(VBench 打分口径 vs. 人类标注口径),线性拟合并算 Spearman 相关系数 ρ;16 个维度全部展示出高相关(详见评测部分)。
无 RL、无 action tokenization(VBench 本身不是生成式模型)。
Infra(训练 / 推理工程)
- VLM 微调硬件:VideoChat-embed 微调在 8×A100-80GB 上跑,约 1 小时完成 30,000 条指令数据的 3 epoch 训练。
- 评测侧算力:评测脚本原生支持多卡并行(
torchrun --nproc_per_node=${GPUS}/vbench evaluate --ngpus=${GPUS}),具体单次评测的 GPU 数、耗时论文/README 均未披露。 - 推理 FPS / 控制频率:不适用——VBench 是离线评测工具,不涉及实时推理或控制回路。
- 被评测的 4 个 T2V 模型采样设置(附录 J.1,供复现参考):LaVie 采 16 帧 512×512@8FPS,DDPM 250 步,seed=2,cfg=7;ModelScope 采 16 帧 256×256@8FPS;VideoCrafter(0.9/LVDM 版)采 16 帧 256×256@8FPS,seed=2;CogVideo 采 33 帧 480×480@10FPS(含序列生成+插帧+递归插帧全流程,prompt 需先译成中文),seed=2。
评测 benchmark
论文一手结果(Table 1,4 个 T2V 模型在 16 维度上的原始得分,及 Empirical Min/Max 参照):
| 维度 | LaVie | ModelScope | VideoCrafter | CogVideo | Empirical Min | Empirical Max |
|---|---|---|---|---|---|---|
| Subject Consistency | 91.41% | 89.87% | 86.24% | 92.19% | 14.62% | 100.00% |
| Background Consistency | 97.47% | 95.29% | 92.88% | 95.42% | 26.15% | 100.00% |
| Temporal Flickering | 98.30% | 98.28% | 97.60% | 97.64% | 62.93% | 100.00% |
| Motion Smoothness | 96.38% | 95.79% | 91.79% | 96.47% | 70.60% | 99.75% |
| Dynamic Degree | 49.72% | 66.39% | 89.72% | 42.22% | 0.00% | 100.00% |
| Aesthetic Quality | 54.94% | 52.06% | 44.41% | 38.18% | 0.00% | 100.00% |
| Imaging Quality | 61.90% | 58.57% | 57.22% | 41.03% | 0.00% | 100.00% |
| Object Class | 91.82% | 82.25% | 87.34% | 73.40% | 0.00% | 100.00% |
| Multiple Objects | 33.32% | 38.98% | 25.93% | 18.11% | 0.00% | 100.00% |
| Human Action | 96.80% | 92.40% | 93.00% | 78.20% | 0.00% | 100.00% |
| Color | 86.39% | 81.72% | 78.84% | 79.57% | 0.00% | 100.00% |
| Spatial Relationship | 34.09% | 33.68% | 36.74% | 18.24% | 0.00% | 100.00% |
| Scene | 52.69% | 39.26% | 43.36% | 28.24% | 0.00% | 82.22% |
| Appearance Style | 23.56% | 23.39% | 21.57% | 22.01% | 0.09% | 28.55% |
| Temporal Style | 25.93% | 25.37% | 25.42% | 7.80% | 0.00% | 36.40% |
| Overall Consistency | 26.41% | 25.67% | 25.21% | 7.70% | 0.00% | 36.40% |
人类对齐验证(Figure 5 / Table A5):16 个维度的 Spearman 相关系数 ρ 全部 >0.6,其中 11/16 个维度 >0.9——如 Motion Smoothness ρ=0.9980、Appearance Style ρ=0.9965、Multiple Objects ρ=0.9898、Aesthetic Quality ρ=0.9865、Subject Consistency ρ=0.9651;相对最低的是 Color(ρ=0.6073)与 Object Class(ρ=0.8037),Dynamic Degree(ρ=0.8209)居第三低。额外做了 Temporal Flickering 在三种不同动态程度基准(Dynamic/Semi-Dynamic/Static Benchmark)上的交叉验证,三者之间人类偏好 win ratio 两两相关约 99%,证明该维度排名不受视频动态程度干扰。
T2V vs. T2I(Figure 6a):选取 10 个能涵盖逐帧生成能力的维度,对比 4 个 T2V 模型与 3 个 T2I 模型(SD1.4、SD2.1、SDXL);T2V 模型在 Multiple Objects 与 Spatial Relationship(组合性)上显著落后于 T2I(尤其 SDXL),论文归因于组合能力训练数据不足、以及文本编码器较弱(T2V 常只用 CLIP ViT-L,T2I 用更大/更强的 OpenCLIP ViT-H/G)。
跨内容类别分析(Figure 7 / Table A7):8 类内容中,Human/Vehicle 等运动复杂类别在时序一致性维度上普遍偏低;Food 类别 Aesthetic Quality 得分最高(尽管在 WebVid-10M 中仅占 11% 数据量),而 Human 类别虽在 WebVid-10M 占比最高(26%)却表现最差——论文据此提出”大规模数据集中数据质量可能比数据量更重要”的观察。
leaderboard 演进(GitHub README,非论文本身):2024/08 leaderboard 已有 28 个 T2V + 12 个 I2V 模型;2024/09 增至 40 个 T2V(含长视频)模型、10 个长视频模型专属 leaderboard;2025/01 VBench Arena 上线,收录超过 180,000 条生成视频、支持 40 个模型的人类投票对比;当前 leaderboard 已纳入 Gen-3、Kling、Pika 等闭源商业模型(README 原文引导用户直接查 HuggingFace Leaderboard 获取最新数值,论文本身的 4 模型评测仅为 2023 年发布时的快照)。
创新点与影响
- 首个把”视频生成质量”正式拆解为 16 个解耦维度并逐一验证人类对齐度的评测框架:相比 FVD/CLIPSIM 等单一数字指标,能同时暴露模型在时序一致性 vs. 动态程度之间的权衡(论文观察:擅长时序一致性的模型常常动态程度低,反之亦然),为后续架构/数据决策提供细粒度反馈而非笼统分数。
- 人类偏好标注数据集全开源:不仅验证 VBench 自身,还被作者用于微调 VideoChat 提升其视频生成评测能力,展示了标注数据的二次利用价值。
- 分内容类别评测揭示模型能力的隐藏分布不均——例如 CogVideo 在 Food 类别的美学表现远好于其整体平均分,提示”整体分数掩盖类别级强项”。
- 长期演进为系列标准:VBench→VBench++(I2V/长视频/可信度)→VBench-2.0(内在保真度:常识推理、物理真实感、人体运动、创意构图),持续被视频世界模型/驾驶世界模型/游戏世界模型论文引用作为感知质量的标准评测集,客观上推动了”评测维度可解耦、可复现、可对齐人类”成为该领域的方法论共识。
- 作者自陈局限(论文 Conclusion “Limitations and Future Work”):截至发布时仅评测 4 个开源 T2V 模型,计划随更多模型开源持续扩充;评测任务当时局限于文本到视频,作者明确提出未来要扩展到图生视频等任务(后续由 VBench++ 落实)。潜在负面社会影响部分作者也坦言:VBench 当前不评测安全性与公平性维度,提醒用户对开源视频生成模型保持谨慎(这一空白后续由 VBench-Trustworthiness 补上)。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2311.17982
- arXiv PDF:https://arxiv.org/pdf/2311.17982
- 项目主页:https://vchitect.github.io/VBench-project/
- GitHub(代码 + 评测脚本 + 分维度 prompt 套件 + 采样视频数据集链接):https://github.com/Vchitect/VBench
- HuggingFace Leaderboard:https://huggingface.co/spaces/Vchitect/VBench_Leaderboard
- 后续工作:VBench++(TPAMI 2025)https://arxiv.org/abs/2411.13503;VBench-2.0 https://arxiv.org/abs/2503.21755
一手源存档(sources/)
- vbench—github-readme — GitHub README 快照(VBench/VBench++/VBench-2.0 三代概览、Total Score 计算公式、leaderboard 演进时间线、依赖工具列表),来源 https://github.com/Vchitect/VBench
- vbench—project-page — 项目主页快照(摘要、可视化图表说明、关联项目 Evaluation Agent),来源 https://vchitect.github.io/VBench-project/
- 论文全文:arXiv:2311.17982(arXiv 原文 PDF,不入 git;正文数字取自 arXiv PDF 全文,含附录 G/H/I/J 关于评测方法公式、prompt 设计细节、人类标注流程与 VLM 微调实现细节)