一句话定位
WorldModelBench 由 UC Berkeley / UC San Diego / NVIDIA / MIT 联合提出,是把视频生成模型当”世界模型”来考核的评测基准——7 大应用领域 × 56 子域 = 350 条图文条件对,评分体系覆盖指令遵循(0-3 级)、常识质量(帧质量+时序一致性)、物理遵循(5 条物理定律,各 0/1)三维,累计满分 10 分;论文额外众包 67K 条人类标注评了 14 个前沿模型,并微调出一个仅 2B 参数的 VLM 判官(比 GPT-4o 高 8.6% 准确率),进一步证明”用该判官的奖励做梯度对齐可以直接提升视频生成模型的世界建模能力”。
背景与定位
这是继 vbench(通用视频质量)、videophy(物理常识,0/1 粗粒度)之后,评测维度进一步精细化+应用场景进一步聚焦的一支路线:VBench 主要测美学/时序一致性等通用视频质量,不判物理定律;VideoPhy 引入物理评测但只在”日常物体交互”场景下用粗粒度 0/1 打分。WorldModelBench 的定位是”世界模型评测”而非”视频质量评测”——面向机器人、自动驾驶等决策类下游应用,把物理遵循拆成 5 条具体定律、指令遵循拆成 4 个层级,并首次同时支持 T2V 和 I2V 两种条件类型的统一评测协议。论文用 GPT-4o 生成的 CoT 推理链辅助监督微调,训出人类对齐的自动判官(VILA 系 2B VLM),呼应 cogvideox、mochi-1、open-sora-plan 等同期视频生成模型的评测需求;后续 vbench-2.0、videophy-2 及 phyworldbench 均沿着”物理真实性”这条评测子方向继续推进。
模型架构
本工作是基准+评测器论文,不训练生成模型;“架构”指基准数据结构、评分体系与判官模型三部分。
基准维度设计(总分 0-10):
- 指令遵循(Instruction Following,0-3 分):4 个离散层级——Level 0(主体缺失或静止不动)、Level 1(主体动了但方向/动作错误,如指令要求车左转、视频里车右转)、Level 2(部分完成指令但未做完,如指令让人碰肩膀、视频只做了伸手动作)、Level 3(完整正确完成指令动作)。
- 物理遵循(Physics Adherence,0-5 分,5 条定律各 0/1):Law 1 牛顿第一定律(物体不应无外力自行运动)、Law 2 质量守恒/固体力学(物体不应不规则变形)、Law 3 流体力学(液体不应不自然流动)、Law 4 不可穿透性(物体不应互相穿模)、Law 5 重力(物体不应违反重力,如悬浮)。
- 常识(Commonsense,0-2 分):帧质量(是否有视觉不适/低质量内容)+ 时序质量(是否闪烁、卡顿动作、物体突兀出现/消失),沿用 vbench 的常识维度分类。
VLM 判官(Fine-tuned Judger):基于 VILA(Lin et al. 2023,Efficient-Large-Model 系列)架构,LLM 骨干为 Qwen2,参数量 2B(HF 模型标识 vila-ewm-qwen2-1.5b,架构标签 llava_llama),输入为文本(+图像)条件与生成视频,对 8 项分项评分标准逐一做 QA 式打分(“single vote 拆成 8 个问答对”)。为增强推理对齐,训练集额外用 GPT-4o 与 Gemini-1.5-Pro 生成推理链,只保留最终答案正确的链作为补充监督数据。
数据
- 基准 prompt 规模:350 条图文条件对,覆盖 7 大领域(自动驾驶、机器人、人类活动、工业、自然场景、模拟游戏、动画),每领域 50 条样本、5-10 个子域,共 56 个子域。
- 来源与构造三步流程:(1) 参考视频——驾驶取自 nuScenes、机器人取自 Open X-Embodiment、人类活动取自 ActivityNet,其余领域从更大规模视频库中用 GPT-4 打标签筛关键词选取最热门子域;(2) 图文条件生成——取参考视频首帧为图像条件,用 GPT-4o 对比首帧与后续帧的差异生成动作文本描述,并针对 T2V 场景重新润色首帧描述使其与动作描述场景一致;(3) 人工逐条核验全部 350 条图文条件的质量(剔除黑屏首帧、GPT-4 误标、无潜在评分区分度的样本等)。
- 人类标注规模:8336 条完整投票(每条投票含全部 8 项评分标准 = “一次完整标注8个人类标签”),合计 67K 条人类标签,65 名标注者参与,平均每视频 1.70 票。
- 标注质量校验:投票间总分绝对差 ≤2 的一致率 87.1%;转换为成对胜负比较后一致率 70.0%(对比 VideoPhy 的 70~75%、Chatbot Arena 的 72.8%~83.1%);抽取 10 名 CS 博士水平专家的投票,取均值 ±1 标准差区间,96.2% 的专家票、95.4% 的众包票落在该区间内,验证众包标注质量可靠。
- 判官训练集划分:350 条 prompt 各取 14 个模型生成结果中的 12 个模型(连同原始参考视频,视为满分对照)构成训练集,剩余 2 个模型的生成结果留作测试集;训练集共 4421 段视频(每段配 8 条人工标注),测试集 713 段视频(已剔除部分闭源 API 拒答样本)。
- WorldModelBench-Hard 子集:从投票结果中挑选 5 个闭源模型平均分最低的 45 条 prompt 构成难例子集,用于更快、更具区分度地评测新模型。
- 数据许可/发布:图像首帧、prompt 文本及 350 条测试集随 GitHub 仓库开源(
worldmodelbench.json+images/),标准答案与解释保留不公开,需将结果提交邮箱以上榜;判官权重与数据集同步发布于 HuggingFace(Efficient-Large-Model/worldmodelbench数据集、Efficient-Large-Model/vila-ewm-qwen2-1.5b判官,2025-07-28 起数据从 HF 迁移至 GitHub 便于维护)。
训练方法
- 判官微调目标:以收集的 4421 段训练视频 + 8 项人工标注为监督信号,微调 VILA-Qwen2-2B 完成 8 项评分标准的 QA 式预测;额外用 GPT-4o / Gemini-1.5-Pro 生成推理链、仅保留答案正确的链混入训练集以增强推理对齐。
- 奖励梯度对齐(Reward Gradient Alignment):沿用 VADER(Prabhudesai et al. 2024)框架,把微调判官当作可微奖励模型 R(·),优化目标为最大化跨评分标准 g∈G 的奖励期望 J(θ)=E[Σ_g R(x₀,c,g)](x₀为生成视频、c为图文条件)。因语言模型输出离散 token 不可微,改为直接优化 “No” token 与 “Yes” token 的 softmax 概率差 p(No)−p(Yes),从而可以对生成模型参数 θ 反传梯度。作者在 OpenSora-v1.2 T2V 上应用该方法做定性验证(Figure 8 展示优化前后样例),未报告量化提升指标。
- 模型推理超参(用于评测各开源模型时采用官方推荐配置,见附录 8.3):CogVideoX-5B 用 CFG 6.0、50 步 DDIM;Open-Sora 用 720P、4 秒、9:16、30 采样步、flow threshold 5.0、aesthetic threshold 6.5;Pandora 用官方 checkpoint + 50 步 DDIM;Mochi 用 CFG 4.5、65 采样步;T2V-Turbo 用 4 步采样、CFG 7.5、16fps×16帧;Open-Sora-Plan 用 fps 18、CFG 7.5、100 采样步、352×640 分辨率。
Infra(训练 / 推理工程)
- 判官训练算力:未披露(论文未给出 GPU 数量/型号/训练时长)。
- 人工标注成本/规模:65 名标注者、8336 条完整投票、67K 人类标签,未披露标注工时成本。
- 生成模型推理成本(论文 Discussion 提及作为 benchmark 规模取舍的理由):Mochi 在 4×A100 上生成单条视频约需 5 分钟,是作者将基准规模控制在 350 条(而非 VideoPhy 的 688 条)以维持评测可行性的原因之一。
- 判官推理:2B 参数 VLM,未披露具体推理延迟/吞吐(FPS/控制频率不适用于离线评分场景)。
评测 benchmark
主表(论文 Table 3,14 个模型 × 三维分项 + 总分,节选关键列,0-10 分):
| 模型 | 指令遵循 | 帧质量 | 时序质量 | Newton | 质量守恒 | 流体 | 不可穿透 | 重力 | 总分 |
|---|---|---|---|---|---|---|---|---|---|
| KLING(闭源) | 2.36 | 0.94 | 0.92 | 0.93 | 0.88 | 0.96 | 0.89 | 0.93 | 8.82 |
| Minimax(闭源) | 2.29 | 0.91 | 0.88 | 0.93 | 0.81 | 0.96 | 0.86 | 0.94 | 8.59 |
| Mochi-official(闭源API) | 2.01 | 0.89 | 0.83 | 0.94 | 0.82 | 0.99 | 0.92 | 0.98 | 8.37 |
| Runway(闭源) | 2.15 | 0.87 | 0.78 | 0.91 | 0.69 | 0.94 | 0.82 | 0.91 | 8.08 |
| Luma(闭源) | 2.01 | 0.81 | 0.76 | 0.89 | 0.62 | 0.95 | 0.77 | 0.90 | 7.72 |
| Mochi(开源) | 2.22 | 0.63 | 0.63 | 0.94 | 0.58 | 0.97 | 0.71 | 0.94 | 7.62 |
| OpenSoraPlan-T2V(开源) | 1.79 | 0.70 | 0.77 | 0.90 | 0.66 | 0.97 | 0.89 | 0.93 | 7.61 |
| CogVideoX-T2V(开源) | 2.11 | 0.60 | 0.51 | 0.91 | 0.52 | 0.96 | 0.74 | 0.95 | 7.31 |
| CogVideoX-I2V(开源) | 1.89 | 0.56 | 0.43 | 0.87 | 0.43 | 0.96 | 0.66 | 0.96 | 6.75 |
| OpenSora-Plan-I2V(开源) | 1.77 | 0.47 | 0.54 | 0.84 | 0.42 | 0.97 | 0.70 | 0.92 | 6.62 |
| Pandora(开源) | 1.56 | 0.42 | 0.53 | 0.91 | 0.50 | 0.96 | 0.74 | 0.94 | 6.57 |
| T2VTurbo(开源) | 1.33 | 0.49 | 0.43 | 0.88 | 0.42 | 0.96 | 0.75 | 0.96 | 6.22 |
| OpenSora-T2V(开源) | 1.71 | 0.40 | 0.33 | 0.89 | 0.32 | 0.95 | 0.60 | 0.92 | 6.11 |
| OpenSora-I2V(开源) | 1.60 | 0.37 | 0.25 | 0.90 | 0.25 | 0.92 | 0.60 | 0.94 | 5.83 |
关键发现:(1) 顶尖模型 KLING 也只有 61% 的视频正确完成指定任务(论文原文直接给出的完成率),12% 违反质量守恒、11% 出现物体穿模,说明当前模型对物理对象属性理解远未成熟;(2) 常识指标好不代表世界建模强——Luma 帧质量/时序质量(0.81/0.76)均高于最佳开源模型 Mochi(0.63/0.63),但指令遵循远逊于 Mochi(44% vs 53% 完成率)、物理遵循相近(4.13 vs 4.14);(3) I2V 版本系统性弱于 T2V 版本(CogVideoX 7.31 vs 6.75、OpenSoraPlan 7.61 vs 6.62、OpenSora 6.11 vs 5.83),提示 I2V 方向调优不足;(4) 开源第一梯队(Mochi 7.62、OpenSoraPlan 7.61)已逼近部分闭源模型(Luma 7.72)。
判官准确率对比人类标注(Table 4/5,人类总分 H vs 判官总分 J,预测误差):判官在全部 14 个模型上平均预测误差 4.1%,指令遵循维度上误差 2.79%、与人类标注的 Kendall τ = 0.96。判官与 GPT-4o(零样本/CoT)、Gemini-1.5-Pro(零样本/CoT)、Qwen2-VL-2B 的分项误差对比(Table 5,误差百分比,越低越好):GPT-4o 指令遵循 29.3%/常识 35.0%/物理 36.0%;GPT-4o+CoT 29.7%/28.5%/45.6%;Gemini-1.5-Pro 30.7%/34.5%/29.3%;Gemini-1.5-Pro+CoT 29.3%/19.5%/28.3%;Qwen2-VL-2B 30.3%/39.0%/39.7%;本文 VILA-2B 判官(零样本)21.0%/28.0%/24.0%;本文判官微调后(+CoT Fine-tuned)32.3%/16.4%/29.7%——三维平均误差比 GPT-4o 低 8.6%(对应摘要中的核心数字),常识维度误差降到 16.4% 为全表最低。
与 VBench 的相关性分析(§4.3 + 附录 8.1):帧质量维度上 WorldModelBench 与 VBench 的模型胜率相关系数 0.69(较强相关,说明两者在通用视频质量评测上基本一致);但物理遵循维度相关系数骤降至 0.28,进一步对比 VBench 各细分维度(主体一致性 0.15、背景一致性 0.19、运动平滑度 0.34、动态程度 -0.05、美学质量 0.41、成像质量 0.24),最高也仅 0.41,说明 VBench 现有维度均无法有效区分物理合理性。
WorldModelBench-Hard 子集结果(附录 Table 8):45 条难例上所有模型均显著掉分,KLING 掉分最多(9.08→7.87,回归 1.21 分),OpenSora-I2V 最低(4.71),证明该子集轻量且更具区分度。
创新点与影响
- 首个专门针对”世界模型”应用场景(而非通用视频质量)的评测基准:以指令遵循 + 5 条具体物理定律 + 常识三维打分体系,捕捉先前基准忽略的细粒度违规(如物体尺寸不规则变化违反质量守恒)。
- 大规模人类偏好对齐:67K 人类标签规模与 VideoPhy(73K)相当,且承诺公开标签(VideoPhy/VideoArena 均未公开),为后续研究提供可复现的人类偏好数据。
- 轻量高精度判官:2B 参数即超越 GPT-4o 达到 8.6% 更高平均准确率,验证了”小模型+高质量人类标注微调”路线在 VLM-as-judge 范式下的有效性。
- 奖励梯度对齐的正向信号:证明基于该判官奖励做梯度对齐(沿用 VADER 框架)可提升视频生成模型的世界建模能力,为”用评测反哺训练”提供了初步验证(仅定性展示,未给出量化提升数字)。
- 作者自陈局限:(1) 基准规模(350 条)显著小于 VideoPhy(688 条),原因是当代模型推理成本高(如 Mochi 4×A100 需 5 分钟/条),为保证评测可行性主动收窄规模;作者辩称即便规模较小,模型间区分度依然显著(如两个头部闭源模型 8.82 vs 8.59 的清晰差距)。(2) 与 VideoPhy 的差异定位:VideoPhy 聚焦日常物体交互,未必是最相关的世界模型场景,本文直接测机器人等应用领域表现,并额外支持 I2V、承诺开源细粒度标签。
原始链接
- 论文(arXiv 2502.20694):https://arxiv.org/abs/2502.20694
- PDF:https://arxiv.org/pdf/2502.20694
- 项目页(含实时 Leaderboard):https://worldmodelbench-team.github.io/
- 代码/评测脚本(GitHub):https://github.com/WorldModelBench-Team/WorldModelBench
- 测试集(HuggingFace Datasets):https://huggingface.co/datasets/Efficient-Large-Model/worldmodelbench
- 判官模型(HuggingFace,VILA-Qwen2-2B):https://huggingface.co/Efficient-Large-Model/vila-ewm-qwen2-1.5b(页面未提供 model card 正文,仅确认架构标签
llava_llama、safetensors 格式)
一手源存档(sources/)
- worldmodelbench—github-readme — GitHub README 快照(评测流程、目录结构、引用信息)
- worldmodelbench—project-page — 项目页快照(摘要、Leaderboard 完整表格、BibTeX)
- 论文全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)