一句话定位
WorldScore 是 Stanford Vision & Learning Lab(Fei-Fei Li、Jiajun Wu 团队)提出的首个”世界生成”(world generation)统一评测基准:把任意世界生成任务拆解成一串以显式相机轨迹为约束的”下一场景生成”(next-scene generation)步骤,使 3D/4D 场景生成、文生视频(T2V)、图生视频(I2V)四类方法论都能在同一输出格式(视频)与同一套 10 项指标(可控性/质量/动态性)下直接比较;论文用它评测了 19 个代表性模型,2025-06 被 ICCV 2025 接收。
背景与定位
已有视频生成基准(TC-Bench、EvalCrafter、FETV、VBench、T2V-CompBench、ChronoMagic-Bench、WorldModelBench 等)只评估单场景视频质量,不含显式空间布局控制,也无法评测需要相机轨迹或参考图像输入的 3D/4D 场景生成方法——论文 Table 1 逐项对比:这些基准无一同时支持 Multi-Scene、Unified(跨范式统一)、Long-Seq、Image-Cond、Multi-Style、Camera-Ctrl、3D-Consist 七项能力,而 WorldScore(3,000 样例)全部支持。
WorldScore 延续了同一实验室此前”永续场景生成”这条研究线:wonderjourney(2023,从单图持续生成可探索 3D 场景)与 wonderworld(2024,交互式实时单图 3D 场景生成)都是被本文纳入评测的 3D 基线模型,WorldScore 相当于把这条研究线的产出正式收进一套可复现、跨范式的统一评测协议。同期的 vbench-2.0 走的是另一条路线——在纯视频生成范式内部把评测重心从”表面保真度”细化到”内在保真度”(物理/解剖/常识);WorldScore 的差异化定位是”跨范式”(3D/4D/T2V/I2V 全部纳入同一评测),而非”更细粒度地评单一范式”。论文中 T2V 基线之一 cogvideox(CogVideoX-T2V/I2V 双版本)也是被评测模型之一。
模型架构
WorldScore 本身不是生成模型,而是评测规范 + 评测流水线,核心设计是把世界生成形式化为一系列”下一场景生成”任务:
- 世界规范三元组
(𝒞, 𝒩, ℒ):当前场景𝒞={I, 𝒫}(一张场景图像 + 文本描述)、下一场景文本提示𝒩、布局ℒ={𝒯, 𝒴}(相机轨迹矩阵序列𝒯=(C₁,...,C_N)+ 相机运动文本描述𝒴,如”camera pans right”)。模型被要求生成V = g_world(w_proc(𝒞, 𝒩, ℒ)),w_proc是模型专属的输入预处理(3D/4D 模型直接吃相机矩阵,视频模型吃文本化的相机运动描述;参考图像统一 center-crop + resize 到各模型所需分辨率)。 - 静态 vs 动态两类任务:静态世界生成用大幅相机运动 + 新场景内容评测可控性与质量;动态世界生成固定相机位置、
𝒩描述同一场景内的运动变化(如动物移动),专测动态性。 - 10 项指标的评测流水线(全部复用现成预训练模型,本文不训练任何新网络):
- 相机可控性:DROID-SLAM 估计逐帧相机位姿,与 ground-truth 轨迹算尺度不变的旋转/平移误差
e_camera=√(e_θ·e_t)。 - 物体可控性:开放集目标检测模型(Grounding-DINO)匹配
𝒩中抽取的实体描述,算检测成功率。 - 内容对齐:CLIPScore 对齐生成场景与完整文本
𝒩。 - 3D 一致性:DROID-SLAM 估计逐帧稠密深度,算相邻帧共视像素的重投影误差。
- 光度一致性:SEA-RAFT 估计相邻帧光流,算 Average End-Point Error (AEPE)(弥补 CLIP/DINO 特征抓不住纹理级”贴图漂移”的盲区)。
- 风格一致性:单次 next-scene 任务首末帧的 Gram 矩阵 F-范数差。
- 主观质量:CLIP-IQA+ 与 CLIP Aesthetic 的算术平均组合(经 200 人人类研究在若干候选组合中筛出)。
- 运动准确性:
s_motion-acc = max(F⊙M) − max(F⊙M̄),F 为 SEA-RAFT 光流幅值,M 为 SAM2 标注的动态物体首帧分割掩码。 - 运动幅度:光流幅值的中位数。
- 运动平滑度:VFIMamba 帧插值重建原始丢弃帧后的 MSE/SSIM/LPIPS 组合。
- 相机可控性:DROID-SLAM 估计逐帧相机位姿,与 ground-truth 轨迹算尺度不变的旋转/平移误差
- 归一化与聚合:每项指标基于经验上下界做线性映射到
[0,1]再×100;可控性 + 质量维度算术平均得 WorldScore-Static;再并入动态性三项得 WorldScore-Dynamic;不支持动态任务的 3D 模型三项动态指标记 0。
数据
- 数据集共 3,000 个测试样例:2,000 静态(写实/风格化各 1,000,每类再按室内 5 类×100 + 室外 5 类×100 拆分——室内:Dining/Living/Passage/Public/Work,室外:City/Suburb/Aquatic/Terrestrial/Verdant)+ 1,000 动态(写实/风格化各 500,5 种运动类型×100:Articulated/Deformable/Fluid/Rigid/Multi-Motion)。HuggingFace 数据集页确认两个 config 的样本数与此一致(static 2,000 / dynamic 1,000),总下载体积约 4.86GB。
- 当前场景图像来源:10 个现成场景数据集(室内 InteriorVerse 50,000 张/Hypersim 77,400/SUN-RGBD 10,000/Matterport3D 194,400/DIODE-indoor 9,052/ETH3D-indoor 597;室外 LHQ 90,000/EDEN 300,000/Argoverse-HD 70,000/DIODE-outdoor 18,206/ETH3D-outdoor 301)+ Unsplash 在线补充,先筛出约 5,000 张候选写实图像,再经 5 道过滤(CLIP-IQA+/CLIP Aesthetic 质量过滤、Perspective Fields 视角过滤剔除极端 roll/pitch/窄 FOV、CLIPSIM 去冗余相似图、亮度阈值剔除过暗图、人工复核),10 类各留质量最高的 100 张 → 1,000 张最终写实图像。
- 风格化对应图:为每张写实图随机指派 7 种预定义风格之一(anime、cyberpunk、水墨画、浮世绘、印象派、后印象派、Minecraft),用商用风格可控文生图模型生成风格化版本。
- 下一场景文本提示
𝒩:GPT-4o 自回归生成,静态任务系统提示要求输出 JSON{"Entities":[...], "Prompt":"..."}(1-3 个显著实体 + 场景描述,且需与历史场景不同);动态任务输出{"Objects":[...], "Prompt":"..."}(识别图中可运动物体 + 运动描述)。20% 静态样例为”large world”(4 个场景、连续调用 LLM 3 次),其余 80% 为”small world”(1 个新场景)。 - 相机布局:8 种取自电影工业惯例的相机运动(pan/move/pull 等),随机指派给每个静态样例的 next-scene 任务,intra-scene 布局时用
𝒫替换𝒩。 - 主观质量指标筛选用的人类研究:200 名参与者,2AFC(二选一强制选择)成对比较,视频采样自 CogVideoX-I2V、VideoCrafter1-I2V、DynamiCrafter、WonderJourney、InvisibleStitch 五个模型,用于枚举候选自动指标组合并挑出与人类偏好一致性最高的(CLIP-IQA+ + CLIP Aesthetic)。
- 无 sim-to-real 或跨模态 co-training 概念——WorldScore 本身不训练生成模型,数据集只服务于”喂给待评模型 + 算指标”两件事。
训练方法
WorldScore 不训练任何生成模型;“方法”体现在指标经验上下界的构造方式(用于 C.9 的线性归一化 s_norm = ⟨(s−b_min)/(b_max−b_min)⟩,越高越好取原式,越低越好取 1−式):
- 相机可控性:理论下界天然为 0;上界用”固定相机序列”基线近似(惩罚完全不产生相机运动的生成)。
- 物体可控性:理论上下界天然为 0%/100%(检测成功率本身有界)。
- 3D 一致性 / 风格一致性 / 光度一致性:用帧插值合成的”图像对插帧视频”作为经验最差基线(人为制造强烈风格漂移、低 3D 一致性与差光度稳定性),定义为经验上界;经验下界即理论最小值 0。
- 运动平滑度:从 OpenVid-1M 检索与每条 prompt 语义最相似的真实视频片段(3-10 秒,CLIP 文本特征匹配 top-5),丢偶数帧再双线性插值重建作为”经验最差”(MSE/LPIPS 上界,SSIM 下界);“经验最优”设为 0(完美平滑)。
- 内容对齐 / 主观质量 / 运动准确性 / 运动幅度:这四项难以定义天然上下界,改用 z-score 重缩放,把被评测模型的表现落在 25-75 分位区间以增强区分度。
- 无 RL、无 action tokenization、无蒸馏——WorldScore 是纯评测方法论,不涉及模型训练。
Infra(训练 / 推理工程)
- WorldScore 本身无训练算力开销:指标计算全部复用现成预训练检查点(DROID-SLAM、SEA-RAFT、Grounding-DINO、SAM2、CLIP-IQA+、CLIP Aesthetic、VFIMamba),论文未训练任何新网络。
- 19 个被评测模型的生成侧算力:论文 Table S1 注明”所有生成均在 H100 与 L40S GPU 上完成”,单实例平均生成耗时跨度极大——视频模型从 T2V-Turbo 的 5 秒、WonderWorld 的 10 秒,到 EasyAnimate 的 16 分钟、Allegro 的 0.5 小时;4D-fy 完整生成需要约 20 小时,论文为控制评测成本主动降低迭代步数使其耗时压缩到约 3 小时。
- 评测侧算力:GitHub 仓库的评测与生成脚本均原生支持 Slurm 多卡并行(
--use_slurm True --num_jobs <num_gpu>,基于submitit),单卡也可跑;总评测算力(GPU 型号数量、总 GPU-hours)论文未披露。 - 推理 FPS / 控制频率:不适用——WorldScore 是离线评测基准,不涉及实时推理或闭环控制;各被评测模型自身的输出帧率跨度为 8-30 FPS(如 T2V-Turbo 16 FPS、4D-fy 30 FPS、Allegro 15 FPS,详见 Table S1)。
评测 benchmark
论文 Table 2——19 个模型的 WorldScore 全量结果(12 个视频生成模型:含 2 个闭源 I2V Gen-3、Hailuo,6 个开源 I2V,4 个开源 T2V;6 个 3D 场景生成模型;1 个 4D 生成模型 4D-fy):
| 模型 | Static | Dynamic | 相机可控 | 物体可控 | 内容对齐 | 3D一致 | 光度一致 | 风格一致 | 主观质量 | 运动准确 | 运动幅度 | 运动平滑 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Gen-3(闭源 I2V) | 60.71 | 57.58 | 29.47 | 62.92 | 50.49 | 68.31 | 87.09 | 62.82 | 63.85 | 54.53 | 27.48 | 68.87 |
| Hailuo(闭源 I2V) | 57.55 | 56.36 | 22.39 | 69.56 | 73.53 | 67.18 | 62.82 | 54.91 | 52.44 | 63.46 | 27.20 | 70.07 |
| DynamiCrafter | 52.09 | 47.19 | 25.15 | 47.36 | 25.00 | 72.90 | 60.95 | 78.85 | 54.40 | 41.11 | 39.25 | 26.92 |
| VideoCrafter1-T2V | 47.10 | 43.54 | 21.61 | 50.44 | 60.78 | 64.86 | 51.36 | 38.05 | 42.63 | 11.76 | 75.00 | 18.87 |
| VideoCrafter1-I2V | 50.47 | 47.64 | 25.46 | 24.25 | 35.27 | 74.42 | 73.89 | 65.17 | 54.85 | 55.63 | 25.00 | 42.49 |
| VideoCrafter2 | 52.57 | 47.49 | 28.92 | 39.07 | 72.46 | 65.14 | 61.85 | 43.79 | 56.74 | 47.12 | 30.40 | 29.39 |
| T2V-Turbo | 45.65 | 40.20 | 27.80 | 30.68 | 69.14 | 38.72 | 34.84 | 49.65 | 68.74 | 34.87 | 40.09 | 7.48 |
| EasyAnimate | 52.85 | 51.65 | 26.72 | 54.50 | 50.76 | 67.29 | 47.35 | 73.05 | 50.31 | 75.00 | 31.16 | 40.32 |
| CogVideoX-T2V | 54.18 | 48.79 | 40.22 | 51.05 | 68.12 | 68.81 | 64.20 | 42.19 | 44.67 | 25.00 | 47.31 | 36.28 |
| CogVideoX-I2V | 62.15 | 59.12 | 38.27 | 40.07 | 36.73 | 86.21 | 88.12 | 83.22 | 62.44 | 69.56 | 26.42 | 60.15 |
| Allegro | 55.31 | 51.97 | 24.84 | 57.47 | 51.48 | 70.50 | 69.89 | 65.60 | 47.41 | 54.39 | 40.28 | 37.81 |
| Vchitect-2.0 | 42.28 | 38.47 | 26.55 | 49.54 | 65.75 | 41.53 | 42.30 | 25.69 | 44.58 | 33.59 | 33.81 | 21.31 |
| SceneScape(3D) | 50.73 | 35.51 | 84.99 | 47.44 | 28.64 | 76.54 | 62.88 | 21.85 | 32.75 | 0 | 0 | 0 |
| Text2Room(3D) | 62.10 | 43.47 | 94.01 | 38.93 | 50.79 | 88.71 | 88.36 | 37.23 | 36.69 | 0 | 0 | 0 |
| LucidDreamer(3D) | 70.40 | 49.28 | 88.93 | 41.18 | 75.00 | 90.37 | 90.20 | 48.10 | 58.99 | 0 | 0 | 0 |
| wonderjourney(3D) | 63.75 | 44.63 | 84.60 | 37.10 | 35.54 | 80.60 | 79.03 | 62.82 | 66.56 | 0 | 0 | 0 |
| InvisibleStitch(3D) | 61.12 | 42.78 | 93.20 | 36.51 | 29.53 | 88.51 | 89.19 | 32.37 | 58.50 | 0 | 0 | 0 |
| wonderworld(3D) | 72.69 | 50.88 | 92.98 | 51.76 | 71.25 | 86.87 | 85.56 | 70.57 | 49.81 | 0 | 0 | 0 |
| 4D-fy(4D) | 27.98 | 32.10 | 69.92 | 55.09 | 0.85 | 35.47 | 1.59 | 32.04 | 0.89 | 22.22 | 22.88 | 80.06 |
关键发现(论文 4.1 节原文观察):
- 3D 模型在静态世界生成上全面领先:WonderWorld(72.69)、LucidDreamer(70.40)为前两名,远超最好的视频模型 CogVideoX-I2V(62.15)——因 3D 模型天生具备高相机可控性、更大生成空间带来的高内容对齐,以及高 3D/光度一致性;但代价是不支持动态,扩展到 4D 的 4D-fy 表现很差(Static 27.98,内容对齐仅 0.85,光度一致仅 1.59,主观质量仅 0.89)。
- 视频模型普遍缺乏相机可控性:即使是视频模型中相机可控性最高的 CogVideoX-T2V(40.22),也远低于任何 3D/4D 模型(3D 模型普遍 85-94)。
- 最好的开源视频模型不输闭源模型:CogVideoX-I2V 在 WorldScore-Static(62.15)与 WorldScore-Dynamic(59.12)上都高于两个闭源模型 Gen-3(60.71/57.58)与 Hailuo(57.55/56.36),但并非每项都占优——CogVideoX-I2V 相机可控性更强,但物体可控性与内容对齐更弱。
- 运动平滑度与运动幅度存在权衡:更大幅度的运动通常伴随更低的平滑度(如 EasyAnimate 运动幅度 75.00 是全场最高但…运动准确性与平滑度并不领先)。
- 运动幅度大不代表运动位置准确:两者相关性弱,说明能生成大运动的模型不保证运动发生在正确区域,可能是幻觉出无关运动或意外相机运动。
- 视频模型在长序列与户外场景上更弱(论文 Figure 7,按子域细分的 WorldScore-Static):large-world(长序列)任务上视频模型显著吃力;户外场景上视频模型与 3D 模型的差距比室内场景更大。
- T2V 比 I2V 更易被操控:对比 CogVideoX-T2V 与 CogVideoX-I2V,T2V 版本可控性与运动幅度更高,I2V 版本质量维度更高——原因是 T2V 模型更愿意生成大幅相机运动,而 I2V 模型倾向于贴着输入图像视角不动。
创新点与影响
- 首个跨范式(3D/4D/T2V/I2V)统一的世界生成评测基准:把”世界生成”形式化为可跨方法论比较的”下一场景生成”序列任务,填补此前基准(VBench、WorldModelBench 等)“只测单场景视频质量、不兼容需要相机轨迹输入的 3D/4D 方法”的空白(论文 Table 1 逐项对比)。
- 10 项指标经人类偏好验证:主观质量指标不是随意选取,而是用 200 人的 2AFC 人类研究在候选自动指标组合里筛出与人类偏好一致性最高的组合(CLIP-IQA+ + CLIP Aesthetic),提升了评测的可信度。
- 揭示了 2025 年初世界生成领域的系统性短板:3D 模型静态生成强但难扩展到动态/4D;视频模型普遍缺乏相机可控性、在长序列与户外场景上更弱;运动幅度与平滑度/准确性之间存在权衡——论文把这些观察总结为”未来研究方向”(弥合 3D/4D 表示的鸿沟、构建更鲁棒的可控性机制、设计能处理更长场景序列的架构)而非评测方法本身的局限,论文全文未设专门的 Limitations 小节。
- 持续维护的活跃基准:2025-06 论文被 ICCV 2025 接收;GitHub 仓库在论文发布后持续更新——2025-06 追加了 hunyuanworld-voyager(Voyager)的评测结果,2025-11 补充了 WonderJourney/WonderWorld 的评测适配代码,后续多篇世界模型论文(如 matrix-3d、skywork-matrix-game、mbzuai-pan-world-model)直接借用 WorldScore 定义的相机误差指标或以其为基线对比,表明其已成为世界生成领域事实上的通用评测参照。
- 覆盖范围的固有边界:WorldScore 的可控信号局限于文本 + 相机轨迹,不含逐帧键鼠等细粒度交互动作条件——这一空白后来被专注 Minecraft 交互式世界模型的 GameWorld Score(skywork-matrix-game)显式指出并填补,属于该基准范式本身的适用边界,而非论文自陈的不足。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2504.00983
- arXiv PDF:https://arxiv.org/pdf/2504.00983
- arXiv HTML 全文(v1):https://arxiv.org/html/2504.00983v1
- 项目主页:https://haoyi-duan.github.io/WorldScore/
- GitHub:https://github.com/haoyi-duan/WorldScore
- HuggingFace 数据集:https://huggingface.co/datasets/Howieeeee/WorldScore(注意正确用户名为
Howieeeee五个 e,非常见误写/截断形式Howieeee四个 e) - HuggingFace Leaderboard:https://huggingface.co/spaces/Howieeeee/WorldScore_Leaderboard
一手源存档(sources/)
- worldscore-benchmark—github-readme — GitHub README 快照(更新日志、安装/评测流程、Table S1 模型信息表),来源 https://github.com/haoyi-duan/WorldScore
- worldscore-benchmark—hf-dataset-card — HuggingFace 数据集卡快照(static/dynamic 两个 config 的样本数与体积),来源 https://huggingface.co/datasets/Howieeeee/WorldScore
- worldscore-benchmark—project-page — 项目主页快照(TL;DR、基准对比表、各指标 demo 说明),来源 https://haoyi-duan.github.io/WorldScore/
- 论文全文:arXiv:2504.00983(arXiv 原文 PDF,不入 git;正文数字取自 arXiv HTML v1 全文,含 Table 1/2/S1-S5、附录 A-D 全部方法细节)