一句话定位

WorldScore 是 Stanford Vision & Learning Lab(Fei-Fei Li、Jiajun Wu 团队)提出的首个”世界生成”(world generation)统一评测基准:把任意世界生成任务拆解成一串以显式相机轨迹为约束的”下一场景生成”(next-scene generation)步骤,使 3D/4D 场景生成、文生视频(T2V)、图生视频(I2V)四类方法论都能在同一输出格式(视频)与同一套 10 项指标(可控性/质量/动态性)下直接比较;论文用它评测了 19 个代表性模型,2025-06 被 ICCV 2025 接收。

背景与定位

已有视频生成基准(TC-Bench、EvalCrafter、FETV、VBench、T2V-CompBench、ChronoMagic-Bench、WorldModelBench 等)只评估单场景视频质量,不含显式空间布局控制,也无法评测需要相机轨迹或参考图像输入的 3D/4D 场景生成方法——论文 Table 1 逐项对比:这些基准无一同时支持 Multi-Scene、Unified(跨范式统一)、Long-Seq、Image-Cond、Multi-Style、Camera-Ctrl、3D-Consist 七项能力,而 WorldScore(3,000 样例)全部支持。

WorldScore 延续了同一实验室此前”永续场景生成”这条研究线:wonderjourney(2023,从单图持续生成可探索 3D 场景)与 wonderworld(2024,交互式实时单图 3D 场景生成)都是被本文纳入评测的 3D 基线模型,WorldScore 相当于把这条研究线的产出正式收进一套可复现、跨范式的统一评测协议。同期的 vbench-2.0 走的是另一条路线——在纯视频生成范式内部把评测重心从”表面保真度”细化到”内在保真度”(物理/解剖/常识);WorldScore 的差异化定位是”跨范式”(3D/4D/T2V/I2V 全部纳入同一评测),而非”更细粒度地评单一范式”。论文中 T2V 基线之一 cogvideox(CogVideoX-T2V/I2V 双版本)也是被评测模型之一。

模型架构

WorldScore 本身不是生成模型,而是评测规范 + 评测流水线,核心设计是把世界生成形式化为一系列”下一场景生成”任务:

  • 世界规范三元组 (𝒞, 𝒩, ℒ):当前场景 𝒞={I, 𝒫}(一张场景图像 + 文本描述)、下一场景文本提示 𝒩、布局 ℒ={𝒯, 𝒴}(相机轨迹矩阵序列 𝒯=(C₁,...,C_N) + 相机运动文本描述 𝒴,如”camera pans right”)。模型被要求生成 V = g_world(w_proc(𝒞, 𝒩, ℒ))w_proc 是模型专属的输入预处理(3D/4D 模型直接吃相机矩阵,视频模型吃文本化的相机运动描述;参考图像统一 center-crop + resize 到各模型所需分辨率)。
  • 静态 vs 动态两类任务:静态世界生成用大幅相机运动 + 新场景内容评测可控性与质量;动态世界生成固定相机位置、𝒩 描述同一场景内的运动变化(如动物移动),专测动态性。
  • 10 项指标的评测流水线(全部复用现成预训练模型,本文不训练任何新网络):
    • 相机可控性:DROID-SLAM 估计逐帧相机位姿,与 ground-truth 轨迹算尺度不变的旋转/平移误差 e_camera=√(e_θ·e_t)
    • 物体可控性:开放集目标检测模型(Grounding-DINO)匹配 𝒩 中抽取的实体描述,算检测成功率。
    • 内容对齐:CLIPScore 对齐生成场景与完整文本 𝒩
    • 3D 一致性:DROID-SLAM 估计逐帧稠密深度,算相邻帧共视像素的重投影误差。
    • 光度一致性:SEA-RAFT 估计相邻帧光流,算 Average End-Point Error (AEPE)(弥补 CLIP/DINO 特征抓不住纹理级”贴图漂移”的盲区)。
    • 风格一致性:单次 next-scene 任务首末帧的 Gram 矩阵 F-范数差。
    • 主观质量:CLIP-IQA+ 与 CLIP Aesthetic 的算术平均组合(经 200 人人类研究在若干候选组合中筛出)。
    • 运动准确性:s_motion-acc = max(F⊙M) − max(F⊙M̄),F 为 SEA-RAFT 光流幅值,M 为 SAM2 标注的动态物体首帧分割掩码。
    • 运动幅度:光流幅值的中位数。
    • 运动平滑度:VFIMamba 帧插值重建原始丢弃帧后的 MSE/SSIM/LPIPS 组合。
  • 归一化与聚合:每项指标基于经验上下界做线性映射到 [0,1] 再×100;可控性 + 质量维度算术平均得 WorldScore-Static;再并入动态性三项得 WorldScore-Dynamic;不支持动态任务的 3D 模型三项动态指标记 0。

数据

  • 数据集共 3,000 个测试样例:2,000 静态(写实/风格化各 1,000,每类再按室内 5 类×100 + 室外 5 类×100 拆分——室内:Dining/Living/Passage/Public/Work,室外:City/Suburb/Aquatic/Terrestrial/Verdant)+ 1,000 动态(写实/风格化各 500,5 种运动类型×100:Articulated/Deformable/Fluid/Rigid/Multi-Motion)。HuggingFace 数据集页确认两个 config 的样本数与此一致(static 2,000 / dynamic 1,000),总下载体积约 4.86GB。
  • 当前场景图像来源:10 个现成场景数据集(室内 InteriorVerse 50,000 张/Hypersim 77,400/SUN-RGBD 10,000/Matterport3D 194,400/DIODE-indoor 9,052/ETH3D-indoor 597;室外 LHQ 90,000/EDEN 300,000/Argoverse-HD 70,000/DIODE-outdoor 18,206/ETH3D-outdoor 301)+ Unsplash 在线补充,先筛出约 5,000 张候选写实图像,再经 5 道过滤(CLIP-IQA+/CLIP Aesthetic 质量过滤、Perspective Fields 视角过滤剔除极端 roll/pitch/窄 FOV、CLIPSIM 去冗余相似图、亮度阈值剔除过暗图、人工复核),10 类各留质量最高的 100 张 → 1,000 张最终写实图像。
  • 风格化对应图:为每张写实图随机指派 7 种预定义风格之一(anime、cyberpunk、水墨画、浮世绘、印象派、后印象派、Minecraft),用商用风格可控文生图模型生成风格化版本。
  • 下一场景文本提示 𝒩:GPT-4o 自回归生成,静态任务系统提示要求输出 JSON {"Entities":[...], "Prompt":"..."}(1-3 个显著实体 + 场景描述,且需与历史场景不同);动态任务输出 {"Objects":[...], "Prompt":"..."}(识别图中可运动物体 + 运动描述)。20% 静态样例为”large world”(4 个场景、连续调用 LLM 3 次),其余 80% 为”small world”(1 个新场景)。
  • 相机布局:8 种取自电影工业惯例的相机运动(pan/move/pull 等),随机指派给每个静态样例的 next-scene 任务,intra-scene 布局时用 𝒫 替换 𝒩
  • 主观质量指标筛选用的人类研究:200 名参与者,2AFC(二选一强制选择)成对比较,视频采样自 CogVideoX-I2V、VideoCrafter1-I2V、DynamiCrafter、WonderJourney、InvisibleStitch 五个模型,用于枚举候选自动指标组合并挑出与人类偏好一致性最高的(CLIP-IQA+ + CLIP Aesthetic)。
  • 无 sim-to-real 或跨模态 co-training 概念——WorldScore 本身不训练生成模型,数据集只服务于”喂给待评模型 + 算指标”两件事。

训练方法

WorldScore 不训练任何生成模型;“方法”体现在指标经验上下界的构造方式(用于 C.9 的线性归一化 s_norm = ⟨(s−b_min)/(b_max−b_min)⟩,越高越好取原式,越低越好取 1−式):

  • 相机可控性:理论下界天然为 0;上界用”固定相机序列”基线近似(惩罚完全不产生相机运动的生成)。
  • 物体可控性:理论上下界天然为 0%/100%(检测成功率本身有界)。
  • 3D 一致性 / 风格一致性 / 光度一致性:用帧插值合成的”图像对插帧视频”作为经验最差基线(人为制造强烈风格漂移、低 3D 一致性与差光度稳定性),定义为经验上界;经验下界即理论最小值 0。
  • 运动平滑度:从 OpenVid-1M 检索与每条 prompt 语义最相似的真实视频片段(3-10 秒,CLIP 文本特征匹配 top-5),丢偶数帧再双线性插值重建作为”经验最差”(MSE/LPIPS 上界,SSIM 下界);“经验最优”设为 0(完美平滑)。
  • 内容对齐 / 主观质量 / 运动准确性 / 运动幅度:这四项难以定义天然上下界,改用 z-score 重缩放,把被评测模型的表现落在 25-75 分位区间以增强区分度。
  • 无 RL、无 action tokenization、无蒸馏——WorldScore 是纯评测方法论,不涉及模型训练。

Infra(训练 / 推理工程)

  • WorldScore 本身无训练算力开销:指标计算全部复用现成预训练检查点(DROID-SLAM、SEA-RAFT、Grounding-DINO、SAM2、CLIP-IQA+、CLIP Aesthetic、VFIMamba),论文未训练任何新网络。
  • 19 个被评测模型的生成侧算力:论文 Table S1 注明”所有生成均在 H100 与 L40S GPU 上完成”,单实例平均生成耗时跨度极大——视频模型从 T2V-Turbo 的 5 秒、WonderWorld 的 10 秒,到 EasyAnimate 的 16 分钟、Allegro 的 0.5 小时;4D-fy 完整生成需要约 20 小时,论文为控制评测成本主动降低迭代步数使其耗时压缩到约 3 小时。
  • 评测侧算力:GitHub 仓库的评测与生成脚本均原生支持 Slurm 多卡并行(--use_slurm True --num_jobs <num_gpu>,基于 submitit),单卡也可跑;总评测算力(GPU 型号数量、总 GPU-hours)论文未披露。
  • 推理 FPS / 控制频率:不适用——WorldScore 是离线评测基准,不涉及实时推理或闭环控制;各被评测模型自身的输出帧率跨度为 8-30 FPS(如 T2V-Turbo 16 FPS、4D-fy 30 FPS、Allegro 15 FPS,详见 Table S1)。

评测 benchmark

论文 Table 2——19 个模型的 WorldScore 全量结果(12 个视频生成模型:含 2 个闭源 I2V Gen-3、Hailuo,6 个开源 I2V,4 个开源 T2V;6 个 3D 场景生成模型;1 个 4D 生成模型 4D-fy):

模型StaticDynamic相机可控物体可控内容对齐3D一致光度一致风格一致主观质量运动准确运动幅度运动平滑
Gen-3(闭源 I2V)60.7157.5829.4762.9250.4968.3187.0962.8263.8554.5327.4868.87
Hailuo(闭源 I2V)57.5556.3622.3969.5673.5367.1862.8254.9152.4463.4627.2070.07
DynamiCrafter52.0947.1925.1547.3625.0072.9060.9578.8554.4041.1139.2526.92
VideoCrafter1-T2V47.1043.5421.6150.4460.7864.8651.3638.0542.6311.7675.0018.87
VideoCrafter1-I2V50.4747.6425.4624.2535.2774.4273.8965.1754.8555.6325.0042.49
VideoCrafter252.5747.4928.9239.0772.4665.1461.8543.7956.7447.1230.4029.39
T2V-Turbo45.6540.2027.8030.6869.1438.7234.8449.6568.7434.8740.097.48
EasyAnimate52.8551.6526.7254.5050.7667.2947.3573.0550.3175.0031.1640.32
CogVideoX-T2V54.1848.7940.2251.0568.1268.8164.2042.1944.6725.0047.3136.28
CogVideoX-I2V62.1559.1238.2740.0736.7386.2188.1283.2262.4469.5626.4260.15
Allegro55.3151.9724.8457.4751.4870.5069.8965.6047.4154.3940.2837.81
Vchitect-2.042.2838.4726.5549.5465.7541.5342.3025.6944.5833.5933.8121.31
SceneScape(3D)50.7335.5184.9947.4428.6476.5462.8821.8532.75000
Text2Room(3D)62.1043.4794.0138.9350.7988.7188.3637.2336.69000
LucidDreamer(3D)70.4049.2888.9341.1875.0090.3790.2048.1058.99000
wonderjourney(3D)63.7544.6384.6037.1035.5480.6079.0362.8266.56000
InvisibleStitch(3D)61.1242.7893.2036.5129.5388.5189.1932.3758.50000
wonderworld(3D)72.6950.8892.9851.7671.2586.8785.5670.5749.81000
4D-fy(4D)27.9832.1069.9255.090.8535.471.5932.040.8922.2222.8880.06

关键发现(论文 4.1 节原文观察)

  • 3D 模型在静态世界生成上全面领先:WonderWorld(72.69)、LucidDreamer(70.40)为前两名,远超最好的视频模型 CogVideoX-I2V(62.15)——因 3D 模型天生具备高相机可控性、更大生成空间带来的高内容对齐,以及高 3D/光度一致性;但代价是不支持动态,扩展到 4D 的 4D-fy 表现很差(Static 27.98,内容对齐仅 0.85,光度一致仅 1.59,主观质量仅 0.89)。
  • 视频模型普遍缺乏相机可控性:即使是视频模型中相机可控性最高的 CogVideoX-T2V(40.22),也远低于任何 3D/4D 模型(3D 模型普遍 85-94)。
  • 最好的开源视频模型不输闭源模型:CogVideoX-I2V 在 WorldScore-Static(62.15)与 WorldScore-Dynamic(59.12)上都高于两个闭源模型 Gen-3(60.71/57.58)与 Hailuo(57.55/56.36),但并非每项都占优——CogVideoX-I2V 相机可控性更强,但物体可控性与内容对齐更弱。
  • 运动平滑度与运动幅度存在权衡:更大幅度的运动通常伴随更低的平滑度(如 EasyAnimate 运动幅度 75.00 是全场最高但…运动准确性与平滑度并不领先)。
  • 运动幅度大不代表运动位置准确:两者相关性弱,说明能生成大运动的模型不保证运动发生在正确区域,可能是幻觉出无关运动或意外相机运动。
  • 视频模型在长序列与户外场景上更弱(论文 Figure 7,按子域细分的 WorldScore-Static):large-world(长序列)任务上视频模型显著吃力;户外场景上视频模型与 3D 模型的差距比室内场景更大。
  • T2V 比 I2V 更易被操控:对比 CogVideoX-T2V 与 CogVideoX-I2V,T2V 版本可控性与运动幅度更高,I2V 版本质量维度更高——原因是 T2V 模型更愿意生成大幅相机运动,而 I2V 模型倾向于贴着输入图像视角不动。

创新点与影响

  • 首个跨范式(3D/4D/T2V/I2V)统一的世界生成评测基准:把”世界生成”形式化为可跨方法论比较的”下一场景生成”序列任务,填补此前基准(VBench、WorldModelBench 等)“只测单场景视频质量、不兼容需要相机轨迹输入的 3D/4D 方法”的空白(论文 Table 1 逐项对比)。
  • 10 项指标经人类偏好验证:主观质量指标不是随意选取,而是用 200 人的 2AFC 人类研究在候选自动指标组合里筛出与人类偏好一致性最高的组合(CLIP-IQA+ + CLIP Aesthetic),提升了评测的可信度。
  • 揭示了 2025 年初世界生成领域的系统性短板:3D 模型静态生成强但难扩展到动态/4D;视频模型普遍缺乏相机可控性、在长序列与户外场景上更弱;运动幅度与平滑度/准确性之间存在权衡——论文把这些观察总结为”未来研究方向”(弥合 3D/4D 表示的鸿沟、构建更鲁棒的可控性机制、设计能处理更长场景序列的架构)而非评测方法本身的局限,论文全文未设专门的 Limitations 小节。
  • 持续维护的活跃基准:2025-06 论文被 ICCV 2025 接收;GitHub 仓库在论文发布后持续更新——2025-06 追加了 hunyuanworld-voyager(Voyager)的评测结果,2025-11 补充了 WonderJourney/WonderWorld 的评测适配代码,后续多篇世界模型论文(如 matrix-3dskywork-matrix-gamembzuai-pan-world-model)直接借用 WorldScore 定义的相机误差指标或以其为基线对比,表明其已成为世界生成领域事实上的通用评测参照。
  • 覆盖范围的固有边界:WorldScore 的可控信号局限于文本 + 相机轨迹,不含逐帧键鼠等细粒度交互动作条件——这一空白后来被专注 Minecraft 交互式世界模型的 GameWorld Score(skywork-matrix-game)显式指出并填补,属于该基准范式本身的适用边界,而非论文自陈的不足。

原始链接

一手源存档(sources/)