一句话定位

WorldSimBench 是港中文(深圳)/上海AI Lab/北航/港大团队 2024 年 10 月提出的双轨评测框架,用来回答”视频生成模型能否作为世界模拟器”:先把预测式模型按输出模态与具身程度分成 S0(文本)→S1(图像)→S2(视频)→S3(可转化为可执行动作的视频,即”World Simulator”)四级,再针对 S3 级设计显式感知评测(Explicit Perceptual Evaluation,人类偏好打分)+ 隐式操控评测(Implicit Manipulative Evaluation,闭环具身任务成功率)的组合,覆盖开放式具身环境(Minecraft)、自动驾驶(CARLA)、机器人操作(CALVIN)三大场景;配套构建了 35,701 条细粒度人类反馈标注的 HF-Embodied Dataset,并基于 Flash-VStream 微调出人类偏好评估器(Human Preference Evaluator, HPE),在与人类偏好的对齐度上全面超过 GPT-4o(如 AD 场景总体 PLCC 0.60 vs 0.28)。

背景与定位

Sora 之后”视频生成模型即通用世界模拟器”的叙事流行开来,但已有评测体系存在结构性缺口:S0 阶段的 AgentBench(见 agentbench)、EgoPlan-Bench、MMWorld、VAB 只测文本规划/任务完成;S1/S2 阶段的 LEGO、VBench(见 vbench)、EvalCrafter 只用特征相似度做美学评估;这些方法都无法评估”具身场景关心的物理属性”(透视一致性、物体可破坏性等),也没有能力验证生成视频能否被转化为正确的控制信号。WorldSimBench 把评测目标明确定位在 S3 级——不仅要求视频”好看”,还要求视频内容遵守物理规则、能与执行的动作对齐。

论文与同期的 phygenbench(上海AI Lab/OpenGVLab,同月发布,160 条物理常识 T2V prompt + 分层 VLM 评估器 PhyGenEval)构成互补:PhyGenBench 聚焦”单一物理定律是否被正确渲染”的细粒度物理常识判断,WorldSimBench 则把范围扩展到具身智能全链路——既有基于人类偏好的视觉/条件一致性/具身性打分,也有把生成视频接入真实仿真环境(MineRL/CARLA/CALVIN,CALVIN 见 calvin)后测任务成功率的闭环验证,是目前少数把”生成质量评测”与”下游可执行性评测”绑定在同一套基准里的工作。范式命名:分层能力定义(S0-S3)+ 双轨(显式人类偏好 / 隐式闭环动作)评测框架

模型架构

WorldSimBench 本身不训练生成式世界模型,其”架构”体现在评测流水线与评估器上:

预测式模型分级体系(S0-S3)

  • S0:仅输出文本预测(LLM/MLLM 驱动的高层规划),代表工作如 PaLM-E。
  • S1:输出图像预测但不含时间信息(如 LEGO 一类的目标图像生成)。
  • S2:输出视频预测,但受限于模型能力,评测只看美学质量(VBench/EvalCrafter 覆盖此级)。
  • S3:“World Simulator”级——视频预测需遵守物理规则并与可执行动作对齐,WorldSimBench 专门评这一级。

Explicit Perceptual Evaluation 的人类偏好评估器(HPE)

  • 基座:Flash-VStream(一个面向长视频流式理解的 VideoLLM),只训练 LoRA 参数,其余权重冻结。
  • 输入:采样后的视频帧序列 + prompt(prompt 内含当前场景类型、生成视频所用的指令、被评估的具体维度及该维度的文字定义)。
  • 输出:1 到 n 的标量分数(n 依场景而定:OE 取 n=2 二值判断,AD/RM 取 n=5 连续打分)。
  • 训练时不使用标注员写的定性理由做 CoT 监督——因为不同标注员给出的理由文字差异很大,模型难以学习一致的推理路径。

Implicit Manipulative Evaluation 的三套 video-to-action 模型(分别对应三大场景,均为现成/复现的下游控制模型,而非本文原创)

  • OE(Minecraft/MineRL):复用预训练的 Steve-1(visual) 目标条件(goal-based)策略,未做额外微调;因为是目标条件策略而非逆动力学模型(IDM),可以额外用来评估纯文生视频模型。
  • AD(CARLA):复用预训练 LMDrive 模型(waypoint 输出型),在其基础上额外微调——用任意文本指令替换原指令、并用生成的未来帧替换视觉输入,其余训练设置与 LMDrive 保持一致。
  • RM(CALVIN):复用预训练 Susie 风格的目标条件扩散策略,未做额外微调。

闭环评测循环:World Simulator 依据当前观测 + 文本指令生成情境感知视频 → video-to-action 模型把视频转化为 k 步动作(k 为测试超参数,具体数值论文未披露)→ 执行完 k 步后,World Simulator 基于新观测重新采样视频 → 循环直至任务成功/超时/碰撞终止。

数据

HF-Embodied Dataset(Explicit Perceptual Evaluation 的训练/评测数据,Table 4):

场景指令视频维度动作类别正例负例
OE(开放式具身环境)2708,401711121,24979,965
AD(自动驾驶)515,8706556,76835,044
RM(机器人操作)2,55611,43072670,6729,338

三场景视频总数 8,401+15,870+11,430 = 35,701,与摘要所述总量一致;AD/RM 场景以标注分数 ≥3(满分 5)为正例阈值,OE 为二值判断。AD 场景指令仅 5 类(前进/后退/左转/右转/停止),且为增强 HPE 对真实驾驶场景的理解,额外补充了真实世界驾驶视频。

数据来源:OE 用 OpenAI Contractor Gameplay Dataset(人类操作员录制的 Minecraft 按键+鼠标序列,即 VPT 数据集);AD 用 nuScenes 训练集;RM 用 RH20T-P(基于 RH20T 构建、面向 primitive-level 机器人操作的数据集,训练时剔除含具体坐标信息的指令以提升泛化性)。

生成 HF-Embodied 视频所用的 8 个 T2V/TI2V 模型:Open-Sora-Plan(T2V)、Lavie、ModelScope、OpenSora、AnimateDiff、Open-Sora-Plan(TI2V)、DynamiCrafter、EasyAnimate。每个模型按各自默认训练视频长度微调出 short(Table 5 明确列出均为 16 帧,正文另处笼统表述为”约 20 帧”)与 long(48-64 帧,Open-Sora-Plan 64/Lavie 48/ModelScope 60/OpenSora 48/AnimateDiff 64/DynamiCrafter 60/EasyAnimate 64)两种版本以增加评测集多样性。Open-Sora-Plan(TI2V) 由 T2V 版本改造而来——参照 DynamiCrafter 的做法替换首帧输入并扩展通道维度,使模型能以首帧为条件生成。

Implicit Manipulative Evaluation 训练/测试数据

  • OE:用 VPT 数据集 + 自采集轨迹(用多个预训练 Steve-1 agent 生成,轨迹间随机切换模型、重置 agent 记忆、随机调整朝向以增强分布多样性)。
  • AD:用 LMDrive 训练数据集,遵循 Vista 的做法以 10 Hz 采样 25 帧的视频片段;动作指令按规划惯例定义为”turn right / turn left / go straight / stop”。
  • RM:用完整 CALVIN(ABC_D) 数据集。

闭环测试规模:OE 用 5 个任务(收集木头/泥土/种子、探索、垂直挖掘)× 每任务 10 组不同随机种子的 trial,单次最长 3,000 帧(约 2.5 分钟游戏时长);AD 用 LangAuto-Tiny(路线长度 <150m)设置,覆盖 CARLA 全部 8 个公开城镇,论文声称覆盖”16 种环境条件”(由 7 种天气 Clear/Cloudy/Wet/MidRain/WetCloudy/HardRain/SoftRain 与 3 种昼夜 Night/Noon/Sunset 组合而成——按原文列出的数字相乘应为 21 种组合,“16”为原文数字,此处如实转录);RM 用 CALVIN 标准协议,在 A/B/C 环境上训练策略、D 环境零样本测试,评测集含 1,000 条由 5 个子任务组成的指令链。

训练方法

HPE(Human Preference Evaluator)训练:基于 Flash-VStream 只训练 LoRA 参数;三场景使用一致的训练配置——视频采样频率为 4(每 4 帧采一帧),优化器 AdamW,学习率调度用 cosine decay,训练 4 epoch,学习率 2e-5,warmup ratio 0.03;为避免对特定生成模型或特定 prompt 过拟合,训练前对 HF-Embodied Dataset 做了跨生成模型、跨评测维度的均衡采样过滤。

8 个视频生成模型的场景微调:均使用各模型官方实现、不改变原始训练设置,仅按各场景数据集(OE 用 VPT 数据+captions,AD 用 nuScenes 训练集,RM 用 RH20T-P 剔除坐标指令后的数据)做微调;每个模型分别微调出 short/long 两种帧长版本。

Implicit 闭环所需 video-to-action 模型:均复用/微调自现成的下游控制方法而非本文原创——OE 直接用预训练 Steve-1(visual);AD 在预训练 LMDrive 基础上把视觉输入换成生成的未来帧、指令换成任意文本后继续训练(其余设置不变);RM 直接用预训练 Susie 策略。三者均未针对本文任务重新设计模型结构。

评测执行方式:Explicit Perceptual Evaluation——对每个场景每个维度从 Task Instruction Prompt List 中抽取 5 条强相关指令,每条指令生成 5 个视频,由 HPE 打分后取平均作为该维度得分,全维度平均得到模型总分。Implicit Manipulative Evaluation——按上文闭环循环(生成视频→转动作→执行 k 步→重新生成)跑到任务终止,用各场景特定指标(OE 的位移/挖掘深度/物品数、AD 的 CARLA 八项指标、RM 的连续任务成功率)衡量效果。

Infra(训练 / 推理工程)

  • HPE 训练4 张 A100 80GB GPU;4 epoch,学习率 2e-5,warmup 0.03(见上);GPU-hours、batch size、精度(fp16/bf16)未披露
  • 8 个视频生成模型的场景微调:沿用各模型官方训练脚本与默认设置,论文未给出微调所用的 GPU 数量/GPU-hours/并行策略等具体 infra 数字,未披露
  • video-to-action 模型(Steve-1/LMDrive/Susie)的训练与推理 infra:论文未给出具体训练资源或推理延迟/控制频率数字,仅说明 AD 场景的输入视频片段按 10 Hz 采样、25 帧;闭环测试中”k 步执行后重新采样”的 k 值为测试超参数,具体数值未披露
  • 推理速度/延迟:整体 pipeline(World Simulator 生成 → video-to-action 转换 → 环境执行)声称”实时”(real-time)运行以支撑闭环测试,但论文未给出具体 FPS、控制频率(Hz)或端到端延迟数字,未披露

评测 benchmark

HPE vs GPT-4o 总体对齐度(正文 Table 3;OE 用 Acc,二值判断;AD/RM 用 PLCC,1-5 分打分):

Embodied ScenarioGPT-4oHPEGPT-4o@OpenSora(零样本)HPE@OpenSora(零样本)GPT-4o@Lavie(零样本)HPE@Lavie(零样本)
OE @Acc(↑)72.889.466.571.678.587.9
AD @PLCC(↑)0.280.600.030.34−0.040.49
RM @PLCC(↑)0.070.43−0.060.470.170.44

“@OpenSora”/“@Lavie” 表示 HPE 训练时剔除该模型生成的视频、在其上做零样本验证(HPE@Lavie 即用除 Lavie 外数据训练、在 Lavie 生成视频上验证)。GPT-4o 在 AD@OpenSora 与 RM@Lavie 零样本设置下与人类偏好呈负相关,HPE 在同等零样本设置下仍保持正相关,体现更强的泛化性。

分维度细化结果(附录 Table 6,节选 Overall 列已如上,此处补充典型维度):RM 场景中 Embodied Interaction 与 Trajectory 两个维度 GPT-4o 分别为 −0.14 / −0.01(负/近零相关),HPE 分别为 0.44 / 0.56,是 HPE 相对 GPT-4o 优势最大的维度之一。

Explicit Perceptual Evaluation 主结果(附录 Table 7-9,7 个视频生成模型,各维度缩写见”模型架构”前的 Table 2 定义):

OE(1-2 分制)Overall:Open-Sora-Plan 1.69,Lavie 1.79,ModelScope 1.91,OpenSora 1.79,AnimateDiff 1.40(最低),DynamiCrafter 1.84,EasyAnimate 1.62。

AD(1-5 分制)Overall:Open-Sora-Plan 2.37,Lavie 3.21,ModelScope 3.86,OpenSora 4.40(最高),AnimateDiff 2.37,DynamiCrafter 3.57,EasyAnimate 1.93(最低)。

RM(1-5 分制)Overall:Open-Sora-Plan 3.84,Lavie 3.94,ModelScope 3.83,OpenSora 3.85,AnimateDiff 3.82,DynamiCrafter 4.14(最高),EasyAnimate 3.49(最低);RM 场景所有模型的 Instruction Alignment 维度普遍很低(如 Open-Sora-Plan 仅 1.0,ModelScope 仅 1.18),说明模型倾向生成”看似合理但无目标”的动作。

Implicit Manipulative Evaluation —— OE 闭环结果(附录 Table 11,5 个模型分 Text / Text&Image 两种输入条件,AVG 为归一化平均分,Travel Dis. 已除以 10 折算):

Text 条件下 OpenSora AVG 最高(27.80,Collect Dirt 70.20、Travel Dis. 339.87),Open-Sora-Plan(26.38)与 Lavie(26.06)接近,ModelScope 较低(21.05),AnimateDiff 最弱(13.10)。Text&Image 条件下所有模型分数显著下降——Open-Sora-Plan 从 26.38 掉到 10.28(Travel Dis. 从 342.91 掉到 195.14),DynamiCrafter(4.06)与 EasyAnimate(4.84)在该条件下 Collect Wood 任务分别仅 0.40 / 0.20 分、Collect Seed 任务分别仅 1.30 / 1.70 分,几乎无法完成。

Implicit Manipulative Evaluation —— AD 闭环结果(附录 Table 12,CARLA 八项指标,仅 3 个模型有闭环测试数据):

ModelDS(↑)RC(↑)IS(↑)VC(↓)PC(↓)LC(↓)RV(↓)OI(↓)
Open-Sora-Plan31.05438.2490.7672.4000.0004.4011.1333.514
DynamiCrafter24.49137.1890.5995.0300.0004.8960.9373.221
EasyAnimate17.41428.4750.6070.0000.00029.3440.0001.690

Open-Sora-Plan 在 Driving Score(DS,综合排名指标)上最高;EasyAnimate 虽然车辆/行人碰撞(VC/PC)为 0,但 Layout Collisions(LC,撞路沿/障碍物)高达 29.344,反映其生成视频轨迹质量差导致频繁”軟碰撞”。

Implicit Manipulative Evaluation —— RM 闭环结果(附录 Table 13,CALVIN ABC→D,连续完成 1-5 个任务的比例与平均任务链长度,仅 3 个模型有闭环测试数据):

Method完成1个(%)完成2个(%)完成3个(%)完成4个(%)完成5个(%)Avg. Len.
Open-Sora-Plan0.850.700.600.400.402.95
DynamiCrafter0.950.750.550.250.252.75
EasyAnimate0.900.600.350.100.102.05

Open-Sora-Plan 平均任务链长度最高(2.95/5),DynamiCrafter 首个任务成功率最高(0.95)但随任务链变长衰减最快,反映长时序一致性不足。

Explicit 与 Implicit 结果的一致性讨论:DynamiCrafter 在 Explicit 评测的 Trajectory 维度得分高,在强调轨迹质量的 AD/RM 场景闭环任务中也表现较好;但在需要频繁交互的 OE 场景与 RM 长任务链(4、5 步)上,DynamiCrafter 反而不如 Open-Sora-Plan——论文将其归因于这类任务需要更稳定的长时序高质量视频生成,Open-Sora-Plan 鲁棒性更高,说明单看 Explicit 分数不足以预测 Implicit 闭环表现。

创新点与影响

  • 首次给预测式模型定义 S0-S3 分级体系,把”World Simulator”明确定位为 S3 级——视频预测需兼具物理规则遵循与动作可执行性,为后续研究提供了可对齐的能力坐标系(Table 1 据此系统梳理了 AgentBench/EgoPlan-Bench/MMWorld/VAB/LEGO/VBench/EvalCrafter 等既有基准各自所处的阶段)。
  • 提出显式感知 + 隐式操控的双轨评测框架,是较早把”生成质量的人类偏好评分”与”生成视频驱动真实闭环任务的成功率”绑定在同一基准内的工作,弥补了纯美学评测(VBench/EvalCrafter)与纯文本任务评测(AgentBench 系)都无法覆盖”视频能否转化为正确动作”这一问题的空白。
  • HF-Embodied Dataset(35,701 条细粒度人类反馈标注,覆盖 3 场景 20 个维度)不仅用于训练本文的 HPE,论文指出其还可用于视频生成模型的对齐(alignment)等更广泛用途。
  • HPE 全面超越 GPT-4o 的人类偏好对齐度,且在零样本(未见过生成模型)设置下依然保持正相关,而 GPT-4o 在同等零样本设置下(AD@OpenSora、RM@Lavie)出现负相关,说明现成通用 MLLM 直接做具身视频评分并不可靠,需要针对性微调。
  • 实证结论:当前 8 个开源视频生成模型在物理规则遵循上仍普遍不足(如 OE 场景中物体形变/破坏类的 Embodied Interaction 维度普遍低分,RM 场景 Instruction Alignment 普遍低分),距离真正的 World Simulator 仍有明显差距。
  • 论文自述局限:目前的评测体系主要从机器人/具身智能视角评估物理规则与 3D 内容,但 World Simulator 的应用场景不止于机器人,不同场景有不同的物理表现形式,如何在其他场景中有效评估 World Simulator 仍需更多探索。

原始链接

一手源存档(sources/)

  • worldsimbench—project-page — 项目主页快照(含摘要、分级体系、Explicit/Implicit 评测框架图说明、BibTeX;已核实 Code/Dataset 按钮当前无 href),fetched 2026-07-16
  • arXiv 原文全文(HTML v1,2410.18072)已通读,正文与附录 A-F 数字均取自此;arXiv 原文 PDF,不入 git,见上方 arXiv 链接。