一句话定位
WorldSimBench 是港中文(深圳)/上海AI Lab/北航/港大团队 2024 年 10 月提出的双轨评测框架,用来回答”视频生成模型能否作为世界模拟器”:先把预测式模型按输出模态与具身程度分成 S0(文本)→S1(图像)→S2(视频)→S3(可转化为可执行动作的视频,即”World Simulator”)四级,再针对 S3 级设计显式感知评测(Explicit Perceptual Evaluation,人类偏好打分)+ 隐式操控评测(Implicit Manipulative Evaluation,闭环具身任务成功率)的组合,覆盖开放式具身环境(Minecraft)、自动驾驶(CARLA)、机器人操作(CALVIN)三大场景;配套构建了 35,701 条细粒度人类反馈标注的 HF-Embodied Dataset,并基于 Flash-VStream 微调出人类偏好评估器(Human Preference Evaluator, HPE),在与人类偏好的对齐度上全面超过 GPT-4o(如 AD 场景总体 PLCC 0.60 vs 0.28)。
背景与定位
Sora 之后”视频生成模型即通用世界模拟器”的叙事流行开来,但已有评测体系存在结构性缺口:S0 阶段的 AgentBench(见 agentbench)、EgoPlan-Bench、MMWorld、VAB 只测文本规划/任务完成;S1/S2 阶段的 LEGO、VBench(见 vbench)、EvalCrafter 只用特征相似度做美学评估;这些方法都无法评估”具身场景关心的物理属性”(透视一致性、物体可破坏性等),也没有能力验证生成视频能否被转化为正确的控制信号。WorldSimBench 把评测目标明确定位在 S3 级——不仅要求视频”好看”,还要求视频内容遵守物理规则、能与执行的动作对齐。
论文与同期的 phygenbench(上海AI Lab/OpenGVLab,同月发布,160 条物理常识 T2V prompt + 分层 VLM 评估器 PhyGenEval)构成互补:PhyGenBench 聚焦”单一物理定律是否被正确渲染”的细粒度物理常识判断,WorldSimBench 则把范围扩展到具身智能全链路——既有基于人类偏好的视觉/条件一致性/具身性打分,也有把生成视频接入真实仿真环境(MineRL/CARLA/CALVIN,CALVIN 见 calvin)后测任务成功率的闭环验证,是目前少数把”生成质量评测”与”下游可执行性评测”绑定在同一套基准里的工作。范式命名:分层能力定义(S0-S3)+ 双轨(显式人类偏好 / 隐式闭环动作)评测框架。
模型架构
WorldSimBench 本身不训练生成式世界模型,其”架构”体现在评测流水线与评估器上:
预测式模型分级体系(S0-S3)
- S0:仅输出文本预测(LLM/MLLM 驱动的高层规划),代表工作如 PaLM-E。
- S1:输出图像预测但不含时间信息(如 LEGO 一类的目标图像生成)。
- S2:输出视频预测,但受限于模型能力,评测只看美学质量(VBench/EvalCrafter 覆盖此级)。
- S3:“World Simulator”级——视频预测需遵守物理规则并与可执行动作对齐,WorldSimBench 专门评这一级。
Explicit Perceptual Evaluation 的人类偏好评估器(HPE)
- 基座:Flash-VStream(一个面向长视频流式理解的 VideoLLM),只训练 LoRA 参数,其余权重冻结。
- 输入:采样后的视频帧序列 + prompt(prompt 内含当前场景类型、生成视频所用的指令、被评估的具体维度及该维度的文字定义)。
- 输出:1 到 n 的标量分数(n 依场景而定:OE 取 n=2 二值判断,AD/RM 取 n=5 连续打分)。
- 训练时不使用标注员写的定性理由做 CoT 监督——因为不同标注员给出的理由文字差异很大,模型难以学习一致的推理路径。
Implicit Manipulative Evaluation 的三套 video-to-action 模型(分别对应三大场景,均为现成/复现的下游控制模型,而非本文原创)
- OE(Minecraft/MineRL):复用预训练的 Steve-1(visual) 目标条件(goal-based)策略,未做额外微调;因为是目标条件策略而非逆动力学模型(IDM),可以额外用来评估纯文生视频模型。
- AD(CARLA):复用预训练 LMDrive 模型(waypoint 输出型),在其基础上额外微调——用任意文本指令替换原指令、并用生成的未来帧替换视觉输入,其余训练设置与 LMDrive 保持一致。
- RM(CALVIN):复用预训练 Susie 风格的目标条件扩散策略,未做额外微调。
闭环评测循环:World Simulator 依据当前观测 + 文本指令生成情境感知视频 → video-to-action 模型把视频转化为 k 步动作(k 为测试超参数,具体数值论文未披露)→ 执行完 k 步后,World Simulator 基于新观测重新采样视频 → 循环直至任务成功/超时/碰撞终止。
数据
HF-Embodied Dataset(Explicit Perceptual Evaluation 的训练/评测数据,Table 4):
| 场景 | 指令 | 视频 | 维度 | 动作类别 | 正例 | 负例 |
|---|---|---|---|---|---|---|
| OE(开放式具身环境) | 270 | 8,401 | 7 | 11 | 121,249 | 79,965 |
| AD(自动驾驶) | 5 | 15,870 | 6 | 5 | 56,768 | 35,044 |
| RM(机器人操作) | 2,556 | 11,430 | 7 | 26 | 70,672 | 9,338 |
三场景视频总数 8,401+15,870+11,430 = 35,701,与摘要所述总量一致;AD/RM 场景以标注分数 ≥3(满分 5)为正例阈值,OE 为二值判断。AD 场景指令仅 5 类(前进/后退/左转/右转/停止),且为增强 HPE 对真实驾驶场景的理解,额外补充了真实世界驾驶视频。
数据来源:OE 用 OpenAI Contractor Gameplay Dataset(人类操作员录制的 Minecraft 按键+鼠标序列,即 VPT 数据集);AD 用 nuScenes 训练集;RM 用 RH20T-P(基于 RH20T 构建、面向 primitive-level 机器人操作的数据集,训练时剔除含具体坐标信息的指令以提升泛化性)。
生成 HF-Embodied 视频所用的 8 个 T2V/TI2V 模型:Open-Sora-Plan(T2V)、Lavie、ModelScope、OpenSora、AnimateDiff、Open-Sora-Plan(TI2V)、DynamiCrafter、EasyAnimate。每个模型按各自默认训练视频长度微调出 short(Table 5 明确列出均为 16 帧,正文另处笼统表述为”约 20 帧”)与 long(48-64 帧,Open-Sora-Plan 64/Lavie 48/ModelScope 60/OpenSora 48/AnimateDiff 64/DynamiCrafter 60/EasyAnimate 64)两种版本以增加评测集多样性。Open-Sora-Plan(TI2V) 由 T2V 版本改造而来——参照 DynamiCrafter 的做法替换首帧输入并扩展通道维度,使模型能以首帧为条件生成。
Implicit Manipulative Evaluation 训练/测试数据:
- OE:用 VPT 数据集 + 自采集轨迹(用多个预训练 Steve-1 agent 生成,轨迹间随机切换模型、重置 agent 记忆、随机调整朝向以增强分布多样性)。
- AD:用 LMDrive 训练数据集,遵循 Vista 的做法以 10 Hz 采样 25 帧的视频片段;动作指令按规划惯例定义为”turn right / turn left / go straight / stop”。
- RM:用完整 CALVIN(ABC_D) 数据集。
闭环测试规模:OE 用 5 个任务(收集木头/泥土/种子、探索、垂直挖掘)× 每任务 10 组不同随机种子的 trial,单次最长 3,000 帧(约 2.5 分钟游戏时长);AD 用 LangAuto-Tiny(路线长度 <150m)设置,覆盖 CARLA 全部 8 个公开城镇,论文声称覆盖”16 种环境条件”(由 7 种天气 Clear/Cloudy/Wet/MidRain/WetCloudy/HardRain/SoftRain 与 3 种昼夜 Night/Noon/Sunset 组合而成——按原文列出的数字相乘应为 21 种组合,“16”为原文数字,此处如实转录);RM 用 CALVIN 标准协议,在 A/B/C 环境上训练策略、D 环境零样本测试,评测集含 1,000 条由 5 个子任务组成的指令链。
训练方法
HPE(Human Preference Evaluator)训练:基于 Flash-VStream 只训练 LoRA 参数;三场景使用一致的训练配置——视频采样频率为 4(每 4 帧采一帧),优化器 AdamW,学习率调度用 cosine decay,训练 4 epoch,学习率 2e-5,warmup ratio 0.03;为避免对特定生成模型或特定 prompt 过拟合,训练前对 HF-Embodied Dataset 做了跨生成模型、跨评测维度的均衡采样过滤。
8 个视频生成模型的场景微调:均使用各模型官方实现、不改变原始训练设置,仅按各场景数据集(OE 用 VPT 数据+captions,AD 用 nuScenes 训练集,RM 用 RH20T-P 剔除坐标指令后的数据)做微调;每个模型分别微调出 short/long 两种帧长版本。
Implicit 闭环所需 video-to-action 模型:均复用/微调自现成的下游控制方法而非本文原创——OE 直接用预训练 Steve-1(visual);AD 在预训练 LMDrive 基础上把视觉输入换成生成的未来帧、指令换成任意文本后继续训练(其余设置不变);RM 直接用预训练 Susie 策略。三者均未针对本文任务重新设计模型结构。
评测执行方式:Explicit Perceptual Evaluation——对每个场景每个维度从 Task Instruction Prompt List 中抽取 5 条强相关指令,每条指令生成 5 个视频,由 HPE 打分后取平均作为该维度得分,全维度平均得到模型总分。Implicit Manipulative Evaluation——按上文闭环循环(生成视频→转动作→执行 k 步→重新生成)跑到任务终止,用各场景特定指标(OE 的位移/挖掘深度/物品数、AD 的 CARLA 八项指标、RM 的连续任务成功率)衡量效果。
Infra(训练 / 推理工程)
- HPE 训练:4 张 A100 80GB GPU;4 epoch,学习率 2e-5,warmup 0.03(见上);GPU-hours、batch size、精度(fp16/bf16)未披露。
- 8 个视频生成模型的场景微调:沿用各模型官方训练脚本与默认设置,论文未给出微调所用的 GPU 数量/GPU-hours/并行策略等具体 infra 数字,未披露。
- video-to-action 模型(Steve-1/LMDrive/Susie)的训练与推理 infra:论文未给出具体训练资源或推理延迟/控制频率数字,仅说明 AD 场景的输入视频片段按 10 Hz 采样、25 帧;闭环测试中”k 步执行后重新采样”的 k 值为测试超参数,具体数值未披露。
- 推理速度/延迟:整体 pipeline(World Simulator 生成 → video-to-action 转换 → 环境执行)声称”实时”(real-time)运行以支撑闭环测试,但论文未给出具体 FPS、控制频率(Hz)或端到端延迟数字,未披露。
评测 benchmark
HPE vs GPT-4o 总体对齐度(正文 Table 3;OE 用 Acc,二值判断;AD/RM 用 PLCC,1-5 分打分):
| Embodied Scenario | GPT-4o | HPE | GPT-4o@OpenSora(零样本) | HPE@OpenSora(零样本) | GPT-4o@Lavie(零样本) | HPE@Lavie(零样本) |
|---|---|---|---|---|---|---|
| OE @Acc(↑) | 72.8 | 89.4 | 66.5 | 71.6 | 78.5 | 87.9 |
| AD @PLCC(↑) | 0.28 | 0.60 | 0.03 | 0.34 | −0.04 | 0.49 |
| RM @PLCC(↑) | 0.07 | 0.43 | −0.06 | 0.47 | 0.17 | 0.44 |
“@OpenSora”/“@Lavie” 表示 HPE 训练时剔除该模型生成的视频、在其上做零样本验证(HPE@Lavie 即用除 Lavie 外数据训练、在 Lavie 生成视频上验证)。GPT-4o 在 AD@OpenSora 与 RM@Lavie 零样本设置下与人类偏好呈负相关,HPE 在同等零样本设置下仍保持正相关,体现更强的泛化性。
分维度细化结果(附录 Table 6,节选 Overall 列已如上,此处补充典型维度):RM 场景中 Embodied Interaction 与 Trajectory 两个维度 GPT-4o 分别为 −0.14 / −0.01(负/近零相关),HPE 分别为 0.44 / 0.56,是 HPE 相对 GPT-4o 优势最大的维度之一。
Explicit Perceptual Evaluation 主结果(附录 Table 7-9,7 个视频生成模型,各维度缩写见”模型架构”前的 Table 2 定义):
OE(1-2 分制)Overall:Open-Sora-Plan 1.69,Lavie 1.79,ModelScope 1.91,OpenSora 1.79,AnimateDiff 1.40(最低),DynamiCrafter 1.84,EasyAnimate 1.62。
AD(1-5 分制)Overall:Open-Sora-Plan 2.37,Lavie 3.21,ModelScope 3.86,OpenSora 4.40(最高),AnimateDiff 2.37,DynamiCrafter 3.57,EasyAnimate 1.93(最低)。
RM(1-5 分制)Overall:Open-Sora-Plan 3.84,Lavie 3.94,ModelScope 3.83,OpenSora 3.85,AnimateDiff 3.82,DynamiCrafter 4.14(最高),EasyAnimate 3.49(最低);RM 场景所有模型的 Instruction Alignment 维度普遍很低(如 Open-Sora-Plan 仅 1.0,ModelScope 仅 1.18),说明模型倾向生成”看似合理但无目标”的动作。
Implicit Manipulative Evaluation —— OE 闭环结果(附录 Table 11,5 个模型分 Text / Text&Image 两种输入条件,AVG 为归一化平均分,Travel Dis. 已除以 10 折算):
Text 条件下 OpenSora AVG 最高(27.80,Collect Dirt 70.20、Travel Dis. 339.87),Open-Sora-Plan(26.38)与 Lavie(26.06)接近,ModelScope 较低(21.05),AnimateDiff 最弱(13.10)。Text&Image 条件下所有模型分数显著下降——Open-Sora-Plan 从 26.38 掉到 10.28(Travel Dis. 从 342.91 掉到 195.14),DynamiCrafter(4.06)与 EasyAnimate(4.84)在该条件下 Collect Wood 任务分别仅 0.40 / 0.20 分、Collect Seed 任务分别仅 1.30 / 1.70 分,几乎无法完成。
Implicit Manipulative Evaluation —— AD 闭环结果(附录 Table 12,CARLA 八项指标,仅 3 个模型有闭环测试数据):
| Model | DS(↑) | RC(↑) | IS(↑) | VC(↓) | PC(↓) | LC(↓) | RV(↓) | OI(↓) |
|---|---|---|---|---|---|---|---|---|
| Open-Sora-Plan | 31.054 | 38.249 | 0.767 | 2.400 | 0.000 | 4.401 | 1.133 | 3.514 |
| DynamiCrafter | 24.491 | 37.189 | 0.599 | 5.030 | 0.000 | 4.896 | 0.937 | 3.221 |
| EasyAnimate | 17.414 | 28.475 | 0.607 | 0.000 | 0.000 | 29.344 | 0.000 | 1.690 |
Open-Sora-Plan 在 Driving Score(DS,综合排名指标)上最高;EasyAnimate 虽然车辆/行人碰撞(VC/PC)为 0,但 Layout Collisions(LC,撞路沿/障碍物)高达 29.344,反映其生成视频轨迹质量差导致频繁”軟碰撞”。
Implicit Manipulative Evaluation —— RM 闭环结果(附录 Table 13,CALVIN ABC→D,连续完成 1-5 个任务的比例与平均任务链长度,仅 3 个模型有闭环测试数据):
| Method | 完成1个(%) | 完成2个(%) | 完成3个(%) | 完成4个(%) | 完成5个(%) | Avg. Len. |
|---|---|---|---|---|---|---|
| Open-Sora-Plan | 0.85 | 0.70 | 0.60 | 0.40 | 0.40 | 2.95 |
| DynamiCrafter | 0.95 | 0.75 | 0.55 | 0.25 | 0.25 | 2.75 |
| EasyAnimate | 0.90 | 0.60 | 0.35 | 0.10 | 0.10 | 2.05 |
Open-Sora-Plan 平均任务链长度最高(2.95/5),DynamiCrafter 首个任务成功率最高(0.95)但随任务链变长衰减最快,反映长时序一致性不足。
Explicit 与 Implicit 结果的一致性讨论:DynamiCrafter 在 Explicit 评测的 Trajectory 维度得分高,在强调轨迹质量的 AD/RM 场景闭环任务中也表现较好;但在需要频繁交互的 OE 场景与 RM 长任务链(4、5 步)上,DynamiCrafter 反而不如 Open-Sora-Plan——论文将其归因于这类任务需要更稳定的长时序高质量视频生成,Open-Sora-Plan 鲁棒性更高,说明单看 Explicit 分数不足以预测 Implicit 闭环表现。
创新点与影响
- 首次给预测式模型定义 S0-S3 分级体系,把”World Simulator”明确定位为 S3 级——视频预测需兼具物理规则遵循与动作可执行性,为后续研究提供了可对齐的能力坐标系(Table 1 据此系统梳理了 AgentBench/EgoPlan-Bench/MMWorld/VAB/LEGO/VBench/EvalCrafter 等既有基准各自所处的阶段)。
- 提出显式感知 + 隐式操控的双轨评测框架,是较早把”生成质量的人类偏好评分”与”生成视频驱动真实闭环任务的成功率”绑定在同一基准内的工作,弥补了纯美学评测(VBench/EvalCrafter)与纯文本任务评测(AgentBench 系)都无法覆盖”视频能否转化为正确动作”这一问题的空白。
- HF-Embodied Dataset(35,701 条细粒度人类反馈标注,覆盖 3 场景 20 个维度)不仅用于训练本文的 HPE,论文指出其还可用于视频生成模型的对齐(alignment)等更广泛用途。
- HPE 全面超越 GPT-4o 的人类偏好对齐度,且在零样本(未见过生成模型)设置下依然保持正相关,而 GPT-4o 在同等零样本设置下(AD@OpenSora、RM@Lavie)出现负相关,说明现成通用 MLLM 直接做具身视频评分并不可靠,需要针对性微调。
- 实证结论:当前 8 个开源视频生成模型在物理规则遵循上仍普遍不足(如 OE 场景中物体形变/破坏类的 Embodied Interaction 维度普遍低分,RM 场景 Instruction Alignment 普遍低分),距离真正的 World Simulator 仍有明显差距。
- 论文自述局限:目前的评测体系主要从机器人/具身智能视角评估物理规则与 3D 内容,但 World Simulator 的应用场景不止于机器人,不同场景有不同的物理表现形式,如何在其他场景中有效评估 World Simulator 仍需更多探索。
原始链接
- arXiv 论文:https://arxiv.org/abs/2410.18072(PDF:https://arxiv.org/pdf/2410.18072)
- 项目主页(含 PDF 链接、Code/Dataset 占位按钮但截至抓取时未挂真实链接):https://iranqin.github.io/WorldSimBench.github.io/
一手源存档(sources/)
- worldsimbench—project-page — 项目主页快照(含摘要、分级体系、Explicit/Implicit 评测框架图说明、BibTeX;已核实 Code/Dataset 按钮当前无 href),fetched 2026-07-16
- arXiv 原文全文(HTML v1,2410.18072)已通读,正文与附录 A-F 数字均取自此;arXiv 原文 PDF,不入 git,见上方 arXiv 链接。