世界模型评测:从像素保真到物理·预测·可执行保真

世界模型的评测史,是一部”评测指标追着能力短板跑”的历史。早期(Atari/DMC 时代)评测天然锚定在下游控制回报上——世界模型只是提高样本效率的手段,好坏由 agent 拿多少分说了算。当世界模型转向像素级视频生成后,评测一度被 FID/FVD/美学分主导;但很快人们发现”画面越逼真 ≠ 越懂世界”:physics-iq 直接测出视觉真实度与物理理解的 Pearson 相关系数 r=−0.46(p=.247,不显著)——Sora 视觉最真实却物理理解垫底(8.7/100),worldmodelbench 也测出物理遵循维度与 VBench 各维度的相关系数最高仅 0.41、通常 <0.3。这条”去相关”证据,把整个评测范式从 FID/aesthetics 推向了三个新方向:

  1. 内在保真评测——直接判生成的未来是否遵守物理规律、3D 几何、被指定的动作(videophyworldmodelbenchworldscore-benchmarkphyworldbenchphysics-iq);
  2. 下游可执行保真——把”世界模型能否驱动规划/操作成功”作为 ground truth(dino-wmv-jepa-2video-language-planningunisim);
  3. 领域专用协议——自动驾驶自成一套 nuScenes/NAVSIM 指标体系(开环 L2/碰撞率、4D 占据 mIoU、闭环 PDMS、感知数据增强 NDS/mAP)。

本页按”评测范式 × 时代”横切,梳理这五类指标的具体口径与代表数字。


一、经典 model-based RL:样本效率与规划成功率(2017–2024)

第一代世界模型(Dreamer/MuZero 谱系)的评测标尺是人类归一化分数(HNS)+ 样本效率倍数。这一时代不评”视频好不好看”,只评”用世界模型想象 / 规划出来的策略拿多少分、省多少交互”。

Atari 100k(26 游戏、约 2 小时真实经验) 是最卷的一条基准,也是”无前瞻搜索类世界模型”的主战场。历代 SOTA 的 HNS Mean/Median 单调爬升:

方法类型HNS MeanHNS Median超人(/26)
SimPLe simple-atariVAE 视频模型0.330.131
TWM twm-transformer-world-modelTransformer WM0.9560.5058
IRIS irisTransformer+离散token1.0460.28910
DreamerV3 dreamer-v3RSSM1.120.499
STORM storm随机Transformer WM1.2670.58410
Δ-IRIS delta-iris上下文感知token1.390.65(IQM)11
DIAMOND diamond扩散 WM1.4590.641(IQM)11
TWISTER twister-contrastive-world-model对比预测 WM1.620.7712
— 前瞻搜索类(对照,不直接可比)—
EfficientZero efficientzeroMuZero+SSL1.9431.09014
EfficientZero-V2 efficientzero-v2+Gumbel search2.4281.286

要点:(1)无搜索类从 SimPLe 的 0.33 一路涨到 TWISTER 的 1.62,五年翻近 5 倍;(2)搜索类(EfficientZero 系)始终另立山头——irisstormdreamer-v3 都明确声明不与 MuZero/EfficientZero 直接比,因为 MCTS 前瞻是可叠加的正交技术;(3)架构消融揭示的机理各异——twister-contrastive-world-model 的 AC-CPC 贡献约 50 个百分点(162%→112%)且只在 Transformer 上生效(RSSM+AC-CPC 仅 121%);diamond 靠扩散消除了 iris 那种”帧间敌人↔奖励反复互变”的不一致,且每帧仅 3 NFE。

大数据 Atari / 跨域上,MuZero 谱系刷的是另一个量级。muzero 在 20B 帧、12 小时训练下达 Gamer median 2041%,逐局击败 R2D2 42/57 局、SimPLe 全胜;muzero-unplugged 仅换 ResNet-v2+Adam 就把 median 从 741.7% 推到 1006.4%。dreamer-v3同一套超参跨 8 领域 150+ 任务创下多项 SOTA,头条是首个从零挖到 Minecraft 钻石的算法(10 seeds 100M 步内 100% 挖到,基线 0%)。unizero 用单帧输入即在 15/26 Atari 游戏超过同框架 MuZero,验证”单帧可同时建模长短期依赖”。

样本效率是这代模型的另一核心卖点,各家口径差异很大但量级一致:planet 相对 D4PG 平均省约 200×(cartpole 250×、cheetah 500+×);dreamer-v1 用 20× 更少交互超过 D4PG;mbpo 在 Ant 上 30 万步达到 SAC 300 万步的性能(10×);lightzero 的 MuZero 在 GoBigger 上比 MAPPO 省约 6×;dreamer-v3 在 DMLab 上 100M 步超过 IMPALA/R2D2 的 1B 步(10× 数据效率)。棋类/随机域里 muzerostochastic-muzero(2048、Backgammon 匹配完美模拟器 AlphaZero)、sampled-muzero(大动作空间)、gumbel-muzero(n=2 模拟即可学)用 Elo 曲线评。

连续控制/高维 locomotion上标尺换成 DMC episode return。td-mpc2 用同一超参在 4 域 104 任务超过 DreamerV3/SAC,Pick-YCB 14M 步 >60% 成功率;efficientzero-v2 的 Vision Control 均值 726.1 比 DreamerV3 的 498.5 高 45%;unizero 在 18 个 Proprio 任务上均值/中位数(787.2/875.1)超过 DreamerV3(743.7/845.5)。机理对照上,daydreamer 直接在真实机器人上评”物体/分钟”(UR5 达 2.5、XArm 达 3.1,逼近人类)而 Rainbow/PPO 收敛到”抓了就放回原侧”;s4wm-world-model-backbones记忆任务(Multi Doors Keys skill-level MPC 成功率 S4WM 100% vs RSSM/TSSM 约一半)证明状态空间骨干在长记忆上的优势;harmonydream 一类工作则专攻”任务奖励 vs 观测重建”的权重平衡。


二、动作保真与可控性(controllability / action-fidelity)

当世界模型从”学策略”转向”生成可交互的未来”,一批**专门测”生成的未来是否忠实执行了被指定动作”**的指标随之诞生——这是像素质量指标(FID/FVD)根本无法覆盖的维度。

playable-video-generation(CADDY)最早把这套指标系统化:在视频质量(LPIPS/FID/FVD)之外,引入衡量动作空间质量的 Δ-MSE / Δ-Acc(对物体位移的均方误差与分类准确率)和动作条件化质量的 ADD(平均检测距离)/ MDR(漏检率)。CADDY 在 Atari Breakout 上把 FVD 压到 5.94(次优 SAVP+ 为 84.4)、Δ-Acc 达 91.6%,用户研究一致性(Fleiss’ κ)0.469 远超所有基线(<0.072)。此后每一代交互世界模型都发明了自己的可控性指标:

模型可控性指标数值对照
GameGen-X gamegen-xSR-C/SR-E(角色/事件控制成功率,人评+PLLaVA)63.0% / 56.8%OpenSora-Plan 26.6% / 31.7%
AdaWorld adaworldECS(动作条件相似度,LIBERO)0.804离散基线 0.700
GameCraft tencent-hunyuan-gamecraftRPE-trans / RPE-rot(Sim3 对齐相机误差)0.08 / 0.20Matrix-Game 0.18 / 0.35
The Matrix the-matrixMove-PSNR(键鼠输入vs真实轨迹)29.90warmup 26.89
AVID avidAction Error Ratio(动作分类器误差比)1.154(RT1 145M)预训练底座 4.183
IRASim irasimLatent-L2 / PSNR(轨迹→视频保真)0.2099 / 26.05(RT-1)Video-Ada 0.2191 / 25.45
GenEx genexIELC(20m 闭环回到起点的隐空间 MSE)<0.1

一个反复出现的权衡律是”一致性 vs 动态幅度”:owl-1 的世界模型层显著提升 Subject/Background Consistency、Temporal Flickering(VBench-Long 均居首),但 Dynamic Degree 只有 13.19(其余基线 42~71),拖累总分至倒数第三;tencent-hunyuan-gamecraft 的数据消融同样显示”仅合成数据→RPE 0.07 但动态 34.6,仅真实录像→动态 77.2 但 RPE 0.16”,必须 1:5 混合才均衡。

动作保真的另一种测法是”逆动力学回读”:把生成视频反投影成轨迹,与输入动作算误差。genad-generalized-predictive-model 用此法测出文本+轨迹条件比纯文本条件误差降 20.4%(2.02 vs 2.54,GT=0.90);adriver-i 在 nuScenes 上控制信号预测 Speed-L1 0.072(三基线 0.10~0.12);vista-driving-world-model 更进一步把它做成奖励模型——真值命令得分 0.892 > 随机命令 0.878,可反过来做命令选择。棋类领域 videoworld 则用 BayesElo 评动作质量:VideoWorld-300M(纯视频、无搜索)达 Elo 2317,超过 KataGo-5d(2253),相对无 LDM 的纯视频 Transformer(1998)净增 319 Elo。transdreamer 用”隐藏顺序发现成功率”、playable-game-generation/skywork-matrix-game/mineworld 用各自的可玩性指标补充这条线。

值得如实记录的是,一批标杆交互世界模型至今没有任何定量可控性评测,只有能力展示视频:deepmind-genie2(一致性维持约 1 分钟)、genie-3(仅 SIMA 定性联动)、pandoraworlddreamertencent-yanworld-labs-marbleworld-labs-rtfmdecart-oasisgamengen 是少数给了硬指标的——人类评审在 1.6/3.2 秒片段上只有 58%/60% 能分辨模拟与真实 DOOM(随机=50%),PSNR 29.43 / FVD@16帧 114.02。更早的 world-models-ha-schmidhubergame-gan 则用”梦里训练、回真实环境测分”评可控世界模型(GameGAN 首个用 GAN 解出 VizDoom)。


三、物理常识评测的兴起:从 Physion 到 VideoPhy/WorldModelBench

物理保真评测有两条源流,最终在生成视频模型上汇合。

源流一:认知科学式的物理预测基准。 physion(2021)用 8 个物理场景测”物体是否会接触”(OCP),发现真人跨场景准确率 0.71,object-centric 粒子模型 DPI 达到人类水平,但视觉模型全线远逊人类(CSWM/pDeIT 多在 0.55~0.69);关键洞见是”ImageNet 预训练的物体感知视觉表征即便不显式模拟未来也更利于物理预测”。physion-plus-plus 加入需在线推断力学属性(质量/摩擦/弹性/可变形)的更难版本,最强模型也仅约 55%(chance=50%),人类约 60%,模型-人类相关性最高仅 r=0.12。counterfactual-world-modeling(CWM)在 Physion-v1.5 上以 86M 参数的 ViT-B 拿到 OCP 75.9、OCD 89.1,超过参数大 13× 的 DINOv2 ViT-g。JEPA 谱系在此另辟蹊径:intuitive-physics-vjepa 证明 V-JEPA 在 IntPhys 上达 98%(VideoMAEv2/Qwen2-VL/Gemini 均接近随机),是唯一在 IntPhys/GRASP/InfLevel 三基准都显著超过随机的方法——物理直觉可从自监督视频预训练涌现,但物体交互类属性(solidity/collision)仍近随机。

源流二:生成视频的物理常识评测器。 随着 T2V 模型爆发,videophy(2024)开创”语义遵循 SA × 物理常识 PC 联合达标率”的评测范式,结论惊人——当时冠军 Pika 联合达标率也仅 19.7%,所有模型在 solid-solid 场景最差。此后指标不断加码:

评测器主指标头部模型得分关键结论
VideoPhy videophySA=1,PC=1 联合%Pika 19.7solid-solid 最差(13.6)
VideoPhy-2 videophy-2SA≥4 且 PC≥4 %Wan2.1-14B 32.6(Hard 21.9)动量/质量守恒违反率~40%
WorldModelBench worldmodelbench三维总分(0-10)KLING 8.82(完成率仅61%)I2V 系统性弱于 T2V
PhyWorldBench phyworldbenchSA/PC/BothPika 2.0 Both 0.262Fund.>Composite>Anti-Physics 递减
Physics-IQ physics-iqPhysics-IQ score(上限100)VideoPoet-mf 24.1视觉真实度 vs 物理 r=−0.46
PhyGenBench phygenbenchSA/PC(被 WISA 用作外部集)
WorldSimBench worldsimbenchHPE 显式感知 + 隐式操控OpenSora AD 4.40Explicit≠Implicit 闭环表现
Impossible-Videos impossible-videosIPV-Score(生成”不可能”现象)Mochi 1 37.3画质与prompt遵循严重失衡

这些评测器共享几条硬结论:(1)顶尖模型的物理达标率普遍在 20~35%,远未成为”世界模拟器”;(2)动量守恒与质量守恒是最常被违反的定律videophy-2 测出约 40% 违反率,反射/浮力 <20%);(3)闭源 ≠ 更强——videophy-2 中 Ray2 全面落后于开源的 Wan2.1/CogVideoX-5B;(4)物理保真与像素质量去相关——physics-iq 的 Sora 视觉最真实(MLLM 2AFC 55.6% 最难分辨)却物理最差,worldmodelbench 测出物理维度与 VBench 相关系数骤降至 0.28。改进生成物理性的工作(wisa 的 MoPA 专家、roboscape 的物理信息具身模型)也都以这些评测器为标尺。

面向 VLM 的物理理解physbench 覆盖(Property/Relationships/Scene/Dynamics 四维):75 个 VLM 平均约 40%,最强 GPT-4o 仅 49.49%,远低于人类 95.87%;错误归因显示感知错误占 3745%、知识缺失占 2335%。3d-vla 则把物理场景问答/定位/生成打包评测,在 Embodied QA 上 BLEU-1 达 48.34(BLIP2 基线 37.31);nvidia-cosmos-reason1 走”物理常识→具身推理”链路。

物理评测器本身也要被评测(元评测)。由于人工标注昂贵,各家都训练了自动评判器并报告与人类的对齐度:

自动评判器对齐指标数值对照基线
VideoCon-Physics videophyROC-AUC (SA/PC)82 / 73GPT-4V 53/53、Gemini 73/58
VideoPhy-2-AutoEval videophy-2Pearson×100 (unseen)42.0 / 41.0VideoCon-Physics 28.5/26.5
CAP phyworldbenchROC-AUC (SA/PC)80.3 / 75.1GPT-o1 75.4/61.6
WorldModelBench judge worldmodelbenchKendall τ vs 人类0.96(平均误差4.1%)比 GPT-4o 低8.6%
HPE worldsimbenchPLCC (AD/RM)0.60 / 0.43GPT-4o 0.28 / 0.07

一个诚实的警告贯穿这些工作:现有物理评测器仍不可靠。wisa 自陈 VideoCon-Physics 会把”先落水后飞溅”这类正确时序误判为 0.08 低分;phyworldbench 发现 CAP 会被 Kling 的”电影感风格”骗高分(美学伪装)。这解释了为何评测器还在快速迭代。


四、3D / 长程一致性与世界生成评测

当世界模型要”生成可探索的 3D 世界”,评测就必须覆盖相机可控性、3D/光度一致性、长程时序一致性——这是 worldscore-benchmark 的核心贡献:把 3D 场景生成、视频生成、4D 生成统一到一张表上评(Static/Dynamic 两大聚合分 + 12 细分维度)。其结论极具张力:

模型类别代表Static相机可控3D一致短板
3D 场景生成wonderworld72.6992.9886.87不支持动态
3D 场景生成wonderjourney63.7584.6080.60内容对齐低(35.5)
视频生成 I2VCogVideoX-I2V62.1540.2286.21相机可控极弱
视频生成 I2V(闭源)Gen-360.7129.4768.31相机可控极弱
4D 生成4D-fy27.9869.9235.47光度一致仅1.59

即:3D 模型在静态世界生成上碾压视频模型(天生高相机可控/3D 一致),但不支持动态;视频模型普遍缺相机可控性(最强 CogVideoX-T2V 仅 40.22,任何 3D 模型都 85~94);最好的开源视频模型不输闭源(CogVideoX-I2V 的 Static/Dynamic 都高于 Gen-3/Hailuo)。这条”3D vs 视频”的分裂正是 hunyuanworld-voyagermatrix-3dgenex 等”可探索 3D 世界生成”工作试图弥合的裂缝。

VBench 谱系从另一角度切入”视频生成即世界模拟”。vbench 用 16 维度(Subject/Background Consistency、Temporal Flickering、Dynamic Degree、Motion Smoothness…)把 FVD 拆解成可解释的子能力,并验证 16 维度的人类对齐 Spearman ρ 全 >0.6、11/16 >0.9。vbench-2.0 则专攻”内在忠实性”——加入 Human Anatomy、Mechanics/Material/Thermotics(物理)、Multi-View Consistency、Dynamic Spatial Relationship 等 18 维;测出所有主流模型在 Dynamic Spatial Relationship / Dynamic Attribute(约 80% 失败率)与 Complex Plot(约 10 分/满分 100) 上普遍崩溃,且 Sora 强在 Human Fidelity/Creativity、弱在 Controllability/Physics/Commonsense。

长程一致性是交互世界模型的专属战场,指标是”生成 N 步后与真值/首帧的 PSNR/LPIPS/rFID”:

模型场景PSNR↑LPIPS↓rFID↓对照
WorldMem worldmemMinecraft 超上下文窗25.320.142915.37Diffusion-Forcing 18.04/0.4376/51.28
WorldMem worldmemRealEstate 360°闭环20.190.177367.14DFoT 8.396/0.6676/156.74
The Matrix the-matrixForza Move-PSNR29.900.109warmup 26.89
Tesseract tesseract-4d-world-modelRLBench 4D(Chamfer)0.0811CogVideoX 0.2884

其中 diffusion-forcing 提供了”可稳定 rollout 到 180~2000 帧不发散”的方法论基础,history-guided-video-diffusion(DFoT)、worldmem 则用历史引导/外部记忆库进一步压制漂移。infinitydrive(驾驶域)测出长时程(100 帧)设置下 FID/FVD 同时最优(14.92/113.91),而 Vista/SVD-XT 随帧数上升。yumeowl-1 也在长视频一致性上做文章。

人类偏好在缺乏自动 3D 一致性指标时充当兜底:wonderjourney 相对 InfiniteNature-Zero/SceneScape 的偏好胜率 8895%;wonderworld 相对三基线的鸟瞰图 2AFC 偏好率均 >98%(且生成速度 9.5s vs 基线 749798s);playerone(第一人称)在 20 名标注员打分上 Quality/Fidelity/Smooth/Alignment 全面领先 Cosmos-14B,并同时报告 MPJPE 127.16(人体运动保真)。tesseract-4d-world-model 是少数把 4D 几何评透的——RGB(FVD/SSIM/PSNR) + 深度(AbsRel/δ) + 法线(Mean/Median) + 点云(Chamfer L1) 全套,揭示”额外的深度/法线预测目标会与纯 RGB 生成质量轻微权衡”;aether 用零样本深度/位姿估计评几何感知世界模型。


五、下游可执行保真:世界模型作为规划器 / 评测器

第三条评测范式,是把问题反转:不再问”生成的视频像不像”,而是问”这个世界模型能否驱动规划成功、能否代替真实环境评策略”。这是最接近”世界模型有没有用”的终极标尺。

世界模型驱动的规划/操作成功率(越接近真机/仿真上限越好):

模型任务/环境指标成绩对照
DINO-WM dino-wmPushT / Rope / GranularSR / Chamfer0.90 / 0.41 / 0.26DreamerV3 0.04 / 2.49 / 1.05
V-JEPA 2-AC v-jepa-2Franka Pick-&-Place(零样本)成功率Cup 80% / Box 65%Octo 15%、Cosmos 0%
VLP video-language-planningSim Group-by-Color任务完成率92%UniPi 4%、RT-2 26%
AVDC avdc-actionless-videosMeta-World 11任务成功率43.1%BC-Scratch 16.2%
UniPi unipi-universal-policies-video组合环境 Novel Place完成率60.1%Transformer BC 11.9%
AdaWorld adaworldProcgen 4环境成功率56.67%Q-learning 27.17%(Oracle 80.67%)
PLDM pldm-planning-latent-dynamics新布局迁移泛化能力唯一全项达标GCRL 基线新布局全失败
Vidar vidarRoboTwin/真机 unseen成功率66.7%VPP 13.3%、UniPi 6.7%
TesserAct tesseract-4d-world-modelRLBench 9任务成功率7/9 超UniPiImage-BC 全线低

这套”成功率即真理”的评测催生了一个重要的方法论洞见:世界模型可以当”评测器”用,而其可信度由”仿真评分与真机 rollout 的相关性”来量化。irasim 在 LIBERO 上测出 IRASim 评估器与真值 Mujoco 仿真器的策略成功率 Pearson 0.99genesis-generative-physics 的 2026 版报告仿真-真机相关 0.8996(95% CI [0.744, 0.931])、reality gap 比次优仿真器小 45%;worldsimbench 用 HPE-PLCC 量化”视频世界模型作为策略评测器”的对齐度;gigaworld-1 更把”世界模型作为机器人策略评测器”作为核心命题。unisim 最早展示了这条链路的完整价值——纯在 UniSim 里训 RL 策略可 zero-shot 迁移真机,用其生成数据微调 PaLI-X 视频描述达真数据的 84% 且泛化更好,用其 hindsight 数据训 VLM 策略比原始短时序好 3~4 倍(RDG 0.34 vs 0.11)。ivideogpt(VP² benchmark)、robodreamerenerverse 等机器人世界模型也沿这条线评。

表征质量的下游探针是 JEPA 谱系的主战场:v-jepa/v-jepa-2 用冻结编码器 + attentive probe 评动作理解(V-JEPA-2 在 SSv2 达 77.3,运动理解显著领先),iwm-learning-leveraging-world-models 用”预训练 predictor 微调 vs 随机初始化”的增益(equivariant IWM +1.8pt)证明”只有学到真正的 world model 才值得复用”,i-jepa/lejepa/brain-jepa 则各自在图像/脑动力学线性探针上验证世界模型式表征的迁移力。


六、自动驾驶专用评测协议

自动驾驶世界模型自成一套最成熟、最标准化的指标体系,围绕 nuScenes/NAVSIM 展开,可分三层。

第一层:生成保真(FID/FVD)。 nuScenes 视频生成质量是驾驶世界模型的入门指标,历代 SOTA 单调下压:

方法视角/帧FID↓FVD↓备注
DriveGAN单视角73.4502.3GAN 基线
DriveDreamer drivedreamer首帧多视角14.9340.8扩散+结构条件
WoVoGen wovogen多视角27.6417.7世界体感知
Panacea panacea-driving-video多视角多帧16.96139首个 4D 一致
Drive-WM drive-wm-driving-into-the-future多视角视频15.8122.7因子化生成
GenAD genad-generalized-predictive-modelOpenDV训练15.4184免 3D 布局
DriveDreamer-2 drivedreamer-2首帧多视角11.255.7SVD 主干
Vista vista-driving-world-model单视角高清6.989.4相对最强 FID −55%
DrivingWorld drivingworld-gptGPT 式(zero-shot)7.490.940s/400帧

第二层:4D 预测(Chamfer / 占据 mIoU-IoU)。 点云/占据预测比 RGB 更贴近”预测保真”。copilot4d-waabi 在 ROI 内 Chamfer 相对 4D-Occ 降 65~75%(NuScenes 1s 1.41→0.36);vidar-visual-point-cloud-forecasting视觉输入超过 LiDAR 输入的 SOTA(1s 历史时未来 1s 误差降 33%)。4D 占据预测(Occ3D-nuScenes,2s→3s)是另一条卷得很凶的线:

方法输入辅助监督Avg mIoU↑Avg IoU↑
Copy&Paste3D-Occ11.3320.52
OccWorld-O occworld3D-Occ17.1426.63
OccSora occsora3D-Occ~14(512×压缩)37.0(recon)
DOME-O dome-occupancy-world-model3D-Occ27.1036.36
Drive-OccWorld drive-occworld相机36.3(GMO mIoU_f)
GaussianWorld gaussianworld-occupancy相机22.13(语义占据)33.40

新一代还在往稀疏化/4D 高斯/统一理解生成推进:cam4docc-benchmark 建立了膨胀/细粒度 GMO+GSO 的分层协议,sparseworld-4d-occupancysparseworld-tci2-world-tokenization 攻效率,hermes-plus-plusdriveworld-vlaxiaomi-auto-world-model 攻理解-生成统一。occworld 的经典警示值得记住:把空间分辨率从 50² 提到 100² 时重建 mIoU 飙到 78.12 但预测/规划反而更差——“重建好 ≠ 世界建模好”。

第三层:下游任务(规划 L2/碰撞率、闭环 PDMS、感知数据增强 NDS/mAP)。 这是驾驶世界模型”有没有用”的终判。nuScenes 开环规划的 L2 误差 / 碰撞率是最常报的指标:

方法输入辅助监督L2 Avg(m)↓Col Avg(%)↓
UniAD环视Map&Box&Motion&Track&Occ1.030.31
VAD-Base环视Map&Box&Motion1.220.53
OccWorld-O occworld3D-Occ1.170.60
Drive-WM drive-wm-driving-into-the-future多视角tree rollout0.800.26
Doe-1 doe-1单前视仅 QA1.260.53
DriveWorld driveworld-4d-pretraining环视预训练0.690.19
World4Drive world4drive相机(无标注)0.500.16
Drive-OccWorld drive-occworld相机0.85(NoAvg)0.29
PWM policy-world-model-forecasting-planning单前视0.780.07

这张表要小心读:nuScenes 开环 L2/碰撞率对 ego-status 高度敏感、AD-MLP 已把它刷到饱和,因此数值差异不宜作强因果结论drivedreamerdoe-1 均在页内明确提醒)。更可信的是闭环 NAVSIM PDMS——policy-world-model-forecasting-planning 单前视达 PDMS 88.1(持平相机+LiDAR 的 DiffusionDrive),world4drive 纯相机 85.1。以及感知数据增强的实测增益——这是”世界模型作为数据引擎”的最硬证据:

方法下游任务增益
MagicDrive magicdriveBEVFusion 检测mAP +2.66 / NDS +2.02
DrivingDiffusion drivingdiffusionBEVFusion 检测NDS +2.2 / mAOE −4.83%
Panacea panacea-driving-videoStreamPETR 检测mAP +2.6 / NDS +2.3
DriveDreamer-2 drivedreamer-2StreamPETR 跟踪AMOTA +8.0%
ViDAR vidar-visual-point-cloud-forecastingBEVFormer 检测mAP 37.7→42.6(半标注即超全监督)
WorldSplat worldsplatStreamPETR 检测mAP +4.0 / NDS +3.2(>Panacea)
Dream4Drive rethinking-dwm-synthetic-data-generator检测(<2%合成)mAP 42.2→43.6(唯一超真实基线)

rethinking-dwm-synthetic-data-generator 提供了对这条线的冷静复核:在 2× epoch 对齐后,仅真实数据基线已高于 DriveDreamer/WoVoGen/MagicDrive/Panacea 的合成增强,只有针对性插入的 Dream4Drive 才真正超过真实基线——提醒”合成数据涨点”很依赖评测协议对齐。drivedreamer4dworldsplatmagicdrive3d 则把评测推向新轨迹视角(NTA-IoU/NTL-IoU,因传统视角无真值),drive-wm-driving-into-the-future 用 KPM(Key Points Matching,因子化生成从 45.8%→94.4%)、panacea-driving-video 用 VMS 量化多视角一致性。gaia-1-wayve 一类工作用 scaling law 拟合替代横向 benchmark。更综合的 survey-world-models-autonomous-drivingunderstanding-world-or-predicting-future-survey 系统整理了这三层协议的谱系。


空白与趋势

方法论层面的趋势:(1)评测重心已从 FID/FVD/美学不可逆地转向物理·预测·可执行保真——“画面逼真 ≠ 懂世界”由 physics-iq 的 r=−0.46 与 worldmodelbench 的 0.28 相关系数钉死;(2)联合指标成为标配——单一指标不可用是 physics-iq(无任一 IoU 变体可独立使用)、playable-video-generation(视频质量 vs 动作质量必须分开)、worldscore-benchmark(运动幅度 vs 平滑度权衡)的共同结论;(3)自动评判器与人类对齐度本身成为一级指标(VideoCon-Physics/CAP/WorldModelBench-judge/HPE),且其可靠性仍是公开短板(wisaphyworldbench 都暴露了误判)。

明显的评测空白:(1)交互世界模型缺统一 benchmark——owl-1deepmind-genie2genie-3pandoraworld-labs-marble 都明确写”目前尚无评测视频生成世界模型的基准”而只做定性展示;这批最受关注的 landmark 恰恰是证据最薄的(genesis-generative-physics 的 Dec-2024 版更是”以生成 4D 物理世界为卖点却零量化指标”)。(2)长程/记忆一致性缺跨模型标准协议,各家自定义 rollout 长度与 rFID 计算帧数(worldmem 5000 帧 vs 论文 4800 帧就已不同)。(3)物理评测器的时序判断能力不足(wisa 的”正确时序被误判”)。(4)驾驶开环 L2/碰撞率已饱和,社区正转向闭环 PDMS(policy-world-model-forecasting-planningworld4drive)与新轨迹视角(drivedreamer4dworldsplat)。

能力前沿的真实位置:即便最强的生成世界模型,物理达标率仍在 20~35%(videophy 19.7%→videophy-2 32.6%→worldmodelbench 完成率 61%),Physics-IQ 最高仅 24.1%(上限 100)——距”可靠的世界模拟器”仍有数量级差距。而在下游可执行这条最务实的标尺上,世界模型已开始产出真实价值:v-jepa-2 零样本机器人操作、dino-wm 接触密集操作、unisim/irasim/genesis-generative-physics 作为高相关性策略评测器(Pearson 0.99/0.90)、驾驶合成数据的可复现感知增益——这些”用成功率说话”的证据,正在把世界模型评测从”看视频打分”拉回它最初的锚点:世界模型的价值,终究由它能否让下游 agent 做对事来定义