世界模型评测:从像素保真到物理·预测·可执行保真
世界模型的评测史,是一部”评测指标追着能力短板跑”的历史。早期(Atari/DMC 时代)评测天然锚定在下游控制回报上——世界模型只是提高样本效率的手段,好坏由 agent 拿多少分说了算。当世界模型转向像素级视频生成后,评测一度被 FID/FVD/美学分主导;但很快人们发现”画面越逼真 ≠ 越懂世界”:physics-iq 直接测出视觉真实度与物理理解的 Pearson 相关系数 r=−0.46(p=.247,不显著)——Sora 视觉最真实却物理理解垫底(8.7/100),worldmodelbench 也测出物理遵循维度与 VBench 各维度的相关系数最高仅 0.41、通常 <0.3。这条”去相关”证据,把整个评测范式从 FID/aesthetics 推向了三个新方向:
- 内在保真评测——直接判生成的未来是否遵守物理规律、3D 几何、被指定的动作(videophy、worldmodelbench、worldscore-benchmark、phyworldbench、physics-iq);
- 下游可执行保真——把”世界模型能否驱动规划/操作成功”作为 ground truth(dino-wm、v-jepa-2、video-language-planning、unisim);
- 领域专用协议——自动驾驶自成一套 nuScenes/NAVSIM 指标体系(开环 L2/碰撞率、4D 占据 mIoU、闭环 PDMS、感知数据增强 NDS/mAP)。
本页按”评测范式 × 时代”横切,梳理这五类指标的具体口径与代表数字。
一、经典 model-based RL:样本效率与规划成功率(2017–2024)
第一代世界模型(Dreamer/MuZero 谱系)的评测标尺是人类归一化分数(HNS)+ 样本效率倍数。这一时代不评”视频好不好看”,只评”用世界模型想象 / 规划出来的策略拿多少分、省多少交互”。
Atari 100k(26 游戏、约 2 小时真实经验) 是最卷的一条基准,也是”无前瞻搜索类世界模型”的主战场。历代 SOTA 的 HNS Mean/Median 单调爬升:
| 方法 | 类型 | HNS Mean | HNS Median | 超人(/26) |
|---|---|---|---|---|
| SimPLe simple-atari | VAE 视频模型 | 0.33 | 0.13 | 1 |
| TWM twm-transformer-world-model | Transformer WM | 0.956 | 0.505 | 8 |
| IRIS iris | Transformer+离散token | 1.046 | 0.289 | 10 |
| DreamerV3 dreamer-v3 | RSSM | 1.12 | 0.49 | 9 |
| STORM storm | 随机Transformer WM | 1.267 | 0.584 | 10 |
| Δ-IRIS delta-iris | 上下文感知token | 1.39 | 0.65(IQM) | 11 |
| DIAMOND diamond | 扩散 WM | 1.459 | 0.641(IQM) | 11 |
| TWISTER twister-contrastive-world-model | 对比预测 WM | 1.62 | 0.77 | 12 |
| — 前瞻搜索类(对照,不直接可比)— | ||||
| EfficientZero efficientzero | MuZero+SSL | 1.943 | 1.090 | 14 |
| EfficientZero-V2 efficientzero-v2 | +Gumbel search | 2.428 | 1.286 | — |
要点:(1)无搜索类从 SimPLe 的 0.33 一路涨到 TWISTER 的 1.62,五年翻近 5 倍;(2)搜索类(EfficientZero 系)始终另立山头——iris、storm、dreamer-v3 都明确声明不与 MuZero/EfficientZero 直接比,因为 MCTS 前瞻是可叠加的正交技术;(3)架构消融揭示的机理各异——twister-contrastive-world-model 的 AC-CPC 贡献约 50 个百分点(162%→112%)且只在 Transformer 上生效(RSSM+AC-CPC 仅 121%);diamond 靠扩散消除了 iris 那种”帧间敌人↔奖励反复互变”的不一致,且每帧仅 3 NFE。
大数据 Atari / 跨域上,MuZero 谱系刷的是另一个量级。muzero 在 20B 帧、12 小时训练下达 Gamer median 2041%,逐局击败 R2D2 42/57 局、SimPLe 全胜;muzero-unplugged 仅换 ResNet-v2+Adam 就把 median 从 741.7% 推到 1006.4%。dreamer-v3 用同一套超参跨 8 领域 150+ 任务创下多项 SOTA,头条是首个从零挖到 Minecraft 钻石的算法(10 seeds 100M 步内 100% 挖到,基线 0%)。unizero 用单帧输入即在 15/26 Atari 游戏超过同框架 MuZero,验证”单帧可同时建模长短期依赖”。
样本效率是这代模型的另一核心卖点,各家口径差异很大但量级一致:planet 相对 D4PG 平均省约 200×(cartpole 250×、cheetah 500+×);dreamer-v1 用 20× 更少交互超过 D4PG;mbpo 在 Ant 上 30 万步达到 SAC 300 万步的性能(10×);lightzero 的 MuZero 在 GoBigger 上比 MAPPO 省约 6×;dreamer-v3 在 DMLab 上 100M 步超过 IMPALA/R2D2 的 1B 步(10× 数据效率)。棋类/随机域里 muzero、stochastic-muzero(2048、Backgammon 匹配完美模拟器 AlphaZero)、sampled-muzero(大动作空间)、gumbel-muzero(n=2 模拟即可学)用 Elo 曲线评。
连续控制/高维 locomotion上标尺换成 DMC episode return。td-mpc2 用同一超参在 4 域 104 任务超过 DreamerV3/SAC,Pick-YCB 14M 步 >60% 成功率;efficientzero-v2 的 Vision Control 均值 726.1 比 DreamerV3 的 498.5 高 45%;unizero 在 18 个 Proprio 任务上均值/中位数(787.2/875.1)超过 DreamerV3(743.7/845.5)。机理对照上,daydreamer 直接在真实机器人上评”物体/分钟”(UR5 达 2.5、XArm 达 3.1,逼近人类)而 Rainbow/PPO 收敛到”抓了就放回原侧”;s4wm-world-model-backbones 用记忆任务(Multi Doors Keys skill-level MPC 成功率 S4WM 100% vs RSSM/TSSM 约一半)证明状态空间骨干在长记忆上的优势;harmonydream 一类工作则专攻”任务奖励 vs 观测重建”的权重平衡。
二、动作保真与可控性(controllability / action-fidelity)
当世界模型从”学策略”转向”生成可交互的未来”,一批**专门测”生成的未来是否忠实执行了被指定动作”**的指标随之诞生——这是像素质量指标(FID/FVD)根本无法覆盖的维度。
playable-video-generation(CADDY)最早把这套指标系统化:在视频质量(LPIPS/FID/FVD)之外,引入衡量动作空间质量的 Δ-MSE / Δ-Acc(对物体位移的均方误差与分类准确率)和动作条件化质量的 ADD(平均检测距离)/ MDR(漏检率)。CADDY 在 Atari Breakout 上把 FVD 压到 5.94(次优 SAVP+ 为 84.4)、Δ-Acc 达 91.6%,用户研究一致性(Fleiss’ κ)0.469 远超所有基线(<0.072)。此后每一代交互世界模型都发明了自己的可控性指标:
| 模型 | 可控性指标 | 数值 | 对照 |
|---|---|---|---|
| GameGen-X gamegen-x | SR-C/SR-E(角色/事件控制成功率,人评+PLLaVA) | 63.0% / 56.8% | OpenSora-Plan 26.6% / 31.7% |
| AdaWorld adaworld | ECS(动作条件相似度,LIBERO) | 0.804 | 离散基线 0.700 |
| GameCraft tencent-hunyuan-gamecraft | RPE-trans / RPE-rot(Sim3 对齐相机误差) | 0.08 / 0.20 | Matrix-Game 0.18 / 0.35 |
| The Matrix the-matrix | Move-PSNR(键鼠输入vs真实轨迹) | 29.90 | warmup 26.89 |
| AVID avid | Action Error Ratio(动作分类器误差比) | 1.154(RT1 145M) | 预训练底座 4.183 |
| IRASim irasim | Latent-L2 / PSNR(轨迹→视频保真) | 0.2099 / 26.05(RT-1) | Video-Ada 0.2191 / 25.45 |
| GenEx genex | IELC(20m 闭环回到起点的隐空间 MSE) | <0.1 | — |
一个反复出现的权衡律是”一致性 vs 动态幅度”:owl-1 的世界模型层显著提升 Subject/Background Consistency、Temporal Flickering(VBench-Long 均居首),但 Dynamic Degree 只有 13.19(其余基线 42~71),拖累总分至倒数第三;tencent-hunyuan-gamecraft 的数据消融同样显示”仅合成数据→RPE 0.07 但动态 34.6,仅真实录像→动态 77.2 但 RPE 0.16”,必须 1:5 混合才均衡。
动作保真的另一种测法是”逆动力学回读”:把生成视频反投影成轨迹,与输入动作算误差。genad-generalized-predictive-model 用此法测出文本+轨迹条件比纯文本条件误差降 20.4%(2.02 vs 2.54,GT=0.90);adriver-i 在 nuScenes 上控制信号预测 Speed-L1 0.072(三基线 0.10~0.12);vista-driving-world-model 更进一步把它做成奖励模型——真值命令得分 0.892 > 随机命令 0.878,可反过来做命令选择。棋类领域 videoworld 则用 BayesElo 评动作质量:VideoWorld-300M(纯视频、无搜索)达 Elo 2317,超过 KataGo-5d(2253),相对无 LDM 的纯视频 Transformer(1998)净增 319 Elo。transdreamer 用”隐藏顺序发现成功率”、playable-game-generation/skywork-matrix-game/mineworld 用各自的可玩性指标补充这条线。
值得如实记录的是,一批标杆交互世界模型至今没有任何定量可控性评测,只有能力展示视频:deepmind-genie2(一致性维持约 1 分钟)、genie-3(仅 SIMA 定性联动)、pandora、worlddreamer、tencent-yan、world-labs-marble、world-labs-rtfm、decart-oasis。gamengen 是少数给了硬指标的——人类评审在 1.6/3.2 秒片段上只有 58%/60% 能分辨模拟与真实 DOOM(随机=50%),PSNR 29.43 / FVD@16帧 114.02。更早的 world-models-ha-schmidhuber、game-gan 则用”梦里训练、回真实环境测分”评可控世界模型(GameGAN 首个用 GAN 解出 VizDoom)。
三、物理常识评测的兴起:从 Physion 到 VideoPhy/WorldModelBench
物理保真评测有两条源流,最终在生成视频模型上汇合。
源流一:认知科学式的物理预测基准。 physion(2021)用 8 个物理场景测”物体是否会接触”(OCP),发现真人跨场景准确率 0.71,object-centric 粒子模型 DPI 达到人类水平,但视觉模型全线远逊人类(CSWM/pDeIT 多在 0.55~0.69);关键洞见是”ImageNet 预训练的物体感知视觉表征即便不显式模拟未来也更利于物理预测”。physion-plus-plus 加入需在线推断力学属性(质量/摩擦/弹性/可变形)的更难版本,最强模型也仅约 55%(chance=50%),人类约 60%,模型-人类相关性最高仅 r=0.12。counterfactual-world-modeling(CWM)在 Physion-v1.5 上以 86M 参数的 ViT-B 拿到 OCP 75.9、OCD 89.1,超过参数大 13× 的 DINOv2 ViT-g。JEPA 谱系在此另辟蹊径:intuitive-physics-vjepa 证明 V-JEPA 在 IntPhys 上达 98%(VideoMAEv2/Qwen2-VL/Gemini 均接近随机),是唯一在 IntPhys/GRASP/InfLevel 三基准都显著超过随机的方法——物理直觉可从自监督视频预训练涌现,但物体交互类属性(solidity/collision)仍近随机。
源流二:生成视频的物理常识评测器。 随着 T2V 模型爆发,videophy(2024)开创”语义遵循 SA × 物理常识 PC 联合达标率”的评测范式,结论惊人——当时冠军 Pika 联合达标率也仅 19.7%,所有模型在 solid-solid 场景最差。此后指标不断加码:
| 评测器 | 主指标 | 头部模型得分 | 关键结论 |
|---|---|---|---|
| VideoPhy videophy | SA=1,PC=1 联合% | Pika 19.7 | solid-solid 最差(13.6) |
| VideoPhy-2 videophy-2 | SA≥4 且 PC≥4 % | Wan2.1-14B 32.6(Hard 21.9) | 动量/质量守恒违反率~40% |
| WorldModelBench worldmodelbench | 三维总分(0-10) | KLING 8.82(完成率仅61%) | I2V 系统性弱于 T2V |
| PhyWorldBench phyworldbench | SA/PC/Both | Pika 2.0 Both 0.262 | Fund.>Composite>Anti-Physics 递减 |
| Physics-IQ physics-iq | Physics-IQ score(上限100) | VideoPoet-mf 24.1 | 视觉真实度 vs 物理 r=−0.46 |
| PhyGenBench phygenbench | SA/PC | (被 WISA 用作外部集) | — |
| WorldSimBench worldsimbench | HPE 显式感知 + 隐式操控 | OpenSora AD 4.40 | Explicit≠Implicit 闭环表现 |
| Impossible-Videos impossible-videos | IPV-Score(生成”不可能”现象) | Mochi 1 37.3 | 画质与prompt遵循严重失衡 |
这些评测器共享几条硬结论:(1)顶尖模型的物理达标率普遍在 20~35%,远未成为”世界模拟器”;(2)动量守恒与质量守恒是最常被违反的定律(videophy-2 测出约 40% 违反率,反射/浮力 <20%);(3)闭源 ≠ 更强——videophy-2 中 Ray2 全面落后于开源的 Wan2.1/CogVideoX-5B;(4)物理保真与像素质量去相关——physics-iq 的 Sora 视觉最真实(MLLM 2AFC 55.6% 最难分辨)却物理最差,worldmodelbench 测出物理维度与 VBench 相关系数骤降至 0.28。改进生成物理性的工作(wisa 的 MoPA 专家、roboscape 的物理信息具身模型)也都以这些评测器为标尺。
面向 VLM 的物理理解由 physbench 覆盖(Property/Relationships/Scene/Dynamics 四维):75 个 VLM 平均约 40%,最强 GPT-4o 仅 49.49%,远低于人类 95.87%;错误归因显示感知错误占 3745%、知识缺失占 2335%。3d-vla 则把物理场景问答/定位/生成打包评测,在 Embodied QA 上 BLEU-1 达 48.34(BLIP2 基线 37.31);nvidia-cosmos-reason1 走”物理常识→具身推理”链路。
物理评测器本身也要被评测(元评测)。由于人工标注昂贵,各家都训练了自动评判器并报告与人类的对齐度:
| 自动评判器 | 对齐指标 | 数值 | 对照基线 |
|---|---|---|---|
| VideoCon-Physics videophy | ROC-AUC (SA/PC) | 82 / 73 | GPT-4V 53/53、Gemini 73/58 |
| VideoPhy-2-AutoEval videophy-2 | Pearson×100 (unseen) | 42.0 / 41.0 | VideoCon-Physics 28.5/26.5 |
| CAP phyworldbench | ROC-AUC (SA/PC) | 80.3 / 75.1 | GPT-o1 75.4/61.6 |
| WorldModelBench judge worldmodelbench | Kendall τ vs 人类 | 0.96(平均误差4.1%) | 比 GPT-4o 低8.6% |
| HPE worldsimbench | PLCC (AD/RM) | 0.60 / 0.43 | GPT-4o 0.28 / 0.07 |
一个诚实的警告贯穿这些工作:现有物理评测器仍不可靠。wisa 自陈 VideoCon-Physics 会把”先落水后飞溅”这类正确时序误判为 0.08 低分;phyworldbench 发现 CAP 会被 Kling 的”电影感风格”骗高分(美学伪装)。这解释了为何评测器还在快速迭代。
四、3D / 长程一致性与世界生成评测
当世界模型要”生成可探索的 3D 世界”,评测就必须覆盖相机可控性、3D/光度一致性、长程时序一致性——这是 worldscore-benchmark 的核心贡献:把 3D 场景生成、视频生成、4D 生成统一到一张表上评(Static/Dynamic 两大聚合分 + 12 细分维度)。其结论极具张力:
| 模型类别 | 代表 | Static | 相机可控 | 3D一致 | 短板 |
|---|---|---|---|---|---|
| 3D 场景生成 | wonderworld | 72.69 | 92.98 | 86.87 | 不支持动态 |
| 3D 场景生成 | wonderjourney | 63.75 | 84.60 | 80.60 | 内容对齐低(35.5) |
| 视频生成 I2V | CogVideoX-I2V | 62.15 | 40.22 | 86.21 | 相机可控极弱 |
| 视频生成 I2V(闭源) | Gen-3 | 60.71 | 29.47 | 68.31 | 相机可控极弱 |
| 4D 生成 | 4D-fy | 27.98 | 69.92 | 35.47 | 光度一致仅1.59 |
即:3D 模型在静态世界生成上碾压视频模型(天生高相机可控/3D 一致),但不支持动态;视频模型普遍缺相机可控性(最强 CogVideoX-T2V 仅 40.22,任何 3D 模型都 85~94);最好的开源视频模型不输闭源(CogVideoX-I2V 的 Static/Dynamic 都高于 Gen-3/Hailuo)。这条”3D vs 视频”的分裂正是 hunyuanworld-voyager、matrix-3d、genex 等”可探索 3D 世界生成”工作试图弥合的裂缝。
VBench 谱系从另一角度切入”视频生成即世界模拟”。vbench 用 16 维度(Subject/Background Consistency、Temporal Flickering、Dynamic Degree、Motion Smoothness…)把 FVD 拆解成可解释的子能力,并验证 16 维度的人类对齐 Spearman ρ 全 >0.6、11/16 >0.9。vbench-2.0 则专攻”内在忠实性”——加入 Human Anatomy、Mechanics/Material/Thermotics(物理)、Multi-View Consistency、Dynamic Spatial Relationship 等 18 维;测出所有主流模型在 Dynamic Spatial Relationship / Dynamic Attribute(约 80% 失败率)与 Complex Plot(约 10 分/满分 100) 上普遍崩溃,且 Sora 强在 Human Fidelity/Creativity、弱在 Controllability/Physics/Commonsense。
长程一致性是交互世界模型的专属战场,指标是”生成 N 步后与真值/首帧的 PSNR/LPIPS/rFID”:
| 模型 | 场景 | PSNR↑ | LPIPS↓ | rFID↓ | 对照 |
|---|---|---|---|---|---|
| WorldMem worldmem | Minecraft 超上下文窗 | 25.32 | 0.1429 | 15.37 | Diffusion-Forcing 18.04/0.4376/51.28 |
| WorldMem worldmem | RealEstate 360°闭环 | 20.19 | 0.1773 | 67.14 | DFoT 8.396/0.6676/156.74 |
| The Matrix the-matrix | Forza Move-PSNR | 29.90 | 0.109 | — | warmup 26.89 |
| Tesseract tesseract-4d-world-model | RLBench 4D(Chamfer) | — | — | 0.0811 | CogVideoX 0.2884 |
其中 diffusion-forcing 提供了”可稳定 rollout 到 180~2000 帧不发散”的方法论基础,history-guided-video-diffusion(DFoT)、worldmem 则用历史引导/外部记忆库进一步压制漂移。infinitydrive(驾驶域)测出长时程(100 帧)设置下 FID/FVD 同时最优(14.92/113.91),而 Vista/SVD-XT 随帧数上升。yume、owl-1 也在长视频一致性上做文章。
人类偏好在缺乏自动 3D 一致性指标时充当兜底:wonderjourney 相对 InfiniteNature-Zero/SceneScape 的偏好胜率 8895%;wonderworld 相对三基线的鸟瞰图 2AFC 偏好率均 >98%(且生成速度 9.5s vs 基线 749798s);playerone(第一人称)在 20 名标注员打分上 Quality/Fidelity/Smooth/Alignment 全面领先 Cosmos-14B,并同时报告 MPJPE 127.16(人体运动保真)。tesseract-4d-world-model 是少数把 4D 几何评透的——RGB(FVD/SSIM/PSNR) + 深度(AbsRel/δ) + 法线(Mean/Median) + 点云(Chamfer L1) 全套,揭示”额外的深度/法线预测目标会与纯 RGB 生成质量轻微权衡”;aether 用零样本深度/位姿估计评几何感知世界模型。
五、下游可执行保真:世界模型作为规划器 / 评测器
第三条评测范式,是把问题反转:不再问”生成的视频像不像”,而是问”这个世界模型能否驱动规划成功、能否代替真实环境评策略”。这是最接近”世界模型有没有用”的终极标尺。
世界模型驱动的规划/操作成功率(越接近真机/仿真上限越好):
| 模型 | 任务/环境 | 指标 | 成绩 | 对照 |
|---|---|---|---|---|
| DINO-WM dino-wm | PushT / Rope / Granular | SR / Chamfer | 0.90 / 0.41 / 0.26 | DreamerV3 0.04 / 2.49 / 1.05 |
| V-JEPA 2-AC v-jepa-2 | Franka Pick-&-Place(零样本) | 成功率 | Cup 80% / Box 65% | Octo 15%、Cosmos 0% |
| VLP video-language-planning | Sim Group-by-Color | 任务完成率 | 92% | UniPi 4%、RT-2 26% |
| AVDC avdc-actionless-videos | Meta-World 11任务 | 成功率 | 43.1% | BC-Scratch 16.2% |
| UniPi unipi-universal-policies-video | 组合环境 Novel Place | 完成率 | 60.1% | Transformer BC 11.9% |
| AdaWorld adaworld | Procgen 4环境 | 成功率 | 56.67% | Q-learning 27.17%(Oracle 80.67%) |
| PLDM pldm-planning-latent-dynamics | 新布局迁移 | 泛化能力 | 唯一全项达标 | GCRL 基线新布局全失败 |
| Vidar vidar | RoboTwin/真机 unseen | 成功率 | 66.7% | VPP 13.3%、UniPi 6.7% |
| TesserAct tesseract-4d-world-model | RLBench 9任务 | 成功率 | 7/9 超UniPi | Image-BC 全线低 |
这套”成功率即真理”的评测催生了一个重要的方法论洞见:世界模型可以当”评测器”用,而其可信度由”仿真评分与真机 rollout 的相关性”来量化。irasim 在 LIBERO 上测出 IRASim 评估器与真值 Mujoco 仿真器的策略成功率 Pearson 0.99;genesis-generative-physics 的 2026 版报告仿真-真机相关 0.8996(95% CI [0.744, 0.931])、reality gap 比次优仿真器小 45%;worldsimbench 用 HPE-PLCC 量化”视频世界模型作为策略评测器”的对齐度;gigaworld-1 更把”世界模型作为机器人策略评测器”作为核心命题。unisim 最早展示了这条链路的完整价值——纯在 UniSim 里训 RL 策略可 zero-shot 迁移真机,用其生成数据微调 PaLI-X 视频描述达真数据的 84% 且泛化更好,用其 hindsight 数据训 VLM 策略比原始短时序好 3~4 倍(RDG 0.34 vs 0.11)。ivideogpt(VP² benchmark)、robodreamer、enerverse 等机器人世界模型也沿这条线评。
表征质量的下游探针是 JEPA 谱系的主战场:v-jepa/v-jepa-2 用冻结编码器 + attentive probe 评动作理解(V-JEPA-2 在 SSv2 达 77.3,运动理解显著领先),iwm-learning-leveraging-world-models 用”预训练 predictor 微调 vs 随机初始化”的增益(equivariant IWM +1.8pt)证明”只有学到真正的 world model 才值得复用”,i-jepa/lejepa/brain-jepa 则各自在图像/脑动力学线性探针上验证世界模型式表征的迁移力。
六、自动驾驶专用评测协议
自动驾驶世界模型自成一套最成熟、最标准化的指标体系,围绕 nuScenes/NAVSIM 展开,可分三层。
第一层:生成保真(FID/FVD)。 nuScenes 视频生成质量是驾驶世界模型的入门指标,历代 SOTA 单调下压:
| 方法 | 视角/帧 | FID↓ | FVD↓ | 备注 |
|---|---|---|---|---|
| DriveGAN | 单视角 | 73.4 | 502.3 | GAN 基线 |
| DriveDreamer drivedreamer | 首帧多视角 | 14.9 | 340.8 | 扩散+结构条件 |
| WoVoGen wovogen | 多视角 | 27.6 | 417.7 | 世界体感知 |
| Panacea panacea-driving-video | 多视角多帧 | 16.96 | 139 | 首个 4D 一致 |
| Drive-WM drive-wm-driving-into-the-future | 多视角视频 | 15.8 | 122.7 | 因子化生成 |
| GenAD genad-generalized-predictive-model | OpenDV训练 | 15.4 | 184 | 免 3D 布局 |
| DriveDreamer-2 drivedreamer-2 | 首帧多视角 | 11.2 | 55.7 | SVD 主干 |
| Vista vista-driving-world-model | 单视角高清 | 6.9 | 89.4 | 相对最强 FID −55% |
| DrivingWorld drivingworld-gpt | GPT 式(zero-shot) | 7.4 | 90.9 | 40s/400帧 |
第二层:4D 预测(Chamfer / 占据 mIoU-IoU)。 点云/占据预测比 RGB 更贴近”预测保真”。copilot4d-waabi 在 ROI 内 Chamfer 相对 4D-Occ 降 65~75%(NuScenes 1s 1.41→0.36);vidar-visual-point-cloud-forecasting 用视觉输入超过 LiDAR 输入的 SOTA(1s 历史时未来 1s 误差降 33%)。4D 占据预测(Occ3D-nuScenes,2s→3s)是另一条卷得很凶的线:
| 方法 | 输入 | 辅助监督 | Avg mIoU↑ | Avg IoU↑ |
|---|---|---|---|---|
| Copy&Paste | 3D-Occ | 无 | 11.33 | 20.52 |
| OccWorld-O occworld | 3D-Occ | 无 | 17.14 | 26.63 |
| OccSora occsora | 3D-Occ | 无 | ~14(512×压缩) | 37.0(recon) |
| DOME-O dome-occupancy-world-model | 3D-Occ | 无 | 27.10 | 36.36 |
| Drive-OccWorld drive-occworld | 相机 | — | 36.3(GMO mIoU_f) | — |
| GaussianWorld gaussianworld-occupancy | 相机 | — | 22.13(语义占据) | 33.40 |
新一代还在往稀疏化/4D 高斯/统一理解生成推进:cam4docc-benchmark 建立了膨胀/细粒度 GMO+GSO 的分层协议,sparseworld-4d-occupancy、sparseworld-tc、i2-world-tokenization 攻效率,hermes-plus-plus、driveworld-vla、xiaomi-auto-world-model 攻理解-生成统一。occworld 的经典警示值得记住:把空间分辨率从 50² 提到 100² 时重建 mIoU 飙到 78.12 但预测/规划反而更差——“重建好 ≠ 世界建模好”。
第三层:下游任务(规划 L2/碰撞率、闭环 PDMS、感知数据增强 NDS/mAP)。 这是驾驶世界模型”有没有用”的终判。nuScenes 开环规划的 L2 误差 / 碰撞率是最常报的指标:
| 方法 | 输入 | 辅助监督 | L2 Avg(m)↓ | Col Avg(%)↓ |
|---|---|---|---|---|
| UniAD | 环视 | Map&Box&Motion&Track&Occ | 1.03 | 0.31 |
| VAD-Base | 环视 | Map&Box&Motion | 1.22 | 0.53 |
| OccWorld-O occworld | 3D-Occ | 无 | 1.17 | 0.60 |
| Drive-WM drive-wm-driving-into-the-future | 多视角 | tree rollout | 0.80 | 0.26 |
| Doe-1 doe-1 | 单前视 | 仅 QA | 1.26 | 0.53 |
| DriveWorld driveworld-4d-pretraining | 环视预训练 | — | 0.69 | 0.19 |
| World4Drive world4drive | 相机(无标注) | 无 | 0.50 | 0.16 |
| Drive-OccWorld drive-occworld | 相机 | — | 0.85(NoAvg) | 0.29 |
| PWM policy-world-model-forecasting-planning | 单前视 | — | 0.78 | 0.07 |
这张表要小心读:nuScenes 开环 L2/碰撞率对 ego-status 高度敏感、AD-MLP 已把它刷到饱和,因此数值差异不宜作强因果结论(drivedreamer、doe-1 均在页内明确提醒)。更可信的是闭环 NAVSIM PDMS——policy-world-model-forecasting-planning 单前视达 PDMS 88.1(持平相机+LiDAR 的 DiffusionDrive),world4drive 纯相机 85.1。以及感知数据增强的实测增益——这是”世界模型作为数据引擎”的最硬证据:
| 方法 | 下游任务 | 增益 |
|---|---|---|
| MagicDrive magicdrive | BEVFusion 检测 | mAP +2.66 / NDS +2.02 |
| DrivingDiffusion drivingdiffusion | BEVFusion 检测 | NDS +2.2 / mAOE −4.83% |
| Panacea panacea-driving-video | StreamPETR 检测 | mAP +2.6 / NDS +2.3 |
| DriveDreamer-2 drivedreamer-2 | StreamPETR 跟踪 | AMOTA +8.0% |
| ViDAR vidar-visual-point-cloud-forecasting | BEVFormer 检测 | mAP 37.7→42.6(半标注即超全监督) |
| WorldSplat worldsplat | StreamPETR 检测 | mAP +4.0 / NDS +3.2(>Panacea) |
| Dream4Drive rethinking-dwm-synthetic-data-generator | 检测(<2%合成) | mAP 42.2→43.6(唯一超真实基线) |
rethinking-dwm-synthetic-data-generator 提供了对这条线的冷静复核:在 2× epoch 对齐后,仅真实数据基线已高于 DriveDreamer/WoVoGen/MagicDrive/Panacea 的合成增强,只有针对性插入的 Dream4Drive 才真正超过真实基线——提醒”合成数据涨点”很依赖评测协议对齐。drivedreamer4d、worldsplat、magicdrive3d 则把评测推向新轨迹视角(NTA-IoU/NTL-IoU,因传统视角无真值),drive-wm-driving-into-the-future 用 KPM(Key Points Matching,因子化生成从 45.8%→94.4%)、panacea-driving-video 用 VMS 量化多视角一致性。gaia-1-wayve 一类工作用 scaling law 拟合替代横向 benchmark。更综合的 survey-world-models-autonomous-driving 与 understanding-world-or-predicting-future-survey 系统整理了这三层协议的谱系。
空白与趋势
方法论层面的趋势:(1)评测重心已从 FID/FVD/美学不可逆地转向物理·预测·可执行保真——“画面逼真 ≠ 懂世界”由 physics-iq 的 r=−0.46 与 worldmodelbench 的 0.28 相关系数钉死;(2)联合指标成为标配——单一指标不可用是 physics-iq(无任一 IoU 变体可独立使用)、playable-video-generation(视频质量 vs 动作质量必须分开)、worldscore-benchmark(运动幅度 vs 平滑度权衡)的共同结论;(3)自动评判器与人类对齐度本身成为一级指标(VideoCon-Physics/CAP/WorldModelBench-judge/HPE),且其可靠性仍是公开短板(wisa、phyworldbench 都暴露了误判)。
明显的评测空白:(1)交互世界模型缺统一 benchmark——owl-1、deepmind-genie2、genie-3、pandora、world-labs-marble 都明确写”目前尚无评测视频生成世界模型的基准”而只做定性展示;这批最受关注的 landmark 恰恰是证据最薄的(genesis-generative-physics 的 Dec-2024 版更是”以生成 4D 物理世界为卖点却零量化指标”)。(2)长程/记忆一致性缺跨模型标准协议,各家自定义 rollout 长度与 rFID 计算帧数(worldmem 5000 帧 vs 论文 4800 帧就已不同)。(3)物理评测器的时序判断能力不足(wisa 的”正确时序被误判”)。(4)驾驶开环 L2/碰撞率已饱和,社区正转向闭环 PDMS(policy-world-model-forecasting-planning、world4drive)与新轨迹视角(drivedreamer4d、worldsplat)。
能力前沿的真实位置:即便最强的生成世界模型,物理达标率仍在 20~35%(videophy 19.7%→videophy-2 32.6%→worldmodelbench 完成率 61%),Physics-IQ 最高仅 24.1%(上限 100)——距”可靠的世界模拟器”仍有数量级差距。而在下游可执行这条最务实的标尺上,世界模型已开始产出真实价值:v-jepa-2 零样本机器人操作、dino-wm 接触密集操作、unisim/irasim/genesis-generative-physics 作为高相关性策略评测器(Pearson 0.99/0.90)、驾驶合成数据的可复现感知增益——这些”用成功率说话”的证据,正在把世界模型评测从”看视频打分”拉回它最初的锚点:世界模型的价值,终究由它能否让下游 agent 做对事来定义。