世界模型 Infra:训练算力 · 并行 · 因果 tokenizer 工程 · 实时推理

概述:世界模型的 infra 故事和 LLM 不同。LLM 的工程主线几乎全在”训练规模”这一头,推理是解决过的问题;世界模型却被劈成两半——一半(Dreamer/MuZero 谱系)训练极省(常常单张消费级 GPU),因为它们的价值在样本效率而非算力;另一半(生成视频/交互游戏谱系)训练极贵(从万卡集群到 Cosmos-1 的 10,000×H100×3 月),且要在推理侧再打一场硬仗——因为”世界模型”要么给智能体在其中闭环控制、要么给人实时游玩,出帧率(FPS)与端到端延迟才是它区别于普通文生视频的定义性约束。这条约束把整个领域的工程重心从”怎么把模型训大”逐渐推向”怎么把一个自回归/扩散骨干压到 24fps 以上还能长时程稳定”。本页沿四条线索横切 200+ 页调研:(1) 两条算力光谱——单卡 latent 世界模型 vs 万卡视频基座;(2) 并行策略——从 DDP 到 FSDP/HSDP、序列并行(Ulysses/RingAttention/USP)、上下文并行、注意力头并行;(3) tokenizer/VAE 工程——世界模型的压缩闸门,决定自回归步数与解码成本;(4) 实时推理——蒸馏少步、KV cache、并行解码、FP8/INT8 量化、定制 kernel、多卡换实时,这是本领域最活跃的战场。末尾给”空白与趋势”。


一、两条算力光谱:从单卡 latent 到万卡视频基座

世界模型的训练算力横跨了整个可想象的范围。同样叫”世界模型”,dreamer-v3一张 A100 就能打 150+ 任务并进 Nature,mbzuai-pan-world-model(PAN)却动用 960 张 H200cosmos-predict2-5-world-simulation 报的是 4096 张 H100 上的 MFU。这不是”谁更 SOTA”的差别,而是两类根本不同的目标函数:latent RL 世界模型追样本效率(省的是环境交互,算力天然小),生成视频世界模型追像素保真 + 通用性(算力随分辨率×帧数×视角二次膨胀)。下表把两条光谱的两端拉到一起看:

工作类型训练算力训练时长参数量关键工程口径
dreamer-v3RL·想象1× A100Atari100K 0.1 天 → ProcGen 16.1 天12M→400M一套超参 8 领域;vs VPT 720GPU×9 天
diamond扩散·RL1× RTX 40902.9 天/游戏,26 游戏×5 种子≈1.03 GPU-年13MAtari 每帧 3 NFE
stormTransformer·RL1× RTX 30904.3 小时(100k 步)/ 实测 9.3 V100-时bf16 + KV cache,五者中最省
td-mpc2连续控制1× RTX 3090317M 档 33 GPU-天1M→317M刻意”democratize RL”低门槛
irisTransformer·RL8× A100 40G3.5 天/环境(两环境共卡)无搜索、无分布式,比 SPR 慢很多
efficientzeroMCTS·RL4× 30907 小时/游戏vs muzero 64 TPU×12 时
unisim生成视频512× TPU-v320 天5.6B1M 步,视频扩散模拟器
vista-driving-world-model驾驶视频128× A100(阶段一)8 天 + 8×A100 10 天≈2.5 万 A100·时;LoRA 微调零额外延迟
gaia-1-wayve驾驶视频64+32+32 ×A100 80Gwm/decoder 各 15 天9B(wm)DeepSpeed ZeRO-2 + FlashAttention v2
gaia-2-wayve驾驶视频tokenizer 128×H100 / wm 256× H100300k / 460k 步组件独立训练
genad-generalized-predictive-model驾驶视频32→64 ×A1005.9B5.27 TFLOPs;采样 539ms/步
mbzuai-pan-world-model通用视频960× H200HSDP + FA3 + FlexAttention + Ulysses SP
cosmos-predict2-5-world-simulation通用视频4096× H1002B/14BMFU 36.49%(2B)/33.08%(14B),FSDP2
nvidia-cosmos-transfer1可控视频1024× H100 / 每个 control branch2–4 周7B训练轻、推理重(重点在实时并行推理)

差了整整三个数量级(1 卡 vs 4096 卡)。而 latent 世界模型这一端还进一步把”算力小”当成卖点写进贡献:efficientzero 把”高质量、算力友好的开源实现”本身列为贡献;td-mpc2/dreamer-v3 反复强调”单卡可复现,让许多实验室都跑得起”。综述 mbrl-survey-moerland 还专门批评过领域内算力口径不统一——有人用”训练小时”(依赖硬件)、有人用”episode 数”(model-based 每 episode 样本量远大于 model-free),呼吁统一用真实环境步数 / 模型调用次数 / FLOPs 作可比横轴。这个口径混乱至今仍在:本页很多页都只给”XX 天”或”XX 卡”,鲜有完整的总 GPU-hours。


二、隐空间世界模型:单卡 + 想象并行(Dreamer / MuZero / IRIS 谱系)

这一族的 infra 精髓是**“在紧凑隐空间里并行想象上千条轨迹”**——不解码图像,所以单卡能塞下极大的想象批量,这是它训练便宜的根因。

2.1 想象派(Dreamer 一脉):单卡 + 巨批隐轨迹

world-models-ha-schmidhuber 的”梦境训练”(P100 + 64 CPU,V/M 各训 <1 小时)到 planet(单 V100,10–20 小时/任务,每步在线评 1 万条 latent 序列)、dreamer-v1(单 V100,16 小时训完 5M 步),这一脉一路守着”单卡”。关键工程量是并行想象批量dreamer-v2 因不生成图像、只在隐空间推演,单卡可并行模拟 2500 条隐轨迹,默认开 16-bit 混合精度;daydreamer 的 actor-critic 想象批量可达 16K(量级上与 Isaac Gym 这类专用并行仿真器相当)。dreamer-v2 还留下一句昂贵的注脚:对全部改动做严格消融需 55 任务×5 种子×10 天/改动 ≈ 6 万 GPU 小时/改动,所以只能给关键消融。骨干换芯后成本各有取舍:transdreamer 把 RNN 换 Transformer 后显存暴涨,被迫把并行想象轨迹数压到 K=3;s4wm-world-model-backbones 实测 RSSM-TBTT 在想象阶段吞吐比 S4WM/TSSM-XL 高约 10×(递归展开省显存),但训练速度反被后者甩开(可并行)。recall-to-imagine-r2i 用 S4/S5 SSM 做记忆骨干,2×A100 + 40 个环境 worker,系统总吞吐 ~350 FPS,同墙钟时间下比 DreamerV3 多攒环境步、训练最多快

2.2 规划派(MuZero 一脉):TPU + 分布式 actor/learner + C++ MCTS

规划派的 infra 完全是另一副面孔——TPU 云 + 大规模自对弈muzero 棋类每游戏 16 TPU 训练 + 1000 TPU 自对弈、Atari 8 训练 + 32 自对弈(12 小时/1M 步);stochastic-muzero Backgammon 用 1 TPU 训练 + 16 TPU acting(≈V100 10 天);gumbel-muzero 用”3 倍训练 TPU 数”做自对弈避免数据瓶颈,并给出模拟数→训练吞吐加速表(n=200→n=4 加速 24.3×)。这一脉的工程难点在 MCTS 难并行、每环境需独立搜索树、不适合朴素向量化,于是催生了一整套系统优化:

工作硬件分布式框架MCTS 工程通信/加速
efficientzero4×3090Ray + 双缓冲,四类 actorC++ selection/expansion/backup + Cython 桥接,batch MCTStorch AMP;0.25 卡/worker
lightzeroA100 40G + 24 CPUK8s + PyTorch DDP(4 卡≈5×加速)ctree(C++/Cython);分组批处理三阶段重叠RDMA P2P 推理→训练 GPU 直传;限速 0.8–1.2×
rezero-mcts单 A100 + 30 CPU单 worker(多 worker 留待未来)Backward-view reanalyze,搜索批调至 2000单次 MCTS 0.69ms vs MuZero 1.08ms
unizeroA100 80G + 24 CPU单卡(未讨论多卡)每决策 50 次模拟Atari 100k 训 4 小时

lightzero 的多卡 scaling 表是这一族少见的清晰数字:PongNoFrameskip 训到 1M 步,1 卡 844 分钟、2 卡 363、4 卡 152 分钟(约 5× 加速)。efficientzero-v2 把规划开销当推理成本的代理指标——它一次决策仅需 32 个想象隐状态,对比 td-mpc2 的 MPPI 需 9216 个(约 200×)、sampled-muzero 的 Sample MCTS 需 50 次模拟。

2.3 token 世界模型:tokenizer + 自回归 Transformer 的加速账

IRIS 一脉把世界模型做成”离散 token 上的自回归 Transformer”,于是推理速度直接由 token 数和串行解码次数决定,加速手段也集中在这两点。下表是这一族的训练成本与想象吞吐对照(多为单卡消费级 GPU):

工作训练硬件训练时长想象/rollout 速度加速机制
iris8×A100 40G3.5 天/环境Transformer 记忆每 20 帧刷新加速交互
delta-iris1×A100 40GAtari 26 小时(vs IRIS 5×)Crafter 20 FPS(IRIS-64tok 2 FPS)context-aware tokenization → 每帧仅 4 token
rem-parallel-observation-predictionV100(计时用 4090)<12 小时想象 15.4× 加速Parallel Observation Prediction(并行出观测 token)
storm1×RTX 30904.3 小时KV cache 加速自回归采样
twm-transformer-world-model1×A100~10 小时想象 39,000 samples/s(XL)vs 19,900(vanilla)Transformer-XL 记忆缓存;策略只吃 z(CPU 653fps vs 213fps)
ivideogptA100+3090,4 卡/实验64px 全预训练 ≈36 GPU-天rollout 1.11s(标准 tokenizer 22.5s,20×慢)压缩 token 化把前向次数减 16×

twm-transformer-world-model 的”策略只吃隐状态 z”是个漂亮的推理动机:策略若还要吃 [z,h](跑 Transformer)CPU 上从 653 帧/秒降到 213 帧/秒(3×慢),所以设计上让策略只接受 z。这条”哪部分不需要跑重骨干就别跑”的思路,在后面所有实时世界模型里反复出现。


三、视频基座世界模型:万卡训练与并行策略

当世界模型变成”动作进、视频出”的生成模型,算力和 LLM 一样进入了并行工程的世界,但多了一层时空序列极长(分辨率×帧数×视角)的压力。这一节把大视频世界模型的并行策略拉出来横比——这是本领域 2025–2026 最成熟的工程增量。

工作规模并行策略精度Kernel/系统
lwm-large-world-modelTPU v4-1024(≈450 A100)mesh=(dp,fsdp,tp,sp) 四维,含 RingAttention 序列并行float32百万级序列,推理最低 v4-128
gaia-1-wayve64×A100DeepSpeed ZeRO-2 + activation checkpointing未披露wm 用 FlashAttention v2
mbzuai-pan-world-model960×H200DP+FSDP→HSDP;Stage2 加 序列并行 SP(Ulysses,group=4)FA3 + FlexAttention 编译因果 kernel;block 级 activation ckpt
cosmos-predict2-5-world-simulation4096×H100FSDP2(逐参数 sharding)+ Ulysses all-to-all 上下文并行(取代 ring-attention)TorchTitan 异步 ckpt;Selective Activation Checkpointing
nvidia-cosmos-reason17B/56B7B TP=4;56B TP=8+PP=2;RL 支持 DP/PP/CP/FSDP/TP 5D 并行BF16vLLM runtime
magicdrivedit32×A800 / 64×Ascend 910BOpen-Sora 序列并行(空间维切分,attn 用 all-to-all 换头维),SP=4VAE 按 batch/视角切分并行
aether80×A100 80G节点内 FSDP+ZeRO-2,节点间 DDP深度视频在线归一化,VAE 训练时在线跑
gigaworld-132×H20Ulysses 序列并行BF16SageAttention + Flash Norm/Flash RoPE 融合 Triton kernel
moworld-flash-world-model华为昇腾 CloudMatrix384FSDP;中长序列 Ulysses SP,2000 帧改 USPBF16CANN + HCCL 通信;NPU attention kernel

几条清晰的技术演进:(1) 从 ring-attention 转向 Ulysses all-to-all——cosmos-predict2-5-world-simulation 明确指出用 Ulysses 式 all-to-all 取代 Cosmos-1 diffusion 世界模型的 ring-attention,理由是更简单、通信更省、更好支持 NATTEN 稀疏注意力和带 JVP 的 fused flash attention。(2) 序列并行(SP)成为长视频的标配——mbzuai-pan-world-modelmagicdriveditgigaworld-1moworld-flash-world-modelalayaworld 都在用某种沿 token/序列维切分的并行来突破单卡显存对帧数的限制。(3) 头维不整除的工程细节——mbzuai-pan-world-model 的 28 个注意力头不整除 8 GPU/节点,作者专门改 Ulysses 实现允许头维不均匀分片。(4) 国产算力路线——moworld-flash-world-model 全程华为昇腾 CloudMatrix384 + CANN/HCCL,magicdrivedit 验证 Ascend 910B 可训,是少见的非 NVIDIA 栈完整披露。训练规模的天花板仍是 NVIDIA Cosmos 系列(本 scope 内可查到的驱动域后训练规模,基座 Cosmos-1 的 10,000×H100×3 月只作为对照出现在 cosmos-drive-dreamsdeepmind-genie2 的比较里)。


四、tokenizer / VAE 工程:世界模型的压缩闸门

tokenizer 在世界模型里的地位远超 LLM——它同时决定了自回归步数(token 越少、串行解码越快)和解码成本(VAE decode 常是推理瓶颈)。这一节单列,因为它是 2025–2026 实时化最直接的杠杆。

因果 / context-aware / 联合 tokenizerdelta-iris 的 context-aware tokenization 把每帧压到 4 个 token(IRIS 是 16–64),直接换来 3–10× 的想象加速;copilot4d-waabi 的 tokenizer 仅 13M 参数(world model 39M),每帧 128×128 token 只需 10 步扩散、每步并行解码 ~1600 个新 token;i2-world-tokenization 的 Intra-Inter 分解式 tokenization 让完整模型训练仅需 2.92 GB 显存、推理 37.04 FPS(真值占据输入);omnitokenizer 做图像-视频联合 tokenizer(8×A100 训 2 周),用硬件无关的 GFLOPs 衡量效率(51 iGFLOPs vs VQGAN 167);larp 的 learned AR 生成先验 tokenizer 仅 21.7M 参数且训练期结束即丢弃,对推理零开销;drivingworld-gpt 的 tokenizer 单独用 32×4090 训 7 天(世界模型再用 64×A100 训 12 天),且用时空解耦架构避免显存随序列长度二次膨胀(vanilla GPT-2 在 10–15 帧就 OOM)。

VAE 剪枝——2026 实时流的关键增量:当世界模型跑到 720p/40fps,VAE decode 成了单帧延迟里最肥的一段,于是”剪 VAE”成了显学:

工作VAE 方案剪枝/加速效果上下文
skywork-matrix-game-3MG-LightVAE(改自 TurboVAED,同构缩减解码器隐藏维)50%/75% 剪枝解码提速 ×2.6 / ×5.2;去掉它 40→25.79 FPS消融显示去 VAE 剪枝是第二大降幅
gigaworld-1TinyVAE(基于 TAESD)开发期快速预览解码评测仍用完整 VAE
nvidia-omnidreamsLightVAE/LightTAE(LightX2V)MV pixel-shuffle 编码延迟 <1ms替换原 Cosmos VAE
dreamx-world-1Matrix-Game 3.0 VAE + 75% 剪枝单 chunk 解码降到 ~0.25 秒按高度切分多卡并行(ParaVAE 式)
tencent-yanUNet 结构化剪枝 + FP8 GEMM相对 BF16 提速 1.5–2×Yan-Sim 1080P 60FPS

skywork-matrix-game-3 的 VAE 重建质量/效率表给了硬数字:Wan2.2 VAE 原始解码 0.76s,MG-LightVAE 50% 剪枝降到 0.30s(PSNR 33.79→31.84),75% 剪枝 0.13s(PSNR 31.14)——用 ~2 个 PSNR 点换 5.8× 解码加速。这类”解码器可以大幅剪、编码器对精度敏感保原样”的非对称策略(moworld-flash-world-model 也明确只量化 DiT、编码器保 BF16)已成共识。


五、实时交互推理:世界模型的定义性挑战

这是整个 infra 里最激烈、也最能区分”世界模型”和”文生视频”的战场。判据很朴素——能不能以人眼流畅的帧率、在人操作时实时出画mineworld 甚至用 Actions-Per-Minute 给”实时”定了量化线:业余 Minecraft 玩家约 150 APM,需 >2 FPS 才跟得上、>5 FPS 才追得上职业选手。下面是交互/游戏世界模型的 FPS/延迟军备竞赛全景。

5.1 交互世界模型的 FPS × 延迟总表

工作实时指标分辨率推理硬件核心加速手段
gamengen20 FPS(4 步 denoiser 50ms/帧);蒸馏单步 50 FPSDOOM单 TPU-v5128 TPU-v5e 训练;单步蒸馏
playable-game-generation4 步 20 FPS / 8 步 10 / 16 步 5Mario/Doom单 RTX 2060去噪步数换速度,画质仅降 1.4–1.8%
decart-oasis20 fps(47ms/帧)360pH100自研 kernel 吃透 NVLink/PCIe;Sohu ASIC 可 4K
the-matrixSwin-DPM 0.8 FPS → SCM 加速 10–20× → 8–16 FPS720p8 GPU DeepSpeed Ulysses(>25200 帧序列并行)
gamegen-x20 FPS320p消融用 8×H100;记忆窗仅 1–108 帧
genie-324 fps @720p,每秒多次响应输入720p未披露云端 Project Genie 原型
skywork-matrix-game-225 FPS(25.15)单 H100VAE Cache + 动作模块半层 + 去噪 4→3(消融见下)
skywork-matrix-game-340 FPS @720p720p8+1 GPU 异步(8 DiT + 1 VAE)INT8 量化 + MG-LightVAE + GPU 记忆检索
tencent-yanYan-Sim 60 FPS、单帧 0.07s;Yan-Gen 12–17 FPS(1×H20)→30(4×H20)1080PH20FP8 + CUDA graph + torch.compile + 序列并行
mirage-dynamicslabMirage 1 16 FPS;Mirage 2 200ms 延迟SD单消费级 GPU云流式 + full-duplex 管线
decart-mirage-lsd24 FPS(<40ms/帧),响应快 16×Hopper 多卡Hopper Mega Kernel(GPU-GPU 通信编入 kernel)
odyssey-explorer30 FPS,往返延迟 ~40ms,$1–2/用户·时H100 集群美/欧 GPU 集群流式
world-labs-rtfm”交互帧率”(未给具体数)单 H100刻意面向单卡部署的效率优先配置
moworld-flash-world-modelup to 50 FPS,成本仅同类 30–50%华为昇腾 NPUOn-demand 加载 + 层级 SP + INT8 动态量化
nvidia-omnidreamsSV 68→103 FPS(1→8 GPU);MV 105 FPS/相机(16 GPU)704×1280GB300/H100local-window attn + static KV cache + CUDA Graph;FlashDreams 框架
dreamx-world-116 FPS 流式720P8× RTX 5090INT8 SageAttention + FP8 AngelSlim + 融合 Triton kernel
gigaworld-1>20 FPS(12s 生成 33s 视频)1920×480单 H20(可 4090)峰值 35.93× 加速;单卡 <24GB
tencent-hunyuan-gamecraft蒸馏 + PCM 6.6 FPS,单动作延迟 <5s704×12168×H20/H800192×H20 训练;FP8 + SageAttention
mbzuai-pan-world-model具体 FPS 未披露HopperSageAttention2++(8-bit+4-bit)比 FlexAttention 快 30.3%

几条趋势极清晰:(1) 2024→2026 从 20fps 爬到 40–60fps,Yan-Sim 已做到 1080P 60FPS/0.07s 延迟,达到与传统游戏引擎同级的体感。(2) 单卡 vs 多卡两条路线并存——一条追”单张 H100/消费级 GPU 就能实时”(skywork-matrix-game-2world-labs-rtfmgigaworld-1mirage-dynamicslab),另一条用”多卡换实时”服务更大模型/更高分辨率(skywork-matrix-game-3 8+1、nvidia-omnidreams 16 GPU)。(3) 定制 kernel 成为最后一公里——decart-mirage-lsd/decart-mirage 的 Hopper Mega Kernel 把 GPU-GPU 通信直接编进 kernel 由计算掩盖,mbzuai-pan-world-model 的 SageAttention2++、gigaworld-1 的 Flash Norm/Flash RoPE 都是这一层。

5.2 加速手段拆解:一份可复用的”实时化配方”

把上表的手段归拢,2025–2026 的实时世界模型几乎都在叠加同一套组合拳,各页的消融给了它们各自的边际贡献:

skywork-matrix-game-3 的逐项消融是这套配方最清楚的量化:完整 ~40 FPS,去 INT8 量化→27.38(↓12.62),去 MG-LightVAE→25.79(↓14.21),去 GPU 记忆检索→6.60(↓33.40,最关键单项)skywork-matrix-game-2 同类:+VAE Cache 15.49 FPS → +动作模块半层 21.03 → +去噪 4→3 达 25.15。gigaworld-1 则给了并行侧的账:仅换 attention kernel 1.25–1.31×,叠加 SageAttention+6 步 DMD2+Ulysses SP 峰值 35.93×

5.3 多卡换实时:并行推理的三张标度表

当模型不能再压小,就用多卡把单帧延迟摊薄。三份披露最完整的并行推理标度表:

nvidia-cosmos-transfer1(GB200 NVL72,生成 5 秒视频)——非注意力层纯数据并行 + 注意力层 head-parallelism(32 头 + CFG 正负拆分 = 64 GPU):

GPU 数148163264
端到端耗时141.7s40.0s20.8s11.0s6.1s4.2s

1→64 GPU 约 40× 加速,64 卡下 4.2 秒生成 5 秒视频,跨过”生成快于播放”的实时线。

hunyuanworld-voyager(xDiT USP,512×768/49 帧/50 步)

GPU 数1248
延迟(秒)19251018534288
加速比1.00×1.89×3.60×6.69×

nvidia-omnidreams(OmniDreams-MV,16 帧/chunk,4 视角):1×GPU 1289ms(12 FPS) → 4×GPU 330ms(48) → 8×GPU 209ms(74) → 16×GPU 151ms(105 FPS/相机),16 卡用 hierarchical context-parallel(V=4·T=4·HW=1)。三张表共同说明:实时不是模型属性而是部署预算——同一模型给足卡就能跨过实时线,world-labs-rtfm 索性把”当前档位是刻意选的单卡效率配置、更大预算会继续变好”写进博客。


六、机器人 / 具身世界模型:控制频率 Hz 才是硬指标

具身场景把”实时”换了个更严的度量——闭环控制频率(Hz):世界模型的推理必须在控制周期内完成,否则机器人就等在那儿。这催生了一套”规划慢、执行快”的解耦架构:低频规划出一个动作块(chunk),高频从块里查表下发。

工作训练算力推理硬件规划/推理延迟有效控制频率
daydreamer单机(learner/actor 分卡)GPU/CPU 分离A1 20Hz / UR5 2Hz / XArm 0.5Hz
v-jepa-2预训 A100 + 对齐 128–512×H100单 RTX 409016 秒/动作(vs Cosmos 4 分钟)blocking control 4fps
genie-envisioner8–32×A100 分阶段机器人本体 RTX 409054 步动作轨迹 200ms视频 DiT 5Hz + 动作 30Hz(1:6)
alibaba-rynnworld-4d未披露单 RTX 5090(FP8+FA3)三分支 Transformer 990ms(占 89.5%),总 1106ms规划 0.9Hz → 动作 50Hz 下发 → 有效 9Hz
alibaba-rynnworld-teleop预热 64×H100单 H100蒸馏因果 student 25ms/帧40 FPS(480×832),超同类 2–10Hz
nvidia-cosmos-policy8–64×H100单 H1005 步去噪 0.61s/chunk;1 步 0.16sbest-of-N(N=8)4.9s on 8×H100
enerverse8×A100 20–32 小时A100 / RTX 4090动作 chunk ~300ms(K=8)

几个代表性设计:alibaba-rynnworld-4dalibaba-rynnworld-teleop 共享同一套真机控制栈——策略推理 50Hz、底层接口 500Hz、指令延迟 18–30ms、经 LCM 通信;关键 trick 是”规划 0.9Hz 但每次出 K=10 步动作块,执行窗口内 50Hz 查表下发、下一轮规划并行算”,把有效控制频率抬到 ~9Hz。v-jepa-2 的对比最刺激:V-JEPA 2-AC 每动作 16 秒 vs Cosmos 每动作 4 分钟(一次 pick-and-place 用 Cosmos 要一小时)——latent 世界模型在控制延迟上对像素扩散世界模型是数量级优势。综述 world-action-models-survey 把这件事上升成公式:open-loop 成本 N_fwd(T)(每场景一次、不随控制频率缩放)、chunked closed-loop ⌈T/K⌉·N_fwd(K)(可行条件 N_fwd(K)/K < 1/f_ctrl)、single-step 硬约束 N_fwd(1) < 1/f_ctrl、interactive N_fwd^cached(M(t))(attention 骨干下累计成本随 t 二次增长)——并收录 DreamZero 靠 KV-cache 观测替换达 7Hz 闭环、π0.7 每 4 秒刷新 subgoal 图像等具体数字。


七、驾驶占据 / BEV 世界模型:被感知管线拖慢的 FPS

驾驶世界模型的 FPS 有个独特特征——世界模型本体很快,但前置的相机→占据感知拖慢了端到端管线occworld 是标志性对照:OccWorld-O(真值占据输入)18.0 FPS,但换成相机输入的 OccWorld-D/T/S 全部掉到 2.8 FPS(被 TPVFormer/SelfOcc 感知拖慢)。这条”真值输入 vs 相机输入”的鸿沟贯穿整族:

工作训练硬件真值占据输入 FPS相机端到端 FPS备注
occworld8×RTX 409018.02.8vs UniAD 1.8 / VAD-Base 4.5
i2-world-tokenization8×RTX 409037.044.21(STC)训练仅 2.92GB 显存
sparseworld-4d-occupancy4×A1008.0(PreWorld 1.0,~8×)最终 ckpt 8×H20,17GB 显存
sparseworld-tc8×H20I²-World-O 37.04(对照)Small 9.35 / Large 3.58DINOv3 版更慢
gaussianworld-occupancy16×RTX 4090228ms/7030MB流式建模仅 +3ms/+72MB
geniedrive8×L40S占据 WM 41.38 FPS(3.47M 参数)视频 4.36s/帧微调预训练视频模型,比从头训省 4–16× 卡
drive-occworld8×A100延迟拆解表(W_E 140–406ms)时延主要来自历史编码器
xiaomi-auto-world-model未披露WorldGen 0.19s/帧(单视)、0.46s(三视)@H20WorldRec 10s clip 重建 ~10s(vs 逐场景 4 小时)

大分辨率驾驶视频生成则彻底不实时:genad-generalized-predictive-model 采样 539ms/步×100 步 ≈ 54 秒/次,magicdrivedit 满配 848×1600×241 帧要 28.92 分钟,vista-driving-world-model 作者直接承认”因预测分辨率极高、计算开销大,直接上车有安全风险”。所以驾驶世界模型的主流定位是离线数据生成引擎magicdrivedrivedreamerpanacea-driving-videodelphi-driving-video 4 秒/样本、cosmos-drive-dreams),而非车载实时模块——survey-world-models-autonomous-driving 把”效率”列为该领域核心限制之一,并推荐 DFIT-OccWorld 式”只预测动态体素流、静态直接位姿变换”的解耦策略作为务实方向。占据侧的流式建模(gaussianworld-occupancysparseworld-tcgeniedrive)是唯一逼近实时的分支。


空白与趋势

1. 总 GPU-hours 系统性缺失,口径混乱依旧。 绝大多数页只给”X 卡 × Y 天”或干脆只给卡数,完整的总 GPU-hours 罕见(irasimt-jepa-tabulargenex 是少数例外)。mbrl-survey-moerland 十年前批评的”算力口径不可比”至今未解——训练成本用天/卡/步/FLOPs 各说各话,跨工作横比极难。博客发布尤其黑箱deepmind-genie2genie-3deepmind-sima2 这类顶级工作的训练 infra 几乎零披露,只给推理端的 fps。

2. 实时推理已从”能不能”转向”配方成熟”。 2024 的 20fps 到 2026 的 40–60fps(tencent-yanskywork-matrix-game-3),靠的是一套高度模块化、可叠加的配方——蒸馏少步 + 并行解码 + FP8/INT8 + VAE 剪枝 + 定制 kernel + 异步 GPU 拆分。下一步的前沿是长时程稳定的实时gigaworld-1 11,000+ 帧、worldmem 记忆库线性增长的存储瓶颈)和NPU/ASIC 等非 NVIDIA 栈moworld-flash-world-model 昇腾 50fps、decart-oasis 提到 Sohu ASIC)。

3. latent vs 像素的推理延迟鸿沟是范式级的。 v-jepa-2(16 秒/动作)对 Cosmos(4 分钟/动作)的数量级优势、dino-wm/pldm-planning-latent-dynamics 全程在隐空间规划省算力,说明**“不解码像素”仍是控制场景下最强的 infra 杠杆**。生成视频世界模型再快也难追上,除非蒸馏到极少步——这解释了为何具身/控制场景仍大量用 latent 世界模型,而给人玩的场景才不惜代价上像素扩散。

4. 控制频率的解耦架构正在标准化。 “低频规划出动作块 + 高频查表下发 + 下一轮并行算”(alibaba-rynnworld-4dgenie-envisionerworld-action-models-survey 的 chunked closed-loop 公式)已是具身世界模型的通用范式,把”感知到执行”的时延缺口系统性压小。这条 slow-fast 异步思路,本质上和交互游戏世界模型的”DiT 慢 / VAE 快 / 异步流水”是同一个工程哲学在不同场景的投影。

5. tokenizer/VAE 成了实时化的隐藏主战场。 context-aware tokenization(delta-iris 4 token)、非对称 VAE 剪枝(skywork-matrix-game-3 ×5.2 解码加速)、时空解耦避免显存二次膨胀(drivingworld-gpt)——压缩闸门开多大,几乎直接决定了自回归步数和解码延迟。这一层的工程红利远未见顶,是最值得继续深挖的方向。