生成式交互世界族:从”视频生成即环境”到实时可玩世界与物理 AI 平台

本页是 world-model 调研里生成式交互 / 视频世界模型这一大族的横向综述,串起 2020→2026 的主干工作。每条硬数据都引自对应单工作页([[slug]] 内链,slug = 文件名去 .md),单页均已对抗式核过一手原文。

这一族的共同命题是:用一个生成模型(GAN / 扩散 / 自回归 Transformer)取代”手写代码 + 图形/物理引擎”,让世界的下一帧由动作条件生成出来。它与”用于智能体规划的隐空间世界模型”(Dreamer / RSSM / JEPA 系,另见 architecture section)分属两条路线——后者压到低维隐状态做动力学,前者坚持像素级可观看、可交互。全族的技术主线是四次能力换挡:① 动作条件视频预测的奠基(2020–2023,GAN → 视频扩散,把”视频生成”重定义为”动力学建模 / 环境模拟”)→ ② 单一游戏的实时神经引擎(2024,DOOM / Minecraft,20 FPS)→ ③ 开放域、长时一致、真·实时可玩世界(2025,720p/24–60fps + 分钟级记忆 + 蒸馏近实时)→ ④ 物理 AI 平台化与一次性持久 3D 世界(2025–2026,Cosmos 合成数据引擎、World Labs/HunyuanWorld 的可导出 3DGS)。


0. 一句话地图


1. 谱系时间线:四次能力换挡

年份工作换挡意义
2020game-gan首个 action-conditioned GAN 学游戏引擎;NTM 外部记忆解 loop-closure;静/动态解耦渲染
2021playable-video-generation(CADDY)首提”可玩视频生成”,无监督从无标签视频学离散潜动作(Genie LAM 先驱)
2023unipi-universal-policies-video · unisim把”视频生成”正式 cast 成”策略 / 真实世界模拟器”;统一”图像=状态、文本/控制=动作”接口
2024gamengen · decart-oasis · deepmind-genie2 · the-matrix · gamegen-x · playable-game-generation · genex单游戏实时可玩(DOOM/Minecraft 20 FPS);开放域生成(Genie 2 一图即 3D 世界、GameGen-X 开放世界);无限长(The Matrix Swin-DPM)
2025genie-3 · microsoft-wham-muse · skywork-matrix-game · skywork-matrix-game-2 · tencent-hunyuan-gamecraft · tencent-yan · gamefactory · worldmem · yume · playerone · mirage-dynamicslab · cosmos-predict2 · cosmos-predict2-5-world-simulation · nvidia-cosmos-transfer1 · world-labs-marble · world-labs-rtfm · odyssey-explorer · decart-mirage-lsd · luma-ray3-world-models · hunyuanworld-1 · hunyuanworld-voyager · matrix-3d真·实时 + 开放域 + 长时一致三合一;平台化(Cosmos);一次性持久 3D 世界(World Labs / HunyuanWorld)
2026skywork-matrix-game-3 · dreamx-world-1 · alayaworld · gigaworld-1 · abot-3dworld-0显式记忆机制(联合注意力 / 几何检索)+ RL 对齐 + 更小模型打更大模型;评估器化

一条贯穿全程的暗线是基座换代:早期从零训(GameGAN 的 GAN、CADDY 的编码器、WHAM 的 ViT-VQGAN+GPT-2),2024 起复用图像/视频生成大模型的先验——SD1.4(gamengen)、DiT(decart-oasis)、HunyuanVideo I2V(skywork-matrix-game / tencent-hunyuan-gamecraft)、SkyReels-V2 / Wan(skywork-matrix-game-2 / yume / playerone)、Wan2.2-TI2V-5B(skywork-matrix-game-3 / dreamx-world-1)、LTX-2.3-22B(alayaworld)。这与 omni 视频生成族的”3D-VAE + DiT + Flow Matching”主干换挡完全同步——交互世界模型是视频生成基座之上加”动作条件 + 因果自回归 + 抗漂移 + 蒸馏”四件套的下游分支


2. 五大子范式

2.1 奠基:从”视频预测”到”动作进、视频出的世界模拟器”

这一支回答的是”生成模型凭什么能当环境”。三代思路层层递进:

  • 动作条件像素预测(2020–2021)game-gan 把 World Models(Ha & Schmidhuber)的 VAE 重建换成对抗训练(画面更锐)+ 显式设计——一个 action-conditioned LSTM 动力学引擎(512 维隐状态)、一个 NTM 式 shift-based 外部记忆(训练 39×39×512、测试可放大到 99×99,专治”绕一圈回原地场景要一致”的 loop-closure)、一个用 cycle loss 逼模型把静态元素塞进记忆的静/动态解耦渲染引擎。它是首个”只看帧+动作、不看源码就替换图形引擎”、也是首个用 GAN 框架解出 VizDoom(迁移分 ≥750 即 solved)的工作。playable-video-generation(CADDY)更进一步:连动作标签都不要,用 Gumbel-Softmax + 动作方向聚类中心 + 互信息损失,从 BAIR / Atari / Tennis 无标签视频里无监督发现一组离散动作——这正是三年后 Genie Latent Action Model 的直接精神先驱。
  • 视频生成即策略 / 即环境(2023):同一批作者(Sherry Yang 等)用两篇互补工作把范式钉死。unipi-universal-policies-video(UniPi,NeurIPS 2023 Spotlight)提出替代 MDP 的 UPDP——“图像=通用状态接口、文本=通用任务规约、任务无关的视频规划 ρ 与环境相关的动作 π 解耦”,先用文本条件视频扩散把”未来会发生什么”合成出来(这就是 planning),再用小逆动力学模型抽动作;证明 14M+60M+LAION 互联网预训练能迁移到真机(Bridge 微调,FID/FVD/成功率全升)。unisim(ICLR 2024 最佳论文)把 ρ 反过来当环境/模拟器:一个 5.6B video U-Net 把 14 类异构数据(互联网图文、机器人、人类活动 Ego4D、导航全景……)编排进统一 action-in-video-out 接口(文本动作走 T5 embedding、低层控制离散成 4096 bin 拼接),既能响应”打开抽屉”也能响应”移动 Δx,Δy”;纯在模拟里训 VLM 策略 / RL 策略(PaLM-E 12B / PaLI 3B)后 zero-shot 迁移真机(RL 48 任务成功率 0.58→0.81)。UniPi 把视频生成当策略,UniSim 把它当环境——二者共同确立了后续整族”动作条件视频扩散 + 自回归 rollout”的骨架。

2.2 神经游戏引擎:单一游戏、实时、可玩

2024 年三个几乎同时的工作把”游戏 = 神经网络权重而非代码”从口号做成了可玩 demo,共享一套配方:RL/人类玩法录数据 → 动作条件扩散/自回归 teacher-forcing 训练 → 抗自回归漂移技巧 → 少步采样实时化

  • gamengen(Google,DOOM):把 SD1.4 U-Net 改成动作条件自回归扩散(动作 embedding 替换文本 cross-attention、过去 64 帧沿通道拼接),用 PPO 智能体自玩录 9 亿帧,128×TPU-v5e 训。关键技巧是 noise augmentation——训练时给 context 帧加可控高斯噪声并把噪声等级喂给模型,否则 10–20 帧就崩;4 步 DDIM 即达质量甜点,单 TPU 20 FPS,逐帧 PSNR 29.4(≈JPEG 有损压缩),人评仅 58%/60% 能把模拟和真实分开。
  • decart-oasis(Decart/Etched,Minecraft):刻意选纯 Transformer(ViT-VAE + DiT-S/2,时空轴向注意力交错)而非 U-Net,理由是 scaling 可预测 + 亲和 Etched 的 Sohu ASIC;训练用 Diffusion Forcing(每帧独立噪声级),推理用 dynamic noising 抗漂移;H100 上 360p/20fps(47ms/帧),比同架构文生视频快 >100×,开源 500M。
  • playable-game-generation(腾讯 PlayGen,Mario+Doom):VAE(55M)+DiT(131M) 的 RNN-like 自回归隐空间扩散(借 Diffusion Forcing,用隐状态 z_t 概括无限历史),4 步 DDIM 在消费级 RTX 2060 上双游戏 20 FPS;首提可玩性量化——用 Valid Action Model 反推动作算 ActAcc/ProbDiff,证明 1024 帧长程游玩交互机制准确率仅衰减 <0.036(Mario ActAcc 0.803→0.789)。数据侧三件套(多样采集 + 聚类均衡采样 + PER 式长尾迁移学习)解决稀有转移欠拟合。

随后 mineworld(微软)走非扩散路线证明另一条可行:VQ-VAE 把画面、动作分词器把键鼠各转离散 token 交错成一条序列,LLaMA 架构自回归 next-token;配训练无关的 Diagonal Decoding 并行解码,300M/1.2B 模型在 A100 上 3–6 FPS,可控性/画质全面超 decart-oasis(F1 0.70 vs 0.41)。这些工作共同确立了本族的三条评价轴——实时交互、足够视觉质量、准确交互机制——以及”记忆窗口短(GameNGen 仅 3 秒、MineWorld 仅 16 帧)“这个待解的公共瓶颈。

2.3 开放域可玩世界:一图即世界、长时一致、真·实时

2024 末起,战场从”复现单一已知游戏”转向”生成从未存在过的世界”,并把”实时 + 开放域 + 长时一致”三者同时兼得作为目标。这条支线最拥挤,可按解决的核心难题再分:

① 开放域生成 & 无限长(2024):DeepMind deepmind-genie2自回归潜空间扩散 + 因果 Transformer把 Genie 从 2D(genie-generative-interactive-environments,隐动作 + ST-transformer)推到”一张 Imagen 3 提示图 → 可键鼠操控的 3D 世界”,涌现物体交互/物理/NPC/约 1 分钟记忆,并引入”基座(高质量非实时)vs 蒸馏版(实时、质量降)“的双模型模板。阿里 the-matrixSwin-DPM 滑窗去噪让预训练 DiT 无需重训即可外推到无限长 720pSCM 蒸馏到 8–16 FPS,还验证零样本域泛化(宝马 X3 开进办公室/开进海里)。港科 gamegen-x 首个”开放世界游戏视频生成 + 交互控制二合一”:MSDiT 基座学生成、冻结后单训 InstructNet 分支吸收指令/键鼠/视频提示,FVD 从最强开源基线 1016 降到 760、角色控制成功率约 27%→63%。

② 场景泛化的可插拔控制(2025):港大/快手 gamefactory 提出关键工程范式——风格学习与动作控制解耦:LoRA 承担 Minecraft 风格学习、独立动作模块承担控制学习,推理时”卸下”风格 LoRA 即把控制能力泛化到开放域;仅用 70 小时程序化 Minecraft 数据。它同时定下被后续广泛沿用的动作注入准则——连续鼠标 concat、离散键盘 cross-attentionskywork-matrix-game 明确沿用其 group-operation trick)。

③ 规模化开源可玩世界(2025):Skywork skywork-matrix-game(17B MMDiT,HunyuanVideo I2V 初始化,image-to-world 去文本分支主打 spatial intelligence)配套 GameWorld Score 基准与 2700h+1200h 数据集,键盘/鼠标控制精度 0.95/0.95 全面碾压 Oasis/MineWorld;腾讯 tencent-hunyuan-gamecraft 主攻 AAA 开放世界,把离散键鼠统一到连续相机动作空间(方向+速度、去 roll、可转 Plücker),混合历史条件(单帧/末帧/长片段 head latent + 二值 mask)自回归扩到分钟级,PCM 蒸馏到 6.6 FPS;腾讯 tencent-yan 用一份 4 亿帧《元梦之星》数据训 Sim/Gen/Edit 三模块,Yan-Sim 是唯一做到 1080p/60FPS/0.07s 延迟的(32×32×2 高压缩 VAE + shift-window denoising + FP8)。

④ 登 Nature 的方法论 & 真实世界 / 第一人称(2025):微软 microsoft-wham-muse(WHAM/Muse)把画面 token 与手柄动作 token 交错成同一条序列(ViT-VQGAN + GPT-2,1.6B,Bleeding Edge 14 亿帧 / 27.89 TiB),一个模型同时是世界模型、行为策略、full-generation,从 27 位创作者访谈蒸出 consistency/diversity/persistency 三种可量化能力(FVD 与训练 loss 相关 r=0.77),是首个登上 Nature 的生成式游戏世界模型且开源。上海 AI Lab yume 把战场搬到真实世界城市漫游(Sekai 真实视频),用量化相机动作 QCM(离散动作→文本条件、零新增参数)+ MVDT + 训练无关的 AAM/TTS-SDE,指令跟随 0.657 远超 Matrix-Game 0.271。港大/达摩 playerone第一人称真人动作驱动:外部相机实拍 SMPL 动作,部件解耦注入 PMI(头/手/身脚三组各自编码),MPJPE 127 大幅优于 Cosmos-14B 的 257。

⑤ 实时流式 + 记忆 + RL(2025–2026):Skywork skywork-matrix-game-2 把 1.8B 双向扩散基座经 Self-Forcing 蒸馏成因果少步(3 步)自回归 + 滚动 KV-cache,单 H100 25 FPS 分钟级流式,首个开源权重+代码的实时流式交互世界模型;skywork-matrix-game-3 反而回到双向骨干(Wan2.2-TI2V-5B),把检索记忆/历史/当前预测放进同一自注意力空间联合建模(+相对 Plücker + 头级扰动 RoPE),INT8 量化 + 剪枝 VAE + 8+1 GPU 异步部署做到 720p@40FPS,并放大到 28B-MoE。worldmem 先一步用显式记忆库 + FOV 重叠检索(记忆帧当”干净帧”塞进 Diffusion Forcing 去噪)解决”离开视野再回来”的一致性,beyond-window PSNR 25.32 vs 纯 DF 18.04。高德 dreamx-world-1E-PRoPE(只对下采样 token 算投影式相机注意力,训练/推理省 30–50%)+ 几何检索记忆 + DMD 蒸馏后再叠 RL(DiffusionNFT),5B 模型总分 84.76 反超 8B HY-WorldPlay 与 14B LingBot,8×RTX5090 16 FPS。Alaya Lab alayaworld(LTX-2.3-22B)则坦承是系统集成 + 全栈开源——GEN3C 显式 3D 缓存 + Frame Preservation 历史压缩 + Helios 漂移历史 + error bank 双侧注入 + DMD 4 步,价值在于用”control/consistency/stability/runtime 四维框架”统一这片领域。创业公司 Dynamics Lab 的 mirage-dynamicslab(后改名 Magica)把它做成”AI 原生 UGC 游戏引擎”(因果 AR 扩散 Transformer + KV-cache,单消费级 GPU 200ms、10 分钟+)。

2.4 物理 AI 平台:Cosmos 与”世界模型即合成数据引擎”

NVIDIA 把世界模型做成平台产品线,叙事是”预训练通才世界模型 → 下游小数据 post-training 专才 → 给机器人/驾驶造合成数据、做闭环仿真、评策略”,而非追求”可玩”:

  • cosmos-predict2(2B/14B,统一 DiT,Text2Image + Video2World,8×8×4 tokenizer,T5-11B 文本编码,rectified-flow)配套独立训练的 NATTEN 稀疏注意力 checkpoint 把 720p 推理压到基线 38–59%(1.7–2.6×),内置 Cosmos-Reason1-7B 兼当 prompt refiner 与 rejection-sampling critic;PBench 77.4 超 Wan2.1-I2V/HunyuanVideo/CogVideoX,GenEval 0.84。它把分辨率(480p/720p)×帧率(10/16fps)做成自由组合矩阵,动作条件变体(7×12=84 维末端执行器动作)在 Bridge 上 post-train。
  • cosmos-predict2-5-world-simulation(2025-10 继任)三处实质升级:flow-matching 三任务合一(T2W/I2W/V2W)、WAN2.1 VAE + 只留 3D RoPE用物理 AI VLM Cosmos-Reason1 替换 T5(拼接多层激活投影到 1024 维);预训练处理 >2 亿视频/3500 万小时素材(仅 ~4% 通过全过滤),完整后训练配方(domain-specific SFT → model soup 合并 → GRPO 式 RL + VideoAlign 奖励 + diffusion-loss 正则防 reward hacking → rCM 4 步蒸馏),4096×H100 上 2B MFU 36.49%。Predict2.5-2B/14B 以远小体量追平/超过 Wan2.2-27B-A14B(人偏好 14B 48.6% vs Wan2.1-14B 31.8%),下游机器人 Real2Real 增强把策略成功率从 1/30 提到 24/30。
  • nvidia-cosmos-transfer1(ControlNet 分支)把 Sim2Real”世界翻译”接进平台:多路 ControlNet(Vis/Edge/Depth/Seg,AV 另加 HDMap/LiDAR)+ 时空控制权重图(前景高约束保形、背景低约束换景),模态独立训练、推理时融合;GB200 NVL72 上 64 卡把 5 秒 720p 生成压到 4.2 秒(生成快于播放)。这条线后来收敛为 Transfer2.5-2B(比 Transfer1-7B 小 3.5× 却更强)。作为对照,gigaworld-1 把世界模型专门做成策略评估器(WMBench 基准 + evaluator 导向设计),genesis-generative-physics 则代表”用经典物理引擎当精确模拟器 + VLM 生成 agent”的另一条生成式仿真路线。

2.5 一次性持久 3D 世界 & 实时视频改写

2025 年”世界模型”分叉出与自回归视频流正交的一支:不逐帧”梦”出世界,而是一次性生成几何一致、持久存在的静态 3D 场景(可导出 3DGS/mesh),用一次性几何绕开自回归漂移与记忆窗口瓶颈,代价是场景本身不含动态/物理。

  • World Labs(李飞飞)双拼图world-labs-marble(商业化”大世界模型”,text/image/multi-image/video/coarse-3D → 持久 3D Gaussian Splat + mesh,两阶段”全景生成→3D 提升”,~5min/世界,开源渲染器 Spark)+ world-labs-rtfm(把世界模型当”学出来的实时渲染器”,自回归扩散 Transformer,位姿帧作为空间记忆 + context juggling 把上下文从”随时间增长”变成”随局部空间有界”,单 H100 交互帧率)。二者一个造静态资产、一个实时探索。
  • 腾讯 HunyuanWorld 谱系hunyuanworld-1(“全景图作 2D-3D 桥梁”,VLM 智能体自动分层为天空/背景/多前景物体层 → sheet warping 重建可导出、物体级可交互的分层 mesh,四组对比全指标超 LayerPano3D/Director3D 等)+ hunyuanworld-voyagerRGB-D 联合视频扩散,用深度显式提供几何先验抑制幻觉,世界缓存 + 点云剔除 + 平滑采样支持长程漫游,WorldScore 77.62 第一,生成即重建无需 SfM)。Skywork matrix-3d全景视频路线(Wan2.1-I2V-14B + 场景网格渲染条件,116759 条 Matrix-Pano 合成数据,前馈 LRM 10 秒重建 vs 优化式 571 秒 PSNR 27.62)。JHU genex 把全景想象探索接入具身决策(GPT-4o + GenEx 单智能体 46.10%→85.22%、多智能体 21.88%→94.87%)。高德 abot-3dworld-0 把它锚定到地图 POI 做消费级空间探索引擎。
  • 实时视频改写 & 商业视频模型odyssey-explorer(前 Wayve/Waymo 团队,Explorer 图生 3DGS + Odyssey-1 真实世界 AR 视频世界模型,H100 30 FPS/40ms,明确与游戏世界模型划清界限、主张从真实视频学);Decart decart-mirage/decart-mirage-lsd(MirageLSD,Live-Stream Diffusion 逐帧改写任意视频流,<40ms/24FPS/无限时长,Diffusion Forcing + history augmentation + Hopper mega-kernel);Luma luma-ray2luma-ray3-world-models(“多模态即 AGI、现实是数据集”叙事下的商业视频模型,Ray3 自称”推理式视频模型”+ 原生 HDR,但闭源无论文,“世界模型”更多是口径)。

3. 横向对比表

说明:未披露指该工作(多为博客/闭源产品)未公开对应数字。分辨率/FPS 取一手页披露值。“骨干”列标注基座来源。

表 3-A|奠基 + 单游戏神经引擎

工作年/机构骨干 & 范式训练数据动作条件实时化 / 硬件关键指标
game-gan2020 NVIDIAGAN:LSTM 动力学 + NTM 记忆 + 解耦渲染Pacman/VizDoom 帧+动作(45K/10K ep,84×84)one-hot → shift 记忆核未披露(浏览器可玩)首个 GAN 解出 VizDoom(≥750)
playable-video-generation2021 Trento/Snap编码器 + 离散瓶颈(Gumbel-Softmax 聚类)BAIR/Atari/Tennis 无标签无监督潜动作 K 类浏览器轻量BAIR Δ-Acc 69.0 vs 44.8;Tennis 用户一致性 0.469
gamengen2024 GoogleSD1.4 U-Net 扩散,自回归DOOM 900M 帧(PPO 自玩)动作 emb 替换文本 cross-attn;过去 64 帧 concat128×TPU-v5e 训;单 TPU 20 FPS(4 步)PSNR 29.4;人评仅 58/60% 辨真
decart-oasis2024 Decart/EtchedViT-VAE + DiT-S/2,Diffusion ForcingMinecraft VPT 录像25 维键鼠 → AdaLNH100 360p@20fps 47ms;开源 500M无定量(demo)
playable-game-generation2024 腾讯VAE(55M)+DiT(131M) RNN-like ARMario 236M/Doom 900M → 均衡 50M/200M动作 emb cross-attnRTX 2060 20 FPS(4 步)1024 帧 ActAcc 衰减 <0.036
mineworld2025 微软VQ-VAE + LLaMA AR(Diagonal Decoding)VPT 1000 万 clip / 55B token动作 11-token 序列32×A100 训;3–6 FPSvs Oasis F1 0.70 vs 0.41

表 3-B|开放域 / 可玩世界模型(2024–2026)

工作年/机构骨干(基座)训练数据记忆 & 长时实时化 / FPS关键指标
deepmind-genie22024 DeepMindAR 潜扩散 + 因果 Transformer大规模视频(未披露)~1 分钟涌现蒸馏版实时(未披露)无定量(能力展示)
the-matrix2024 阿里2.7B video DiT + Swin-DPM + SCMForza/Cyberpunk 75 万标注+120 万无标注无限长(滑窗)SCM 8–16 FPS零样本域泛化(宝马开进海)
gamegen-x2024 港科MSDiT + InstructNet 分支OGameData 100 万 clip(150+ 游戏)记忆窗 1–108 帧项目页 320p 20 FPSFVD 1016→760;控制成功率 27%→63%
microsoft-wham-muse2025 微软(Nature)ViT-VQGAN + GPT-2,画面/动作 token 交错Bleeding Edge 14 亿帧 / 27.89 TiB上下文 1s(10 帧)98×H100 5d;非实时2 分钟一致;FVD~loss r=0.77
skywork-matrix-game2025 Skywork17B MMDiT(HunyuanVideo I2V)Matrix-Game-MC 2700h+1200h5 运动帧自回归非实时(A100/H100 ≥80G)GameWorld 键盘 0.95/鼠标 0.95
tencent-hunyuan-gamecraft2025 腾讯HunyuanVideo MM-DiT + 混合历史条件100+ AAA / 100 万 clip + 3000 渲染head latent(单帧/末帧/长片段)192×H20 训;PCM 6.6 FPSDyn.Avg 67.2 vs MG 31.7;RPE↓55%
tencent-yan2025 腾讯SD/Wan 三模块(Sim/Gen/Edit)元梦之星 4 亿帧KV-cacheYan-Sim 1080p 60 FPS 0.07s唯一 1080p/60FPS
gamefactory2025 港大/快手~1B 视频扩散 + 可插拔动作模块 + LoRA 解耦GF-Minecraft 70h 程序化Diffusion Forcing 自回归非实时开放域 Flow-MSE 54.13 vs 76.02
worldmem2025 NTUOasis DiT + DF + 显式记忆 cross-attnMinecraft 20K×1500 帧 / RealEstate10KFOV 检索记忆库非实时beyond-window PSNR 25.32 vs DF 18.04
skywork-matrix-game-22025 Skywork1.8B(SkyReels-V2)+ Self-Forcing 蒸馏UE+GTA ~1200h(合成为主)滚动 KV-cache单 H100 25 FPS(3 步)vs Oasis Mouse 0.95 vs 0.56
yume2025 上海 AI LabSkyReels-V2-14B + MVDT + QCMSekai-Real-HQ 400h 真实城市FramePack 分级压缩对抗蒸馏 14 步(3.7×)指令跟随 0.657 vs MG 0.271
playerone2025 港大/达摩Wan2.1-1.3B + PMI 部件解耦ego-exo 配对(SMPL)训练时点云重建CausVid 蒸馏 8 FPSMPJPE 127 vs Cosmos-14B 257
mirage-dynamicslab2025 Dynamics Lab因果 AR 扩散 Transformer + KV-cache互联网游戏 + 自录(未披露)长上下文 KV-cache16 FPS(v1);单消费级 GPU 200ms(v2)无(仅自绘 vs Genie 3 表)
skywork-matrix-game-32026 SkyworkWan2.2-TI2V-5B 双向 + 联合注意力记忆480 万 clip(UE5+AAA+真实)几何检索记忆(相对 Plücker)INT8+剪枝 VAE,8+1 GPU 720p@40FPS内部消融(记忆检索最关键)
dreamx-world-12026 高德Wan2.2-5B + E-PRoPE + RL(DiffusionNFT)UE5 + 真实 + 游戏几何检索 + 误差注入DMD 蒸馏;8×RTX5090 16 FPS5B 超 8B/14B;Overall 84.76
alayaworld2026 Alaya LabLTX-2.3-22B AR DiT + GEN3C 缓存gameplay + 真实(未披露)空间缓存 + 压缩历史 + error bankbf16 FA3;DMD 4 步无(定性预览)

表 3-C|Genie 3 与 Cosmos 物理 AI 平台

工作年/机构骨干 & 范式数据训练 / 后训练实时 / 算力关键指标
genie-32025 DeepMind自回归逐帧(结构未披露)未披露未披露720p/24fps 实时,数分钟一致、~1min 记忆无定量(SIMA 定性联动)
cosmos-predict22025 NVIDIA统一 DiT 2B/14B(T2I+V2W),8×8×4 tok未披露(无独立报告)post-train recipe 公开NATTEN 1.7–2.6×;DGX/H100PBench 77.4;GenEval 0.84
cosmos-predict2-5-world-simulation2025 NVIDIAflow-matching 2B/14B 三任务合一,Reason1 换脑>2 亿视频/3500 万小时(~4% 过滤)SFT→model soup→GRPO RL→rCM 4 步4096×H100(2B MFU 36.49%)人偏好 14B 48.6% vs Wan2.1-14B 31.8%
nvidia-cosmos-transfer12025 NVIDIAPredict1-7B + 多路 ControlNet + 时空控制图RDS-HQ 360h AV + Predict1 数据每 branch 1024×H100 训 2–4 周GB200 64 卡 5s→4.2sSim2Real 策略 24/30 vs 1/30

表 3-D|一次性持久 3D 世界 & 实时视频改写

工作年/机构表征 & 范式输入记忆 / 一致性来源实时 / 生成耗时关键指标
world-labs-marble2025 World Labs全景→持久 3DGS + mesh(可导出)text/image/multi-image/video/coarse-3D一次性几何(无漂移)离线 ~5min/世界无定量(产品参数)
world-labs-rtfm2025 World LabsAR 扩散 Transformer(“学出来的渲染器”)单图/短视频位姿索引空间记忆 + context juggling单 H100 交互帧率无定量
hunyuanworld-12025 腾讯全景→VLM 分层→sheet warping 分层 mesh文/图一次性几何 + 物体级解耦未披露(4090 lite 量化版)全指标超 LayerPano3D/Director3D
hunyuanworld-voyager2025 腾讯RGB-D 联合视频扩散(HunyuanVideo)单图 + 相机轨迹世界缓存 + 点云剔除8×H20 288s(49 帧)WorldScore 77.62 第一
matrix-3d2025 Skywork全景视频(Wan2.1-I2V-14B)→ 3DGS文/图 → 全景场景网格渲染条件A800 720p ~1h;前馈 LRM 10s 重建全景 FVD 140;重建 PSNR 27.62
genex2024 JHU全景视频扩散(SVD)+ 球面一致性单图球面一致正则(IELC<0.1@20m)384 A100-hrs 训;~1.86s/帧具身决策 46.10%→85.22%
odyssey-explorer2025 OdysseyExplorer 图生 3DGS / Odyssey-1 AR 视频单图 / 真实视频窄分布后训练换稳定H100 30 FPS 40ms(Odyssey-1)无定量(研究预览)
decart-mirage-lsd2025 DecartLive-Stream Diffusion 视频→视频改写实时视频流 + 文本有限历史窗(无长记忆)<40ms/24FPS 无限时长响应速度 16× vs 前作 AR
luma-ray3-world-models2025 Luma闭源”推理式视频模型” + 原生 HDR文/图/视频未披露Draft 5–20×无可复核定量(自述 SOTA)
abot-3dworld-02026 高德14B 全景视频扩散 → ABot-3DGS文/图/多视图/视频Spatial Generative Primitive未披露锚定地图 POI

4. 共享设计模式:全族的六个公共零件

把上面 40+ 工作拆开看,会发现它们其实在反复组合同一套零件——这也是本族”看起来百花齐放、实则同构”的原因。

4.1 动作条件注入:连续 concat + 离散 cross-attention 几乎成定式

早期 game-gan 用 one-hot 动作驱动记忆移位核,gamengen 直接用动作 embedding 替换 SD 的文本 cross-attention。到 2025,gamefactory 用消融确立了被后续广泛沿用的准则:

信号类型注入方式采用者
连续(鼠标/相机/低层控制)通道 concat + MLP + 时间自注意力gamefactory · skywork-matrix-game · skywork-matrix-game-2(鼠标)
离散(键盘按键)cross-attentiongamefactory · skywork-matrix-game · skywork-matrix-game-3(键盘)
统一相机空间方向+速度 → token addition / Plückertencent-hunyuan-gamecraft · dreamx-world-1(E-PRoPE)· alayaworld(AdaLN)
键鼠 → 自然语言T5/文本条件(零新增参数)the-matrix · yume(QCM)
统一 action-in-video-outT5 embedding ⊕ 离散化控制 binunisim
真人全身动作SMPL 分部位(头/手/身脚)独立编码playerone(PMI)
潜动作(无标签)离散瓶颈无监督学playable-video-generationgenie-generative-interactive-environments

消融证据一致:gamefactory 显示”离散 cross-attn + 连续 concat”组合 Flow-MSE 全子集最优;tencent-hunyuan-gamecraft 显示 token addition 优于 concat;playerone 显示部件解耦(DINO 62.5)明显优于整体编码(58.0)与 ControlNet 式注入(57.1)。

4.2 抗自回归漂移:从加噪到”训练时就见坏历史”

teacher-forcing 训练与自回归推理的分布 gap 会让误差滚雪球——这是全族的头号敌人,解法演进出一整条谱系:

机制一句话代表
noise augmentation给 context 帧加可控噪声并喂噪声等级,学会纠正污染历史gamengen
Diffusion Forcing每帧独立噪声级,解锁逐帧自回归 + 推理端 dynamic noisingdecart-oasis · playable-game-generation · worldmem · decart-mirage-lsd
Self-Forcing 蒸馏生成器从自身分布采历史帧,弥合 train/inference gapskywork-matrix-game-2
history augmentation训练时用”模型自己可能产生的伪影”腐化历史帧decart-mirage-lsd · decart-mirage
error-aware / error bank存 rollout 残差,重采样注入训练(alayaworld 更进一步双侧注入记忆与目标)skywork-matrix-game-3 · alayaworld · dreamx-world-1
窄分布后训练牺牲泛化换长程稳定odyssey-explorer
一次性几何干脆不自回归,一次生成持久 3D 场景world-labs-marble · hunyuanworld-1

4.3 记忆机制:从短上下文窗口,到位姿/几何索引的空间记忆

“离开视野再回来,场景要一致”是长时可玩的硬门槛。演进路径清晰:滑动窗口 → KV-cache → 空间/几何索引的显式记忆

阶段机制代表
短时上下文窗过去 N 帧(GameNGen 64 帧≈3s、WHAM 10 帧≈1s、MineWorld 16 帧)gamengen · microsoft-wham-muse · mineworld
外部/NTM 记忆shift-based 寻址的地图记忆game-gan
滚动 KV-cache定长近期 latent/动作,超容驱逐skywork-matrix-game-2 · mirage-dynamicslab
分级历史压缩越远的历史压得越狠(FramePack 式)yume · alayaworld
FOV/位姿检索记忆按视场重叠 + 时间戳检索历史帧当”干净帧”worldmem
位姿索引空间记忆每帧带 3D 位姿,按空间邻近动态组装有界上下文world-labs-rtfm
联合注意力记忆检索记忆/历史/当前预测放进同一自注意力空间 + 相对 Plückerskywork-matrix-game-3 · dreamx-world-1
显式 3D 缓存深度反投影点云缓存,沿目标轨迹渲染几何证据hunyuanworld-voyager · alayaworld

4.4 实时化:蒸馏 + 稀疏注意力 + 量化的推理工程军备竞赛

“可玩”要求 >20 FPS(mineworld 用 APM 换算:>2 FPS 跟上业余玩家、>5 FPS 跟上职业选手)。手段高度趋同:

一个反复出现的取舍是 Genie 2 就定下的”基座 vs 蒸馏版”双模型模板——高质量非实时基座出展示样本、蒸馏版实时可玩但质量降(deepmind-genie2 · the-matrix · skywork-matrix-game-2 皆如此)。

4.5 数据引擎:合成 tick 级对齐 + 真实视频 + 位姿反标

动作-画面逐帧精确对齐是交互世界模型的命门,催生了各家自建数据引擎,四条来源反复出现:

来源手段代表
游戏引擎内存/tick 级采集Cheat Engine 读坐标 / UE tick 回调零对齐误差 / GTA modthe-matrix(GameData 平台)· skywork-matrix-game-2 · skywork-matrix-game-3 · tencent-yan
Minecraft VPT/MineDojoVPT 人类录像 / MineRL VPT agent / 程序化去偏采集mineworld · skywork-matrix-game · gamefactory(程序化消偏)
AAA 游戏录像PySceneDetect 切段 + RAFT 光流 + Monst3R 6-DoF 位姿tencent-hunyuan-gamecraft · gamegen-x(OGameData 100 万 clip)
真实视频 + 位姿反标MegaSaM/VGGT/MoGE/Metric3D 估计相机与深度yume(Sekai)· hunyuanworld-voyager · dreamx-world-1 · odyssey-explorer(背包 6 相机+2 LiDAR)

一个共同发现是数据配比 > 数据量tencent-hunyuan-gamecraft 消融显示”仅合成→控制准但动态崩、仅真实→动态高但控制差”,Render:Live = 1:5 才均衡;playable-game-generation 用聚类均衡采样把 236M/900M 帧精炼到 50M/200M 反而更好;cosmos-predict2-5-world-simulation 只留 ~4% 过全过滤的 clip。

4.6 评测:从”没有 benchmark”到专用可控性度量

早期与闭源产品的通病是只有 demo、没有定量deepmind-genie2 · genie-3 · decart-oasis · world-labs-marble · luma-ray3-world-models · mirage-dynamicslab 均无跑分)。开源侧则催生了专用基准:

基准度量什么出处
ActAcc / ProbDiff用 Valid Action Model 反推动作,量化交互机制准确率playable-game-generation
GameWorld Score视觉/时序/可控性/物理四支柱 8 维(含逐帧键鼠 IDM 精度)skywork-matrix-gameskywork-matrix-game-2 沿用)
IDM 可控性 F1逆动力学模型反推动作的分类精度mineworld
consistency/diversity/persistencyFVD / Wasserstein / 用户编辑保持率microsoft-wham-muse
PBench / PAI-Bench物理 AI 视频 Domain+Quality 双轴cosmos-predict2 · cosmos-predict2-5-world-simulation
WorldScore静态 3D 世界生成(相机控制/3D 一致/内容对齐等 7 项)hunyuanworld-voyager · matrix-3d 引用
重访一致性 ΔPSNR/ΔLPIPS离开-回来轨迹的一致性增益dreamx-world-1
WMBench世界模型作为策略评估器的可靠性gigaworld-1

值得注意的是”崩溃即虚高”陷阱:skywork-matrix-game-2 指出 Oasis 崩溃后倾向输出静止帧,反而虚高了 motion smoothness 与 scenario consistency——说明单一指标不可靠,人评仍是金标准(skywork-matrix-game 双盲胜率 96.3%、tencent-hunyuan-gamecraft 用户研究、dreamx-world-1 盲测 57.5% win)。


5. 三处根本张力

  1. 可交互 vs 一致/持久。自回归视频流(Genie 3、Matrix-Game 系)天生”边走边梦”、有漂移和有限记忆窗;一次性 3D 场景(Marble、HunyuanWorld)几何一致、可自由漫游、可导出资产,但静态无动态/物理(Marble 的火/水只能在导出视频后 enhance)。world-labs-rtfm(Marble 造世界 + RTFM 实时渲染)与 hunyuanworld-1(分层 mesh + 集成 Voyager 做长程扩展)是把两者缝起来的尝试。

  2. 画质 vs 无限长/实时the-matrix 坦承 Swin-DPM/SCM 换来无限长+实时,代价是 FVD/FID/CLIP 相对 Interactive-Module 阶段回退;蒸馏几乎人手一套但都有小幅质量损(skywork-matrix-game-2 · yume · tencent-hunyuan-gamecraft)。dreamx-world-1 的应对是”DMD 蒸馏后再叠一层 RL 把画质/可控性找回来”。

  3. 透明度断层。这一族横跨”完整技术报告 + 开源权重”(Cosmos、Matrix-Game 系、WHAM、GameFactory、MineWorld、Yume、HunyuanWorld)与”博客/产品、几乎零披露”(Genie 2/3、Oasis、Marble、RTFM、Odyssey、Mirage、Luma Ray)两个极端。前者可复现、能拆设计选择;后者只能靠 demo 判断能力上限——genie-3 连参数量、tokenizer、上下文长度都未公开,skywork-matrix-game-3 直言 Genie 3 “细节和训练配方未公开”难以拆解。


6. 这一族要去哪

  • 记忆是 2026 的主战场。短上下文窗(GameNGen 3 秒)已被公认为天花板,2026 的工作几乎都在做显式记忆——几何检索(dreamx-world-1)、联合注意力(skywork-matrix-game-3)、位姿索引空间记忆(world-labs-rtfm)、显式 3D 缓存(hunyuanworld-voyager · alayaworld),并为此新设”重访一致性”评测协议(dreamx-world-1)。
  • 更小模型 + 后训练打更大模型cosmos-predict2-5-world-simulation(14B 追平 Wan2.2-27B)、dreamx-world-1(5B 超 8B/14B)都靠”更强基座 + 更严数据 + 完整后训练(SFT→合并→RL)“而非堆参数;RL 对齐(GRPO / DiffusionNFT + 视频奖励模型)正从视频生成迁移进世界模型。
  • 动作空间从”方向键”扩到”任意行为”genie-3 的 promptable world events、tencent-hunyuan-gamecraft 的连续相机空间、dreamx-world-1 的多实体可组合事件、playerone 的真人全身动作,都在突破”WASD + 相机”的窄动作空间;dreamx-world-1 进一步展望角色中心 + 原生音视频联合世界模型。
  • 平台化与消费级落地并行。一头是 Cosmos/GigaWorld 把世界模型做成机器人/驾驶的合成数据引擎与策略评估器cosmos-predict2-5-world-simulation 的 Real2Real 增强把成功率从 1/30 提到 24/30、gigaworld-1 的 WMBench);另一头是 World Labs/HunyuanWorld/高德把它做成可导出 3D 资产 / 地图空间引擎world-labs-marble · hunyuanworld-1 · abot-3dworld-0)、Decart/Dynamics Lab 做实时视频改写 / UGC 游戏引擎decart-mirage-lsd · mirage-dynamicslab)。
  • 世界模型 + 智能体闭环sima-scalable-instructable-multiworld-agent 这类”住在世界里”的智能体被 DeepMind 与 genie-3 直接配对(SIMA 在生成世界里执行导航目标检验一致性),genex 用想象探索服务具身/多智能体信念推断——“用世界模型批量生成无限多样环境来训练/评测智能体”这条 UniSim/Genie 2 就提出的叙事,正在成为通往具身 AGI 的基础设施主张。

附:本页引用的一手工作页(slug)

奠基:game-gan · playable-video-generation · unipi-universal-policies-video · unisim| 单游戏神经引擎:gamengen · decart-oasis · playable-game-generation · mineworld| 开放域/可玩世界:deepmind-genie2 · genie-3 · the-matrix · gamegen-x · microsoft-wham-muse · skywork-matrix-game · skywork-matrix-game-2 · skywork-matrix-game-3 · tencent-hunyuan-gamecraft · tencent-yan · gamefactory · worldmem · yume · playerone · mirage-dynamicslab · dreamx-world-1 · alayaworld| Cosmos 物理 AI 平台:cosmos-predict2 · cosmos-predict2-5-world-simulation · nvidia-cosmos-transfer1 · gigaworld-1 · genesis-generative-physics| 持久 3D 世界 & 视频改写:world-labs-marble · world-labs-rtfm · hunyuanworld-1 · hunyuanworld-voyager · matrix-3d · genex · odyssey-explorer · decart-mirage · decart-mirage-lsd · luma-ray2 · luma-ray3-world-models · abot-3dworld-0| 消费/智能体:sima-scalable-instructable-multiworld-agent