生成式交互世界族:从”视频生成即环境”到实时可玩世界与物理 AI 平台
本页是 world-model 调研里生成式交互 / 视频世界模型这一大族的横向综述,串起 2020→2026 的主干工作。每条硬数据都引自对应单工作页(
[[slug]]内链,slug = 文件名去.md),单页均已对抗式核过一手原文。这一族的共同命题是:用一个生成模型(GAN / 扩散 / 自回归 Transformer)取代”手写代码 + 图形/物理引擎”,让世界的下一帧由动作条件生成出来。它与”用于智能体规划的隐空间世界模型”(Dreamer / RSSM / JEPA 系,另见 architecture section)分属两条路线——后者压到低维隐状态做动力学,前者坚持像素级可观看、可交互。全族的技术主线是四次能力换挡:① 动作条件视频预测的奠基(2020–2023,GAN → 视频扩散,把”视频生成”重定义为”动力学建模 / 环境模拟”)→ ② 单一游戏的实时神经引擎(2024,DOOM / Minecraft,20 FPS)→ ③ 开放域、长时一致、真·实时可玩世界(2025,720p/24–60fps + 分钟级记忆 + 蒸馏近实时)→ ④ 物理 AI 平台化与一次性持久 3D 世界(2025–2026,Cosmos 合成数据引擎、World Labs/HunyuanWorld 的可导出 3DGS)。
0. 一句话地图
- 奠基(2020–2023):NVIDIA game-gan(GAN + NTM 式外部记忆 + 静/动态解耦渲染,首个”看帧+动作就替换图形引擎”、首个用 GAN 解出 VizDoom)与 playable-video-generation(CADDY,从无标签视频用离散瓶颈无监督学出潜动作,是 Genie Latent Action Model 的精神先驱)打底;Google DeepMind 的 unipi-universal-policies-video(UniPi,“决策 = 文本条件视频生成 + 逆动力学抽动作”)与 unisim(把 14 类异构数据编排进统一 action-in-video-out 接口,5.6B video U-Net,ICLR 2024 最佳论文)把”视频生成”正式提升为”真实世界模拟器”。
- 单游戏实时神经引擎(2024):Google gamengen(SD1.4 改成动作条件自回归扩散,单 TPU 20 FPS 跑 DOOM,PSNR 29.4,人评仅 58–60% 能辨真)、Decart/Etched decart-oasis(纯 Transformer DiT+ViT-VAE,H100 上 360p@20fps 实时玩 Minecraft,开源 500M)、腾讯 playable-game-generation(PlayGen,消费级 RTX 2060 上 20 FPS,首提 ActAcc/ProbDiff 可玩性量化)把”游戏 = 神经网络权重”从概念做成可玩产品。
- 开放域 + 长时一致 + 真·实时(2025):DeepMind deepmind-genie2→genie-3(一图/一句话即 3D 世界,720p/24fps 实时、分钟级一致、可提示世界事件),Microsoft microsoft-wham-muse(WHAM/Muse,画面+手柄同序列建模,登 Nature,开源 1.6B),Skywork skywork-matrix-game→skywork-matrix-game-2→skywork-matrix-game-3(17B → 1.8B 实时流式 → 5B 双向+记忆 720p@40FPS),腾讯 tencent-hunyuan-gamecraft/tencent-yan(AAA 开放世界 / 1080p@60FPS),以及 gamegen-x、gamefactory、worldmem、yume、playerone、mirage-dynamicslab、alayaworld、dreamx-world-1 各攻一角。
- 物理 AI 平台(2025–2026):NVIDIA Cosmos 把世界模型做成产品线 —— cosmos-predict2(DiT 2B/14B + NATTEN)→ cosmos-predict2-5-world-simulation(flow-matching 三任务合一 + Reason1 换脑 + RL)+ nvidia-cosmos-transfer1(ControlNet 式 Sim2Real),定位机器人/驾驶的合成数据引擎;gigaworld-1 则把世界模型专门做成”策略评估器”。
- 一次性持久 3D 世界 & 实时视频改写(2025–2026):World Labs world-labs-marble(全景→持久 3DGS 可导出)+ world-labs-rtfm(位姿索引空间记忆的实时渲染器),腾讯 hunyuanworld-1/hunyuanworld-voyager、Skywork matrix-3d、genex 走”生成可导出 3D 资产”路线;odyssey-explorer、decart-mirage/decart-mirage-lsd(实时视频→视频世界改写)、luma-ray2/luma-ray3-world-models、abot-3dworld-0 各自把它商品化。消费端 sima-scalable-instructable-multiworld-agent 是”住在世界里”的智能体,genesis-generative-physics 是把经典物理引擎当精确模拟器的生成式仿真对照组。
1. 谱系时间线:四次能力换挡
一条贯穿全程的暗线是基座换代:早期从零训(GameGAN 的 GAN、CADDY 的编码器、WHAM 的 ViT-VQGAN+GPT-2),2024 起复用图像/视频生成大模型的先验——SD1.4(gamengen)、DiT(decart-oasis)、HunyuanVideo I2V(skywork-matrix-game / tencent-hunyuan-gamecraft)、SkyReels-V2 / Wan(skywork-matrix-game-2 / yume / playerone)、Wan2.2-TI2V-5B(skywork-matrix-game-3 / dreamx-world-1)、LTX-2.3-22B(alayaworld)。这与 omni 视频生成族的”3D-VAE + DiT + Flow Matching”主干换挡完全同步——交互世界模型是视频生成基座之上加”动作条件 + 因果自回归 + 抗漂移 + 蒸馏”四件套的下游分支。
2. 五大子范式
2.1 奠基:从”视频预测”到”动作进、视频出的世界模拟器”
这一支回答的是”生成模型凭什么能当环境”。三代思路层层递进:
- 动作条件像素预测(2020–2021):game-gan 把 World Models(Ha & Schmidhuber)的 VAE 重建换成对抗训练(画面更锐)+ 显式设计——一个 action-conditioned LSTM 动力学引擎(512 维隐状态)、一个 NTM 式 shift-based 外部记忆(训练 39×39×512、测试可放大到 99×99,专治”绕一圈回原地场景要一致”的 loop-closure)、一个用 cycle loss 逼模型把静态元素塞进记忆的静/动态解耦渲染引擎。它是首个”只看帧+动作、不看源码就替换图形引擎”、也是首个用 GAN 框架解出 VizDoom(迁移分 ≥750 即 solved)的工作。playable-video-generation(CADDY)更进一步:连动作标签都不要,用 Gumbel-Softmax + 动作方向聚类中心 + 互信息损失,从 BAIR / Atari / Tennis 无标签视频里无监督发现一组离散动作——这正是三年后 Genie Latent Action Model 的直接精神先驱。
- 视频生成即策略 / 即环境(2023):同一批作者(Sherry Yang 等)用两篇互补工作把范式钉死。unipi-universal-policies-video(UniPi,NeurIPS 2023 Spotlight)提出替代 MDP 的 UPDP——“图像=通用状态接口、文本=通用任务规约、任务无关的视频规划 ρ 与环境相关的动作 π 解耦”,先用文本条件视频扩散把”未来会发生什么”合成出来(这就是 planning),再用小逆动力学模型抽动作;证明 14M+60M+LAION 互联网预训练能迁移到真机(Bridge 微调,FID/FVD/成功率全升)。unisim(ICLR 2024 最佳论文)把 ρ 反过来当环境/模拟器:一个 5.6B video U-Net 把 14 类异构数据(互联网图文、机器人、人类活动 Ego4D、导航全景……)编排进统一 action-in-video-out 接口(文本动作走 T5 embedding、低层控制离散成 4096 bin 拼接),既能响应”打开抽屉”也能响应”移动 Δx,Δy”;纯在模拟里训 VLM 策略 / RL 策略(PaLM-E 12B / PaLI 3B)后 zero-shot 迁移真机(RL 48 任务成功率 0.58→0.81)。UniPi 把视频生成当策略,UniSim 把它当环境——二者共同确立了后续整族”动作条件视频扩散 + 自回归 rollout”的骨架。
2.2 神经游戏引擎:单一游戏、实时、可玩
2024 年三个几乎同时的工作把”游戏 = 神经网络权重而非代码”从口号做成了可玩 demo,共享一套配方:RL/人类玩法录数据 → 动作条件扩散/自回归 teacher-forcing 训练 → 抗自回归漂移技巧 → 少步采样实时化。
- gamengen(Google,DOOM):把 SD1.4 U-Net 改成动作条件自回归扩散(动作 embedding 替换文本 cross-attention、过去 64 帧沿通道拼接),用 PPO 智能体自玩录 9 亿帧,128×TPU-v5e 训。关键技巧是 noise augmentation——训练时给 context 帧加可控高斯噪声并把噪声等级喂给模型,否则 10–20 帧就崩;4 步 DDIM 即达质量甜点,单 TPU 20 FPS,逐帧 PSNR 29.4(≈JPEG 有损压缩),人评仅 58%/60% 能把模拟和真实分开。
- decart-oasis(Decart/Etched,Minecraft):刻意选纯 Transformer(ViT-VAE + DiT-S/2,时空轴向注意力交错)而非 U-Net,理由是 scaling 可预测 + 亲和 Etched 的 Sohu ASIC;训练用 Diffusion Forcing(每帧独立噪声级),推理用 dynamic noising 抗漂移;H100 上 360p/20fps(47ms/帧),比同架构文生视频快 >100×,开源 500M。
- playable-game-generation(腾讯 PlayGen,Mario+Doom):VAE(55M)+DiT(131M) 的 RNN-like 自回归隐空间扩散(借 Diffusion Forcing,用隐状态 z_t 概括无限历史),4 步 DDIM 在消费级 RTX 2060 上双游戏 20 FPS;首提可玩性量化——用 Valid Action Model 反推动作算 ActAcc/ProbDiff,证明 1024 帧长程游玩交互机制准确率仅衰减 <0.036(Mario ActAcc 0.803→0.789)。数据侧三件套(多样采集 + 聚类均衡采样 + PER 式长尾迁移学习)解决稀有转移欠拟合。
随后 mineworld(微软)走非扩散路线证明另一条可行:VQ-VAE 把画面、动作分词器把键鼠各转离散 token 交错成一条序列,LLaMA 架构自回归 next-token;配训练无关的 Diagonal Decoding 并行解码,300M/1.2B 模型在 A100 上 3–6 FPS,可控性/画质全面超 decart-oasis(F1 0.70 vs 0.41)。这些工作共同确立了本族的三条评价轴——实时交互、足够视觉质量、准确交互机制——以及”记忆窗口短(GameNGen 仅 3 秒、MineWorld 仅 16 帧)“这个待解的公共瓶颈。
2.3 开放域可玩世界:一图即世界、长时一致、真·实时
2024 末起,战场从”复现单一已知游戏”转向”生成从未存在过的世界”,并把”实时 + 开放域 + 长时一致”三者同时兼得作为目标。这条支线最拥挤,可按解决的核心难题再分:
① 开放域生成 & 无限长(2024):DeepMind deepmind-genie2 用自回归潜空间扩散 + 因果 Transformer把 Genie 从 2D(genie-generative-interactive-environments,隐动作 + ST-transformer)推到”一张 Imagen 3 提示图 → 可键鼠操控的 3D 世界”,涌现物体交互/物理/NPC/约 1 分钟记忆,并引入”基座(高质量非实时)vs 蒸馏版(实时、质量降)“的双模型模板。阿里 the-matrix 用 Swin-DPM 滑窗去噪让预训练 DiT 无需重训即可外推到无限长 720p,SCM 蒸馏到 8–16 FPS,还验证零样本域泛化(宝马 X3 开进办公室/开进海里)。港科 gamegen-x 首个”开放世界游戏视频生成 + 交互控制二合一”:MSDiT 基座学生成、冻结后单训 InstructNet 分支吸收指令/键鼠/视频提示,FVD 从最强开源基线 1016 降到 760、角色控制成功率约 27%→63%。
② 场景泛化的可插拔控制(2025):港大/快手 gamefactory 提出关键工程范式——风格学习与动作控制解耦:LoRA 承担 Minecraft 风格学习、独立动作模块承担控制学习,推理时”卸下”风格 LoRA 即把控制能力泛化到开放域;仅用 70 小时程序化 Minecraft 数据。它同时定下被后续广泛沿用的动作注入准则——连续鼠标 concat、离散键盘 cross-attention(skywork-matrix-game 明确沿用其 group-operation trick)。
③ 规模化开源可玩世界(2025):Skywork skywork-matrix-game(17B MMDiT,HunyuanVideo I2V 初始化,image-to-world 去文本分支主打 spatial intelligence)配套 GameWorld Score 基准与 2700h+1200h 数据集,键盘/鼠标控制精度 0.95/0.95 全面碾压 Oasis/MineWorld;腾讯 tencent-hunyuan-gamecraft 主攻 AAA 开放世界,把离散键鼠统一到连续相机动作空间(方向+速度、去 roll、可转 Plücker),混合历史条件(单帧/末帧/长片段 head latent + 二值 mask)自回归扩到分钟级,PCM 蒸馏到 6.6 FPS;腾讯 tencent-yan 用一份 4 亿帧《元梦之星》数据训 Sim/Gen/Edit 三模块,Yan-Sim 是唯一做到 1080p/60FPS/0.07s 延迟的(32×32×2 高压缩 VAE + shift-window denoising + FP8)。
④ 登 Nature 的方法论 & 真实世界 / 第一人称(2025):微软 microsoft-wham-muse(WHAM/Muse)把画面 token 与手柄动作 token 交错成同一条序列(ViT-VQGAN + GPT-2,1.6B,Bleeding Edge 14 亿帧 / 27.89 TiB),一个模型同时是世界模型、行为策略、full-generation,从 27 位创作者访谈蒸出 consistency/diversity/persistency 三种可量化能力(FVD 与训练 loss 相关 r=0.77),是首个登上 Nature 的生成式游戏世界模型且开源。上海 AI Lab yume 把战场搬到真实世界城市漫游(Sekai 真实视频),用量化相机动作 QCM(离散动作→文本条件、零新增参数)+ MVDT + 训练无关的 AAM/TTS-SDE,指令跟随 0.657 远超 Matrix-Game 0.271。港大/达摩 playerone 做第一人称真人动作驱动:外部相机实拍 SMPL 动作,部件解耦注入 PMI(头/手/身脚三组各自编码),MPJPE 127 大幅优于 Cosmos-14B 的 257。
⑤ 实时流式 + 记忆 + RL(2025–2026):Skywork skywork-matrix-game-2 把 1.8B 双向扩散基座经 Self-Forcing 蒸馏成因果少步(3 步)自回归 + 滚动 KV-cache,单 H100 25 FPS 分钟级流式,首个开源权重+代码的实时流式交互世界模型;skywork-matrix-game-3 反而回到双向骨干(Wan2.2-TI2V-5B),把检索记忆/历史/当前预测放进同一自注意力空间联合建模(+相对 Plücker + 头级扰动 RoPE),INT8 量化 + 剪枝 VAE + 8+1 GPU 异步部署做到 720p@40FPS,并放大到 28B-MoE。worldmem 先一步用显式记忆库 + FOV 重叠检索(记忆帧当”干净帧”塞进 Diffusion Forcing 去噪)解决”离开视野再回来”的一致性,beyond-window PSNR 25.32 vs 纯 DF 18.04。高德 dreamx-world-1 用 E-PRoPE(只对下采样 token 算投影式相机注意力,训练/推理省 30–50%)+ 几何检索记忆 + DMD 蒸馏后再叠 RL(DiffusionNFT),5B 模型总分 84.76 反超 8B HY-WorldPlay 与 14B LingBot,8×RTX5090 16 FPS。Alaya Lab alayaworld(LTX-2.3-22B)则坦承是系统集成 + 全栈开源——GEN3C 显式 3D 缓存 + Frame Preservation 历史压缩 + Helios 漂移历史 + error bank 双侧注入 + DMD 4 步,价值在于用”control/consistency/stability/runtime 四维框架”统一这片领域。创业公司 Dynamics Lab 的 mirage-dynamicslab(后改名 Magica)把它做成”AI 原生 UGC 游戏引擎”(因果 AR 扩散 Transformer + KV-cache,单消费级 GPU 200ms、10 分钟+)。
2.4 物理 AI 平台:Cosmos 与”世界模型即合成数据引擎”
NVIDIA 把世界模型做成平台产品线,叙事是”预训练通才世界模型 → 下游小数据 post-training 专才 → 给机器人/驾驶造合成数据、做闭环仿真、评策略”,而非追求”可玩”:
- cosmos-predict2(2B/14B,统一 DiT,Text2Image + Video2World,8×8×4 tokenizer,T5-11B 文本编码,rectified-flow)配套独立训练的 NATTEN 稀疏注意力 checkpoint 把 720p 推理压到基线 38–59%(1.7–2.6×),内置 Cosmos-Reason1-7B 兼当 prompt refiner 与 rejection-sampling critic;PBench 77.4 超 Wan2.1-I2V/HunyuanVideo/CogVideoX,GenEval 0.84。它把分辨率(480p/720p)×帧率(10/16fps)做成自由组合矩阵,动作条件变体(7×12=84 维末端执行器动作)在 Bridge 上 post-train。
- cosmos-predict2-5-world-simulation(2025-10 继任)三处实质升级:flow-matching 三任务合一(T2W/I2W/V2W)、WAN2.1 VAE + 只留 3D RoPE、用物理 AI VLM Cosmos-Reason1 替换 T5(拼接多层激活投影到 1024 维);预训练处理 >2 亿视频/3500 万小时素材(仅 ~4% 通过全过滤),完整后训练配方(domain-specific SFT → model soup 合并 → GRPO 式 RL + VideoAlign 奖励 + diffusion-loss 正则防 reward hacking → rCM 4 步蒸馏),4096×H100 上 2B MFU 36.49%。Predict2.5-2B/14B 以远小体量追平/超过 Wan2.2-27B-A14B(人偏好 14B 48.6% vs Wan2.1-14B 31.8%),下游机器人 Real2Real 增强把策略成功率从 1/30 提到 24/30。
- nvidia-cosmos-transfer1(ControlNet 分支)把 Sim2Real”世界翻译”接进平台:多路 ControlNet(Vis/Edge/Depth/Seg,AV 另加 HDMap/LiDAR)+ 时空控制权重图(前景高约束保形、背景低约束换景),模态独立训练、推理时融合;GB200 NVL72 上 64 卡把 5 秒 720p 生成压到 4.2 秒(生成快于播放)。这条线后来收敛为 Transfer2.5-2B(比 Transfer1-7B 小 3.5× 却更强)。作为对照,gigaworld-1 把世界模型专门做成策略评估器(WMBench 基准 + evaluator 导向设计),genesis-generative-physics 则代表”用经典物理引擎当精确模拟器 + VLM 生成 agent”的另一条生成式仿真路线。
2.5 一次性持久 3D 世界 & 实时视频改写
2025 年”世界模型”分叉出与自回归视频流正交的一支:不逐帧”梦”出世界,而是一次性生成几何一致、持久存在的静态 3D 场景(可导出 3DGS/mesh),用一次性几何绕开自回归漂移与记忆窗口瓶颈,代价是场景本身不含动态/物理。
- World Labs(李飞飞)双拼图:world-labs-marble(商业化”大世界模型”,text/image/multi-image/video/coarse-3D → 持久 3D Gaussian Splat + mesh,两阶段”全景生成→3D 提升”,~5min/世界,开源渲染器 Spark)+ world-labs-rtfm(把世界模型当”学出来的实时渲染器”,自回归扩散 Transformer,位姿帧作为空间记忆 + context juggling 把上下文从”随时间增长”变成”随局部空间有界”,单 H100 交互帧率)。二者一个造静态资产、一个实时探索。
- 腾讯 HunyuanWorld 谱系:hunyuanworld-1(“全景图作 2D-3D 桥梁”,VLM 智能体自动分层为天空/背景/多前景物体层 → sheet warping 重建可导出、物体级可交互的分层 mesh,四组对比全指标超 LayerPano3D/Director3D 等)+ hunyuanworld-voyager(RGB-D 联合视频扩散,用深度显式提供几何先验抑制幻觉,世界缓存 + 点云剔除 + 平滑采样支持长程漫游,WorldScore 77.62 第一,生成即重建无需 SfM)。Skywork matrix-3d 走全景视频路线(Wan2.1-I2V-14B + 场景网格渲染条件,116759 条 Matrix-Pano 合成数据,前馈 LRM 10 秒重建 vs 优化式 571 秒 PSNR 27.62)。JHU genex 把全景想象探索接入具身决策(GPT-4o + GenEx 单智能体 46.10%→85.22%、多智能体 21.88%→94.87%)。高德 abot-3dworld-0 把它锚定到地图 POI 做消费级空间探索引擎。
- 实时视频改写 & 商业视频模型:odyssey-explorer(前 Wayve/Waymo 团队,Explorer 图生 3DGS + Odyssey-1 真实世界 AR 视频世界模型,H100 30 FPS/40ms,明确与游戏世界模型划清界限、主张从真实视频学);Decart decart-mirage/decart-mirage-lsd(MirageLSD,Live-Stream Diffusion 逐帧改写任意视频流,<40ms/24FPS/无限时长,Diffusion Forcing + history augmentation + Hopper mega-kernel);Luma luma-ray2→luma-ray3-world-models(“多模态即 AGI、现实是数据集”叙事下的商业视频模型,Ray3 自称”推理式视频模型”+ 原生 HDR,但闭源无论文,“世界模型”更多是口径)。
3. 横向对比表
说明:未披露指该工作(多为博客/闭源产品)未公开对应数字。分辨率/FPS 取一手页披露值。“骨干”列标注基座来源。
表 3-A|奠基 + 单游戏神经引擎
| 工作 | 年/机构 | 骨干 & 范式 | 训练数据 | 动作条件 | 实时化 / 硬件 | 关键指标 |
|---|---|---|---|---|---|---|
| game-gan | 2020 NVIDIA | GAN:LSTM 动力学 + NTM 记忆 + 解耦渲染 | Pacman/VizDoom 帧+动作(45K/10K ep,84×84) | one-hot → shift 记忆核 | 未披露(浏览器可玩) | 首个 GAN 解出 VizDoom(≥750) |
| playable-video-generation | 2021 Trento/Snap | 编码器 + 离散瓶颈(Gumbel-Softmax 聚类) | BAIR/Atari/Tennis 无标签 | 无监督潜动作 K 类 | 浏览器轻量 | BAIR Δ-Acc 69.0 vs 44.8;Tennis 用户一致性 0.469 |
| gamengen | 2024 Google | SD1.4 U-Net 扩散,自回归 | DOOM 900M 帧(PPO 自玩) | 动作 emb 替换文本 cross-attn;过去 64 帧 concat | 128×TPU-v5e 训;单 TPU 20 FPS(4 步) | PSNR 29.4;人评仅 58/60% 辨真 |
| decart-oasis | 2024 Decart/Etched | ViT-VAE + DiT-S/2,Diffusion Forcing | Minecraft VPT 录像 | 25 维键鼠 → AdaLN | H100 360p@20fps 47ms;开源 500M | 无定量(demo) |
| playable-game-generation | 2024 腾讯 | VAE(55M)+DiT(131M) RNN-like AR | Mario 236M/Doom 900M → 均衡 50M/200M | 动作 emb cross-attn | RTX 2060 20 FPS(4 步) | 1024 帧 ActAcc 衰减 <0.036 |
| mineworld | 2025 微软 | VQ-VAE + LLaMA AR(Diagonal Decoding) | VPT 1000 万 clip / 55B token | 动作 11-token 序列 | 32×A100 训;3–6 FPS | vs Oasis F1 0.70 vs 0.41 |
表 3-B|开放域 / 可玩世界模型(2024–2026)
| 工作 | 年/机构 | 骨干(基座) | 训练数据 | 记忆 & 长时 | 实时化 / FPS | 关键指标 |
|---|---|---|---|---|---|---|
| deepmind-genie2 | 2024 DeepMind | AR 潜扩散 + 因果 Transformer | 大规模视频(未披露) | ~1 分钟涌现 | 蒸馏版实时(未披露) | 无定量(能力展示) |
| the-matrix | 2024 阿里 | 2.7B video DiT + Swin-DPM + SCM | Forza/Cyberpunk 75 万标注+120 万无标注 | 无限长(滑窗) | SCM 8–16 FPS | 零样本域泛化(宝马开进海) |
| gamegen-x | 2024 港科 | MSDiT + InstructNet 分支 | OGameData 100 万 clip(150+ 游戏) | 记忆窗 1–108 帧 | 项目页 320p 20 FPS | FVD 1016→760;控制成功率 27%→63% |
| microsoft-wham-muse | 2025 微软(Nature) | ViT-VQGAN + GPT-2,画面/动作 token 交错 | Bleeding Edge 14 亿帧 / 27.89 TiB | 上下文 1s(10 帧) | 98×H100 5d;非实时 | 2 分钟一致;FVD~loss r=0.77 |
| skywork-matrix-game | 2025 Skywork | 17B MMDiT(HunyuanVideo I2V) | Matrix-Game-MC 2700h+1200h | 5 运动帧自回归 | 非实时(A100/H100 ≥80G) | GameWorld 键盘 0.95/鼠标 0.95 |
| tencent-hunyuan-gamecraft | 2025 腾讯 | HunyuanVideo MM-DiT + 混合历史条件 | 100+ AAA / 100 万 clip + 3000 渲染 | head latent(单帧/末帧/长片段) | 192×H20 训;PCM 6.6 FPS | Dyn.Avg 67.2 vs MG 31.7;RPE↓55% |
| tencent-yan | 2025 腾讯 | SD/Wan 三模块(Sim/Gen/Edit) | 元梦之星 4 亿帧 | KV-cache | Yan-Sim 1080p 60 FPS 0.07s | 唯一 1080p/60FPS |
| gamefactory | 2025 港大/快手 | ~1B 视频扩散 + 可插拔动作模块 + LoRA 解耦 | GF-Minecraft 70h 程序化 | Diffusion Forcing 自回归 | 非实时 | 开放域 Flow-MSE 54.13 vs 76.02 |
| worldmem | 2025 NTU | Oasis DiT + DF + 显式记忆 cross-attn | Minecraft 20K×1500 帧 / RealEstate10K | FOV 检索记忆库 | 非实时 | beyond-window PSNR 25.32 vs DF 18.04 |
| skywork-matrix-game-2 | 2025 Skywork | 1.8B(SkyReels-V2)+ Self-Forcing 蒸馏 | UE+GTA ~1200h(合成为主) | 滚动 KV-cache | 单 H100 25 FPS(3 步) | vs Oasis Mouse 0.95 vs 0.56 |
| yume | 2025 上海 AI Lab | SkyReels-V2-14B + MVDT + QCM | Sekai-Real-HQ 400h 真实城市 | FramePack 分级压缩 | 对抗蒸馏 14 步(3.7×) | 指令跟随 0.657 vs MG 0.271 |
| playerone | 2025 港大/达摩 | Wan2.1-1.3B + PMI 部件解耦 | ego-exo 配对(SMPL) | 训练时点云重建 | CausVid 蒸馏 8 FPS | MPJPE 127 vs Cosmos-14B 257 |
| mirage-dynamicslab | 2025 Dynamics Lab | 因果 AR 扩散 Transformer + KV-cache | 互联网游戏 + 自录(未披露) | 长上下文 KV-cache | 16 FPS(v1);单消费级 GPU 200ms(v2) | 无(仅自绘 vs Genie 3 表) |
| skywork-matrix-game-3 | 2026 Skywork | Wan2.2-TI2V-5B 双向 + 联合注意力记忆 | 480 万 clip(UE5+AAA+真实) | 几何检索记忆(相对 Plücker) | INT8+剪枝 VAE,8+1 GPU 720p@40FPS | 内部消融(记忆检索最关键) |
| dreamx-world-1 | 2026 高德 | Wan2.2-5B + E-PRoPE + RL(DiffusionNFT) | UE5 + 真实 + 游戏 | 几何检索 + 误差注入 | DMD 蒸馏;8×RTX5090 16 FPS | 5B 超 8B/14B;Overall 84.76 |
| alayaworld | 2026 Alaya Lab | LTX-2.3-22B AR DiT + GEN3C 缓存 | gameplay + 真实(未披露) | 空间缓存 + 压缩历史 + error bank | bf16 FA3;DMD 4 步 | 无(定性预览) |
表 3-C|Genie 3 与 Cosmos 物理 AI 平台
| 工作 | 年/机构 | 骨干 & 范式 | 数据 | 训练 / 后训练 | 实时 / 算力 | 关键指标 |
|---|---|---|---|---|---|---|
| genie-3 | 2025 DeepMind | 自回归逐帧(结构未披露) | 未披露 | 未披露 | 720p/24fps 实时,数分钟一致、~1min 记忆 | 无定量(SIMA 定性联动) |
| cosmos-predict2 | 2025 NVIDIA | 统一 DiT 2B/14B(T2I+V2W),8×8×4 tok | 未披露(无独立报告) | post-train recipe 公开 | NATTEN 1.7–2.6×;DGX/H100 | PBench 77.4;GenEval 0.84 |
| cosmos-predict2-5-world-simulation | 2025 NVIDIA | flow-matching 2B/14B 三任务合一,Reason1 换脑 | >2 亿视频/3500 万小时(~4% 过滤) | SFT→model soup→GRPO RL→rCM 4 步 | 4096×H100(2B MFU 36.49%) | 人偏好 14B 48.6% vs Wan2.1-14B 31.8% |
| nvidia-cosmos-transfer1 | 2025 NVIDIA | Predict1-7B + 多路 ControlNet + 时空控制图 | RDS-HQ 360h AV + Predict1 数据 | 每 branch 1024×H100 训 2–4 周 | GB200 64 卡 5s→4.2s | Sim2Real 策略 24/30 vs 1/30 |
表 3-D|一次性持久 3D 世界 & 实时视频改写
| 工作 | 年/机构 | 表征 & 范式 | 输入 | 记忆 / 一致性来源 | 实时 / 生成耗时 | 关键指标 |
|---|---|---|---|---|---|---|
| world-labs-marble | 2025 World Labs | 全景→持久 3DGS + mesh(可导出) | text/image/multi-image/video/coarse-3D | 一次性几何(无漂移) | 离线 ~5min/世界 | 无定量(产品参数) |
| world-labs-rtfm | 2025 World Labs | AR 扩散 Transformer(“学出来的渲染器”) | 单图/短视频 | 位姿索引空间记忆 + context juggling | 单 H100 交互帧率 | 无定量 |
| hunyuanworld-1 | 2025 腾讯 | 全景→VLM 分层→sheet warping 分层 mesh | 文/图 | 一次性几何 + 物体级解耦 | 未披露(4090 lite 量化版) | 全指标超 LayerPano3D/Director3D |
| hunyuanworld-voyager | 2025 腾讯 | RGB-D 联合视频扩散(HunyuanVideo) | 单图 + 相机轨迹 | 世界缓存 + 点云剔除 | 8×H20 288s(49 帧) | WorldScore 77.62 第一 |
| matrix-3d | 2025 Skywork | 全景视频(Wan2.1-I2V-14B)→ 3DGS | 文/图 → 全景 | 场景网格渲染条件 | A800 720p ~1h;前馈 LRM 10s 重建 | 全景 FVD 140;重建 PSNR 27.62 |
| genex | 2024 JHU | 全景视频扩散(SVD)+ 球面一致性 | 单图 | 球面一致正则(IELC<0.1@20m) | 384 A100-hrs 训;~1.86s/帧 | 具身决策 46.10%→85.22% |
| odyssey-explorer | 2025 Odyssey | Explorer 图生 3DGS / Odyssey-1 AR 视频 | 单图 / 真实视频 | 窄分布后训练换稳定 | H100 30 FPS 40ms(Odyssey-1) | 无定量(研究预览) |
| decart-mirage-lsd | 2025 Decart | Live-Stream Diffusion 视频→视频改写 | 实时视频流 + 文本 | 有限历史窗(无长记忆) | <40ms/24FPS 无限时长 | 响应速度 16× vs 前作 AR |
| luma-ray3-world-models | 2025 Luma | 闭源”推理式视频模型” + 原生 HDR | 文/图/视频 | 未披露 | Draft 5–20× | 无可复核定量(自述 SOTA) |
| abot-3dworld-0 | 2026 高德 | 14B 全景视频扩散 → ABot-3DGS | 文/图/多视图/视频 | Spatial Generative Primitive | 未披露 | 锚定地图 POI |
4. 共享设计模式:全族的六个公共零件
把上面 40+ 工作拆开看,会发现它们其实在反复组合同一套零件——这也是本族”看起来百花齐放、实则同构”的原因。
4.1 动作条件注入:连续 concat + 离散 cross-attention 几乎成定式
早期 game-gan 用 one-hot 动作驱动记忆移位核,gamengen 直接用动作 embedding 替换 SD 的文本 cross-attention。到 2025,gamefactory 用消融确立了被后续广泛沿用的准则:
| 信号类型 | 注入方式 | 采用者 |
|---|---|---|
| 连续(鼠标/相机/低层控制) | 通道 concat + MLP + 时间自注意力 | gamefactory · skywork-matrix-game · skywork-matrix-game-2(鼠标) |
| 离散(键盘按键) | cross-attention | gamefactory · skywork-matrix-game · skywork-matrix-game-3(键盘) |
| 统一相机空间 | 方向+速度 → token addition / Plücker | tencent-hunyuan-gamecraft · dreamx-world-1(E-PRoPE)· alayaworld(AdaLN) |
| 键鼠 → 自然语言 | T5/文本条件(零新增参数) | the-matrix · yume(QCM) |
| 统一 action-in-video-out | T5 embedding ⊕ 离散化控制 bin | unisim |
| 真人全身动作 | SMPL 分部位(头/手/身脚)独立编码 | playerone(PMI) |
| 潜动作(无标签) | 离散瓶颈无监督学 | playable-video-generation → genie-generative-interactive-environments |
消融证据一致:gamefactory 显示”离散 cross-attn + 连续 concat”组合 Flow-MSE 全子集最优;tencent-hunyuan-gamecraft 显示 token addition 优于 concat;playerone 显示部件解耦(DINO 62.5)明显优于整体编码(58.0)与 ControlNet 式注入(57.1)。
4.2 抗自回归漂移:从加噪到”训练时就见坏历史”
teacher-forcing 训练与自回归推理的分布 gap 会让误差滚雪球——这是全族的头号敌人,解法演进出一整条谱系:
| 机制 | 一句话 | 代表 |
|---|---|---|
| noise augmentation | 给 context 帧加可控噪声并喂噪声等级,学会纠正污染历史 | gamengen |
| Diffusion Forcing | 每帧独立噪声级,解锁逐帧自回归 + 推理端 dynamic noising | decart-oasis · playable-game-generation · worldmem · decart-mirage-lsd |
| Self-Forcing 蒸馏 | 生成器从自身分布采历史帧,弥合 train/inference gap | skywork-matrix-game-2 |
| history augmentation | 训练时用”模型自己可能产生的伪影”腐化历史帧 | decart-mirage-lsd · decart-mirage |
| error-aware / error bank | 存 rollout 残差,重采样注入训练(alayaworld 更进一步双侧注入记忆与目标) | skywork-matrix-game-3 · alayaworld · dreamx-world-1 |
| 窄分布后训练 | 牺牲泛化换长程稳定 | odyssey-explorer |
| 一次性几何 | 干脆不自回归,一次生成持久 3D 场景 | world-labs-marble · hunyuanworld-1 |
4.3 记忆机制:从短上下文窗口,到位姿/几何索引的空间记忆
“离开视野再回来,场景要一致”是长时可玩的硬门槛。演进路径清晰:滑动窗口 → KV-cache → 空间/几何索引的显式记忆。
| 阶段 | 机制 | 代表 |
|---|---|---|
| 短时上下文窗 | 过去 N 帧(GameNGen 64 帧≈3s、WHAM 10 帧≈1s、MineWorld 16 帧) | gamengen · microsoft-wham-muse · mineworld |
| 外部/NTM 记忆 | shift-based 寻址的地图记忆 | game-gan |
| 滚动 KV-cache | 定长近期 latent/动作,超容驱逐 | skywork-matrix-game-2 · mirage-dynamicslab |
| 分级历史压缩 | 越远的历史压得越狠(FramePack 式) | yume · alayaworld |
| FOV/位姿检索记忆 | 按视场重叠 + 时间戳检索历史帧当”干净帧” | worldmem |
| 位姿索引空间记忆 | 每帧带 3D 位姿,按空间邻近动态组装有界上下文 | world-labs-rtfm |
| 联合注意力记忆 | 检索记忆/历史/当前预测放进同一自注意力空间 + 相对 Plücker | skywork-matrix-game-3 · dreamx-world-1 |
| 显式 3D 缓存 | 深度反投影点云缓存,沿目标轨迹渲染几何证据 | hunyuanworld-voyager · alayaworld |
4.4 实时化:蒸馏 + 稀疏注意力 + 量化的推理工程军备竞赛
“可玩”要求 >20 FPS(mineworld 用 APM 换算:>2 FPS 跟上业余玩家、>5 FPS 跟上职业选手)。手段高度趋同:
- 步数蒸馏:progressive distillation(unipi-universal-policies-video 初步 16×)、SCM(the-matrix 8–16 FPS)、Self-Forcing/DMD(skywork-matrix-game-2 3 步 25 FPS、alayaworld/dreamx-world-1 DMD 4 步)、PCM+CFG 蒸馏(tencent-hunyuan-gamecraft 8 步 6.6 FPS)、CausVid(playerone 8 FPS)、shortcut distillation(decart-mirage-lsd)、对抗蒸馏(yume 14 步 3.7×)、rCM(cosmos-predict2-5-world-simulation 4 步)。
- 少步采样甜点:gamengen 与 playable-game-generation 都发现 4 步 DDIM 即达质量甜点(受限图像空间 + 强历史条件)。
- 稀疏注意力 / 高压缩 VAE:NATTEN(cosmos-predict2 1.7–2.6×)、E-PRoPE 只对下采样 token 算相机注意力(dreamx-world-1 省 30–50%)、32×32×2 高压缩 VAE + shift-window(tencent-yan 1080p/60FPS)、剪枝 VAE(skywork-matrix-game-3 MG-LightVAE ×5.2)。
- 量化 + 定制 kernel + 并行:INT8/FP8 量化(skywork-matrix-game-3 · dreamx-world-1 · tencent-yan)、Hopper mega-kernel 把通信编进 kernel(decart-mirage-lsd)、head-parallelism(nvidia-cosmos-transfer1 64 卡 5s→4.2s)、8+1 GPU 异步部署(skywork-matrix-game-3 DiT×8 + VAE×1)、Ulysses 序列并行(cosmos-predict2-5-world-simulation · alayaworld)。
一个反复出现的取舍是 Genie 2 就定下的”基座 vs 蒸馏版”双模型模板——高质量非实时基座出展示样本、蒸馏版实时可玩但质量降(deepmind-genie2 · the-matrix · skywork-matrix-game-2 皆如此)。
4.5 数据引擎:合成 tick 级对齐 + 真实视频 + 位姿反标
动作-画面逐帧精确对齐是交互世界模型的命门,催生了各家自建数据引擎,四条来源反复出现:
| 来源 | 手段 | 代表 |
|---|---|---|
| 游戏引擎内存/tick 级采集 | Cheat Engine 读坐标 / UE tick 回调零对齐误差 / GTA mod | the-matrix(GameData 平台)· skywork-matrix-game-2 · skywork-matrix-game-3 · tencent-yan |
| Minecraft VPT/MineDojo | VPT 人类录像 / MineRL VPT agent / 程序化去偏采集 | mineworld · skywork-matrix-game · gamefactory(程序化消偏) |
| AAA 游戏录像 | PySceneDetect 切段 + RAFT 光流 + Monst3R 6-DoF 位姿 | tencent-hunyuan-gamecraft · gamegen-x(OGameData 100 万 clip) |
| 真实视频 + 位姿反标 | MegaSaM/VGGT/MoGE/Metric3D 估计相机与深度 | yume(Sekai)· hunyuanworld-voyager · dreamx-world-1 · odyssey-explorer(背包 6 相机+2 LiDAR) |
一个共同发现是数据配比 > 数据量:tencent-hunyuan-gamecraft 消融显示”仅合成→控制准但动态崩、仅真实→动态高但控制差”,Render:Live = 1:5 才均衡;playable-game-generation 用聚类均衡采样把 236M/900M 帧精炼到 50M/200M 反而更好;cosmos-predict2-5-world-simulation 只留 ~4% 过全过滤的 clip。
4.6 评测:从”没有 benchmark”到专用可控性度量
早期与闭源产品的通病是只有 demo、没有定量(deepmind-genie2 · genie-3 · decart-oasis · world-labs-marble · luma-ray3-world-models · mirage-dynamicslab 均无跑分)。开源侧则催生了专用基准:
| 基准 | 度量什么 | 出处 |
|---|---|---|
| ActAcc / ProbDiff | 用 Valid Action Model 反推动作,量化交互机制准确率 | playable-game-generation |
| GameWorld Score | 视觉/时序/可控性/物理四支柱 8 维(含逐帧键鼠 IDM 精度) | skywork-matrix-game(skywork-matrix-game-2 沿用) |
| IDM 可控性 F1 | 逆动力学模型反推动作的分类精度 | mineworld |
| consistency/diversity/persistency | FVD / Wasserstein / 用户编辑保持率 | microsoft-wham-muse |
| PBench / PAI-Bench | 物理 AI 视频 Domain+Quality 双轴 | cosmos-predict2 · cosmos-predict2-5-world-simulation |
| WorldScore | 静态 3D 世界生成(相机控制/3D 一致/内容对齐等 7 项) | hunyuanworld-voyager · matrix-3d 引用 |
| 重访一致性 ΔPSNR/ΔLPIPS | 离开-回来轨迹的一致性增益 | dreamx-world-1 |
| WMBench | 世界模型作为策略评估器的可靠性 | gigaworld-1 |
值得注意的是”崩溃即虚高”陷阱:skywork-matrix-game-2 指出 Oasis 崩溃后倾向输出静止帧,反而虚高了 motion smoothness 与 scenario consistency——说明单一指标不可靠,人评仍是金标准(skywork-matrix-game 双盲胜率 96.3%、tencent-hunyuan-gamecraft 用户研究、dreamx-world-1 盲测 57.5% win)。
5. 三处根本张力
-
可交互 vs 一致/持久。自回归视频流(Genie 3、Matrix-Game 系)天生”边走边梦”、有漂移和有限记忆窗;一次性 3D 场景(Marble、HunyuanWorld)几何一致、可自由漫游、可导出资产,但静态无动态/物理(Marble 的火/水只能在导出视频后 enhance)。world-labs-rtfm(Marble 造世界 + RTFM 实时渲染)与 hunyuanworld-1(分层 mesh + 集成 Voyager 做长程扩展)是把两者缝起来的尝试。
-
画质 vs 无限长/实时。the-matrix 坦承 Swin-DPM/SCM 换来无限长+实时,代价是 FVD/FID/CLIP 相对 Interactive-Module 阶段回退;蒸馏几乎人手一套但都有小幅质量损(skywork-matrix-game-2 · yume · tencent-hunyuan-gamecraft)。dreamx-world-1 的应对是”DMD 蒸馏后再叠一层 RL 把画质/可控性找回来”。
-
透明度断层。这一族横跨”完整技术报告 + 开源权重”(Cosmos、Matrix-Game 系、WHAM、GameFactory、MineWorld、Yume、HunyuanWorld)与”博客/产品、几乎零披露”(Genie 2/3、Oasis、Marble、RTFM、Odyssey、Mirage、Luma Ray)两个极端。前者可复现、能拆设计选择;后者只能靠 demo 判断能力上限——genie-3 连参数量、tokenizer、上下文长度都未公开,skywork-matrix-game-3 直言 Genie 3 “细节和训练配方未公开”难以拆解。
6. 这一族要去哪
- 记忆是 2026 的主战场。短上下文窗(GameNGen 3 秒)已被公认为天花板,2026 的工作几乎都在做显式记忆——几何检索(dreamx-world-1)、联合注意力(skywork-matrix-game-3)、位姿索引空间记忆(world-labs-rtfm)、显式 3D 缓存(hunyuanworld-voyager · alayaworld),并为此新设”重访一致性”评测协议(dreamx-world-1)。
- 更小模型 + 后训练打更大模型。cosmos-predict2-5-world-simulation(14B 追平 Wan2.2-27B)、dreamx-world-1(5B 超 8B/14B)都靠”更强基座 + 更严数据 + 完整后训练(SFT→合并→RL)“而非堆参数;RL 对齐(GRPO / DiffusionNFT + 视频奖励模型)正从视频生成迁移进世界模型。
- 动作空间从”方向键”扩到”任意行为”。genie-3 的 promptable world events、tencent-hunyuan-gamecraft 的连续相机空间、dreamx-world-1 的多实体可组合事件、playerone 的真人全身动作,都在突破”WASD + 相机”的窄动作空间;dreamx-world-1 进一步展望角色中心 + 原生音视频联合世界模型。
- 平台化与消费级落地并行。一头是 Cosmos/GigaWorld 把世界模型做成机器人/驾驶的合成数据引擎与策略评估器(cosmos-predict2-5-world-simulation 的 Real2Real 增强把成功率从 1/30 提到 24/30、gigaworld-1 的 WMBench);另一头是 World Labs/HunyuanWorld/高德把它做成可导出 3D 资产 / 地图空间引擎(world-labs-marble · hunyuanworld-1 · abot-3dworld-0)、Decart/Dynamics Lab 做实时视频改写 / UGC 游戏引擎(decart-mirage-lsd · mirage-dynamicslab)。
- 世界模型 + 智能体闭环。sima-scalable-instructable-multiworld-agent 这类”住在世界里”的智能体被 DeepMind 与 genie-3 直接配对(SIMA 在生成世界里执行导航目标检验一致性),genex 用想象探索服务具身/多智能体信念推断——“用世界模型批量生成无限多样环境来训练/评测智能体”这条 UniSim/Genie 2 就提出的叙事,正在成为通往具身 AGI 的基础设施主张。
附:本页引用的一手工作页(slug)
奠基:game-gan · playable-video-generation · unipi-universal-policies-video · unisim| 单游戏神经引擎:gamengen · decart-oasis · playable-game-generation · mineworld| 开放域/可玩世界:deepmind-genie2 · genie-3 · the-matrix · gamegen-x · microsoft-wham-muse · skywork-matrix-game · skywork-matrix-game-2 · skywork-matrix-game-3 · tencent-hunyuan-gamecraft · tencent-yan · gamefactory · worldmem · yume · playerone · mirage-dynamicslab · dreamx-world-1 · alayaworld| Cosmos 物理 AI 平台:cosmos-predict2 · cosmos-predict2-5-world-simulation · nvidia-cosmos-transfer1 · gigaworld-1 · genesis-generative-physics| 持久 3D 世界 & 视频改写:world-labs-marble · world-labs-rtfm · hunyuanworld-1 · hunyuanworld-voyager · matrix-3d · genex · odyssey-explorer · decart-mirage · decart-mirage-lsd · luma-ray2 · luma-ray3-world-models · abot-3dworld-0| 消费/智能体:sima-scalable-instructable-multiworld-agent