一句话定位
Microsoft Research(剑桥 Game Intelligence + Teachable AI Experiences 团队,联合 Xbox Games Studios 旗下 Ninja Theory)于 2025-02-19 发表在 Nature 的 World and Human Action Model(WHAM,产品名 “Muse”)——首个把游戏画面与人类手柄动作当作同一条 token 序列联合建模的自回归世界模型。它在 Ninja Theory 的 Xbox 游戏 Bleeding Edge(3D 4v4 竞技)约 6.1 万场对局(≈50 万条玩家轨迹、逾 7 年人类游玩) 数据上训练,最大 1.6B 参数的 Muse 可从 1 秒(10 帧)真实提示出发、给定后续手柄动作,自回归生成长达 2 分钟且视觉/机制一致的游戏画面;论文把”支持创作者构思”拆成 consistency(一致性)/ diversity(多样性)/ persistency(持久性) 三种可量化能力并逐一评测。权重(200M + 1.6B 两档)、样例数据与 WHAM Demonstrator 交互原型随论文以开放形式发布(HuggingFace + Azure AI Foundry)。
背景与定位
World model 的传统脉络(论文自述)是 Ha & Schmidhuber 的 World Models(2018)→ 循环网络 / RSSM(Dreamer)→ transformer 世界模型(IRIS、GAIA-1)。WHAM 明确把自己接在这条 transformer 世界模型支上,但换了一个动机:不是为了给强化学习智能体做仿真环境,而是为游戏创作者的”发散思维 + 迭代打磨”服务。这一动机来自对 27 位游戏从业者(8 家工作室,含独立/AAA/无障碍开发团队,含全球南方与残障视角)的半结构化访谈——论文先从用户研究里蒸馏出创作者真正需要的三种模型能力,再据此设计与评测模型,是一篇人机交互驱动 + 机器学习的交叉工作。
范式上 WHAM 属于自回归、token 化的交互式游戏世界模型这一派:把画面与动作离散化成统一 token 流、用 decoder-only transformer 做 next-token prediction。它与同期”可玩游戏世界模型” Google DeepMind Genie 3、以及驾驶域的 Wayve GAIA-2、通用视频世界模型 NVIDIA Cosmos 同处一个赛道;与 GameGAN、Genie(Bruce et al. 2024)、GameNGen(“Diffusion models are real-time game engines”, Valevski et al. 2024)、GAIA-1(Hu et al. 2023)等前作相比,WHAM 的关键差异是”World + Human Action”双头——同一个模型既能当世界模型(给动作出画面)、又能当行为策略(给画面出动作)、还能”full generation”两者一起生成。作为首个登上 Nature 的此类生成式游戏世界模型,它的分量更多在”方法论 + 开放权重 + 能力评测框架”,而非把画质/实时性推到极限(论文明说推理还太慢、分辨率仅 300×180)。
模型架构
WHAM = VQGAN 图像 tokenizer + decoder-only causal transformer,两部分都从零训练(Fig. 2)。
- 序列骨干:causal(decoder-only)transformer 做 next-token prediction,交叉熵损失;实现是改版 nanoGPT 的 GPT-2。把人类游玩建模为图像 token 与动作 token 交替的一条序列
… z_t a_t z_{t+1} a_{t+1} …。不放任何分隔符区分”下一个该出图还是出动作”——模型靠学到的位置嵌入自行推断。 - 图像 tokenizer(两套):
- 15M–894M 档:约 60M 参数的卷积 VQGAN,把 128×128×3(由原始 300×180 缩放而来)图像编码成 d_z = 256 个离散 token,码本 V_O = 4,096;先用重建损失 + 感知损失(LPIPS)训练,再加 GAN 损失。
- 1.6B 档(Muse):约 300M 参数的 ViT-VQGAN,直接在原生 300×180×3 分辨率上编码成 d_z = 540 个 token,码本 V_O = 16,384;先用 L1 重建 + 感知损失 + 最大像素损失训练,再加 GAN 损失。
- 动作条件(action-conditioning):Xbox 手柄动作嵌入为 16 维向量(12 个按键各 0/1 + 左右摇杆各 x/y 共 4 轴)。按键天然离散;摇杆 x/y 各离散化成 11 个 bin。动作 token 占词表
{16,385,…,16,452}(68 个),每个动作 16 个 token。因为动作是序列的一等公民,用户既能用手柄动作”驾驶”生成,也能直接改画面 token——这正是 persistency 的前提。 - 上下文/一致性:上下文窗 = 10 个 (观测, 动作) 对 = 1 秒(10Hz);1.6B 为 5,560 token,894M 为 2,720 token。长序列(如 2 分钟)靠自回归滑窗逐 token 采样生成;一致性/记忆并无显式 3D 或外部 memory,纯由 transformer 上下文与训练涌现。
- 三种推理模式(model card):① World Model——给真实起始状态 + 动作序列预测画面;② Behaviour Policy——给画面预测下一手柄动作;③ Full Generation——同时生成画面与动作。
- 发布规格:200M WHAM(3.7 GB ckpt,轻量快速探索)+ 1.6B WHAM(
WHAM_1.6B_v1.ckpt,18.9 GB,训练 200k 步的正式版)。
数据
- 来源:与 Ninja Theory 合作,用其 2020 年 Xbox 游戏 Bleeding Edge(3D、4v4 多人竞技)录制的真人游玩数据。录制窗口 2020-09 至 2022-10,覆盖 EULA 授权、经数据共享协议与 IRB 批准;剔除 Xbox 用户 ID 等 PII,清洗掉错误与不活跃玩家。
- 存储格式:画面存 MP4 @ 60fps,配套二进制手柄动作文件,每帧带一个游戏内 timecode 以保证训练时动作/画面严格对齐。
- 7 Maps 数据集(1.6B 训练集):60,986 场对局 → 约 500,000 条玩家轨迹,磁盘占 27.89 TiB,相当于逾 7 年连续游玩,覆盖全部 7 张地图;下采样到 10Hz 后约 14 亿(1.4B)帧。按对局做 80:10:10 划分训练/验证/测试。blog 与 model card 口径:逾 10 亿(image, action)对、逾 7 年连续人类游玩。
- Skygarden 数据集(小模型训练集):只保留 Skygarden 一张地图、约 1 年游玩,66,709 条轨迹 ≈ 3.1 亿帧,同样 10Hz + 80:10:10。
- 动作标注:无需人工标注——手柄动作本身就随游玩录制,是数据的一部分(这是本工作能”联合建模动作”的数据前提)。
- 公开样例:
microsoft/bleeding-edge-gameplay-sample= Skygarden 测试集 1,024 条轨迹(每条 100 步 image+action 对),即评测用测试数据,格式同训练数据。(model card 另有一处把公开数据描述为”27,990 名玩家一年游玩”,与论文 7 Maps/Skygarden 口径略有出入,以论文数字为准。) - 全部为真实人类游玩数据,无 sim 数据、无跨游戏 co-training——模型只见过 Bleeding Edge 一款游戏。
训练方法
- 两阶段:先训 VQGAN 编解码器(重建 + 感知损失,再加 GAN 损失),冻结后再训 transformer 做 next-token 预测(cross-entropy)。纯模仿式自回归预训练,论文正文不含 RL;行为对齐类的 RL/post-training 放在后续工作(见下)。
- 训练栈:PyTorch Lightning + FSDP(全分片数据并行)。
- 894M 超参:上下文 2,720 token;每 batch 2M token;训练 170k 步;AdamW,恒定学习率 0.00036 + 线性 warmup,β1=0.9、β2=0.999。
- 1.6B 超参:上下文 5,560 token;每 batch 2.5M token;训练 200k 步;AdamW,cosine 退火 LR:峰值 0.0008 → 末端 0.00008,前 5,000 步线性 warmup,β1=0.9、β2=0.95,weight decay 0.1;算力预算约 1×10²² FLOPS。
- 动作 loss 上权重:1.6B 因用了更多图像 token(540 vs 256)与更大码本(16,384 vs 4,096),隐性稀释了动作 token 的 loss,导致多样性(Wasserstein)反而略逊 894M;**把动作 loss 权重 ×10(“1.6B up-weighted”)**后 Wasserstein 明显改善。
- scaling law:仿 LLM 做了 15M→206M 一组配置的缩放分析,据此外推预测了 894M 的最终 loss,并用来定 1.6B 的配置;发现 FVD 与训练 loss 强相关(Pearson r = 0.77),为”朝更低 loss 优化”提供依据。这一初探催生了后续专文《Scaling Laws for Pre-training Agents and World Models》(arXiv 2411.04434)。
Infra(训练 / 推理工程)
- 训练硬件:model card 明确 98× H100 GPU、训练时长 5 天。blog 补充演进路径:最初用 V100 集群验证可扩到 100 GPU,再迁到 H100 集群做大规模训练;并行为 FSDP。
- 软件栈:PyTorch Lightning、Flash-Attention、ffmpeg、exiftool。
- 推理(非实时):model card 明说推理速度目前太慢,无法实时。
run_dreaming.py生成:单 A6000、batch=1 约 4.5 GB 显存;batch=12 约 30 GB 显存;跑完全部 512 段视频约 24 小时;首段输出在 A6000 上要数分钟。测试卡包括 RTX A6000 / A100。模型服务器在 4× A6000(跑大模型)与单张 GTX 1080(跑小模型)上验证过。 - 产权/安全:生成图像内嵌水印与 provenance 元数据(要求勿移除);对 out-of-domain 提示做过 Responsible AI 测试。
评测 benchmark
论文围绕用户研究得出的三种能力做量化评测(均以 1.6B / 894M 为主):
-
Consistency(FVD):用 Fréchet Video Distance 衡量,把真人游玩当 ground truth——取 1,024 段 10 秒留出真人视频,用其前 10 帧 + 整段动作序列提示 WHAM 生成对照视频,比 FVD。结果:FVD 随模型规模/算力单调下降;1.6B 因分辨率更高、重建上限更高,FVD 最优。并用 894M 做人工核验(结构/动作/交互三问,两标注者逐帧配对),确认人感一致性随训练提升、与低 FVD 吻合;FVD 与训练 loss 相关系数 r = 0.77。定性上 1.6B 可生成长达 2 分钟保持一致的序列。
-
Diversity(Wasserstein 距离):比较真人动作与模型生成动作的边缘分布。从 102,400 个动作里子采样 10,000 个、重复 10 次算 emd2。基线:均匀随机动作距离 = 5.3;human-to-human 基线约 0.1 量级。训练过程中所有模型的 Wasserstein 均逼近 human 基线;894M 略优于 1.6B,而 1.6B up-weighted(动作 loss ×10) 把 1.6B 拉回并改善。
-
Persistency(用户编辑保持率):手工把 Powercell(道具)/ 角色 / Vertical Jumppad(地图元素) 插入 8 个(Jumppad 为 4 个)新位置,分别以 1 / 5 / 10 张编辑帧为条件、各生成 10 段视频(共 600 段),由 7 位作者盲标(对是否”持久”分四类),标注者间一致率 90%(270/300)。Table 1 结果:
条件帧数 Powercell 角色 Character Vertical Jumppad 1 帧 58% 45% 58% 5 帧 86% 85% 98% 即从 1 帧增到 5 帧,三类元素的保持率都显著跃升到 ≥85%(六个单边二项检验,Bonferroni 校正显著性 0.008),5→10 帧无显著增益。
论文未与外部模型跑对比 benchmark(无 SOTA 打榜)——评测目的是验证三种”创作能力”是否随训练/规模改善,而非横向刷分。
创新点与影响
- 首个 “World and Human Action Model”:把游戏画面 + 人类手柄动作统一进一条自回归 token 序列联合建模,一个模型同时具备世界模型、行为策略、full-generation 三种角色。
- 首个登上 Nature 的生成式游戏世界模型:经同行评审,配套开放 200M + 1.6B 两档权重、1,024 条样例数据、WHAM Demonstrator 交互原型(HuggingFace + Azure AI Foundry),可复现评测与创作探索。
- 能力驱动的评测范式:从 27 位真实游戏创作者的访谈里提炼 consistency / diversity / persistency 三种可操作、可量化的能力,并给出各自的度量(FVD / Wasserstein / 人工保持率)——把”生成式 AI 是否支持创意实践”变成可测的科学问题,而非只看任务完成效率。
- 可提示的迭代式创作:支持视觉提示(给几帧起手)、直接编辑画面(copy-paste 角色/道具并被”持久化”)、手柄”驾驶”生成、分支再生成,指向”人在环、可迭代”的构思工具形态。
- 作者自陈局限:只在单一游戏上训练、易过拟合该域,out-of-domain 输入会”溶成色块”或被同化为游戏元素;上下文仅 1 秒(10 帧);分辨率固定 300×180、无法更高;推理太慢、尚不能实时;生成的画面与操作可能错误/不可辨。行为可控性、更长记忆等留给后续(如《Aligning agents like large language models》arXiv 2406.04208 的 post-training 行为对齐)。
原始链接
- Nature 论文(主源):https://www.nature.com/articles/s41586-025-08600-3
- Nature 论文 PDF:https://www.nature.com/articles/s41586-025-08600-3.pdf
- 官方博客(Katja Hofmann,2025-02-19):https://www.microsoft.com/en-us/research/blog/introducing-muse-our-first-generative-ai-model-designed-for-gameplay-ideation/
- HuggingFace 权重 + model card + 代码:https://huggingface.co/microsoft/wham
- 样例数据集:https://huggingface.co/datasets/microsoft/bleeding-edge-gameplay-sample
- MSR 项目页:https://www.microsoft.com/en-us/research/project/wham/
- 注:metadata 给出的
github.com/microsoft/WHAM实际 404,代码托管在上述 HuggingFace 仓库(git@hf.co:microsoft/WHAM),故 github_url 留空。
一手源存档(sources/)
- microsoft-wham-muse—blog — 官方博客正文快照(sources/world-model/2025/microsoft-wham-muse—blog.md)
- microsoft-wham-muse—hf-card — HuggingFace model card 快照(sources/world-model/2025/microsoft-wham-muse—hf-card.md)
- Nature 论文全文经 PDF 抓取通读,正文不入 git,引用见上方 Nature URL。