一句话定位

MineWorld:一个开源、实时的 Minecraft 交互式世界模型——用 VQ-VAE 把游戏画面、用动作分词器把键鼠输入各自转成离散 token,交错拼接成一条序列,交给一个 LLaMA 架构的自回归 Transformer 做 next-token 预测;推理时接入训练无关的 Diagonal(对角)并行解码算法,把 300M~1.2B 三档模型的生成速度压到 3~6 FPS 量级,实现与人类玩家的实时交互,同时提出基于逆动力学模型(IDM)的动作跟随量化指标,在可控性和视频质量上全面超过开源扩散基线 Oasis。

背景与定位

Minecraft 长期是世界模型研究的标准测试场:Genie 从无标注视频里学习隐动作空间;Genie 2 把这一思路扩展为大规模基础世界模型;Oasis 用扩散模型做实时游戏引擎但完整推理栈(大模型+专用芯片+推理引擎)并不开放。这些工作大多押注扩散模型路线,效率与可控性的评测标准也不统一。

MineWorld 走的是另一条路线:不用扩散,而是延续视觉自回归 Transformer(LLaMA 架构)的路子,把视觉状态和动作都离散化成 token,交错拼接为单一序列做 next-token 预测——这样模型天然同时具备”世界模型”(给定历史状态+当前动作,预测下一状态)和”策略模型”(给定历史状态,预测下一动作)两种能力。自回归路线的老问题是逐 token 顺序解码慢,论文借用同团队稍早发布的配套工作 Diagonal Decoding(Ye et al. 2025,arXiv:2503.14070)——一种利用图像 token 空间局部依赖、训练无关的并行解码算法——把这一瓶颈基本解决,是把该算法从静态图像/视频生成扩展到”动作条件、逐帧误差会累积”的交互式游戏世界模型场景的首次应用。数据上复用 OpenAI 的 VPT 数据集(Baker et al. 2022)及其配套的逆动力学模型(IDM),并把 IDM 转用为评测可控性的工具而非训练数据标注器。

模型架构

  • 整体范式:视觉-动作自回归 Transformer。把 t 时刻的游戏画面 x_i 与该时刻动作 a_i 的 pair 序列 (x_i, a_i) 用两个独立分词器转成离散 id,按”图像 token 段 + 动作 token 段”交错拼接为一条 flat 序列,训练目标是标准自回归似然 f_θ(t) = Π_i p(t_i | t_<i)。

  • 视觉分词器:VQ-VAE,从公开预训练 checkpoint Amused(Patil et al. 2024,一个开源 MUSE 复现)初始化,再在 Minecraft 数据上微调。空间压缩率 16×(宽高各压缩 16 倍),codebook 大小 8192。一帧 224×384 的画面被编码为 14×24 = 336 个离散 token。

  • 动作分词器:Minecraft 动作分两类——连续的鼠标视角移动(camera X/Y)和离散的键鼠按键。连续量沿用 VPT 做法,把视角角度量化进离散 bin(X、Y 各 11 个 bin);离散按键因为存在互斥关系(如 forward 和 backward 不能同时发生),被归并为 7 个互斥的动作类(对应评测里的 3 个三分类任务 + 4 个二分类任务,覆盖 10 个最常用动作)。每个动作最终编码为一条 11-token 序列:[aBOS] + 9 个内容 token(7 个离散动作类 token + 2 个视角角度 token)+ [aEOS]

  • 词表:图像词表 8192 + 动作词表 70 = 总词表 8262

  • Transformer 解码器:LLaMA 架构,RMSNorm + 旋转位置编码(RoPE),标准因果自回归。三档模型配置(Appendix B):

    规模Hidden dimMLP dimHeadsLayers
    300M102440961620
    700M204840963220
    1.2B204881923220

    最大位置数(Table 7)为 5376;正文另给出每条训练样本对应 16 组 state-action pair 共 ~5.5k token(16×347)的上下文长度,两处数字口径略有出入(未在文中显式对齐),此处如实并列。

    • 补充(GitHub README 披露、论文正文未涉及):实际发布的 checkpoint 除论文里 16 帧上下文的 300M/700M/1.2B 三档外,还有 700M_32f、1200M_32f 两个 32 帧上下文的变体,具体如何扩展上下文长度论文未说明。
  • 并行解码(推理侧机制):采用 Diagonal Decoding(Ye et al. 2025),训练无关,利用画面 token 网格里相邻位置的空间依赖——某位置 (row i, col j) 生成后,下一步可同时生成 (i, j+1) 与 (i+1, j) 两个 token。理论加速比 r = h×w / (h+w−1)(h、w 为 patch 网格高宽;本模型 14×24 网格对应理论 r≈9.08),但训练/推理分布不一致会带来质量损耗,论文额外用对齐并行解码的注意力掩码对预训练好的自回归模型做微调(替换标准因果掩码)来弥合这一差距。

数据

  • 来源:OpenAI 的 VPT(Video PreTraining)数据集(Baker et al. 2022)——人类真实 Minecraft 游戏录像,逐帧配对键鼠动作标注。
  • 过滤:剔除无动作记录的帧,以及打开游戏内 GUI 界面的帧(消除界面对结果的干扰)。
  • 切片:按模型最大上下文长度切成 16 帧一段的短 clip,随机划分训练/验证/测试集。
  • 规模:训练集 1000 万个 clip(即 1.6 亿帧);验证集 500 个 clip,测试集 1000 个 clip
  • 分辨率:原始 360×640 下采样到 224×384(保持宽高比,降低计算量)。
  • token 规模:每帧 336 个视觉 token + 11 个动作 token/pair = 每个 state-action pair 347 token;每条 16-pair 训练样本压成约 5.5k token;训练集总量 550 亿(55B)token
  • 数据性质:全部为人类真实游戏录像(sim-vs-real 上属于”real”一端),无文本条件、无跨具身/跨场景协同训练——单一领域(Minecraft)、单一视觉编码器、单一动作空间;动作标注继承 VPT 本身的人类行为分布(未做 GameFactory 那种程序化去偏采集)。

训练方法

  • 目标函数:标准自回归 next-token 预测(交叉熵),作用在图像+动作交错的 flat token 序列上(式 4)。
  • 优化器:AdamW(betas = 0.9, 0.95),cosine 学习率衰减,峰值学习率 3e-4,warmup 10000 步,weight decay 0.1
  • 训练步数200k 步
  • 视觉分词器训练:从预训练 Amused VQ-VAE 初始化,在预处理后的 VPT 训练数据上微调;微调后重建质量显著提升(见”评测”部分 Table 8 数字)。
  • 并行解码专用微调:标准自回归预训练完成后,另用对齐并行解码模式的注意力掩码(替代因果掩码)对模型做微调,以缩小训练/推理不一致带来的质量损耗——效果见 Table 2 的”w/ FT” vs “w/o FT”对比。
  • 无 RL、无蒸馏:纯监督式 next-token 预测,动作和图像 token 视为等价处理,无额外的动作 token 化方案或强化学习信号;模型因交错训练自然同时具备世界模型与策略模型能力(用于第 4.3 节的 agent 案例研究,但未做定量评测)。
  • 论文自陈的未来方向:直接从零开始用并行注意力掩码训练(而非”先自回归预训练、再并行微调”两阶段),可能带来更快收敛和更低总训练成本。

Infra(训练 / 推理工程)

  • 训练硬件32 张 NVIDIA A100 40GB GPU,PyTorch,训练 200k 步。并行策略、精度(fp16/bf16/fp32)、总 GPU-hours 均未披露
  • 推理速度(Table 1/2,三档模型,并行解码 + 微调后):300M 5.91 FPS,700M 3.18 FPS,1.2B 3.01 FPS;对应标准自回归解码分别为 2.00 / 1.08 / 0.89 FPS,即并行解码带来约 2.9×~3.4× 的加速(摘要笼统称”4 到 7 FPS / 3×以上加速”,为不同规模模型的区间概括,三个已发布规模的实测值如上)。
  • “实时”的定义:论文用 Actions Per Minute(APM)换算——专业 StarCraft 选手约 250~300 APM,新手约 50 APM,作者自测的业余 Minecraft 玩家平均约 150 APM;据此世界模型需 >2 FPS 才能跟上业余玩家、>5 FPS 才能跟上职业选手。300M 模型 5.91 FPS ≈ 360 APM(达到职业选手水平);1.2B 模型 3.01 FPS ≈ 180 APM(达到业余玩家水平)。
  • 推理硬件:GitHub README 建议使用高端 GPU,官方测试环境为 A100 / H100;论文未给出更细的端侧/边缘设备数字。
  • 与基线对比的说明:论文指出 Oasis 官方博客宣称的画质与速度依赖更大规模模型+专用芯片+推理引擎,这些均未公开;而本文的并行解码算法与硬件/系统层优化正交,理论上可与之叠加进一步提速。

评测 benchmark

评测维度分两类:视频质量(FVD、PSNR、LPIPS、SSIM)与可控性(用 VPT 的预训练 IDM 从生成视频反推动作,与输入动作做分类指标对比:precision/recall/F1,外加相机运动的 L1 loss)。

主结果,对比 Oasis(Table 1)

方法参数量FPS↑P↑R↑F1↑L1↓FVD↓LPIPS↓SSIM↑PSNR↑
Oasis500M2.580.490.440.412.603770.530.3614.38
MineWorld300M5.910.720.710.701.032460.450.3815.13
MineWorld700M3.180.720.710.701.042310.440.3815.32
MineWorld1.2B3.010.760.730.731.022270.440.4115.69

三档 MineWorld 在两类指标上全面优于 Oasis 500M(Oasis 结果由其开源 500M 模型和推理代码复现得到),且随模型规模增大呈现清晰的 scaling 趋势。

并行解码效果(Table 2,AT=自回归解码,Parallel w/FT=微调后并行解码,w/o FT=未微调直接并行解码)

规模解码方式FPS↑F1↑PSNR↑FVD↓
300MAT2.000.7015.63223
300MParallel w/ FT5.910.7015.13246
300MParallel w/o FT5.910.6914.98275
700MAT1.080.7315.74210
700MParallel w/ FT3.180.7115.32231
700MParallel w/o FT3.180.7015.27247
1.2BAT0.890.7216.06203
1.2BParallel w/ FT3.010.7315.69227
1.2BParallel w/o FT3.010.7015.30258

即便不做并行掩码微调,更大的模型也能在并行解码下保持较好效果;而做了微调后,指标能进一步逼近甚至持平自回归基线(如 300M 微调后 F1 与 AT 持平,同时获得 3× 加速)。

可控性指标与人类评估的相关性(Table 3,700M 模型、自回归解码,20 个测试片段、5 名有经验玩家评分):F1 = 0.81,人类平均分 = 4.21(满分 5),皮尔逊相关系数 r = 0.56,p = 0.01——验证了论文提出的分类式可控性指标与人类主观判断显著正相关。

700M 模型分任务动作准确率(Table 5,Appendix A.2)

任务PrecisionRecallF1
Forward-Backward0.8070.7730.782
Left-Right0.8080.7450.771
Sprint-Sneak0.7650.7880.750
Use0.7420.6480.682
Attack0.7290.7490.736
Jump0.7600.8470.796
Drop0.5000.4980.499

“drop”动作明显是最难学的一类(各项指标均在 0.5 左右)。

视觉分词器重建质量(Table 8,Appendix C):微调前(Amused 原始 checkpoint)PSNR 25.91 / SSIM 0.758 / LPIPS 0.238 / rFID 35.05;在 VPT 数据上微调后 PSNR 29.24 / SSIM 0.816 / LPIPS 0.134 / rFID 18.93,证明了针对 Minecraft 画面微调分词器的必要性。

论文未与其它开源自回归世界模型做直接对比,也未给出与 GameFactory、Genie 等的横向评测——这些工作评测协议不完全统一。

创新点与影响

  • 首个开源、实时的 Minecraft 自回归交互式世界模型:把视觉+动作交错序列的自回归 Transformer 路线跑通到 FPS 达到”可与人类玩家实时交互”的水平(对照 APM 的量化定义),代码与(发布初期的)模型权重均已开源。
  • 把 Diagonal Decoding 从静态图像/视频生成扩展到动作条件的交互式世界模型场景:论文明确指出视频场景比图像场景更具挑战——存在跨帧误差累积问题,仍取得比 ZipAR、Lformer 等同类并行解码工作更高的实测加速比。
  • 提出基于 IDM 的可控性评测协议:把 Minecraft 复杂动作空间简化为 7 个互斥分类任务,用逆动力学模型反推生成视频对应的动作、与真值动作做分类指标对比,并用人类评估验证了该指标的有效性(r=0.56, p=0.01)——填补了动作条件视频生成模型缺乏标准化可控性度量的空白。
  • 模型同时是策略模型:因为动作 token 与视觉 token 被同等对待、联合训练,模型天然具备”自己生成动作+自己生成后续画面”的能力,论文用案例研究(Figure 5)展示了它作为自玩 agent 的潜力(未做定量评测)。
  • 作者自述局限(Conclusion & Limitations):仅在 Minecraft 单一领域、固定低分辨率下训练,无法泛化到其它视频域(如互联网视频)或生成更高分辨率结果;下采样会损失细粒度画面信息;模型最大输入长度为 16 个 state-action pair(约 5.5k token),超出这一范围后时序一致性不再有保证。
  • 发布后变化(GitHub README 披露,非论文内容):2025 年 5 月起 HuggingFace 仓库的模型权重被”暂时下架”;截至本次抓取(2026-07-16),https://huggingface.co/microsoft/mineworld 返回 404,项目主页短链 https://aka.ms/mineworld 也无法解析,仅 GitHub 代码仓库仍然可访问。

原始链接

一手源存档(sources/)

  • mineworld—github-readme — GitHub README 快照(fetched 2026-07-16,含 HF/项目页失效说明)
  • arXiv 2504.08388 全文(arXiv 原文 HTML,不入 git,见上方链接)