一句话定位
Skywork AI 开源的 17B 交互式世界基础模型:从单张参考图出发,用键盘/鼠标动作逐帧驱动,生成可控的 Minecraft 风格游戏世界视频;配套开源大规模数据集 Matrix-Game-MC(2700+ 小时无标注 + 1000+ 小时动作标注)与统一评测基准 GameWorld Score,在开源 Minecraft 世界模型(Oasis、MineWorld)上全维领先。
背景与定位
世界模型(world model)近年以视频扩散模型为主流范式:给定结构化控制信号(键盘、相机运动),生成时空连贯、且遵循物理规律的可交互视频。论文明确对标并试图超越三类前作:
- 游戏世界生成 / 神经游戏引擎:Genie / Genie 2、DIAMOND、GameNGen、OASIS、MineWorld、GameGen-X、The Matrix、GameFactory、WorldMem。论文批评这些工作要么过拟合特定游戏数据、泛化差,要么模型容量与数据规模有限,难以捕捉物理规则、难以跨场景精确交互。
- 可控视频生成:CameraCtrl / MotionCtrl(轨迹级相机控制)、Direct-a-Video(粗粒度 yaw/pitch/zoom),Matrix-Game 走的是键鼠动作逐帧条件的交互式路线,而非静态相机轨迹。
- 世界基础模型平台:论文自述受 Cosmos(NVIDIA physical-AI 世界基础模型)与 Genie 2 启发,采用潜空间扩散范式。
核心主张是 image-to-world(图到世界) 而非 text+image:作者受 World Labs “Spatial Intelligence” 概念启发,去掉文本分支,让模型纯粹从视觉/物理线索里建立一致的场景理解(几何、物体运动、物理交互),避免文本先验带来的语义偏置与幻觉。三大贡献:Matrix-Game-MC 数据集、Matrix-Game 模型、GameWorld Score 基准。
注:本页对应 Matrix-Game 1.0(2025-05 首发权重、2025-06 技术报告)。同仓库后续有 Matrix-Game 2.0(2025-08,实时流式)与 3.0(2026-03,长时记忆),不在本页范围。
模型架构
范式:潜空间扩散(latent diffusion)+ 多模态扩散 Transformer(MMDiT),image-to-world 自回归生成。总参数 17B(170 亿)。
- Backbone / 初始化:多模态扩散 Transformer,遵循 Flux 与 HunyuanVideo 的 MMDiT 设计;权重由 HunyuanVideo image-to-video 模型初始化。为从”文本驱动”转向”图像条件世界建模”,把 MMDiT 里原本的文本分支替换成图像分支。
- Tokenizer / 潜空间:3D Causal VAE,对视频做空间 8×、时间 4×压缩;生成在压缩潜空间内进行,再由 3D VAE decoder 解码回视频。
- 条件输入(三路):① 参考图(经视觉编码器 / 多模态 backbone,作为世界理解的核心先验);② 运动上下文(motion frames,见自回归);③ 用户动作(键鼠)。外加高斯噪声。
- 自回归长视频生成:固定长度片段生成限制了长时建模,故采用自回归策略——取每个已生成片段的最后 k=5 帧作为下一片段的运动条件。这些运动帧的潜表示沿通道维与噪声潜拼接,再拼一个二值 mask标记哪些帧含有效运动信息;组合后经 patch embedding,再沿 token 维与图像 token 拼接。采用 HunyuanVideo I2V 的 token replacement trick 稳定 image-to-video。
- 动作注入(control module):沿用 GameFactory 的动作控制设计。键盘=离散编码(up / down / left / right / jump / attack 六类),经 cross-attention 注入;鼠标=连续标量(pitch 角度变化),与输入潜拼接后经 MLP + temporal self-attention 处理。为对齐 3D Causal VAE 的时间压缩比,采用 GameFactory 的 group operation trick 做 token 级条件对齐。控制模块细节见论文 Fig.6。
数据
Matrix-Game-MC,专为 Minecraft 世界建模构建,分无标注与动作标注两部分。
无标注数据(Stage 1 用)
- 从 MineDojo 官方视频库检索约 6,000 小时原始游戏录像(教程、非结构化玩法、环境交互演示),跨 forest / desert / snow 等多个 biome。
- 预处理:TransNet V2 检测转场 → FFmpeg 按转场切成单镜头片段 → 统一转 libx264 编码 → 丢弃每片段首尾各 4 帧(去渐变/抖动伪影)。
- 三阶段层级过滤:① 视频质量(DOVER,genre 自适应阈值)+ 美学(LAION 美学预测器,分帧平均、genre 自适应阈值);② 菜单态过滤(IDM/Inverse Dynamics Model 剔除无输入帧:菜单/待机/加载)、字幕过滤(CRAFT 文本检测,聚焦下屏高风险区)、人脸过滤(DeepFace 去主播摄像头/人脸叠加);③ 运动过滤(GMFlow 光流,剔除过静/过动片段)、相机运动过滤(IDM 估计角度变化,剔除 yaw/pitch 过激片段)。
- 过滤后得 2,700+ 小时无标注片段;再从中精选 870 小时高质量子集(稳定相机、干净 UI、清晰度高)做二次精炼。
动作标注数据(Stage 2 用) —— 两条互补管线:
- Exploration Agent(MineRL):在 MineRL 环境部署 curriculum-guided VPT agents 做长时任务自主探索,逐帧抽取键鼠动作,动作采样率 16Hz,得到密集监督的动作标注集。curation 三策略:相机运动限制(yaw/pitch 每帧 ≤ 15°);MineRL 引擎改造(禁用 frustum-based chunk loading 消除地形 pop-in、实时监测 agent 健康/界面状态、临近死亡或菜单时自动停录);场景多样化(14 个 biome 各挑场景,离散动作 move/jump/attack 均衡采样)。
- Unreal 程序化仿真:在 Unreal Engine 自建 urban / desert / forest 等 biome,逐帧提供无噪声真值监督:① 离散动作标签 + 连续注视向量(相机 pitch/yaw);② 运动学真值(位置、速度、朝向);③ 环境交互结果(方块操作成功/失败)。
- 规模:33 帧训练用 1,026+ 小时(MineRL 合成 + Unreal),65 帧训练用扩展均衡集 1,200+ 小时(约一半来自 MineRL 的 14 个 biome)。
- 14 biome 分布(65 帧均衡集,论文 Table 1):Desert 7.9%、Ocean 7.2%、Extreme hills 7.2%、Icy 6.8%、Mesa 6.7%、Beach 6.5%、Savanna 6.3%、Mushroom 6.3%、Plains 6.0%、Jungle 5.9%、River 5.8%、Swamp 4.6%、Taiga 4.5%、Forest 4.0%,另 Random 14%(Nether/End 等随机出生)。每 biome 4–7%。
训练方法
- 目标函数:flow matching 范式(比 DDPM 收敛/采样更快),采用 rectified flow loss。
- 两阶段渐进训练:
- Stage 1 · 无标注世界理解预训练:从 HunyuanVideo I2V 权重初始化,文本分支换图像分支,不含动作控制模块。用 2,700 小时无标注 720p 视频,混合帧数(17 / 33 / 65)与宽高比(16:9 / 4:3 / 21:9)增强鲁棒性;再在 870 小时高质量子集上精炼。
- Stage 2 · 动作标注可控训练:接入动作控制模块。先用 1,200 小时动作标注 720p 33 帧(Minecraft + Unreal)在固定 720p/33 帧稳态训练;再切到 8 biome(beach / desert / forest / hills / icy / mushroom / plains / river)均衡集 + Unreal,约 1,200 小时 720p 65 帧继续训练,强化长程时序依赖。
- 自回归鲁棒性技巧:为抑制误差累积,训练时以 p=0.2 给运动帧与参考图加高斯噪声;对运动帧施 CFG(p=0.25 用零潜替换为无条件),迫使模型更依赖运动上下文;对动作信号施 CFG(p=0.1 替换为无条件),提升动作利用率。
- 关键超参(论文 Implementation details):per-GPU batch size 1,bf16 混合精度,FSDP;学习率 5×10⁻⁵,训练 16 FPS,5 运动帧。
- 推理:对参考图、运动帧、动作信号均施 CFG,CFG scale = 6,50 采样步,Flow Matching,flow matching shift = 15。
Infra(训练 / 推理工程)
- 训练:bf16 混合精度 + FSDP(Fully Sharded Data Parallel),per-GPU batch size 1。GPU 型号/数量、GPU-hours、并行拓扑均未披露(论文仅称 “large-scale training”)。
- 推理硬件:官方要求 NVIDIA A100/H100,单条 65 帧视频推理需 ≥80GB 显存。
- 推理速度:1.0 版未披露实时/FPS/延迟指标——本版为片段式扩散生成、非实时(实时流式为后续 Matrix-Game 2.0)。仅报告训练侧 16 FPS 采样率。
- 2025-07 仓库补充发布了并行推理脚本(parallel inference script)。
评测 benchmark
作者自建 GameWorld Score:针对 Minecraft image-to-world 逐帧动作条件场景(现有 VBench / WorldScore 只评文本条件、无法评细粒度控制),分四大支柱 8 维。评测工具:LAION 美学、MUSIQ(图像质量,SPAQ 训练)、CLIP 相邻帧余弦相似(时序一致)、AMT 帧插值重建误差(运动平滑)、IDM(可控性,从生成视频反推动作)、DROID-SLAM(物体一致性,重投影误差)、对称相机运动 MSE(场景一致性,容 4px 位移)。IDM 代理本身在 1,962 小时 Minecraft 玩法上训练,键盘准确率 90.6%、鼠标回归 R²=0.97。
GameWorld Score(论文 Table 2,↑越高越好)
| 维度 | Oasis | MineWorld | Matrix-Game |
|---|---|---|---|
| Image Quality | 0.65 | 0.69 | 0.72 |
| Aesthetic | 0.48 | 0.47 | 0.49 |
| Temporal Cons. | 0.94 | 0.95 | 0.97 |
| Motion Smooth. | 0.98 | 0.98 | 0.98 |
| Keyboard Acc. | 0.77 | 0.86 | 0.95 |
| Mouse Acc. | 0.56 | 0.64 | 0.95 |
| Object Cons. | 0.56 | 0.51 | 0.76 |
| Scenario Cons. | 0.86 | 0.92 | 0.93 |
最大增益在可控性(键盘 +0.09 / 鼠标 +0.31 vs MineWorld)与物理一致性(物体 +0.25)。
逐动作控制精度(论文 Table 3)
- 键盘:forward 0.99、backward 0.91、left 0.92、right 0.96、jump 0.88、attack 0.95(全部 >88%)。
- 鼠标 8 方向:camera↑ 0.91、↓ 0.98、← 0.89、→ 0.90、↖ 0.92、↗ 0.97、↙ 0.98、↘ 0.98(全部 ≥89%,远超 Oasis 的 0.33–0.66、MineWorld 的 0.45–0.96)。
双盲人评胜率(论文 Fig.8,两组独立标注):Overall Quality 96.30%、Controllability 93.76%、Visual Quality 98.23%、Temporal Consistency 89.56%——与 GameWorld Score 结论一致。
泛化:在 beach/desert/forest/hills/icy/mushroom/plains/river 8 场景(论文 Fig.9 雷达图)全面超过 Oasis、MineWorld。自回归多段生成(Fig.10)在跨段边界保持时序一致、忠实跟随动作。
创新点与影响
- 首个 17B 级开源交互式世界基础模型,把 Minecraft 世界生成从小容量/窄数据推到 foundation-model 规模,并全套开源(模型权重 + Matrix-Game-MC 数据集 + GameWorld Score 工具,MIT 许可)。
- image-to-world 纯视觉条件范式:去文本分支,从单图建立一致场景理解,主打 spatial intelligence,减少语言先验幻觉。
- GameWorld Score 基准:首个覆盖视觉/时序/可控性/物理规则四支柱、含逐帧键鼠动作评测的 Minecraft 世界模型统一基准,填补 VBench/WorldScore 在交互控制上的空白。
- 可复用的数据管线:MineDojo 检索 + 三阶段层级过滤 + MineRL(VPT agent)/Unreal 双路动作标注,给”稀缺的高质量交互视频数据”提供了可规模化解法。
作者自述局限:① 罕见/复杂 biome 的边缘泛化仍失稳(数据覆盖不足);② 物理理解不足(示例:agent 穿过树叶——缺高保真物理监督数据);③ 动作空间受限(仅 6 类键盘 + 有限鼠标方向);④ 仅 Minecraft 沙盒;⑤ 长时时序一致性仍是根本挑战。未来方向:记忆机制/更长运动上下文、扩展键鼠动作空间、扩展 GameWorld Score 的物理评测、以及走出 Minecraft(Black Myth: Wukong、赛车模拟、CS:GO 等多智能体对战)。
原始链接
- arXiv abs:https://arxiv.org/abs/2506.18701
- arXiv PDF(技术报告):https://arxiv.org/pdf/2506.18701
- 项目主页:https://matrix-game-homepage.github.io/
- GitHub:https://github.com/SkyworkAI/Matrix-Game (1.0 子目录
Matrix-Game-1/) - HuggingFace 权重:https://huggingface.co/Skywork/Matrix-Game
- GameWorld Score 基准实现:https://github.com/SkyworkAI/Matrix-Game/tree/main/GameWorldScore
一手源存档(sources/)
- skywork-matrix-game—github-readme — GitHub Matrix-Game-1 README(fetched 2026-07-16)
- skywork-matrix-game—hf-card — HuggingFace Skywork/Matrix-Game model card(fetched 2026-07-16)
- skywork-matrix-game—project-page — 项目主页文本快照(fetched 2026-07-16)
- arXiv 2506.18701 全文(arXiv 原文 PDF/HTML,不入 git,见上方链接)