一句话定位
Skywork AI 把一个 1.8B 的 Wan-I2V 风格动作可控视频扩散模型,用 Self-Forcing 蒸馏成因果少步(3 步)自回归模型,配合滚动 KV-cache,在单张 H100 上以 25 FPS 实时流式生成分钟级、键鼠可控的交互游戏视频——首个开源权重+代码的实时流式交互世界模型。
背景与定位
Matrix-Game 2.0 属于”交互式游戏世界模型(game world model)“这一支,直接前作是同组的 skywork-matrix-game(Matrix-Game 1.0,全序列双向扩散、固定长度生成)。论文把现有交互世界模型的三大痛点作为出发点:
- 缺大规模高质量交互数据——带精确动作/相机标注的游戏视频采集成本高。
- 双向扩散的延迟问题——像 Matrix-Game 1.0、Hunyuan-GameCraft(tencent-hunyuan-gamecraft)、YUME 这类双向注意力模型,生成一帧要处理整段视频,算力/显存随帧数二次增长,加上多步去噪,不适合实时流式。
- 自回归扩散的误差累积——逐帧生成会随时间退化画质。
对应地,它把范式定为 少步自回归扩散(few-step auto-regressive diffusion)+ Self-Forcing 蒸馏:技术核心是”带动作控制模块的视频 DiT,经 Self-Forcing(huang2025self)蒸成因果少步自回归模型”,训练与推理都靠 KV-cache 支撑。这条线沿袭 Diffusion Forcing、CausVid、Self-Forcing 的自回归+扩散长视频路线,把它们从 T2V/I2V 扩展到”长交互视频”这个此前未被充分探索的场景。与去语义化理念相关的还有 World Labs 的 spatial intelligence(world-labs-marble)、DeepMind 的 genie-3。动作控制模块设计借鉴 GameFactory 与 Matrix-Game 1.0。
一个刻意的设计取向:完全去掉语言输入(不像 SORA/HunyuanVideo/Wan 用文本引导),只从图像学习空间结构与动态规律,避免语义先验把生成偏向语言推理而非物理规律。
模型架构
基础模型(foundation model):从 Wan I2V 设计派生,具体以 SkyReels-V2-I2V-1.3B-540P(遵循 Wan 2.1 架构)初始化,移除文本分支、加入动作模块——与 Matrix-Game 1.0 一样”只从视觉内容+动作预测下一帧”。
- Tokenizer / latent:3D Causal VAE(推理阶段用带 cache 机制的 Wan2.1-VAE),空间压缩 8×8、时间压缩 4×。图像输入同时经 3D VAE encoder 与 CLIP image encoder 作为条件。DiT 生成视觉 token 序列,再由 3D VAE decoder 解码成视频。
- Backbone:Diffusion Transformer(DiT),1.3B 基座加动作模块后总参数量 1.8B。
- 动作条件(action-conditioning):帧级信号注入 DiT block,分两类——
- 离散移动动作(键盘):由融合特征通过 cross-attention 查询注入,得到精确可控性;键盘输入的位置编码用 RoPE 替换 Matrix-Game 1.0 的 sin-cos embedding,以利长视频生成。
- 连续视角动作(鼠标):直接 concat 到输入 latent → 过 MLP → 再过 temporal self-attention。
- 记忆/一致性:滚动 KV-cache(rolling cache)维持定长的近期 latent 与动作 embedding,超容量时驱逐最旧 token,支持”无限长”生成。论文刻意约束 KV-cache 窗口大小(把首帧对后续帧设为不可见),迫使模型更依赖学到的先验与当前动作,缓解 I2V 长视频推理时”首帧被排除”造成的训练-推理 gap,也提升鲁棒性。
数据
数据生产线(Unreal Engine + GTA5)是本作三大贡献之一,产出约 1200 小时带交互标注的视频(HF card / abstract 口径)。
- 规模与来源:curation pipeline 共采集 超 120 万个视频片段;整体标注准确率 >99%,相机旋转精度提升 50 倍,单 GPU 支持双路并发数据流(产能翻倍)。
- 实际训练集配比(基础模型):约 800 小时动作标注视频、360p 分辨率,每个 clip 排成 57 帧。其中 153 小时 Minecraft + 615 小时 Unreal Engine。真实场景另用开源 Sekai 数据集,curation 后得 85 小时(因 Sekai 导航速度/FPS 与 UE 不同,做了帧重采样对齐时序动态)。
- 额外微调数据(验证通用性):再采 574 小时 GTA-driver 数据 + 560 小时 Temple Run 游戏数据,覆盖动态场景交互。所有视频统一 resize 到 352×640。
- UE 生产线细节:以 navigation mesh + 3D 场景为输入,自动移动/相机控制模块模拟 agent 导航与视角变换,最后经 MP4 编码器 + CSV 生成器导出视觉数据与动作标注。
- NavMesh 路径规划:基于 UE 原生 NavMesh + 自定义优化,平均查询延迟 <2 ms;引入受控随机性生成多样轨迹。
- RL 增强 agent:在碰撞规则之外用 PPO 训练采集 agent,奖励 = α·碰撞规避 + β·探索效率 + γ·轨迹多样性。
- 精确输入/相机控制:UE Enhanced Input 系统毫秒级同步多键输入与渲染帧;用双精度算术做四元数精度优化,把相机旋转 0.2% 的误差率降到近乎可忽略。
- 数据清洗:OpenCV 帧过滤去时序冗余帧;速度阈值校验剔除零/负速度(静止或物理不合理)样本。
- 加速:多线程改造,单张 RTX 3090 上双流数据生产。
- GTA5 录制系统:Script Hook V 插件 + 自定义 C# mod,帧级同步捕获鼠标/键盘 + RGB 帧,OBS Studio 录 MP4 + Data Collector 生成 CSV。可调车辆密度 [0.1, 2.0]、NPC 密度 [0.2, 1.5]、天气、时间;支持第一/第三人称、自主导航、NPC 交互、车辆交互。
- sim-vs-real:绝大多数是合成数据(UE/GTA5/Minecraft/Temple Run),真实数据仅 Sekai 的 85 小时。
训练方法
分”基础模型训练”与”蒸馏”两大阶段。
基础模型(objective 为标准视频扩散):
- 以
SkyReels-V2-I2V-1.3B初始化,移除文本注入模块,先微调 5k step 稳定训练。 - 每个 DiT block 加动作模块(总量升到 1.8B),训练 120k step,lr=2e-5,batch size=256。
蒸馏为因果少步自回归(两阶段):
- 学生初始化(ODE 轨迹):先构造 ODE 轨迹数据集,t 从 [0,T] 的 3-step 子集采样;采一段 N 帧噪声序列、切成 L 个独立 timestep 的 chunk,学生生成器以对应动作为输入,用去噪输出与干净输出的回归损失(式 5)训练。收集 40k ODE pairs,微调因果学生 6k step。
- DMD-based Self-Forcing:随后 4k step,用 DMD(distribution matching distillation)把学生分布对齐教师分布;关键是生成器从自身分布(而非 ground-truth)采样历史帧,缓解训练-推理 gap 与误差累积。lr=6e-6。
- 潜帧 chunk size=3,attention local size=6。
- Self-Forcing 是 data-free 方法,可手工设计动作序列分布,比自动脚本产的随机动作更贴近真实用户输入。
- 蒸馏去噪步数:从 4 步降到 3 步(配合加速)。
Infra(训练 / 推理工程)
- 训练 GPU 数量 / GPU-hours / 并行策略 / 精度:未披露(论文只给了 step 数、lr、batch size=256)。
- 推理:单张 H100 上 25 FPS(25.15 FPS)自回归生成,分钟级长视频。
- 运行门槛(GitHub):NVIDIA GPU ≥ 24 GB(A100、H100 实测)、Linux、64 GB RAM;依赖 apex + FlashAttention。
- 加速消融(Table 3,逐步叠加):
- (1) +VAE Cache(集成带 cache 的 Wan2.1-VAE,加速长视频解码):15.49 FPS。
- (2) (1)+动作模块只放在 DiT 前半层(halving action modules):21.03 FPS。
- (3) (2)+去噪步数 4→3:25.15 FPS——质量指标基本不变。
- 数据生产 infra:单张 RTX 3090 双流;NavMesh 查询 <2 ms。
评测 benchmark
用 Matrix-Game 1.0 引入的 GameWorld Score Benchmark(四维:视觉质量、时序质量、动作可控性、物理规则理解)。因开源交互世界模型稀缺,分两域评测:Minecraft(对比 Oasis)与 wild scene(对比 YUME)。评测用 597 帧复合动作序列,覆盖 32 个 Minecraft 场景 + 16 张 wild 场景图。
Table 1 — Minecraft(vs Oasis):
| 指标 | Oasis | Ours |
|---|---|---|
| Image Quality ↑ | 0.27 | 0.61 |
| Aesthetic ↑ | 0.27 | 0.50 |
| Temporal Cons. ↑ | 0.82 | 0.94 |
| Motion smooth. ↑ | 0.99 | 0.98 |
| Keyboard Acc. ↑ | 0.73 | 0.91 |
| Mouse Acc. ↑ | 0.56 | 0.95 |
| Obj. Cons. ↑ | 0.18 | 0.64 |
| Scenario Cons. ↑ | 0.84 | 0.80 |
论文注:Oasis 崩溃后倾向输出静止帧,反而虚高了 motion smoothness 与 scenario consistency。
Table 2 — Wild scene(vs YUME):
| 指标 | YUME | Ours |
|---|---|---|
| Image Quality ↑ | 0.65 | 0.67 |
| Aesthetic ↑ | 0.48 | 0.51 |
| Temporal Cons. ↑ | 0.85 | 0.86 |
| Motion smooth. ↑ | 0.99 | 0.98 |
| Obj. Cons. ↑ | 0.77 | 0.71 |
| Scenario Cons. ↑ | 0.80 | 0.76 |
(GameWorld 的动作可控性子项是为 Minecraft 设计的,无法直接用于 wild scene,故 Table 2 不含键鼠精度。论文称 YUME 在 OOD 场景动作可控性显著退化,且崩溃后趋于静止,虚高了 Obj./Scenario 一致性。)
KV-cache local size 消融:9 帧 cache 反而更早出现伪影(过度依赖缓存、把早期误差”记忆”成有效场景元素),6 帧在上下文保持与误差纠正间最平衡。
创新点与影响
- 贡献:(1) 首个开源权重+代码的实时(25 FPS)流式交互世界模型;(2) 把双向扩散基座经 Self-Forcing 蒸成因果少步自回归 + 滚动 KV-cache,实现分钟级长视频且缓解误差累积;(3) 可规模化的 UE+GTA5 交互数据生产线(~1200h,帧级键鼠+相机标注);(4) 去语言化、纯视觉驱动的世界建模取向。HF 上同时放出通用场景、GTA driving、TempleRun 三套权重。
- 改变了什么:把交互世界模型从”离线双向、慢、固定长度”推进到”在线自回归、实时、无限长流式”,让 human-in-the-loop 的实时交互成为可能。
- 论文自陈局限:(1) OOD 场景泛化不足——长时间上抬相机或持续前进可能过饱和/退化;(2) 输出仅 352×640,低于 SOTA 视频模型;(3) 缺显式记忆机制,长视频的内容/历史一致性仍难维持。作者指出可通过扩数据域、放大模型、接入兼容的记忆检索机制改进。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2508.13009
- arXiv PDF:https://arxiv.org/pdf/2508.13009
- 技术报告 PDF(项目站镜像):https://matrix-game-v2.github.io/static/pdf/report.pdf
- 项目主页:https://matrix-game-v2.github.io/
- GitHub(Matrix-Game-2 子目录):https://github.com/SkyworkAI/Matrix-Game/tree/main/Matrix-Game-2
- HuggingFace 权重:https://huggingface.co/Skywork/Matrix-Game-2.0
- 基座:https://huggingface.co/Skywork/SkyReels-V2-I2V-1.3B-540P
一手源存档(sources/)
- skywork-matrix-game-2—hf-card — HF model card 快照(https://huggingface.co/Skywork/Matrix-Game-2.0)
- skywork-matrix-game-2—github-readme — GitHub Matrix-Game-2 README 快照
- skywork-matrix-game-2—project-page — 项目主页快照(https://matrix-game-v2.github.io/)
- arXiv 全文 PDF(arXiv:2508.13009,原文 PDF,不入 git)