一句话定位

Skywork AI 把一个 1.8B 的 Wan-I2V 风格动作可控视频扩散模型,用 Self-Forcing 蒸馏成因果少步(3 步)自回归模型,配合滚动 KV-cache,在单张 H100 上以 25 FPS 实时流式生成分钟级、键鼠可控的交互游戏视频——首个开源权重+代码的实时流式交互世界模型。

背景与定位

Matrix-Game 2.0 属于”交互式游戏世界模型(game world model)“这一支,直接前作是同组的 skywork-matrix-game(Matrix-Game 1.0,全序列双向扩散、固定长度生成)。论文把现有交互世界模型的三大痛点作为出发点:

  1. 缺大规模高质量交互数据——带精确动作/相机标注的游戏视频采集成本高。
  2. 双向扩散的延迟问题——像 Matrix-Game 1.0、Hunyuan-GameCraft(tencent-hunyuan-gamecraft)、YUME 这类双向注意力模型,生成一帧要处理整段视频,算力/显存随帧数二次增长,加上多步去噪,不适合实时流式。
  3. 自回归扩散的误差累积——逐帧生成会随时间退化画质。

对应地,它把范式定为 少步自回归扩散(few-step auto-regressive diffusion)+ Self-Forcing 蒸馏:技术核心是”带动作控制模块的视频 DiT,经 Self-Forcing(huang2025self)蒸成因果少步自回归模型”,训练与推理都靠 KV-cache 支撑。这条线沿袭 Diffusion Forcing、CausVid、Self-Forcing 的自回归+扩散长视频路线,把它们从 T2V/I2V 扩展到”长交互视频”这个此前未被充分探索的场景。与去语义化理念相关的还有 World Labs 的 spatial intelligence(world-labs-marble)、DeepMind 的 genie-3。动作控制模块设计借鉴 GameFactory 与 Matrix-Game 1.0。

一个刻意的设计取向:完全去掉语言输入(不像 SORA/HunyuanVideo/Wan 用文本引导),只从图像学习空间结构与动态规律,避免语义先验把生成偏向语言推理而非物理规律。

模型架构

基础模型(foundation model):从 Wan I2V 设计派生,具体以 SkyReels-V2-I2V-1.3B-540P(遵循 Wan 2.1 架构)初始化,移除文本分支、加入动作模块——与 Matrix-Game 1.0 一样”只从视觉内容+动作预测下一帧”。

  • Tokenizer / latent:3D Causal VAE(推理阶段用带 cache 机制的 Wan2.1-VAE),空间压缩 8×8、时间压缩 4×。图像输入同时经 3D VAE encoder 与 CLIP image encoder 作为条件。DiT 生成视觉 token 序列,再由 3D VAE decoder 解码成视频。
  • Backbone:Diffusion Transformer(DiT),1.3B 基座加动作模块后总参数量 1.8B
  • 动作条件(action-conditioning):帧级信号注入 DiT block,分两类——
    • 离散移动动作(键盘):由融合特征通过 cross-attention 查询注入,得到精确可控性;键盘输入的位置编码用 RoPE 替换 Matrix-Game 1.0 的 sin-cos embedding,以利长视频生成。
    • 连续视角动作(鼠标):直接 concat 到输入 latent → 过 MLP → 再过 temporal self-attention。
  • 记忆/一致性:滚动 KV-cache(rolling cache)维持定长的近期 latent 与动作 embedding,超容量时驱逐最旧 token,支持”无限长”生成。论文刻意约束 KV-cache 窗口大小(把首帧对后续帧设为不可见),迫使模型更依赖学到的先验与当前动作,缓解 I2V 长视频推理时”首帧被排除”造成的训练-推理 gap,也提升鲁棒性。

数据

数据生产线(Unreal Engine + GTA5)是本作三大贡献之一,产出约 1200 小时带交互标注的视频(HF card / abstract 口径)。

  • 规模与来源:curation pipeline 共采集 超 120 万个视频片段;整体标注准确率 >99%,相机旋转精度提升 50 倍,单 GPU 支持双路并发数据流(产能翻倍)。
  • 实际训练集配比(基础模型):约 800 小时动作标注视频、360p 分辨率,每个 clip 排成 57 帧。其中 153 小时 Minecraft + 615 小时 Unreal Engine。真实场景另用开源 Sekai 数据集,curation 后得 85 小时(因 Sekai 导航速度/FPS 与 UE 不同,做了帧重采样对齐时序动态)。
  • 额外微调数据(验证通用性):再采 574 小时 GTA-driver 数据 + 560 小时 Temple Run 游戏数据,覆盖动态场景交互。所有视频统一 resize 到 352×640
  • UE 生产线细节:以 navigation mesh + 3D 场景为输入,自动移动/相机控制模块模拟 agent 导航与视角变换,最后经 MP4 编码器 + CSV 生成器导出视觉数据与动作标注。
    • NavMesh 路径规划:基于 UE 原生 NavMesh + 自定义优化,平均查询延迟 <2 ms;引入受控随机性生成多样轨迹。
    • RL 增强 agent:在碰撞规则之外用 PPO 训练采集 agent,奖励 = α·碰撞规避 + β·探索效率 + γ·轨迹多样性。
    • 精确输入/相机控制:UE Enhanced Input 系统毫秒级同步多键输入与渲染帧;用双精度算术做四元数精度优化,把相机旋转 0.2% 的误差率降到近乎可忽略。
    • 数据清洗:OpenCV 帧过滤去时序冗余帧;速度阈值校验剔除零/负速度(静止或物理不合理)样本。
    • 加速:多线程改造,单张 RTX 3090 上双流数据生产。
  • GTA5 录制系统:Script Hook V 插件 + 自定义 C# mod,帧级同步捕获鼠标/键盘 + RGB 帧,OBS Studio 录 MP4 + Data Collector 生成 CSV。可调车辆密度 [0.1, 2.0]、NPC 密度 [0.2, 1.5]、天气、时间;支持第一/第三人称、自主导航、NPC 交互、车辆交互。
  • sim-vs-real:绝大多数是合成数据(UE/GTA5/Minecraft/Temple Run),真实数据仅 Sekai 的 85 小时。

训练方法

分”基础模型训练”与”蒸馏”两大阶段。

基础模型(objective 为标准视频扩散):

  1. SkyReels-V2-I2V-1.3B 初始化,移除文本注入模块,先微调 5k step 稳定训练。
  2. 每个 DiT block 加动作模块(总量升到 1.8B),训练 120k step,lr=2e-5,batch size=256

蒸馏为因果少步自回归(两阶段):

  1. 学生初始化(ODE 轨迹):先构造 ODE 轨迹数据集,t 从 [0,T] 的 3-step 子集采样;采一段 N 帧噪声序列、切成 L 个独立 timestep 的 chunk,学生生成器以对应动作为输入,用去噪输出与干净输出的回归损失(式 5)训练。收集 40k ODE pairs,微调因果学生 6k step
  2. DMD-based Self-Forcing:随后 4k step,用 DMD(distribution matching distillation)把学生分布对齐教师分布;关键是生成器从自身分布(而非 ground-truth)采样历史帧,缓解训练-推理 gap 与误差累积。lr=6e-6
    • 潜帧 chunk size=3,attention local size=6
    • Self-Forcing 是 data-free 方法,可手工设计动作序列分布,比自动脚本产的随机动作更贴近真实用户输入。
  • 蒸馏去噪步数:从 4 步降到 3 步(配合加速)。

Infra(训练 / 推理工程)

  • 训练 GPU 数量 / GPU-hours / 并行策略 / 精度未披露(论文只给了 step 数、lr、batch size=256)。
  • 推理:单张 H10025 FPS(25.15 FPS)自回归生成,分钟级长视频。
  • 运行门槛(GitHub):NVIDIA GPU ≥ 24 GB(A100、H100 实测)、Linux、64 GB RAM;依赖 apex + FlashAttention。
  • 加速消融(Table 3,逐步叠加)
    • (1) +VAE Cache(集成带 cache 的 Wan2.1-VAE,加速长视频解码):15.49 FPS
    • (2) (1)+动作模块只放在 DiT 前半层(halving action modules):21.03 FPS
    • (3) (2)+去噪步数 4→3:25.15 FPS——质量指标基本不变。
  • 数据生产 infra:单张 RTX 3090 双流;NavMesh 查询 <2 ms。

评测 benchmark

用 Matrix-Game 1.0 引入的 GameWorld Score Benchmark(四维:视觉质量、时序质量、动作可控性、物理规则理解)。因开源交互世界模型稀缺,分两域评测:Minecraft(对比 Oasis)与 wild scene(对比 YUME)。评测用 597 帧复合动作序列,覆盖 32 个 Minecraft 场景 + 16 张 wild 场景图

Table 1 — Minecraft(vs Oasis)

指标OasisOurs
Image Quality ↑0.270.61
Aesthetic ↑0.270.50
Temporal Cons. ↑0.820.94
Motion smooth. ↑0.990.98
Keyboard Acc. ↑0.730.91
Mouse Acc. ↑0.560.95
Obj. Cons. ↑0.180.64
Scenario Cons. ↑0.840.80

论文注:Oasis 崩溃后倾向输出静止帧,反而虚高了 motion smoothness 与 scenario consistency。

Table 2 — Wild scene(vs YUME)

指标YUMEOurs
Image Quality ↑0.650.67
Aesthetic ↑0.480.51
Temporal Cons. ↑0.850.86
Motion smooth. ↑0.990.98
Obj. Cons. ↑0.770.71
Scenario Cons. ↑0.800.76

(GameWorld 的动作可控性子项是为 Minecraft 设计的,无法直接用于 wild scene,故 Table 2 不含键鼠精度。论文称 YUME 在 OOD 场景动作可控性显著退化,且崩溃后趋于静止,虚高了 Obj./Scenario 一致性。)

KV-cache local size 消融:9 帧 cache 反而更早出现伪影(过度依赖缓存、把早期误差”记忆”成有效场景元素),6 帧在上下文保持与误差纠正间最平衡。

创新点与影响

  • 贡献:(1) 首个开源权重+代码的实时(25 FPS)流式交互世界模型;(2) 把双向扩散基座经 Self-Forcing 蒸成因果少步自回归 + 滚动 KV-cache,实现分钟级长视频且缓解误差累积;(3) 可规模化的 UE+GTA5 交互数据生产线(~1200h,帧级键鼠+相机标注);(4) 去语言化、纯视觉驱动的世界建模取向。HF 上同时放出通用场景、GTA driving、TempleRun 三套权重。
  • 改变了什么:把交互世界模型从”离线双向、慢、固定长度”推进到”在线自回归、实时、无限长流式”,让 human-in-the-loop 的实时交互成为可能。
  • 论文自陈局限:(1) OOD 场景泛化不足——长时间上抬相机或持续前进可能过饱和/退化;(2) 输出仅 352×640,低于 SOTA 视频模型;(3) 缺显式记忆机制,长视频的内容/历史一致性仍难维持。作者指出可通过扩数据域、放大模型、接入兼容的记忆检索机制改进。

原始链接

一手源存档(sources/)