一句话定位
Skywork AI 在 skywork-matrix-game-2 的因果自回归路线上改走”统一双向 DiT + 误差缓冲自纠错 + 相机感知记忆检索”,用多段自生成 DMD 蒸馏把 5B 双向模型压成少步流式模型,配上 INT8 量化 + 剪枝 VAE + GPU 记忆检索,在 8+1 GPU 异步部署下做到 720p@40FPS,且能在分钟级 rollout 中保持长程时空一致性;同时把骨干放大到 28B(2×14B)MoE 验证可扩展性。
背景与定位
Matrix-Game 3.0 属于”交互式游戏世界模型(game world model)“这一支,是 skywork-matrix-game-2 的直接后继。论文把问题定位在一个此前少有工作同时做到的三角:长程记忆一致性 + 高分辨率 + 真实时交互。
- Matrix-Game 2.0(skywork-matrix-game-2)与 Hunyuan-GameCraft-2(前作见 tencent-hunyuan-gamecraft)靠因果自回归少步扩散做到了实时流式,但都没有显式记忆机制,长视频容易漂移;
- Lingbot-World 靠放大 DiT 的 context length 提升长程几何一致性,但同时保住记忆能力和真实时部署”仍然困难”;
- DeepMind Genie 3 证明了从大规模长时程视频学交互式世界动态是可行且可扩展的,但训练细节、算力预算、完整推理栈未公开,难以复现或拆解设计选择;
- RELIC、WORLDMEM、VMem 等引入了记忆检索/记忆库,但通常把记忆做成独立分支,额外开销大,难以扩展到高分辨率实时场景。
Matrix-Game 3.0 的方案是:保留双向骨干(而非蒸馏成异构的因果学生),把记忆检索/历史帧/当前预测帧放进同一个自注意力空间联合建模,再用训练-推理对齐的多段自生成蒸馏把双向模型压成少步流式模型——试图同时保住双向模型的先验强度、记忆一致性和实时性。
模型架构
基础模型:以 Wan2.2-TI2V-5B 架构为基座,动作模块按 Matrix-Game 2.0 的设计接入前 15 层 DiT block。
- 训练范式:双向扩散 Transformer,对序列切成”过去 k 帧(history,作为条件)”+“当前 N-k 帧(待预测,加高斯噪声)“两段,拼接后整体过 DiT,flow-matching 目标只加在当前帧上(式 1-3)。
- 动作条件:延续 Matrix-Game 2.0 + GameFactory 设计——离散键盘动作走 cross-attention 注入;连续鼠标视角信号走 self-attention 直接影响当前帧生成。
- 误差感知自纠错(error-aware training):维护一个误差缓冲区 ℰ;训练时把模型输出转成 x₀ 估计 x̂ⁱ,残差 δ=x̂ⁱ−xⁱ 存入缓冲区;再从 ℰ 中均匀采样 δ,扰动历史 latent x̃ⁱ=xⁱ+γδ 参与训练(式 1-3),让基座模型在训练阶段就见过”不完美的自生成历史”,与后续蒸馏阶段行为对齐。
- 记忆模块(长程一致性核心):
- 联合自注意力:不把记忆做成外置分支,而是把检索到的记忆 latent、时间上邻近的历史帧 latent、当前加噪预测 latent放进同一个注意力空间,同一 DiT 联合处理(图 4);论文对比了两条不如它的路线——(a) MoC 式稀疏长上下文路由(高噪阶段相似度估计不稳定,少步场景难收敛,训练开销大);(b) 相机感知显式检索+cross-attention 记忆分支(额外分支特征错位+逐层重复注入导致收敛慢,即便加了几何线索增益仍有限)。
- 相机感知记忆选择 + 相对 Plücker 编码:按相机位姿与视场重叠检索”与当前视角相关”的历史帧(式 9-11:CPU 端用精确视锥体积交比 s_exact,GPU 端用采样近似 s_approx,避免显式 3D 求交);推理时可选保留序列第一帧作为持久 sink latent,作为场景风格/外观统计的全局锚点;显式编码当前目标帧与所选记忆之间的相对相机几何(Plücker 风格线索)。
- 记忆专用误差缓冲:把误差收集/注入机制扩展到记忆 latent 与历史 latent(共享同一个误差缓冲区 ℰ),历史与记忆分别用独立扰动幅度 γ_h、γ_m 加噪(式 4-6)。
- 头级扰动 RoPE base:受 LoL 多头 RoPE jitter 思路启发,给每个注意力头的旋转位置编码基数加扰动 θ̂_h=θ_base(1+σ_θ ε_h)(式 7,σ_θ 训练/推理阶段固定为 0.8),打破 RoPE 周期性带来的”远距离记忆与当前帧位置意外对齐”的伪影,注意力可视化显示扰动后远处记忆帧仍能获得与近邻预测帧相当的注意力权重(图 5)。
- 蒸馏架构一致性:多步基座与少步学生用同一套双向架构(而非常见的因果学生/双向教师异构组合),依据 Causal Forcing 的发现——异构架构会导致映射失配、训练不稳定;统一架构同时降低了 ODE 蒸馏的成本。
- 规模化到 28B-MoE:受 LingBot-World 启发,把骨干放大到 MoE-28B(论文亦称 2×14B);专家路由细节(专家数、top-k 等)论文未披露。视角专精化设计:训练两个独立的高噪模型(分别对应第一人称/第三人称),共享同一个低噪模型;论证依据是”动作控制只需在高噪模型学好即可精确控制,低噪模型可脱离动作模块只专注细节精修”,于是高噪模型用动作精确标注数据训练(窄噪声区间收敛快),低噪模型可以吃未标注的互联网视频提升泛化——把”动作可控性”与”画质精修”解耦到不同阶段的模型上。训练中逐步放大分辨率与视频片段长度以加速收敛、稳定长程行为。
数据
数据引擎是本作三大贡献之一,比 Matrix-Game 2.0 的产线(Unreal Engine + GTA5)更进一步,整合了三类互补来源:
(1) Unreal-Gen(UE5 合成数据产线)
- 基于 1,000+ 个自建 UE5 场景,用 Nanite 虚拟几何 + Lumen 全局光照渲染电影级画质。
- Tick 级同步:每渲染帧 t 同时采集 RGB 帧、玩家世界位置/旋转、相机 6-DoF 位姿、离散动作向量(a_t∈{0,1}⁶)(式 12),全部取自同一引擎 tick 回调,时间对齐误差为零(外部录制方案做不到);旋转用双精度四元数运算保证亚度级精度。
- NavMesh-RL 混合 agent:高层 RL 策略 π_θ(g_t|s_t) 按”覆盖率奖励+场景丰富度”选导航目标,底层 NavMesh 规划器算无碰撞路径;级联回退策略(方向覆盖/形状路线生成/多半径重试)+ 三重卡死检测(位置增量/路径超时/包围盒)保证跨开阔地形、密集室内、风格化世界的鲁棒导航。
- 相机与角色多样性:随机化偏航(360° 全扫或 8 方向离散)与俯仰角;模块化角色组装(上衣/裤子/鞋/发型/外套/帽子/配饰可换装)产生 |𝒞|=∏|𝒮ᵢ| > 10⁸ 种运行时随机变体。
- 工业级自动化:零人工介入产线,单 GPU 并发多个 UE5 实例(含着色器预热)、实时云同步、自动质检(重复帧检测/位置异常修复/不完整场景检测),单人可通过 webhook 监控数十台录制机。
(2) 可扩展 AAA 游戏录制系统(四层解耦架构,覆盖 GTA V、Red Dead Redemption 2、Palworld、Cyberpunk 2077、Hogwarts Legacy)
- 游戏进程层(注入 agent 插件做角色控制/状态提取)→ Agent 层(NavMesh 自主探索 + 8 方向视角切换,经 JSON 文件 IPC 导出逐帧状态,轮询延迟 <1ms)→ 录制协调层(OBS Studio 经 WebSocket 做 60 秒分段录制,物理式 WSAD 推断:位置增量投影到相机局部坐标系后按内积分类到 8 个基本方向,式 13,完全消除人工标注偏差)→ 数据集输出层(MP4 视频配逐帧 CSV,含 6 维动作向量、相机参数、完整位姿)。
- 新增游戏只需实现该游戏专属的 Agent 层,录制/输出层完全复用;全链路可靠性(卡死自动恢复、断线重连分段录制、webhook 远程告警);环境参数(天气/时段/NPC 密度)跨场景随机化。整体数据准确率 >99%。
(3) 真实世界数据(互补光度变化与自然相机轨迹):DL3DV-10K(超 10,000 个 4K 序列,覆盖 65 类兴趣点)、RealEstate10K(室内地产漫游,静态场景、干净相机轨迹)、OmniWorld-CityWalk(YouTube 第一人称城市步行影像,位姿用 DPVO 估计)、SpatialVid-HD(最大子集,覆盖行人/驾驶/无人机航拍,高清,补足稀有场景与长尾视角分布)。所有真实数据统一用 ViPE 重新标注位姿,消除跨源坐标系/表示不一致。
标注与质量过滤:
- 用 InternVL3.5-8B 为全部数据(Unreal + 真实数据)生成结构化描述,采用 LingBot World 提出的四层描述体系:叙事总述 / 静态场景描述(把外观和相机运动解耦)/ 逐段时序描述(事件标签+相机运动描述)/ 感知质量分(0-10 分五维打分:运动平滑度、背景动态、场景复杂度、物理合理性、总体质量)。
- 轨迹与速度过滤:局部几何一致性(深度重投影误差)+ 全局运动异常(最大/中位位移比)+ 相机速度过滤(按中位速度剔除过慢/过快片段)三个准则同时满足才保留;阈值在 UNREAL ground truth 上标定后分数据集分别应用。结合感知质量过滤,整条流水线过滤掉约 20% 的原始数据。
- 记忆增强基座模型训练集规模:约 480 万(4.8M)视频片段。
- MG-LightVAE 训练集:从游戏环境与真实场景混合中收集 70 万(700K)个 17 帧视频片段。
训练方法
阶段一:交互基座模型——基于 Wan2.2-TI2V-5B,联合优化含 VAE 参考 latent(对应输入视频首帧)的情形:以 0.8 的概率用”4 个历史帧 latent + 10 个当前加噪 latent”组合训练;其余 0.2 概率把历史帧和记忆 latent 都遮蔽,退化为动作条件 I2V 设置(对应实际流式推理的第一个 segment:参考 latent + 14 个当前加噪 latent)。学习率 2×10⁻⁵,训练 50K steps。
阶段二:记忆增强基座模型——从同一个动作基座 checkpoint 初始化;联合建模 5 个记忆 latent + 4 个历史帧 latent + 10 个待生成加噪 latent,拼接后送入 DiT;头级 RoPE 扰动系数 ε_h 在各注意力头间线性分布,σ_θ 固定 0.8;训练集约 4.8M 视频片段。
阶段三:训练-推理对齐的少步蒸馏——教师、critic、学生都直接从记忆增强基座模型初始化。
- 冷启动阶段(防止多段推理下少步学生一开始就崩溃):单段推理设置,历史帧用 ground-truth clip;学生学习率 5×10⁻⁷、critic 学习率 1×10⁻⁷;学生每次迭代更新 5 步;持续 600 steps。
- 多段推理阶段:切到实际流式场景对齐的多段自生成推理(图 6)——每段从随机噪声起始,当前段历史帧取自前一段末尾,记忆信号按当前相机视角从在线更新的记忆池中检索;第一段无记忆可用,退化为 I2V 模式;训练时随机截断在某个段(segment 数 k 从 1 到 6 均匀采样),把该段送给教师和 critic 做 DMD(Distribution Matching Distillation,最小化采样时间步 t 上的反向 KL,梯度用两个 score function 之差近似,式 8)。学生+critic 学习率均为 1×10⁻⁷,学生每次迭代更新 3 步,共训练 2,400 steps;历史帧与记忆同样以 0.2 概率遮蔽(与基座模型设置一致)。
阶段四(可选):28B-MoE 规模化——高噪模型用动作精确标注数据训练动作模块(窄噪声区间收敛快),低噪模型用未标注互联网视频训练、专注视觉细节精修,二者解耦;训练中逐步放大分辨率与片段长度;第一人称/第三人称各训一个独立高噪模型,共享一个低噪模型。
Infra(训练 / 推理工程)
- 训练 GPU 数量 / 总 GPU-hours / 并行策略 / 精度:未披露(论文仅给出各阶段的 step 数、学习率、更新步数与掩码概率,未给出显卡型号、卡数、总训练时长或并行切分方式)。
- 推理部署:异步 8+1 GPU 配置——8 张 GPU 做 DiT 推理,1 张 GPU 专门做 VAE 解码,整体流水线达到 720p 下最高 40 FPS。单机 7+1 配置也测试过,吞吐略低,结论不变。H 系列 GPU 用 FlashAttention 3,A 系列用 FlashAttention 2;同等并行设置下 H 系列吞吐始终高于 A 系列。
- INT8 量化:基于 LightX2V 的量化算子,只对 DiT 注意力投影层做 INT8 量化,FFN、VAE、文本编码器保持原精度。
- VAE 剪枝(MG-LightVAE):沿用 LightX2V 的同构解码器缩减设计(降低解码器隐藏维度、结构不变),训练管线改自 TurboVAED,训 50%/75% 两个剪枝比例版本,论文陈述解码速度提升分别为 ×2.6 和 ×5.2;额外对 VAE 解码器首轮迭代后应用 torch.compile。
- GPU 记忆检索:CPU 端精确视锥重叠体积比计算成本高;GPU 端改用采样近似(式 11),避免显式 3D 求交,随候选集增长时优势更明显。
- 加速消融(Table 1,75% VAE 剪枝配置下):完整配置 ~40 FPS;去掉 INT8 量化 → 27.38 FPS(↓12.62);去掉 MG-LightVAE → 25.79 FPS(↓14.21);去掉 GPU 记忆检索 → 6.60 FPS(↓33.40,是三项中降幅最大的单项,论文称其为”最关键组件”)。
- VAE 重建质量/效率(Table 2,17 帧 720×1280 视频,Full=编解码器总耗时,Dec.=仅解码耗时):
| 模型 | PSNR↑ | SSIM↑ | Full(s)↓ | Dec.(s)↓ |
|---|---|---|---|---|
| Wan2.2 VAE(原始) | 33.79 | 0.99 | 0.99 | 0.76 |
| MG-LightVAE(50% 剪枝) | 31.84 | 0.99 | 0.52 | 0.30 |
| MG-LightVAE(75% 剪枝) | 31.14 | 0.99 | 0.35 | 0.13 |
(表中 Dec. 时间与正文所述 ×2.6/×5.2 speedup 基本吻合,个别小数位存在四舍五入误差。)
- 鸣谢:论文致谢 Reactor(reactor.inc)提供加速相关基础设施支持,未披露具体形式。
评测 benchmark
论文没有像 Matrix-Game 2.0 那样给出对标 GameWorld Score / Oasis / YUME 的量化对比表;也没有针对 Genie-3、HY-Gamecraft-2、RELIC、WorldPlay、Lingbot-World 等同类工作的头对头数值基准——Related Work 部分只做了定性/描述性比较(例如指出 Genie-3 在约 24 FPS、720p 下能维持分钟级一致性但”细节和训练配方未公开”)。论文给出的定量结果限于系统内部消融:
- 加速消融(Table 1):见上”Infra”部分——INT8 量化、MG-LightVAE、GPU 记忆检索三项对 FPS 的边际贡献。
- VAE 重建质量/效率(Table 2):见上表,MG-LightVAE 相对原始 Wan2.2 VAE 的 PSNR/SSIM/耗时权衡。
- 定性展示(无数值指标):基座模型的动作可控性与场景稳定性(图 8);场景重访实验——反转后半段动作强迫相机回到已访问区域,验证记忆机制能重建早前观测到的几何/外观细节(图 9);28B 模型在多种 AAA/UE 场景下的长程第三人称生成(图 10);蒸馏模型继承记忆能力、遮挡内容可被后续帧忠实复现(图 11)。
创新点与影响
- 贡献:(1) 统一双向架构的误差感知自纠错基座模型——把误差收集/注入机制系统化地用于训练阶段,让基座模型直接学会处理”不完美的自生成历史”,同时保持与后续蒸馏阶段的架构一致性(避免异构教师-学生失配);(2) 联合自注意力式相机感知记忆机制——记忆、历史、当前预测帧共处同一注意力空间而非外置分支,配合相对 Plücker 编码与头级扰动 RoPE,用较低开销获得长程时空一致性;(3) 训练-推理对齐的多段自生成 DMD 蒸馏——针对双向学生(而非常见的因果学生)设计的多段 rollout 蒸馏策略,弥合”单窗口推理”与”流式自回归推理”之间的训练-测试差距;(4) 完整的工程化部署栈(INT8 量化+剪枝 VAE+GPU 记忆检索)把 5B 模型做到 720p@40FPS;(5) 升级版工业级 Video-Pose-Action-Prompt 数据引擎(UE5 Unreal-Gen 的 tick 级零对齐误差数据 + 覆盖 5 款 AAA 大作的四层录制系统 + 四类真实数据集 + 四层描述标注体系);(6) 用 28B-MoE 规模化 + 视角解耦(高噪管动作、低噪管画质)验证了这套框架的可扩展性。
- 改变了什么:把 Matrix-Game 系列从”因果自回归少步、无显式记忆”(2.0)推进到”双向基座 + 联合注意力记忆 + 训练对齐蒸馏”,试图在同一个开源框架内同时兑现长程一致性、高分辨率与真实时三项此前彼此制约的目标。
- 论文自陈局限 / 未披露信息:(1) 训练算力(GPU 型号/数量/总时长/并行策略)全程未披露;(2) 没有对标 Genie-3、RELIC、WorldPlay 等同类工作的量化基准,评测限于内部消融;(3) MoE-28B 的专家路由细节(专家数、top-k、激活参数量)未披露;(4) 结论部分明确指出未来方向——需要进一步扩大模型和数据规模以提升生成质量、需要更高效的架构支持更高分辨率与更长序列、需要更先进的记忆机制支持更长期依赖和更复杂交互,暗示当前版本在这几方面仍有明显上限;(5) GitHub/HF 目前只放出 **5B 模型(基座+蒸馏,均为 Unreal 场景第一人称版本)**权重,28B 模型与”Unreal+真实数据混合”版本仓库注明”即将发布”,尚未开源。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2604.08995
- arXiv PDF:https://arxiv.org/pdf/2604.08995
- 技术报告 PDF(GitHub 镜像):https://github.com/SkyworkAI/Matrix-Game/blob/main/Matrix-Game-3/assets/pdf/report.pdf
- 项目主页:https://matrix-game-v3.github.io/
- GitHub(Matrix-Game-3 子目录):https://github.com/SkyworkAI/Matrix-Game/tree/main/Matrix-Game-3
- HuggingFace 权重:https://huggingface.co/Skywork/Matrix-Game-3.0
- 基座:https://huggingface.co/Wan-AI/Wan2.2-TI2V-5B
一手源存档(sources/)
- skywork-matrix-game-3—github-readme — GitHub Matrix-Game-3 子目录 README 快照
- skywork-matrix-game-3—hf-card — HuggingFace model card 快照(https://huggingface.co/Skywork/Matrix-Game-3.0)
- skywork-matrix-game-3—project-page — 项目主页正文快照(https://matrix-game-v3.github.io/)
- arXiv 全文 PDF(arXiv:2604.08995,原文 PDF,不入 git)