一句话定位
腾讯混元的交互式游戏视频世界模型:以 HunyuanVideo 文生视频基座为底,把键盘/鼠标离散动作统一映射到连续相机动作空间逐段驱动,用**混合历史条件(hybrid history condition)**自回归扩展实现分钟级长视频与历史场景保持;在 100+ AAA 游戏、100 万+ 段录像上训练,蒸馏后可 6.6 FPS 近实时交互。已开源推理代码与权重(含蒸馏版)。
背景与定位
世界模型的游戏路线以视频扩散为主流范式:给定单张参考图 + 结构化控制信号(键鼠 / 相机),生成时空连贯、可交互的游戏视频。论文用 Table 1 系统对标近期工作,并指出它们各有短板——GameNGen(DOOM 单场景过拟合)、GameGen-X(指令级控制、无场景记忆)、Oasis(Minecraft、无动态无记忆)、The Matrix、Genie 2、GameFactory、Matrix-Game(Minecraft、无场景记忆)。作者主张四点同时达成:场景可泛化 + 高动态 + 场景记忆 + 连续动作空间。
论文把现状短板归为四类:动态性不足、泛化性差、长时一致性差、效率低。三大方法贡献对应解法:
- 连续动作空间(Sec 4.1)——把离散键鼠统一到共享相机表征,支持速度/角度等细粒度、可插值的输入,区别于 GameFactory 等的离散动作或 CameraCtrl/MotionCtrl 的静态相机轨迹。
- 混合历史条件长视频扩展(Sec 4.2)——在扩散范式下自回归扩段,兼顾交互响应与历史保持,区别于 training-free 外推、streaming denoising、last-frame conditioning 与 Diffusion Forcing / test-time training 等。
- 蒸馏加速(Sec 4.3)——基于 Phased Consistency Model (PCM) + CFG 蒸馏,把 50 步降到 8 步做近实时。
基座为 MM-DiT 架构的 HunyuanVideo(arXiv 2412.03603);与 Matrix-Game 同用 HunyuanVideo 家族基座但走 AAA 开放世界 + 连续动作 + 历史记忆路线。相关世界模型可参 genie-3、Cosmos-Predict、Muse。
模型架构
范式:基于 MM-DiT 的图生视频 + flow matching 扩散,chunk 级自回归长视频扩展。基座 HunyuanVideo(文生视频 → 通过 latent mask 机制改造为图生视频 + 长视频扩展)。
- 文本/视觉编码器与 VAE(据权重清单):文本编码器 LLaVA-Llama-3-8B(MLLM)+ OpenAI CLIP-ViT-Large-patch14;视频潜空间用 3D Causal VAE(hyvae)。
- 连续动作空间 $\mathcal{A}$:定义在相机参数子空间内,动作 $\mathbf{a}=(\mathbf{d}{\text{trans}},\mathbf{d}{\text{rot}},\alpha,\beta)$。$\mathbf{d}{\text{trans}},\mathbf{d}{\text{rot}}$ 是 2-球面 $\mathbb{S}^2$ 上的平移/旋转单位方向向量;标量 $\alpha\in[0,v_{\max}]$、$\beta\in[0,\omega_{\max}]$ 分别控平移/旋转速度(逐帧相对速度与角度的微分模)。基于游戏与相机控制惯例,去掉 roll 自由度、加入速度控制。该表征可无损转换为标准相机轨迹参数与 Plücker embedding。W/A/S/D→平移,↑/←/↓/→→视角变化,Space 等亦并入。
- 动作编码器(轻量):与既有相机控制不同,不用级联残差块/Transformer,只用少量卷积层做空间下采样 + 池化层做时间下采样对齐 Plücker 与视频 latent;引入可学习缩放系数在 token 逐元素相加时自动优化相对权重,保证融合稳定。
- 动作注入:采用 token addition(token 逐元素相加)把相机位姿控制注入 MM-DiT;用一对轻量可学习 tokenizer 做视频 token 与动作 token 的高效融合。消融显示初始阶段直接相加即达 SOTA 控制精度(见评测)。
- 混合历史条件(核心):每个自回归步是一个 chunk latent 去噪过程,由 head latent 与交互信号引导。head condition 有三种形态:(i) 单帧图像 latent、(ii) 上一 clip 的末尾 latent、(iii) 更长的历史 latent 片段。head 与 chunk 在条件层与噪声层双重拼接;一个二值 mask 对 head latent 区域赋 1、chunk 段赋 0,精确控制去噪区域。噪声调度中 head 保持无噪 clean latent,经 flow matching 引导后续 noisy chunk 逐步去噪,产出下一段 clean video。论文实验表明历史信息越丰富,一致性/保真越高但交互响应越弱(因训练数据来自切段长视频、相邻段运动连续),故用混合训练平衡(见训练方法)。
数据
- 游戏场景数据(真实录像):策展 100+ AAA 游戏(Assassin’s Creed、Red Dead Redemption、Cyberpunk 2077 等),四阶段处理管线:
- 场景/动作双层切分:用 PySceneDetect 把 2–3 小时录像切成 6 秒连贯片段(100 万+ 片段,1080p);用 RAFT 光流梯度检测动作边界(如快速瞄准)做精确对齐。
- 数据过滤:质量评估模型剔除低保真片段;OpenCV 亮度过滤去暗场;VLM(Qwen2-VL) 梯度检测做多视角综合过滤。
- 交互标注:用 Monst3R 重建 6-DoF 相机轨迹(平移/旋转),逐帧标注位置/朝向。
- 结构化字幕:游戏专用 VLM 生成分层字幕——30 字符简述 + 100+ 字符详述,训练时随机采样。
- 合成数据(渲染):从策展 3D 资产渲染约 3,000 段高质量运动序列,系统采样多起始位、多轨迹(平移/旋转/复合)并以不同速度重渲染,为复杂相机运动建立几何先验、提升运动预测精度与视角切换连贯性。
- 分布均衡策略:针对相机轨迹的前向运动偏置——① 起止向量分层采样以均衡 3D 空间方向;② 时间反演增强将后向运动覆盖翻倍;③ 后期用均匀分布的渲染数据微调。
- 混合比例:消融表以 Render:Live = 1:5 为最终配比(渲染:真实录像)。混合历史条件的采样比例(见训练):单历史 clip 0.7、多历史 clip 0.05、单帧 0.25。
训练方法
- 目标:flow matching 扩散去噪;长视频扩展用混合历史条件(三种 head condition 混合训练,联合优化交互能力与生成一致性)。
- 两阶段全参训练(在 HunyuanVideo 基座上):
- Phase 1:30k 迭代,lr $3\times10^{-5}$,用全部真实 + 合成数据(原始比例)。
- Phase 2:额外 20k 迭代,lr 降到 $1\times10^{-5}$,引入 Sec 3 的数据增强以均衡动作分布、提升质量与交互性能。
- batch size 48;系统 25 fps,每个 video chunk = 33 帧 clip @ 720p。
- 混合历史条件比例:0.7 单历史 clip / 0.05 多历史 clip / 0.25 单帧——把「初始帧生成」与「视频扩展」两任务统一进一个模型,无需改架构即可无缝切换生成模式。
- 蒸馏加速:采用 Phased Consistency Model (PCM),把原扩散过程 + CFG 蒸馏成 8 步一致性模型;再加 Classifier-Free Guidance Distillation,用蒸馏目标 $L_{cfg}=\mathbb{E}{w,t}\lVert\hat{u}\theta(z_t,t,w,T_s)-u_\theta^s(z_t,t,w,T_s)\rVert_2^2$ 让学生模型直接产出带引导输出、免外部引导。蒸馏实现 10–20× 推理加速,单动作延迟降到 <5s,最终达 6.6 FPS 近实时。
Infra(训练 / 推理工程)
- 训练:192× NVIDIA H20 GPU,全参训练,batch size 48,两阶段共 50k 迭代(30k + 20k)。GPU-hours 未披露;并行策略与精度未在论文披露。
- 推理(据 GitHub README):测试于 8× H20/H800 GPU;最低 24GB 显存(704×1216 可跑但极慢),推荐 80GB。默认生成分辨率 704×1216,
cfg-scale 2.0、infer-steps 50(蒸馏版cfg-scale 1.0、infer-steps 8);一个动作对应 33 帧、25 FPS,推理时间随动作序列长度线性增长。支持 FP8 优化与 SageAttention 加速、单卡 CPU offload 低显存模式、多卡 sequence parallel。 - 近实时指标:蒸馏 + PCM 后 6.6 FPS、单动作延迟 <5s。
评测 benchmark
评测集:150 张多样图 + 12 种动作信号(游戏场景、风格化艺术、AIGC),源自公开库。指标:FVD(真实度)、Image Quality、Dynamic Average(改自 VBench 的连续光流值)、Aesthetic、Temporal Consistency、RPE trans / RPE rot(Sim3 Umeyama 对齐后的相对位姿误差,评交互控制)、Infer Speed (FPS)。基线:Matrix-Game(开源 SOTA 游戏交互模型)+ 三个相机控制工作 CameraCtrl、MotionCtrl、WanX-Cam(Wan VideoX-Fun 实现)。
Table 2 主结果(↑高好 / ↓低好):
| Model | FVD↓ | ImgQ↑ | Dyn.Avg↑ | Aesth↑ | Temp.Cons↑ | RPE trans↓ | RPE rot↓ | FPS↑ |
|---|---|---|---|---|---|---|---|---|
| CameraCtrl | 1580.9 | 0.66 | 7.2 | 0.64 | 0.92 | 0.13 | 0.25 | 1.75 |
| MotionCtrl | 1902.0 | 0.68 | 7.8 | 0.48 | 0.94 | 0.17 | 0.32 | 0.67 |
| WanX-Cam | 1677.6 | 0.70 | 17.8 | 0.67 | 0.92 | 0.16 | 0.36 | 0.13 |
| Matrix-Game | 2260.7 | 0.72 | 31.7 | 0.65 | 0.94 | 0.18 | 0.35 | 0.06 |
| Ours | 1554.2 | 0.69 | 67.2 | 0.67 | 0.95 | 0.08 | 0.20 | 0.25 |
| Ours + PCM | 1883.3 | 0.67 | 43.8 | 0.65 | 0.93 | 0.08 | 0.20 | 6.6 |
要点:非蒸馏版在 FVD、Dynamic Average、Aesthetic、Temporal Consistency、RPE trans、RPE rot 上全面最优;相对 Matrix-Game 动态性大幅领先(67.2 vs 31.7),跨域测试交互误差降低 55%(RPE trans 0.08 vs 0.18)。蒸馏 + PCM 版把 FPS 从 0.25 拉到 6.6,代价是动态/视觉质量略降。
Table 3 用户研究(30 名评估者,1–5 排名分,越高越好):Ours 在 Video Quality 4.42、Temporal Consistency 4.44、Motion Smooth 4.53、Action Accuracy 4.61、Dynamic 4.54,各维均居首(次优 MotionCtrl ~3.2)。
Table 4 消融(FVD↓ / DA↑ / Aesthetic↑ / RPE trans↓ / RPE rot↓):
| 设置 | FVD | DA | Aesth | RPE t | RPE r |
|---|---|---|---|---|---|
| (a) 仅合成数据 | 2550.7 | 34.6 | 0.56 | 0.07 | 0.17 |
| (b) 仅真实录像 | 1937.7 | 77.2 | 0.60 | 0.16 | 0.27 |
| (c) Token Concat. | 2236.4 | 59.7 | 0.54 | 0.13 | 0.29 |
| (d) Channel-wise Concat. | 1725.5 | 63.2 | 0.49 | 0.11 | 0.25 |
| (e) Image Condition | 1655.3 | 47.6 | 0.58 | 0.07 | 0.22 |
| (f) Clip Condition | 1743.5 | 55.3 | 0.57 | 0.16 | 0.30 |
| (g) Ours (Render:Live=1:5) | 1554.2 | 67.2 | 0.67 | 0.08 | 0.20 |
- 数据分布:仅合成数据→控制精度高(RPE trans 0.07)但动态崩(DA 34.6);仅真实录像→动态高(DA 77.2)但控制差(RPE trans 0.16);1:5 混合取得均衡。
- 动作注入:Token Addition(本文,即 g)优于 Token Concat.(c)与 Channel-wise Concat.(d),且计算开销更省。
- 历史条件:仅单帧(Image Condition, e)控制准但多动作后质量崩;仅历史 clip(Clip Condition, f)历史保持好但控制精度退化(RPE trans 0.16);**混合历史条件(g)**同时拿到交互、长时一致与画质。
论文另附分钟级长视频(Fig 8)、第三人称视角(Fig 9)、真实世界泛化(Fig 10)的定性结果。
创新点与影响
- 统一连续动作空间:把离散键鼠信号统一为共享连续相机表征(方向 + 速度、去 roll),支持细粒度可插值控制并可转 Plücker embedding——比离散动作或静态相机轨迹更贴近玩家操作习惯。
- 混合历史条件训练:以「head latent(单帧/末帧/长片段)+ 二值 mask + 双重拼接 + flow matching」的 chunk 级自回归,在扩散范式下同时解决 training-free 外推的场景崩塌与纯历史条件的控制退化,实现分钟级长视频 + 历史场景保持,并把初始帧生成与视频扩展统一进单模型。
- 蒸馏近实时:PCM 8 步 + CFG 蒸馏,10–20× 加速、单动作 <5s、6.6 FPS,向可玩交互靠拢。
- 数据工程:100+ AAA 游戏、100 万+ 6 秒片段的策展管线(PySceneDetect/RAFT/Monst3R 6-DoF/VLM 分层字幕)+ 合成渲染补充 + 分布均衡,为相机控制视频生成建立新数据标准。
- 开源影响:开放推理代码 + 权重(标准版 + 蒸馏版)+ Gradio demo,成为 AAA 开放世界交互视频生成的可复现基线。
作者自述局限:当前动作空间主要面向开放世界探索,缺少射击、投掷、爆炸等游戏特定动作;未来将扩充更多样玩法元素,并朝更物理、更可玩的下一代游戏交互模型演进。
原始链接
- 论文(arXiv abs):https://arxiv.org/abs/2506.17201
- 论文 PDF:https://arxiv.org/pdf/2506.17201
- 项目主页:https://hunyuan-gamecraft.github.io/
- GitHub:https://github.com/Tencent-Hunyuan/Hunyuan-GameCraft-1.0
- HuggingFace 权重:https://huggingface.co/tencent/Hunyuan-GameCraft-1.0
一手源存档(sources/)
- tencent-hunyuan-gamecraft—github-readme — GitHub README(推理命令、硬件需求、FP8/SageAttention、蒸馏版)
- tencent-hunyuan-gamecraft—weights-readme — 权重清单(LLaVA-Llama-3-8B 文本编码器 + CLIP-ViT-L/14 + hyvae 3D VAE)
- tencent-hunyuan-gamecraft—project-page — 项目主页文本(摘要、方法、定性对比)
- arXiv 原文 PDF(不入 git):https://arxiv.org/pdf/2506.17201