一句话定位

腾讯混元的交互式游戏视频世界模型:以 HunyuanVideo 文生视频基座为底,把键盘/鼠标离散动作统一映射到连续相机动作空间逐段驱动,用**混合历史条件(hybrid history condition)**自回归扩展实现分钟级长视频与历史场景保持;在 100+ AAA 游戏、100 万+ 段录像上训练,蒸馏后可 6.6 FPS 近实时交互。已开源推理代码与权重(含蒸馏版)。

背景与定位

世界模型的游戏路线以视频扩散为主流范式:给定单张参考图 + 结构化控制信号(键鼠 / 相机),生成时空连贯、可交互的游戏视频。论文用 Table 1 系统对标近期工作,并指出它们各有短板——GameNGen(DOOM 单场景过拟合)、GameGen-X(指令级控制、无场景记忆)、Oasis(Minecraft、无动态无记忆)、The Matrix、Genie 2、GameFactoryMatrix-Game(Minecraft、无场景记忆)。作者主张四点同时达成:场景可泛化 + 高动态 + 场景记忆 + 连续动作空间

论文把现状短板归为四类:动态性不足、泛化性差、长时一致性差、效率低。三大方法贡献对应解法:

  • 连续动作空间(Sec 4.1)——把离散键鼠统一到共享相机表征,支持速度/角度等细粒度、可插值的输入,区别于 GameFactory 等的离散动作或 CameraCtrl/MotionCtrl 的静态相机轨迹。
  • 混合历史条件长视频扩展(Sec 4.2)——在扩散范式下自回归扩段,兼顾交互响应与历史保持,区别于 training-free 外推、streaming denoising、last-frame conditioning 与 Diffusion Forcing / test-time training 等。
  • 蒸馏加速(Sec 4.3)——基于 Phased Consistency Model (PCM) + CFG 蒸馏,把 50 步降到 8 步做近实时。

基座为 MM-DiT 架构的 HunyuanVideo(arXiv 2412.03603);与 Matrix-Game 同用 HunyuanVideo 家族基座但走 AAA 开放世界 + 连续动作 + 历史记忆路线。相关世界模型可参 genie-3Cosmos-PredictMuse

模型架构

范式:基于 MM-DiT 的图生视频 + flow matching 扩散,chunk 级自回归长视频扩展。基座 HunyuanVideo(文生视频 → 通过 latent mask 机制改造为图生视频 + 长视频扩展)。

  • 文本/视觉编码器与 VAE(据权重清单):文本编码器 LLaVA-Llama-3-8B(MLLM)+ OpenAI CLIP-ViT-Large-patch14;视频潜空间用 3D Causal VAE(hyvae)
  • 连续动作空间 $\mathcal{A}$:定义在相机参数子空间内,动作 $\mathbf{a}=(\mathbf{d}{\text{trans}},\mathbf{d}{\text{rot}},\alpha,\beta)$。$\mathbf{d}{\text{trans}},\mathbf{d}{\text{rot}}$ 是 2-球面 $\mathbb{S}^2$ 上的平移/旋转单位方向向量;标量 $\alpha\in[0,v_{\max}]$、$\beta\in[0,\omega_{\max}]$ 分别控平移/旋转速度(逐帧相对速度与角度的微分模)。基于游戏与相机控制惯例,去掉 roll 自由度、加入速度控制。该表征可无损转换为标准相机轨迹参数与 Plücker embedding。W/A/S/D→平移,↑/←/↓/→→视角变化,Space 等亦并入。
  • 动作编码器(轻量):与既有相机控制不同,不用级联残差块/Transformer,只用少量卷积层做空间下采样 + 池化层做时间下采样对齐 Plücker 与视频 latent;引入可学习缩放系数在 token 逐元素相加时自动优化相对权重,保证融合稳定。
  • 动作注入:采用 token addition(token 逐元素相加)把相机位姿控制注入 MM-DiT;用一对轻量可学习 tokenizer 做视频 token 与动作 token 的高效融合。消融显示初始阶段直接相加即达 SOTA 控制精度(见评测)。
  • 混合历史条件(核心):每个自回归步是一个 chunk latent 去噪过程,由 head latent 与交互信号引导。head condition 有三种形态:(i) 单帧图像 latent、(ii) 上一 clip 的末尾 latent、(iii) 更长的历史 latent 片段。head 与 chunk 在条件层与噪声层双重拼接;一个二值 mask 对 head latent 区域赋 1、chunk 段赋 0,精确控制去噪区域。噪声调度中 head 保持无噪 clean latent,经 flow matching 引导后续 noisy chunk 逐步去噪,产出下一段 clean video。论文实验表明历史信息越丰富,一致性/保真越高但交互响应越弱(因训练数据来自切段长视频、相邻段运动连续),故用混合训练平衡(见训练方法)。

数据

  • 游戏场景数据(真实录像):策展 100+ AAA 游戏(Assassin’s Creed、Red Dead Redemption、Cyberpunk 2077 等),四阶段处理管线:
    • 场景/动作双层切分:用 PySceneDetect 把 2–3 小时录像切成 6 秒连贯片段(100 万+ 片段,1080p);用 RAFT 光流梯度检测动作边界(如快速瞄准)做精确对齐。
    • 数据过滤:质量评估模型剔除低保真片段;OpenCV 亮度过滤去暗场;VLM(Qwen2-VL) 梯度检测做多视角综合过滤。
    • 交互标注:用 Monst3R 重建 6-DoF 相机轨迹(平移/旋转),逐帧标注位置/朝向。
    • 结构化字幕:游戏专用 VLM 生成分层字幕——30 字符简述 + 100+ 字符详述,训练时随机采样。
  • 合成数据(渲染):从策展 3D 资产渲染约 3,000 段高质量运动序列,系统采样多起始位、多轨迹(平移/旋转/复合)并以不同速度重渲染,为复杂相机运动建立几何先验、提升运动预测精度与视角切换连贯性。
  • 分布均衡策略:针对相机轨迹的前向运动偏置——① 起止向量分层采样以均衡 3D 空间方向;② 时间反演增强将后向运动覆盖翻倍;③ 后期用均匀分布的渲染数据微调。
  • 混合比例:消融表以 Render:Live = 1:5 为最终配比(渲染:真实录像)。混合历史条件的采样比例(见训练):单历史 clip 0.7、多历史 clip 0.05、单帧 0.25。

训练方法

  • 目标:flow matching 扩散去噪;长视频扩展用混合历史条件(三种 head condition 混合训练,联合优化交互能力与生成一致性)。
  • 两阶段全参训练(在 HunyuanVideo 基座上):
    • Phase 1:30k 迭代,lr $3\times10^{-5}$,用全部真实 + 合成数据(原始比例)。
    • Phase 2:额外 20k 迭代,lr 降到 $1\times10^{-5}$,引入 Sec 3 的数据增强以均衡动作分布、提升质量与交互性能。
    • batch size 48;系统 25 fps,每个 video chunk = 33 帧 clip @ 720p
  • 混合历史条件比例:0.7 单历史 clip / 0.05 多历史 clip / 0.25 单帧——把「初始帧生成」与「视频扩展」两任务统一进一个模型,无需改架构即可无缝切换生成模式。
  • 蒸馏加速:采用 Phased Consistency Model (PCM),把原扩散过程 + CFG 蒸馏成 8 步一致性模型;再加 Classifier-Free Guidance Distillation,用蒸馏目标 $L_{cfg}=\mathbb{E}{w,t}\lVert\hat{u}\theta(z_t,t,w,T_s)-u_\theta^s(z_t,t,w,T_s)\rVert_2^2$ 让学生模型直接产出带引导输出、免外部引导。蒸馏实现 10–20× 推理加速,单动作延迟降到 <5s,最终达 6.6 FPS 近实时。

Infra(训练 / 推理工程)

  • 训练192× NVIDIA H20 GPU,全参训练,batch size 48,两阶段共 50k 迭代(30k + 20k)。GPU-hours 未披露;并行策略与精度未在论文披露。
  • 推理(据 GitHub README):测试于 8× H20/H800 GPU;最低 24GB 显存(704×1216 可跑但极慢),推荐 80GB。默认生成分辨率 704×1216cfg-scale 2.0infer-steps 50(蒸馏版 cfg-scale 1.0infer-steps 8);一个动作对应 33 帧、25 FPS,推理时间随动作序列长度线性增长。支持 FP8 优化SageAttention 加速、单卡 CPU offload 低显存模式、多卡 sequence parallel。
  • 近实时指标:蒸馏 + PCM 后 6.6 FPS、单动作延迟 <5s。

评测 benchmark

评测集:150 张多样图 + 12 种动作信号(游戏场景、风格化艺术、AIGC),源自公开库。指标:FVD(真实度)、Image Quality、Dynamic Average(改自 VBench 的连续光流值)、Aesthetic、Temporal Consistency、RPE trans / RPE rot(Sim3 Umeyama 对齐后的相对位姿误差,评交互控制)、Infer Speed (FPS)。基线:Matrix-Game(开源 SOTA 游戏交互模型)+ 三个相机控制工作 CameraCtrl、MotionCtrl、WanX-Cam(Wan VideoX-Fun 实现)。

Table 2 主结果(↑高好 / ↓低好):

ModelFVD↓ImgQ↑Dyn.Avg↑Aesth↑Temp.Cons↑RPE trans↓RPE rot↓FPS↑
CameraCtrl1580.90.667.20.640.920.130.251.75
MotionCtrl1902.00.687.80.480.940.170.320.67
WanX-Cam1677.60.7017.80.670.920.160.360.13
Matrix-Game2260.70.7231.70.650.940.180.350.06
Ours1554.20.6967.20.670.950.080.200.25
Ours + PCM1883.30.6743.80.650.930.080.206.6

要点:非蒸馏版在 FVD、Dynamic Average、Aesthetic、Temporal Consistency、RPE trans、RPE rot 上全面最优;相对 Matrix-Game 动态性大幅领先(67.2 vs 31.7),跨域测试交互误差降低 55%(RPE trans 0.08 vs 0.18)。蒸馏 + PCM 版把 FPS 从 0.25 拉到 6.6,代价是动态/视觉质量略降。

Table 3 用户研究(30 名评估者,1–5 排名分,越高越好):Ours 在 Video Quality 4.42、Temporal Consistency 4.44、Motion Smooth 4.53、Action Accuracy 4.61、Dynamic 4.54,各维均居首(次优 MotionCtrl ~3.2)。

Table 4 消融(FVD↓ / DA↑ / Aesthetic↑ / RPE trans↓ / RPE rot↓):

设置FVDDAAesthRPE tRPE r
(a) 仅合成数据2550.734.60.560.070.17
(b) 仅真实录像1937.777.20.600.160.27
(c) Token Concat.2236.459.70.540.130.29
(d) Channel-wise Concat.1725.563.20.490.110.25
(e) Image Condition1655.347.60.580.070.22
(f) Clip Condition1743.555.30.570.160.30
(g) Ours (Render:Live=1:5)1554.267.20.670.080.20
  • 数据分布:仅合成数据→控制精度高(RPE trans 0.07)但动态崩(DA 34.6);仅真实录像→动态高(DA 77.2)但控制差(RPE trans 0.16);1:5 混合取得均衡。
  • 动作注入:Token Addition(本文,即 g)优于 Token Concat.(c)与 Channel-wise Concat.(d),且计算开销更省。
  • 历史条件:仅单帧(Image Condition, e)控制准但多动作后质量崩;仅历史 clip(Clip Condition, f)历史保持好但控制精度退化(RPE trans 0.16);**混合历史条件(g)**同时拿到交互、长时一致与画质。

论文另附分钟级长视频(Fig 8)、第三人称视角(Fig 9)、真实世界泛化(Fig 10)的定性结果。

创新点与影响

  • 统一连续动作空间:把离散键鼠信号统一为共享连续相机表征(方向 + 速度、去 roll),支持细粒度可插值控制并可转 Plücker embedding——比离散动作或静态相机轨迹更贴近玩家操作习惯。
  • 混合历史条件训练:以「head latent(单帧/末帧/长片段)+ 二值 mask + 双重拼接 + flow matching」的 chunk 级自回归,在扩散范式下同时解决 training-free 外推的场景崩塌与纯历史条件的控制退化,实现分钟级长视频 + 历史场景保持,并把初始帧生成与视频扩展统一进单模型。
  • 蒸馏近实时:PCM 8 步 + CFG 蒸馏,10–20× 加速、单动作 <5s、6.6 FPS,向可玩交互靠拢。
  • 数据工程:100+ AAA 游戏、100 万+ 6 秒片段的策展管线(PySceneDetect/RAFT/Monst3R 6-DoF/VLM 分层字幕)+ 合成渲染补充 + 分布均衡,为相机控制视频生成建立新数据标准。
  • 开源影响:开放推理代码 + 权重(标准版 + 蒸馏版)+ Gradio demo,成为 AAA 开放世界交互视频生成的可复现基线。

作者自述局限:当前动作空间主要面向开放世界探索,缺少射击、投掷、爆炸等游戏特定动作;未来将扩充更多样玩法元素,并朝更物理、更可玩的下一代游戏交互模型演进。

原始链接

一手源存档(sources/)