一句话定位
Yan 是腾讯提出的交互式视频生成”全流程”框架,用同一份 4 亿帧现代 3D 游戏数据训练三个模块——Yan-Sim(1080P/60FPS 实时物理模拟)、Yan-Gen(文本/图像驱动、可泛化到开放域的多模态生成)、Yan-Edit(结构/风格解耦的实时文本编辑)——覆盖模拟、生成、编辑三段任务,而非只做其中一项。
背景与定位
交互式生成式视频(Interactive Generative Video, IGV)此前分裂为两条互不相交的路线:一是游戏专用神经引擎,如 GameNGen(Doom,20FPS)、PlayGen(Doom/Mario,20FPS,128p)、MineWorld,普遍受限于低分辨率、低帧率、且只能复现单一经典游戏;二是开放域可控生成,如 The-Matrix、GameFactory、Matrix-Game,虽然有一定跨场景泛化能力,但通常是分块控制(chunked control)而非严格逐帧交互,缺乏精细物理,分辨率/帧率也有限。同时,GameGen-X 一类工作提供了更丰富的开放世界视频数据,但不支持逐帧交互;DeepMind 的 Genie 2 / Genie 3 系列代表了另一条”真实世界世界模型”路线,同样未能同时兼顾开放域可提示控制与逐帧实时响应。此外,已有的交互生成工作几乎都把生成内容视为固定产物,不支持交互过程中的动态编辑。
Yan 的定位是同时解决三个未解决的核心挑战:(1) 高保真、实时的视觉体验;(2) 可泛化、可提示控制的生成;(3) 交互过程中的动态编辑与即时内容定制。选择腾讯自研现代 3D 游戏《元梦之星》(Yuan Meng Star)作为统一测试床/数据来源,因其场景复杂多样、动作空间丰富,三个模块共享同一套采集数据训练。
模型架构
Yan-Sim(AAA 级实时模拟)
- 基座:Stable Diffusion (SD) 架构改造为自回归、逐帧因果推理的扩散模型。
- VAE:在编码器上增加两个单层下采样 block,把空间压缩比从 8 提升到 32;相邻帧沿通道维拼接,实现时间压缩比 2;因此整体压缩率从
1×8×8提升到2×32×32,隐空间通道数 C 扩到 16。解码器对应做轻量化:每个上采样 block 削减一层,新增单层上采样 block + pixel-shuffle 层维持与编码器的对齐(只有解码器延迟计入推理时延,因此重点做解码器轻量化)。 - 扩散模型含三类 attention block:空间注意力(同帧内不同空间位置);动作交叉注意力(动作信号经 MLP 生成每帧 768 维 token,仅对本帧生效);1D 时间注意力(因果,帧
F_t只能看到F_{<=t}),支持严格逐帧自回归预测。 - 训练分辨率 1080P 对应输入
H=1024, W=1792(两帧沿通道拼接后x∈R^{H×W×6}),VAE 编码为z∈R^{h×w×16}。
Yan-Gen(多模态生成)
- 基座:预训练 Wan 视频扩散模型(cross-attention 注入文本/图像条件),微调所有线性层(LoRA)适配交互视频数据分布,训练文生视频 / 图生视频。
- 条件编码:文本用 umt5-xxl(512 token 长文本 embedding),图像用 ViT-H-14(257 token 图像 embedding),动作用独立的动作编码器经 cross-attention 逐 DiT block 注入,采用与 Yan-Sim 相同的因果注意力掩码以保证动作因果性与逐帧精确控制。
- 训练目标为 Rectified Flow 速度预测损失
L_fm = E‖u(x_t,c_txt,c_img,c_act,t;θ) − v_t‖²;classifier-free guidance 对文本/动作条件均可用(推理时用u_output = u(x_t,∅,c_img,∅,t;θ) + g_uncond·(u(x_t,c_txt,c_img,c_act,t;θ) − u(x_t,∅,c_img,∅,t;θ)))。 - 自回归化:对预训练好的 Yan-Gen 做多步 flow matching 采样得到 ODE 轨迹,取 4 个噪声等级子集
{x_T, x_t1, x_t2, x_0}训练 4 步生成器;自注意力改为 block causal attention,配合 diffusion forcing 范式(每帧随机取 4 个预定义噪声等级之一),用 MSE 回归损失对齐 clean latent。 - 少步蒸馏:用 distribution matching distillation(DMD / DMD2)+ Self-forcing 自回归式训练范式,把多步因果模型蒸馏为少步实时生成器。
Yan-Edit(多粒度编辑)
- 结构:把”交互力学模拟”与”视觉渲染”显式解耦,中间态用深度图连接。
- 交互力学模拟器:以 Yan-Sim 为基座,输入初始深度图,在用户逐帧动作信号 + 结构文本 prompt 条件下自回归生成后续深度帧;结构 prompt 通过在每个 attention block 的动作交叉注意力之后插入一个文本交叉注意力层注入。
- 视觉渲染器:以 Yan-Gen 为基座,通过 ControlNet(结构仿照 VACE:从 Yan-Gen 原始 DiT block 复制出若干 block,其输出加回原始 DiT block)把深度图注入 Yan-Gen,用风格文本 prompt 控制颜色/材质渲染。
数据
- 规模:自建数据采集流水线在《元梦之星》中采集超过 4 亿帧(400M frames) 交互视频数据,覆盖 90+ 种风格场景(草原、城堡、雨林、峡谷等)。
- 采集方式:一个场景探索 agent 按
{o_t, a_t}(图像状态、动作)逐帧交互;交互策略 = 随机模型(保证广度)+ PPO 强化学习模型(保证探索深度)。通过精确时间戳对齐动作与截图,实现高精度图像-动作对(动作记录后 1–2 帧图像内即体现)。 - 分辨率/帧率:采集时游戏引擎设为 1920×1080(用 NVIDIA RTX 4060 渲染单个引擎实例);动作以 10Hz 发送,截图以 30Hz 捕获,通过”动作插值”(相邻两个有效动作帧之间的帧沿用前一个有效动作)合成 30FPS 交互视频。
- 动作空间:除基础移动/跳跃外,还包含俯冲、左右视角旋转等技能,动作空间维度为 8(Table 1)。
- 三级数据过滤:视觉过滤器(逐段计算平均颜色方差
σ̄²,低于阈值 τ₁ 判定渲染失败/被遮挡而丢弃);异常过滤器(帧数超过阈值 τ₂ 判定卡顿异常);规则过滤器(剔除”准备阶段”等游戏规则不一致的数据)。 - 数据均衡:额外记录引擎侧属性(xyz 坐标、存活/碰撞状态等),仿照 PlayGen 做均衡采样,避免模型对特定场景/位置过拟合。
- 与其他交互数据集对比(论文 Table 1):
| 数据集 | 分辨率 | FPS | 逐帧交互 | 动作维度 | 规模 |
|---|---|---|---|---|---|
| The Matrix | 720P | 60 | ✓ | 5 | 792M |
| PlayGen | 128P | 30 | ✓ | 5 | 250M |
| GameGenX | 720P-4K | 1-24 | ✗ | ✗ | 192M |
| GameFactory | 360P | 16 | ✓ | 9 | 4M |
| Matrix-Game | 720P | 16 | ✓ | 7 | 50M |
| Ours (Yan) | 1080P | 30 | ✓ | 8 | 400M |
- 标注数据:Qwen2.5-VL 做分层标注(一段约 1 分钟的环境穿越视频生成 1 条全局 caption;每 3 秒本地片段生成 1 条局部 caption),共标注 **9800 万帧(98M frames)**用于 Yan-Gen 训练。全局 caption 固定描述世界拓扑/视觉主题/基础光照天气以防长时漂移;局部 caption 描述局部场景、可交互物体状态变化、关键事件(死亡/任务完成)。
- Yan-Edit 结构标注:把交互视频切成 81 帧时序块,用 Qwen2.5-VL 做三维结构分解(动态物体 / 墙体结构 / 环境平台),并用 DepthFM 提取深度图专门训练深度 VAE。蒸馏视觉渲染器所用的风格 prompt 分两部分:域内风格(从 5.2.1 的 caption 中抽取风格描述)+ 域外风格(GPT-4 生成,提升开放域风格渲染能力)。
- 全部训练数据来自游戏引擎内采集的仿真环境;论文未涉及额外真实世界视频联合训练(Yan-Gen 的开放域生成能力来自预训练 Wan 模型自带先验,而非额外真实数据)。
训练方法
- Yan-Sim:两阶段——先训练 VAE(MSE + LPIPS 损失),再用 DDPM 范式训练扩散模型,采用 Diffusion Forcing 策略(clip 内每帧独立加噪,首帧作为无噪声条件帧不加噪;分阶段噪声调度模拟推理时噪声沿时间轴递增的分布)。
- Yan-Gen:三阶段——① LoRA 微调 Wan 全部线性层以适配交互视频分布(文/图生视频,条件为拼接的全局+局部 caption,10% 概率仅用全局 caption 增强弱条件下的合理生成);② 冻结其余参数,单独训练动作交叉注意力模块(动作相关描述从 caption 中剔除,10% 概率替换为 null action 以支持 CFG);③ 自回归 post-training(4 步 ODE 轨迹蒸馏 + block causal attention + diffusion forcing)与 self-forcing post-training(DMD/DMD2 蒸馏为少步因果生成器)。
- Yan-Edit:先训练交互力学模拟器(在 Yan-Sim 上加结构文本交叉注意力,先联合训练动作+文本交叉注意力层加速收敛,再冻结文本注意力单独微调动作注意力以提升一致性/保真度),再训练视觉渲染器——先训练非因果、深度图条件的视频生成模型,再蒸馏为少步因果模型;作者发现直接把(post-training 前的)Yan-Gen 模型与开源 VACE 的 ControlNet 权重组合即可获得多样且时序一致的风格渲染,因此只需对这个组合模型做一次蒸馏。蒸馏用深度视频由交互力学模拟器以随机初始深度/随机动作/随机结构 prompt 生成,每段 81 帧。
- 推理时用 KV cache 存储每一帧生成结果,保证长序列时序一致性;三模块推理策略分别沿用 Yan-Sim / Yan-Gen 各自的方案。
Infra(训练 / 推理工程)
- Yan-Sim 推理优化:DDIM 采样降到 4 步;提出 shift window denoising inference(同一推理步内处理一个跨帧噪声窗口,早帧更”干净”、晚帧更”噪”,配合 KV cache 避免重复计算);对 UNet 做结构化剪枝,并对全部 GEMM 算子做 FP8 权重+激活量化,相对 BF16 提速 1.5×–2×,整体贡献 1.18× 推理提速(画质损失很小);整条推理流水线捕获为单个 CUDA graph 消除 kernel-launch 开销,配合 Triton 自定义 kernel 优化线程块几何与访存;启用
torch.compile(max-autotune 模式)再带来 1.15× 加速;扩散模型与 VAE 部署在不同 GPU 上,用队列传递隐变量以避免串行推理的延迟。 - Yan-Sim 端到端指标(论文 Table 2):1080P、60FPS、单帧延迟 0.07s(对比 The Matrix 720p/16fps/无低延迟标注;PlayGen 128p/20fps/0.05s;Genie 2 360p/非实时;GameFactory 640p/非实时;Matrix-Game 720p/非实时;Genie 3 720p/24fps/低延迟)。Model Architecture 一节另给出 Yan-Sim 整体速度区间为 50–60 FPS。
- Yan-Gen 推理:蒸馏后的少步模型单张 NVIDIA H20 上可达 12–17 FPS;用统一序列并行(unified sequence parallel)推理,4 张 NVIDIA H20 可扩展到 30 FPS。
- 训练侧硬件:论文未披露 Yan-Sim/Yan-Gen/Yan-Edit 训练所用 GPU 型号、卡数、GPU-hours、并行策略与精度(仅在 Limitation 中提到”Yan 的高保真实时性能目前依赖强大的 GPU(A100)推理”,未说明具体用于哪个模块、卡数或训练配置)。数据采集阶段渲染单个游戏引擎实例使用 NVIDIA RTX 4060(非训练/推理硬件)。
评测 benchmark
- 论文对 Yan-Sim / Yan-Gen / Yan-Edit 三模块均只做定性评测(视觉质量、动作一致性、物理力学准确性、长视频生成能力,均以图示展示,如水滑梯的惯性、电网触碰后无法移动、蹦床更高的跳跃),未报告 FVD/FID/PSNR/用户研究等量化视频质量指标,也没有与 GameNGen/Oasis 等基线做同基准量化对比(论文明确指出这些方法本身不支持开放域场景,缺乏可比较的统一评测协议)。
- 唯二的量化对比是两张”规格对比表”:Table 1(数据集规模/分辨率/FPS/动作维度,见”数据”一节)与 Table 2(世界模拟系统的分辨率/实时性/延迟,见”Infra”一节),二者均为系统属性对比,非生成质量指标。
- Yan-Gen 的评测覆盖 text-to-interaction、text-guided expansion(如迪斯科场景连续过渡为古典乐手场景)、image-to-interaction(跨城市废墟/科技荒野等开放场景)、cross-domain fusion(域外参考图 + 域内角色描述融合生成),均为定性展示。
- Yan-Edit 的评测展示结构编辑(如把”旋转平台”替换为”木门”、在障碍墙处生成”风扇”/“蹦床”化解阻挡)与风格编辑(同一段交互视频在第 81/162 帧切换”竹与水彩”→“紫色玻璃与青色光”→“雪与柔和粉彩”三种风格),同样是定性图示,无量化编辑保真度指标。
创新点与影响
- 首次把”实时模拟""可泛化生成""交互式编辑”三种此前分裂的能力整合进同一个框架,且共享一套统一采集的现代 3D 游戏数据集训练。
- Yan-Sim 是目前唯一同时做到 1080P + 60FPS + 低延迟(0.07s) 的交互式世界模拟系统(对比 Genie 3 的 720p/24fps、PlayGen 的 128p/20fps),核心工程手段是 32×32×2 高压缩比 VAE + shift window denoising + FP8 量化 + CUDA graph。
- Yan-Edit 提出用深度图解耦”交互力学”与”视觉渲染”的编辑范式:力学模拟器学结构相关的物理规律,渲染器负责开放域风格化,从而支持交互过程中任意时刻的结构/风格双重实时编辑,填补了此前交互生成工作”内容生成后不可再编辑”的空白。
- 论文自陈局限:(1) 长时长视频的空间/时间一致性仍待提升;(2) 高保真实时性能依赖强大 GPU(A100),限制了资源有限用户的可及性;(3) 动作空间与交互复杂度仍受限于底层游戏环境,可能限制向真实世界应用的可扩展性;(4) 编辑模块目前仅支持文本描述驱动,交互方式的直观性和控制粒度有待增强。
原始链接
- arXiv: https://arxiv.org/abs/2508.08601
- PDF: https://arxiv.org/pdf/2508.08601
- 项目页: https://greatx3.github.io/Yan/
- HF 模型:官网标注 “Coming Soon”(截至 2026-07-16 尚未发布)
一手源存档(sources/)
- tencent-yan—project-page.md
- arXiv 原文 HTML(https://arxiv.org/html/2508.08601v1,全文含公式/图表说明),不入 git,仅引用 arXiv URL