一句话定位

上海 AI Lab / 复旦联合出品的开源交互式世界生成模型:以 SkyReels-V2-14B-540P 为基座,从一张输入图出发,用离散化的键盘动作(前进/后退/左右平移/转向/俯仰)逐段驱动生成第一人称城市漫游视频,配套 Masked Video Diffusion Transformer、训练无关的去伪影机制(AAM)与时间穿越 SDE 采样(TTS-SDE)、以及对抗蒸馏+缓存的加速方案;数据、代码、权重全部开源。

背景与定位

Yume 属于视频扩散驱动的可交互世界生成这一支(与 Matrix-GameWorldMem、Genie 系列同属一个范式:图像/视频扩散模型 + 动作条件 + 自回归 rollout),但目标场景不同——前述工作多聚焦游戏/Minecraft 这类合成环境,Yume 主打真实世界城市漫步场景的探索生成,训练数据来自真实 YouTube 步行/航拍视频而非游戏引擎渲染。

论文将自己定位为对现有相机控制方案的改进:以往方法(MotionCtrl、CameraCtrl、CameraCtrl II 等)依赖逐帧稠密的绝对相机位姿矩阵(c2w),需要额外可学习模块、标注精细且轨迹不够稳定直观;Yume 提出量化相机运动(Quantized Camera Motion, QCM)——把连续轨迹离散化成一组预定义的整体动作(前进/后退/左转/右转/上仰/下俯等),再把动作解析成文本条件注入预训练 I2V 基座模型(SkyReels-V2-14B-540P),不引入任何新可学习参数。

基座沿用 Wan 的时空 VAE + DiT 去噪架构;长视频生成的历史帧压缩策略直接借鉴 FramePack 的分级下采样设计。训练数据用的是 Sekai 数据集的高质量子集 Sekai-Real-HQ。项目后续(2025-12)已推出继任版本 Yume-1.5(arXiv 2512.22096,转向文本可控事件生成 + 线性注意力长上下文,5B 参数),本页只覆盖 2025-07 发布的 Yume 1.0(本报告版本)。

模型架构

  • 基座:沿用 SkyReels-V2-14B-540P(14B 参数 DiT)作为预训练 I2V 模型,架构与 Wan 一致——时空 VAE 编码器将输入视频压缩为 [1+T/4, H/8, W/8]、通道数 C=16 的潜表示;DiT backbone 含 3D 卷积 Patchify(kernel=(1,2,2))、CLIP 图像编码器 + umT5 文本编码器、交叉注意力融合视频 token 与图文 embedding。训练目标为 Rectified Flow(速度场回归 MSE)。
  • Masked Video Diffusion Transformer (MVDT):在 DiT 上引入 encoder / side-interpolator / decoder 三段式非对称结构。对噪声视频 token 施加随机掩码(掩码率 ρ=0.3),encoder 只处理保留 token 以降低计算;side-interpolator 将可学习潜 token 与编码特征拼接后自注意力,动态预测被掩码内容,再用门控融合 ẑ = (1-MASK)⊙z + MASK⊙z_I 与原始特征混合;decoder 用剩余 DiT block 处理插值后特征。训练阶段端到端优化,推理阶段直接处理完整特征(不做插值)。
  • I2V / V2V 生成:图像条件通过 Wan-VAE 编码为潜表示 z_c,配合二值掩码 M_c 与噪声潜 z_t 通道拼接后送入 DiT(新增零初始化投影层适配 2c+s 维通道);V2V 则只取条件视频末帧做 CLIP 编码,且以 30% 概率用静态图像(单帧沿时间维复制 16 次)代替真实条件视频训练,缓解模型过度依赖条件视频运动模式的问题。
  • 长视频生成(FramePack 式记忆):自回归生成时,历史帧按距当前时刻的远近做分级时空压缩(如 t-1t-2 帧用 (1,2,2),t-3t-6 帧用 (1,4,4),t-7~t-23 帧用 (1,8,8),……,初始帧固定 (1,2,2)),压缩比随距离增大逐级提高,从而在有限 token 预算下保留近期高分辨率细节与初始图像关键特征,实现理论上无限长的分段自回归 rollout。训练时以 0.3 概率用 33–400 帧历史预测后续 33 帧、以 0.7 概率用 400–800 帧历史预测后续 33 帧。
  • 采样器
    • 训练无关去伪影机制(AAM):受 NVIDIA DLSS 与 DDNM 启发,两阶段流程——第一遍标准去噪得到 z_orig,第二遍精炼时在前 K 步(如 K=5)用低通滤波器把 z_orig 的低频结构与当前潜的高频细节重组注入,抑制城市场景中的模糊纹理/闪烁/几何畸变。标准采样 50 步 + CFG 共 100 NFE;AAM 用 30 步无 CFG(第一遍)+ 30 步带 CFG(第二遍)共 90 NFE,NFE 降低 10% 且质量更好。AAM 在自回归长视频上因缺乏 V2V 基座而效果不佳(论文明言留待下一版本改进)。
    • TTS-SDE(Time Travel Sampling based on SDE):受 DDNM / RePaint / OSV 启发,在选定时间步先”时间穿越”前跳 l=5 步(每 s=5 步触发一次)得到更准确的速度场估计再回填当前步,并将 ODE 替换为 SDE 引入受控随机性,显著提升文本可控性(细节见论文 Algorithm 3)。
  • 相机运动控制:QCM 之外,额外计算三类运动速度指标并解析进文本条件——平移位移向量(Translational Motion)、方向变化角(Directional Change,三帧夹角)、旋转动态(Rotational Dynamics,相邻帧朝向角变化),训练时提供、推理时固定,防止生成速度忽快忽慢;最终文本条件 = 动作描述 + 速度描述 + 前缀场景描述(“This video depicts a city walk scene with a first-person view”)。
  • 加速(对抗蒸馏 + 缓存联合优化):把采样步数从 50 步蒸馏到 14 步;蒸馏用 GAN 判别器(沿用 OSV 的判别器设计,降低显存占用)区分真实样本与去噪估计 x̂₀,损失为扩散损失 + 对抗损失。缓存机制对 DiT 40 个 block 中通过 MSE 重要性打分(32 段视频、每段生成 40 条时序 MSE 曲线聚合成 40 个综合分数)挑出影响最小的 10 个 block 作为可缓存层,以 bfloat16 存储层间残差特征,按 1:l_c 比例跳步复用。

数据

  • 原始采集:从热门 YouTuber 手动收集高质量视频 URL,并用关键词(walk、drone、HDR、4K)扩展搜索,共采集 10471 小时步行视频(含立体声)与 628 小时无人机/FPV 视频;视频发布于近三年内,单支时长 30 分钟至 12 小时,分辨率≥1080P、帧率 30–60 FPS。因网络问题/视频损坏,实际下载到 8409 小时步行视频 + 214 小时航拍视频
  • 预处理:裁掉每支视频首尾各 2 分钟片头片尾,经镜头边界检测、片段抽取转码、亮度过滤、质量过滤、相机轨迹过滤五步,得到 6620 小时 视频片段(Sekai-Real)。
  • 标注:用多种工具 + 视觉语言模型 + YouTube 元信息标注位置、多类别标签、caption 与相机轨迹。
  • 精选:综合内容多样性、地点多样性、类别多样性、相机轨迹多样性挑选,最终得到 400 小时 的 Sekai-Real-HQ 高质量子集(训练数据)。
  • 相机运动量化:Sekai-Real-HQ 的轨迹由 MegaSaM 估计,仍不够精确;论文设计轨迹量化算法(Algorithm 1)把连续 c2w 位姿匹配到预定义离散动作集合中最接近的一个(按平移+旋转加权距离),既过滤过度抖动轨迹,也平衡了动作分布、降低训练难度。按此量化并筛选出长度 >33 帧的连续同动作片段,最终得到 139019 个视频片段 用于相机运动量化训练池;附录 C 另给出 21526 个视频片段 在各动作组合上的分布统计(子集/统计口径与前者不同,论文未明确二者关系,此处如实并列)。
  • 动态平衡:为避免 V2V 模式下模型过度模仿条件视频的运动模式,训练时 30% 迭代改用静态图像(单帧复制 16 次构造静态视频)作为条件。

训练方法

  • 目标函数:Rectified Flow(ODE 传输代价最小化),训练时对 VAE 潜空间做速度场回归 MSE;采样按欧拉法离散积分。
  • 训练配置:以 SkyReels-V2-14B-540P 为预训练基座,视频分辨率 544×960,帧率 16 FPS,batch size 40,Adam 优化器,学习率 1e-5,训练 7000 迭代,硬件为 NVIDIA A800 GPU(论文正文未给出具体卡数;GitHub README 注明 MVDT 训练”至少需要 16 张 A100”)。
  • 多阶段/消融训练配置:条件注入方式消融(AdaLN-Zero / Cross-Attention / Text injection)与 MVDT、AAM 消融实验统一训练 1000 迭代、在 20 个随机视频序列上评测(见评测章节 Table 5–7)。
  • 蒸馏:见”模型架构”加速部分——对抗蒸馏将采样步数从 50 降到 14,配合缓存机制联合优化,蒸馏时判别器结构复用 OSV。
  • 推理采样:标准 50 步 + CFG(100 NFE)为基线;AAM 用 90 NFE;TTS-SDE 在 ODE 基础上加时间穿越(interval s=5, depth l=5)与随机项。

Infra(训练 / 推理工程)

  • 训练硬件:NVIDIA A800(论文正文未披露具体卡数/GPU-hours);GitHub 训练脚本注明 MVDT 框架”至少需要 16 张 A100”(这是代码仓库给出的最低配置要求,与论文正文训练所用的具体 A800 卡数是两个不同的数字,均未给出总卡时)。
  • 精度:缓存的层间残差特征以 bfloat16 存储;其余精度配置未披露。
  • 推理时延(Table 4,544×960、96 帧、50 推理步基线 vs 14 步蒸馏版):基线 583.1 秒,蒸馏后 158.8 秒(同一硬件配置下测得,论文未注明具体 GPU 型号/数量用于此计时)。
  • 推理分辨率/帧数:评测统一用 544×960、16 FPS、96 帧输入。
  • 边缘部署:GitHub README 另提供 Yume-5B 模型的 Windows 一键运行方案,在 RTX 4090 Laptop GPU(16GB 显存)上验证可跑,采样步数可在 4–50 间调节(此为后续 Yume-5B 权重的部署说明,非本文 14B 模型的基准数字)。

评测 benchmark

论文自建 Yume-Bench 评测框架:从 Sekai-Real-HQ 中排除训练视频,采样含各类动作组合的测试视频/图像共 70 个(含罕见动作如倒走、上仰/下俯的单图采样),覆盖 9 类键鼠动作组合(如 W+A 键无鼠标 29 例、W+A+鼠标右转 17 例等,见 Table 1)。评测指标:指令跟随(人工评估相机运动是否符合预期方向)+ VBench 的 5 项自动指标(主体一致性、背景一致性、运动平滑度、美学质量、成像质量)。测试分辨率 544×960、16 FPS、96 帧,统一用 50 推理步。

Table 2(与 SOTA 对比,同随机种子)

模型指令跟随↑主体一致性↑背景一致性↑运动平滑度↑美学质量↑成像质量↑
Wan-2.1(文本控制)0.0570.8590.8990.9610.4940.695
MatrixGame(原生键鼠控制)0.2710.9110.9320.9830.4350.750
Yume(Ours)0.6570.9320.9410.9860.5180.739

Yume 的指令跟随分数(0.657)大幅超过 Wan-2.1(文本控制方式指令跟随能力弱)和 MatrixGame(能一定程度控制但难泛化到真实场景);其余视觉质量指标也取得最优或接近最优。

长视频生成验证:构造 18 秒序列(每次自回归生成 2 秒片段),前 8 秒沿用测试集运动模式,之后 10 秒切换为持续前进。观察到轻微内容衰减:0–8s 与 12–18s 相比,主体一致性下降 0.5%(0.934→0.930),背景一致性下降 0.6%(0.947→0.941);运动切换阶段(8–12s)指令跟随一度下降 8.6%(因输入视频运动惯性阻碍立即反向),但 12 秒后惯性消退、指令跟随回升 22.3%(0.636→0.819)。

采样器消融(Table 3,ODE vs SDE vs TTS-ODE vs TTS-SDE):TTS-SDE 指令跟随达 0.743,显著高于 ODE 基线 0.657、SDE 0.629、TTS-ODE 0.671;代价是美学质量从 0.518 略降到 0.507。

蒸馏效果(Table 4):基线(50 步)耗时 583.1s、指令跟随 0.657;蒸馏(14 步)耗时 158.8s(约 3.7× 加速),指令跟随降到 0.557,其余指标(主体/背景一致性、运动平滑度、美学、成像质量)与基线基本持平,说明步数减少主要削弱的是文本控制能力而非整体视觉质量。

条件注入方式消融(Table 5,附录 A,1000 迭代/20 个视频):AdaLN-Zero 指令跟随 0.35、Cross-Attention 0.45、Text injection 0.45——三者互有优劣,论文最终选 Text injection(不引入新可学习参数、与预训练模型无缝集成、可控性更优)。

MVDT 消融(Table 6):有 MVDT 时美学质量 0.517/成像质量 0.702/运动平滑度 0.985/背景一致性 0.929;无 MVDT 时降为 0.492/0.694/0.991/0.902(背景一致性下降明显,运动平滑度反而略升)。

AAM 消融(Table 7):有 AAM 时美学质量 0.529/成像质量 0.737/运动平滑度 0.986/动态程度 0.937;无 AAM 时降为 0.517/0.702/0.985/0.929。

创新点与影响

  • 贡献:(1) 量化相机运动(QCM)——把连续相机轨迹离散成键盘友好的动作集合,用文本条件注入预训练 I2V 模型实现零新增参数的稳定可控生成;(2) Masked Video Diffusion Transformer(MVDT),引入掩码表征学习提升跨帧结构一致性;(3) 训练无关的 AAM 去伪影机制与 TTS-SDE 采样,分别改善视觉质量与文本可控性且不需重新训练;(4) 对抗蒸馏 + 缓存的联合加速方案,将 50 步采样蒸馏到 14 步(3.7× 提速)同时保持视觉质量;(5) 全流程开源(数据处理代码、训练/推理代码、模型权重),并建立 Yume-Bench 评测框架。
  • 与同类工作的区别:相比 Matrix-Game / WorldMem 等游戏世界模型,Yume 主打真实世界城市漫游场景,且用真实 YouTube 视频估计的相机轨迹训练(而非游戏引擎/合成数据的精确动作标签),因此需要专门设计轨迹量化与去伪影机制来应对真实场景的复杂性与标注噪声。
  • 论文自陈局限:这是一份”preview 版本”,作者明言仍面临视觉质量、运行效率、控制精度等诸多挑战;许多功能尚未实现(如与物体的交互);AAM 在自回归长视频生成上因缺乏 V2V 基座而表现不佳。项目定位为长期迭代(“will update monthly”),2025-12 已推出继任版本 Yume-1.5(arXiv 2512.22096,转向文本可控事件生成 + 线性注意力长上下文压缩 + 双向注意力蒸馏实时加速,模型缩小到 5B 参数),本页范围不含 Yume-1.5 的内容。

原始链接

一手源存档(sources/)

  • yume—github-readme — GitHub README(fetched 2026-07-16)
  • yume—hf-card — HuggingFace stdstu123/Yume-I2V-540P model card(fetched 2026-07-16)
  • yume—project-page — 项目页快照(现已被作者改写为 Yume-1.5 内容,供溯源参考,fetched 2026-07-16)
  • arXiv 2507.17744 全文(arXiv 原文 PDF/HTML,不入 git,见上方链接)