一句话定位
Mirage(模型代号 MirageLSD,Live Stream Diffusion)是 Decart 于 2025-07-17 发布的”世界变换模型”(World Transformation Model):把任意实时视频流——摄像头、游戏画面、直播、视频通话——逐帧重绘成一个新的数字世界,宣称做到 <40ms 单帧延迟、24 FPS、无限时长不崩坏,是 Decart 继 decart-oasis(2024-10 的”AI Minecraft”)之后的第二个模型。
背景与定位
Mirage 属于实时视频到视频(video-to-video)世界变换这条路线,与同期两类世界模型形成对照:
- 与自回归”可玩世界”模型(decart-oasis、genie-3、skywork-matrix-game/skywork-matrix-game-2、tencent-hunyuan-gamecraft)不同:那批模型是”无中生有”地生成整个可交互世界(玩家操作决定下一帧内容),而 Mirage 是对已有真实视频流做逐帧风格/内容改写——输入是真实摄像头/游戏画面,模型在保留大致运动与结构的前提下把它”传送”到另一个视觉世界(真人变角色、房间变宫殿、棍棒格斗变光剑对决)。
- 与固定长度视频生成模型(MovieGen、ltx-video 的前代非因果基线、WAN、Veo 3)不同:这些模型一次性生成几秒到几十秒的短片,非因果、需要完整推理后才能看到结果,不能交互;Mirage 逐帧因果生成,边生成边响应用户新的 prompt/输入。
- 技术谱系上,Mirage 直接建立在 diffusion-forcing(Chen et al., NeurIPS 2024/ICML 2025)之上——用”每帧独立加噪”的训练方式让扩散模型具备逐帧自回归去噪的能力,这也是 Genie 系与不少 2025 年交互式世界模型共享的底层训练范式。
范式命名:流式扩散(Live Stream Diffusion, LSD)驱动的实时视频到视频世界变换模型。Mirage 是 Decart 从”生成孤立可玩世界”(Oasis)转向”实时改写任意视频流”的产品化落地,后续演进为 Decart 的 Lucy 系列(Lucy 2.0→2.5,“生产级世界编辑模型”)与面向机器人/自动驾驶的 Oasis 3。
模型架构
Decart 未公开 MirageLSD 的具体网络结构(backbone 类型、参数量、latent 维度、tokenizer 细节均未披露)——博客只给出方法学层面的架构选择:
- 骨干范式:因果、逐帧自回归扩散(causal frame-by-frame diffusion),建立在 diffusion-forcing 技术之上——每帧独立加噪训练,使模型能在不依赖完整视频上下文的情况下对单帧去噪,从而支持逐帧生成。
- 条件化输入:每个时间步,模型接收过去若干帧生成结果的窗口 $(F_{i-2}, F_{i-1}, F_i)$、当前输入帧 $(I_{i+1})$、以及用户文本 prompt $(P)$,预测下一输出帧 $(F_{i+1})$,该输出立即反馈进下一步(闭环因果结构)。上下文窗口长度、具体网络层数/宽度未披露。
- 历史增强(history augmentation):训练时对输入历史帧人为注入损坏/伪影(模拟模型自身可能产生的漂移误差),推理时告知模型历史帧”可能不准确”,使模型学会预期并修正输入历史中的伪影,抑制自回归误差累积。这是解决”无限时长生成不崩坏”的核心训练手段,取代了显式的长期记忆模块。
- 推理加速的架构改动:文中提到”架构感知剪枝”(architecture-aware pruning)——把参数规模调整到匹配具体 GPU 常量、利用硬件稀疏支持剪掉部分权重,以及配合 shortcut distillation(Frans et al., arXiv:2410.12557)用小模型蒸馏大模型的去噪轨迹以减少每帧所需的扩散步数;但具体剪枝比例、蒸馏后步数、教师/学生模型规模均未披露。
数据
训练数据的规模、来源、配比、清洗、动作/文本标注方式均未披露。 官方技术报告全文未给出训练集时长(小时/帧数)、数据来源(游戏录屏/网络视频/自采)、真实-合成配比或任何数据处理细节,这是 Mirage 与开源世界模型(如 Oasis 开源的 500M 版)之间最大的信息差。可确认的仅为产品层面的输入形态:任意实时视频流(摄像头、游戏画面、直播源、视频通话、VOD)作为条件输入,文本 prompt 作为风格/内容控制信号,而非结构化数据集条目。
训练方法
- 训练目标:延续 Diffusion Forcing 的逐帧独立加噪训练——每帧被赋予独立的噪声级别(而非整段视频统一噪声级别),使模型学会仅依赖局部历史帧去噪,为推理期的逐帧自回归生成打基础。
- 误差累积对策(history augmentation):在训练阶段对输入历史帧注入”教师强制”式的模拟伪影,微调模型使其能纠正这些伪影;推理阶段显式提示模型历史帧可能失真。这一步是让自回归生成从”数十秒内崩坏”变为”无限时长稳定”的关键改动。
- 蒸馏:应用 shortcut distillation(Frans, Hafner, Levine & Abbeel, arXiv:2410.12557)压缩每帧所需的扩散步数,用于加速推理;蒸馏具体设置(步数从多少压到多少、教师模型规模)未披露。
- 多阶段流水线、RL/模仿学习、具体超参(学习率、batch size、训练步数等):均未披露。
Infra(训练 / 推理工程)
- 训练所用 GPU 型号/数量、总 GPU-hours、并行策略、训练精度:均未披露。
- 推理硬件:文中提到工程针对 NVIDIA Hopper 架构做了定制优化(“Hopper-optimized Mega Kernels”),构建了类似 Stanford Hazy Research “Mega Kernels”(2025-05-27 博客)的自定义 CUDA mega kernel,把 GPU-GPU 通信直接编译进 kernel 内部、由计算掩盖通信延迟,用于压低小 batch(单样本)推理下的逐层延迟。
- 推理性能(官方披露的量化指标):
- 单帧生成延迟 < 40 毫秒(对应可持续 24 FPS 生成)。
- 相较此前的自回归视频模型,响应速度(worst-case response latency)提升 16×——文中原话:“even previous Auto-regressive models are more than 16X slower to respond than MirageLSD”。
- 定位为”zero-latency”实时生成,与此前”生成几秒视频需要数分钟处理”的模型形成对照(具体对比模型的延迟数字未在文本中给出,仅以图表呈现)。
- 平台/落地形态:发布时为 Web 端 Demo(mirage.decart.ai),iOS/Android 客户端”下周上线”(时间点为公司自述,未来性表述,非本次可验证的既成事实)。
评测 benchmark
无正式定量评测表。 官方技术报告不含 FID/FVD 等标准视频生成指标,也没有与具名 baseline(MovieGen、WAN、Veo 3、CausVid、ltx-video、Seaweed-APT)逐项对比的数字表格——相关比较停留在图表 + 定性论证层面(例如”生成长度上限”图与”响应延迟”图,均未在正文文字中给出可复核的坐标轴数值)。文中唯一给出的可复核量化对比是上述 16× 响应速度提升与 <40ms/24FPS 的自身指标。作为知识库如实记录:该条目缺乏可独立复核的定量 benchmark,质量论证主要依赖官方演示视频。
创新点与影响
贡献
- 首个”无限时长 + 零延迟 + 可交互”三者兼得的视频生成系统(官方自陈):此前的定长模型(MovieGen/WAN/Veo)非因果不可交互,自回归模型(CausVid/ltx-video/Seaweed-APT)因误差累积被限制在数十秒以内,Mirage 通过 history augmentation 解决了误差累积对生成长度的硬限制。
- history augmentation 训练技巧:把”预期并修正输入历史伪影”直接训练进模型,是对自回归视频生成漂移问题的一个具体工程化解法,区别于依赖显式长期记忆模块的思路。
- 推理工程层面的 16× 响应速度提升(Hopper 定制 mega kernel + 架构感知剪枝 + shortcut distillation 三件套),把高保真扩散视频生成的单帧延迟从”数秒/片段”压到”<40ms/帧”,是把扩散视频生成做成实时交互媒介(而非离线渲染产物)的工程关键。
- 产品化路线:作为”世界变换模型”直接对准直播、视频通话、游戏画面、VOD 等真实视频流的实时改写场景,是 Decart 从 Oasis(生成孤立可玩世界)转向”改写任意现有视频”的产品方向切换,后续演化为 Decart 的 Lucy 系列产品线。
自陈局限(技术报告原文)
- 依赖有限的历史帧窗口,长期记忆机制缺失,可能影响长序列下角色身份、场景布局、长期动作的一致性。
- 支持文本引导的整体变换,但对特定物体/空间区域/运动的精确控制仍然有限;结构化控制信号(关键点、场景标注)等更精细控制尚未实现。
- 极端风格切换下的语义/几何一致性不足:虽然局部一致性较好,但极端风格转变偶尔会扭曲物体结构或空间布局。
现状(截至 2026-07 verified):Decart 官网与开发者文档中已不再列出 “Mirage” 作为独立模型名,其实时视频变换能力已整合进 Lucy 产品线(Lucy 2.0→2.5,API 模型名如 lucy-latest/lucy-restyle-2),mirage.decart.ai 与 about.decart.ai/publications/mirage 页面均已下线(404),本页内容基于 2025-07 Wayback Machine 存档重建。
原始链接
- 技术报告 / 发布博客(原始 URL,现已 404,需通过 Wayback 访问):https://about.decart.ai/publications/mirage
- 产品 Demo 落地页(原始 URL,现已 404):https://mirage.decart.ai/
- Decart 公司主页(现状,含 Mirage 后续产品线 Lucy/Oasis 3):https://decart.ai/
- Decart 开发者 API 文档(现状,Mirage 能力已并入 Lucy 系列模型):https://docs.platform.decart.ai/
一手源存档(sources/)
- decart-mirage—blog — MirageLSD 技术报告全文快照(经 Wayback Machine 2025-07-18 存档,原页面已 404)(sources/world-model/2025/decart-mirage—blog.md)
- decart-mirage—landing — Mirage 产品落地页快照 + Decart 现状(Lucy/Oasis 3 产品线)交叉核实(sources/world-model/2025/decart-mirage—landing.md)