一句话定位

Decart 于 2025-07-17 发布的 MirageLSD——基于自研 Live-Stream Diffusion(LSD) 模型的”世界/视频转换”系统:把任意实时视频流(摄像头、游戏画面、视频通话)逐帧、无预设终点地转换成用户用文本提示指定的新视觉世界,宣称每帧响应延迟 <40ms、24 FPS、可无限时长生成,相比此前的自回归视频模型响应速度提升 16×;产品以网页 demo「Mirage」的形式对外展示(iOS/Android 随后跟进)。

背景与定位

Decart 是一家以色列裔背景的美国初创公司,2024 年以互动版”AI Minecraft”世界模型 Oasis(与 Etched 合作)出道。MirageLSD 是 Decart 继 Oasis 之后的第二个模型,官方称耗时约半年打造。与 Google DeepMind Genie 3World Labs MarbleWayve GAIA-2 等”生成新世界”的世界模型不同,MirageLSD 走的是**实时视频流转换(video-to-video live transformation)**路线:输入不是纯文本起点,而是一路持续输入的真实视频流(摄像头/游戏/通话画面),模型逐帧对其进行风格化重绘,同时接受用户随时输入的新文本提示做”再编辑”。

官方将 MirageLSD 定位为解决此前视频生成模型的三个共性短板:交互性(interactivity)、低延迟(low latency)、时序稳定性(temporal stability)——并称此前系统很少能同时做到三者。技术报告将同期工作分为三类并逐一指出局限:

  • 定长模型(MovieGen、WAN、Veo)——非因果设计+全片段推理,引入延迟,无法实时交互或超出预定长度;
  • 自回归分块模型(CausVid、LTX、Seaweed-APT)——按 chunk 生成延长序列,但分块推理仍限制响应速度,且饱受误差累积困扰;
  • 可控生成方法(ControlNet、LoRA 类适配器)——支持定向编辑/风格迁移,但依赖离线微调,不适合逐帧的实时提示。

官方称其前作 Oasis 是”受限领域内的首个实时因果生成”,而 LSD 将这一能力扩展到开放域、可提示、零延迟、无限稳定的组合——官方称此前工作未同时做到过这四点。

模型架构

说明:MirageLSD 无 arXiv 论文,仅以官方博客+“Technical Report”章节披露方法细节;未公开网络结构具体层数、参数量、tokenizer/latent 细节,以下如实标注未披露处。

  • 生成范式因果自回归、逐帧生成(frame-by-frame, causal)——每个时间步,模型输入一个过去生成帧的窗口 $(F_{i-2}, F_{i-1}, F_i)$、当前输入帧 $(I_{i+1})$、用户文本提示 $(P)$,预测下一输出帧 $(F_{i+1})$,随即反馈进下一步。这一因果反馈环是实现”零延迟响应用户输入”的关键机制。
  • 底层技术基座:构建在 Diffusion Forcing(Chen et al., NeurIPS 2024/ICML 2025, arXiv:2407.01392)之上——一种逐帧独立加噪的预训练方法,使模型学会在不依赖完整视频上下文的情况下对单帧去噪,从而支持逐帧生成。
  • history augmentation(历史增强,官方自称的新机制):为解决自回归误差累积,在训练时对输入的历史帧做”腐化”(用模拟教师强制场景下可能产生的伪影去扰动历史帧),并在推理时告知模型”历史帧可能不准确”,让模型学会预期并修正输入历史中的伪影,从而对自回归漂移更鲁棒。
  • 动作/条件输入:条件不是离散动作 token,而是持续视频流(当前输入帧)+ 文本提示的组合;支持推理过程中随时切换/追加新文本提示做连续再编辑。
  • 推理加速三件套(详见 Infra):Hopper 定制 Mega Kernel、架构感知剪枝(architecture-aware pruning)、shortcut distillation 蒸馏——三者共同把单帧延迟从”每片段数秒”压到”<40ms/帧”。
  • 配置数字:参数量、层数、分辨率、上下文窗口长度等均未披露。已披露的运行时数字仅有:<40ms 单帧响应延迟、24 FPS 生成速率、相比此前自回归模型 16× 响应速度提升

数据

  • 训练数据规模(小时/帧/token)、来源、配比、筛选方式、动作标注方式、sim-vs-real 混合、co-training 策略:官方博客全部未披露,技术报告聚焦方法与工程,未给出任何数据集章节或数字。
  • 可推断的间接信息:Diffusion Forcing 底座与 history augmentation 均需要视频训练语料并对历史帧做人工腐化增强,但腐化方式的具体实现(噪声类型/强度/覆盖率)未公开。

训练方法

  • 训练目标:延续 Diffusion Forcing 的逐帧去噪目标,不依赖完整视频上下文即可对单帧去噪。
  • 误差累积的针对性训练:通过在训练阶段用”模型可能产生的伪影”腐化输入历史帧(history augmentation),并在推理阶段显式告知模型历史帧不完全可信,使模型对自回归漂移形成鲁棒性——这是官方给出的实现”无限时长生成不崩溃”的核心训练侧改动。
  • 蒸馏:使用 shortcut distillation(Frans et al., arXiv:2410.12557)训练小模型去匹配大教师模型的去噪轨迹,显著减少每帧所需的模型评估次数,同时保持输出质量与时序一致性,且官方强调该蒸馏”不会在长序列中引入新伪影或漂移”。
  • 剪枝:architecture-aware pruning——把模型参数规模与目标 GPU 硬件常数对齐,并利用模型权重稀疏性配合专用硬件支持,在降低 FLOPs 的同时提升 tensor-core 利用率;剪枝后模型经微调以对参数移除保持鲁棒。
  • 多阶段流水线的具体顺序(预训练→蒸馏→剪枝的先后关系、是否迭代)、RL 环节、关键超参(学习率/batch size/训练步数):均未披露

Infra(训练 / 推理工程)

  • 训练侧:GPU 型号/数量、GPU-hours、并行策略、训练精度(fp8/bf16)等全部未披露
  • 推理侧(重点披露方向)
    • Hopper 定制 Mega Kernel:针对 NVIDIA Hopper GPU 架构优化模型执行,采用类似 MegaKernels(Stanford Hazy Research,2025-05-27 blog)的技术,在小 batch size 限制下最小化逐层模型延迟;并将 GPU-GPU 通信内置进 kernel 核心,使跨设备通信被计算操作掩盖(masked),从而保证设备间无缝通信——暗示部署是**多卡(multi-device)**推理配置,但具体卡数未披露。
    • 延迟预算:硬性要求每帧 <40ms(对应人眼不易察觉的响应延迟阈值),以支撑持续 24 FPS 生成。
    • 速度提升幅度:相比此前最快的自回归模型,响应速度提升 16×
  • 部署形态:网页 demo(mirage.decart.ai,产品名 Mirage),iOS/Android 应用彼时”下周上线”;截至 2026-07 该 demo 子域名已下线(DNS 不可达),decart.ai/publications/mirage 页面也已返回 404,内容已被 Decart 后续的 Lucy 系列产品线取代(company 官网当前主打 Lucy 2.5 实时视频编辑与 Oasis 3 物理世界模型)。

评测 benchmark

  • 无标准化定量 benchmark 表。官方技术报告未给出 FVD/人类偏好评分/与具名 baseline 的并排对比表。
  • 已披露的量化指标均为自述的系统性能数字(非第三方评测):
    • 单帧响应延迟 <40ms
    • 生成帧率 24 FPS
    • 相比”此前自回归模型”(未逐一点名到具体数字对比表)响应速度提升 16×
    • 此前视频模型普遍在20-30 秒生成后因误差累积严重降质,而 MirageLSD 声称可无限时长稳定生成
  • 对比对象在文中以类别+具名模型形式列出(MovieGen、WAN、Veo 3、CausVid、LTX-Video、Seaweed-APT、ControlNet、LoRA、Oasis),但均为定性方法论对比,而非同一 benchmark 下的并排跑分。

创新点与影响

  • 核心贡献:把”无限时长自回归生成不崩溃”与”<40ms/24FPS 零延迟实时响应”这两个此前从未被同一系统同时解决的问题合并解决——前者靠 Diffusion Forcing + history augmentation 对抗误差累积,后者靠 Hopper Mega Kernel + 架构感知剪枝 + shortcut distillation 的推理工程三件套。
  • 改变了什么
    1. 把视频生成的可交互性从”生成一段可看的定长片段”推进到”对持续输入视频流做无预设终点的逐帧实时转换/再编辑”,用户可在生成过程中随时切换文本提示。
    2. 将 Decart 自身前作 Oasis(受限领域实时因果生成)扩展到开放域,不再局限于游戏世界重建。
    3. 以消费级 demo(网页 + 计划中的移动端 App)形式把”实时视频世界转换”直接推向大众用户,而非仅限研究原型。
  • 官方自陈局限
    1. 依赖有限的历史帧窗口,缺乏长期记忆机制,限制了角色身份、场景布局、长期动作的一致性;
    2. 虽支持文本引导的整体转换,但对特定物体/空间区域/运动的精确控制仍有限,尚未集成关键点、场景标注等结构化控制信号;
    3. 极端风格切换下,语义与几何一致性会退化,物体结构或布局可能失真,需要更强的内容保持机制。
  • 后续路线图(发布时官方自述,截至 2026-07 已部分兑现为 Lucy/Oasis 系列):官方称”MirageLSD 只是第一天”,后续将推出更多视频模型、音频、情绪、音乐等模态,并计划整个夏天持续发布模型升级与新功能,包括人脸一致性、语音控制、精确物体控制。

原始链接

一手源存档(sources/)

  • decart-mirage-lsd—blog — 官方发布博客 + Technical Report 全文快照(经 Wayback Machine 抓取,因 decart.ai/publications/mirage 现网页已 404、mirage.decart.ai 已下线)