一句话定位

LiveEdit 把”离线双向扩散视频编辑模型”蒸馏成一个因果、逐块(chunk-by-chunk)流式编辑器,通过三阶段蒸馏(打底 → teacher forcing 转因果 → DMD 压到 4 步)加上一个面向自回归的 Mask Cache(只对未编辑背景区做 token 复用),在保证背景严格不变的前提下把推理拉到 12.66 FPS / 每帧 79ms,是首个面向实时交互与 AR 场景的流式视频编辑框架。已被 ECCV 2026 接收。

背景与定位

视频编辑这几年进展很快,但真要落到实时交互(直播、AR)上一直卡在两件事:一是长时间维持背景和未编辑区域的稳定,二是足够低的延迟。现有做法基本分两类,各有致命短板。

一类是离线双向模型(VACE、EditVerse、UNIC、Lucy Edit、InsV2V 这类),靠全局/双向 attention 保时序一致,视觉质量好,但它们必须先看完整段视频、把所有帧和条件一起塞进联合表征里做二次方级别的联合计算,才能吐出第一帧——这个延迟在实时场景里不可接受。

另一类是近两年的流式自回归生成模型(Diffusion Forcing、StreamDiffusion、Self Forcing、StreamDiffusionV2、MAGI-1、SkyReels-V2 等),它们把去噪重定义成块级串行处理,延迟低,但都是为从零合成设计的:靠历史生成结果往下续,本质是自由生成运动。直接搬到编辑任务上会出问题,因为编辑的核心诉求是”严格贴合输入源视频、只改指定区域、其余像素级不动”,而这些生成式缓存(DeepCache、VMem、StreamDiffusionV2 的 rolling KV cache)在严格对齐语义编辑轨迹时会破坏高频结构细节。EgoEdit 算是第一个把流式模型做进第一人称视频编辑的,但它是直接复用 Self-Forcing 管线、绑死在 egocentric 单域上,没有做推理加速,也难泛化到通用场景。

作者把问题归结为两个具体的技术障碍:

  • Attention 分布漂移:SOTA 视频扩散模型依赖双向/全局 attention,一旦砍掉未来帧强行改成因果执行,attention 权重会从”局部聚集”塌成”在所有历史帧上均匀铺开”,破坏预训练的结构先验,导致遗忘或严重闪烁。
  • 时空 token 冗余:标准扩散把每一帧当成独立的重生成任务,但流式场景里大部分背景要么静止要么做可预测的线性运动,对这些未编辑区反复跑稠密的 FFN 和 Attention 是巨大的浪费,每帧延迟高到边缘设备跑不动。

LiveEdit 就是冲着这两点设计的:三阶段蒸馏解决架构不兼容(漂移问题),Mask Cache 解决计算冗余(延迟问题)。基座选的是 Wan2.1-T2V-1.3B,代码建立在 Self-Forcing 和 CausVid 之上。

模型架构

整体是一个因果 DiT(Causal DiT)+ Mask Cache 的流式编辑器,基座是 Wan2.1-T2V-1.3B(1.3B 参数)。

条件注入方式:把原始视频 latent 和加噪 latent z_t 做**通道维拼接(channel-wise concatenation)**送进网络,而不是在序列维度上做 spatial/temporal 拼接。这是个关键工程选择——保持原始序列长度不变,从根子上避开视频生成里长序列 attention 的二次方爆炸。文本编辑指令 c 作为文本 embedding 走 cross-attention 注入。

因果化:网络从双向 DiT ε_θ^bid 迁移成因果 DiT ε_θ^causal,靠一个 chunk-wise 因果 attention mask M_causal 约束——temporal token 只能 attend 到当前块和严格靠前的块,不能看未来块。时间块大小设为 3 个 latent 帧

AR-oriented Mask Cache(核心创新):推理时逐块处理,对当前块 k,用上一块 k−1 的原始源 latent z_src^{k-1} 和它的编辑输出 latent z_edit^{k-1} 之间的 L2 距离算一个二值空间编辑掩码 M^k:距离超过阈值 τ 的位置标 1(活跃编辑区),否则标 0(静态背景区)。阈值 τ 不是固定经验值,而是根据 token 间冗余度动态确定,目标是剪掉 70% 的冗余空间 token

对活跃编辑区,走完整的 Self-Attention + Cross-Attention + FFN;对未编辑区,直接从上一块的 Token Cache 里取中间特征复用(f^k = f^{k-1}),跳过昂贵的计算层。一个重要发现是:缓存只加在 Self-Attention 层——作者观察到不同模块处理冗余信息的方式不同,FFN 和 Cross-Attention 承载逐像素空间细节和文本对齐、不能复用,而 Self-Attention 在未编辑区有显著的时空冗余、复用它对质量零损失。消融里把缓存加到 FFN 会造成严重退化(见评测)。

作者还给出一组统计证据支撑”背景高度稳定”这个前提:整段序列的 Temporal IoU 均值 0.016%、Pixel Difference 均值 0.126%,说明未编辑区确实几乎不变,缓存复用是安全的。

数据

训练数据是 20K 高质量视频-视频配对,从大规模合成指令编辑数据集 Ditto-1M 里精心筛选出来的。除此之外论文没有披露更细的数据构造、配比或清洗流程——数据规模就是这一个数字,属于”小而精”的做法(配 1.3B 基座 + 蒸馏范式,本来也不需要海量数据)。

评测基准是作者自建的流式视频编辑专用 benchmark,共 120 对(源视频 + 编辑指令)。这是论文的一个明确贡献:此前没有针对流式视频编辑的标准化评测集。

训练方法

核心是三阶段渐进式蒸馏管线,把强双向基础模型的编辑能力一步步迁到高效的单向流式编辑器上。全程在 8 张 NVIDIA A100 上用 AdamW 训练。

Stage 1 — Foundation Tuning(打底,获取编辑能力): 在双向 DiT 上建立高保真的多模态视频到视频编辑基线。通道拼接源 latent 与加噪 latent,用标准噪声匹配 MSE 损失 L_MSE^bid = E[‖ε − ε_θ^bid(z_t,t,c)‖²] 监督。全序列全局处理,训 9K 步,学习率 1e-5,global batch 8,连续时间步 t∈[0,1000]。这一阶段需要 100 NFE + CFG,无法在线流式,只是拿到一个强离线编辑先验。

Stage 2 — Teacher Forcing(转 chunk-wise 因果): 把架构从双向切成自回归。直接给预训练双向模型加因果 mask 会严重掉点,所以引入 teacher forcing + chunk-wise 因果 attention,让因果 DiT 的输出分布对齐 Stage 1 学到的局部化双向先验,避免因缺失未来 token 导致结构塌缩。额外训 20K 步,块大小 3 latent 帧。此阶段实现了流式的输入输出格式,但仍是 100 NFE + CFG,延迟太高不能实时部署。

Stage 3 — DMD(蒸到 4 步,实现实时): 用 Distribution Matching Distillation 做步数蒸馏。关键设计是绕开 ODE 初始化:Self-Forcing 这类自回归范式严重依赖一个 ODE 初始化阶段来弥合训练-推理分布 gap,但为流式视频编辑构造这个 ODE 轨迹要处理高分辨率长序列源视频,算力开销高到不可扩展。LiveEdit 直接拿 Stage 2 的自回归权重 ε_θ^causal 初始化 4 步 DMD 生成器 G_θ,既省掉初始化开销、又提供了一个对齐好的因果起点。

DMD 梯度在冻结的 Real Score 模型 ε_φ^real 和可训练的 Fake Score 模型 ε_ψ^fake 之间计算(两者都从 Stage 1 的基础模型权重初始化):∇_θ L_DMD = E[w(t)(ε_φ^real − ε_ψ^fake)∇_θ G_θ]。训练用 L_MSE∇_θ L_DMD 联合优化,喂入的是剪枝后的噪声输入。4 步采样时间步固定设为 [0, 250, 500, 750],学习率降到 1e-5,训 10K 步。这一步把生成压到 4 NFE 并去掉 CFG(CFG 本来要 double forward pass),是实现实时的最后一环。

RL/奖励对齐:本文没有引入 RLHF/RLAIF 类后训练,纯粹是监督式蒸馏管线(related work 提到过 RL 对齐这条线,但 LiveEdit 自身未使用)。

Infra(训练 / 推理工程)

  • 训练:8× A100,AdamW,三阶段合计 9K + 20K + 10K 步。这是本文全部披露的算力信息,没有给 GPU·时、并行策略、混合精度等更细的数字。
  • 推理:纯自回归运行,每步解码 3 帧。Mask Cache 动态剪掉 70% 冗余空间 token,且只作用于 Self-Attention 层。最终 4 步流式编辑达到每帧 79ms 的延迟 → 12.66 FPS,背景无闪烁。
  • 代码/部署(GitHub cp-cp/LiveEdit,Apache-2.0):基于 Self-Forcing + CausVid + Wan2.1 三个开源仓构建。推荐 Linux + NVIDIA GPU,单卡即可推理,训练脚本走多卡 torchrun。放出了推理与训练代码、以及 HF checkpoint cp-cp/LiveEditar-forcing_002000.pt,对应 2000 步的 self-forcing checkpoint)。仓库提供了 infer-local-ar-forcing.sh(默认推理)和 infer-token-pruning.sh(带 Mask Cache 的高效推理,--save_mask 可导出复用区/全算区的可视化),训练分 train-mm-bid-diffusion.sh(Stage 1)、train-mm-ar-forcing.sh(Stage 2/3)等入口。

评测 benchmark

在自建的 120 对流式编辑 benchmark 上,用六个自动指标评:Text Alignment(TA,CLIP 特征相似度,follow EgoEdit)、Background Consistency(BC)、Motion Smoothness(MS)、Dynamic Degree(DD)、Aesthetic Quality(AQ,LAION-Aesthetic 预测器)、Imaging Quality(IQ),其中 BC/MS/DD/IQ 用 VBench 框架算。

主表(Table 1,↑ 越高越好)

方法TABCMSDDAQIQ
LucyEdit(离线)0.2530.9430.9900.2660.5290.707
VideoCoF(离线)0.2450.9530.9910.0940.5420.709
InsV2V(离线)0.2590.9430.9860.1960.5770.708
StreamDiffusion(流式)0.2390.8860.9750.2390.5900.717
StreamDiffusionV2(流式)0.2520.9510.9920.2640.5390.653
StreamV2V(流式)0.2440.9340.9890.1530.5480.712
LiveEdit(无 Cache)0.2650.9560.9910.2820.5840.720
LiveEdit(有 Cache)0.2700.9560.9920.2560.5810.708

结论:LiveEdit 在几乎所有维度拿到最优。值得注意的是它是单向流式却在 Text Alignment 上(0.270)反超能看到未来帧的离线双向模型(InsV2V 0.259),DD 和 IQ 也是全场最高。加上 Cache 之后 TA 和 MS 还小幅提升、BC 完美保持不变,证明缓存机制不掉质量。

三阶段效率消融(Table 2)

Stage 1(打底)Stage 2(Teacher Forcing)Stage 3(DMD)
流式?
NFE1001004
用 CFG?
延迟(秒)197.48200.367.89
首块全序列3 帧3 帧
TA / IQ0.268 / 0.7160.264 / 0.7020.265 / 0.720

Stage 3 把 81 帧的整体延迟从约 200 秒压到 7.89 秒,同时质量(IQ 0.720)反而是三阶段里最好的——蒸馏没有以质量换速度。

Cache 位置消融(Table 3):把缓存加在 Self-Attention(Ours)几乎全维最优(TA 0.270 / BC 0.956 / IQ 0.708);加在 FFN 则灾难性退化(TA 0.236 / BC 0.841 / DD 0.017 / IQ 0.513),出现严重模糊和结构不稳。原因是 SA token 在连续去噪步之间余弦相似度极高(冗余大、可复用),而 FFN 表征相似度低、含高频空间信息不能复用。

User Study:请 20 名志愿者对 LiveEdit 和 6 个基线在 Instruction Consistency、Background Preservation、Overall Quality 三维排序。LiveEdit 的指令一致性拿到 100% top-3 偏好、且垄断绝大多数”最佳”;背景保持 75% 最佳票 / 87.5% top-3;整体质量 95.8% top-3,全面压过离线和流式基线。

创新点与影响

核心贡献

  1. 首个通用流式视频编辑框架——因果、逐块编辑,高保真且超低延迟(12.66 FPS),把”实时交互 + AR”这个此前无解的组合真正跑通。
  2. 三阶段蒸馏管线:Foundation Tuning → Teacher Forcing → DMD,把复杂编辑知识从双向 DiT teacher 迁到一个 4 步因果 DiT student。其中”用 Stage 2 因果权重直接初始化 DMD 生成器、绕开昂贵 ODE 初始化”是相对 Self-Forcing 的关键改进。
  3. AR-oriented Mask Cache:用 L2 距离动态解耦计算图,只对活跃编辑区做全量计算、背景区 token 复用,且发现缓存应只加在 Self-Attention 层。剪 70% 冗余 token、背景像素级零退化。
  4. 建立了流式视频编辑的专用 benchmark(120 对)。

定位与差异:论文明确把自己和两个最接近的工作对比——相对 Self-Forcing(为 T2V 从零合成设计、依赖 ODE 初始化、搬到编辑会结构偏移),LiveEdit 绕开 ODE 初始化并用 Mask Cache 保证源保真;相对 EgoEdit(绑死第一人称单域、无推理加速),LiveEdit 是面向通用场景的、把推理压到 4 步。整个方法思路上最像的先例是 FlashVSR(也用三阶段蒸馏做实时流式视频超分),但超分是低层像素映射,编辑涉及复杂语义重建,直接搬蒸馏方案会掉高频细节,所以 LiveEdit 定制了三阶段策略 + AR Cache。

开源与生态:代码、HF checkpoint 均已放出,Apache-2.0,基座 Wan2.1-T2V-1.3B,1.3B 小模型单卡可跑,对社区复现和二次开发友好。

已知局限:① 数据只有 20K 对、且来自合成集 Ditto-1M,真实分布覆盖和泛化边界未充分披露;② 训练算力信息只有”8×A100 + 步数”,无 GPU·时/并行细节;③ benchmark 是作者自建的 120 对,规模偏小、尚非社区公认标准,跨工作可比性有限;④ 12.66 FPS 对”实时”而言够用于交互,但离直播级 24/30 FPS 仍有距离;⑤ 基座是 1.3B 的 T2V-1.3B,分辨率/编辑复杂度上限受基座能力约束。

原始链接

一手源存档(sources/)