一句话定位
LiveEdit 把”离线双向扩散视频编辑模型”蒸馏成一个因果、逐块(chunk-by-chunk)流式编辑器,通过三阶段蒸馏(打底 → teacher forcing 转因果 → DMD 压到 4 步)加上一个面向自回归的 Mask Cache(只对未编辑背景区做 token 复用),在保证背景严格不变的前提下把推理拉到 12.66 FPS / 每帧 79ms,是首个面向实时交互与 AR 场景的流式视频编辑框架。已被 ECCV 2026 接收。
背景与定位
视频编辑这几年进展很快,但真要落到实时交互(直播、AR)上一直卡在两件事:一是长时间维持背景和未编辑区域的稳定,二是足够低的延迟。现有做法基本分两类,各有致命短板。
一类是离线双向模型(VACE、EditVerse、UNIC、Lucy Edit、InsV2V 这类),靠全局/双向 attention 保时序一致,视觉质量好,但它们必须先看完整段视频、把所有帧和条件一起塞进联合表征里做二次方级别的联合计算,才能吐出第一帧——这个延迟在实时场景里不可接受。
另一类是近两年的流式自回归生成模型(Diffusion Forcing、StreamDiffusion、Self Forcing、StreamDiffusionV2、MAGI-1、SkyReels-V2 等),它们把去噪重定义成块级串行处理,延迟低,但都是为从零合成设计的:靠历史生成结果往下续,本质是自由生成运动。直接搬到编辑任务上会出问题,因为编辑的核心诉求是”严格贴合输入源视频、只改指定区域、其余像素级不动”,而这些生成式缓存(DeepCache、VMem、StreamDiffusionV2 的 rolling KV cache)在严格对齐语义编辑轨迹时会破坏高频结构细节。EgoEdit 算是第一个把流式模型做进第一人称视频编辑的,但它是直接复用 Self-Forcing 管线、绑死在 egocentric 单域上,没有做推理加速,也难泛化到通用场景。
作者把问题归结为两个具体的技术障碍:
- Attention 分布漂移:SOTA 视频扩散模型依赖双向/全局 attention,一旦砍掉未来帧强行改成因果执行,attention 权重会从”局部聚集”塌成”在所有历史帧上均匀铺开”,破坏预训练的结构先验,导致遗忘或严重闪烁。
- 时空 token 冗余:标准扩散把每一帧当成独立的重生成任务,但流式场景里大部分背景要么静止要么做可预测的线性运动,对这些未编辑区反复跑稠密的 FFN 和 Attention 是巨大的浪费,每帧延迟高到边缘设备跑不动。
LiveEdit 就是冲着这两点设计的:三阶段蒸馏解决架构不兼容(漂移问题),Mask Cache 解决计算冗余(延迟问题)。基座选的是 Wan2.1-T2V-1.3B,代码建立在 Self-Forcing 和 CausVid 之上。
模型架构
整体是一个因果 DiT(Causal DiT)+ Mask Cache 的流式编辑器,基座是 Wan2.1-T2V-1.3B(1.3B 参数)。
条件注入方式:把原始视频 latent 和加噪 latent z_t 做**通道维拼接(channel-wise concatenation)**送进网络,而不是在序列维度上做 spatial/temporal 拼接。这是个关键工程选择——保持原始序列长度不变,从根子上避开视频生成里长序列 attention 的二次方爆炸。文本编辑指令 c 作为文本 embedding 走 cross-attention 注入。
因果化:网络从双向 DiT ε_θ^bid 迁移成因果 DiT ε_θ^causal,靠一个 chunk-wise 因果 attention mask M_causal 约束——temporal token 只能 attend 到当前块和严格靠前的块,不能看未来块。时间块大小设为 3 个 latent 帧。
AR-oriented Mask Cache(核心创新):推理时逐块处理,对当前块 k,用上一块 k−1 的原始源 latent z_src^{k-1} 和它的编辑输出 latent z_edit^{k-1} 之间的 L2 距离算一个二值空间编辑掩码 M^k:距离超过阈值 τ 的位置标 1(活跃编辑区),否则标 0(静态背景区)。阈值 τ 不是固定经验值,而是根据 token 间冗余度动态确定,目标是剪掉 70% 的冗余空间 token。
对活跃编辑区,走完整的 Self-Attention + Cross-Attention + FFN;对未编辑区,直接从上一块的 Token Cache 里取中间特征复用(f^k = f^{k-1}),跳过昂贵的计算层。一个重要发现是:缓存只加在 Self-Attention 层——作者观察到不同模块处理冗余信息的方式不同,FFN 和 Cross-Attention 承载逐像素空间细节和文本对齐、不能复用,而 Self-Attention 在未编辑区有显著的时空冗余、复用它对质量零损失。消融里把缓存加到 FFN 会造成严重退化(见评测)。
作者还给出一组统计证据支撑”背景高度稳定”这个前提:整段序列的 Temporal IoU 均值 0.016%、Pixel Difference 均值 0.126%,说明未编辑区确实几乎不变,缓存复用是安全的。
数据
训练数据是 20K 高质量视频-视频配对,从大规模合成指令编辑数据集 Ditto-1M 里精心筛选出来的。除此之外论文没有披露更细的数据构造、配比或清洗流程——数据规模就是这一个数字,属于”小而精”的做法(配 1.3B 基座 + 蒸馏范式,本来也不需要海量数据)。
评测基准是作者自建的流式视频编辑专用 benchmark,共 120 对(源视频 + 编辑指令)。这是论文的一个明确贡献:此前没有针对流式视频编辑的标准化评测集。
训练方法
核心是三阶段渐进式蒸馏管线,把强双向基础模型的编辑能力一步步迁到高效的单向流式编辑器上。全程在 8 张 NVIDIA A100 上用 AdamW 训练。
Stage 1 — Foundation Tuning(打底,获取编辑能力):
在双向 DiT 上建立高保真的多模态视频到视频编辑基线。通道拼接源 latent 与加噪 latent,用标准噪声匹配 MSE 损失 L_MSE^bid = E[‖ε − ε_θ^bid(z_t,t,c)‖²] 监督。全序列全局处理,训 9K 步,学习率 1e-5,global batch 8,连续时间步 t∈[0,1000]。这一阶段需要 100 NFE + CFG,无法在线流式,只是拿到一个强离线编辑先验。
Stage 2 — Teacher Forcing(转 chunk-wise 因果): 把架构从双向切成自回归。直接给预训练双向模型加因果 mask 会严重掉点,所以引入 teacher forcing + chunk-wise 因果 attention,让因果 DiT 的输出分布对齐 Stage 1 学到的局部化双向先验,避免因缺失未来 token 导致结构塌缩。额外训 20K 步,块大小 3 latent 帧。此阶段实现了流式的输入输出格式,但仍是 100 NFE + CFG,延迟太高不能实时部署。
Stage 3 — DMD(蒸到 4 步,实现实时):
用 Distribution Matching Distillation 做步数蒸馏。关键设计是绕开 ODE 初始化:Self-Forcing 这类自回归范式严重依赖一个 ODE 初始化阶段来弥合训练-推理分布 gap,但为流式视频编辑构造这个 ODE 轨迹要处理高分辨率长序列源视频,算力开销高到不可扩展。LiveEdit 直接拿 Stage 2 的自回归权重 ε_θ^causal 初始化 4 步 DMD 生成器 G_θ,既省掉初始化开销、又提供了一个对齐好的因果起点。
DMD 梯度在冻结的 Real Score 模型 ε_φ^real 和可训练的 Fake Score 模型 ε_ψ^fake 之间计算(两者都从 Stage 1 的基础模型权重初始化):∇_θ L_DMD = E[w(t)(ε_φ^real − ε_ψ^fake)∇_θ G_θ]。训练用 L_MSE 和 ∇_θ L_DMD 联合优化,喂入的是剪枝后的噪声输入。4 步采样时间步固定设为 [0, 250, 500, 750],学习率降到 1e-5,训 10K 步。这一步把生成压到 4 NFE 并去掉 CFG(CFG 本来要 double forward pass),是实现实时的最后一环。
RL/奖励对齐:本文没有引入 RLHF/RLAIF 类后训练,纯粹是监督式蒸馏管线(related work 提到过 RL 对齐这条线,但 LiveEdit 自身未使用)。
Infra(训练 / 推理工程)
- 训练:8× A100,AdamW,三阶段合计 9K + 20K + 10K 步。这是本文全部披露的算力信息,没有给 GPU·时、并行策略、混合精度等更细的数字。
- 推理:纯自回归运行,每步解码 3 帧。Mask Cache 动态剪掉 70% 冗余空间 token,且只作用于 Self-Attention 层。最终 4 步流式编辑达到每帧 79ms 的延迟 → 12.66 FPS,背景无闪烁。
- 代码/部署(GitHub
cp-cp/LiveEdit,Apache-2.0):基于 Self-Forcing + CausVid + Wan2.1 三个开源仓构建。推荐 Linux + NVIDIA GPU,单卡即可推理,训练脚本走多卡torchrun。放出了推理与训练代码、以及 HF checkpointcp-cp/LiveEdit(ar-forcing_002000.pt,对应 2000 步的 self-forcing checkpoint)。仓库提供了infer-local-ar-forcing.sh(默认推理)和infer-token-pruning.sh(带 Mask Cache 的高效推理,--save_mask可导出复用区/全算区的可视化),训练分train-mm-bid-diffusion.sh(Stage 1)、train-mm-ar-forcing.sh(Stage 2/3)等入口。
评测 benchmark
在自建的 120 对流式编辑 benchmark 上,用六个自动指标评:Text Alignment(TA,CLIP 特征相似度,follow EgoEdit)、Background Consistency(BC)、Motion Smoothness(MS)、Dynamic Degree(DD)、Aesthetic Quality(AQ,LAION-Aesthetic 预测器)、Imaging Quality(IQ),其中 BC/MS/DD/IQ 用 VBench 框架算。
主表(Table 1,↑ 越高越好):
| 方法 | TA | BC | MS | DD | AQ | IQ |
|---|---|---|---|---|---|---|
| LucyEdit(离线) | 0.253 | 0.943 | 0.990 | 0.266 | 0.529 | 0.707 |
| VideoCoF(离线) | 0.245 | 0.953 | 0.991 | 0.094 | 0.542 | 0.709 |
| InsV2V(离线) | 0.259 | 0.943 | 0.986 | 0.196 | 0.577 | 0.708 |
| StreamDiffusion(流式) | 0.239 | 0.886 | 0.975 | 0.239 | 0.590 | 0.717 |
| StreamDiffusionV2(流式) | 0.252 | 0.951 | 0.992 | 0.264 | 0.539 | 0.653 |
| StreamV2V(流式) | 0.244 | 0.934 | 0.989 | 0.153 | 0.548 | 0.712 |
| LiveEdit(无 Cache) | 0.265 | 0.956 | 0.991 | 0.282 | 0.584 | 0.720 |
| LiveEdit(有 Cache) | 0.270 | 0.956 | 0.992 | 0.256 | 0.581 | 0.708 |
结论:LiveEdit 在几乎所有维度拿到最优。值得注意的是它是单向流式却在 Text Alignment 上(0.270)反超能看到未来帧的离线双向模型(InsV2V 0.259),DD 和 IQ 也是全场最高。加上 Cache 之后 TA 和 MS 还小幅提升、BC 完美保持不变,证明缓存机制不掉质量。
三阶段效率消融(Table 2):
| Stage 1(打底) | Stage 2(Teacher Forcing) | Stage 3(DMD) | |
|---|---|---|---|
| 流式? | 否 | 是 | 是 |
| NFE | 100 | 100 | 4 |
| 用 CFG? | 是 | 是 | 否 |
| 延迟(秒) | 197.48 | 200.36 | 7.89 |
| 首块 | 全序列 | 3 帧 | 3 帧 |
| TA / IQ | 0.268 / 0.716 | 0.264 / 0.702 | 0.265 / 0.720 |
Stage 3 把 81 帧的整体延迟从约 200 秒压到 7.89 秒,同时质量(IQ 0.720)反而是三阶段里最好的——蒸馏没有以质量换速度。
Cache 位置消融(Table 3):把缓存加在 Self-Attention(Ours)几乎全维最优(TA 0.270 / BC 0.956 / IQ 0.708);加在 FFN 则灾难性退化(TA 0.236 / BC 0.841 / DD 0.017 / IQ 0.513),出现严重模糊和结构不稳。原因是 SA token 在连续去噪步之间余弦相似度极高(冗余大、可复用),而 FFN 表征相似度低、含高频空间信息不能复用。
User Study:请 20 名志愿者对 LiveEdit 和 6 个基线在 Instruction Consistency、Background Preservation、Overall Quality 三维排序。LiveEdit 的指令一致性拿到 100% top-3 偏好、且垄断绝大多数”最佳”;背景保持 75% 最佳票 / 87.5% top-3;整体质量 95.8% top-3,全面压过离线和流式基线。
创新点与影响
核心贡献:
- 首个通用流式视频编辑框架——因果、逐块编辑,高保真且超低延迟(12.66 FPS),把”实时交互 + AR”这个此前无解的组合真正跑通。
- 三阶段蒸馏管线:Foundation Tuning → Teacher Forcing → DMD,把复杂编辑知识从双向 DiT teacher 迁到一个 4 步因果 DiT student。其中”用 Stage 2 因果权重直接初始化 DMD 生成器、绕开昂贵 ODE 初始化”是相对 Self-Forcing 的关键改进。
- AR-oriented Mask Cache:用 L2 距离动态解耦计算图,只对活跃编辑区做全量计算、背景区 token 复用,且发现缓存应只加在 Self-Attention 层。剪 70% 冗余 token、背景像素级零退化。
- 建立了流式视频编辑的专用 benchmark(120 对)。
定位与差异:论文明确把自己和两个最接近的工作对比——相对 Self-Forcing(为 T2V 从零合成设计、依赖 ODE 初始化、搬到编辑会结构偏移),LiveEdit 绕开 ODE 初始化并用 Mask Cache 保证源保真;相对 EgoEdit(绑死第一人称单域、无推理加速),LiveEdit 是面向通用场景的、把推理压到 4 步。整个方法思路上最像的先例是 FlashVSR(也用三阶段蒸馏做实时流式视频超分),但超分是低层像素映射,编辑涉及复杂语义重建,直接搬蒸馏方案会掉高频细节,所以 LiveEdit 定制了三阶段策略 + AR Cache。
开源与生态:代码、HF checkpoint 均已放出,Apache-2.0,基座 Wan2.1-T2V-1.3B,1.3B 小模型单卡可跑,对社区复现和二次开发友好。
已知局限:① 数据只有 20K 对、且来自合成集 Ditto-1M,真实分布覆盖和泛化边界未充分披露;② 训练算力信息只有”8×A100 + 步数”,无 GPU·时/并行细节;③ benchmark 是作者自建的 120 对,规模偏小、尚非社区公认标准,跨工作可比性有限;④ 12.66 FPS 对”实时”而言够用于交互,但离直播级 24/30 FPS 仍有距离;⑤ 基座是 1.3B 的 T2V-1.3B,分辨率/编辑复杂度上限受基座能力约束。
原始链接
- arxiv_abs: https://arxiv.org/abs/2606.26740
- arxiv_html(全文 v2): https://arxiv.org/html/2606.26740v2
- arxiv_pdf: https://arxiv.org/pdf/2606.26740
- project(ECCV 2026 项目页,含大量对比视频): https://live-edit.github.io
- github(代码,Apache-2.0): https://github.com/cp-cp/LiveEdit
- huggingface(checkpoint): https://huggingface.co/cp-cp/LiveEdit
- hf_papers: https://huggingface.co/papers/2606.26740
一手源存档(sources/)
- arxiv-2606.26740.pdf (arXiv 原文 PDF,不入 git)
- liveedit—arxiv.md (arXiv HTML 全文正文)
- liveedit—project.md (项目页)
- liveedit—github.md (GitHub README)
- liveedit—hf-paper.md (HF papers 页)