一句话定位
Vidu S1 是生数科技(清华 Jun Zhu / Fan Bao / Jianfei Chen 团队)做的实时交互视频生成模型:上传一张真人/动漫/萌宠图当数字人,开麦用语音随时指挥它做动作,模型以自回归方式流式生成音视频,在消费级 GPU(RTX 5090)上跑 540p、最高 42 FPS,可无限时长连续生成而不 drift、不崩溃。落地栈是自研的 TurboDiffusion(推理加速)+ TurboServe(流式 serving),已在 vidu.com/vidu-stream 开放试玩。
背景与定位
现在主流视频生成(sora-2、Veo、Wan、Seedance)都是离线 one-shot:输入 prompt,等几分钟到几十分钟拿一整段视频,全程用户被动等待、无法中途干预。根子在离线扩散范式——模型要在很多步里对整段视频联合去噪,结束才吐出干净结果。但人类的视觉娱乐不止于预生成视频:面对面沟通、直播、游戏陪玩、聊天这些交互式体验,内容必须即时响应用户。作者还给了个需求侧的估算:实时交互需求随用户数 N 线性放大(α×N),而离线视频因为能重放/分享,需求更像 β×N/m(m 是每条视频平均观看次数);只要每条视频被看超过 100 次,实时交互视频的总需求就远大于离线视频。
已有的自回归/流式视频工作(magi-1、framepack、LongLive、Self-Forcing、Skyreels-v2、ltx-video 这一线)作者归纳出四个没解决的问题:一是很多方法只是把生成从离线改成自回归,仍不支持生成过程中的实时用户交互;二是大多不把语音当成对”接下来生成什么”的直接、显式控制信号,用口语指令控制很难;三是长时程生成里小误差会累积成 drift、失稳直至视觉崩溃,很多模型只能出有限时长、撑不住开放式长流;四是实时不只是建模问题,还要配推理 kernel、serving 系统、调度和大规模部署基础设施,否则模型再强也太慢太贵。Vidu S1 就是冲着这四点做的:用户可随时介入、语音作显式控制信号、缓解流式误差累积以支持稳定长时程、并配一整套推理与 serving 工程栈。相比 Kling Avatar 2.0 这类”能跟指令但非实时”的方案,Vidu S1 是论文对比表里唯一同时打勾”指令跟随”和”实时”的模型。
模型架构
核心是一个视频-音频联合的自回归扩散模型,把画面和声音一起生成。记第 i 帧的干净视频表征 v、干净音频表征 a,联合态就是沿模态维拼接的 x_0^i = [v_0^i; a_0^i];统一的条件接口 c 里同时装了语音、文本 prompt 和参考图(首帧)。生成是逐帧因果自回归:当前联合态既看条件序列 c^{≤i},也看已生成的历史视频-音频前缀。
模型没有走一步到位训练,而是分双向 teacher → 因果 teacher → 少步蒸馏三步演化出来的(见训练方法)。真正上线做实时推理的是最后蒸出来的少步因果生成器。位置编码用 RoPE,并针对流式做了 RoPE Repositioning 改造(见 Infra)。论文没有披露主干参数量、层数、隐藏维度、VAE/tokenizer 的具体规格,也没给音频侧编码器的细节,这些都是未披露。
数据
原始视频分两类采集,各有分工:直播/talking-head 视频主要用来学细粒度的面部表情、身体动作和唇同步;影视高质量片段用来提升跨镜头角度、场景、视觉风格的泛化与一致性。所有数据进流水线前先全局去重,再按帧率、分辨率、音视频完整性、音视频同步做预过滤。
整条数据流水线(论文 Figure 2)是六段渐进精炼:
- Prefiltering — 滤掉低帧率/低分辨率、音视频不完整、音画不同步的视频。
- Clipping — 按镜头边界切成单镜头 clip,长镜头再切、切点约束不落在语音中间,最终 clip 时长 3–60 秒。
- Subject Filtering — 保留单人、单镜头 clip。
- Other Filtering — 画面内容/视觉质量、内容安全、镜头稳定性、交互性等过滤。
- Diarization — 说话人分离与筛选。
- Caption + Embedding — 打标并 embed 成训练数据。
过滤上作者的做法是专家模型 + Omni 模型联合。他们发现专家模型有短板:人脸检测对夸张/高度风格化的 2D 动画主体泛化差,图像式专家模型只看采样帧、缺全局判断。于是引入一个 Omni 模型(引用 Qwen3-omni 与 Gemini)对整段视频做全局语义理解作补充,覆盖 editing、subject、action、emotion、face、speech、scene、shot、tone。具体聚焦六个过滤面:主体检测(每 clip 恰好一个主体、占画面比例合理)、帧洁净度(滤水印/字幕/叠加广告)、视觉质量(美学+技术打分,剔除 blur/jitter/flicker)、内容安全(滤 NSFW 等)、镜头稳定性(保留静态或慢动作镜头,专门为降低长时程生成的 shot drift 风险)、交互性(主体要有清晰动作/行为,好让模型学有意义的运动)。
**语音分离(Diarization)**是这套数据里比较讲究的一环,因为高保真唇同步要求模型看到的视觉表演与语音一致。做法是抽出语音分量,用 VAD + active speaker detection 标注每段语音的时间戳和说话人,再按”说话人是否等于屏上主体”分三类:onscreen(匹配)、offscreen(不匹配任何可见主体)、overlap(多声重叠)。含 overlap 的 clip 直接丢弃。作者还观察到 diarization 在歌唱或强背景音乐场景不稳,常把人声误分到音乐 stem 或引入合成音色/失真,于是加了条启发式规则:丢弃”说话人在发声但语音能量占比过低”的段,保语音信号干净。
打标(Captioning)用两种粒度互补:full-clip caption 给整段一个连贯的全局语义锚点;speech-aware chunk-level caption 与对应时间区间对齐,为可控的交互式流式生成提供细粒度、时间局部的条件信号。为降跨模态幻觉,用 dual-path 策略解耦视觉和听觉——视觉属性只从视频帧推断,声学属性只从音轨推断。标注的属性维度包括主体外观、动作、运动、情绪、场景、镜头语言、电影化属性、光照、屏上文字、对话、音效、背景音乐。数据集规模、时长、样本量等绝对数字未披露。
训练方法
三阶段:双向 teacher 打底 → 因果 teacher 适配流式 → DMD+PCM 蒸成少步生成器。
Stage 1 双向 teacher。 先在完整视频-音频序列上训一个双向 teacher,条件是整段 c^{1:N},对整段联合态做去噪,目标是标准的 MSE(x̂_0 = f^bi(x_{t_j}, t_j, c),L_bi = E‖f_θ(·)−x_0‖²)。这一步建立高质量的生成先验,给后面的因果适配和蒸馏打基础。
Stage 2 因果 teacher。 从双向 teacher 初始化,加因果 attention mask,让每个目标态只能看因果条件上下文和合法的历史前缀,适配到流式自回归设定。对 i>1 只去噪当前联合态,条件是 c^{≤i} 加历史视频-音频前缀。关键是用 Teacher Forcing + Diffusion Forcing 混合训练缩小训练-推理 gap:每个样本按 Bernoulli(p) 抽一种——Teacher Forcing 时历史前缀是干净的 ground-truth(τ=0),提供稳定的条件同步与运动一致监督;Diffusion Forcing 时历史前缀是带噪态(τ>0),提升模型对推理阶段不完美前缀的鲁棒性。作者引的正是自家 Causal-RCM 那套”统一 teacher-forcing 与 self-forcing”的开源配方(另有 Causal Forcing / Causal Forcing++ 系列)。
Stage 3 DMD + PCM 蒸馏。 自回归 warm-up 后模型每帧仍需大量去噪步、推理慢,于是用 DMD(Distribution Matching Distillation) 把自回归生成压到少数几步。因果生成器依前一步生成的带噪前缀递归产出整段序列,DMD 用最小化生成分布与数据分布差异的梯度优化。但作者发现只用 DMD 常 mode collapse——表现为 camera drift、内容退化、时间不一致;于是加了 PCM(Phased Consistency Models) 正则,用感知特征距离约束(EMA student 作参考),最终用 DMD 与 PCM 一致性目标的加权组合来训。上线推理用的就是这个少步生成器(评测里是 3-step 配置)。
论文没有做传统 RLHF/偏好优化的 RL,主要靠这套”混合 forcing + 蒸馏 + 一致性正则”的流式训练配方。学习率、batch、训练步数、GPU 规模等训练超参未披露。
Infra(训练 / 推理工程)
这是 Vidu S1 着墨最多、也最有分量的部分,推理工程对齐自研 TurboDiffusion(arXiv:2512.16093,号称把视频扩散加速 100–200 倍)的技术路线,并以 TurboServe(arXiv:2606.19271)作 cluster 级流式 serving 参考,硬软协同做实时多 GPU 推理。
流式推理主干用 sliding-window decoding:任意长序列在有限内存/算力下在线自回归生成,每步的 attention 只限于一个固定长度的滑窗,含三部分——(1) persistent reference context:从用户给的首帧加首个生成态提取的 latent tokens,只算一次、全程固定,作用类比 LLM 的 sink token 与流式视频里的 sink frame,提供稳定的全局条件;(2) 窗内缓存的历史视频-音频态;(3) 当前正在去噪的态。固定窗保证每步推理时延恒定,不随生成长度增长——这是能”无限时长”且实时的前提。
在此之上有两个缓存技巧:
- RoPE Repositioning:在施加 RoPE 之前就缓存历史 KV 特征;滑窗前移时,按更新后的相对位置对缓存特征重新施加 RoPE,避免重复重算历史特征,既保跨窗位置一致、又让所有可见位置落在训练见过的位置范围内。
- TwinCache(stage-aware 缓存):为每个历史态同时维护 noisy 和 clean 两份缓存。中间去噪步用 noisy cache,末次去噪步换成 clean cache。noisy cache 保留残余噪声,起到保粗时序动态、抑制长自回归序列里高频伪影累积的隐式 low-pass 先验作用;末步的 clean cache 则恢复细粒度视觉细节和身份一致。以此把时序传播和外观精修解耦,平衡长时序一致与视觉保真——这是它宣称”无 drift、无模糊、无失真”的技术抓手。
推理基础设施的具体优化:
- 注意力加速:用 SageAttention、SpargeAttention、Sparse-Linear Attention(SLA)降 attention 时延(这些都是同组 Jintao Zhang 等人的工作,Jintao Zhang 也是本文 core/项目 lead)。
- 线性层量化:per-tensor 和 per-channel 量化都容易被 outlier 拉大量化范围导致精度损失,于是实现自定义 per-block W8A8 量化 GEMM CUDA 算子,降显存并显著加速线性层。
- Kernel Fusion:把算子序列融成自定义 Triton/CUDA kernel(典型如 RMSNorm 与选定 elementwise 融合),降 launch 与同步开销、避免中间张量落全局显存。
- CUDA Graph:流式生成的算子计算时间短、过程固定重复,host 侧 launch 开销会累积成瓶颈;用 CUDA Graph 把固定结构子图一次捕获、多次 replay,把众多独立 kernel launch 并成一次 graph launch,提 GPU 利用率。
- 多卡并行:用 Ulysses 式 context parallelism(DeepSpeed Ulysses)跨多 GPU 分序列切片做前向,attention 前后用 all-to-all 在 sequence-parallel 与 head-parallel 布局间重分区,并进一步优化底层通信降开销。
训练侧的 infra(GPU 数、并行策略、混合精度、吞吐)未披露,论文工程篇幅几乎全在推理和 serving。
评测 benchmark
用两个基准:自建的 Vidu-StreamBench 和公开的 HDTF;实时性在 RTX 5090 上测。
HDTF 定量对比(Table 1),指标是 CSIM(身份保持,ArcFace,↑)、Sync-D(音视频同步,↓越好)、DOVER(感知质量,↑)。Vidu S1 三项全面最优,且是唯一同时”指令跟随✓ + 实时✓“的:
| 模型 | 指令跟随 | 实时 | 分辨率 | FPS | CSIM↑ | Sync-D↓ | DOVER↑ |
|---|---|---|---|---|---|---|---|
| OmniAvatar | × | × | 480p | – | 0.8062 | 9.242 | 0.5476 |
| StableAvatar-1.3B | × | × | 480p | – | 0.8358 | 11.18 | 0.5560 |
| Hallo3 | × | × | 480×720 | – | 0.7698 | 8.660 | 0.5313 |
| Wan2.2-S2V-14B | × | × | 480p/720p | – | 0.7936 | 8.255 | 0.5510 |
| LiveAvatar | × | ✓ | – | – | 0.8127 | 8.447 | 0.5639 |
| LemonSlice | × | ✓ | 368×560 | – | 0.8407 | 7.921 | 0.5196 |
| HeyGen | × | ✓ | – | 25 | – | 8.037 | 0.4864 |
| Kling Avatar 2.0 | ✓ | × | – | – | 0.8688 | 8.158 | 0.5406 |
| Vidu S1 | ✓ | ✓ | 540p (960×540) | 42 | 0.9192 | 7.8470 | 0.5660 |
Vidu-StreamBench 是自建基准,500 个样本,每个由”一条动作指令 + 参考首帧 + 一段音频”组成,覆盖多样的动作命令、参考图风格、说话人属性、情绪和应用场景,专门测能否在真实流式交互里跟随指令、产自然运动、保身份、维持连贯音视频。对 HeyGen、LemonSlice、Kling Avatar 2.0 做成对 A/B 人类偏好测(Ours / Same / Other,Figure 3):
- vs HeyGen:整体 56/16/28,运动动态 68/18/14,音视频同步 52/28/20,主体可控性 100/–/–;
- vs LemonSlice:整体 46/24/30,主体可控性 100/–/–;
- vs Kling Avatar 2.0:整体 48/22/30,音视频同步 60/16/24,主体可控性 60/24/16。
“主体可控性”对 HeyGen 和 LemonSlice 拿到 100% 偏好——因为这类任务需要 avatar 跟随显式动作指令,而它们本质是被动的语音驱动面部动画,做不了。定性上(Figure 4)与 Kling Avatar 2.0 同条件对比,“抬头做沉思状""举手竖大拇指”这类指令 Kling 失败、Vidu S1 正确执行。
实时能力:540p、3-step 配置下,RTX 5090 上平均吞吐 42 FPS,超过 30 FPS 的实时播放阈值,且是在保持上述 HDTF 强身份一致/同步/质量的同时达到的,即实时不牺牲质量。(注意规格口径:论文与 GitHub 讲”up to 42 FPS”,产品页把默认写成 540P+25FPS、最高 42FPS;Notion 规格表也写 540P+25FPS,Web 单次调用 10 分钟、API 无时长限制。)
创新点与影响
把这篇工作放在实时交互视频这条新赛道上看,几个点值得记:
- 语音作显式实时控制信号 + 无限长流式:不是”给完整 prompt 再一次性出视频”,而是生成过程中用户随时用语音指挥数字人动作,且靠固定滑窗 + TwinCache 缓解误差累积,做到无限时长不 drift/崩溃。论文对比表里它是唯一同时满足”指令跟随”和”实时”的。
- 视频-音频联合自回归生成:画面和声音一起生成、唇同步靠数据侧的 diarization 对齐来保证,而不是先生成画面再配音。
- 三阶段训练配方:双向 teacher 打先验 → 因果 teacher 用 Teacher/Diffusion Forcing 混合适配流式 → DMD+PCM 蒸成 3 步生成器,用 PCM 一致性正则专门压 DMD 的 mode collapse。
- 一整套实时推理工程栈:TurboDiffusion(SageAttention/SpargeAttention/SLA + per-block W8A8 + kernel fusion + CUDA Graph + Ulysses 并行)与 TurboServe 配套,把”实时”从纸面能力做成消费级 GPU 上可跑。这也是团队自身注意力加速/量化研究成果的一次系统集成落地。
影响:它把生数 Vidu 的产品形态从离线视频生成推向”实时数字人交互”,直指直播带货、游戏陪玩、虚拟主持、教育/客服 agent 等时延敏感场景,且已在 vidu.com/vidu-stream 与 MaaS API 平台开放。
已知局限:① 未开源权重/代码,GitHub 仓库只是文档与链接聚合,评测无法第三方复现;② 主干参数量、VAE/tokenizer 规格、训练数据规模、训练算力等几乎全部未披露,论文重推理工程、轻模型与数据披露;③ 基准里 Vidu-StreamBench 是自建、HDTF 对比的部分商用系统(HeyGen/LemonSlice/Kling)为闭源,可比性有保留;④ 官方 FAQ 自陈复杂指令失败率更高,腿部等大动作需用含腿全身图,能力边界仍在。
原始链接
- arxiv_abs: https://arxiv.org/abs/2607.03118
- arxiv_pdf: https://arxiv.org/pdf/2607.03118
- github: https://github.com/shengshu-ai/Vidu-S1
- project / demo: https://vidu.com/vidu-stream (中文 https://vidu.cn/vidu-stream)
- HuggingFace papers: https://huggingface.co/papers/2607.03118
- API platform: https://platform.vidu.com/live/landing
- Notion 使用说明: https://auspicious-passive-36a.notion.site/Vidu-S1-Introduction-34324005a3e48009b3f3d9c07c79d83b
一手源存档(sources/)
- arxiv-2607.03118.pdf (arXiv 全文 PDF,13 页,不入 git;HTML 版不可用)
- vidu-s1—arxiv-abs.md
- vidu-s1—paper-notes.md
- vidu-s1—product-page.md
- vidu-s1—github-readme.md
- vidu-s1—notion-guide.md
- vidu-s1—hf-paper.md