一句话定位
LARP(University of Maryland, College Park,2024-10,ICLR 2025 Oral)指出传统 patchwise 视频 tokenizer 把离散 token 与输入 patch 位置一一绑定,既限制了 token 的全局语义表达能力,又留下”如何把 2D/3D patch 网格展平成 1D 序列”这个无解的手工设计难题;LARP 用一组可学习的整体查询(holistic queries)替代逐 patch 编码,并在训练期联合一个轻量 AR 先验 transformer去反向塑造 tokenizer 的隐空间,让离散 token 天然适配自回归生成,在 UCF-101 上把 AR 类视频生成模型的 FVD 刷到 57,超过包括闭源 MAGVIT-v2 在内的所有已发表方法。
背景与定位
自 VQ-VAE、taming-transformers-vqgan(VQGAN)确立”编码器+量化器+解码器”的离散视觉 tokenizer 范式以来,vit-vqgan 把 ViT 架构和分解式(factorized)codebook 引入图像 tokenizer;视频侧则有 C-ViViT、magvit-masked-generative-video-transformer(MAGVIT)及其后继 magvit-v2(引入 lookup-free quantization,大幅扩容 codebook)、OmniTokenizer(图像/视频共用同一 tokenizer)等工作。这些方法无一例外都是 patchwise 的:每个离散 token 直接对应输入视频某个时空位置的 patch,天然带有局部归纳偏置,也迫使 AR 模型必须依赖某种(通常是 raster-scan)展平顺序才能把网格数据变成 1D 序列——而这个顺序是否最优,此前没有定论。
另一条被论文重点指出的现象:tokenizer 的重建质量(rFVD)与下游 AR/MLM 模型的生成质量(gFVD)之间存在 gap,且重建质量更高有时反而生成质量更差(呼应 Rethinking VQ Objectives、maskgit 等工作的观察)。LARP 认为根源在于 tokenizer 训练目标只优化重建,没有显式考虑隐空间是否适合下游自回归建模。
LARP 的定位是为二阶段视频生成流水线(先 tokenize,再训练 AR 生成模型)设计一个”AR 友好”的视频 tokenizer,路径是:(1) 用一组与输入 patch 网格解耦的可学习整体查询做holistic tokenization,天然去掉了展平顺序问题;(2) 在 tokenizer 训练时”偷偷”跑一个轻量 AR 先验模型去预测下一个 holistic token,用这个信号反向推动 tokenizer 学出对 AR 建模友好的隐空间结构,该先验模型在推理时被完全丢弃、不增加任何推理开销。方法定位与同期把 AR 生成器用于视频世界模型/生成任务的工作(如 cogvideo、ivideogpt)互补——LARP 解决的是”tokenizer 本身该怎么设计”,而非 AR 生成器结构本身。
模型架构
整体范式:ViT 风格时空 patchifier + parallel transformer encoder 构成的 autoencoder(编码器 E、解码器 D),配合一个 Stochastic Vector Quantization(SVQ)量化器 Q;额外引入一个仅训练期存在的轻量 AR 先验 transformer。
- Patchify:输入视频 V∈R^{T×H×W×3},用时空 patch size f_T=4, f_H=8, f_W=8 线性切片;主实验固定输入为 16 帧、128×128 分辨率的视频片段,切出 4×16×16=1024 个 patch,线性投影为 1024 个连续 patch embedding E。
- Holistic tokenization(核心机制):定义 n 个可学习的整体查询 embedding Q_L∈R^{n×d},与 patch embedding E 沿 token 维拼接成长度 (n+m) 的序列送入 transformer encoder;只对查询位置对应的输出 Z_{1:n,:} 做量化得到离散 token x=(x_1,…,x_n),patch 部分的输出不参与量化。这样每个离散 token 都能”看到”任意视频 patch(encoder 的自注意力做了全局信息混合),彻底摆脱了”token 对应固定 patch 位置”的局部约束,也不再需要人为定义展平顺序。默认 n 与 m 相同(均为 1024)。
- 解码:解码器同样是 transformer encoder 架构,用 m 个可学习的 patch 查询 embedding Q_P 与去量化后的隐向量 Ẑ 拼接送入解码器,取前 m 个输出 reshape 回视频。
- Stochastic Vector Quantization (SVQ):codebook C∈R^{c×d’},采用 factorized codebook(遵循 ViT-VQGAN 的做法),codebook size c=8192、码本维度 d’=8;量化时计算输入向量与全部码字的余弦相似度 s,softmax(温度 0.03)得到概率 p,再从多项分布采样索引 x(而非标准 VQ 的 argmin 最近邻),用 straight-through estimator 保持可微;去量化即按索引查表。训练 AR 生成模型阶段,SVQ 被切换为确定性模式(即变为标准最近邻查找)以保证隐表示稳定(Appendix A.2)。
- 位置编码:编码器对 patch 用固定 3D sin-cos 位置编码,解码器对 holistic token 用固定 1D sin-cos 位置编码;查询 embedding 本身按位置可学习,无需额外位置编码。
- AR 先验模型(Continuous AR Transformer,仅训练期存在):基于小型 GPT-2 改造,仅 21.7M 参数。为解决”离散 AR 建模会阻断梯度回传到 encoder”以及”codebook 训练中持续演化、标准离散 embedding 查找层不稳定”两个问题,把标准 AR transformer 的输入层换成对去量化隐向量 Ẑ 的线性投影(保证梯度可回传),输出层不再预测词表 logits,而是按 SVQ 同款机制预测下一个 token 的估计 embedding v̄,再与 codebook 做余弦相似度+softmax 得到概率算 NLL loss。
- Scheduled sampling:先验模型每个训练 iteration 前向两轮——第一轮用真实输入序列预测,第二轮把第一轮预测结果与真实序列按 token 级随机混合后再前向一次;混合比例做线性 warm-up,从 0 升到峰值 0.5(在总训练步数 30% 处达到峰值);两轮 NLL loss 取平均。
- 损失整合:总损失 L = L_rec + α·L_prior,α=0.06(主实验),先验模型参数使用 50× 于 tokenizer 主体的学习率倍率;L_rec 由 L1 重建损失、LPIPS 感知损失、GAN 损失(判别器为 ViT 架构、与 patch 设置一致,每 5 步更新 1 次、判别器学习率为 tokenizer 学习率的 30%,配 LeCam 正则,GAN loss 权重 0.3)与 SVQ 损失(commitment loss 权重 0.25、codebook loss 权重 1.0,SVQ 总权重 0.1)组成。
- 规模档位(Fig. 3a,UCF-101 上、固定 1024 token):LARP-S 39.8M、LARP-B 116.3M、LARP-L 173.0M(tokenizer 总参数,含先验模型?论文未明确区分,按上下文应为 tokenizer 主体参数)。
- AR 生成模型:Llama 风格 transformer,但改用绝对可学习位置编码(区别于原版 Llama/Lingua 的 RoPE);token dropout 0.1,residual/feedforward dropout 均 0.1;UCF-101 class-conditional 生成任务用 1 个 [cls] 类别 token,K600 frame-prediction 任务用 1 个 [sep] 分隔 token。主表中出现 343M 与 632M 两档生成器参数量;默认档为 632M。采样用 Classifier-Free Guidance,scale=1.25,不使用 top-k/top-p。
数据
- 数据集:UCF-101(Soomro, 2012,class-conditional 视频生成基准)与 Kinetics-600(K600,Carreira et al. 2018,frame-prediction 基准);论文未在正文给出两个数据集具体的样本/帧数统计,直接使用两者官方划分。
- 视频格式:所有实验统一用 16 帧、128×128 分辨率片段(沿用 TATS / MAGVIT 系列的设置)。
- Tokenizer 训练数据:UCF-101 + K600 合并训练(跨数据集联合训练一个通用 tokenizer),75 epoch、batch size 64,约 50 万训练步;LARP-L-Long 变体训练 150 epoch、batch size 128。数据增强仅用随机水平翻转。
- AR 生成模型训练数据:UCF-101 class-conditional 生成模型只用 UCF-101 训练集,默认 1000 epoch、batch size 32;最优档(Table 1 末行,632M 参数)训练 3000 epoch、batch size 64。K600 frame-prediction AR 模型用 K600(该任务用前 5 帧预测后 11 帧,构成完整 16 帧片段),论文未给出该模型独立的 epoch/batch 数字。
- 全部为真实自然视频,无 sim-to-real 或跨模态协同训练设计;tokenizer 侧和 AR 生成器侧均只用单一来源的视频数据,无额外数据配比或过滤规则。
训练方法
- 两阶段流水线:Stage 1 训练 LARP tokenizer(联合 AR 先验模型端到端优化,先验模型仅提供梯度信号、推理期丢弃);Stage 2 冻结(SVQ 切换为确定性)tokenizer,在其离散 token 序列上训练 Llama 风格 AR 生成模型。
- Tokenizer 优化器:Adam,学习率 1e-4,β1=0.9,β2=0.95,warm-up + cosine 学习率调度。
- AR 生成模型优化器:AdamW,β1=0.9,β2=0.95,weight decay 0.05,学习率 6e-4,warm-up + cosine 调度。
- 消融研究(Table 2,均基于 LARP-B,UCF-101):
| 配置 | PSNR↑ | LPIPS↓ | rFVD↓ | gFVD↓ |
|---|---|---|---|---|
| LARP-B(完整) | 27.88 | 0.0855 | 31 | 107 |
| 去掉 AR 先验模型 | 27.95 | 0.0830 | 23(最优重建) | 190(最差生成) |
| 去掉 scheduled sampling | 27.85 | 0.0856 | 27 | 142 |
| 确定性量化(去掉 SVQ,退化为标准 VQ) | 27.65 | 0.0884 | 27 | 149 |
| 减小先验模型损失权重 α=0.03 | 27.83 | 0.0866 | 28 | 120 |
| 去掉 CFG | 27.88 | 0.0855 | 31 | 121 |
结论:AR 先验模型对生成质量贡献最大(去掉后重建最好但生成质量骤降,直接印证”重建优化目标≠生成友好隐空间”的论文动机);scheduled sampling 与 SVQ(相对标准 VQ)也是关键设计;先验损失权重与 CFG 影响相对较小。
Infra(训练 / 推理工程)
- GPU 数量、GPU-hours、并行策略(DP/FSDP/TP 等)、混合精度设置:论文正文与附录均未披露具体训练算力规模。
- GitHub 仓库提供的训练脚本按单 GPU 配置编写(源码注释提到”脚本按 8-GPU 机器配置,GPU 数更少需调整 batch size 和 dataloader worker 数”,但未给出实际使用的 GPU 型号/数量/总训练时长)。
- 推理:官方采样脚本(
sample.py)默认用--dtype bfloat16;论文未披露推理 FPS、控制频率或延迟数据。 - AR 先验模型因仅 21.7M 参数且训练期结束即丢弃,对推理侧无内存/算力开销(这是论文明确强调的设计目标,但不构成量化的 infra 数据)。
评测 benchmark
主评测指标为 Frechét Video Distance (FVD)。Table 1 按生成范式分组对比 UCF-101 class-conditional 生成(gFVD-UCF)与 K600 frame-prediction(gFVD-K600,5 帧输入预测后 11 帧):
| 方法 | Tokenizer 参数 | Generator 参数 | Tokens | rFVD↓ | gFVD-K600↓ | gFVD-UCF↓ |
|---|---|---|---|---|---|---|
| 扩散类(连续 tokenizer) | ||||||
| VideoFusion | - | 2B | - | - | - | 173 |
| HPDM | - | 725M | - | - | - | 66 |
| MLM 类(离散 tokenizer) | ||||||
| MAGVIT-MLM | 158M | 306M | 1024 | 25 | 9.9 | 76 |
| MAGVIT-v2-MLM | - | 307M | 1280 | 8.6 | 4.3 | 58 |
| AR 类(离散 tokenizer) | ||||||
| CogVideo | - | 9.4B | 2065 | - | 109.2 | 626 |
| TATS | 32M | 321M | 1024 | 162 | - | 332 |
| MAGVIT-AR | 158M | 306M | 1024 | 25 | - | 265 |
| MAGVIT-v2-AR(闭源) | - | 840M | 1280 | 8.6 | - | 109 |
| OmniTokenizer | 82.2M | 650M | 1280 | 42 | 32.9 | 191 |
| LARP-L(Ours) | 173M | 343M | 1024 | 24 | 6.2 | 107 |
| LARP-L-Long(Ours) | 173M | 343M | 1024 | 20 | 6.2 | 102 |
| LARP-L-Long(Ours,更大生成器) | 173M | 632M | 1024 | 20 | 5.1 | 57 |
- LARP-L-Long(632M 生成器)在 UCF-101 上取得 gFVD=57,超过所有已发表方法,包括闭源的 MAGVIT-v2-AR(109);在 AR 类方法内部,LARP 在 UCF-101 与 K600 两个基准上都大幅领先其他 AR 方法(如 K600 上 6.2/5.1 vs OmniTokenizer 的 32.9、CogVideo 的 109.2)。
- Scaling 实验(Fig. 3,UCF-101,无逐点数值表,仅定性描述):(a) 固定 1024 token,tokenizer 从 LARP-S(39.8M)→LARP-B(116.3M)→LARP-L(173.0M) 放大时,rFVD 持续改善,但 gFVD 在 B→L 之间出现饱和(不再同步提升);(b) 固定 LARP-B + 默认 AR 生成器,token 数从 1024 降到 512、256 时,rFVD 与 gFVD 均上升,但 512→256 区间 gFVD 恶化速度慢于 rFVD,说明 holistic 表示在低 token 数下的生成效率相对更高。
- 消融数据见上”训练方法”节 Table 2。
创新点与影响
- 核心贡献:(1) 提出holistic tokenization——用可学习查询代替逐 patch 编码,让离散 token 与输入 patch 位置解耦,天然支持任意数量的 token 且不再需要人工设计展平顺序;(2) 提出训练时协同的轻量 AR 先验模型,通过对隐空间做下一 token 预测的监督信号,把 tokenizer 的隐空间”扳向”对 AR 生成友好的结构,且推理期零开销;(3) 在 UCF-101 上取得 AR 类视频生成模型的新 SOTA(gFVD 57),并大幅缩小了 tokenizer 的 rFVD 与下游 gFVD 之间的 gap(Fig. 1c)。
- 对领域的影响:直接质疑了”tokenizer 只需专注重建质量”的传统设计假设,用实证(消融中”去掉 AR 先验→重建最优但生成最差”)证明重建与生成友好性可能是两个需要分别优化的目标;同时为把 AR/自回归范式统一应用到多模态大模型(MLLM)处理视频生成与理解提供了一个候选 tokenizer 方案。
- 论文自陈的局限 / 未尽事项:正文未设专门 Limitations 小节,但从结果中可提炼:① tokenizer 规模从 B 扩大到 L 时 gFVD 出现饱和,rFVD 提升未能同步转化为生成质量提升,扩展性上限不明;② holistic token 数量(1024/512/256)与生成质量、推理速度之间的权衡仍需人工选择,论文未给出自动化选择准则;③ 论文未讨论/对比 AR 生成范式相对扩散、MLM(并行去噪/掩码填充)在推理速度上的天然劣势;④ 未披露具体训练算力规模(GPU 数、总训练时长),可复现性依赖开源代码与预训练权重。
原始链接
- arXiv: https://arxiv.org/abs/2410.21264
- PDF: https://arxiv.org/pdf/2410.21264
- GitHub: https://github.com/hywang66/LARP
- 项目主页: https://hywang66.github.io/larp/
- HuggingFace(tokenizer): https://huggingface.co/hywang66/LARP-L-long-tokenizer
- HuggingFace(AR 生成模型): https://huggingface.co/hywang66/LARP-L-long-AR
- HuggingFace(AR frame-prediction 模型): https://huggingface.co/hywang66/LARP-L-long-AR-FP
一手源存档(sources/)
- larp—github-readme — GitHub README 快照(
sources/world-model/2024/larp--github-readme.md) - larp—project-page — 项目主页快照(
sources/world-model/2024/larp--project-page.md) - arXiv 全文(2410.21264v1,arXiv 原文 PDF,不入 git):见上方 arXiv 链接