一句话定位

两阶段自监督框架:Stage 1 用 JEPA + 一种叫 Density Adaptive Attention Mechanism(DAAM,高斯混合门控)的注意力模块在潜空间做遮盖预测学语音表征(不碰波形重建),Stage 2 冻结/微调该编码器接上 Finite Scalar Quantization(FSQ)+ mixed-radix 打包 + HiFi-GAN 解码器,把表征离散化成 2.5 Hz 帧率、47.5 tokens/秒的可逆语音 token——本质是把 JEPA(原本是 LeCun 世界模型蓝图里的表征学习组件)改造成一个语言模型友好的神经语音分词器。作者明确将其定位为”preliminary findings”:只报告了自监督训练损失收敛的消融,没有下游 ASR/TTS/MOS 等标准 benchmark 数字。

背景与定位

传统语音 codec(EnCodec、SoundStream、DAC 等)把表征学习和波形重建耦合在同一个目标里,编码器被迫为最小化波形级损失服务,这就把”学到语义 / 语言学结构”和”保真度重建”这两个不同目标混在了一起。本文延续 i-jepa 开创的 Joint-Embedding Predictive Architecture(context/target/predictor 三网络,损失作用在表征空间而非像素/波形空间,目标编码器 EMA 更新、停梯度)思路——即 lecun-path-autonomous-machine-intelligence 提出的 JEPA 世界模型范式——把它显式拆成两阶段:Stage 1 纯自监督表征学习(无标签、只用 MSE 遮盖预测损失),Stage 2 才引入量化和重建目标。这一拆分呼应 a-jepa(JEPA 首次进入音频领域,用于分类/理解任务)的立场,但目的不同:A-JEPA 是学分类特征,本文是要学一个可逆、可离散化、供语言模型使用的语音 tokenizer,更接近 Mimi、DualCodec、U-Codec 这条神经音频编解码器谱系,而不是纯表征学习评测谱系。

核心创新是把作者此前提出的 DAAM(Density Adaptive Attention Mechanism,高斯混合门控注意力,Ioannides et al. 2024)接入 JEPA 编码器:用可学习的高斯混合分布对时间轴统计特性建模,识别”统计上显著”的时间区域并做自适应门控,而非标准自注意力那种成对点积相似度计算。论文强调这是与常规自注意力互补的机制:标准注意力回答”哪些时刻彼此相似”,DAAM 回答”哪些时刻统计特性异常/信息量大”,且避免了全量成对注意力的二次复杂度。

这是一篇 NeurIPS 2025 UniReps workshop 论文(Unifying Representations in Neural Models),作者自陈”受限于有限算力预算,本文呈现的是初步发现”(preliminary findings)。七位作者跨 Carnegie Mellon University、University of Bristol、Stanford University、James Silberrad Brown Center for Artificial Intelligence、Northeastern University、New York University,三位作者同时标注 Amazon GenAI 归属但论文脚注明确声明”work does not relate to position at Amazon”——即这是一项独立于 Amazon 的学术合作,非 Amazon 官方工作。共同作者包含 Yann LeCun(NYU,JEPA 范式提出者)。

模型架构

Stage 1 — JEPA 编码器 + DAAM:

  • 双通路结构:context encoder(在线网络,梯度更新)与 target encoder(EMA 动量更新,τ=0.996,停梯度,仅提供稳定预测目标),两者共享架构,均为「Conv1D 下采样 + Conformer」混合设计。
  • 下采样路径:原始波形 [B,1,T_wav] 经 Conv1D 逐层下采样,通道 64→128→256→384→512→512,总 stride = 8×8×5×5×6 = 9600 samples/hop @ 24 kHz,对应约 2.5 Hz 帧率。
  • Conformer 主干:8 层 Conformer block,16 个注意力头(自注意力 + 前馈 + 卷积 + LayerNorm)。
  • DAAM 门控AttnGate 模块先用 1×1 卷积把特征投影到 1 通道,在这个 1D 时间信号上算高斯混合门控(K=4 个高斯分量,均值偏移 δ_k 和对数尺度 ν_k 可学习,softplus 保证尺度为正,log-sum-exp 聚合混合密度,ε=1e-3 数值稳定,方差下限 clamp 到 1e-6,全程 FP32 计算),再用 y = x·(1+α·gate) 缩放回全维度特征,α 初始化为 0.05 控制调制强度。原文对 DAAM 具体挂载位置存在自相矛盾的表述:2.3.1 节正文一句说”DAAM gating is applied in the encoder blocks (after the strided convolutions and residual stacks); there is no DAAM after the Conformer blocks in the current implementation”,但紧接着”Integration with DAAM”小节又写”After each Conformer block, features pass through GAttnGate modules”——两处表述直接冲突,原文未澄清,此处如实标注该矛盾而非擅自取舍。
  • JEPA 掩码:block masking,遮盖比例 ρ=0.5,最小 span 2 帧,最大 span T/4(随序列长度自适应),生成 [B,T] 二值掩码后在特征空间用可学习 mask token 替换被遮时刻(不是在波形层面遮)。
  • Predictor:仅 2 层 Conformer block(16 头),先用扩张 Conv1D 把通道数翻倍,再经中间 Conv1D 精炼,最后投影 Conv1D 降回原始维度,只接收 context(可见)区域特征,输出所有位置(含被遮位置)的预测。
  • Stage 1 损失:纯 MSE,只在被遮位置计算,对目标做 stop-gradient(公式见原文 Eq.10),不涉及任何生成式重建。
  • 崩溃监控:跟踪 predictor 输出跨 batch/时间维的标准差(不参与反向),若均值标准差 <0.01 记录警告,但不计入损失。

Stage 2 — FSQ 量化 + Mixed-Radix 打包 + HiFi-GAN:

  • FSQ(Finite Scalar Quantization):编码器特征先 tanh 投影到 [-1,1],再按每维离散边界就近取整量化(无需学习 codebook,区别于 VQ-VAE);论文给出的配置为量化档位 L=[4,4,4,4]、编码维度 C=128、温度 τ=1.0(结合下文 mixed-radix 每维 radix=4 一致,即 128 维每维 4 档);反向传播用 straight-through estimator 直通梯度。
  • Mixed-Radix token 打包:把 128 个 FSQ 维度按组大小 G=7 打包成一个整数 token(混合进制编码,Horner 法迭代计算),⌈128/7⌉=19 组,末尾 pad 5 维(radix=1);单 token 最大取值 4⁷-1=16383,词表大小 16384(与 NLP 常见子词词表量级相当)。
  • Token 速率:帧率 2.5 Hz × 每帧 19 组 = 47.5 tokens/秒;对比”不打包”(128 维即 128 token/帧 → 320 tokens/秒)与”VQ codebook”(可变速率,需学习 codebook),mixed-radix 方案在保持完全可逆(模运算精确还原)的前提下把 token 速率压到约 1/7。
  • HiFi-GAN 解码器:量化特征 [B,512,T_z] 经 ConvTranspose1D 逐层上采样,通道 512→384→256→128→64,stride 6,5,5,8,8(总 stride 9600,与编码器下采样对称),上采样卷积核 [3,7,11,15,23,32],每级 8 个多感受野(MRF)残差块,ResBlock 内含 Leaky ReLU + 空洞卷积 + 残差连接,可选加 DAAM 门控;激活函数用 SnakeBeta(周期性归纳偏置)。
  • Stage 2 损失:L_total = L_rec(L1 重建) + 2.0·L_stft(多分辨率 STFT,FFT 尺寸 [2048,1024,512,256,128]、hop [512,256,128,64,32]、Hann 窗,谱收敛+对数幅度两项) + 0.1·L_gan(多周期 MPD + 多尺度 MSD 判别器,LSGAN 生成器损失 + 特征匹配损失);判别器 warmup 5000 步(冻结),之后每步更新。

参数量(论文 Table 3):

组件参数量备注
Stage 1 在线编码器121.7M可训练
Stage 1 目标编码器(EMA)118.5M动量更新
Predictor3.2M可训练
Stage 1 合计240.2M121.7M 可训练
Stage 2 JEPA 编码器(微调)240.2Mfine-tuned
FSQ 量化器~0.01M可训练
HiFi-GAN 解码器69.2M可训练
Stage 2 合计309.5M69.3M 可训练
推理时总模型191.0M仅编码器(121.7M)+ FSQ/解码器(69.3M),不含 EMA 目标网络

数据

  • 来源:LibriLight(大规模无标注英语语音语料)。
  • 规模:两阶段合计约 9000 小时训练数据(论文未拆分 Stage1/Stage2 各自用量)。
  • 验证:held-out speakers(留出说话人,不与训练集重叠)。
  • 采样率:24 kHz;单条音频最长 15 秒。
  • 预处理:仅”重采样到 24kHz + 多声道平均转单声道”,不做任何其他归一化(归一化在模型内部完成)。
  • 未做数据配比消融、未做跨语言/跨领域数据混合——论文自陈”预训练数据规模相对当前大规模 SSL 系统仍偏小”,结论限于英语单语场景。

训练方法

  • 两阶段流水线:Stage 1 纯自监督(JEPA 遮盖预测,MSE-only),Stage 2 微调编码器 + 从零训练 FSQ 量化器与 HiFi-GAN 解码器(重建 + STFT + GAN 复合损失)。这一拆分本身是核心方法论主张:表征学习和重建质量分开优化,好处包括(a)编码器专注语义内容而非底层波形细节、(b)Stage2 微调成本降低、(c)同一编码器可复用到 TTS / 语音转换 / ASR 等下游任务、(d)Stage1 可利用大规模无标注数据扩展。
  • Stage 1 超参:AdamW(β1=0.8, β2=0.99),学习率 1.5×10⁻⁴,权重衰减 1×10⁻³,batch size 32(每卡),最长音频 15s@24kHz,训练 24,000 步
  • Stage 2 超参:AdamW(β1=0.8, β2=0.99),解码器学习率 1.5×10⁻⁴、判别器学习率 0.75×10⁻⁴,权重衰减 1×10⁻³,batch size 8(每卡),训练 29,000 步
  • 无 action-conditioning、无强化学习环节——这是一个纯语音自监督表征 + 量化 + 声码器管线,不涉及智能体/动作空间,scope 归入 world-model 是因为 JEPA 架构本身源自 LeCun 世界模型蓝图,本文是该架构在语音 tokenizer 场景的一次再利用,而非新增世界模型能力。

Infra(训练 / 推理工程)

  • 硬件:2× NVIDIA A100(80GB),分布式训练(论文正文明确写明,未提具体并行策略如 ZeRO stage,但配套 GitHub 仓库的训练脚本用 DeepSpeed,示例配置为 ZeRO Stage 2 + optimizer CPU offload)。
  • 混合精度:前向/反向 FP16,关键运算(如 DAAM 的高斯密度计算)强制 FP32 保数值稳定。
  • 梯度累积:1 step(不累积)。
  • Global batch size:Stage 1 为 64(2 卡 × 32),Stage 2 为 16(2 卡 × 8)。
  • GPU-hours:未披露。GitHub 仓库 README 给出的是默认配置(200K/800K 步)的粗略工期估计(“~2-3 天”/“~5-7 天” @ 2×A100),但论文实际报告的训练步数(24K/29K)远少于这些默认值,两者不可直接换算,故实际训练时长未披露。
  • 推理 FPS / 延迟 / 端侧硬件:未披露(论文未报告 real-time factor、控制频率或端侧部署数据)。
  • 代码开源:https://github.com/gioannides/Density-Adaptive-JEPA ,含 Stage1/Stage2 训练脚本、FSQ + mixed-radix 打包实现、HiFi-GAN 解码器(可选 DAAM)、DeepSpeed 分布式训练集成、DeepSpeed 分片 checkpoint 合并工具。

评测 benchmark

论文原文明确声明:“We report qualitative evaluations, as all variants were trained under limited computational budgets and this work presents preliminary findings”——即没有标准语音评测指标(WER、MOS、PESQ、STOI 或下游分类准确率等)的定量对比表。

论文给出的两类量化信息均是架构/效率对比,不是感知质量或任务准确率:

  1. Stage 1 训练损失收敛曲线(Figure 4,论文唯一的消融数字):JEPA+DAAM(本文方法)收敛更快、最终 MSE 约 0.09;不带 DAAM 门控的 JEPA baseline 最终 MSE 约 0.17。两者架构完全相同,仅 DAAM 门控存在与否不同。
  2. 帧率/token 速率对比表(Table 2,与神经编解码器比较):本文 2.5 Hz(19 组/帧 mixed-radix 打包);对比 U-Codec 5 Hz、Mimi 12.5 Hz、DualCodec 12.5–25 Hz、SoundStream(24kHz)75 Hz、EnCodec(24kHz)75 Hz、DAC(44.1kHz)86 Hz——本文帧率是列表中最低的,即压缩率最高,但这只是帧率数字,不代表重建保真度或下游任务表现优于这些 baseline。

论文列出的”Baselines”一节(JEPA baseline / WavLM-Large / JEPA+DAAM)只是声明了三个待对比对象,正文中并未给出三者在任何下游任务上的实际数字对比。

创新点与影响

贡献(论文原文三点自述):

  1. 把 DAAM(基于高斯混合的门控)接入 JEPA 编码器,在自监督学习中做自适应特征选择——用统计显著性门控替代/补充标准成对自注意力。
  2. 基于 mixed-radix FSQ 打包的高效分词方案,达到 47.5 tokens/秒,远低于多数现有神经音频编解码器,同时保持严格可逆。
  3. 两阶段训练范式,把表征学习与重建目标彻底解耦,允许纯自监督预训练之后再做面向重建的微调。

论文自陈局限(原文 Limitations and Future Work,四点):

  1. 固定掩码策略:block masking 的 span 分布固定,可能无法适配不同语速或语言学结构,未来考虑对声学/语言学边界敏感的自适应掩码。
  2. 单语种评测:实验仅限英语(LibriLight),对声调语言、形态丰富语言的泛化性未知。
  3. 数据规模有限:预训练数据量相对大规模 SSL 系统仍偏小,结论只能视为”初步能力”的观察,不构成规模化验证。
  4. 未做跨模态扩展:音频-视觉或音频-文本联合嵌入预测是作者列出的未来方向,本文仅做单模态音频。

综合看,这篇论文的定位更像一个方法论 demo + 消融研究——证明 JEPA 表征学习范式可以被改造成一个可逆、低帧率的语音 tokenizer,并且 DAAM 门控能让 Stage1 的自监督预测损失收敛得更快更低——而非一个已经在标准语音基准上验证过重建质量或下游任务性能的成熟系统。

原始链接

一手源存档(sources/)