一句话定位
A-JEPA 把 i-jepa 的联合嵌入预测架构(context/target/predictor 三网络、在表征空间里做遮盖预测而非重建像素/token)从图像搬到音频:把音频转成 Mel 频谱图切成 patch,用一套由易到难的课程式掩码策略(随机 block → 时频感知掩码)遮住其中一部分,让 context encoder 在可见 patch 上编码,predictor 据此预测被遮 target patch 在潜空间里的表征(由 EMA 更新的 target encoder 给出监督信号),全程不重建像素、不用对比学习负样本。仅用 AudioSet 音频自监督预训练(无 ImageNet、无文本),在 6 个音频/语音分类任务上取得当时最优,比同类掩码重建法 Audio-MAE 在 AudioSet-2M 上高 +1.3 mAP。作者称这是 JEPA 范式首次被应用到音频领域。
背景与定位
自监督视觉表征学习里,i-jepa 证明了”预测发生在抽象表征空间而非像素/token 空间”能学到更语义化的特征,同时避免生成式方法(MAE、BEiT)里无关像素细节带来的干扰。论文把音频自监督预训练分成两条既有路线:
- 迁移 ImageNet 监督预训练的 ViT/ResNet 骨干到频谱图(AST、PSLA、HTS-AT、MBT、PaSST 等,把 3 通道 RGB patch embedding 压成 1 通道频谱图 patch embedding,复用其余 Transformer block);
- 音频专属自监督方法,按输入信号类型再分为原始波形(wav2vec 2.0、data2vec)、帧级特征(HuBERT、Conformer)、频谱图 patch(SS-AST、MAE-AST、Audio-MAE),按目标函数分为对比学习或预测/重建。
A-JEPA 的架构直接沿用 Audio-MAE(Huang et al. 2022, Masked Autoencoders that Listen)的频谱图 patch 化、shifted local attention 解码器等工程设计,但把 Audio-MAE 的”像素级重建”目标换成 JEPA 式”表征级预测”目标,并针对音频频谱图(时间和频率轴高度局部相关,随机 block 掩码容易靠邻近上下文”猜”出来,比图像更容易泄漏信息)新增两处专属设计:预训练阶段的课程式掩码退火、微调阶段的正则化掩码(regularized masking, RM)替代直接置零/丢弃 patch。论文明确定位为”JEPA 范式在音频领域的首次尝试”,并把未来方向指向多模态(视频+文本)联合嵌入自监督,本文本身只做音频单模态。
模型架构
三网络结构(与 I-JEPA 一致):context encoder E_θ、target encoder E_θ~(context encoder 权重的 EMA,不接收梯度)、predictor P_φ(条件于 context 表征,预测 target 区域的表征)。encoder/predictor 均为标准 ViT(Vision Transformer)堆叠。
输入与 patch 化:原始波形转为单声道、16,000 Hz 采样,25ms Hanning 窗、10ms 帧移,提取 128 维 Kaldi 兼容 Mel 频带;10 秒音频片段对应 1×1024×128 维频谱图;用 (16,16) 卷积核、非重叠 stride 切 patch,加固定正弦位置编码。
掩码采样(预训练):
- 随机 block 目标:采 4 个可重叠 target block,尺度范围 (0.15, 0.2),宽高比 (0.75, 1.5);
- 时频感知目标:采 3 个 target block,尺度范围 (0.05, 0.075),直接抹掉对应的整段时间或整段频率;
- context block:采 1 个,尺度范围 (0.85, 1.0),单位宽高比,再挖掉与任一 target block 重叠的区域。
课程式掩码(curriculum masking):每个训练 step 以 p ~ Bernoulli(f(s)) 决定用时频感知掩码(p=1)还是随机 block 掩码(p=0),f(s) = min(1, √(s·(1-c₀²)/S) + c₀²),c₀ 默认 0.01,s 为训练步数、S 为总步数——随训练推进,f(s) 从 0 渐进到 1,即掩码难度由”随机 block”逐渐退火到”时频感知”。
Decoder/predictor:16 层 Transformer(默认),带 shifted local window attention(沿用 Audio-MAE 设计),编码器输出的可见 patch 表征与可训练 mask token 一起按原始时频顺序还原、加正弦位置编码后送入 decoder,顶层线性头预测(不是像素而是)表征。宽度(embedding 维度)默认 512。
多掩码目标(multi-mask objective):单张频谱图内采样多组掩码,摊薄 target 表征计算开销(借鉴 DINO 多裁剪式和 data2vec 2.0 的效率技巧);损失为 predictor 输出与 target encoder 输出之间做 patch-normalized 的 L2/MSE 距离,在多个掩码/多个 target block 上取平均。
模型规模(ablation,Table 2):ViT-S 22M 参数、ViT-B 86M 参数(默认,12 层)、ViT-L 304M 参数。
微调阶段:丢弃 decoder/predictor,只保留 context encoder,接平均池化 + 线性分类头。引入正则化掩码(RM):在第 l 层随机选中一定比例的 patch token,这些被选中 token 在自注意力权重计算中被排除(不参与影响其它 token 的注意力分布),但它们自身的输出完全由其余(未选中)token 贡献——从而强迫网络只用局部邻居信息也能产出有意义表征;RM 仅在微调阶段使用,测试/推理时仍用原始(无 RM)注意力计算,默认掩码比例 10%。
该工作不含 action-conditioning / cross-embodiment——它是一个音频表征学习编码器(分类任务),不是带动作/规划接口的具身世界模型;被归入 world-model/jepa 类别是因为 JEPA 家族本身被 LeCun 定位为”世界模型”谱系的通用预测架构,本文只是把它扩展到音频这一感官模态。
数据
预训练:AudioSet-2M(Gemmeke et al. 2017),~10s 弱标注音频片段,527 类声音事件、可多标签共存。原始划分:不平衡训练集 2,042,985 条 + 平衡训练集 22,176 条,评测集 20,383 条;作者实际获取并处理的子集为不平衡训练集 1.96M 条 + 平衡训练集 21k 条 + 评测集 19k 条。
微调/评测数据集(6 个任务):
- AS-2M:预训练 + 微调都用不平衡集与平衡集的并集(~2M);
- AS-20K:先在 AS-2M 上预训练,再只用 20K 平衡子集微调;
- ESC-50(环境声分类):2,000 条环境声录音、50 类、每条 5 秒,5 折交叉验证;
- SPC-2(Speech Commands v2):35 类语音命令,训练 84,843 / 测试 11,005 / 验证 9,981,每条 1 秒;
- SPC-1(Speech Commands v1):10 类关键词 + 静音类 + 未知类,用 SUPERB benchmark 的划分;
- SID(VoxCeleb 说话人识别):150K 条语音,1,251 个说话人,V1 版本划分训练/验证/测试为 128k/6k/8k。
数据增强:每条音频随机采样起始时间、循环截取 10 秒片段,幅值随机抖动 ±6dB。微调采样策略:AS-2M 有监督微调用加权采样解决类别不均衡,每 epoch 采样 200K 条(约 AS-2M 的 10%)、不放回、采样概率与该类别出现频次成反比;共微调 100 epoch,累计相当于遍历 AS-2M 约 10 遍。AS-20K 微调 60 epoch,不使用加权采样。
预训练数据规模消融(Figure 6,仅定性趋势,正文未给出具体数值表):从 AudioSet 随机采样不同规模子集预训练,下游 mAP 随预训练数据量增大而持续提升;训练轮数消融(Figure 7)显示延长训练有益,但在第 24 epoch 后趋于平台。
训练方法
预训练目标:在 target/context/predictor 三网络框架下,最小化 predictor 输出与 target encoder 输出之间的 patch-normalized L2/MSE 距离(纯表征空间预测,无重建损失、无对比负样本);target encoder 权重通过 context encoder 权重的指数滑动平均(EMA)更新。
预训练超参:24 epoch,batch size 512,学习率 2e-4(优化器、权重衰减、学习率调度等论文未披露)。
掩码课程:训练全程用式 (1)(2) 的 Bernoulli(f(s)) 在”随机 block 掩码”与”时频感知掩码”间退火切换(见上文模型架构)。
微调阶段:丢弃 decoder,仅微调 context encoder + 池化 + 线性头;用正则化掩码(RM,默认比例 10%)代替传统的整块置零/丢弃(如 SpecAug、Audio-MAE 微调阶段的做法)。论文原文在描述 AS-20K 微调设置时提到”使用 Sqrt progressive function”,但该 progressive function f(s) 本是预训练阶段掩码课程的定义,在微调段落里的具体所指原文表述含糊,这里按原文如实转述,不做过度解读。
无 RL、无蒸馏、无动作 tokenization——纯自监督表征学习 + 有监督微调两阶段流程,不涉及策略学习或强化学习信号。
Infra(训练 / 推理工程)
论文全文未披露 GPU 型号、GPU 数量、GPU-hours、并行策略(数据/模型并行)、混合精度设置等训练工程细节。也未报告推理侧的吞吐/延迟/FPS 数字(本工作是离线分类任务而非实时控制场景,论文本身没有相应指标)。唯一披露的算力相关代理指标是模型规模(ViT-S 22M / ViT-B 86M / ViT-L 304M 参数)与训练轮数/batch size(见上)。
评测 benchmark
Table 1:6 个音频/语音分类任务的横向对比(AS 系列用 mAP%,其余用 accuracy%),A-JEPA 均用 ViT-B、仅 AudioSet 预训练:
| 类别 | 模型 | 骨干/预训练数据 | AS-20K | AS-2M | ESC-50 | SPC-2 | SPC-1 | SID |
|---|---|---|---|---|---|---|---|---|
| 无预训练 | ERANN | CNN | - | - | 45.0 | 89.2 | - | - |
| 无预训练 | PANN | CNN | 27.8 | 43.1 | 83.3 | 61.8 | - | - |
| 域内自监督 | wav2vec 2.0 | Transformer/LS | - | - | - | - | 96.2* | 75.2* |
| 域内自监督 | HuBERT | Transformer/LS | - | - | - | - | 96.3* | 81.4* |
| 域内自监督 | Conformer | Conformer/AS | - | 41.1 | 88.0 | - | - | - |
| 域内自监督 | SS-AST | ViT-B/AS+LS | 31.0 | - | 88.8 | 98.0 | 96.0 | 64.3 |
| 掩码重建 | MaskSpec | ViT-B/AS | 32.3 | 47.1 | 89.6 | 97.7 | - | - |
| 掩码重建 | MAE-AST | ViT-B/AS+LS | 30.6 | - | 90.0 | 97.9 | 95.8 | 63.3 |
| 掩码重建 | Audio-MAE | ViT-B/AS | 37.0 | 47.3 | 94.1 | 98.3 | 96.9 | 94.8 |
| 本文 | A-JEPA | ViT-B/AS | 38.4 | 48.6 | 96.3 | 98.5 | 97.7 | 95.8 |
| 域外监督预训练 | PSLA | EfficientNet/IN | 31.9 | 44.4 | - | 96.3 | - | - |
| 域外监督预训练 | AST | DeiT-B/IN | 34.7 | 45.9 | 88.7 | 98.1 | 95.5 | 41.1 |
| 域外监督预训练 | MBT | ViT-B/IN-21K | 31.3 | 44.3 | - | - | - | - |
| 域外监督预训练 | HTS-AT | Swin-B/IN | - | 47.1 | 97.0 | 98.0 | - | - |
| 域外监督预训练 | PaSST | DeiT-B/IN | - | 47.1 | 96.8 | - | - | - |
(* 为对应论文的 linear-evaluation 结果)A-JEPA 在域内自监督组全面领先,且优于用 ImageNet 域外监督预训练的模型;相对 Audio-MAE 提升为 AS-2M +1.3 mAP、AS-20K +1.4 mAP、ESC-50 +2.2 acc、SID +1.0 acc。
消融实验:
- 模型规模(Table 2):ViT-S(22M) AS-20K 33.7/AS-2M 46.1;ViT-B(86M) 38.4/48.6;ViT-L(304M) 38.8/48.8——更大模型持续受益,且 S→B 的差距在微调数据从 AS-20K 换到 AS-2M 后从 4.7 mAP 收窄到 2.5 mAP。
- 预训练掩码策略(Table 3,ViT-B,掩码比例 0.75):Curriculum 48.6 > Random 47.8 > Inverse(先时频后随机)46.3。
- 微调正则化掩码(Table 4,ViT-B,比例 0.1):有 RM 48.6 vs 无 RM 48.1。
- Predictor 深度(Table 5,ViT-B,24 epoch):8 层 48.3 vs 16 层 48.6。
- Predictor 宽度(Table 6,ViT-B,24 epoch):256 维 48.0、512 维 48.6、768 维 48.5——512 维(带宽度瓶颈)最优。
- Figure 5:用 RCDM 框架训一个后验 decoder,把 predictor 输出的平均池化表征映回频谱图空间做定性可视化,显示 predictor 能捕捉被遮 target 的位置不确定性并生成风格一致的高层成分(无量化指标,纯定性)。
创新点与影响
- 作者称这是 JEPA(LeCun 提出的非生成式、表征空间掩码预测范式)首次应用到音频领域的工作,直接沿用 Audio-MAE 的频谱图 patch 化和 shifted local attention 解码器工程,但把重建目标换成表征预测目标。
- 两处音频专属设计:① 课程式掩码退火(随机 block → 时频感知),应对音频频谱图局部时频强相关、随机 block 掩码”太容易”的问题;② 微调阶段的正则化掩码(RM),用”排除注意力贡献”代替”置零/整块丢弃”,缓解预训练-微调之间的输入分布差异。
- 仅用 AudioSet 音频自监督预训练(无 ImageNet、无文本、无跨模态迁移)即在 6 个音频/语音分类任务上超过同期用 ImageNet 监督预训练的模型,为”音频表征学习不必依赖域外视觉监督”提供了证据。
- 论文自陈的局限/未来方向:仅限音频单模态,提出未来应探索多模态(如视频+文本)联合嵌入自监督,以获得更好的音频表征引导——即本文本身并未尝试跨模态联合训练。
- 核查发现(写作时验证):论文正文声明”code and models will be publicly available”,但截至 2026-07-16,作者 Zhengcong Fei 的 GitHub 账号(feizc,约 80 个仓库)中未见名为 A-JEPA 的官方仓库,Hugging Face 上也未检索到作者发布的官方模型卡——承诺的开源似乎并未兑现。仅存在第三方非官方复现(GitHub/HF 上的
ltuncay/Audio-JEPA),并非本文作者发布。 - arXiv 摘要页附有一条 admin 备注:“text overlap with arXiv:2207.06405 by other authors”,未进一步核实该关联论文内容,如实记录、不做过度解读。
原始链接
- arXiv 摘要页:https://arxiv.org/abs/2311.15830
- arXiv PDF(v3,2024-01-11):https://arxiv.org/pdf/2311.15830
- arXiv HTML(experimental):https://arxiv.org/html/2311.15830v1
一手源存档(sources/)
本工作未发现官方 blog / GitHub 仓库 / Hugging Face model card / project page(核查过程见”创新点与影响”),故无可归档的官方衍生页面;一手来源仅为 arXiv 论文本身(arXiv 原文 PDF/HTML,不入 git,见上方”原始链接”)。