一句话定位

A-JEPA 把 i-jepa 的联合嵌入预测架构(context/target/predictor 三网络、在表征空间里做遮盖预测而非重建像素/token)从图像搬到音频:把音频转成 Mel 频谱图切成 patch,用一套由易到难的课程式掩码策略(随机 block → 时频感知掩码)遮住其中一部分,让 context encoder 在可见 patch 上编码,predictor 据此预测被遮 target patch 在潜空间里的表征(由 EMA 更新的 target encoder 给出监督信号),全程不重建像素、不用对比学习负样本。仅用 AudioSet 音频自监督预训练(无 ImageNet、无文本),在 6 个音频/语音分类任务上取得当时最优,比同类掩码重建法 Audio-MAE 在 AudioSet-2M 上高 +1.3 mAP。作者称这是 JEPA 范式首次被应用到音频领域。

背景与定位

自监督视觉表征学习里,i-jepa 证明了”预测发生在抽象表征空间而非像素/token 空间”能学到更语义化的特征,同时避免生成式方法(MAE、BEiT)里无关像素细节带来的干扰。论文把音频自监督预训练分成两条既有路线:

  • 迁移 ImageNet 监督预训练的 ViT/ResNet 骨干到频谱图(AST、PSLA、HTS-AT、MBT、PaSST 等,把 3 通道 RGB patch embedding 压成 1 通道频谱图 patch embedding,复用其余 Transformer block);
  • 音频专属自监督方法,按输入信号类型再分为原始波形(wav2vec 2.0、data2vec)、帧级特征(HuBERT、Conformer)、频谱图 patch(SS-AST、MAE-AST、Audio-MAE),按目标函数分为对比学习或预测/重建。

A-JEPA 的架构直接沿用 Audio-MAE(Huang et al. 2022, Masked Autoencoders that Listen)的频谱图 patch 化、shifted local attention 解码器等工程设计,但把 Audio-MAE 的”像素级重建”目标换成 JEPA 式”表征级预测”目标,并针对音频频谱图(时间和频率轴高度局部相关,随机 block 掩码容易靠邻近上下文”猜”出来,比图像更容易泄漏信息)新增两处专属设计:预训练阶段的课程式掩码退火、微调阶段的正则化掩码(regularized masking, RM)替代直接置零/丢弃 patch。论文明确定位为”JEPA 范式在音频领域的首次尝试”,并把未来方向指向多模态(视频+文本)联合嵌入自监督,本文本身只做音频单模态。

模型架构

三网络结构(与 I-JEPA 一致):context encoder E_θ、target encoder E_θ~(context encoder 权重的 EMA,不接收梯度)、predictor P_φ(条件于 context 表征,预测 target 区域的表征)。encoder/predictor 均为标准 ViT(Vision Transformer)堆叠。

输入与 patch 化:原始波形转为单声道、16,000 Hz 采样,25ms Hanning 窗、10ms 帧移,提取 128 维 Kaldi 兼容 Mel 频带;10 秒音频片段对应 1×1024×128 维频谱图;用 (16,16) 卷积核、非重叠 stride 切 patch,加固定正弦位置编码。

掩码采样(预训练):

  • 随机 block 目标:采 4 个可重叠 target block,尺度范围 (0.15, 0.2),宽高比 (0.75, 1.5);
  • 时频感知目标:采 3 个 target block,尺度范围 (0.05, 0.075),直接抹掉对应的整段时间或整段频率;
  • context block:采 1 个,尺度范围 (0.85, 1.0),单位宽高比,再挖掉与任一 target block 重叠的区域。

课程式掩码(curriculum masking):每个训练 step 以 p ~ Bernoulli(f(s)) 决定用时频感知掩码(p=1)还是随机 block 掩码(p=0),f(s) = min(1, √(s·(1-c₀²)/S) + c₀²),c₀ 默认 0.01,s 为训练步数、S 为总步数——随训练推进,f(s) 从 0 渐进到 1,即掩码难度由”随机 block”逐渐退火到”时频感知”。

Decoder/predictor:16 层 Transformer(默认),带 shifted local window attention(沿用 Audio-MAE 设计),编码器输出的可见 patch 表征与可训练 mask token 一起按原始时频顺序还原、加正弦位置编码后送入 decoder,顶层线性头预测(不是像素而是)表征。宽度(embedding 维度)默认 512。

多掩码目标(multi-mask objective):单张频谱图内采样多组掩码,摊薄 target 表征计算开销(借鉴 DINO 多裁剪式和 data2vec 2.0 的效率技巧);损失为 predictor 输出与 target encoder 输出之间做 patch-normalized 的 L2/MSE 距离,在多个掩码/多个 target block 上取平均。

模型规模(ablation,Table 2):ViT-S 22M 参数、ViT-B 86M 参数(默认,12 层)、ViT-L 304M 参数。

微调阶段:丢弃 decoder/predictor,只保留 context encoder,接平均池化 + 线性分类头。引入正则化掩码(RM):在第 l 层随机选中一定比例的 patch token,这些被选中 token 在自注意力权重计算中被排除(不参与影响其它 token 的注意力分布),但它们自身的输出完全由其余(未选中)token 贡献——从而强迫网络只用局部邻居信息也能产出有意义表征;RM 仅在微调阶段使用,测试/推理时仍用原始(无 RM)注意力计算,默认掩码比例 10%。

该工作不含 action-conditioning / cross-embodiment——它是一个音频表征学习编码器(分类任务),不是带动作/规划接口的具身世界模型;被归入 world-model/jepa 类别是因为 JEPA 家族本身被 LeCun 定位为”世界模型”谱系的通用预测架构,本文只是把它扩展到音频这一感官模态。

数据

预训练:AudioSet-2M(Gemmeke et al. 2017),~10s 弱标注音频片段,527 类声音事件、可多标签共存。原始划分:不平衡训练集 2,042,985 条 + 平衡训练集 22,176 条,评测集 20,383 条;作者实际获取并处理的子集为不平衡训练集 1.96M 条 + 平衡训练集 21k 条 + 评测集 19k 条。

微调/评测数据集(6 个任务):

  • AS-2M:预训练 + 微调都用不平衡集与平衡集的并集(~2M);
  • AS-20K:先在 AS-2M 上预训练,再只用 20K 平衡子集微调;
  • ESC-50(环境声分类):2,000 条环境声录音、50 类、每条 5 秒,5 折交叉验证;
  • SPC-2(Speech Commands v2):35 类语音命令,训练 84,843 / 测试 11,005 / 验证 9,981,每条 1 秒;
  • SPC-1(Speech Commands v1):10 类关键词 + 静音类 + 未知类,用 SUPERB benchmark 的划分;
  • SID(VoxCeleb 说话人识别):150K 条语音,1,251 个说话人,V1 版本划分训练/验证/测试为 128k/6k/8k。

数据增强:每条音频随机采样起始时间、循环截取 10 秒片段,幅值随机抖动 ±6dB。微调采样策略:AS-2M 有监督微调用加权采样解决类别不均衡,每 epoch 采样 200K 条(约 AS-2M 的 10%)、不放回、采样概率与该类别出现频次成反比;共微调 100 epoch,累计相当于遍历 AS-2M 约 10 遍。AS-20K 微调 60 epoch,不使用加权采样。

预训练数据规模消融(Figure 6,仅定性趋势,正文未给出具体数值表):从 AudioSet 随机采样不同规模子集预训练,下游 mAP 随预训练数据量增大而持续提升;训练轮数消融(Figure 7)显示延长训练有益,但在第 24 epoch 后趋于平台。

训练方法

预训练目标:在 target/context/predictor 三网络框架下,最小化 predictor 输出与 target encoder 输出之间的 patch-normalized L2/MSE 距离(纯表征空间预测,无重建损失、无对比负样本);target encoder 权重通过 context encoder 权重的指数滑动平均(EMA)更新。

预训练超参:24 epoch,batch size 512,学习率 2e-4(优化器、权重衰减、学习率调度等论文未披露)。

掩码课程:训练全程用式 (1)(2) 的 Bernoulli(f(s)) 在”随机 block 掩码”与”时频感知掩码”间退火切换(见上文模型架构)。

微调阶段:丢弃 decoder,仅微调 context encoder + 池化 + 线性头;用正则化掩码(RM,默认比例 10%)代替传统的整块置零/丢弃(如 SpecAug、Audio-MAE 微调阶段的做法)。论文原文在描述 AS-20K 微调设置时提到”使用 Sqrt progressive function”,但该 progressive function f(s) 本是预训练阶段掩码课程的定义,在微调段落里的具体所指原文表述含糊,这里按原文如实转述,不做过度解读。

无 RL、无蒸馏、无动作 tokenization——纯自监督表征学习 + 有监督微调两阶段流程,不涉及策略学习或强化学习信号。

Infra(训练 / 推理工程)

论文全文未披露 GPU 型号、GPU 数量、GPU-hours、并行策略(数据/模型并行)、混合精度设置等训练工程细节。也未报告推理侧的吞吐/延迟/FPS 数字(本工作是离线分类任务而非实时控制场景,论文本身没有相应指标)。唯一披露的算力相关代理指标是模型规模(ViT-S 22M / ViT-B 86M / ViT-L 304M 参数)与训练轮数/batch size(见上)。

评测 benchmark

Table 1:6 个音频/语音分类任务的横向对比(AS 系列用 mAP%,其余用 accuracy%),A-JEPA 均用 ViT-B、仅 AudioSet 预训练:

类别模型骨干/预训练数据AS-20KAS-2MESC-50SPC-2SPC-1SID
无预训练ERANNCNN--45.089.2--
无预训练PANNCNN27.843.183.361.8--
域内自监督wav2vec 2.0Transformer/LS----96.2*75.2*
域内自监督HuBERTTransformer/LS----96.3*81.4*
域内自监督ConformerConformer/AS-41.188.0---
域内自监督SS-ASTViT-B/AS+LS31.0-88.898.096.064.3
掩码重建MaskSpecViT-B/AS32.347.189.697.7--
掩码重建MAE-ASTViT-B/AS+LS30.6-90.097.995.863.3
掩码重建Audio-MAEViT-B/AS37.047.394.198.396.994.8
本文A-JEPAViT-B/AS38.448.696.398.597.795.8
域外监督预训练PSLAEfficientNet/IN31.944.4-96.3--
域外监督预训练ASTDeiT-B/IN34.745.988.798.195.541.1
域外监督预训练MBTViT-B/IN-21K31.344.3----
域外监督预训练HTS-ATSwin-B/IN-47.197.098.0--
域外监督预训练PaSSTDeiT-B/IN-47.196.8---

(* 为对应论文的 linear-evaluation 结果)A-JEPA 在域内自监督组全面领先,且优于用 ImageNet 域外监督预训练的模型;相对 Audio-MAE 提升为 AS-2M +1.3 mAP、AS-20K +1.4 mAP、ESC-50 +2.2 acc、SID +1.0 acc。

消融实验

  • 模型规模(Table 2):ViT-S(22M) AS-20K 33.7/AS-2M 46.1;ViT-B(86M) 38.4/48.6;ViT-L(304M) 38.8/48.8——更大模型持续受益,且 S→B 的差距在微调数据从 AS-20K 换到 AS-2M 后从 4.7 mAP 收窄到 2.5 mAP。
  • 预训练掩码策略(Table 3,ViT-B,掩码比例 0.75):Curriculum 48.6 > Random 47.8 > Inverse(先时频后随机)46.3。
  • 微调正则化掩码(Table 4,ViT-B,比例 0.1):有 RM 48.6 vs 无 RM 48.1。
  • Predictor 深度(Table 5,ViT-B,24 epoch):8 层 48.3 vs 16 层 48.6。
  • Predictor 宽度(Table 6,ViT-B,24 epoch):256 维 48.0、512 维 48.6、768 维 48.5——512 维(带宽度瓶颈)最优。
  • Figure 5:用 RCDM 框架训一个后验 decoder,把 predictor 输出的平均池化表征映回频谱图空间做定性可视化,显示 predictor 能捕捉被遮 target 的位置不确定性并生成风格一致的高层成分(无量化指标,纯定性)。

创新点与影响

  • 作者称这是 JEPA(LeCun 提出的非生成式、表征空间掩码预测范式)首次应用到音频领域的工作,直接沿用 Audio-MAE 的频谱图 patch 化和 shifted local attention 解码器工程,但把重建目标换成表征预测目标。
  • 两处音频专属设计:① 课程式掩码退火(随机 block → 时频感知),应对音频频谱图局部时频强相关、随机 block 掩码”太容易”的问题;② 微调阶段的正则化掩码(RM),用”排除注意力贡献”代替”置零/整块丢弃”,缓解预训练-微调之间的输入分布差异。
  • 仅用 AudioSet 音频自监督预训练(无 ImageNet、无文本、无跨模态迁移)即在 6 个音频/语音分类任务上超过同期用 ImageNet 监督预训练的模型,为”音频表征学习不必依赖域外视觉监督”提供了证据。
  • 论文自陈的局限/未来方向:仅限音频单模态,提出未来应探索多模态(如视频+文本)联合嵌入自监督,以获得更好的音频表征引导——即本文本身并未尝试跨模态联合训练。
  • 核查发现(写作时验证):论文正文声明”code and models will be publicly available”,但截至 2026-07-16,作者 Zhengcong Fei 的 GitHub 账号(feizc,约 80 个仓库)中未见名为 A-JEPA 的官方仓库,Hugging Face 上也未检索到作者发布的官方模型卡——承诺的开源似乎并未兑现。仅存在第三方非官方复现(GitHub/HF 上的 ltuncay/Audio-JEPA),并非本文作者发布。
  • arXiv 摘要页附有一条 admin 备注:“text overlap with arXiv:2207.06405 by other authors”,未进一步核实该关联论文内容,如实记录、不做过度解读。

原始链接

一手源存档(sources/)

本工作未发现官方 blog / GitHub 仓库 / Hugging Face model card / project page(核查过程见”创新点与影响”),故无可归档的官方衍生页面;一手来源仅为 arXiv 论文本身(arXiv 原文 PDF/HTML,不入 git,见上方”原始链接”)。