一句话定位

Stem-JEPA 把 i-jepa 的”隐空间预测、非生成”范式第一次搬到多轨音乐上:给定一首歌的若干乐器分轨(stem),随机挑一个分轨当预测目标,把其余分轨混合成”上下文混音”,训练一个 encoder+predictor 对,在表征空间里从上下文混音预测目标分轨的 embedding——不像 I-JEPA/V-JEPA 那样在输入空间做空间/时间遮挡,而是用”从混音里拿掉一个乐器”本身充当遮挡,并用被拿掉乐器的类别标签(Bass/Drums/Vocals/Other)去条件化 predictor。论文在 MUSDB18 上做分轨检索(R@1=33%)、23 人听感测试、时间对齐分析、和弦/调性可解释性分析、以及 MARBLE 下游基准五项评测,ISMIR 2024(25th International Society for Music Information Retrieval Conference)收录。作者自陈:这是 JEPA 家族中首次把 predictor 用于推理阶段(而非只当训练期辅助信号)的工作。

背景与定位

此前的”分轨兼容性(stem compatibility)“估计工作走两条路:一是基于传统 MIR 特征(节拍跟踪、和弦估计)的 AutoMashupper 等自动混编(mashup)方法;二是深度学习方法,如 Neural Loop Combiner、Samplematch 等针对采样/循环检索的兼容性打分模型,但它们通常局限于音乐理论层面的兼容性(调性、节奏),难以覆盖音色、演唱/演奏风格等更细腻的表现性特征。

Stem-JEPA 转而借鉴 i-jepa(图像)与 Masked Modeling Duo / M2D(音频,Niizumi et al. 2023)代表的联合嵌入预测架构(Joint-Embedding Predictive Architecture, JEPA,源自 LeCun 的世界模型蓝图):预测发生在编码器输出的表征空间而非原始输入空间,从而剔除无关的低层声学细节,只保留对”能否搭配”起作用的音色、和声、节奏信息。与 I-JEPA/M2D 靠在输入空间做掩码(mask patch)不同,Stem-JEPA 的”掩码”是音乐特有的:从多轨混音里省略掉某个乐器分轨,天然对应”给定伴奏预测缺失乐器”这一实际应用场景(分轨检索、自动编曲、分轨生成的上下文条件化)。

模型架构

总体结构(AR-transformer 式 encoder + 非自回归 predictor,双分支 JEPA):context encoder f_θ、target encoder f_θ̄(EMA 更新、不接收梯度,与 context encoder 同构但参数独立)、predictor g_φ 三部分组成,与 I-JEPA/M2D 同构。

输入表征(tokenizer):从一首歌的 S 个分轨中裁剪 8 秒音频片段;随机选一个分轨作为目标 x̄=x_t(t∈{1,…,S}),把其余分轨的子集 C⊂{1,…,S}∖{t} 相加得到上下文混音 x=Σ_{c∈C} x_c。x 和 x̄ 都转换为 80 个 mel 频带、窗长 25ms / 帧移 10ms 的对数梅尔谱,再按 16×16 patch 切分为规则网格,得到序列长度 (80/16)×(800/16)=250 个 token(8 秒音频对应约 800 帧)。

Context/Target 编码:context patch 经 context encoder f_θ 得到 patch-wise embedding z=(z₁,…,z_K);target patch 经 target encoder f_θ̄ 得到 z̄=(z̄₁,…,z̄_K)。Encoder 为标准 ViT-Base[Dosovitskiy et al. 2021](论文未在正文重复具体层数/宽度,但下游任务里”patch-wise 输出沿频率维拼接得到 3840 维全局 embedding”与 80/16=5 个频率 patch 一致,反推 patch embedding 维度为标准 ViT-Base 的 768)。

Predictor(论文核心组件之一)6 层 MLP,ReLU 激活,每个隐藏层 1024 维;predictor 以被省略分轨的乐器类别标签 l 为条件——把一个可学习的类别 embedding emb(l) 与每个上下文 patch embedding z_k 拼接后再送入 predictor,输出预测 z̃_k=g_φ(concat(z_k, emb(l)))。消融中另比较了一种 Transformer predictor(架构与 M2D [9] 一致),但性能显著更差(见评测节)。

Loss(式 1):对预测 z̃ 与目标 z̄ 的每个 patch 做 L2 归一化后取均方误差,K 个 patch 取平均:L(z̃,z̄) = (1/K)Σ_k ‖z̃_k/‖z̃_k‖ − z̄_k/‖z̄_k‖‖²,无重建、无对比负样本(BYOL 式非对比目标)。

参数更新:context encoder(θ)与 predictor(φ)走反向传播;target encoder 参数 θ̄ 走 context encoder 的指数滑动平均(EMA):θ̄_i = τ_i·θ̄_{i-1} + (1−τ_i)·θ_i,其中 EMA 率 τ_i 在训练步数间从 τ₀ 线性插值到 τ_T(T 为总训练步数,具体 τ₀/τ_T 数值未披露)。

Action-conditioning 类比:本文没有机器人动作,“条件”信号是被省略乐器的类别标签(4 类:Bass/Drums/Vocals/Other),起到与动作/位置条件类似的”predictor 该预测什么”的作用;消融显示去掉该条件(“MLP w/o cond.“)会让检索性能明显下降(见评测节)。

采样策略:仅在非静音(active)分轨间采样,避免用静音片段训练;目标 t 从活跃分轨集合 A 中随机取,上下文子集 C⊂A∖{t} 大小在 1 到 |A|−1 间均匀采样;多数情况下上下文分轨数 > 1(简化 predictor 任务),偶尔 |C|=1(让模型学会处理单个分轨的表征,因为分轨本身也会被当作目标)。若整段 8 秒静音或只有一个活跃分轨,则重新从同一曲目采样另一片段。

数据

  • 预训练数据:Sony 的**专有(proprietary)**多轨录音数据集,20,000 首多轨曲目,覆盖 pop/rock、R&B、rap、country 等多种流派,总时长 1,350 小时;用已有乐器标注归并为 4 类标准分轨类别:Bass、Drums、Vocals、Other。数据集未公开,也未说明具体来源渠道。
  • 动作/条件标注:即分轨类别标签(4 类),沿用已有乐器标注,无需额外人工标注。
  • 仿真 vs 真实:不适用(音乐音频,非机器人/仿真场景)。
  • 下游/评测数据集(均为公开数据集,未用于预训练)
    • MUSDB18[Rafii et al. 2017]:150 首曲目,每首 4 个分轨(vocals/bass/drums/other),检索任务共 150×4=600 次查询。
    • Isophonics 标注的 174 首 Beatles 歌曲:key/chord 标注,用于分析嵌入空间的调性/和声可解释性。
    • MARBLE 基准(constrained track)下的四个下游数据集:Giantsteps(24 类,key 检测)、GTZAN(10 类,genre 分类)、MagnaTagATune/MTT(50 类,多标签 tagging)、NSynth(11 类,乐器分类)。
  • 对照基线所用数据规模(非本文训练数据,用于说明数据量级差距):MULE 训练于 MusicSet 117,000 小时;Jukebox-5B 训练于 120 万首歌曲——论文明确指出自己预训练数据比这些基线少约 100 倍

训练方法

  • 目标函数:单一的表征空间归一化 MSE(式 1),非生成式、非对比式,无负样本,属 BYOL/I-JEPA 一脉的自监督范式。
  • 流程:单阶段自监督预训练(无需人工标签,仅用已有乐器类别标注做 predictor 条件),随后在冻结 encoder 上做检索评测与下游线性/MLP 探测,无 RL、无蒸馏、无多阶段微调。
  • 训练步数与超参300k 步,AdamW[Loshchilov & Hutter 2019],batch size 256,base learning rate 3e-420k 步线性 warmup 后接余弦退火(cosine annealing);其余超参与 M2D[9]一致(论文未在正文重复列出,如具体 weight decay/AdamW β 值)。
  • Predictor 条件消融:训练时是否用乐器标签条件化 predictor(“MLP w/ cond.” vs “MLP w/o cond.“)——对检索任务影响巨大(有条件 R@1=33.0 vs 无条件 R@1=28.2),但对下游分类任务影响很小、甚至多数任务上”无条件”版本更优(见评测节)。
  • Predictor 架构消融:MLP predictor vs Transformer predictor(与 M2D 同构)——Transformer 版本在检索任务上性能大幅下降(R@1 从 33.0 跌至 5.2),论文解释为 MLP 无法像 Transformer 那样直接利用 token 间的位置关系”作弊”,被迫让 encoder 承担更多全局信息编码,反而学出更有信息量的 embedding。

Infra(训练 / 推理工程)

  • 训练硬件:单张 NVIDIA A100(40GB 显存),未披露数据/模型并行策略(描述为单卡训练)。
  • 训练时长:约 4 天(300k 步,batch 256,单卡 A100)。
  • 精度:未披露(论文未提及混合精度/FP16/BF16 设置)。
  • 推理 FPS / 控制频率 / 边缘硬件:不适用——本文是离线音乐表征学习模型,检索/分析类下游任务均为离线批处理,论文未给出任何推理延迟或吞吐指标。
  • 计算资源来源:训练/评测通过法国 IDRIS(GENCI 分配号 2022-AD011013842)的 HPC/AI 资源支持;项目由 ANRT CIFRE convention n°2021/1537 与 Sony France 联合资助。

评测 benchmark

分轨检索任务(Table 1,MUSDB18,150 曲×4 分轨=600 次查询,指标 Recall@K 与 Normalized Rank,K∈{1,5,10})

模型R@1R@5R@10mean NRmedian NR
MLP w/ cond.(Stem-JEPA 主模型)33.063.276.22.00.5
MLP w/o cond.28.258.069.23.30.7
Transformer predictor5.217.525.712.16.0
AutoMashupper(唯一可比的公开兼容性基线)1.08.815.529.119.5

要点:主模型 R@1=33%,中位数 Normalized Rank 仅 0.5%(一半查询里正确分轨排进前 0.5% 近邻);AutoMashupper 的 mashability 度量依赖节拍跟踪/和弦检测,对人声、鼓类分轨不适用,表现明显偏弱。按乐器类别拆分(Fig. 2):drums R@1≈25%,other R@1≈45%;论文定义的四类近邻结果(both correct/right instrument/right song/both wrong)中,bass 和 drums 落入”right song”(歌曲猜对、乐器类别猜错)的比例超过 25%,主要误判来源是”other”类。

23 人听感测试(Go Listen 平台,60 个 trial、每人答 12 个/3 类乐器×4,20/23 人有音乐经验、11 人 ≥10 年经验):Stem-JEPA 检索出的分轨评分略低于真实分轨,但约为随机采样评分的两倍;drums 类别上模型与真实分轨评分接近,“other”类别差异更大。

时间对齐分析:以 160ms 分辨率保留时序 embedding,计算不同时间偏移 j 下预测-真实的余弦相似度 s(z,q,j)(式 3);随机表征间的基线余弦相似度约 0.17,而模型预测在 j=0 处出现明显峰值,且以 8 秒(训练片段长度)为周期出现次级峰值,说明 embedding 同时编码局部对齐信息与全局位置信息。

调性/和声可解释性:用 Isophonics 174 首披头士歌曲的 key/chord 标注,对 embedding 做 k=32 的 k-means 聚类,统计簇内 key/chord 共现频率——高频组合多为”主音-下属音/属音”关系(如 C/F、G 或 D/G、A),说明表征捕捉到有意义的调性关系。

MARBLE 下游基准(Table 3,constrained track,冻结 encoder + MLP 探测头)

模型Giantsteps (Acc^refined)GTZAN (Acc)MTT (ROC)MTT (AP)NSynth (Acc)
MLP w/ cond.(Stem-JEPA 主模型)40.268.689.942.873.5
MLP w/o cond.36.872.590.142.975.0
Transformer predictor46.068.190.042.773.3
MULE(117k 小时对比学习基线)64.975.591.240.174.6
Jukebox-5B(120 万首歌基线)63.877.991.440.670.4

要点:MTT(tagging)和 NSynth(乐器分类)上与 MULE/Jukebox 基本持平,但 Giantsteps(key 检测)和 GTZAN(genre 分类)上明显落后;论文强调这是在训练数据量少约 100 倍的情况下取得的结果,说明方法”promising 但尚未达到 SOTA 竞争力”。此外,训练时是否条件化 predictor 对下游任务影响很小(Giantsteps 上 Transformer predictor 反而最优,46.0),与检索任务的结论相反——表明检索能力与下游线性可分性并非同一回事。

创新点与影响

贡献

  1. 把 JEPA 范式从图像(I-JEPA)、通用音频(M2D)扩展到多轨音乐分轨兼容性估计,用”从混音中省略某个乐器”这一音乐特有的操作替代空间/时间掩码,构造 context/target 对。
  2. 用被省略乐器的类别标签条件化 predictor,证明这一条件化对检索任务至关重要(有/无条件 R@1 相差近 5 点,Transformer 版本崩溃到 5.2)。
  3. 论文自陈是首次把 JEPA 的 predictor 组件真正用于推理阶段(而不只是训练期的辅助监督信号)——推理时直接用 predictor 从混音表征预测缺失乐器的表征,用于检索/生成条件。
  4. 系统性五项评测(检索、听感测试、时间对齐、调性可解释性、下游 MIR 基准)覆盖了兼容性估计从”能否检索”到”表征是否有音乐学意义”的多个侧面。

它改变了什么:把 I-JEPA/M2D 代表的”非生成式隐空间预测”思路首次系统应用到”多轨音乐分轨兼容性”这一此前主要靠传统 MIR 特征(节拍/和弦)或对比学习解决的问题上,展示了 JEPA 框架可以通过”领域特定的遮挡定义”(本文是省略分轨而非空间掩码)迁移到新模态,与同期 Point-JEPA(点云排序化掩码)、Brain-JEPA(fMRI 空间位置化掩码)呈现同一条”JEPA + 领域特定前置步骤”的迁移路线。

论文自陈的局限

  • 自监督学习通常受益于超大规模语料,但分轨分离数据难以大规模获取,本文预训练数据(1350 小时)比 MULE/Jukebox 基线少约 100 倍,导致 Giantsteps/GTZAN 等下游任务上落后于 SOTA。
  • 仅限定 4 类标准乐器(Bass/Drums/Vocals/Other),虽是分轨分离领域的常见做法,但限制了方法的泛化性;论文认为将 predictor 扩展到任意乐器数量、避免 4.1.3 节所示的”乐器类别混淆”失败模式(尤其 bass/drums 与”other”类之间),是未来值得探索的方向。

原始链接

一手源存档(sources/)