一句话定位
Stem-JEPA 把 i-jepa 的”隐空间预测、非生成”范式第一次搬到多轨音乐上:给定一首歌的若干乐器分轨(stem),随机挑一个分轨当预测目标,把其余分轨混合成”上下文混音”,训练一个 encoder+predictor 对,在表征空间里从上下文混音预测目标分轨的 embedding——不像 I-JEPA/V-JEPA 那样在输入空间做空间/时间遮挡,而是用”从混音里拿掉一个乐器”本身充当遮挡,并用被拿掉乐器的类别标签(Bass/Drums/Vocals/Other)去条件化 predictor。论文在 MUSDB18 上做分轨检索(R@1=33%)、23 人听感测试、时间对齐分析、和弦/调性可解释性分析、以及 MARBLE 下游基准五项评测,ISMIR 2024(25th International Society for Music Information Retrieval Conference)收录。作者自陈:这是 JEPA 家族中首次把 predictor 用于推理阶段(而非只当训练期辅助信号)的工作。
背景与定位
此前的”分轨兼容性(stem compatibility)“估计工作走两条路:一是基于传统 MIR 特征(节拍跟踪、和弦估计)的 AutoMashupper 等自动混编(mashup)方法;二是深度学习方法,如 Neural Loop Combiner、Samplematch 等针对采样/循环检索的兼容性打分模型,但它们通常局限于音乐理论层面的兼容性(调性、节奏),难以覆盖音色、演唱/演奏风格等更细腻的表现性特征。
Stem-JEPA 转而借鉴 i-jepa(图像)与 Masked Modeling Duo / M2D(音频,Niizumi et al. 2023)代表的联合嵌入预测架构(Joint-Embedding Predictive Architecture, JEPA,源自 LeCun 的世界模型蓝图):预测发生在编码器输出的表征空间而非原始输入空间,从而剔除无关的低层声学细节,只保留对”能否搭配”起作用的音色、和声、节奏信息。与 I-JEPA/M2D 靠在输入空间做掩码(mask patch)不同,Stem-JEPA 的”掩码”是音乐特有的:从多轨混音里省略掉某个乐器分轨,天然对应”给定伴奏预测缺失乐器”这一实际应用场景(分轨检索、自动编曲、分轨生成的上下文条件化)。
模型架构
总体结构(AR-transformer 式 encoder + 非自回归 predictor,双分支 JEPA):context encoder f_θ、target encoder f_θ̄(EMA 更新、不接收梯度,与 context encoder 同构但参数独立)、predictor g_φ 三部分组成,与 I-JEPA/M2D 同构。
输入表征(tokenizer):从一首歌的 S 个分轨中裁剪 8 秒音频片段;随机选一个分轨作为目标 x̄=x_t(t∈{1,…,S}),把其余分轨的子集 C⊂{1,…,S}∖{t} 相加得到上下文混音 x=Σ_{c∈C} x_c。x 和 x̄ 都转换为 80 个 mel 频带、窗长 25ms / 帧移 10ms 的对数梅尔谱,再按 16×16 patch 切分为规则网格,得到序列长度 (80/16)×(800/16)=250 个 token(8 秒音频对应约 800 帧)。
Context/Target 编码:context patch 经 context encoder f_θ 得到 patch-wise embedding z=(z₁,…,z_K);target patch 经 target encoder f_θ̄ 得到 z̄=(z̄₁,…,z̄_K)。Encoder 为标准 ViT-Base[Dosovitskiy et al. 2021](论文未在正文重复具体层数/宽度,但下游任务里”patch-wise 输出沿频率维拼接得到 3840 维全局 embedding”与 80/16=5 个频率 patch 一致,反推 patch embedding 维度为标准 ViT-Base 的 768)。
Predictor(论文核心组件之一):6 层 MLP,ReLU 激活,每个隐藏层 1024 维;predictor 以被省略分轨的乐器类别标签 l 为条件——把一个可学习的类别 embedding emb(l) 与每个上下文 patch embedding z_k 拼接后再送入 predictor,输出预测 z̃_k=g_φ(concat(z_k, emb(l)))。消融中另比较了一种 Transformer predictor(架构与 M2D [9] 一致),但性能显著更差(见评测节)。
Loss(式 1):对预测 z̃ 与目标 z̄ 的每个 patch 做 L2 归一化后取均方误差,K 个 patch 取平均:L(z̃,z̄) = (1/K)Σ_k ‖z̃_k/‖z̃_k‖ − z̄_k/‖z̄_k‖‖²,无重建、无对比负样本(BYOL 式非对比目标)。
参数更新:context encoder(θ)与 predictor(φ)走反向传播;target encoder 参数 θ̄ 走 context encoder 的指数滑动平均(EMA):θ̄_i = τ_i·θ̄_{i-1} + (1−τ_i)·θ_i,其中 EMA 率 τ_i 在训练步数间从 τ₀ 线性插值到 τ_T(T 为总训练步数,具体 τ₀/τ_T 数值未披露)。
Action-conditioning 类比:本文没有机器人动作,“条件”信号是被省略乐器的类别标签(4 类:Bass/Drums/Vocals/Other),起到与动作/位置条件类似的”predictor 该预测什么”的作用;消融显示去掉该条件(“MLP w/o cond.“)会让检索性能明显下降(见评测节)。
采样策略:仅在非静音(active)分轨间采样,避免用静音片段训练;目标 t 从活跃分轨集合 A 中随机取,上下文子集 C⊂A∖{t} 大小在 1 到 |A|−1 间均匀采样;多数情况下上下文分轨数 > 1(简化 predictor 任务),偶尔 |C|=1(让模型学会处理单个分轨的表征,因为分轨本身也会被当作目标)。若整段 8 秒静音或只有一个活跃分轨,则重新从同一曲目采样另一片段。
数据
- 预训练数据:Sony 的**专有(proprietary)**多轨录音数据集,20,000 首多轨曲目,覆盖 pop/rock、R&B、rap、country 等多种流派,总时长 1,350 小时;用已有乐器标注归并为 4 类标准分轨类别:Bass、Drums、Vocals、Other。数据集未公开,也未说明具体来源渠道。
- 动作/条件标注:即分轨类别标签(4 类),沿用已有乐器标注,无需额外人工标注。
- 仿真 vs 真实:不适用(音乐音频,非机器人/仿真场景)。
- 下游/评测数据集(均为公开数据集,未用于预训练):
- MUSDB18[Rafii et al. 2017]:150 首曲目,每首 4 个分轨(vocals/bass/drums/other),检索任务共 150×4=600 次查询。
- Isophonics 标注的 174 首 Beatles 歌曲:key/chord 标注,用于分析嵌入空间的调性/和声可解释性。
- MARBLE 基准(constrained track)下的四个下游数据集:Giantsteps(24 类,key 检测)、GTZAN(10 类,genre 分类)、MagnaTagATune/MTT(50 类,多标签 tagging)、NSynth(11 类,乐器分类)。
- 对照基线所用数据规模(非本文训练数据,用于说明数据量级差距):MULE 训练于 MusicSet 117,000 小时;Jukebox-5B 训练于 120 万首歌曲——论文明确指出自己预训练数据比这些基线少约 100 倍。
训练方法
- 目标函数:单一的表征空间归一化 MSE(式 1),非生成式、非对比式,无负样本,属 BYOL/I-JEPA 一脉的自监督范式。
- 流程:单阶段自监督预训练(无需人工标签,仅用已有乐器类别标注做 predictor 条件),随后在冻结 encoder 上做检索评测与下游线性/MLP 探测,无 RL、无蒸馏、无多阶段微调。
- 训练步数与超参:300k 步,AdamW[Loshchilov & Hutter 2019],batch size 256,base learning rate 3e-4,20k 步线性 warmup 后接余弦退火(cosine annealing);其余超参与 M2D[9]一致(论文未在正文重复列出,如具体 weight decay/AdamW β 值)。
- Predictor 条件消融:训练时是否用乐器标签条件化 predictor(“MLP w/ cond.” vs “MLP w/o cond.“)——对检索任务影响巨大(有条件 R@1=33.0 vs 无条件 R@1=28.2),但对下游分类任务影响很小、甚至多数任务上”无条件”版本更优(见评测节)。
- Predictor 架构消融:MLP predictor vs Transformer predictor(与 M2D 同构)——Transformer 版本在检索任务上性能大幅下降(R@1 从 33.0 跌至 5.2),论文解释为 MLP 无法像 Transformer 那样直接利用 token 间的位置关系”作弊”,被迫让 encoder 承担更多全局信息编码,反而学出更有信息量的 embedding。
Infra(训练 / 推理工程)
- 训练硬件:单张 NVIDIA A100(40GB 显存),未披露数据/模型并行策略(描述为单卡训练)。
- 训练时长:约 4 天(300k 步,batch 256,单卡 A100)。
- 精度:未披露(论文未提及混合精度/FP16/BF16 设置)。
- 推理 FPS / 控制频率 / 边缘硬件:不适用——本文是离线音乐表征学习模型,检索/分析类下游任务均为离线批处理,论文未给出任何推理延迟或吞吐指标。
- 计算资源来源:训练/评测通过法国 IDRIS(GENCI 分配号 2022-AD011013842)的 HPC/AI 资源支持;项目由 ANRT CIFRE convention n°2021/1537 与 Sony France 联合资助。
评测 benchmark
分轨检索任务(Table 1,MUSDB18,150 曲×4 分轨=600 次查询,指标 Recall@K 与 Normalized Rank,K∈{1,5,10})
| 模型 | R@1 | R@5 | R@10 | mean NR | median NR |
|---|---|---|---|---|---|
| MLP w/ cond.(Stem-JEPA 主模型) | 33.0 | 63.2 | 76.2 | 2.0 | 0.5 |
| MLP w/o cond. | 28.2 | 58.0 | 69.2 | 3.3 | 0.7 |
| Transformer predictor | 5.2 | 17.5 | 25.7 | 12.1 | 6.0 |
| AutoMashupper(唯一可比的公开兼容性基线) | 1.0 | 8.8 | 15.5 | 29.1 | 19.5 |
要点:主模型 R@1=33%,中位数 Normalized Rank 仅 0.5%(一半查询里正确分轨排进前 0.5% 近邻);AutoMashupper 的 mashability 度量依赖节拍跟踪/和弦检测,对人声、鼓类分轨不适用,表现明显偏弱。按乐器类别拆分(Fig. 2):drums R@1≈25%,other R@1≈45%;论文定义的四类近邻结果(both correct/right instrument/right song/both wrong)中,bass 和 drums 落入”right song”(歌曲猜对、乐器类别猜错)的比例超过 25%,主要误判来源是”other”类。
23 人听感测试(Go Listen 平台,60 个 trial、每人答 12 个/3 类乐器×4,20/23 人有音乐经验、11 人 ≥10 年经验):Stem-JEPA 检索出的分轨评分略低于真实分轨,但约为随机采样评分的两倍;drums 类别上模型与真实分轨评分接近,“other”类别差异更大。
时间对齐分析:以 160ms 分辨率保留时序 embedding,计算不同时间偏移 j 下预测-真实的余弦相似度 s(z,q,j)(式 3);随机表征间的基线余弦相似度约 0.17,而模型预测在 j=0 处出现明显峰值,且以 8 秒(训练片段长度)为周期出现次级峰值,说明 embedding 同时编码局部对齐信息与全局位置信息。
调性/和声可解释性:用 Isophonics 174 首披头士歌曲的 key/chord 标注,对 embedding 做 k=32 的 k-means 聚类,统计簇内 key/chord 共现频率——高频组合多为”主音-下属音/属音”关系(如 C/F、G 或 D/G、A),说明表征捕捉到有意义的调性关系。
MARBLE 下游基准(Table 3,constrained track,冻结 encoder + MLP 探测头)
| 模型 | Giantsteps (Acc^refined) | GTZAN (Acc) | MTT (ROC) | MTT (AP) | NSynth (Acc) |
|---|---|---|---|---|---|
| MLP w/ cond.(Stem-JEPA 主模型) | 40.2 | 68.6 | 89.9 | 42.8 | 73.5 |
| MLP w/o cond. | 36.8 | 72.5 | 90.1 | 42.9 | 75.0 |
| Transformer predictor | 46.0 | 68.1 | 90.0 | 42.7 | 73.3 |
| MULE(117k 小时对比学习基线) | 64.9 | 75.5 | 91.2 | 40.1 | 74.6 |
| Jukebox-5B(120 万首歌基线) | 63.8 | 77.9 | 91.4 | 40.6 | 70.4 |
要点:MTT(tagging)和 NSynth(乐器分类)上与 MULE/Jukebox 基本持平,但 Giantsteps(key 检测)和 GTZAN(genre 分类)上明显落后;论文强调这是在训练数据量少约 100 倍的情况下取得的结果,说明方法”promising 但尚未达到 SOTA 竞争力”。此外,训练时是否条件化 predictor 对下游任务影响很小(Giantsteps 上 Transformer predictor 反而最优,46.0),与检索任务的结论相反——表明检索能力与下游线性可分性并非同一回事。
创新点与影响
贡献
- 把 JEPA 范式从图像(I-JEPA)、通用音频(M2D)扩展到多轨音乐分轨兼容性估计,用”从混音中省略某个乐器”这一音乐特有的操作替代空间/时间掩码,构造 context/target 对。
- 用被省略乐器的类别标签条件化 predictor,证明这一条件化对检索任务至关重要(有/无条件 R@1 相差近 5 点,Transformer 版本崩溃到 5.2)。
- 论文自陈是首次把 JEPA 的 predictor 组件真正用于推理阶段(而不只是训练期的辅助监督信号)——推理时直接用 predictor 从混音表征预测缺失乐器的表征,用于检索/生成条件。
- 系统性五项评测(检索、听感测试、时间对齐、调性可解释性、下游 MIR 基准)覆盖了兼容性估计从”能否检索”到”表征是否有音乐学意义”的多个侧面。
它改变了什么:把 I-JEPA/M2D 代表的”非生成式隐空间预测”思路首次系统应用到”多轨音乐分轨兼容性”这一此前主要靠传统 MIR 特征(节拍/和弦)或对比学习解决的问题上,展示了 JEPA 框架可以通过”领域特定的遮挡定义”(本文是省略分轨而非空间掩码)迁移到新模态,与同期 Point-JEPA(点云排序化掩码)、Brain-JEPA(fMRI 空间位置化掩码)呈现同一条”JEPA + 领域特定前置步骤”的迁移路线。
论文自陈的局限
- 自监督学习通常受益于超大规模语料,但分轨分离数据难以大规模获取,本文预训练数据(1350 小时)比 MULE/Jukebox 基线少约 100 倍,导致 Giantsteps/GTZAN 等下游任务上落后于 SOTA。
- 仅限定 4 类标准乐器(Bass/Drums/Vocals/Other),虽是分轨分离领域的常见做法,但限制了方法的泛化性;论文认为将 predictor 扩展到任意乐器数量、避免 4.1.3 节所示的”乐器类别混淆”失败模式(尤其 bass/drums 与”other”类之间),是未来值得探索的方向。
原始链接
- 论文(arXiv 2408.02514,v1 2024-08-05,ISMIR 2024 收录):https://arxiv.org/abs/2408.02514
- PDF:https://arxiv.org/pdf/2408.02514
- HTML 全文:https://arxiv.org/html/2408.02514v1
- 官方代码(Sony CSL Paris,含训练/评测配置,基于 Hydra + Dora):https://github.com/SonyCSLParis/Stem-JEPA
- 项目页(交互式图 4 音频示例,当前站点提示”under reconstruction”):https://sonycslparis.github.io/Stem-JEPA
- HF / ModelScope:均未找到官方发布(预训练数据为 Sony 专有数据集,未开源权重)
一手源存档(sources/)
- stem-jepa-music—github-readme — SonyCSLParis/Stem-JEPA README 快照,含训练/数据格式说明与 BibTeX(sources/world-model/2024/stem-jepa-music—github-readme.md)
- 论文全文见 arXiv HTML(https://arxiv.org/html/2408.02514v1)/ PDF(arXiv 原文,不入 git):https://arxiv.org/pdf/2408.02514