一句话定位

Qwen-Music 是通义千问团队的大规模歌曲生成系统,能从文字描述、歌词和音乐属性直接生成带完整人声演唱的高保真歌曲,同时支持”翻唱”(cover,保留参考旋律但换风格换嗓音)。它把歌曲生成拆成”语义作曲 + 声学渲染”两段:先由一个 25 Hz 单码本的 Music Semantic Token 把音乐压成离散序列,用一个从 Qwen3.5-Omni 初始化的 3B 自回归 LLM 作曲(配 Melody-CoT 先规划旋律再生成整曲),再由一个基于扩散 Transformer + 谱域 VAE 的 Render 模块渲染成 48 kHz 立体声波形。在 600 条中英文 prompt 上,16 项客观音乐性/音质指标里拿下 13 项 SOTA。

背景与定位

歌曲生成不同于一般音频生成,它要在几分钟的时间跨度里联合建模歌词、旋律、节奏、人声演唱、配器和曲式结构。这条赛道近两年冒出一大批工作(YuE、DiffRhythm、ACE-Step、LeVo、SongGen、HeartMuLa 等),商业侧则有 Suno、MiniMax Music、Mureka 领跑。报告点出的核心技术矛盾是”语义作曲 vs 声学渲染的失配”:在语义层,模型要规划歌词、人声旋律、段落结构、重复与风格推进;在声学层,又要在波形分辨率上还原音色、相位、立体声像和高频细节。离散 token 的语言模型给全局序列生成提供了可扩展接口,但压缩 token 会丢声学细节;而翻唱任务还额外要求”复用旋律的同时允许换编曲、换嗓、换风格”。

Qwen-Music 的路线是把这两件事解耦:语言模型只负责在紧凑的语义 token 空间里作曲,声学细节全部交给生成式 Render 补齐。这跟连续隐扩散一条道走到黑的 stable-audio-latent-audio-diffusion、以及码本+LM 的 musicgen-audiocraft 都不同——它是”离散语义 LM + 生成式声学渲染”的组合。音频/多模态底座上,它复用了通义自家的栈:LLM 从 qwen3-5-omni 的 3B dense 变体初始化,人声可懂度打分用 Qwen3-ASR,tag 遵循度用 Gemini 3.1 Pro 评判,Render 的文本编码用冻结的 Qwen3-Embedding-0.6B。语音/歌唱合成方向上可对照 seed-ttsstep-audio,但 Qwen-Music 面向的是完整带伴奏的歌曲而非单纯人声。

需要说明的是,这是一次”只发报告”的披露:截至 2026-07-16,没有 HuggingFace paper 页(404)、没有 QwenLM/Qwen-Music 的 GitHub 仓库、也没找到对应的 qwen.ai 官方博客,未见开源权重或代码。模型曾以代号 JazzCat 参加 Artificial Analysis 的 “Music with Vocals” 榜单,在英文人声音乐系统里排第三。所以本页所有数字都出自 arXiv 技术报告本身。

模型架构

整体是一条三段式推理流水线(Figure 4):用户请求先被 prompt rewriter 改写成结构化文本条件(音乐 tag:风格/歌手特征/配器等 + 生成的歌词)→ Qwen-Music-LLM 自回归生成 Music Semantic Token(翻唱时额外注入从参考曲提取的 melody token)→ Qwen-Music-Render 拿”改写后的文本条件 + 语义 token”渲染成 48 kHz 立体声。三大组件如下。

Qwen-Music-Tokenizer(语义 tokenizer)。把原始音乐波形映射成 25 Hz 的单码本 Music Semantic Token。骨干是卷积前端 + 24 层、0.6B 参数的 Conformer(宽 1024、16 头),一个轻量卷积前端把帧率降到 25 Hz(每 40 ms 一帧),输入是 24 kHz 单声道的 log-Mel。它用四阶段训练(详见”训练方法”),部署时只保留到 VQ 插入点的因果编码器 + 量化器,post-VQ 层和所有辅助头都丢掉。VQ 用单码本 32768(2^15)条、cosine 度量、straight-through + commitment loss,靠专门机制把码本利用率顶到 99%+、几乎没有死码;单码本 2^15 @ 25 Hz 对应 25 tokens/s、375 bit/s 的极低码率。

Qwen-Music-LLM(作曲)。自回归骨干从 Qwen3.5-Omni 的 3B dense 变体初始化,在语义 token 空间里建模长程作曲、人声乐句、伴奏和段落级音乐发展。核心创新是 Melody-CoT:文本 prompt 通常只在高层给出风格和歌词,并不决定旋律走向,所以直接从文本预测整曲 token 等于要模型同时学作曲和编曲。Melody-CoT 让模型在生成整曲 token 之前,先产出一段粗粒度的人声旋律轮廓(melody token),相当于”先定曲再填词渲染”。它还统一了两个任务的接口:文生曲时 melody plan 是可选中间步骤;翻唱时把参考曲抽出的 melody token 塞进前缀,模型据此生成遵循参考旋律、但音色/编曲/曲风由文本条件控制的新歌。

Melody Tokenizer 的设计很讲究”只保留作曲旋律、丢掉演唱细节”:先用 RMVPE 抽 50 Hz 的人声音高曲线,再 8× 中值池化降到 6.25 Hz(压掉颤音、装饰音等演唱层细节),然后转成相对 MIDI表示——减去全曲有声帧的 MIDI 中位数,clip 到固定范围映射到 256 词表(1 个 token 专留给无声帧)。这样 melody token 只编码旋律形状,不泄露绝对音区/调性/歌手音色,逼着生成结果去听文本 tag 的风格和音色指令。作者试过 chromagram 表示,但发现它保留了太多伴奏和背景信息,条件信号过强会削弱模型跟随全局 tag 的能力,故弃用。

Qwen-Music-Render(声学渲染)。三段式神经渲染,把离散 token 变高保真波形。第一段是 1.3B 的 DiT(32 层、hidden 1024、24 头、FFN 扩张比 8、self-attn 用 RoPE),在连续隐空间上做 conditional flow matching;每个 block 含 self-attn + cross-attn(attend 文本条件)+ FFN,全部用 AdaLN 按扩散时间步调制。输入是噪声隐 φ_t(m=128)加上 LM 生成的 25 Hz 帧对齐 token 序列。文本条件用冻结的 Qwen3-Embedding-0.6B 编码后经 cross-attention 注入:歌曲描述 token 走 bias-free 线性投影,歌词 token 再过一个 6 层 RoPE Transformer 编码器(与 DiT 联合训练)。为支持 CFG,给文本分支引入可学习 null context。第二段是 Spec-VAE:沿用 SpectroStream 的 2D 卷积结构但把离散残差 VQ 换成连续谱域隐,48 kHz 立体声经 STFT 变成复谱 X∈ℂ^{2×480×T},7 block 的 Spec Encoder 压成 25 Hz 的 128 维隐,总压缩比 192×,镜像 Decoder 重建粗复谱做 iSTFT;立体声在编码器里延迟融合、解码器里早期分裂。第三段是 Band-Mode Refiner,一个轻量 ConvNeXt-1D,按频段分工纠错:低频只修相位、中频联合修幅度+相位、高频只修幅度;初始化时权重全零,保证一开始 refined 输出恰等于 decoder 输出,训练稳定。

Render 里还有个 Spec-SnakeBeta 激活:把 BigVGAN 的 SnakeBeta 从”逐通道”改成”沿频率轴”参数化(每个 STFT bin 对应固定物理频率),α_f 用 log-frequency 先验初始化(鼓励高频更强周期调制),学出来的参数在低-中频段调整最大。

数据

LLM 训练语料是超过 500 万小时的多语种音乐,覆盖数百种语言。报告没给绝对配比的细数,但披露了质量分级和采样策略(见训练方法的质量分级课程):Stage 1 强调语言均衡以缓解跨语种不平衡,并掺 20% 纯器乐来加强伴奏建模。

数据质量用一个内部 MOS 打分模型来分级:该 reward model 训练在有专业音乐背景的人工标注上,按流派内百分位(90/75/50/25/5/1%)把每个流派切成 Q1–Q7 七桶(Q1 最好、Q7 最差),这种”流派内归一化”避免了向主流曲风倾斜。训练丢掉 Q7,用 Q1–Q6。

Render 侧另有一套声学数据质量流水线(Table 3),专门筛掉”假高保真”文件——从 MP3 转码来的无损容器、双声道其实是单声道复制的假立体声、削波/过限的母带、以及被上采样但高频段是空的文件。它用规则引擎逐项检查:编码器标签(含 lavf/lavc/ffmpeg/lame 就 flag)、比特率利用率(≥0.6 才 pass)、响度(integrated loudness 落在 [−25,−5] LUFS、true peak [−1,+2] dBFS、LRA [3,15] LU)、假立体声(|L−R| 为零的样本占比 <0.99)、频率截止等。其中”噪底感知的截止检测”是亮点:从音轨头尾各 10% 估噪底、从内部段估谱截止,两者独立;根据 cutoff/Nyquist 比值和 ±2 kHz 频带的能量跌落幅度,把文件判成 hard_cutoff / suspicious / natural,用来剔除伪无损。

训练方法

分三条线:tokenizer 四阶段、LLM 的质量分级预训练 + 三段后训练、Render 的三阶段。

Tokenizer 四阶段(Table 1,四阶段共享同一 0.6B Conformer,逐阶段续训)

  1. Stage 1 双向 BestRQ 自监督预训练(随机初始化,30 s crop,双向 attention)。目标码由 clean log-Mel 经固定随机投影 + 冻结 ℓ2 归一化随机码本产生,不需要单独学 target 网络。时域 span masking:波形切 0.4 s 段、每段独立以 0.3 概率 mask、mask 段换成低方差高斯噪声,预测头在 mask 帧上用交叉熵还原随机投影目标。
  2. Stage 2 因果适配(从 Stage 1 续训,30 s crop)。把 self-attention 从双向切成因果(只看左文),BestRQ 目标不变,用极小成本把编码器转成因果,匹配下游自回归设定。后续阶段都继承因果。
  3. Stage 3 多任务 SFT(从 Stage 2 续训,整曲 ≤300 s ≈7.5k 帧)。挂三个轻量头:线性 CTC 头转录多语种 subword 歌词、ConvNeXt Mel 头上采样回 100 Hz/128 bin Mel 谱、ConvNeXt chroma 头预测 12 bin chroma。损失 = CTC + Mel 谱重建 + chroma 谱重建(三项权重都为 1)。输入 mask 基本关掉(p=0.01),让编码器看近乎干净的音频,逼 token 保留歌词内容 + 旋律/和声等音乐语义。
  4. Stage 4 VQ tokenizer(从 Stage 3 续训)。在 24 层 Conformer 的中间层插单个 VQ 瓶颈,上面的层和 SFT 头都在量化流上工作,逼码字保留转录和重建所需信息。为稳,用标量 gate h_out = h + α(h_q − h),α 从 0 线性 ramp 到 1;先冻结插入点及以下只训量化器/上层/头,再解冻全模型;损失是 SFT + VQ,CTC 权重降到 0.5。

LLM 质量分级预训练课程(三阶段)

  • Stage 1 通用预训练:用 Q3–Q6(占 500 万小时语料大头),学”文本条件(歌词+tag)→ 语义 token”的通用映射;用动态质量采样,早期多喂低质数据、后期逐步换成高质数据;做语言均衡 + 20% 器乐。
  • Stage 2 退火:切到 Q2 数据 + 学习率衰减,作质量巩固,改善曲式结构、连贯性和音质,压掉第一阶段噪声数据带来的 artifact。
  • Stage 3 高质精炼:聚焦 Q1 + 从全语料精挑的高质样本,进一步提音乐性、可控性和指令遵循,保持流派/语言均衡防过拟合。

LLM 三段后训练对齐(RL 部分):优化两个互补目标——音乐性(内部 MOS 预测器打分)和指令遵循(流派控制 + 歌词遵循,奖励由 Qwen3.5-Omni 和 Qwen3-ASR 算)。顺序从稳到探索:

  • Phase I 监督冷启动:在精挑的高质、且控制信息(流派 tag、歌词)标注可靠的数据上做 SFT,建立干净且可控的生成先验。
  • Phase II 迭代离线偏好对齐(DPO):当前策略在多样 prompt/控制条件下 rollout,用音乐性 MOS + 指令遵循 reward 打分,构造偏好对做 DPO,“rollout–打分–构对–优化”迭代循环,逐步提音乐性和可控性,产出更稳、更适合后续在线优化的策略。
  • Phase III 在线音乐性优化(GSPO):用 on-policy 的 Group Sequence Policy Optimization,相比离线 DPO 靠 on-policy 样本和序列级奖励做更强探索;因为前两阶段已经解决了基本对齐,这阶段专注细粒度音乐性和音质。

Render 三阶段(Table 2):Stage 1 只做重建的 Spec-VAE 预训练(优化器 Muon,LR 1e-4);Stage 2 引入波形域对抗训练(生成器/判别器都用 Muon,加 CQT 判别器,G:D 交替 1:1);Stage 3 冻结 Spec-VAE 编解码器、只训 Band-Mode Refiner,同时上波形判别器和谱域判别器(优化器换 AdamW,G:D 交替 4:1,谱判别器 15k warmup)。DiT 本身两阶段训:先在大规模音乐语料预训练,再在小批精选的无损录音上 SFT 提音质;训练样本限 6 分钟内(≤9000 帧@25 Hz),cross-attn 上下文截断到描述 256 token、歌词 1536 token,AdamW + 线性 warmup + grad clip 1.0。

Infra(训练 / 推理工程)

报告是偏方法的技术报告,工程数字披露有限:

  • 训练算力/GPU 数/GPU·时/并行策略/训练总步数:未披露。这是本报告最大的缺口。
  • 已知的工程细节多在优化器和 batch 层面:Render 的 Spec-VAE 用 Muon 优化器(Stage 1/2)、Refiner 阶段换 AdamW,段长 1.28 s、batch/GPU 只有 1–4;DiT 用 AdamW。LLM 从 Qwen3.5-Omni 3B dense 初始化。tokenizer 编码是离线对整段音频跑,产出 25 Hz token 流。
  • 各模块规模:tokenizer 骨干 0.6B Conformer、LLM 3B、Render DiT 1.3B、文本编码器 Qwen3-Embedding-0.6B(冻结)。语义流码率 375 bit/s、Spec-VAE 压缩比 192×——这两个是决定序列长度和推理成本的关键工程量。
  • 推理:三段串行(LLM 自回归出 token → DiT flow matching → Spec-VAE + Refiner → iSTFT),Render 用 Text-drop CFG。报告未给端到端延迟/RTF 数字。

评测 benchmark

评测分文生曲和翻唱两大任务,客观 + 主观都做。

主观盲测 A/B(Figure 2,50 位有音乐创作/制作经验的专业评委,每对 3 位独立评、随机呈现):Qwen-Music 对各商业系统的胜率——对 MiniMax Music 2.6 66.7%、对 MiniMax Music 2.5+ 59.1%、对 Mureka V8 58.3%、对 Suno V5 55.4%;对最强的 Suno V5.5 是 50.3% vs 49.7%,基本打平略占优。分流派的 Bradley–Terry 分析(Table 4)里,8 个流派中 5 个拿第一(Electronic/EDM、Jazz & Blues、Punk & Hardcore、R&B/Soul、Rock),Hip-Hop/Rap 和 Pop 第二。外部榜单上以代号 JazzCat 参加 Artificial Analysis “Music with Vocals”,在英文人声音乐系统里排第三。

文生曲客观评测(Table 5,300 中文 + 300 英文,共 600 条,统一用 AI 生成的歌词和 tag):用 SongBench(旋律/编曲/音乐性/人声/器乐/混音/结构 7 维)、SongEval(连贯/音乐性/记忆点/清晰/自然 5 维)、AudioBox-Aesthetic(4 维)三套框架,共 16 项音乐性/音质指标里拿下 13 项 SOTA。具体:

  • SongBench 7 维里第一 6 项(旋律 7.03、编曲 7.35、音乐性 6.22、人声 7.44、器乐 7.24、混音 7.13;只有 Structure 6.94 略输 Mureka 的 7.02);
  • SongEval 5 维全部第一(连贯 4.55、音乐性 4.42、记忆点 4.51、清晰 4.45、自然 4.37);
  • AudioBox-Aesthetic 在 Content Enjoyment 7.47、Content Usefulness 7.86 第一,Production Complexity/Quality 与最强系统持平。
  • Tag 遵循(Gemini 3.1 Pro 1–10 打分):5 维均分 8.44,跟最好系统仅差 0.04;Vocal Gender 7.85 第一,Mood 和 Vocal Timbre 第二;Genre 略输 Mureka V8、Instruments 略输 Suno V5。
  • 歌词可懂度(Qwen3-ASR 转录算 PER,越低越好):Qwen-Music 6.10,全体第二低(Suno V5.5 的 4.19 最低)。

翻唱客观评测(Table 6 AI 参考集 / Table 7 真实流行曲参考集,各 100 中 + 100 英):两种 Melody-CoT 模式互补——section-level(每个含词段都给 melody token)直接旋律克隆最准,Melody MAE 最低(AI 集 1.48、真实集 1.44,均优于 Suno V5.5 2.00 / Suno V5 1.87 / MiniMax Cover 1.89 及 1.76);unique-section-level(每种重复段只采一个代表旋律)则 tag 遵循和可懂度更好。真实流行曲参考集上,Qwen-Music 在大多数客观维度超过 MiniMax Cover(Suno 不接受真实歌曲作参考,故只在 AI 集比)。翻唱的 PER 明显高于文生曲(section 19–20、unique-section 17–18),是它相对商业系统的弱项。

Render 消融(Table 8/9):DiT 渲染上,改写文本条件(tag + 歌词)比不给文本好,Text-drop CFG(null 分支只去文本、保留 LM token)在各配置里最优;Spec-VAE 优于 Levo 2 VAE。声学重建上(Table 9,Song Describer Dataset 546 轨),Spec-VAE + Refiner 拿到最好的 STFT Distance 0.870、STFT_log1p 0.075、Mel Distance 0.461、MEL_log1p 0.089、Spectral Pan Error 0.264,CCPC 0.973 并列最好;Refiner 相比裸 Spec-VAE 全指标改善,Mel Distance 从 0.572 降到 0.461 提升最大。

创新点与影响

  1. 语义作曲 + 生成式声学渲染的解耦架构:不直接建波形,而是先用 375 bit/s 的单码本 Music Semantic Token 让 LLM 作曲,再用 DiT + Spec-VAE + Refiner 补声学细节。既拿到 LM 的长程结构能力,又靠生成式渲染绕开离散 token 丢细节的天花板。
  2. Melody-CoT:把旋律显式化成中间表示,文生曲时”先规划旋律再生成整曲”提升作曲结构性和创造力,翻唱时同一机制变成旋律条件;配上相对 MIDI + 低帧率 melody token 的”只留旋律形状、丢演唱细节”设计,让翻唱既保旋律又能换风格换嗓。section / unique-section 两种模式提供了”旋律保真 vs tag 遵循”的互补控制。
  3. 四阶段语义 tokenizer:BestRQ 自监督 → 因果适配 → 多任务 SFT(CTC + Mel + chroma,逼 token 同时保歌词和音乐语义)→ 单码本 VQ,码本利用率 99%+、几乎无死码,在 375 bit/s 的极低码率下保住语义。
  4. 质量分级课程 + 三段后训练:用内部 MOS 把语料按流派内百分位分 7 桶,动态从低质到高质课程学习,而不是简单丢弃低质数据;后训练 SFT→离线 DPO→在线 GSPO 从稳到探索,专门优化音乐性和指令遵循。
  5. 面向”真高保真”的声学工程:Spec-VAE 192× 压缩下的谱域重建、频率轴参数化的 Spec-SnakeBeta、分频段纠错的 Band-Mode Refiner,加上噪底感知的伪无损数据剔除流水线,共同支撑 48 kHz 立体声输出。

影响:它证明了”离散语义 LM 作曲 + 生成式渲染”这条路在带人声的完整歌曲上能追平甚至超过 Suno/MiniMax/Mureka 这些闭源商业系统(对 Suno V5.5 打平、其余全胜),并把 Melody-CoT 这种”旋律显式规划”作为翻唱和文生曲的统一接口。对通义栈而言,它是把 Qwen3.5-Omni / Qwen3-ASR / Qwen3-Embedding 复用到音乐生成的一次整合。

已知局限:① 只发报告,无开源权重/代码、无 HF/GitHub/官方博客,可复现性和生态影响待观察;② 训练算力、GPU 数、训练步数等 infra 数字完全未披露;③ 翻唱任务的歌词可懂度(PER 17–20)明显弱于文生曲和商业系统;④ 数据配比绝对量、语言分布细数未给;⑤ 客观评测的 tag 遵循在 Genre/Instruments 等个别维度仍略输商业系统。

原始链接

一手源存档(sources/)