一句话定位
Audex(Nemotron-Labs-Audex-30B-A3B)是 NVIDIA 在文本-only MoE 大模型 Nemotron-Cascade-2-30B-A3B(30B 总参 / 3B 激活,Mamba2-Transformer hybrid)之上做的统一”音频-文本”LLM:单一 Transformer decoder,音频输入经 encoder 投进文本 embedding 空间,音频输出用离散 codec token 和文本 token 一视同仁地自回归生成。它一口气覆盖音频理解 + ASR/AST + TTS + 通用音频生成 + 语音到语音五类任务,同时把底座的推理/知识/对齐/长上下文/agentic 能力几乎无损保留下来(论文标题的”Without Regressing on Text Intelligence”就是这个卖点)。训练只用了 157.4B 音频 token + 320.5B 文本 token,且完全跳过了音频预训练,直接在文本预训练模型上做多阶段 SFT + 纯文本 RL。
背景与定位
带多模态输出的 LLM 有个反复出现的老问题:加了音频/视觉生成能力后,文本能力会明显退化。论文开篇就点名 Qwen3-Omni、Qwen3.5-Omni 相对各自的文本底座(Qwen3、Qwen3.5)在推理 benchmark 上有可见回退(引用 Qwen3-Omni 技术报告 Table 5),并把”造原生多模态 LLM 而不牺牲文本智能”定位成通往 AGI 的关键一步。闭源阵营里 GPT-4o、Gemini 2.5 做到了原生多模态,但开源前沿模型(DeepSeek-V4、GLM-5.1)大多仍是纯文本,即便 Qwen3.5、Kimi-2.5 支持视觉也不支持音频输出。
Audex 是 NVIDIA 自家 UALM(Tian et al. 2026,用 1.5B/7B LLM 做统一文本-音频生成)这条线的放大与系统化:把配方搬到 30B MoE 底座,补上 TTS、ASR、speech 理解、语音交互,并首次对”文本 SFT + 文本 RL 对多模态能力的影响”做了系统研究。和级联系统(stacked models)或 thinker-talker 架构(Qwen3-Omni 那种)不同,Audex 坚持单个 MoE decoder:既能拿到最强的模态融合,又天然兼容现成的 LLM 训练(Megatron-LM)与推理栈(vLLM),工程上省事。同时发布 30B-A3B 与 2B dense 两个 checkpoint(2B 用同一套 recipe)。
模型架构
整体见论文 Figure 1:底座 LLM 在中间,左侧是音频输入路径(Audio Encoder → MLP Adapters → 连续 embedding 送进 decoder),右侧是三条输出头(Text Tokens、Speech Tokens → Speech Decoder → 语音,Audio Tokens → Audio Decoder → 通用音频)。关键点是输出侧的 speech/audio token 直接进了扩展词表,由同一个 decoder 用同一套交叉熵预测,不是外挂 talker。
LLM 底座:Nemotron-Cascade-2-30B-A3B,是建在 Mamba2-Transformer hybrid 上的 MoE,52 层,model dimension 2688,128 个 routable expert、6 个激活(细节见 Nemotron 3 Nano 报告)。权重从 Cascade-2 后训练里 SFT 之后的 checkpoint 初始化。2B 版是 28 层 dense Transformer,dim 2048,MLP intermediate 9216,用同样的数据和 recipe 训。
词表扩展:两个底座原始词表都是 131,072,扩到 205,312 以容纳音频 token。新加的 embedding 用均值 0、标准差 0.02 的高斯初始化。具体分配:speech codec 65,536 个 + non-speech audio codec 8,192 个(给 8 层 RVQ 预留满,尽管只用前 4 层)+ 5 个 special token(<speechgen_start/end>、<audiogen_start/end>、占位 <audiogen>),合计 204,805,再 pad 到 205,312(可被 512 整除,方便 Megatron 的 tensor parallelism)。
音频 encoder:用 Audio Flamingo 3 里 finetune 过的 AF-Whisper(Whisper Large-v3 同架构,扩展到语音以外的通用音频理解)。输入 16kHz,每 30 秒音频输出 25Hz 特征(30 秒 = 750 帧)、维度 1280;音频切成 30 秒窗口,最后一段 pad 到 30 秒。再用 2 层 MLP adapter 把特征投到 LLM 维度。
音频 codec(tokenizer,语音/非语音分开):这是设计上的一个明确取舍——语音和非语音用不同 codec、不同词表,因为语音结构简单、单层量化即可低 token/s 高效预测,而非语音(音乐、环境声)结构复杂需要更高 token 预算。
- 语音用 X-Codec2:50Hz 帧率,单层 FSQ(finite scalar quantization),codebook 65,536 → 50 token/s,词表 65,536。
- 非语音用 X-Codec(沿 UALM):50Hz,8 层 RVQ(每层 codebook 1024),只取前 4 层,用简单 flatten 模式(frame×depth,Copet 2024)把二维 RVQ token 摊平成一维当文本处理 → 50×4=200 token/s,词表 1024×4=4096。
音频解码:两条策略。非语音走 X-Codec,再额外训一个 enhancement VAE(BigVGAN-v2 recipe)把采样率提到 48kHz、消 codec artifact,提升感知质量与带宽。语音为了快速流式推理,训了一个基于 causal ConvNeXt(Vocos) 的 streaming decoder 替换 X-Codec2 的非因果 decoder,小 look-ahead 窗口就能保证语义准确 + 快速流式。
对话模板(Figure 2):文本 chat / 工具调用模板照抄 Nemotron-Cascade-2;音频理解/ASR/AST 统一走 audio-QA 格式,输入音频用 <sound> 占位(由 MLP adapter 算出的 embedding 替换),非 thinking 模式作答;TTS 用固定 user turn “<|text to speech|> Generate speech for this transcription. {transcription}“,输出 speech token;TTA 同理用 “<|text to audio|> Generate audio for this caption. {caption}“。thinking / instruct 双模式,<think></think> 前置即切非 thinking。
数据
训练数据是文本、音频、交错文本-音频的混合,规模见 Table 2(按输入-输出对计样本数,音频小时按 16kHz,音频 token 用 X-Codec RVQ4/X-Codec2 量出,文本 token 用 Audex tokenizer):
| 任务 | 样本数 | 音频小时 | 音频 token | 文本 token | 总 token |
|---|---|---|---|---|---|
| Text-to-Speech (TTS) | 147M | 421K | 75.8B | 5.2B | 81.0B |
| Text-to-Audio (TTA) | 12M | 34K | 24.3B | 0.4B | 24.7B |
| Audio Understanding | 49M | 308K | 27.7B | 2.2B | 29.9B |
| Speech Recognition (ASR) | 95M | 201K | 18.1B | 4.4B | 22.5B |
| Speech Translation (AST) | 58M | 128K | 11.5B | 5.3B | 16.8B |
| Text SFT | 33M | 0 | 0 | 303.0B | 303.0B |
| Total | 394M | 1,092K | 157.4B | 320.5B | 477.9B |
数据来源与处理(都强调用许可宽松的公开语料):
- 文本 SFT/RL:直接沿用 Nemotron-Cascade-2 的 SFT 与 RL 数据(覆盖 reasoning、math、coding、alignment、long-context、agentic、多语种),源自 Nemotron-Cascade 与 Nemotron 3 Nano。文本 SFT 过滤掉超过 200K token 的样本。
- ASR/AST:公开语音语料。ASR 目标格式是”输入语言 + transcript”;为提升噪声/混响鲁棒性,用第 5 届 DNS Challenge 的真实全带噪声与房间冲激响应做数据增强、保留原 transcript 当目标。AST 每条目标含”源语言 + 源语言转录 + 英文翻译”顺序排列,让模型学”先转录再翻译”的中间步。
- TTS:公开语音语料 + 专门 TTS 语料 + ASR 里的干净样本。固定音色 TTS 选了 Tortoise 里一个和 X-Codec2 重建质量好的合成音色,用 Qwen3-TTS-12Hz-1.7B-Base 把约 8% 的 TTS 数据转成这个音色。输入时长阈值 0.1–120 秒,多数落在几秒到二十几秒。
- 音频理解:沿 Audio Flamingo 3 / Audio Flamingo Next,单轮 audio QA 格式,全部重采样到 16kHz。
- TTA:沿 ETTA、Stable Audio Open、Tango-AF、TangoFlux 的做法,用许可宽松样本并过滤低质/不相关的;输出长度固定 10 秒(早期实验发现变长会训练不稳)。
训练方法
核心结论之一:不需要音频/语音预训练也能造出最强音频 LLM——直接从文本预训练模型出发做后训练。
损失:标准 LLM 交叉熵(式 1),配 square averaging loss(Chen 2024d,式 2)处理 packed 序列。30B MoE 层用 auxiliary-loss-free load balancing(update rate 1e-3,top-K routing scale 2.5),外加系数 1e-6 的标准 load balancing loss。
SFT,研究了两种 curriculum(Figure 3 上半 + Table 3):
- Multi-stage SFT(最终采用):① 先做和 Cascade-2 一样的纯文本 SFT(直接复用 Cascade-2 SFT 后的 checkpoint);② Audio Warmup——扩词表、加 audio encoder 和随机初始化的 MLP adapter,只训 MLP adapter 和 audio token embedding,冻结文本 token embedding(训文本 embedding 会掉文本质量,见消融);③ Audio Gen SFT——解冻整个 LLM,在音频/语音生成 + 文本数据上训(这一步不含 audio-to-text 任务,因为音频生成是全新任务需要更多训练;encoder 和 MLP 此阶段不参与);④ 再解冻 MLP adapter + LLM,加入音频理解、ASR、AST + 音频生成 + 文本,encoder 保持冻结。另有一个额外阶段去掉 speech prompting 能力以负责任地发布。
- Single-stage consolidated SFT:直接对预训练底座做 audio warmup,然后把所有 SFT 数据(音频生成、理解、文本)合成单个 stage 一起训。总 epoch 更少、训练预算更低,但会破坏 long-context attention——NIAH(256K/1M) 从 99.3/86.8 崩到 6.0/0.0(Table 4)。论文推测长文本样本和长音频样本同时学太难,multi-stage 先学好长上下文再维持才行。综合稳定性和调参难度,选 multi-stage。
数据配比按 epoch 给(Table 3):文本权重 % 在各 SFT 阶段是 Text 100 / Audio Warmup 44 / Audio Gen 59 / Audio Gen+Und 69(single-stage consolidated 需要 75 才能保住文本质量)。超参:global batch 64,max LR:文本 5e-5、audio warmup 2e-3、其余 2e-5;cosine scheduler,warmup 200 step / 5%;AdamW β=(0.9, 0.98/0.999)。
Cascade RL + MOPD(仅文本域):把 multi-stage SFT 的 checkpoint 当 Audex SFT,然后做只在文本域的 RL,流程和 Nemotron-Cascade-2 一样:Instruction-Following RL → Multi-domain RL → Multi-domain On-policy Distillation (MOPD) → RLHF → Long-context RL(Figure 3 下半)。有意思的现象:纯文本 RL 后,音频/语音任务几乎不回退,而文本任务显著提升——论文引 Nemotron-Cascade 4.1.1 节”为什么 Cascade RL 抗灾难性遗忘”来解释。分阶段看(Table 15),文本 benchmark 随对应 RL 阶段提升,音频 benchmark 大体稳定,唯一例外是 MOPD 会短暂拉低 ASR 和 MMSU,但后续两个 RL 阶段又恢复。最终 checkpoint 才叫 Audex;RL 只加在 30B-A3B 上,2B 就是 multi-stage SFT 的 checkpoint。
Classifier-Free Guidance:只有语音/音频生成需要 CFG。为了不改训练基础设施,用预处理式做法——随机选 10% 的 speech/audio 生成样本,把 transcription/caption 换成随机长度的 padding token(等价于把条件置空),混进训练集。推理侧在 vLLM 里把每个生成样本成对提交 conditional/unconditional 到同一 decoding batch,custom logits processor 追踪配对、按式 3 组合 next-token logit 再喂回采样,每步保持 token 同步。最优 CFG:TTA λ∈[3,5](用 3),TTS λ≈1.5(TTS 即便不用 CFG 的 WER 也很低)。采样 Top-k=80;TTA temperature 1.0,TTS temperature 0.1(TTA 需要更多随机性,TTS 不需要)。
Infra(训练 / 推理工程)
训练:Megatron 框架 + Transformer Engine。并行策略 TP=4,EP=32(expert parallelism),CP=8(context parallelism),加 sequence parallelism,训练序列长度拉到 262,144。硬件 512× NVIDIA H100,BF16 精度,AdamW,grad clipping 1.0。数据加载用 Megatron-Energon 的多模态 dataloader + online sequence packing(balanced greedy knapsack 算法,同 Nemotron 3 Nano Omni),packing buffer 8192,每个 DP rank num_workers=4。为省掉训练时的 audio codec forward,TTS/TTA 的目标音频用 base64 格式预 tokenize 好。GPU·时、训练总时长等未披露。
推理 / 部署(HF model card):官方推荐 vLLM 0.20.0 容器(vllm/vllm-openai:v0.20.0-cu129),文本推理、TTS、TTA、音频理解/ASR/AST 都能跑;音频输入解码需 pip install "vllm[audio]"。也支持 SGLang,以及 transformers ≥ 4.53.0(因为底座是 hybrid Mamba,额外要 mamba-ssm + causal-conv1d)。支持 1M context。音频 QA 用 <sound> 占位的 JSON 输入,TP 可配(示例用 8);TTA 需下 XCodec1,TTS 默认用自带的 causal speech decoder 做流式(也可换原版 X-Codec2 拿更高质量但非流式)。
评测 benchmark
Audex 的主打是”文本能力对齐底座、音频能力达 SOTA”,两条线都给了定量数字(Table 1 主表,Table 5 文本,6–14 音频细分)。文本 benchmark 都在 thinking 模式、带工具(math/code 标 ◇ 为 tool-integrated reasoning)。
文本能力 vs 底座 Nemotron-Cascade-2-30B-A3B(Table 1,Audex | Cascade-2):
- Reasoning:AIME 2025 91.2◇ vs 98.6◇ 的对照里 Audex 拿 91.2|98.3◇;AIME 2026 89.4|96.6◇ vs 90.9|95.0◇;HMMT Feb25 92.2|93.8◇ vs 94.6|92.2◇;IMO AnswerBench 81.1 vs 79.3(Audex 略高);LiveCodeBench v6 85.3|86.2◇ vs 87.2|88.4◇。
- Knowledge:MMLU-Redux 86.4 vs 86.3,MMLU-Pro 78.9 vs 79.8,GPQA-Diamond 74.9 vs 76.1。
- Alignment:ArenaHard v2 81.6 vs 83.5,IFBench 77.8 vs 82.9。
- Long-context:NIAH(256K|1M) 99.4|83.4 vs 100|99.0;LongBench v2 41.3 vs 40.3;AA-LCR 39.3 vs 39.1。
- Agentic:τ²-Bench 57.2 vs 58.9,Terminal Bench 2.0 19.1 vs 21.2,SWE Verified 48.2 vs 50.2。
整体就是”marginal or no regression”——多数掉个位数、部分反超(IMO AnswerBench、部分 AIME/HMMT、AA-LCR、LongBench)。作为对照,论文强调 Qwen3-Omni-30B-A3B-Thinking 相对其文本底座 Qwen3-30B-A3B-Thinking-2507 在推理上大幅退化(比如 AIME 2025 73.7 vs 85.0,HMMT 60.4 vs 71.4),Qwen3.5-Omni-Flash 也明显不如 Qwen3.5。
音频理解(Table 1 / 12):MMAU 75.6(和最强开源 Step-Audio-R1.1-33B 73.6、Qwen3-Omni-Thinking 75.4 相当,略逊闭源 Qwen3.5-Omni-Flash 80.4),MMAR 63.2、MMSU 63.4(这两项对最强音频 LLM 仍有差距),Audio Entailment 95.0(deductive reasoning,远超 Step-Audio 61.6)、CMM Hallucination 90.3——后两项说明可信度/抗幻觉强。
ASR(WER↓,Table 1/8/9):OpenASR average 6.82(优于 Step-Audio-R1.1-33B 7.91、多个 ASR 专用基线,接近闭源 Qwen3.5-Omni-Flash);LibriSpeech clean/other 1.34/3.06,noisy 2.92;Fleurs 多语种 5.11。噪声 ASR 上 -5dB 到 100dB 平均 2.92,强于所有对手。30B 与 2B 差距不大(2B OpenASR 7.14),因为 encoder 已抓到转写所需信息。
AST(Fleurs xx→en,BLEU|COMET,Table 1/11):平均 34.0|86.9,和多个 SOTA speech LLM 相当。
TTS(Seed-TTS-Eval en,Table 1/6):WER↓ 1.70(fixed-voice),非常低;prompting WER 2.07。SIM(说话人相似度)45.3 偏低,作者归因于 codec 选择和训练 recipe 没为 SIM 优化。
通用音频生成(OpenL3 Fréchet Distance↓,Table 1/7):AudioCaps 66.9、SongDescriber 62.7(SFT checkpoint 更好,60.9/58.1,是公开数据训练模型里的 SOTA;文本 RL 后 +6.0/4.6,可忽略)。论文强调:多数 diffusion/AR 基线靠 cross-attention 条件化在语义 text embedding 上,而 Audex 直接把 raw text token 放 user turn、生成 raw audio token,把 TTA 统一进 next-token-prediction 范式。Audex 是最强开源模型里唯一支持语音以外通用音频生成的。
语音到语音(BigBenchAudio,Table 1/13):级联管线(同一个 Audex 做 ASR + 文本推理 + TTS),得分 90.0,在榜上很有竞争力(超过 Qwen3.5 Omni Plus Realtime 73.0、Nova 2.0 Sonic 88.1,逊于 Fun-Realtime-Audiochat 97.6、Gemini 3.1 Flash Live 96.6)。VoiceBench(Table 14)在指令跟随、推理、多选 QA、安全上都很强(AdvBench 99.6)。2B 版 BigBenchAudio 64.3。
关键消融:① Audio warmup 冻结文本 embedding 是刚需——unfreeze 会让 MMLU-Pro 78.9→71.2、GPQA 73.8→62.3、AIME 93.2→71.8(Table 16)。② single-stage consolidated SFT 省预算但破坏 NIAH(长上下文),且需要更高文本配比(0.75 甚至 0.88)才不崩文本。③ 文本 RL 抗遗忘,只提文本不伤音频。
创新点与影响
- 单 decoder 统一 audio-text:不用 thinker-talker、不用级联多模型,音频输入投进文本 embedding 空间、音频输出 token 和文本 token 同等对待,直接吃现成 Megatron/vLLM 栈。这让”一个 30B MoE 同时做理解 + ASR/AST + TTS + 通用音频生成 + S2S”成为可能。
- 无音频预训练:证明从文本预训练底座出发、只做后训练(多阶段 SFT + 纯文本 RL)就能拿到 best-in-class 音频 LLM,训练量只有 157.4B 音频 token。
- 文本智能几乎无损:系统研究了 audio warmup 冻结策略、SFT curriculum、文本 RL 抗遗忘,把”加音频不掉文本”从口号变成可复现配方——这是相对 Qwen3-Omni 等的主要差异化。
- 把 UALM 的 LLM-based 音频生成放大到 30B MoE + CFG:通用音频生成质量做到公开数据 SOTA,且是最强开源里唯一能生成非语音音频的。
- speech/audio 双 codec 分派:语音用低 token/s 单层 FSQ(X-Codec2),非语音用高预算 RVQ(X-Codec 前 4 层),按结构复杂度分配 token 预算。
影响:给”原生多模态但不牺牲文本”提供了一份完整开源配方(模型 + 训练/推理细节),尤其把纯文本 RL 用在多模态模型上抗遗忘这一点,论文自己也点名是值得继续做 audio-text RL 的方向。
已知局限:① MMAR/MMSU 相对最强音频 LLM 仍有差距;② TTS 的说话人相似度 SIM 偏低(45.3),codec/recipe 未为此优化;③ 通用音频生成固定 10 秒,变长会不稳,长度/一致性靠后续数据和 RL 解决;④ 语音到语音走的是级联(ASR+推理+TTS 都用同一 Audex),不是真正的全双工/duplex 实时交互,duplex 明确排除在本文范围外;⑤ 权重是 NVIDIA Oneway Noncommercial License(非商用),不是 Apache/宽松开源。
原始链接
- arxiv_abs: https://arxiv.org/abs/2607.05196
- arxiv_pdf: https://arxiv.org/pdf/2607.05196
- HuggingFace collection: https://huggingface.co/collections/nvidia/nemotron-labs-audex
- HF model card (30B-A3B): https://huggingface.co/nvidia/Nemotron-Labs-Audex-30B-A3B
- HF model card (2B): https://huggingface.co/nvidia/Nemotron-Labs-Audex-2B
- 底座 LLM: https://huggingface.co/nvidia/Nemotron-Cascade-2-30B-A3B
- 说明:未发现 Audex 专属的 NVIDIA 官方博客或独立 GitHub 仓库;论文只引用 NVIDIA 的通用基础设施仓库(Megatron-LM / Megatron-Energon / TransformerEngine)。
一手源存档(sources/)
- arxiv-2607.05196.pdf (arXiv 全文 PDF,41 页,不入 git;HTML 版对本文不可用,全文从 PDF 读取)
- nemotron-audex—arxiv.md (abstract + 从 PDF 提取的关键 spec/数字)
- nemotron-audex—hf-collection.md
- nemotron-audex—hf-card.md