AI Research 技术调研

标签: text-to-audio

此标签下有3条笔记。

  • 2026年7月16日

    Nemotron-Labs-Audex-30B-A3B (Audex): Unified Audio Intelligence Without Regressing on Text Intelligence

    • nvidia
    • audex
    • nemotron-cascade-2
    • audio-llm
    • moe
    • mamba-transformer
    • x-codec2
    • af-whisper
    • tts
    • text-to-audio
    • speech-to-speech
    • unified-audio-text
    • cascade-rl
    • cfg
  • 2026年6月25日

    AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining

    • audio
    • text-to-audio
    • text-to-music
    • text-to-speech
    • latent-diffusion
    • self-supervised
    • audiomae
    • gpt-2
    • unified
  • 2026年6月25日

    Stable Audio: Fast Timing-Conditioned Latent Audio Diffusion

    • audio
    • music-generation
    • latent-diffusion
    • text-to-audio
    • timing-conditioning
    • stereo
    • vae
    • clap

  • GitHub