Stable Audio 3 是一组潜空间扩散音频模型(Small、Medium、Large),支持可变长度生成、音频补全(inpainting)以及最长约 6 分钟的音频生成。[1][8] 模型通过语义‑声学自动编码器将音频压缩到潜空间中生成,大幅降低计算成本,并支持对已有音频进行局部编辑。[1][2] 与 Suno、Udio 等封闭平台不同,Stability AI 强调开放权重、授权训练数据以及开发者可扩展的音频基础模型定位。[4][8]

Create a landscape editorial hero image for this Studio Global article: How does Stability AI’s new Stable Audio 3 work, what models are included in the release, what technical improvements does it introduce (suc. Article summary: Stable Audio 3 is Stability AI’s new family of fast latent-diffusion audio models for variable-length music and sound generation, with editing support such as inpainting.[1] The release includes small, medium, and large . Topic tags: general, academic, general web. Reference image context from search candidates: Reference image 1: visual subject "# Announcing Stable Audio: A Generative AI Music Service. We’re pleased to announce the release of Stable Audio, a new generative AI music service. Stable Audio is a collaboration" source context "Announcing Stable Audio: A Generative AI Music Service" Reference image 2: visual subject "## **For** **everywhere** **your
AI 音乐生成领域正在快速发展,而 Stable Audio 3 是 Stability AI 最新推出的一代音频生成模型。该系统由一系列扩散模型组成,可以根据文本提示生成音乐或音效,也能编辑现有音频片段,同时保持较高效率,支持生成 多分钟长度的音频内容。与不少竞争产品不同,该模型家族的一部分还提供 开放权重和授权训练数据,方便研究人员与开发者在此基础上构建新的应用。
Stable Audio 3 是一个 用于音频生成与编辑的潜空间扩散模型家族,包含三个主要版本:Small、Medium 和 Large。这些模型能够根据提示词生成音乐作品或音效,也可以对已有音频进行修改或扩展。
与直接生成原始波形的系统不同,Stable Audio 3 在 压缩后的潜空间(latent space) 中进行生成。这种方式显著降低计算成本,使生成较长音频成为可能。
该系统的两个关键能力包括:
因此,它不仅能生成全新的音乐,还可以用于 编辑、修复或扩展已有录音。
Stable Audio 3 的核心技术与许多现代图像生成模型类似:在压缩潜空间中运行的扩散模型。
系统的关键组件是 语义‑声学自动编码器(semantic‑acoustic autoencoder)。它将原始音频转换为紧凑表示,同时保留音乐结构和声音细节。
整体流程大致如下:
由于扩散过程发生在压缩表示中,而不是直接处理原始音频,系统能够在保持音质的同时 大幅减少计算量并支持更长音频生成。
Stable Audio 3 的一个重要设计目标,是支持不同长度音频的高效生成。
模型原生支持 可变长度生成:用户既可以生成几秒的音效,也可以生成持续数分钟的音乐,而不需要为短音频计算完整长度输出。
此外,系统还支持 音频补全(inpainting),允许用户:
这种能力使 Stable Audio 3 更像是一个 生成式音频工作站工具,而不仅仅是“输入提示生成整首歌”的系统。
Stable Audio 3 作为一个 模型家族 发布,不同规模针对不同使用场景。
常见的两个版本包括:
根据 Stability AI 的说明,该模型家族在合适配置下可以生成 最长约 6 分钟的音频内容。
Stable Audio 3 采用 多阶段训练流程,核心围绕语义‑声学自动编码器和扩散生成模型展开。
简化来说,训练流程包括:
公开资料表明这是一个分阶段训练系统,但每个阶段的详细结构在公开摘要中披露较少。
Stable Audio 3 的一个重要特点是其许可策略。
Stability AI 表示,该系列模型 使用完全授权的数据进行训练,并且用户拥有生成内容的使用权。
主要许可特点包括:
这种强调授权数据与开放权重的策略,是对生成式 AI 训练数据版权争议的一种回应。
AI 音乐生成领域竞争正在加剧。例如 Suno 和 Udio 等平台,已经可以直接生成带人声的完整歌曲,并以消费级应用为主要目标。
相比之下,Stable Audio 3 采取了不同策略:
这意味着 Stability AI 的目标并不只是打造一个面向普通用户的音乐生成应用,而是推出一个 面向创作者和开发者的音频基础模型平台。
Stable Audio 3 展示了一种新的方向:可编辑、可扩展的长音频生成模型。
其几个关键特点包括:
随着生成式音频技术的发展,这类模型很可能成为未来数字音频工作站(DAW)和创作工具的重要基础。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Stable Audio 3 是一组潜空间扩散音频模型(Small、Medium、Large),支持可变长度生成、音频补全(inpainting)以及最长约 6 分钟的音频生成。[1][8]
Stable Audio 3 是一组潜空间扩散音频模型(Small、Medium、Large),支持可变长度生成、音频补全(inpainting)以及最长约 6 分钟的音频生成。[1][8] 模型通过语义‑声学自动编码器将音频压缩到潜空间中生成,大幅降低计算成本,并支持对已有音频进行局部编辑。[1][2]
与 Suno、Udio 等封闭平台不同,Stability AI 强调开放权重、授权训练数据以及开发者可扩展的音频基础模型定位。[4][8]