Stability AI 将其定位为一个用于 “生成式音频(generative audio)”实验与创作的平台。公司表示,这些模型使用授权数据集训练,以降低版权风险,这是早期一些 AI 音乐系统常被质疑的问题。
该模型家族按不同规模划分,让开发者可以在本地轻量运行,或使用更大的模型生成更复杂、更长的音乐作品。
Stable Audio 3.0 包含四个模型,参数规模从数亿到数十亿不等。
Stable Audio 3.0 Small SFX
Stable Audio 3.0 Small
Stable Audio 3.0 Medium
Stable Audio 3.0 Large
这种分层结构让开发者可以根据硬件条件、音质需求和生成长度选择合适的模型。
Stable Audio 3.0 最大的升级之一是 生成长度显著提升。
相比 Stable Audio 2.0 的生成时长,这一长度 提升超过一倍,意味着 AI 不再只生成短循环或片段,而是可以生成接近完整歌曲结构的作品。
Stability AI 采用了混合发布策略。
开放权重模型:
这些模型可以下载并在本地运行或进行开发修改。
API / 托管模型:
最大模型没有公开权重,而是通过托管服务或 API 提供,通常面向企业用户。
这种策略与 Stability AI 在其他生成式模型上的做法类似:为开发者开放部分能力,同时将最强模型保留在商业服务中。
Stability AI 强调 Stable Audio 3.0 使用 完全授权的数据集进行训练,试图解决 AI 音乐领域长期存在的版权争议。
在许可方面:
不过,公司尚未公开完整的数据集构成,因此外界仍无法完全独立验证所有训练数据来源。
为了强化授权数据来源,Stability AI 与主要音乐公司建立合作关系。
这些合作被视为解决生成式音乐版权问题的一种方式,即让模型训练基于合法授权的数据。
Stable Audio 3.0 发布之际,AI 音乐领域竞争正在迅速升温。
包括 Google、Suno、Udio 和 ElevenLabs 在内的公司,都在开发能够生成高质量音乐和人声的系统。
Stable Audio 3.0 的差异化主要体现在两点:
再加上超过 6 分钟的生成时长,AI 音乐工具正逐渐从生成短 demo 片段,迈向真正意义上的完整歌曲创作平台。
Stable Audio 3.0 也反映了生成式 AI 的一个重要趋势:从单一模型转向模型家族。
通过同时提供轻量模型、开放权重模型和企业级模型,Stability AI 试图覆盖从个人创作者到专业音乐制作人的广泛用户群。
随着生成质量、歌曲结构控制和版权合规不断提升,像 Stable Audio 3.0 这样的系统,可能成为下一代音乐创作软件的重要基础组件。