Stability AIはこのシステムを、「生成オーディオ(generative audio)」の実験と創作のための基盤と説明しています。また、従来のAI音楽ツールで問題視されてきた著作権問題を避けるため、ライセンス済みデータセットで学習している点を強調しています。
さらに、用途に応じて選べるように複数のモデルサイズが用意されています。軽量モデルはローカル環境でも動作し、上位モデルではより長い楽曲生成が可能です。
Stable Audio 3.0は、パラメータ数の異なる4つのモデルで構成されています。
Stable Audio 3.0 Small SFX
Stable Audio 3.0 Small
Stable Audio 3.0 Medium
Stable Audio 3.0 Large
このような階層構造により、開発者はハードウェア性能・品質・生成時間に応じてモデルを選択できます。
Stable Audio 3.0の大きな進化は、生成できる楽曲の長さです。
以前のバージョンと比べると、この長さは2倍以上に拡張されています。これにより、単なる短いループではなく、イントロから展開まである楽曲構造をAIが作れる可能性が広がりました。
Stable Audio 3.0は、すべてを公開するのではなくハイブリッド配布を採用しています。
オープンウェイト(ダウンロード可能)
これらは開発者や研究者がローカルで実行したり、改良したりできます。
API提供のみ
最上位モデルは公開ウェイトとしては提供されず、クラウドAPIやエンタープライズ向けサービスで利用する形になります。
この戦略は、コミュニティ向けに一定のオープン性を保ちつつ、最も高性能なモデルは商用サービスとして提供するという形です。
AI音楽分野では、学習データの著作権問題が大きな議論になっています。
Stability AIは、Stable Audio 3.0が完全にライセンスされたデータセットで学習されたと説明しています。
生成した音楽の扱いについては次のような仕組みです。
基本的に、ユーザーは生成した音源の所有と配布が可能とされています。
ただし、具体的なデータ構成の詳細は完全には公開されておらず、外部からの独立検証は限定的とされています。
Stability AIは、音楽業界との協力関係も進めています。
Universal Music Group(UMG)
Warner Music Group(WMG)
これらの提携は、AI音楽の最大の争点である**「著作権データの扱い」**をクリアにする狙いがあります。
現在、AI音楽市場では複数の企業が競争しています。
代表的なプレイヤーには次のような企業があります。
Stable Audio 3.0の特徴は、主に次の2点です。
さらに、6分以上の長尺生成が可能になったことで、AIは短いクリップ生成から、実際の楽曲制作に近い領域へと踏み込みつつあります。
Stable Audio 3.0は、単一モデルではなく用途別のモデルファミリーという設計になっています。
この構造により、個人クリエイターからプロ制作まで幅広いユーザーを狙う戦略です。
音楽生成AIがさらにリアルで長い楽曲を作れるようになれば、こうしたモデルは将来、次世代の音楽制作ソフトの基盤技術になる可能性があります。