これらのモデルは、テキストプロンプトから楽曲や効果音を生成するだけでなく、既存の音声を編集する機能も備えています。
また設定によっては最大およそ6分程度の音声生成が可能とされています。
Stable Audio 3は、近年の画像生成AIでも広く使われている**拡散モデル(diffusion model)**を音声生成に応用したものです。
ただし、生の音声波形を直接生成するのではなく、圧縮された潜在空間(latent space)上で生成処理を行う点が重要な特徴です。
基本的な流れは次のようになります。
音声の圧縮
セマンティック・アコースティックオートエンコーダーが音声を潜在表現に変換する。
拡散モデルによる生成
テキストなどの条件に基づき、潜在空間上で新しい音声表現を生成する。
デコード
潜在表現を再び波形音声に変換する。
この方法により、計算量を抑えながら長い音声を生成できるという利点があります。
Stable Audio 3の中核技術の一つが、**Semantic‑Acoustic Autoencoder(セマンティック・アコースティックオートエンコーダー)**です。
このモデルは、音声を圧縮する際に
の両方を保持したまま潜在表現に変換します。
その結果、拡散モデルが生成した潜在データからでも自然な音質を保った音声を再構築できるようになります。
Stable Audio 3では、可変長の音声生成がネイティブにサポートされています。
これは例えば
といった異なる長さの音声を、必要な長さだけ計算して生成できる仕組みです。
通常、最大長に合わせて常に生成する方式だと計算コストが無駄になります。可変長生成によって、その問題を回避できます。
Stable Audio 3は音声インペインティングにも対応しています。
これは画像生成AIのインペインティングと似ており、既存の音声の一部を指定してAIに補完・置き換えさせる技術です。
例えば次のような用途があります。
この機能により、単なる生成AIではなく、音楽制作ツールのような編集ワークフローにも使える可能性があります。
Stable Audio 3は、用途や性能に応じて3つのモデルサイズが用意されています。
主なバリエーション:
Largeモデルのウェイトは一般公開されておらず、APIまたは企業向けデプロイで利用する形になります。
Stable Audio 3は、複数段階のトレーニングプロセスで構築されています。
大まかな流れは次の通りです。
このようにコンポーネントを段階的に学習させることで、長時間音声生成と高品質音声の両立を目指しています。
Stable Audio 3の大きな特徴の一つが、ライセンス済みデータでの学習とオープンウェイトの公開です。
主なポイントは以下です。
生成物はStability AI Community Licenseの下で商用利用も可能とされています(一定規模以上の企業はエンタープライズ契約)。
AI音楽生成市場では、
といったサービスが、ボーカル付きの楽曲生成で人気を集めています。
一方でStable Audio 3は、次の点に重点を置いています。
つまり、一般向けのアプリというより、音声生成の基盤モデル(foundation model)としての役割を目指した設計といえます。
Stable Audio 3は、AI音楽生成モデルの中でも特に次の3点で注目されています。
こうした設計は、将来的に**生成AIを組み込んだ音楽制作ツールやDAW(デジタル音楽制作ソフト)**の基盤として活用される可能性があります。