Stable Audio 3はSmall・Medium・Largeの3種類からなる潜在拡散型の音声生成モデルで、音楽や効果音を数分単位で生成・編集できる。[1][8] セマンティック・アコースティックオートエンコーダーによる圧縮潜在空間で生成するため、計算コストを抑えつつ長い音声を生成できる。[1][2] SmallとMediumはオープンウェイトで公開され、ライセンス済みデータで学習されている点が、SunoやUdioなどの競合サービスとの差別化ポイントとなっている。[4][8]

Create a landscape editorial hero image for this Studio Global article: How does Stability AI’s new Stable Audio 3 work, what models are included in the release, what technical improvements does it introduce (suc. Article summary: Stable Audio 3 is Stability AI’s new family of fast latent-diffusion audio models for variable-length music and sound generation, with editing support such as inpainting.[1] The release includes small, medium, and large . Topic tags: general, academic, general web. Reference image context from search candidates: Reference image 1: visual subject "# Announcing Stable Audio: A Generative AI Music Service. We’re pleased to announce the release of Stable Audio, a new generative AI music service. Stable Audio is a collaboration" source context "Announcing Stable Audio: A Generative AI Music Service" Reference image 2: visual subject "## **For** **everywhere** **your
AIによる音楽生成の分野は急速に進化しています。その中で**Stability AIが発表した「Stable Audio 3」**は、音楽や効果音をテキスト指示から生成・編集できる新しいAIモデル群として注目されています。
このシステムの特徴は、数分間の音声を生成できる効率的な拡散モデルと、研究者や開発者が利用できるオープンウェイトモデルの提供にあります。
以下では、Stable Audio 3の仕組み、モデル構成、技術的特徴、そしてAI音楽生成市場における位置づけを整理します。
Stable Audio 3は、音楽や音声を生成・編集できる潜在拡散モデル(latent diffusion model)のファミリーです。モデルは用途や計算環境に合わせて以下の3サイズで提供されています。
これらのモデルは、テキストプロンプトから楽曲や効果音を生成するだけでなく、既存の音声を編集する機能も備えています。
また設定によっては最大およそ6分程度の音声生成が可能とされています。
Stable Audio 3は、近年の画像生成AIでも広く使われている**拡散モデル(diffusion model)**を音声生成に応用したものです。
ただし、生の音声波形を直接生成するのではなく、圧縮された潜在空間(latent space)上で生成処理を行う点が重要な特徴です。
基本的な流れは次のようになります。
この方法により、計算量を抑えながら長い音声を生成できるという利点があります。
Stable Audio 3の中核技術の一つが、**Semantic‑Acoustic Autoencoder(セマンティック・アコースティックオートエンコーダー)**です。
このモデルは、音声を圧縮する際に
その結果、拡散モデルが生成した潜在データからでも自然な音質を保った音声を再構築できるようになります。
Stable Audio 3では、可変長の音声生成がネイティブにサポートされています。
これは例えば
といった異なる長さの音声を、必要な長さだけ計算して生成できる仕組みです。
通常、最大長に合わせて常に生成する方式だと計算コストが無駄になります。可変長生成によって、その問題を回避できます。
Stable Audio 3は音声インペインティングにも対応しています。
これは画像生成AIのインペインティングと似ており、既存の音声の一部を指定してAIに補完・置き換えさせる技術です。
例えば次のような用途があります。
この機能により、単なる生成AIではなく、音楽制作ツールのような編集ワークフローにも使える可能性があります。
Stable Audio 3は、用途や性能に応じて3つのモデルサイズが用意されています。
主なバリエーション:
Largeモデルのウェイトは一般公開されておらず、APIまたは企業向けデプロイで利用する形になります。
Stable Audio 3は、複数段階のトレーニングプロセスで構築されています。
大まかな流れは次の通りです。
このようにコンポーネントを段階的に学習させることで、長時間音声生成と高品質音声の両立を目指しています。
Stable Audio 3の大きな特徴の一つが、ライセンス済みデータでの学習とオープンウェイトの公開です。
主なポイントは以下です。
生成物はStability AI Community Licenseの下で商用利用も可能とされています(一定規模以上の企業はエンタープライズ契約)。
AI音楽生成市場では、
といったサービスが、ボーカル付きの楽曲生成で人気を集めています。
一方でStable Audio 3は、次の点に重点を置いています。
つまり、一般向けのアプリというより、音声生成の基盤モデル(foundation model)としての役割を目指した設計といえます。
Stable Audio 3は、AI音楽生成モデルの中でも特に次の3点で注目されています。
こうした設計は、将来的に**生成AIを組み込んだ音楽制作ツールやDAW(デジタル音楽制作ソフト)**の基盤として活用される可能性があります。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Stable Audio 3はSmall・Medium・Largeの3種類からなる潜在拡散型の音声生成モデルで、音楽や効果音を数分単位で生成・編集できる。[1][8]
Stable Audio 3はSmall・Medium・Largeの3種類からなる潜在拡散型の音声生成モデルで、音楽や効果音を数分単位で生成・編集できる。[1][8] セマンティック・アコースティックオートエンコーダーによる圧縮潜在空間で生成するため、計算コストを抑えつつ長い音声を生成できる。[1][2]
SmallとMediumはオープンウェイトで公開され、ライセンス済みデータで学習されている点が、SunoやUdioなどの競合サービスとの差別化ポイントとなっている。[4][8]