同直接生成原始聲波(waveform)唔同,Stable Audio 3 先將音訊轉換成 壓縮嘅潛在表示(latent representation) 再進行生成。呢種做法大幅降低運算成本,亦令生成 長時間音訊 變得可行。
發佈資料特別強調兩個重要能力:
呢啲功能令 Stable Audio 3 唔只係「prompt 生成歌曲」工具,而係更接近一個 AI 音訊創作工具平台。
Stable Audio 3 嘅基本原理,同而家好多 AI 圖像生成模型相似:擴散模型喺壓縮潛在空間入面生成內容。
其中一個核心組件叫做 語義‑聲學自編碼器(semantic‑acoustic autoencoder)。呢個模型會將原始音訊轉換成一個緊湊表示,同時保留兩種資訊:
整個生成流程大致如下:
由於擴散過程係喺壓縮空間進行,系統可以 用較少運算生成更長嘅音訊,同時保持音質。
Stable Audio 3 嘅設計重點之一係 原生支援不同長度音訊生成。
傳統音訊生成模型往往固定長度,但 Stable Audio 3 可以按需求生成:
呢個功能可以避免為短音訊付出生成整段長音訊嘅運算成本。
另外,系統亦支援 audio inpainting,即係可以:
呢種能力令模型更接近 生成式音訊工作站工具(generative audio workstation),而唔只係單純生成音樂。
Stable Audio 3 係一個 多尺寸模型家族,每個版本針對唔同使用場景。
常見有兩個版本:
官方表示整個模型家族可生成 最長約六分鐘音訊(視乎配置而定)。
Stable Audio 3 採用 多階段訓練流程。核心思路係先分別訓練不同組件,再整合成完整生成系統。
簡化流程包括:
論文確認存在多階段設計,但公開資料對每個訓練階段嘅細節仍然比較有限。
Stable Audio 3 嘅一個重要特色係 授權策略。
Stability AI 表示模型係使用 完全授權嘅訓練數據,而生成內容嘅所有權屬於用戶。
主要授權重點包括:
呢個策略亦回應生成式 AI 行業近年最具爭議嘅議題之一:AI 訓練數據版權問題。
目前 AI 音樂市場競爭激烈,例如 Suno 同 Udio 已經可以生成完整歌曲甚至人聲。
Stable Audio 3 嘅定位有少少唔同。
Stability AI 更強調:
相比之下,Suno 同 Udio 更偏向 封閉式消費產品平台。
換句話講,Stable Audio 3 更似係一個 音訊生成基礎模型(foundation model),希望成為藝術家、研究者同開發者構建新工具嘅底層技術。
Stable Audio 3 顯示 AI 音訊生成模型正逐步由「玩具式生成歌曲」走向 可編輯、可擴展嘅創作平台。
最突出的三點包括:
隨住生成式 AI 工具愈來愈成熟,呢類架構有機會成為下一代 AI 驅動音樂製作工具同數碼音訊工作站(DAW) 嘅核心技術。