Stable Audio 3 係一個由 Small、Medium、Large 組成嘅音訊生成模型家族,可以由文字提示生成或編輯音樂同聲效,最長可生成約 6 分鐘音訊。[1][8] 系統用「語義‑聲學自編碼器」將音訊壓縮到潛在空間,再用擴散模型生成音訊,令長時間音訊生成更高效。[1][2] Stability AI 將 Small 同 Medium 版本以開放權重形式發布,並強調使用已授權訓練數據,希望同 Suno、Udio 等封閉平台形成差異。[4][8]

Create a landscape editorial hero image for this Studio Global article: How does Stability AI’s new Stable Audio 3 work, what models are included in the release, what technical improvements does it introduce (suc. Article summary: Stable Audio 3 is Stability AI’s new family of fast latent-diffusion audio models for variable-length music and sound generation, with editing support such as inpainting.[1] The release includes small, medium, and large . Topic tags: general, academic, general web. Reference image context from search candidates: Reference image 1: visual subject "# Announcing Stable Audio: A Generative AI Music Service. We’re pleased to announce the release of Stable Audio, a new generative AI music service. Stable Audio is a collaboration" source context "Announcing Stable Audio: A Generative AI Music Service" Reference image 2: visual subject "## **For** **everywhere** **your
AI 音樂生成技術近年發展得非常快,而 Stability AI 最新推出嘅 Stable Audio 3,正正係想成為呢個領域嘅核心模型之一。呢個系統唔只係單一模型,而係一個由多個模型組成嘅家族,可以由文字提示生成音樂、聲效,甚至對現有音訊進行編輯,而且可以生成 幾分鐘長嘅音訊片段。同部分競爭對手唔同,當中部分模型更提供 開放權重同已授權訓練數據,方便研究者同開發者自行擴展。
Stable Audio 3 係一個用於音訊生成同編輯嘅 潛在擴散模型(latent diffusion)家族,主要分為三個版本:Small、Medium 同 Large。系統可以根據文字提示生成音樂、樂器段落或者聲效,同時亦可以修改現有音訊片段。
同直接生成原始聲波(waveform)唔同,Stable Audio 3 先將音訊轉換成 壓縮嘅潛在表示(latent representation) 再進行生成。呢種做法大幅降低運算成本,亦令生成 長時間音訊 變得可行。
發佈資料特別強調兩個重要能力:
呢啲功能令 Stable Audio 3 唔只係「prompt 生成歌曲」工具,而係更接近一個 AI 音訊創作工具平台。
Stable Audio 3 嘅基本原理,同而家好多 AI 圖像生成模型相似:擴散模型喺壓縮潛在空間入面生成內容。
其中一個核心組件叫做 語義‑聲學自編碼器(semantic‑acoustic autoencoder)。呢個模型會將原始音訊轉換成一個緊湊表示,同時保留兩種資訊:
整個生成流程大致如下:
由於擴散過程係喺壓縮空間進行,系統可以 用較少運算生成更長嘅音訊,同時保持音質。
Stable Audio 3 嘅設計重點之一係 原生支援不同長度音訊生成。
傳統音訊生成模型往往固定長度,但 Stable Audio 3 可以按需求生成:
另外,系統亦支援 audio inpainting,即係可以:
呢種能力令模型更接近 生成式音訊工作站工具(generative audio workstation),而唔只係單純生成音樂。
Stable Audio 3 係一個 多尺寸模型家族,每個版本針對唔同使用場景。
常見有兩個版本:
官方表示整個模型家族可生成 最長約六分鐘音訊(視乎配置而定)。
Stable Audio 3 採用 多階段訓練流程。核心思路係先分別訓練不同組件,再整合成完整生成系統。
簡化流程包括:
論文確認存在多階段設計,但公開資料對每個訓練階段嘅細節仍然比較有限。
Stable Audio 3 嘅一個重要特色係 授權策略。
Stability AI 表示模型係使用 完全授權嘅訓練數據,而生成內容嘅所有權屬於用戶。
主要授權重點包括:
呢個策略亦回應生成式 AI 行業近年最具爭議嘅議題之一:AI 訓練數據版權問題。
目前 AI 音樂市場競爭激烈,例如 Suno 同 Udio 已經可以生成完整歌曲甚至人聲。
Stable Audio 3 嘅定位有少少唔同。
Stability AI 更強調:
相比之下,Suno 同 Udio 更偏向 封閉式消費產品平台。
換句話講,Stable Audio 3 更似係一個 音訊生成基礎模型(foundation model),希望成為藝術家、研究者同開發者構建新工具嘅底層技術。
Stable Audio 3 顯示 AI 音訊生成模型正逐步由「玩具式生成歌曲」走向 可編輯、可擴展嘅創作平台。
最突出的三點包括:
隨住生成式 AI 工具愈來愈成熟,呢類架構有機會成為下一代 AI 驅動音樂製作工具同數碼音訊工作站(DAW) 嘅核心技術。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Stable Audio 3 係一個由 Small、Medium、Large 組成嘅音訊生成模型家族,可以由文字提示生成或編輯音樂同聲效,最長可生成約 6 分鐘音訊。[1][8]
Stable Audio 3 係一個由 Small、Medium、Large 組成嘅音訊生成模型家族,可以由文字提示生成或編輯音樂同聲效,最長可生成約 6 分鐘音訊。[1][8] 系統用「語義‑聲學自編碼器」將音訊壓縮到潛在空間,再用擴散模型生成音訊,令長時間音訊生成更高效。[1][2]
Stability AI 將 Small 同 Medium 版本以開放權重形式發布,並強調使用已授權訓練數據,希望同 Suno、Udio 等封閉平台形成差異。[4][8]