Stable Audio 3 是一個基於潛在擴散(latent diffusion)的音訊模型家族,包含 Small、Medium、Large 三個版本,可生成或編輯長達數分鐘的音樂與聲音。[1][8] 系統透過語意‑聲學自編碼器(semantic‑acoustic autoencoder)在壓縮的潛在空間中生成音訊,使多分鐘長度的生成與局部音訊編輯(如 inpainting)更有效率。[1][2] Small 與 Medium 模型提供開放權重並使用授權資料訓練,Stability AI 以此強調開放研究與創作者工具定位,與 Suno、Udio 等封閉平台形成差異。[4][8]

Create a landscape editorial hero image for this Studio Global article: How does Stability AI’s new Stable Audio 3 work, what models are included in the release, what technical improvements does it introduce (suc. Article summary: Stable Audio 3 is Stability AI’s new family of fast latent-diffusion audio models for variable-length music and sound generation, with editing support such as inpainting.[1] The release includes small, medium, and large . Topic tags: general, academic, general web. Reference image context from search candidates: Reference image 1: visual subject "# Announcing Stable Audio: A Generative AI Music Service. We’re pleased to announce the release of Stable Audio, a new generative AI music service. Stable Audio is a collaboration" source context "Announcing Stable Audio: A Generative AI Music Service" Reference image 2: visual subject "## **For** **everywhere** **your
AI 音樂生成技術正在快速發展,而 Stable Audio 3 是 Stability AI 最新推出的一代音訊生成模型家族。這套系統基於擴散模型(diffusion models),能從文字提示生成音樂或音效,也能對既有音訊進行修改與延伸,並且能生成 長達數分鐘的音訊片段。
與許多封閉式音樂生成平台不同,Stable Audio 3 的部分模型 提供開放權重(open weights)並使用授權資料集訓練,讓研究者與開發者能在其基礎上建立新工具或應用。
Stable Audio 3 是一個 用於音訊生成與編輯的潛在擴散模型(latent diffusion models)家族,目前包含三種主要尺寸:
這些模型能根據文字提示生成音樂、環境聲或其他音效,也能對既有音訊片段進行修改與延續。
與直接生成原始波形(raw waveform)不同,Stable Audio 3 在 壓縮的潛在音訊表示(latent audio representation) 上進行生成,從而降低計算成本,使生成較長的音訊成為可能。
系統的兩個關鍵能力包括:
因此,Stable Audio 3 不只是「文字生成歌曲」工具,更像是一個可進行編輯與創作的 生成式音訊製作平台。
Stable Audio 3 採用與現代影像生成器類似的核心理念:在壓縮潛在空間中運作的擴散模型。
其中最重要的元件之一是 語意‑聲學自編碼器(semantic‑acoustic autoencoder)。這個模型會把原始音訊轉換成較小的潛在表示,同時保留音樂結構與聲學細節。
整個生成流程大致分為三步:
由於擴散過程是在壓縮空間中進行,系統可以在保持音質的同時 大幅降低計算量並支援更長的音訊生成。
Stable Audio 3 的設計重點之一,是讓模型能有效率地生成不同長度的音訊。
模型支援 原生可變長度生成,使用者可以要求生成短音效、背景音或數分鐘的完整音樂,而系統只會計算所需長度。
此外,Stable Audio 3 還支援 音訊 inpainting。這讓使用者可以:
這種功能使模型更接近 生成式數位音訊工作站(generative audio workstation) 的概念,而不只是單純的文字生成音樂工具。
Stable Audio 3 以 多尺寸模型家族 的形式發布,以適應不同硬體與使用情境。
常見兩種版本:
整體而言,這些模型可生成 最長約六分鐘的音訊序列,實際長度取決於設定與運行環境。
Stable Audio 3 採用 多階段訓練流程(multi‑stage training pipeline),將不同模型組件分別訓練後再整合。
簡化流程如下:
公開資料僅提供高層級描述,部分細節並未在公開摘要中完全披露。
Stable Audio 3 的另一個重要特點是 授權與資料策略。
Stability AI 表示,模型是以 完全授權(fully licensed)的訓練資料建立,並且生成內容的所有權屬於使用者。
主要授權重點包括:
這種策略旨在回應生成式 AI 在 訓練資料版權與創作者權利上的爭議。
AI 音樂生成市場競爭激烈,例如 Suno 和 Udio 等平台已能生成完整歌曲甚至帶人聲。
但 Stable Audio 3 採取稍微不同的策略。
Stability AI 的重點包括:
許多現有的文字轉音訊系統仍屬於封閉平台,因此 Stable Audio 3 嘗試以 開放研究與創作基礎模型 的角色切入市場。
Stable Audio 3 顯示 AI 音訊模型正在從單純的「文字生成歌曲」走向 可編輯、可延伸的長音訊創作工具。
三個關鍵突破包括:
隨著生成式音訊技術成熟,這類模型可能逐漸成為未來 AI 原生音樂製作工具與數位音訊工作站 的核心基礎。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Stable Audio 3 是一個基於潛在擴散(latent diffusion)的音訊模型家族,包含 Small、Medium、Large 三個版本,可生成或編輯長達數分鐘的音樂與聲音。[1][8]
Stable Audio 3 是一個基於潛在擴散(latent diffusion)的音訊模型家族,包含 Small、Medium、Large 三個版本,可生成或編輯長達數分鐘的音樂與聲音。[1][8] 系統透過語意‑聲學自編碼器(semantic‑acoustic autoencoder)在壓縮的潛在空間中生成音訊,使多分鐘長度的生成與局部音訊編輯(如 inpainting)更有效率。[1][2]
Small 與 Medium 模型提供開放權重並使用授權資料訓練,Stability AI 以此強調開放研究與創作者工具定位,與 Suno、Udio 等封閉平台形成差異。[4][8]