Stable Audio 3.0 est une nouvelle famille de modèles d’IA audio de Stability AI allant de 459 millions à 2,7 milliards de paramètres. Les modèles Medium et Large peuvent générer des morceaux complets d’environ 6 minutes 20, bien plus longs que les versions précédentes.

Create a landscape editorial hero image for this Studio Global article: How does Stability AI’s new Stable Audio 3.0 family work, what models does it include (small SFX, small, medium, and large with 459M–2.7B pa. Article summary: Stable Audio 3.0 is Stability AI’s new text-to-audio/music generation family, positioned as a more open and licensing-safe alternative in AI music. It includes four models from 459M to 2.7B parameters, with three open-we. Topic tags: general, general web, news. Reference image context from search candidates: Reference image 1: visual subject "Title: Stability AI debuts Stable Audio bringing text to audio generation to the masses | VentureBeat # Stability AI debuts Stable Audio bringing text to audio generation to the ma" source context "Stability AI debuts Stable Audio bringing text to audio generation to the masses | VentureBeat" Reference image 2: visual subj
La musique générée par intelligence artificielle évolue à grande vitesse. L’entreprise Stability AI, connue pour son générateur d’images Stable Diffusion, a dévoilé Stable Audio 3.0, une nouvelle famille de modèles capables de créer musique et effets sonores à partir d’un simple texte.
Cette version introduit plusieurs avancées importantes : des morceaux plus longs, une gamme de modèles adaptée à différents usages et une stratégie hybride combinant modèles open‑weight et accès via API. L’objectif est d’attirer à la fois développeurs, chercheurs et créateurs de contenu.
Stable Audio 3.0 appartient à la catégorie des modèles texte‑vers‑audio. Concrètement, l’utilisateur décrit une ambiance, un style musical, des instruments ou une scène — par exemple « musique électronique énergique avec synthés rétro » — et le modèle produit une piste audio correspondante.
Stability AI présente cette technologie comme une plateforme de « generative audio » destinée à l’expérimentation artistique, avec un entraînement sur des données audio sous licence afin de limiter les problèmes de droits d’auteur qui ont marqué les premières générations d’IA musicale.
La plateforme est structurée autour de quatre modèles de tailles différentes, allant de quelques centaines de millions à plusieurs milliards de paramètres.
Stable Audio 3.0 Small SFX
Stable Audio 3.0 Small
Stable Audio 3.0 Medium
Stable Audio 3.0 Large
Cette architecture en plusieurs tailles permet aux utilisateurs de choisir entre performance, qualité sonore et contraintes matérielles.
L’un des progrès les plus visibles concerne la durée des morceaux générés.
C’est plus du double de la durée maximale des versions précédentes du système, ce qui rapproche ces outils de la production de véritables chansons structurées plutôt que de simples extraits.
Stability AI adopte une stratégie de distribution mixte.
Modèles open‑weight (téléchargeables)
Ces versions peuvent être téléchargées et exécutées localement par les développeurs et les chercheurs.
Modèle accessible via API
Le modèle le plus puissant n’est pas distribué publiquement sous forme de poids téléchargeables. Il est proposé via services hébergés ou accès entreprise.
Stability AI affirme que Stable Audio 3.0 a été entraîné sur des ensembles de données entièrement sous licence, afin de réduire les risques juridiques liés à l’utilisation de musique protégée.
Les utilisateurs peuvent généralement posséder et distribuer les créations générées, sous réserve des conditions de la Stability AI Community License. Les organisations réalisant plus d’environ 1 million de dollars de chiffre d’affaires annuel doivent passer à une licence entreprise.
Cependant, la composition exacte des datasets n’est pas entièrement détaillée publiquement, ce qui limite la vérification indépendante de ces affirmations.
Pour renforcer sa stratégie basée sur des données licenciées, Stability AI a conclu plusieurs accords avec l’industrie musicale.
Ces partenariats visent à répondre à l’un des sujets les plus sensibles de l’IA musicale : l’utilisation d’œuvres protégées dans les jeux de données d’entraînement.
Le lancement de Stable Audio 3.0 intervient dans un contexte de forte concurrence. Plusieurs entreprises développent déjà des systèmes capables de produire musique et voix synthétiques très réalistes, notamment Google, Suno, Udio et ElevenLabs.
Pour se différencier, Stability AI mise sur deux axes principaux :
Avec des compositions dépassant désormais six minutes, Stable Audio 3.0 rapproche l’IA musicale de la génération de morceaux complets plutôt que de simples démos ou boucles.
Plus largement, Stable Audio 3.0 illustre une tendance de fond dans l’IA générative : l’émergence de familles de modèles spécialisées plutôt qu’un seul modèle universel.
En combinant des modèles légers pour l’expérimentation locale, des modèles intermédiaires ouverts et un modèle haut de gamme accessible via API, Stability AI tente de couvrir tout l’écosystème — du développeur indépendant aux studios professionnels.
À mesure que la qualité sonore, la durée et la clarté juridique progressent, des outils comme Stable Audio 3.0 pourraient devenir des briques essentielles dans la prochaine génération de logiciels de création musicale.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Stable Audio 3.0 est une nouvelle famille de modèles d’IA audio de Stability AI allant de 459 millions à 2,7 milliards de paramètres.
Stable Audio 3.0 est une nouvelle famille de modèles d’IA audio de Stability AI allant de 459 millions à 2,7 milliards de paramètres. Les modèles Medium et Large peuvent générer des morceaux complets d’environ 6 minutes 20, bien plus longs que les versions précédentes.
Trois modèles sont open‑weight tandis que le modèle Large reste accessible via API, avec un entraînement revendiqué sur des données sous licence.