Stable Audio 3.0 é uma família de quatro modelos de geração de música e áudio por IA, com tamanhos de 459 milhões a 2,7 bilhões de parâmetros. Os modelos mais avançados conseguem criar composições completas de até cerca de 6 minutos e 20 segundos, mais que o dobro das versões anteriores.

Create a landscape editorial hero image for this Studio Global article: How does Stability AI’s new Stable Audio 3.0 family work, what models does it include (small SFX, small, medium, and large with 459M–2.7B pa. Article summary: Stable Audio 3.0 is Stability AI’s new text-to-audio/music generation family, positioned as a more open and licensing-safe alternative in AI music. It includes four models from 459M to 2.7B parameters, with three open-we. Topic tags: general, general web, news. Reference image context from search candidates: Reference image 1: visual subject "Title: Stability AI debuts Stable Audio bringing text to audio generation to the masses | VentureBeat # Stability AI debuts Stable Audio bringing text to audio generation to the ma" source context "Stability AI debuts Stable Audio bringing text to audio generation to the masses | VentureBeat" Reference image 2: visual subj
A geração de música por inteligência artificial está evoluindo rapidamente — e a Stability AI, conhecida pelo modelo de imagens Stable Diffusion, quer ter um papel central nesse avanço. A empresa apresentou o Stable Audio 3.0, uma nova família de modelos capazes de criar músicas e efeitos sonoros a partir de descrições em texto.
A ideia é simples: o usuário escreve um prompt descrevendo estilo musical, instrumentos, clima ou cenário — por exemplo, “lo‑fi relaxante com piano e chuva ao fundo” — e o sistema gera automaticamente uma faixa de áudio correspondente.
Mas a nova versão traz mudanças importantes que a colocam entre os sistemas mais ambiciosos da área: músicas mais longas, vários tamanhos de modelo para diferentes usos e uma estratégia parcialmente aberta para desenvolvedores.
O Stable Audio 3.0 é uma família de modelos de IA voltados para geração de áudio a partir de texto — incluindo músicas completas, trilhas instrumentais e efeitos sonoros.
Segundo a Stability AI, os modelos foram criados como uma plataforma de “áudio generativo” voltada à experimentação criativa, permitindo que desenvolvedores e artistas explorem novas formas de composição assistida por IA.
Outro ponto enfatizado pela empresa é o treinamento com dados totalmente licenciados, uma tentativa de reduzir os riscos de copyright que têm cercado muitas ferramentas de música gerada por IA.
A nova geração inclui quatro modelos principais, com diferentes tamanhos e capacidades.
Stable Audio 3.0 Small SFX
Stable Audio 3.0 Small
Stable Audio 3.0 Medium
Stable Audio 3.0 Large
Essa estrutura em camadas permite escolher o modelo conforme o hardware disponível, o tempo de geração e o nível de qualidade desejado.
Uma das maiores melhorias em relação às versões anteriores é o aumento do tempo de geração de áudio.
Isso representa mais que o dobro da duração possível em versões anteriores do sistema, aproximando a IA da criação de músicas completas em vez de apenas loops curtos ou demos.
A Stability AI adotou uma estratégia híbrida de distribuição.
Modelos open‑weight (baixáveis):
Esses modelos podem ser baixados e executados localmente por desenvolvedores ou pesquisadores, permitindo experimentação, customização e integração em novos softwares.
Modelo disponível apenas via API:
O modelo mais poderoso não tem pesos liberados publicamente e é oferecido apenas por serviços hospedados ou acesso corporativo.
Essa estratégia é semelhante ao que a empresa já fez em outros projetos: liberar versões abertas para pesquisa enquanto mantém o modelo mais avançado sob controle comercial.
Um dos pontos mais sensíveis na música gerada por IA é a origem dos dados de treinamento. Para lidar com essa questão, a Stability AI afirma que o Stable Audio 3.0 foi treinado exclusivamente com dados licenciados.
Segundo a empresa, os usuários geralmente podem possuir e distribuir as músicas que geram, dentro dos termos da licença da plataforma.
Apesar dessas declarações, detalhes completos sobre a composição do conjunto de dados não foram totalmente divulgados publicamente, o que limita a verificação externa.
Para fortalecer sua posição em relação ao licenciamento, a Stability AI também firmou acordos com grandes empresas da indústria musical.
Essas parcerias tentam enfrentar uma das maiores controvérsias da área: o uso de músicas protegidas por direitos autorais no treinamento de modelos de IA.
O lançamento do Stable Audio 3.0 acontece em um momento de competição intensa no setor de áudio generativo.
Empresas como Google, Suno, Udio e ElevenLabs estão desenvolvendo sistemas capazes de produzir músicas cada vez mais realistas, com vocais sintéticos, estruturas musicais completas e ferramentas de produção integradas.
A estratégia da Stability AI tenta se diferenciar em dois pontos principais:
Com geração de músicas acima de seis minutos e uma abordagem mais aberta para a comunidade de IA, o Stable Audio 3.0 mostra como o setor está se movendo rapidamente para sistemas capazes de criar faixas completas e estruturadas, não apenas pequenos trechos de áudio.
O Stable Audio 3.0 também reflete uma tendência mais ampla na IA: em vez de um único modelo universal, empresas estão lançando famílias de modelos especializados.
Com versões leves para rodar localmente, modelos intermediários abertos e um modelo grande voltado ao mercado profissional, a Stability AI tenta atender desde hobbystas e desenvolvedores até produtores musicais.
Se a qualidade continuar evoluindo e as questões de licenciamento forem resolvidas, ferramentas desse tipo podem se tornar componentes fundamentais das próximas gerações de softwares criativos.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Stable Audio 3.0 é uma família de quatro modelos de geração de música e áudio por IA, com tamanhos de 459 milhões a 2,7 bilhões de parâmetros.
Stable Audio 3.0 é uma família de quatro modelos de geração de música e áudio por IA, com tamanhos de 459 milhões a 2,7 bilhões de parâmetros. Os modelos mais avançados conseguem criar composições completas de até cerca de 6 minutos e 20 segundos, mais que o dobro das versões anteriores.
Três modelos são open‑weight para download e uso local, enquanto o modelo Large é oferecido apenas via API ou serviços corporativos.