Stable Audio 3.0: los nuevos modelos de IA de Stability que generan música completa desde texto
Stable Audio 3.0 es una familia de modelos de IA para generar música y efectos de sonido a partir de texto. Incluye cuatro modelos —Small SFX, Small, Medium y Large— con entre 459 millones y 2.700 millones de parámetros.
Publicado porEditado con GPT-5.5Imágenes generadas con GPT Image 2
Stable Audio 3.0 es una familia de modelos de IA para generar música y efectos de sonido a partir de texto.
Incluye cuatro modelos —Small SFX, Small, Medium y Large— con entre 459 millones y 2.700 millones de parámetros.
Las versiones más avanzadas pueden crear composiciones musicales completas de hasta 6 minutos y 20 segundos.
How does Stability AI’s new Stable Audio 3.0 family work, what models does it include (small SFX, small, medium, and large with 459M–2.7B paStable Audio 3.0 expands AI music generation with multiple model sizes and longer compositions.
Prompt de IA
Create a landscape editorial hero image for this Studio Global article: How does Stability AI’s new Stable Audio 3.0 family work, what models does it include (small SFX, small, medium, and large with 459M–2.7B pa. Article summary: Stable Audio 3.0 is Stability AI’s new text-to-audio/music generation family, positioned as a more open and licensing-safe alternative in AI music. It includes four models from 459M to 2.7B parameters, with three open-we. Topic tags: general, general web, news. Reference image context from search candidates: Reference image 1: visual subject "Title: Stability AI debuts Stable Audio bringing text to audio generation to the masses | VentureBeat # Stability AI debuts Stable Audio bringing text to audio generation to the ma" source context "Stability AI debuts Stable Audio bringing text to audio generation to the masses | VentureBeat" Reference image 2: visual subj
openai.com
La generación musical con inteligencia artificial está avanzando a gran velocidad. Stability AI —la empresa conocida por el modelo de imágenes Stable Diffusion— ha presentado Stable Audio 3.0, una nueva familia de modelos de texto a audio diseñada para crear música y efectos sonoros a partir de descripciones escritas.
El lanzamiento introduce tres cambios importantes: composiciones mucho más largas, varios modelos adaptados a distintos usos y una estrategia híbrida con modelos de pesos abiertos para desarrolladores. Con esto, Stability AI busca posicionarse como un actor clave en el creciente ecosistema de música generada por IA.
Qué es Stable Audio 3.0
Studio Global AI
Continúe su investigación
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
¿Cuál es la respuesta corta a "Stable Audio 3.0: los nuevos modelos de IA de Stability que generan música completa desde texto"?
Stable Audio 3.0 es una familia de modelos de IA para generar música y efectos de sonido a partir de texto.
¿Cuáles son los puntos clave a validar primero?
Stable Audio 3.0 es una familia de modelos de IA para generar música y efectos de sonido a partir de texto. Incluye cuatro modelos —Small SFX, Small, Medium y Large— con entre 459 millones y 2.700 millones de parámetros.
¿Qué debo hacer a continuación en la práctica?
Las versiones más avanzadas pueden crear composiciones musicales completas de hasta 6 minutos y 20 segundos.
Stable Audio 3.0 es una familia de modelos generativos de audio capaz de producir pistas musicales o efectos de sonido a partir de prompts de texto. El usuario puede describir el estilo, el ambiente, los instrumentos o una escena específica, y el sistema genera un archivo de audio acorde a esa descripción.
La compañía describe el proyecto como una plataforma para "audio generativo" y experimentación creativa, entrenada con conjuntos de datos con licencia para reducir los problemas de derechos de autor que han rodeado a otros sistemas de música generada por IA.
Además, el sistema no es un único modelo: está compuesto por varias versiones con diferentes tamaños y capacidades, pensadas tanto para ejecutar localmente como para producir música de mayor calidad y duración.
Los cuatro modelos de Stable Audio 3.0
La familia incluye cuatro modelos con tamaños que van desde cientos de millones hasta miles de millones de parámetros.
Stable Audio 3.0 Small SFX
Aproximadamente 459 millones de parámetros
Diseñado principalmente para efectos de sonido cortos
Optimizado para dispositivos o entornos ligeros
Stable Audio 3.0 Small
También cerca de 459 millones de parámetros
Pensado para generación musical ligera
Puede ejecutarse localmente en proyectos pequeños
Stable Audio 3.0 Medium
Cerca de 1.400 millones de parámetros
Diseñado para música más expresiva y composiciones más largas
Stable Audio 3.0 Large
Alrededor de 2.700 millones de parámetros
El modelo más potente de la serie
Orientado a generación musical de calidad profesional
Esta estructura escalonada permite elegir el modelo según la potencia del hardware, la calidad deseada o la duración de la pista generada.
Duración de la música generada
Uno de los mayores avances de Stable Audio 3.0 es la duración de las composiciones.
Los modelos Small SFX y Small pueden generar audio de hasta unos 2 minutos, lo que facilita su uso directamente en dispositivos o equipos modestos.
Los modelos Medium y Large pueden producir composiciones completas de aproximadamente 6 minutos y 20 segundos.
Esto supone más del doble de la duración disponible en versiones anteriores del sistema, acercando la IA a la creación de canciones completas en lugar de simples fragmentos o loops.
Qué modelos son abiertos y cuáles no
Stability AI ha optado por una estrategia mixta entre apertura y servicios gestionados.
Modelos de pesos abiertos (open‑weight):
Stable Audio 3.0 Small SFX
Stable Audio 3.0 Small
Stable Audio 3.0 Medium
Estos pueden descargarse y ejecutarse localmente por desarrolladores o investigadores.
Modelo disponible solo vía API:
Stable Audio 3.0 Large
La versión más potente se ofrece únicamente mediante servicios alojados o acceso empresarial, en lugar de publicar sus pesos públicamente.
Datos de entrenamiento y licencias
Uno de los puntos centrales del lanzamiento es el enfoque en datos con licencia completa. Según Stability AI, los modelos se entrenaron con conjuntos de datos autorizados, lo que busca reducir los riesgos legales asociados a la música generada por IA.
En cuanto al uso:
Los usuarios generalmente pueden poseer y distribuir las pistas que generen.
La Community License de Stability AI se aplica a individuos, investigadores y pequeñas organizaciones.
Las empresas con ingresos superiores a aproximadamente 1 millón de dólares anuales deben adquirir una licencia empresarial.
Aun así, los detalles completos sobre la composición exacta de los datasets no se han publicado, por lo que la verificación independiente sigue siendo limitada.
Alianzas con grandes discográficas
Para reforzar su enfoque legal y de licencias, Stability AI ha firmado acuerdos con grandes compañías de la industria musical.
Universal Music Group (UMG) anunció una alianza estratégica con Stability AI para desarrollar herramientas profesionales de creación musical con IA basadas en datos licenciados y participación de artistas.
Warner Music Group (WMG) también colabora con la empresa para impulsar herramientas de IA responsables para compositores, productores y artistas.
Estas alianzas buscan responder a una de las principales polémicas del sector: el uso de música protegida por derechos de autor en el entrenamiento de modelos de IA.
La carrera por la música generada por IA
El lanzamiento llega en medio de una competencia cada vez más intensa en el campo del audio generativo.
Empresas como Google, Suno, Udio y ElevenLabs también están desarrollando sistemas capaces de generar música y voces cada vez más realistas.
Stable Audio 3.0 intenta diferenciarse con dos elementos clave:
Modelos open‑weight que los desarrolladores pueden descargar y modificar.
Entrenamiento con datos licenciados, respaldado por acuerdos con grandes discográficas.
Junto con la capacidad de crear canciones de más de seis minutos, el sistema acerca la IA musical a la producción de pistas completas con estructura real, no solo demos o fragmentos cortos.
El panorama general
Stable Audio 3.0 refleja una tendencia creciente en la IA generativa: en lugar de un único modelo universal, las empresas lanzan familias completas de modelos especializados.
Con versiones pequeñas para ejecución local, modelos intermedios abiertos y un modelo grande gestionado para uso profesional, Stability AI intenta cubrir todo el espectro: desde aficionados y desarrolladores hasta productores musicales.
Si la calidad, la duración y la claridad legal continúan mejorando, herramientas como Stable Audio 3.0 podrían convertirse en una pieza fundamental del software creativo basado en IA en los próximos años.