Investigaciones muestran que entrenar repetidamente modelos de IA con datos sintéticos puede provocar “model collapse”, donde desaparecen patrones raros y el modelo pierde diversidad en su representación del mundo. El entrenamiento recursivo amplifica sesgos estadísticos: los eventos poco frecuentes en los “extremos...

Create a landscape editorial hero image for this Studio Global article: What does the new study on AI model collapse find about preventing degradation when models are trained on synthetic data, why does recursive. Article summary: The study describes model collapse as a failure mode where recursively trained generative models lose information about the original data distribution, especially its rare or low-probability regions.. Topic tags: general, government, education, academic, general web. Reference image context from search candidates: Reference image 1: visual subject "However, as AI-generated data increasingly populates the internet, an important question arises: What happens when new AI models are trained on datasets containing their previous o" source context "Avoiding Model Collapse in AI Training - Risk Insight" Reference image 2: visual subject "Artificial intelligence models
Los sistemas de IA generativa cada vez se entrenan más utilizando datos sintéticos: textos, imágenes o ejemplos creados por modelos anteriores. Pero varias investigaciones advierten que esta práctica puede causar un problema serio conocido como model collapse (colapso de modelos): una degradación gradual en la que los modelos dejan de representar la diversidad real de los datos originales.
Un estudio sobre entrenamiento recursivo mostró que cuando los modelos aprenden repetidamente a partir de contenido generado por otras IA —en lugar de datos producidos por humanos— empiezan a olvidar patrones raros que estaban presentes en la distribución original de datos. Con cada nueva generación de entrenamiento, esas piezas faltantes se acumulan hasta que la representación del mundo se vuelve distorsionada.
Comprender este fenómeno se está volviendo crucial a medida que el contenido generado por IA se expande por internet y empieza a formar parte de los conjuntos de datos que se utilizan para entrenar futuros modelos.
El model collapse describe un modo de fallo en el que los modelos generativos se degradan cuando se entrenan con datos producidos por modelos anteriores, en lugar de con datos originales creados por humanos.
Los investigadores encontraron que el entrenamiento recursivo introduce defectos irreversibles. Con el tiempo, los modelos pierden información sobre los “extremos” de la distribución de datos: los ejemplos raros o inusuales que aparecen pocas veces pero que son esenciales para representar la realidad con precisión.
A medida que avanza el proceso, las salidas del modelo se vuelven más estrechas y menos diversas, reflejando principalmente los patrones más comunes presentes en los datos de entrenamiento.
Este fenómeno se ha observado en distintos tipos de modelos generativos, incluyendo:
El hecho de que aparezca en varias familias de modelos sugiere que el colapso no es un problema de una arquitectura específica, sino una propiedad general del aprendizaje generativo cuando se utilizan datos sintéticos de forma recursiva.
El mecanismo detrás del colapso de modelos tiene raíces en la estadística básica.
Cuando un modelo genera datos sintéticos, tiende a reproducir los patrones más probables con mucha más frecuencia que los raros. Estos eventos poco frecuentes se encuentran en los extremos (o "colas") de la distribución de datos, por lo que ya están subrepresentados cuando se toman muestras.
Cuando la siguiente generación de modelos se entrena con ese conjunto sintético ocurre lo siguiente:
Cada iteración refuerza los sesgos introducidos por modelos anteriores. Con el tiempo, los extremos de la distribución desaparecen por completo y solo quedan los patrones dominantes.
Una vez que esos ejemplos raros desaparecen del conjunto de entrenamiento, los modelos posteriores ya no pueden reconstruirlos, porque la evidencia de que existían se ha perdido.
Uno de los hallazgos más llamativos de análisis recientes es que podría bastar muy poca información del mundo real para evitar el colapso.
Investigadores que estudiaron modelos estadísticos conocidos como familias exponenciales encontraron que incluso un único dato proveniente de la distribución real puede servir como ancla para el proceso de entrenamiento. Ese dato preserva evidencia de que existen patrones raros, impidiendo que el entrenamiento recursivo converja hacia una distribución incorrecta.
Algo similar ocurre con el conocimiento previo incorporado al modelo (por ejemplo, restricciones matemáticas o supuestos sobre cómo deben comportarse los datos). Esos “priors” limitan las distribuciones posibles que el modelo puede aprender y evitan que se desvíe completamente hacia los patrones sesgados de los datos sintéticos.
En la práctica, esto implica que:
Incluso cuando los datos sintéticos superan ampliamente a los reales, estos elementos pueden estabilizar el proceso de entrenamiento.
El problema del colapso de modelos se vuelve especialmente relevante a medida que el contenido generado por IA se multiplica en internet.
Los grandes modelos de lenguaje se entrenan normalmente con enormes conjuntos de datos recopilados de la web. A medida que más textos en línea son producidos por sistemas de IA, esos conjuntos de datos corren el riesgo de contaminarse con salidas sintéticas de modelos anteriores.
Si los futuros modelos se entrenan principalmente con ese contenido, podrían empezar a alejarse gradualmente de la riqueza y diversidad del lenguaje humano.
Entre las posibles consecuencias se incluyen:
Por eso, varios investigadores advierten que evitar este escenario requerirá mantener acceso a datos confiables generados por humanos o incorporar mecanismos que preserven la distribución original de los datos durante el entrenamiento.
Aunque el mecanismo del colapso de modelos está bien respaldado, algunos detalles siguen siendo inciertos. Por ejemplo, la idea de que un único dato real pueda evitar el colapso proviene principalmente de análisis teóricos y de modelos estadísticos simplificados, no de experimentos a gran escala con LLM en producción.
Esto significa que, en sistemas reales, la cantidad exacta de datos humanos necesaria para estabilizar el entrenamiento podría variar según la arquitectura del modelo, el tipo de dataset y el procedimiento de entrenamiento.
Aun así, la conclusión central de la investigación es clara: entrenar IA únicamente con contenido generado por IA corre el riesgo de borrar partes de la realidad, por lo que mantener un vínculo con datos del mundo real es esencial para que los modelos sigan siendo precisos con el tiempo.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Investigaciones muestran que entrenar repetidamente modelos de IA con datos sintéticos puede provocar “model collapse”, donde desaparecen patrones raros y el modelo pierde diversidad en su representación del mundo.
Investigaciones muestran que entrenar repetidamente modelos de IA con datos sintéticos puede provocar “model collapse”, donde desaparecen patrones raros y el modelo pierde diversidad en su representación del mundo. El entrenamiento recursivo amplifica sesgos estadísticos: los eventos poco frecuentes en los “extremos” de la distribución aparecen cada vez menos y terminan desapareciendo del aprendizaje.
Incluso pequeñas cantidades de datos reales o conocimiento previo incorporado al modelo pueden evitar el colapso al mantener evidencia de esos patrones raros.