El estudio identifica la «decadencia de atribución»: al entrenar un generador de imágenes por difusión con más datos, la influencia causal de una imagen concreta sobre un resultado puede volverse demasiado pequeña par... El hallazgo dificulta vincular una imagen generada con un artista, una fotografía o una imagen d...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did Zheng Dai and David Gifford’s MIT CSAIL study, published in Nature Communications on August 20, 2026, reveal about “attribution dec. Article summary: The study found “attribution decay”: as a diffusion image generator is trained on more images, the causal influence of any one training image on a particular output can become too small to detect—and may disappear under . Topic tags: general web, openai, llm, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
El estudio encontró un fenómeno que sus autores denominan «decadencia de atribución»: cuanto más grande es el conjunto de datos con el que se entrena un generador de imágenes por difusión, más puede diluirse la influencia causal de cualquier imagen individual sobre un resultado concreto. En algunos casos, esa influencia deja de ser detectable cuando se elimina exactamente la fuente del entrenamiento.
Esto complica la tarea de vincular una imagen generada con un artista, una fotografía o una obra específica. Pero el resultado no demuestra que los modelos no copien ni resuelve la cuestión de si utilizar material protegido por derechos de autor para entrenarlos es legal.
En lugar de calcular matemáticamente cuánto influía cada imagen, Zheng Dai, David Gifford y su equipo construyeron una arquitectura llamada «diffusion ensemble». El sistema reúne muchos componentes pequeños de difusión, entrenados con diferentes segmentos del conjunto de datos.
Para crear el modelo contrafactual —es decir, una versión idéntica salvo por la ausencia de una fuente concreta—, los investigadores desactivaron todos los componentes que habían visto esa imagen. Así pudieron comparar los resultados sin tener que reentrenar el modelo ni depender de una estimación aproximada.
El equipo también comparó este enfoque con 24 modelos convencionales de difusión entrenados con los mismos datos. Según la evaluación mediante métricas estándar, la calidad de las imágenes generadas era ampliamente comparable.
Las pruebas se realizaron con conjuntos de datos de entre 256 y más de 160.000 imágenes. Los investigadores comprobaron qué ocurría al retirar:
A medida que aumentaba la escala de los datos, eliminar una de esas fuentes a menudo no producía cambios apreciables en la imagen generada. Esa reducción del efecto medible de cada fuente es lo que el estudio llama «decadencia de atribución».
El hallazgo podría complicar las demandas que sostienen que un resultado concreto producido por un sistema asociado con Midjourney, OpenAI o Microsoft fue causado por una imagen específica del demandante o copiado de ella. Si retirar exactamente ese material no cambia el resultado relevante, esta prueba contrafactual ofrece poca base para atribuirle causalmente esa imagen.
Sin embargo, el estudio no responde por sí solo a varias preguntas jurídicas distintas, entre ellas:
En otras palabras, la investigación aporta evidencia sobre la dificultad de atribuir causalmente un resultado particular a una fuente concreta; no constituye un fallo judicial ni una conclusión general sobre la legalidad de los sistemas de IA.
La decadencia de atribución no significa que los modelos de difusión sean incapaces de memorizar. En determinadas condiciones, pueden memorizar o reproducir ejemplos del conjunto de entrenamiento. El hallazgo indica que, cuando los datos crecen, la influencia de una fuente individual suele volverse difícil de medir; no que la copia nunca ocurra.
Además, el trabajo se centró en generadores de imágenes basados en difusión. Sus resultados no deben extrapolarse automáticamente a modelos de lenguaje ni a otras arquitecturas generativas.
Por eso, los tribunales podrían necesitar pruebas adicionales a la relación causal entre una imagen individual y un resultado concreto: registros sobre la adquisición de los datos, evidencia de similitud directa, comportamiento del modelo ante instrucciones dirigidas, información sobre la procedencia de las obras y análisis de expertos. Esta conclusión se desprende de la dificultad que el estudio demuestra para asignar la causa de resultados individuales cuando los modelos se entrenan a gran escala.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
El estudio identifica la «decadencia de atribución»: al entrenar un generador de imágenes por difusión con más datos, la influencia causal de una imagen concreta sobre un resultado puede volverse demasiado pequeña par...
El estudio identifica la «decadencia de atribución»: al entrenar un generador de imágenes por difusión con más datos, la influencia causal de una imagen concreta sobre un resultado puede volverse demasiado pequeña par... El hallazgo dificulta vincular una imagen generada con un artista, una fotografía o una imagen de origen específicos, pero no demuestra que entrenar con material protegido sea legal ni que los modelos nunca copien.
Los investigadores crearon una arquitectura «diffusion ensemble» compuesta por muchos componentes pequeños entrenados con distintos segmentos de datos.