Эксперименты проводились на наборах от 256 до более чем 160 000 изображений. Исследователи поочерёдно проверяли, что произойдёт при удалении:
На больших объёмах данных удаление таких источников часто не вызывало заметных изменений в результатах генерации. Именно постепенное уменьшение измеримого влияния отдельного источника авторы и называют «затуханием атрибуции».
Вывод может осложнить утверждения о том, что конкретный результат системы, связанной, например, с Midjourney, OpenAI или Microsoft, был причинно обусловлен определённым изображением истца или всем корпусом работ конкретного автора. Если точное удаление этих материалов не меняет соответствующий результат, такой контрфактический тест даёт мало оснований приписывать ему происхождение от данного источника.
Но эксперимент не отвечает на ряд самостоятельных юридических вопросов. В частности, он не устанавливает:
Иными словами, исследование посвящено причинной связи между конкретными обучающими материалами и отдельными результатами генерации, а не выносит правовую оценку действиям компаний или пользователей.
«Затухание атрибуции» не означает, что диффузионные модели неспособны запоминать обучающие данные. В определённых условиях они могут воспроизводить отдельные примеры или близкие к ним копии. Результат MIT показывает лишь то, что при увеличении набора данных влияние одного источника на конкретный результат часто становится неизмеримым — а не то, что копирование никогда не происходит.
Кроме того, работа изучала именно диффузионные генераторы изображений. Её выводы нельзя автоматически распространять на языковые модели и другие типы генеративных систем.
Поэтому в юридических спорах, вероятно, потребуется учитывать не только возможность сопоставить одну картинку с одним результатом. Значение могут иметь история формирования обучающего набора, документы о получении данных, прямые признаки сходства, поведение модели при целевых запросах, сведения о происхождении изображений и заключения экспертов. Это следует из продемонстрированной в исследовании сложности установить причинный вклад отдельного источника в результат модели, обученной на масштабном наборе данных.