Perbezaan terbesar yang diukur antara output asal dan output kontra-fakta itu dinamakan counterfactual radius. Ukuran ini menunjukkan sejauh mana satu unit latihan yang disingkirkan boleh mengubah hasil model.
Nilai counterfactual radius menurun apabila set data latihan menjadi lebih besar. Dalam bahasa mudah, menyingkirkan satu imej semakin kurang menghasilkan perbezaan yang boleh dikesan dalam output.
Implikasinya agak berlawanan dengan intuisi: menambah lebih banyak data latihan boleh menyebabkan sesuatu imej yang dijana semakin sukar dikaitkan dengan mana-mana satu contoh sumber, walaupun contoh itu memang pernah berada dalam set data latihan. Model mungkin mempelajari corak umum yang bertindih daripada banyak sumber, bukannya bergantung pada satu imej yang boleh dikenal pasti untuk menghasilkan keputusan tertentu.
Pada skala yang cukup besar, kesan itu bukan hanya melibatkan satu imej. Kajian tersebut melaporkan bahawa menyingkirkan semua imej oleh seorang artis, atau semua foto yang memaparkan individu tertentu, juga boleh menyebabkan perubahan yang hampir tidak dapat dikesan pada sampel yang dijana dalam ujian kontra-fakta itu.
Sebab itu penyelidik menggambarkan fenomena ini sebagai “decay”, bukan sekadar kegagalan alat pengesanan. Masalahnya mungkin bukan kerana penyiasat belum mempunyai alat yang cukup berkuasa; hubungan sebab-akibat antara satu sumber dengan satu output itu sendiri boleh menjadi terlalu tersebar untuk diasingkan.
Attribution decay berpotensi menyukarkan satu teori tertentu dalam tuntutan hak cipta: dakwaan bahawa output yang dipertikaikan berpunca secara langsung daripada karya artis tertentu, atau salinan karya tersebut dalam data latihan. Jika menyingkirkan keseluruhan koleksi seorang artis tidak mengubah output secara ketara, lebih sukar untuk dihujahkan bahawa koleksi itu secara individu diperlukan bagi menghasilkan imej tersebut dalam ujian sebab-akibat ini.
Hal ini penting dalam pertikaian melibatkan penjana imej komersial dan dakwaan bahawa model AI meniru gaya artis. Latihan pada skala besar boleh melemahkan naratif mudah bahawa satu output yang mudah dikenali ialah hasil langsung daripada satu karya atau seorang artis tertentu. Oleh itu, kajian ini dilihat berpotensi merumitkan kes harta intelek yang melibatkan sistem penjana imej.
Namun, kajian ini tidak menentukan sama ada sesebuah syarikat telah melanggar hak cipta dan tidak dengan sendirinya menjadi pembelaan undang-undang. Pertikaian hak cipta boleh melibatkan persoalan berbeza, termasuk sama ada karya dilindungi telah disalin ketika latihan, sama ada output mempunyai persamaan ketara dengan karya berhak cipta, perkara yang boleh dihasilkan sistem melalui arahan tertentu, serta tahap kerugian atau kewajipan kontrak yang terpakai.
Maksud teknikal “tidak boleh dikaitkan” tidak sama dengan maksud undang-undang “tidak disalin”.
Eksperimen tersebut menguji kepekaan model terhadap penyingkiran unit latihan. Ia tidak menguji semua cara model mungkin menyimpan atau menghasilkan semula maklumat.
Sebuah model boleh menunjukkan kebergantungan yang rendah pada mana-mana satu imej dalam ujian pemadaman ensemble, tetapi masih menghasilkan semula karya tertentu melalui arahan atau keadaan pensampelan tertentu. Sesuatu output juga boleh menyerupai karya yang dilindungi walaupun tiada satu imej latihan pun dapat dibuktikan sebagai punca yang mutlak diperlukan untuk output itu.
Tiga perkara berikut perlu dibezakan:
Attribution decay secara langsung menjawab persoalan pertama. Ia tidak menyelesaikan persoalan kedua atau ketiga.
Kajian ini tertumpu pada model generatif berasaskan difusi untuk imej dan media audiovisual yang berkaitan. Seni bina ensemble serta corak penskalaan yang diperhatikan tidak boleh terus digeneralisasikan kepada model bahasa besar berasaskan transformer.
Model bahasa mempunyai seni bina, proses latihan, perwakilan token dan tingkah laku output yang berbeza. Kajian ini mungkin mencadangkan hala tuju eksperimen untuk penyelidikan atribusi pada masa hadapan, tetapi ia belum membuktikan bahawa bentuk attribution decay yang sama berlaku pada LLM.
Jika persoalannya ialah sama ada sistem AI menyalin sesuatu karya, attribution decay hanyalah satu bahagian daripada bukti. Mahkamah dan penyiasat teknikal masih perlu menilai perkara seperti:
Kesimpulan utama kajian ini lebih khusus — dan lebih berguna — daripada dakwaan bahawa AI “melupakan” sumbernya. Apabila set data difusi berkembang, sumbangan sebab-akibat setiap contoh latihan boleh menjadi terlalu tersebar untuk dikesan dalam satu output tertentu. Ini menjadikan usaha menjejak sumber lebih sukar, tetapi tidak bermakna hafalan, penghasilan semula atau analisis hak cipta mustahil dibuktikan.