Ini tidak bermakna imej berkenaan langsung tidak memainkan peranan dalam keseluruhan proses latihan model. Maksudnya ialah bagi satu hasil tertentu, dan berdasarkan ujian penyingkiran yang digunakan dalam kajian, sumbangan sebab-musabab imej itu secara individu mungkin terlalu kecil untuk dikesan.
Menguji persoalan ini secara terus bukan perkara mudah. Kaedah biasa memerlukan penyelidik melatih semula model selepas mengeluarkan satu imej sumber, kemudian membandingkan hasil baharu dengan hasil asal. Mengulangi proses itu untuk imej individu, artis atau subjek tertentu akan memakan kos yang tinggi. Kaedah anggaran pula mungkin tidak menyingkirkan semua kesan lanjutan daripada data tersebut.
Sebaliknya, Dai dan Gifford mereka bentuk ensemble difusi—gabungan beberapa komponen difusi yang lebih kecil dan dilatih menggunakan subset data yang berbeza tetapi bertindih. Untuk menguji pengaruh sesuatu sumber, penyelidik boleh mematikan komponen yang pernah melihat sumber itu, lalu menghasilkan output kontrafaktual seolah-olah sumber berkenaan tidak pernah digunakan, tanpa melatih semula keseluruhan sistem.
Mereka membandingkan pendekatan ensemble itu dengan 24 model difusi konvensional yang dilatih menggunakan data sama. Berdasarkan ukuran standard, kualiti hasil kedua-dua pendekatan dilaporkan secara umumnya setanding.
Kaedah ini memberikan ujian penyingkiran yang tepat dalam seni bina tersebut: jika hasil tidak berubah selepas semua komponen yang pernah terdedah kepada sesuatu sumber dimatikan, eksperimen itu tidak memberikan bukti yang boleh diukur bahawa sumber tersebut menyebabkan hasil berkenaan.
Kemerosotan atribusi boleh menyukarkan jenis tuntutan tertentu—iaitu dakwaan bahawa satu imej yang dijana berpunca daripada, atau disalin daripada, imej milik plaintif tertentu atau keseluruhan himpunan karya seorang artis. Jika penyingkiran bahan itu tidak mengubah hasil dalam ujian kontrafaktual yang tepat, ujian tersebut memberikan sedikit sokongan untuk mengaitkan hasil itu dengan sumber yang disingkirkan.
Isu sebegini boleh timbul dalam pertikaian melibatkan perkhidmatan penjanaan imej atau pembangun model, termasuk syarikat seperti Midjourney, OpenAI dan Microsoft. Namun, kajian ini sendiri tidak menentukan liabiliti undang-undang mana-mana syarikat. Ia memberikan bukti tentang betapa sukarnya mewujudkan hubungan sebab-musabab antara data latihan individu dengan hasil individu.
Beberapa persoalan berasingan masih belum terjawab:
Secara praktikal, mahkamah dan penyiasat mungkin perlu meneliti rekod pemerolehan data, maklumat asal-usul bahan, analisis persamaan langsung, ujian menggunakan gesaan tertentu, bukti tingkah laku model serta analisis pakar. Kesimpulan ini berpunca daripada dapatan bahawa atribusi satu imej kepada satu hasil menjadi tidak boleh dipercayai apabila skala model meningkat; ia bukan peraturan undang-undang yang diwujudkan oleh kajian tersebut.
Kemerosotan atribusi tidak boleh ditafsirkan sebagai bukti bahawa model difusi tidak pernah meniru. Dapatan kajian ialah pengaruh yang boleh diukur daripada satu sumber individu boleh menjadi terlalu kecil untuk dikesan apabila set data latihan berkembang. Dalam keadaan tertentu, model masih boleh menghafal atau menghasilkan semula contoh daripada data latihan.
Skop kajian itu juga terhad. Penyelidik menguji penjana imej berasaskan difusi, jadi hasilnya tidak boleh terus digeneralisasikan kepada model bahasa atau seni bina generatif lain.
Bacaan yang paling tepat ialah secara berhati-hati: sistem difusi berskala besar mungkin menyukarkan atribusi kepada sumber individu, walaupun data latihan mereka mengandungi imej tertentu atau karya seorang artis. Keadaan itu mungkin melemahkan satu laluan untuk membuktikan tanggungjawab terhadap hasil tertentu, tetapi persoalan lebih luas mengenai amalan latihan, penyalinan, peniruan dan hak harta intelek masih belum selesai.