Kajian Zheng Dai dan David Gifford mengenal pasti “kemerosotan atribusi”: semakin banyak data digunakan untuk melatih penjana imej difusi, semakin kecil kesan sebab akibat mana mana satu imej latihan terhadap hasil te... Penemuan ini mengukur pengaruh yang boleh dikaitkan dengan sesuatu output — bukan bukti bahawa i...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zheng Dai and David Gifford’s MIT CSAIL study, published in Nature Communications, discover about “attribution decay” in diffusion. Article summary: Dai and Gifford found “attribution decay”: as a diffusion image generator is trained on more data, the causal effect of any one training item on a particular generated image can shrink until it is too small to detect.. Topic tags: general web, ai safety, openai, chatgpt, llm. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wit
Kajian Zheng Dai dan David Gifford dari MIT Computer Science and Artificial Intelligence Laboratory (CSAIL), yang diterbitkan dalam Nature Communications, menemui fenomena yang mereka namakan “kemerosotan atribusi” (attribution decay).
Secara ringkas, apabila penjana imej difusi dilatih menggunakan set data yang semakin besar, kesan sebab-akibat mana-mana satu imej latihan terhadap imej yang dihasilkan boleh mengecil sehingga terlalu kecil untuk dikesan.
Namun, ini bukan bermakna imej tersebut tidak pernah digunakan dalam latihan, tidak disimpan oleh model atau tidak boleh dihasilkan semula dalam keadaan tertentu. Kajian itu hanya mengukur sama ada membuang sesuatu unit latihan akan mengubah hasil tertentu.
Kebiasaannya, sukar untuk menjawab soalan balas fakta seperti: “Apakah yang akan berlaku jika imej ini tidak pernah dimasukkan ke dalam data latihan?” Melatih semula model besar setiap kali satu imej dibuang juga tidak praktikal.
Untuk mengatasi masalah itu, penyelidik membina ensemble difusi. Ensemble ini terdiri daripada komponen model yang dilatih secara berasingan, dengan setiap komponen melihat bahagian tertentu daripada set data latihan. Jika sesuatu imej hanya muncul dalam komponen tertentu, komponen-komponen yang pernah melihat imej itu boleh dinyahaktifkan untuk menghasilkan versi “tanpa imej berkenaan” — tanpa perlu melatih semula satu model besar dari awal.
Pasukan itu kemudian membandingkan ensemble tersebut dengan 24 model difusi konvensional yang dilatih menggunakan data sama. Menurut kajian, ukuran kualiti imej standard bagi kedua-dua pendekatan adalah lebih kurang setanding.
Secara keseluruhan, mereka menguji 24 ensemble yang dilatih menggunakan tujuh koleksi imej awam. Saiz koleksi itu berbeza-beza, daripada 256 imej hingga lebih 160,000 imej. Bagi setiap output, mereka menghasilkan apa yang disebut sebagai “alam semesta kontrafakta” — versi imej yang terhasil apabila setiap calon unit latihan dikeluarkan secara bergilir-gilir.
Perbezaan terbesar antara output asal dengan versi yang telah dibuang satu unit latihan dipanggil jejari kontrafakta (counterfactual radius). Ukuran ini mewakili kesan sebab-akibat maksimum unit tersebut terhadap output berkenaan.
Apabila saiz set data meningkat, jejari kontrafakta menurun. Dalam erti kata lain, membuang satu imej latihan semakin kurang memberi perubahan yang ketara terhadap imej yang dijana.
Pada skala yang cukup besar, keadaan sama boleh berlaku bukan sahaja pada satu imej tertentu, malah pada keseluruhan karya seorang artis atau semua foto yang memaparkan individu tertentu. Dalam ujian kajian, membuang kategori lengkap itu juga sering tidak mengubah sampel yang dijana dengan ketara.
Ini ialah penemuan tentang ketiadaan atribusi dalam ujian kontrafakta yang digunakan. Jika membuang sesuatu unit tidak mengubah output, unit itu tidak boleh dianggap sebagai punca sebab-akibat bagi output tersebut berdasarkan ukuran kajian berkenaan.
Penemuan ini berpotensi menyukarkan teori pelanggaran tertentu dalam kes terhadap syarikat penjana imej AI seperti Midjourney, OpenAI atau Microsoft. Sebagai contoh, plaintif mungkin mendakwa bahawa hasil tertentu berpunca secara langsung daripada karya artis tertentu atau daripada penyalinan gaya artis itu.
Jika membuang keseluruhan koleksi karya artis tersebut tidak mengubah output dengan ketara, mungkin lebih sukar untuk membuktikan sumbangan sebab-akibat yang khusus kepada output berkenaan.
Bagaimanapun, kajian ini tidak memutuskan mana-mana kes dan tidak menetapkan peraturan undang-undang. Pertikaian hak cipta boleh melibatkan isu lain, termasuk penyalinan tanpa kebenaran semasa latihan, persamaan ketara antara output tertentu dengan karya asal, akses kepada bahan, kemudaratan pasaran, syarat kontrak serta rekod penggunaan data.
Sesuatu output mungkin tidak boleh dikaitkan dengan mana-mana satu imej latihan melalui ujian penghapusan ini, tetapi model masih berkemungkinan menghafal bahan tertentu, menghasilkan semula bahan itu berdasarkan arahan atau keadaan pensampelan tertentu, atau menghasilkan imej yang mempunyai persamaan ketara dengan karya yang dilindungi. Kajian ini menguji kepekaan sebab-akibat terhadap pengeluaran unit latihan, bukan semua bentuk hafalan atau pelanggaran hak cipta.
Kajian ini khusus kepada model difusi, terutamanya penjana imej. Kaedah ensemble dan penghapusan yang digunakan, serta dapatan berkaitan skala latihan, tidak boleh dianggap telah terbukti untuk model bahasa besar berasaskan transformer.
Mahkamah dan penyiasat teknikal masih memerlukan ujian penghasilan semula berdasarkan arahan, analisis persamaan dan asal-usul kandungan, rekod data latihan serta sistem, audit model dan analisis undang-undang yang berkaitan.
Kesimpulan utama kajian ini ialah: apabila skala data meningkat, cerita mudah bahawa “satu sumber tertentu menyebabkan satu output tertentu” mungkin tidak lagi dapat dibuktikan melalui ujian atribusi. Namun, itu tidak bermakna penyalinan tidak boleh dibuktikan menggunakan bentuk bukti lain.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kajian Zheng Dai dan David Gifford mengenal pasti “kemerosotan atribusi”: semakin banyak data digunakan untuk melatih penjana imej difusi, semakin kecil kesan sebab akibat mana mana satu imej latihan terhadap hasil te...
Kajian Zheng Dai dan David Gifford mengenal pasti “kemerosotan atribusi”: semakin banyak data digunakan untuk melatih penjana imej difusi, semakin kecil kesan sebab akibat mana mana satu imej latihan terhadap hasil te... Penemuan ini mengukur pengaruh yang boleh dikaitkan dengan sesuatu output — bukan bukti bahawa imej latihan tidak pernah digunakan, disimpan atau boleh dihasilkan semula oleh model.
Para penyelidik membina ensemble difusi, iaitu beberapa komponen model yang dilatih secara berasingan menggunakan bahagian data yang dikawal.