研究發現「歸因衰減」:擴散式圖像生成器訓練資料越多,單一訓練影像對特定輸出的因果影響可能小到無法偵測,甚至在精確移除測試中消失。[1] 這使人們更難把生成圖像與特定藝術家、照片或來源影像連結起來,但研究並未證明使用受版權保護的資料訓練模型必然合法,也沒有證明模型從不複製作品。[1] 研究團隊建立「擴散集成」架構,由多個以不同資料切片訓練的小型擴散元件組成,藉此測試個別影像對輸出的影響。[1]
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Zheng Dai and David Gifford’s MIT CSAIL study, published in Nature Communications on August 20, 2026, reveal about “attribution dec. Article summary: The study found “attribution decay”: as a diffusion image generator is trained on more images, the causal influence of any one training image on a particular output can become too small to detect—and may disappear under . Topic tags: general web, openai, llm, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
這項由 MIT 電腦科學與人工智慧實驗室(CSAIL)研究人員鄭岱與 David Gifford 進行的研究,指出擴散式 AI 圖像生成器可能出現一種名為「歸因衰減」(attribution decay)的現象:當模型以越來越龐大的圖像資料集訓練時,任何單一訓練影像對某個特定輸出的因果影響,都可能小到無法偵測;在精確移除測試中,這種影響甚至可能完全消失。
這個結果讓「某張生成圖像是否源自某一張訓練圖片」變得更難回答。不過,研究並沒有宣稱模型不會記憶或複製訓練資料,也沒有裁定使用受版權保護的作品訓練 AI 是否違法。
研究人員沒有只靠數學方法估算一張圖像的重要性,而是建立了「擴散集成」(diffusion ensemble)架構:讓許多較小的擴散模型元件,分別以不同的資料切片進行訓練。
如果要測試「模型從未看過某張來源圖像」時會產生什麼結果,團隊會關閉所有曾經看過該影像的元件。這樣便能建立一個精確的反事實模型,不必重新訓練整個系統,也不必依賴近似估算。
團隊接著把這種集成方法,與 24 個以相同資料訓練的傳統擴散模型比較。依照標準評測,兩種方法產生的圖像品質大致相近。
測試涵蓋從 256 張到超過 16 萬張圖像的資料集,研究人員分別移除:
當資料集規模變大,移除上述其中一類來源後,生成結果往往沒有出現可觀察的變化。研究團隊將這種「單一來源可測量影響逐漸減弱」的現象稱為「歸因衰減」。
研究結果可能使某些版權主張更加複雜。假設原告主張,與 Midjourney、OpenAI 或 Microsoft 相關的系統所生成的特定圖像,是由原告某一張作品,或其完整藝術作品集直接造成;如果在精確移除這些資料後,相關輸出並沒有改變,那麼這項反事實測試就很難支持「該輸出可歸因於這些作品」的說法。
但這並沒有解決 AI 版權爭議中的其他法律問題,包括:
換言之,這項研究提供的是「特定輸出能否因果歸因於特定訓練來源」的科學證據,而不是一項法律裁決。
首先,研究並沒有說擴散模型無法記憶資料。在某些情況下,模型仍可能記住或重現訓練樣本;「歸因衰減」指的是,隨著資料集擴大,個別來源對特定輸出的影響往往變得難以測量,而不是宣稱複製行為從未發生。
其次,研究對象是擴散式圖像生成器,不能直接把結果套用到語言模型或其他生成式架構。
因此,法院若要判斷是否存在複製行為,以及相關智慧財產責任,可能仍需參考一對一的輸出歸因之外的證據,例如資料取得紀錄、作品之間的直接相似性、模型在針對性提示下的行為、內容來源資訊,以及專家證詞。這是根據研究所呈現的結果作出的推論:在大規模資料集下,要把單一輸出明確歸因於某個個別來源,可能相當困難。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
研究發現「歸因衰減」:擴散式圖像生成器訓練資料越多,單一訓練影像對特定輸出的因果影響可能小到無法偵測,甚至在精確移除測試中消失。[1]
研究發現「歸因衰減」:擴散式圖像生成器訓練資料越多,單一訓練影像對特定輸出的因果影響可能小到無法偵測,甚至在精確移除測試中消失。[1] 這使人們更難把生成圖像與特定藝術家、照片或來源影像連結起來,但研究並未證明使用受版權保護的資料訓練模型必然合法,也沒有證明模型從不複製作品。[1]
研究團隊建立「擴散集成」架構,由多個以不同資料切片訓練的小型擴散元件組成,藉此測試個別影像對輸出的影響。[1]