這個結果有點反直覺:增加更多訓練資料,可能反而令一張生成圖像較難歸因於任何一個特定訓練樣本,即使該樣本確實曾出現在訓練資料中。
一個可能的技術解釋是,模型從大量彼此重疊的來源中學習廣泛的視覺模式。對某個特定輸出而言,模型未必需要依賴一張可被單獨辨認的影像,而是由許多資料共同形成分散的影響。
歸因衰減可能令某一種版權主張更難證明:爭議輸出是由某位具名藝術家的作品,或該藝術家作品的複本,直接造成。
如果在這項因果測試中,移除一位藝術家的完整作品集也沒有令特定輸出出現實質變化,原告便較難主張這個作品集對該張圖像而言是不可或缺的個別來源。研究因此可能令涉及生成式圖像系統、藝術家風格模仿,以及 Midjourney、OpenAI 或 Microsoft 等公司相關爭議的知識產權案件,面對更複雜的舉證問題。
不過,這項研究沒有裁定任何公司是否侵犯版權,也不會自行構成法律抗辯理由。版權爭議可能涉及多個不同問題,包括:
技術上的「無法歸因」,不能直接等同法律上的「沒有複製」。
這項實驗測試的是:移除某些訓練單位後,模型輸出對這些單位的敏感度有多高。它並沒有涵蓋模型保留或重現資訊的所有方式。
模型可能在刪除測試中顯示出對任何單一影像的低度依賴,但在某些提示詞、取樣設定或生成條件下,仍然能夠重現特定作品。即使沒有任何一張單獨的訓練影像被證明是某個輸出的必要因果來源,輸出仍可能與受保護作品相似。
以下三種說法不能混為一談:
歸因衰減主要回答第一個問題,並沒有單獨解決第二或第三個問題。
這項研究集中於用來生成圖像及相關視聽媒體的擴散模型。研究中的集成架構,以及觀察到的資料規模變化模式,不能自動推論同樣適用於以 Transformer 為基礎的大型語言模型(LLM)。
語言模型在架構、訓練流程、標記表示方式和輸出行為上,都與圖像擴散模型不同。這項研究或許能為未來的資料歸因研究提供實驗方向,但目前並未證明 LLM 也會出現完全相同形式的歸因衰減。
如果爭議核心是 AI 系統是否複製了某件作品,歸因衰減只是其中一項證據。法院和技術調查人員仍可能需要檢視:
這項研究最重要的啟示,並不是 AI「忘記」了自己從哪裡學習。更準確地說,當擴散模型的訓練資料集持續擴大,單一訓練樣本對某個輸出的因果貢獻,可能會分散到難以測量。這會令來源追溯更加困難,卻不代表記憶、重現或版權分析已經失去可能性。