呢個現象最令人意外的地方係,增加訓練數據,可能令一張生成圖片更難歸因到任何一個單一來源。模型似乎可以從大量來源學到互相重疊的形狀、構圖、色彩和視覺模式,而唔需要依賴其中一張可被單獨識別的圖片,先能夠產生某個結果。
歸因衰減或會令某一種版權主張較難證明:一張有爭議的AI生成圖片,係由某位具名藝術家的作品,或者由那些作品的複本,直接造成。
如果移除一位藝術家的整個作品集,都沒有令特定輸出出現重大變化,原告就較難單靠這種因果測試,證明該作品集對這張圖片是「個別而必要」的來源。這可能令涉及大型圖片生成服務,以及「AI直接複製藝術家風格」的爭議,變得更加複雜。
但研究沒有裁定任何公司有沒有侵權,亦不會自行構成法律抗辯理由。版權案件可以涉及多個不同問題,包括:訓練期間有沒有未經授權複製受保護作品、輸出同某件作品是否達到實質相似、模型在特定提示詞下可以重現到甚麼程度,以及案件涉及的損害或合約責任。
技術上的「無法歸因」,唔可以直接當成法律上的「沒有複製」。
這項實驗測試的是:移除訓練單位後,模型對輸出的敏感程度。它並沒有涵蓋模型保留或重現資訊的所有方式。
模型可能在刪除測試中顯示出對任何一張圖片都沒有很強的個別依賴,但在某些提示詞、抽樣設定或生成條件下,仍然可以重現一件特定作品。即使沒有任何一張訓練圖片被證明是該輸出的「必要原因」,輸出亦可能同受保護作品高度相似。
以下三句說話,意思並不一樣:
歸因衰減直接處理的是第一個問題,並沒有解決第二或第三個問題。
研究集中於用來生成圖片及相關視聽媒體的擴散模型。其集成架構和觀察到的規模效應,唔可以自動推論到以Transformer為基礎的大型語言模型(LLM)。
語言模型有不同的架構、訓練方法、文字標記方式和輸出行為。今次研究可以為日後的來源歸因實驗提供方向,但並沒有證明LLM亦會出現完全相同形式的歸因衰減。
如果要判斷一個AI系統有沒有複製某件作品,歸因衰減只係其中一塊拼圖。法院和技術調查人員仍可能需要考慮:
這項研究最核心、亦最實用的結論,唔係AI已經「忘記」自己向邊個學習,而係:當擴散模型的訓練數據規模愈來愈大,單一訓練例子對某個輸出的因果貢獻,可能分散到難以偵測。