一句講晒:單一來源可能「淡出」模型影響力
Zheng Dai、David Gifford及其研究團隊嘅工作指出,當擴散式圖像生成器訓練嘅圖片數量增加,任何一張訓練圖片對某一張生成圖片嘅因果影響,可能會細到無法再偵測。研究人員將呢種現象稱為「歸因衰減」(attribution decay)。![]()
換句話講,就算將某張圖片從訓練資料中精確移除,生成結果都可能幾乎冇變;移除某位藝術家的全部作品,或者某個人嘅全部相片,亦可能出現同樣情況。![]()
但要留意,呢個結論係講「難以將特定輸出歸因於單一來源」,唔係話模型一定冇複製作品,更加唔係話以受版權保護作品訓練AI就一定合法。
研究團隊點樣測試?
研究人員冇單靠數學估算某張圖片對模型嘅影響,而係設計咗一個「擴散集成」(diffusion ensemble)架構:由多個較小型嘅擴散模型組件組成,而每個組件以不同數據切片訓練。![]()
如果要測試某個來源被移除後會點,團隊就會關閉所有曾經睇過該來源嘅組件。咁樣可以直接建立一個「冇咗該素材」嘅反事實模型,唔需要重新訓練整個模型,亦唔使靠近似方法推算。![]()
團隊亦將呢種集成方法,同24個以相同數據訓練嘅傳統擴散模型比較。按標準評估指標計算,兩種方法嘅輸出質素大致相若。![]()
測試涵蓋由256張至超過16萬張圖片嘅數據集,研究人員分別移除:
- 一張單獨嘅圖片;
- 某一位藝術家嘅全部作品;
- 某一個人嘅全部相片。
![]()