隨住 AI 生成內容喺網絡上愈來愈多,呢個問題亦開始被視為長遠 AI 發展嘅重要風險。
模型崩塌係生成式模型嘅一種失效模式:當模型唔再主要從人類或真實世界數據學習,而係從舊模型生成嘅輸出學習時,就會出現性能同多樣性下降。
研究發現,呢種遞歸式訓練會引入不可逆嘅缺陷。模型會逐漸失去數據分佈「尾端」(tails)嘅資訊——即係那些出現次數少,但對準確描述現實非常重要嘅例子。
隨住訓練一代一代進行:
呢個現象已經喺多種生成模型中觀察到,例如:
因為唔同模型架構都出現同樣問題,研究人員認為模型崩塌並唔只係某種算法嘅缺陷,而係生成模型在合成數據遞歸訓練下嘅普遍現象。
背後原因其實同基本統計抽樣有關。
當模型生成數據時,它傾向重現高機率模式,而罕見事件本身就位於分佈尾端,因此抽樣時本來就比較少出現。
當下一代模型用呢啲合成數據訓練時:
每一次迭代都會累積之前嘅誤差。到某一個階段,分佈尾端幾乎完全消失,只剩下最常見嘅模式。
一旦呢啲罕見例子從訓練數據中消失,之後嘅模型就無辦法再重建它們,因為數據裡面已經冇證據顯示佢哋曾經存在。
近期分析提出一個有趣結果:阻止模型崩塌可能唔需要大量真實數據。
研究人員分析一類叫做指數族(exponential families)嘅統計模型時發現,只要訓練過程中包含至少一個來自真實分佈嘅數據點,就可以為模型提供「錨點」,保持對原始分佈嘅參考。
換句話講,即使合成數據佔絕大多數,呢個真實樣本仍然可以提醒模型:原本嘅分佈其實包含其他模式。
另外一種方法係加入先驗知識(prior knowledge),即係對模型設定限制或假設。呢啲限制會縮小模型可以學習嘅分佈範圍,避免它完全跟隨偏差嘅合成數據。
實際意義包括:
即使真實數據比例好少,仍然可能足以穩定訓練過程。
模型崩塌問題近年愈來愈受關注,原因係AI 生成內容正在快速充斥互聯網。
大型語言模型通常依賴從網絡抓取嘅海量文本數據訓練。如果網上越來越多內容其實係 AI 生成,未來模型訓練數據就可能大量包含舊模型嘅輸出。
如果訓練主要依賴呢啲內容,長遠可能帶來幾個後果:
因此研究人員認為,要避免模型崩塌,AI 開發者需要確保仍然能取得可信嘅人類生成數據,或者在訓練過程中加入能保留原始分佈結構嘅方法。
雖然模型崩塌嘅機制已經有理論同實驗支持,但部分細節仍然未完全確定。
例如「一個真實數據點就足以阻止崩塌」嘅結論主要來自理論分析同簡化統計模型,而唔係大規模實際 LLM 訓練實驗。
因此喺真實 AI 系統中,到底需要幾多真實數據先足夠,仍然可能取決於模型架構、數據來源同訓練方法。
不過整體訊息相當清楚:如果 AI 只靠 AI 生成內容訓練,模型可能會逐漸「忘記」部分現實世界。 要保持準確同多樣性,仍然需要同真實世界數據保持連接。