背後其實是非常基本的統計原理:取樣偏差(sampling bias)。
如果下一代模型用這些資料訓練,就會出現連鎖效應:
長期下來,資料分布的尾端可能完全消失,只剩最常見的模式。
一旦這些罕見案例不再出現在訓練資料中,後續模型就幾乎無法重新學回它們——因為證據已經不存在了。
有趣的是,一些最新分析顯示:防止模型崩潰所需的真實資料可能非常少。
在研究一類稱為指數族(exponential families)的統計模型時,研究者發現,只要在訓練資料中保留哪怕一個來自真實分布的資料點,就可能足以作為「錨點」,提醒模型原始分布中仍然存在那些罕見模式。
換句話說,那個資料點能提供關鍵證據,使模型不會完全收斂到錯誤的分布。
在實務上意味著:
模型崩潰的議題近年變得更受關注,原因之一是網路內容正快速被AI生成文本填滿。
研究者警告,這種情況可能導致:
這表示在實際系統中,需要多少真實資料,仍可能依模型架構、資料集組成與訓練方式而有所不同。