インターネット上にAI生成コンテンツが急増している現在、この問題は次世代のAI開発にとって重要な課題と見られています。
モデル崩壊とは、生成モデルが人間などの実データではなく、過去のモデルが作ったデータを主に学習することで性能が劣化する現象です。
研究では、こうした再帰的な学習が不可逆的な欠陥を生む可能性が指摘されています。特に影響を受けるのが、データ分布の「テール(尾部)」と呼ばれる領域です。これは、頻度は低いものの現実を正確に表すために重要な珍しい事例を指します。
こうした事例が消えていくと、モデルの出力は次第に似通い、平均的で単調なパターンだけを再現するようになると考えられています。
この現象は特定のモデルに限らず、複数の生成モデルで確認されています。例えば次のようなモデルです。
複数のモデルで同様の結果が出ていることから、研究者はこれを特定のアーキテクチャの問題ではなく、合成データによる再帰学習に共通する統計的な性質とみています。
原因は、基本的な統計的サンプリングにあります。
AIがデータを生成する際、モデルは確率が高いパターンをより多く生成し、まれなパターンはほとんど生成しません。つまり、分布のテールにある事例は最初から出現頻度が低い状態になります。
その合成データで次の世代のモデルを訓練すると、次のような連鎖が起こります。
このプロセスが繰り返されると、分布のテールが完全に消滅することもあります。
そして一度データから消えてしまったパターンは、合成データだけからは復元できません。なぜなら、それが存在していた証拠自体がデータに残っていないからです。
興味深いのは、モデル崩壊を防ぐために大量の実データが必ずしも必要とは限らないという点です。
指数型分布族(Exponential Families)と呼ばれる統計モデルを使った分析では、わずか1つの実世界データ点でも訓練を安定させる可能性が示唆されています。
その理由は、このデータ点が
として機能するためです。
同様に、**事前知識(prior)**も崩壊防止に役立つ可能性があります。これはモデルにあらかじめ組み込まれた制約や仮定のことで、学習できる分布の範囲を限定します。
結果として、合成データが大多数であっても
が存在すれば、学習が完全に偏った方向へ進むのを防げる可能性があります。
この問題が注目されている背景には、インターネット上のAI生成コンテンツの急増があります。
大規模言語モデルは通常、ウェブ全体から収集された膨大なテキストで訓練されます。しかし、もしそのデータの多くがすでにAIによって書かれたものになれば、将来のモデルはAIの出力を主に学習することになるかもしれません。
そうなると次のような影響が懸念されています。
研究者は、これを防ぐためには
といった対策が重要だと指摘しています。
モデル崩壊の基本メカニズム自体は複数の研究で支持されていますが、実際の大規模LLMでどの程度起きるのかなど、詳細にはまだ不確実性があります。
例えば「1つの実データで防げる」という結果は、主に理論分析や簡略化した統計モデルで示されたものであり、巨大な実運用モデルで同じ条件が成立するかは今後の研究課題です。
それでも研究から得られる重要な教訓ははっきりしています。
AIをAIだけで育て続けると、現実の一部が徐々に消えてしまう可能性がある。 そのため、AI開発では今後も実世界データとのつながりを維持することが重要だと考えられています。