背后的原因来自一个简单的统计学事实:采样偏差。
如果下一代模型再用这些合成数据训练,就会发生连锁效应:
随着迭代进行,偏差不断累积,分布尾部最终完全消失。
一旦这些稀有模式从训练数据中消失,后续模型就无法再恢复它们,因为训练数据里已经没有任何证据表明它们曾经存在。
一些最新分析提出了一个出人意料的发现:防止模型崩塌所需的真实信息量可能非常少。
研究人员在分析一种称为指数族(Exponential Families)的统计模型时发现,只要在训练数据中加入哪怕一个来自真实分布的数据点,就可以作为“锚点”。这个数据点保留了原始分布存在的证据,从而阻止训练过程收敛到错误的分布。
类似地,**先验知识(prior knowledge)**也能起到类似作用。例如:
换句话说:
即使合成数据数量远远超过真实数据,这些因素仍然可以稳定训练过程。
模型崩塌的问题在当前AI发展阶段变得越来越现实。
如果新的模型主要从这些AI生成文本中学习,就可能逐渐远离真实的人类语言和知识结构。
潜在影响包括:
因此,在实际系统中需要多少真实数据,仍然可能取决于: