一项由麻省理工学院计算机科学与人工智能实验室(MIT CSAIL)的Zheng Dai和David Gifford开展、于2026年8月20日发表于《Nature Communications》的研究,聚焦于一个与AI图像版权争议密切相关的问题:一张生成图,究竟能否被明确归因于某一张训练图片?
研究给出的答案是:当模型使用的训练数据足够庞大时,很多情况下可能无法做到。研究人员将这种现象称为“归因衰减”(attribution decay)——随着训练数据规模扩大,任何单个训练样本对某一特定输出的因果影响都会减弱,最终可能小到无法检测。![]()
研究团队究竟测试了什么?
研究人员没有仅仅用数学方法估算一张图片的影响,而是构建了一种名为“扩散集成”(diffusion ensemble)的架构。它由多个使用不同数据切片训练的较小扩散模型组成。![]()
如果要测试某张图片是否影响了生成结果,团队会关闭所有曾经接触过这张图片的组件,从而直接得到一个“不包含该来源”的反事实模型。这样既不需要重新训练整个模型,也不必依赖近似计算。![]()
随后,研究人员将这种集成方法与24个使用相同数据训练的传统扩散模型进行比较。这些模型按照常见指标衡量时,生成质量大体相当。![]()
实验覆盖了从256张到超过16万张图片的多个数据集,测试了三种移除情形:
- 移除一张单独的图片;
- 移除某一位艺术家的全部作品;
- 移除某个人的全部照片。
![]()
结果显示,在数据规模较大时,移除上述某一种来源,往往不会让生成结果出现可观测的变化。换言之,即使某张图片或某位艺术家的完整作品集被拿掉,特定输出也可能基本保持不变。这种单个来源的可测影响不断减弱的现象,就是研究所说的“归因衰减”。![]()