MIT研究人员郑戴(Zheng Dai)和David Gifford在覆盖24个扩散模型集、7个公共图像数据集的研究中发现:随着数据集从256张图像扩大到超过16万张,单个训练图像对特定输出的可测量影响会持续减弱。 研究团队设计了“扩散模型集”(diffusion ensemble),通过关闭见过特定图像的模型组件,生成“如果这张图没有影响训练,结果会怎样”的反事实输出,无需重新训练完整模型。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Zheng Dai and David Gifford’s MIT CSAIL study, published in Nature Communications, discover about “attribution decay” in diffusion-. Article summary: Dai and Gifford found “attribution decay”: as a diffusion image generator is trained on more data, the causal effect of any one training item on a particular generated image can shrink until it is too small to detect. Th. Topic tags: general, education, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wat
麻省理工学院计算机科学与人工智能实验室(MIT CSAIL)的一项研究,揭示了生成式图像模型在训练数据规模扩大后面临的一个反直觉问题:归因衰减(attribution decay)。
简单来说,扩散模型接触的图像越多,某一张训练图像对某一张生成结果的独立、可测量影响就可能越小。到了足够大的规模,即使把某个训练样本移除,生成结果也可能几乎没有变化。
但这项发现的含义比“AI忘记了来源”更窄。它并不证明模型从未见过这张图,也不证明模型无法复现它,更不能单独证明不存在版权风险。研究测试的是:在一个受控的移除实验中,某个训练单元是否仍是生成某一输出所必需的因素。
传统的影响分析方法通常是估算某个训练样本对模型产生了多大影响。郑戴和David Gifford采用了不同思路,设计出一种扩散模型集:它由多个独立训练的模型组件组成,每个组件只接触经过精心划分的一部分训练数据。
这种架构让研究人员可以提出一个清晰的反事实问题:如果某张图像没有影响模型训练,模型还会生成什么?
他们无需从头重新训练一个大型模型,而是关闭所有见过目标图像的相关组件,再生成对照结果。这样做相当于对该图像的训练影响进行消融,而不只是通过近似算法推测其影响。
研究团队在7个公共图像数据集上评估了24个扩散模型集。数据集规模从256张图像到超过16万张图像不等,便于研究人员观察数据量增加后,训练样本的可归因程度如何变化。
研究人员将原始生成结果与移除候选训练单元后得到的反事实结果进行比较,并把原始结果与这些反事实结果之间测得的最大差异称为反事实半径(counterfactual radius)。它可以用来衡量:移除一个训练单元,最多能让输出改变多少。
随着训练数据集扩大,反事实半径持续下降。换言之,移除单张图像后,生成结果越来越难与原始结果区分,至少在这项研究采用的测量方式下是如此。
这带来了一个看似矛盾的结论:增加训练数据,可能反而让一张生成图像更难归因于任何一个具体样本。
模型可能从大量来源中学习到相互重叠的整体模式,而不是在生成某个结果时依赖某一张能够被单独识别的图像。随着这些来源不断累积,单个样本与单个输出之间的因果联系会变得越来越分散。
在足够大的规模下,研究中观察到的现象并不只涉及单张图像。移除某位艺术家的全部作品,或移除所有描绘某个特定人物的照片,也可能不会让测试中的生成样本出现实质变化。
因此,研究人员将其称为“衰减”,而不只是“检测失败”。问题可能并非调查工具还不够强,而是单个来源与单个输出之间的因果连接本身已经变得过于分散,难以被单独隔离。
归因衰减,可能让一种具体的版权主张更难举证:争议输出是由某位明确指认的艺术家作品,或由这些作品的复制品,直接造成的。
如果移除某位艺术家的全部作品后,模型在该项反事实测试中仍生成几乎不变的结果,那么原告要证明这组作品对于这张特定图像具有不可替代的因果作用,可能会更加困难。对于围绕Midjourney、OpenAI或Microsoft等公司图像生成系统展开的争议,这一结果可能削弱“某个输出直接来自某一位艺术家”的简单叙事。
不过,这项研究没有裁定任何公司是否侵犯版权,也不会自动构成法律抗辩。版权案件可能涉及一系列不同问题,包括:
技术意义上的“无法归因”,不能直接等同于法律意义上的“没有复制”。
这项实验测试的是:移除某些训练单元后,模型对输出的敏感程度是否发生变化。它并没有覆盖模型保留或复现信息的所有方式。
在扩散模型集的删除测试中,一张图像对某个输出可能没有显示出明显的独立影响,但模型仍可能在特定提示词或采样条件下复现相关作品,或者生成与受保护作品高度相似的结果。
以下几种说法并不相同:
归因衰减直接回答的是第一个问题,并没有解决后两个问题。
这项研究针对的是用于图像及相关视听媒体生成的扩散模型。其模型集架构和观察到的规模变化规律,不能自动推广到基于Transformer的大型语言模型(LLM)。
语言模型拥有不同的架构、训练流程、词元表示方式和输出机制。该研究或许能为未来的训练数据归因研究提供实验思路,但目前并没有证明LLM也会出现完全相同形式的归因衰减。
如果争议焦点是AI系统是否复制了某件作品,归因衰减只是证据链中的一环。法院和技术调查人员仍可能需要考察:
这项研究最重要、也最准确的结论,并不是AI“忘记了自己从哪里学来”。更准确地说,随着扩散模型使用的数据集不断扩大,单个训练样本对某一输出的因果贡献可能变得过于分散,以至于难以检测。
这会让来源追溯更加困难,却不会让记忆、复现或版权分析失去意义。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
MIT研究人员郑戴(Zheng Dai)和David Gifford在覆盖24个扩散模型集、7个公共图像数据集的研究中发现:随着数据集从256张图像扩大到超过16万张,单个训练图像对特定输出的可测量影响会持续减弱。
MIT研究人员郑戴(Zheng Dai)和David Gifford在覆盖24个扩散模型集、7个公共图像数据集的研究中发现:随着数据集从256张图像扩大到超过16万张,单个训练图像对特定输出的可测量影响会持续减弱。 研究团队设计了“扩散模型集”(diffusion ensemble),通过关闭见过特定图像的模型组件,生成“如果这张图没有影响训练,结果会怎样”的反事实输出,无需重新训练完整模型。
在足够大的规模下,移除某位艺术家的全部作品,甚至移除某个特定人物的全部照片,也可能不会让测试中的生成结果出现明显变化;但这并不意味着模型没有记忆、无法复现作品,或因此自动规避版权责任。