2026년 연구에서 정 다이와 데이비드 기퍼드는 24개 확산 앙상블과 7개 공개 이미지 컬렉션을 분석했다. 데이터셋 규모는 256개 이미지부터 16만 개 이상까지 다양했다. 연구팀은 ‘확산 앙상블’을 활용해 모델 전체를 다시 학습하지 않고도 특정 이미지가 학습에 미친 영향을 제거한 뒤, 원래 결과와 반사실적 결과를 비교했다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What did Zheng Dai and David Gifford’s MIT CSAIL study, published in Nature Communications, discover about “attribution decay” in diffusion-. Article summary: Dai and Gifford found “attribution decay”: as a diffusion image generator is trained on more data, the causal effect of any one training item on a particular generated image can shrink until it is too small to detect. Th. Topic tags: general, education, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wat
MIT 컴퓨터과학·인공지능연구소(CSAIL) 연구팀이 생성형 AI 이미지의 출처를 추적하려는 사람들에게 중요한 기술적 난제를 제시했다. 연구진이 **‘귀속성 감쇠(attribution decay)’**라고 부른 현상이다.
확산 모델이 더 많은 이미지를 학습할수록, 특정 생성 결과에 대한 개별 학습 이미지 하나의 측정 가능한 인과적 영향은 작아진다. 어느 한 이미지를 학습 과정에서 제외해도 결과가 거의 달라지지 않을 수 있다는 뜻이다.
다만 이것이 모델이 해당 이미지를 본 적이 없거나, 그 이미지를 재현할 수 없거나, 저작권 위험이 없다는 의미는 아니다. 이 연구가 보여주는 것은 더 좁은 기술적 결과다. 통제된 삭제 실험에서 특정 학습 단위가 특정 출력물을 만드는 데 더 이상 필수적이지 않을 수 있다는 것이다.
기존의 영향 분석 방식은 대체로 특정 학습 사례가 모델에 어떤 영향을 줬는지를 추정한다. 정 다이와 데이비드 기퍼드는 대신 **확산 앙상블(diffusion ensemble)**을 설계해 통제된 반사실적 실험이 가능하도록 했다.
확산 앙상블은 서로 독립적으로 학습된 여러 구성 요소로 이뤄진다. 각 구성 요소는 전체 학습 데이터 중 세심하게 나눈 일부만 접한다.
이 구조를 이용하면 다음과 같은 질문을 비교적 직접적으로 던질 수 있다.
“이 이미지가 학습에 영향을 주지 않았다면 모델은 무엇을 생성했을까?”
하나의 거대한 모델을 처음부터 다시 학습하는 대신, 선택한 이미지를 본 구성 요소를 비활성화해 비교용 결과를 생성하는 방식이다. 따라서 단순한 추정이 아니라 특정 이미지의 영향을 제거하는 **절제 실험(ablation)**에 가깝다.
연구팀은 7개의 공개 이미지 컬렉션을 대상으로 24개의 확산 앙상블을 평가했다. 데이터셋 규모는 256개 이미지부터 16만 개가 넘는 이미지까지 다양했다. 연구진은 원래 생성 결과와 후보 학습 단위를 제외한 뒤 생성한 반사실적 결과를 비교했다.
원래 출력물과 반사실적 출력물 사이에서 관측된 가장 큰 차이는 **반사실적 반경(counterfactual radius)**으로 정의했다. 이는 학습 단위 하나를 제외했을 때 결과가 얼마나 달라질 수 있는지를 나타내는 척도다.
학습 데이터셋이 커질수록 반사실적 반경은 감소했다. 실제로는 이미지 한 장을 제거해도 연구 측정 방식에서 원래 결과와 구별하기 어려운 출력물이 나오는 경우가 점점 늘어났다는 뜻이다.
직관과는 반대되는 결과다. 학습 데이터를 추가하면 특정 생성 이미지가 어느 한 학습 사례에 의해 만들어졌다고 보기 오히려 어려워질 수 있다. 모델이 특정 결과를 위해 하나의 식별 가능한 이미지만 사용하는 대신, 여러 출처에서 겹치는 광범위한 패턴을 학습하기 때문이다.
충분히 큰 규모에서는 개별 이미지뿐 아니라 더 넓은 범주의 영향도 희미해졌다. 연구에서는 특정 작가가 만든 이미지 전부를 제거하거나, 특정 인물을 담은 사진을 모두 제거해도 테스트 환경에서 생성 결과가 사실상 변하지 않을 수 있다고 보고했다.
연구진이 이를 단순한 ‘탐지 실패’가 아니라 감쇠라고 표현한 이유도 여기에 있다. 조사 도구가 충분히 정교하지 않아서가 아니라, 특정 출처와 특정 결과 사이의 인과적 연결 자체가 너무 여러 데이터에 분산돼 분리하기 어려워질 수 있다는 것이다.
귀속성 감쇠는 저작권 주장 중 한 가지 논리를 입증하기 어렵게 만들 수 있다. 예를 들어 문제의 생성 이미지가 특정 작가의 작품 또는 해당 작품의 복사본에 의해 직접적으로 만들어졌다는 주장을 생각해보자.
만약 작가의 작품 전체를 학습 데이터에서 제거해도 특정 출력물이 크게 달라지지 않는다면, 해당 작품 집합이 그 이미지 생성에 개별적으로 필요했다고 주장하기가 어려워진다. 대규모 학습은 ‘눈에 띄는 결과물 = 한 작가 또는 한 작품의 직접적인 산물’이라는 단순한 설명을 약화할 수 있다. 이에 따라 이 연구는 생성형 이미지 시스템과 관련된 지식재산권 분쟁을 복잡하게 만들 수 있다는 평가를 받았다.
하지만 이 연구가 특정 기업의 저작권 침해 여부를 판단한 것은 아니다. 연구 결과만으로 법적 면책이 성립하는 것도 아니다.
저작권 분쟁에서는 여러 문제가 별도로 검토될 수 있다. 학습 과정에서 보호받는 저작물이 무단 복제됐는지, 특정 출력물이 보호 저작물과 실질적으로 유사한지, 시스템이 특정 프롬프트에서 무엇을 재현할 수 있는지, 피해나 계약상 의무가 존재하는지 등이 대표적이다.
따라서 기술적 의미의 **‘귀속할 수 없음’**을 법적 의미의 **‘복제되지 않음’**과 같은 말로 받아들여서는 안 된다.
이번 실험은 학습 단위를 제거했을 때 모델의 결과가 얼마나 민감하게 변하는지를 측정했다. 모델이 정보를 보존하거나 재현하는 모든 방식을 검사한 것은 아니다.
앙상블의 삭제 테스트에서 특정 이미지 하나에 대한 의존성이 거의 나타나지 않더라도, 모델이 특정 작품의 일부를 기억하고 있을 가능성은 남는다. 특정 프롬프트나 샘플링 조건에서 해당 작품을 재현할 수도 있다. 어떤 출력물이 특정 학습 이미지 하나에 의해 인과적으로 필요하지 않았더라도 보호 저작물과 유사한 결과가 나올 수 있다.
다음 세 가지 주장은 서로 다르다.
이번 연구가 직접 다룬 것은 첫 번째 질문이다. 두 번째와 세 번째 질문에 대한 답을 확정한 것은 아니다.
이번 연구의 대상은 이미지와 관련 시청각 콘텐츠를 생성하는 확산 기반 생성 모델이다. 연구에서 사용한 앙상블 구조와 데이터 규모에 따른 패턴을 트랜스포머 기반 대규모 언어 모델(LLM)에 자동으로 일반화할 수는 없다.
언어 모델은 구조, 학습 방식, 토큰 표현, 출력 동작이 확산 모델과 다르다. 이번 연구가 향후 언어 모델의 귀속성 연구에 실험 방향을 제시할 수는 있지만, LLM에서도 동일한 형태의 귀속성 감쇠가 발생한다는 점을 입증한 것은 아니다.
AI 시스템이 특정 작품을 복제했는지를 판단할 때 귀속성 감쇠는 여러 증거 중 하나에 불과하다. 법원과 기술 조사기관은 여전히 다음과 같은 요소를 검토해야 한다.
이번 연구의 핵심 메시지는 AI가 출처를 ‘잊는다’는 주장보다 좁고, 동시에 더 유용하다. 확산 모델의 학습 데이터가 커질수록 특정 학습 사례 하나가 특정 출력물에 기여한 인과적 영향은 감지하기 어려울 정도로 분산될 수 있다. 출처 추적은 더 어려워지지만, 이것이 암기·재현 가능성이나 저작권 분석 자체를 불가능하게 만드는 것은 아니다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
2026년 연구에서 정 다이와 데이비드 기퍼드는 24개 확산 앙상블과 7개 공개 이미지 컬렉션을 분석했다. 데이터셋 규모는 256개 이미지부터 16만 개 이상까지 다양했다.
2026년 연구에서 정 다이와 데이비드 기퍼드는 24개 확산 앙상블과 7개 공개 이미지 컬렉션을 분석했다. 데이터셋 규모는 256개 이미지부터 16만 개 이상까지 다양했다. 연구팀은 ‘확산 앙상블’을 활용해 모델 전체를 다시 학습하지 않고도 특정 이미지가 학습에 미친 영향을 제거한 뒤, 원래 결과와 반사실적 결과를 비교했다.
데이터셋이 커질수록 개별 이미지 하나를 제거해도 생성 결과가 거의 달라지지 않았다. 경우에 따라 특정 작가의 작품 전체나 특정 인물을 담은 사진을 모두 제거해도 결과가 사실상 유지됐다.