이 한계가 다가오자 OpenAI와 Anthropic은 눈을 돌렸다. 그동안 손대지 않았던 기업 내부 협업 데이터로 말이다. 실제 인간의 상호작용 기록—협상을 담은 이메일, 실시간 의사결정이 오간 회의록, 진짜 직장 내 역학이 드러난 슬랙 스레드—는 이미 공개 웹에서는 찾기 어려운 유기적 대화 데이터를 제공한다.
로이터 통신이 2024년 보도한 시장 평균 단가는 다음과 같다: 텍스트 단어당 약 0.1센트, 이미지 1~2달러, 짧은 영상 2~4달러, 긴 영화나 비디오 시간당 100~300달러.
SimpleClosure는 지난 1년간 약 100건의 거래를 중개했으며, 건당 지급액은 1,000만 원에서 1억 원 사이였다. 이 회사의 'Asset Hub' 플랫폼은 창업자들이 데이터 라이선싱 전에 개인식별정보(PII)를 제거하도록 돕지만, 그 익명화의 효과와 일관성은 아직 불확실하며 점점 더 논란의 대상이 되고 있다.
AI 기업들이 훈련 데이터를 확보하기 위해 어디까지 갈 수 있는지는 '프로젝트 파나마'라는 사건에서 극명하게 드러났다. 이는 Anthropic이 방대한 책 훈련 데이터셋을 구축하기 위해 비밀리에 진행한 내부 프로그램이다.
프로젝트는 두 가지 방향으로 진행됐다. 첫째, Anthropic은 인쇄된 책을 물리적으로 구매한 뒤 제본을 잘라내 페이지별로 파괴적으로 스캔해 검색 가능한 PDF로 변환하고 원본은 폐기했다. 목표는 6개월 안에 최대 200만 권의 책을 처리하는 것이었다. 한 내부 메모는 "이 사실이 알려지는 것을 원하지 않기 때문에" 코드명을 사용하라고 조언했다.
둘째, 회사는 LibGen, Pirate Library Mirror 등 섀도 라이브러리에서 700만 권이 넘는 불법 복제 전자책 파일을 다운로드했다. 이 경로는 2024년 작가 안드레아 바츠, 커크 월러스 존슨, 찰스 그레버가 제기한 집단 소송으로 이어졌다. 이들은 Anthropic이 클로드(Claude)를 훈련시키는 데 거의 50만 권의 불법 복제 책을 사용했다고 고발했다.
2026년 7월 20일, 샌프란시스코 연방 판사는 1조 7,100억 원(15억 달러)의 합의를 승인했다. 이는 미국 역사상 최대 규모의 저작권 합의금이다. 50만 명 이상의 작가와 출판사가 이 집단 소송에 포함되었으며, 저작물당 약 3,000달러씩 배정될 예정이다.
중요한 점은 법원이 AI 훈련에 대해 결정적인 법적 구분을 그었다는 것이다. 불법 복제 전자책을 사용한 것은 침해 행위로 합의 대상이 됐다. 그러나 물리적 인쇄본을 구매해 내부적으로 파괴 스캔하는 것은 법원이 '매우 혁신적인(exceedingly transformative)' 과정이라고 판단해 공정 이용(fair use) 에 해당할 가능성을 열어뒀다. 1조 7천억 원은 불법 복제 도서 책임을 위한 것이었고, 물리적 책 파괴 프로그램은 처벌받지 않았다.
기업들이 내부 데이터를 돈으로 바꾸려 서두르면서 중요한 문제들이 남아 있다. SimpleClosure 같은 중개업체의 데이터 익명화 효과는 아직 불확실하며 점점 더 논란의 대상이 되고 있다. 직원 슬랙 메시지와 이메일에는 깊은 개인적·민감한 정보가 포함되어 있으며, 현재의 정보 제거 기술로 재식별을 완전히 막을 수 있을지는 불분명하다.
한편 훈련 비용은 통제 불능으로 치닫고 있다. GPT-4 규모의 단일 훈련 실행은 이미 1억 달러(약 1,100억 원) 이상이 들 수 있다. 고품질 공공 데이터가 고갈됨에 따라 독점 기업 데이터 라이선싱 비용, Anthropic의 1조 7천억 원 같은 기록적인 합의금, 합성 데이터 파이프라인 구축 비용이 모두 급등하고 있다. 이러한 인간 텍스트 라이선싱이 공식 자산 클래스로 자리 잡으면서, 광범위한 AI 훈련 데이터셋 시장은 2025년 약 36억 달러에서 2034년 230억 달러로 빠르게 성장할 전망이다.
일반 사용자 입장에서 상황은 확연히 달라졌다. 2025년 말 기준으로, OpenAI와 Anthropic은 모두 기본 정책을 변경해 사용자가 적극적으로 거부(opt-out)하지 않는 한 컨슈머 티어 대화(ChatGPT 무료·Plus, Claude 무료·Pro·Max 등)를 훈련에 사용하도록 허용했다. 기업(Enterprise) 및 API 고객은 데이터 처리 계약(DPA)에 따라 기본적으로 훈련에서 제외된다.
메시지는 명확하다. AI의 끝없는 데이터 갈증을 채우기 위한 경쟁에서, 공공과 사적, 개인과 상업의 경계가 하나의 슬랙 아카이브씩 다시 그려지고 있다.