Bu tavan yaklaşırken, OpenAI ve Anthropic daha önce dokunulmamış bir kaynağa yöneldi: şirket içi iş birliği verileri . Canlı insan etkileşimlerinin kayıtları (müzakereleri içeren e-postalar, gerçek zamanlı karar alma süreçlerinin yer aldığı toplantı transkriptleri ve otantik iş yeri dinamiklerini gösteren Slack akışları), kazınmış kamuya açık web'de kıt hale gelen türden organik konuşma verilerini sunuyor.
Bu hassas işlemleri yürütmek için yeni bir aracı firma ekosistemi ortaya çıktı. En sık adı geçen iki firma: Mercor ve SimpleClosure .
Reuters'ın 2024'te bildirdiği daha geniş piyasa oranları, birim başına değer hakkında fikir veriyor: metin için yaklaşık kelime başına 0,001 dolar, görsel başına 1 ila 2 dolar, kısa video başına 2 ila 4 dolar ve uzun film veya video saati başına 100 ila 300 dolar .
Bir startup kapanış firması olan SimpleClosure, geçtiğimiz yıl içinde şirket başına 10.000 ila 100.000 dolar arasında değişen ödemelerle yaklaşık 100 işlem gerçekleştirdi . Firmanın 'Varlık Hub' platformu, kurucuların verileri lisanslamadan önce kişisel olarak tanımlanabilir bilgileri (PII) temizlemesine yardımcı oluyor; ancak bu anonimleştirmenin etkinliği ve tutarlılığı belirsizliğini koruyor ve giderek büyüyen bir tartışma konusu haline geliyor .
Yapay zeka şirketlerinin eğitim verisi elde etmek için ne kadar ileri gideceği, Anthropic'in büyük bir kitap eğitim veri seti oluşturmaya yönelik gizli dahili programı Project Panama'nın olağanüstü davasında gözler önüne serildi .
Projenin iki ayağı vardı. İlk olarak, Anthropic fiziksel basılı kitaplar satın aldı, ciltlerini kesti ve sayfa sayfa yıkıcı bir şekilde taradı, bunları aranabilir PDF'lere dönüştürdü ve kağıt orijinallerini çöpe attı. Hedef: Altı ayda 2 milyona kadar kitabı dönüştürmekti . Dahili bir not, 'bunun üzerinde çalıştığımızın bilinmesini istemediğimiz için' bir kod adı kullanılmasını tavsiye ediyordu .
İkinci olarak, şirket, LibGen ve Pirate Library Mirror gibi gölge kütüphanelerden 7 milyondan fazla korsan e-kitap dosyası indirdi . Bu durum, 2024'te yazarlar Andrea Bartz, Kirk Wallace Johnson ve Charles Graeber tarafından Anthropic'i Claude'u eğitmek için yaklaşık yarım milyon korsan kitap kullanmakla suçlayan bir toplu davaya yol açtı .
20 Temmuz 2026'da, San Francisco'da bir federal yargıç, ABD tarihindeki en büyük telif hakkı ödemesi olan 1.5 milyar dolarlık bir anlaşmayı onayladı . Davaya dahil olan 500.000'den fazla yazar ve yayıncı, uygun eser başına tahmini 3.000 dolar alacak .
Mahkeme, yapay zeka eğitimi için büyük önem taşıyan yasal bir ayrım yaptı. Korsan e-kitapların kullanılması ihlaldi ve anlaşmayı tetikledi. Ancak, fiziksel kitapları satın alıp yıkıcı bir şekilde dahili olarak taramak için eğitimin, mahkemenin 'son derece dönüştürücü' olarak nitelendirdiği bir süreçte her fiziksel kopyanın tek bir dijital kopyayla değiştirilmesi nedeniyle potansiyel olarak adil kullanım olarak nitelendirilebileceğine karar verdi . 1.5 milyar dolar, korsan kitap yükümlülüğünü kapsıyordu; fiziksel imha programı cezalandırılmadı .
Şirketler dahili verileri nakde dönüştürmek için yarışırken, önemli sorular devam ediyor. SimpleClosure gibi komisyoncular tarafından yapılan veri anonimleştirmesinin etkinliği belirsiz ve giderek büyüyen bir tartışma konusu . Çalışan Slack mesajları ve e-postaları derin kişisel ve hassas bilgiler içeriyor ve mevcut temizleme tekniklerinin yeniden tanımlamayı önlemek için yeterli olup olmadığı net değil.
Bu arada, eğitim maliyetleri hızla artıyor. Tek bir GPT-4 ölçeğinde eğitim çalışması halihazırda 100 milyon dolara veya daha fazlasına mal olabiliyor . Yüksek kaliteli kamuya açık veriler tükenirken, özel kurumsal verileri lisanslamanın, Anthropic'in 1.5 milyar doları gibi önemli anlaşmaları ödemenin ve sentetik veri hatları oluşturmanın birleşik maliyetleri önemli ölçüde artıyor. Daha geniş yapay zeka eğitim veri seti pazarının, insan metni lisanslamasının resmileşmiş bir varlık sınıfı haline gelmesiyle, tahmini 2025'te 3.6 milyar dolardan 2034'e kadar 23 milyar dolara hızla büyümesi bekleniyor .
Bireysel kullanıcılar için manzara değişti. 2025'in sonları itibarıyla, hem OpenAI hem de Anthropic, kullanıcılar aktif olarak devre dışı bırakmadığı sürece, tüketici düzeyindeki sohbetlerde (ChatGPT Ücretsiz ve Plus, Claude Ücretsiz, Pro ve Max) eğitime izin vermek için varsayılan politikalarını değiştirdi . Kurumsal ve API müşterileri, sözleşmeye dayalı Veri İşleme Anlaşmaları (DPA) kapsamında varsayılan olarak eğitimin dışında tutuluyor
.
Mesaj açık: Yapay zekanın insan yapımı verilere olan doyumsuz açlığını besleme yarışında, kamusal ile özel, kişisel ile ticari arasındaki sınırlar, her bir Slack arşiviyle birlikte yeniden çiziliyor.