Con questo soffitto sempre più vicino, OpenAI e Anthropic hanno puntato la loro attenzione su un tesoro fino ad ora inesplorato: i dati interni della collaborazione aziendale . I documenti delle interazioni umane in tempo reale – email contenenti trattative, trascrizioni di riunioni con processi decisionali dal vivo e thread Slack che mostrano dinamiche lavorative autentiche – offrono quel tipo di dati conversazionali organici che sono diventati rari sul web pubblico raschiato.
Un nuovo ecosistema di aziende intermediarie è sorto per gestire queste transazioni delicate. Due nomi compaiono con maggiore frequenza: Mercor e SimpleClosure .
I tassi di mercato più ampi, riportati da Reuters nel 2024, offrono un'idea del valore per unità: circa $0,001 per parola per il testo, da 1 a 2 dollari per immagine, da 2 a 4 dollari per video breve, e da 100 a 300 dollari l'ora per filmati o video più lunghi .
SimpleClosure, un'impresa di liquidazione di startup, ha gestito quasi 100 transazioni di questo tipo nell'ultimo anno, con pagamenti che vanno da 10.000 a 100.000 dollari per azienda . La sua piattaforma "Asset Hub" aiuta i fondatori a ripulire i dati dalle informazioni personali identificabili (PII) prima di concederli in licenza – anche se l'efficacia e la coerenza di questa anonimizzazione rimangono incerte e sono un punto di contesa crescente .
Le lunghezze che le aziende AI sono disposte a percorrere per assicurarsi dati di addestramento sono state messe a nudo nel caso straordinario del Progetto Panama, il programma interno segreto di Anthropic per costruire un massiccio dataset di addestramento basato su libri .
Il progetto aveva due binari. Primo, Anthropic ha acquistato libri fisici, ha tagliato le loro rilegature e li ha scansionati in modo distruttivo pagina per pagina, convertendoli in PDF ricercabili e buttando via gli originali cartacei. L'obiettivo: convertire fino a 2 milioni di libri in sei mesi . Un memo interno consigliava di usare un nome in codice "perché non vogliamo che si sappia che stiamo lavorando a questo" .
Secondo, l'azienda ha scaricato più di 7 milioni di file di ebook piratati da biblioteche ombra tra cui LibGen e Pirate Library Mirror . Questo secondo binario ha portato a una causa collettiva presentata nel 2024 dagli autori Andrea Bartz, Kirk Wallace Johnson e Charles Graeber, che hanno accusato Anthropic di aver usato quasi mezzo milione di libri piratati per addestrare Claude .
Il 20 luglio 2026, un giudice federale di San Francisco ha approvato una transazione da 1,5 miliardi di dollari – il più grande risarcimento per violazione del diritto d'autore mai conosciuto nella storia degli Stati Uniti . Più di 500.000 autori ed editori facevano parte della causa collettiva e riceveranno una stima di 3.000 dollari per opera idonea .
Fondamentalmente, il tribunale ha tracciato una distinzione legale con implicazioni enormi per l'addestramento dell'AI. L'uso di ebook piratati era illecito e ha innescato la transazione. Ma l'acquisto di libri fisici e la loro scansione distruttiva interna per l'addestramento è stato giudicato potenzialmente qualificabile come fair use, poiché ogni copia fisica è stata sostituita con una singola copia digitale in un processo che il tribunale ha definito "estremamente trasformativo" . Il miliardo e mezzo ha coperto la responsabilità per i libri piratati; il programma di distruzione fisica non è stato penalizzato .
Mentre le aziende si affrettano a monetizzare i dati interni, rimangono domande significative. L'efficacia dell'anonimizzazione dei dati da parte di broker come SimpleClosure è incerta e rappresenta un punto di contesa crescente . I messaggi Slack e le email dei dipendenti contengono informazioni profondamente personali e sensibili, e non è chiaro se le attuali tecniche di stripping siano sufficienti a prevenire la re-identificazione.
Nel frattempo, i costi di addestramento stanno esplodendo. Un singolo ciclo di addestramento su scala GPT-4 può già costare 100 milioni di dollari o più . Con l'esaurirsi dei dati pubblici di alta qualità, i costi combinati di licenza per dati aziendali proprietari, pagamento di transazioni epocali come quella da 1,5 miliardi di dollari di Anthropic e la costruzione di pipeline di dati sintetici stanno tutti aumentando drasticamente. Il mercato più ampio dei dataset per l'addestramento AI è previsto in rapida crescita, da una stima di 3,6 miliardi di dollari nel 2025 a 23 miliardi di dollari entro il 2034, man mano che la licenza del testo umano diventa una classe di asset formalizzata .
Per i singoli utenti, il panorama è cambiato. A partire da fine 2025, sia OpenAI che Anthropic hanno modificato le loro politiche predefinite per consentire l'addestramento sulle chat a livello consumer (ChatGPT Free e Plus, Claude Free, Pro e Max) a meno che gli utenti non scelgano attivamente di rinunciare . I clienti enterprise e API rimangono esclusi dall'addestramento per impostazione predefinita in base ad accordi contrattuali di Data Processing Agreement (DPA)
.
Il messaggio è chiaro: nella corsa per alimentare l'insaziabile fame di dati generati dall'uomo dell'AI, i confini tra pubblico e privato, personale e commerciale, vengono ridisegnati – un archivio Slack alla volta.