Tra i titoli più ricercati ci sono opere accademiche di nicchia, libri esauriti e pubblicazioni precedenti al 2022. Secondo le ricostruzioni disponibili, questi testi sono considerati preziosi perché precedono la diffusione dei contenuti generati dall’IA e offrono quindi materiale scritto prevalentemente da autori umani .
Uno dei casi che ha attirato l’attenzione è quello di Pieter de Vries, libraio antiquario della De Vries & De Vries di Haarlem, nei Paesi Bassi.
De Vries ha ricevuto un’e-mail da una persona che si presentava come “Natalia” o “Nataly”, collegata alla società 2077AI, con sede a Singapore. In allegato c’era un foglio di calcolo contenente oltre 3.000 codici ISBN, soprattutto di titoli accademici poco conosciuti. Il messaggio chiedeva di reperire i libri, preparare un preventivo e stimare i costi di spedizione verso la Cina .
Il libraio inizialmente aveva liquidato la richiesta come spam o tentativo di phishing. In seguito, richieste molto simili sono state segnalate da commercianti di libri usati nei Paesi Bassi, in Germania, Svizzera e Spagna. Le indagini hanno fatto ipotizzare che una parte di questi ordini fosse destinata a laboratori di IA statunitensi .
I documenti desecretati nella causa per violazione del copyright Bartz v. Anthropic hanno rivelato l’esistenza di un’iniziativa interna chiamata Project Panama, avviata all’inizio del 2024 .
Secondo i documenti, Anthropic ha speso decine di milioni di dollari per acquistare milioni di libri cartacei, rimuoverne meccanicamente le rilegature, scansionarne ogni pagina e distruggere gli originali. L’obiettivo era creare una raccolta digitale privata e di alta qualità per addestrare Claude .
Un documento di pianificazione del 2024, reso pubblico nel gennaio 2026, descriveva il progetto con una frase particolarmente ambiziosa: «Project Panama è il nostro tentativo di scansionare in modo distruttivo tutti i libri del mondo» .
Le proposte dei fornitori indicavano una capacità compresa tra 500.000 e 2 milioni di libri in circa sei mesi. Il progetto è stato ricostruito attraverso più di 4.000 pagine di atti giudiziari .
Il 23 giugno 2025 il giudice distrettuale statunitense William Alsup, del tribunale federale del Northern District of California, si è pronunciato sulla causa Bartz v. Anthropic .
La decisione ha stabilito che l’uso di libri acquistati legalmente per addestrare modelli di IA è “quintessentially transformative”, cioè profondamente trasformativo, e rientra nella dottrina del fair use prevista dal diritto d’autore statunitense .
In termini pratici, la sentenza ha considerato lecita la trasformazione di copie cartacee acquistate regolarmente in copie digitali destinate all’addestramento. Il principio, però, non equivale a un’autorizzazione generale a usare qualsiasi libro: il giudice ha distinto le copie comprate legalmente da quelle ottenute attraverso siti pirata o “biblioteche ombra”.
Su questo secondo punto, il tribunale non ha concesso il giudizio sommario ad Anthropic e ha stabilito che il download e la conservazione di copie piratate non costituiscono fair use .
Nel luglio 2026 un giudice federale di San Francisco ha approvato un accordo collettivo da 1,5 miliardi di dollari nella causa Bartz v. Anthropic .
La class action era stata avviata da autori tra cui Andrea Bartz e Charles Graeber, insieme ad altri titolari di diritti. L’accordo è arrivato dopo la decisione del 2025, che aveva ritenuto legale l’addestramento basato su libri acquistati regolarmente, ma aveva lasciato aperte le contestazioni relative al materiale piratato .
Il caso mostra quindi una distinzione importante: la sentenza favorevole ad Anthropic riguardava alcuni aspetti centrali dell’addestramento e della digitalizzazione, mentre la controversia sulle copie ottenute illegalmente ha avuto conseguenze economiche molto più pesanti.
Intorno alla richiesta di dati per l’addestramento degli LLM si è sviluppato un vero mercato secondario per l’approvvigionamento di libri.
I grandi operatori dell’IA si affidano a servizi intermediari di terze parti, tra cui la società di database ISBNdb, per effettuare ordini anonimi di centinaia di migliaia di volumi. In questo modo l’identità del compratore finale rimane schermata .
Le richieste ricevute dai librai europei sono spesso molto simili tra loro e riguardano opere specialistiche, rare o non più ristampate. I libri vengono quindi trasferiti verso centri logistici e di lavorazione, talvolta in Cina o in altre località, dove avviene la scansione distruttiva .
La principale preoccupazione di bibliotecari, archivisti e librai antiquari non riguarda soltanto il copyright. È anche una questione di conservazione della memoria culturale.
Quando viene acquistata e distrutta l’ultima, o una delle pochissime copie rimaste, di un testo raro, la digitalizzazione può preservarne il contenuto per un modello privato, ma non garantisce che il libro resti accessibile a studiosi, biblioteche o lettori.
Esistono metodi di digitalizzazione non distruttivi, progettati per mantenere intatto il volume. Sistemi come il Treventus ScanRobot, per esempio, possono acquisire libri fragili senza danneggiarli, arrivando — secondo le fonti citate — a 2.500 pagine all’ora . Tuttavia, le procedure distruttive sono più economiche e più semplici da scalare quando l’obiettivo è trattare milioni di copie.
Il risultato è un paradosso: un libro può sopravvivere come insieme di dati, ma scomparire come oggetto fisico. Per opere accademiche oscure e fuori catalogo, di cui esistono soltanto pochi esemplari conosciuti, la perdita può essere irreversibile .