W zakładzie przetwarzania książka trafia pod hydrauliczną gilotynę, która odcina grzbiet i rozdziela kartki. Luźne strony można następnie szybko przepuścić przez przemysłowy skaner. Po zakończeniu procesu papier jest niszczony lub przekazywany do recyklingu . W efekcie cyfrowa kopia pozostaje, ale fizyczny egzemplarz niekoniecznie.
Jednym z pierwszych sygnałów, że za masowymi zamówieniami może stać branża AI, była wiadomość otrzymana przez Pietera de Vriesa, antykwariusza z Haarlemu i współwłaściciela księgarni De Vries & De Vries.
Nadawczyni przedstawiająca się jako „Natalia” lub „Nataly”, związana z singapurską firmą 2077AI, przesłała mu arkusz zawierający ponad 3 tys. numerów ISBN. Większość pozycji stanowiły mało znane publikacje akademickie i specjalistyczne. De Vries miał wyszukać książki, przygotować wycenę oraz oszacować koszt wysyłki do Chin .
Antykwariusz uznał wiadomość za spam albo próbę phishingu. Z czasem podobne zapytania zaczęli zgłaszać sprzedawcy używanych książek z Holandii, Niemiec, Szwajcarii i Hiszpanii. Według relacji branżowych zamówienia mogły być elementem łańcucha dostaw kierującego książki do amerykańskich laboratoriów AI .
Odtajnione dokumenty z pozwu zbiorowego Bartz v. Anthropic ujawniły, że Anthropic rozpoczęła na początku 2024 roku poufną operację o nazwie Project Panama . Firma miała wydać dziesiątki milionów dolarów na zakup milionów drukowanych książek, odcięcie ich grzbietów, zeskanowanie każdej strony i zniszczenie oryginałów. Celem było stworzenie prywatnego, wysokiej jakości zbioru danych do trenowania Claude’a .
W dokumencie planistycznym z 2024 roku, odtajnionym w styczniu 2026 roku, zapisano: „Project Panama to nasza próba destrukcyjnego zeskanowania wszystkich książek na świecie” . Zakładano przetworzenie nawet 2 mln książek w ciągu sześciu miesięcy . Zakres operacji opisano w ponad 4 tys. stron dokumentów sądowych .
Nie oznacza to jednak, że potwierdzono fizyczne zniszczenie każdego rzadkiego lub bezcennego egzemplarza. Dokumenty pokazują przede wszystkim skalę planu, sposób pozyskiwania książek oraz przemysłowy charakter procesu.
23 czerwca 2025 roku sędzia William Alsup z Sądu Okręgowego dla Północnego Dystryktu Kalifornii wydał ważne orzeczenie w sprawie Bartz v. Anthropic. Uznał, że wykorzystanie legalnie nabytych książek do trenowania modeli AI ma charakter „wyjątkowo transformacyjny” i mieści się w amerykańskiej doktrynie fair use, czyli dozwolonego użytku .
W praktyce sąd przyjął, że firma może kupić egzemplarz książki, zdigitalizować go i wykorzystać do treningu modelu. Sama zamiana papierowej kopii na przeszukiwalny plik cyfrowy również została uznana za dozwolony użytek .
To rozstrzygnięcie dotyczy prawa Stanów Zjednoczonych i nie jest automatycznie zasadą obowiązującą w Polsce ani w całej Unii Europejskiej.
Sąd oddzielił jednak legalnie kupione książki od kopii pozyskanych z serwisów pirackich. W odniesieniu do tych materiałów Anthropic nie uzyskała korzystnego rozstrzygnięcia — pobieranie książek z pirackich źródeł nie zostało uznane za fair use .
W lipcu 2026 roku sąd federalny w San Francisco zatwierdził ugodę o wartości 1,5 mld dolarów w pozwie zbiorowym Bartz v. Anthropic. Sprawę wnieśli autorzy, między innymi Andrea Bartz i Charles Graeber .
Ugoda była następstwem postępowania, w którym sąd rozdzielił dwie kwestie: legalne nabywanie i skanowanie książek oraz przechowywanie i wykorzystywanie kopii pochodzących z pirackich źródeł. Samo orzeczenie z 2025 roku uznało podstawową praktykę kupowania książek i przekształcania ich na potrzeby treningu za legalną, ale spór obejmował także materiały zdobyte nielegalnie .
Wokół treningu dużych modeli językowych, czyli LLM, rozwinął się rynek hurtowego pozyskiwania książek. Firmy AI korzystają z pośredników, którzy składają anonimowe zamówienia na setki tysięcy egzemplarzy. Jednym z wymienianych w tym kontekście podmiotów jest baza ISBNdb, obsługująca dane o wydaniach i numerach ISBN .
Takie pośrednictwo utrudnia ustalenie, kto jest ostatecznym nabywcą. Sprzedawcy z Europy opisują bardzo podobne zapytania dotyczące dużych partii specjalistycznych książek. Zamówienia mogą następnie trafiać do centrów logistycznych i zakładów przetwarzania, między innymi w Chinach .
Dla firm technologicznych fizyczna książka jest przede wszystkim nośnikiem tekstu. Gdy ostatnia strona zostanie zeskanowana, papierowy egzemplarz przestaje być potrzebny. Dla antykwariuszy, bibliotekarzy i badaczy może jednak mieć wartość, której nie da się sprowadzić do samej treści odczytanej przez algorytm.
Archiwiści, bibliotekarze i handlarze starymi książkami ostrzegają, że destrukcyjne skanowanie może prowadzić do bezpowrotnego zniszczenia ostatnich fizycznych egzemplarzy rzadkich i wycofanych z obiegu prac akademickich .
Istnieją również metody niedestrukcyjnej digitalizacji. Specjalistyczne urządzenia, takie jak Treventus ScanRobot, mogą skanować delikatne książki bez rozcinania ich, choć rozwiązania tego typu są wolniejsze i droższe przy ogromnej skali . Według przywoływanych materiałów ScanRobot może digitalizować do 2500 stron na godzinę bez niszczenia książki .
Dylemat jest więc prosty, ale konsekwencje — poważne: przemysłowe cięcie i skanowanie pozwala szybko zgromadzić ogromny korpus danych, lecz w przypadku tytułów, których zachowało się zaledwie kilka egzemplarzy, może oznaczać nieodwracalną stratę dla kultury i nauki .