AI firmy podle dostupných zpráv vyhledávají také vyprodané, odborné a obtížně dostupné tituly. Zájem se soustředí mimo jiné na knihy vydané před rokem 2022, protože jejich text měl vzniknout ještě před masovým rozšířením generativní AI. Pro trénování modelů tak představují zdroj lidského psaní, který není tolik zatížen později vzniklým strojově generovaným obsahem .
Jedním z konkrétních případů je Pieter de Vries, antikvář z Haarlemu a spolumajitel obchodu De Vries & De Vries. Obdržel e-mail od osoby, která se představila jako „Natalia“ nebo „Nataly“ a uvedla, že pracuje pro singapurskou společnost 2077AI.
Zpráva obsahovala tabulku s více než 3 000 ISBN. Šlo převážně o úzce zaměřené akademické a obskurní tituly. De Vries měl knihy vyhledat, připravit cenové nabídky a odhadnout náklady na jejich odeslání do Číny .
Požadavek nejprve považoval za spam nebo phishing a nevěnoval mu pozornost. Podobné objednávky ale následně zaznamenali také prodejci použitých knih v Nizozemsku, Německu, Švýcarsku a Španělsku. Podle dostupných zjištění mohly tyto nákupy sloužit jako prostřední článek mezi evropskými prodejci a americkými AI laboratořemi .
O operaci Anthropic se veřejnost dozvěděla z více než 4 000 stran soudních materiálů odtajněných ve sporu Bartz v. Anthropic . Projekt Panama měl začít na začátku roku 2024. Jeho cílem bylo vybudovat rozsáhlý soukromý digitální korpus pro trénování Clauda.
Podle dokumentů Anthropic utratil desítky milionů dolarů za nákup milionů fyzických knih. Ty měly být mechanicky rozřezány, stránka po stránce naskenovány a následně zničeny . Interní plánovací dokument z roku 2024, odtajněný v lednu 2026, popsal ambici projektu slovy: „Project Panama is our effort to destructively scan all the books in the world“ – tedy „Projekt Panama je naše snaha destruktivně naskenovat všechny knihy na světě“ .
Návrhy dodavatelů počítaly s kapacitou zhruba 500 000 až 2 miliony knih během šesti měsíců. Přesný konečný počet zpracovaných svazků není ve zveřejněných materiálech jednoznačně uveden, dokumenty však opakovaně popisují nákup a likvidaci milionů knih .
Dne 23. června 2025 rozhodl federální soudce William Alsup u okresního soudu pro severní okres Kalifornie ve věci Bartz v. Anthropic, že použití legálně získaných knih k trénování AI modelů představuje podle amerického autorského práva fair use, tedy zákonem uznané oprávněné užití .
Soud označil trénování modelů za „quintessentially transformative“ – mimořádně transformativní využití. Prakticky to znamenalo, že pokud společnost získá fyzické kopie knih legálně, může je za daných okolností digitalizovat a využít pro trénování modelu. Samotné nahrazení zakoupených papírových exemplářů vyhledávatelnou digitální kopií soud rovněž považoval za fair use .
Rozhodnutí ale nebylo bezvýhradným vítězstvím Anthropic. Soud odmítl zjednodušeně uzavřít otázku kopií získaných z pirátských zdrojů a uvedl, že stažení knih z pirátských webů fair use nepředstavuje . Právě tato část sporu se stala důležitou pro následné finanční vyrovnání.
V červenci 2026 federální soud v San Francisku schválil dohodu o narovnání ve výši 1,5 miliardy dolarů v hromadné žalobě Bartz v. Anthropic. Žalobu podali autoři včetně Andrey Bartz a Charlese Graebera .
Částka nesouvisela s tím, že by soud označil samotné skenování legálně zakoupených knih za nezákonné. Tato praxe naopak v klíčovém rozhodnutí z roku 2025 získala ochranu fair use. Předmětem sporu však byly také pirátské kopie knih a jejich uchovávání, které soud posuzoval odlišně .
Případ ukazuje na vznikající sekundární trh s tištěnými knihami určenými nikoli čtenářům, ale jako datový materiál pro velké jazykové modely – tedy systémy typu Claude, které se učí vytvářet text na základě rozsáhlých jazykových korpusů.
AI společnosti při nákupech využívají třetí strany a prostředníky. Zmiňována je například společnost ISBNdb, která provozuje databázi ISBN a může pomáhat s vyhledáváním titulů i anonymizovanými objednávkami. Takový model umožňuje zadávat nákupy v řádu stovek tisíc knih, aniž by prodejce okamžitě znal skutečného koncového odběratele .
Knihy pak mohou putovat do logistických nebo zpracovatelských center, mimo jiné do Číny či jiných míst, kde probíhá jejich rozebrání a skenování .
Největší obavy se týkají knih, jejichž fyzických exemplářů existuje jen několik. Archiváři, knihovníci a prodejci vzácných knih upozorňují, že destruktivní skenování může znamenat trvalou ztrátu posledních dostupných kopií odborných nebo dávno vyprodaných děl .
Technicky přitom existují i šetrnější metody. Například systém Treventus ScanRobot dokáže podle dostupných zpráv digitalizovat křehké knihy rychlostí až 2 500 stran za hodinu, aniž by je zničil. Při průmyslovém měřítku je však rozřezání vazby a rychlý průchod volných listů skenerem levnější a efektivnější .
Tím vzniká zásadní paradox: text může být zachován v digitální podobě, ale fyzická kniha, která ho nesla, zmizí. U běžně dostupného titulu může jít především o ekologickou a kulturní otázku. U vzácného akademického díla s několika posledními exempláři už ale může být ztráta nevratná – i když jeho obsah dál existuje v interním datovém korpusu AI společnosti .