Mye av interessen gjelder bøker utgitt før 2022. De inneholder menneskeskrevet tekst fra før generativ AI ble vanlig, og blir derfor sett på som mer verdifulle treningsdata enn materiale fra et nett som allerede kan være fylt med AI-generert tekst .
Den nederlandske antikvarbokhandleren Pieter de Vries ved De Vries & De Vries i Haarlem fikk en e-post fra en person som presenterte seg som «Natalia» eller «Nataly». Avsenderen sa hun jobbet for det Singapore-baserte selskapet 2077AI.
Vedlagt lå et regneark med mer enn 3 000 ISBN-numre. Titlene var i hovedsak smale akademiske utgivelser og obskure fagbøker. De Vries ble bedt om å finne bøkene, lage pristilbud og beregne frakt til Kina .
Han avfeide først meldingen som spam eller et phishingforsøk. Senere viste det seg at bruktbokhandlere i Nederland, Tyskland, Sveits og Spania hadde mottatt svært like forespørsler. Bokhandlerne mistenkte at bøkene kunne være på vei videre til amerikanske AI-laboratorier .
Over 4 000 sider med rettsdokumenter i opphavsrettssaken Bartz v. Anthropic ga innblikk i Anthropics plan . Selskapet startet Project Panama tidlig i 2024 og brukte ifølge dokumentene titalls millioner dollar på å kjøpe millioner av fysiske bøker.
Bøkene skulle skjæres opp mekanisk, skannes side for side og ødelegges etterpå. Målet var å bygge et privat og høykvalitets digitalt treningskorpus for chatboten Claude .
Et internt planleggingsdokument fra 2024, offentliggjort i januar 2026, beskrev prosjektet slik: «Project Panama is our effort to destructively scan all the books in the world» .
Leverandørforslag og rettsdokumenter viste et mål om å behandle mellom 500 000 og 2 millioner bøker på rundt seks måneder. Dokumentene beskriver dermed en skala som langt overgår vanlig digitalisering i bibliotek eller arkiv .
Den 23. juni 2025 konkluderte den amerikanske distriktsdommeren William Alsup i Bartz v. Anthropic med at bruk av lovlig anskaffede bøker til trening av AI-modeller var «quintessentially transformative» – altså grunnleggende omformende – og dermed kunne regnes som fair use etter amerikansk opphavsrett .
Kjernen i avgjørelsen var at Anthropic hadde kjøpt de fysiske eksemplarene lovlig. Å gjøre dem om til søkbare digitale kopier og bruke innholdet i modelltrening kunne derfor være tillatt etter amerikansk rett .
Avgjørelsen ga imidlertid ikke selskapet frikort til alt. Dommeren avviste såkalt summary judgment for piratkopierte kopier og slo fast at nedlasting av bøker fra piratnettsteder ikke var fair use .
Det er også verdt å merke seg at avgjørelsen gjelder amerikansk lov. Den avgjør ikke automatisk hvordan tilsvarende praksis vil bli vurdert etter norsk eller europeisk opphavsrett.
I juli 2026 godkjente en føderal dommer i San Francisco et forlik på 1,5 milliarder dollar i gruppesøksmålet Bartz v. Anthropic. Forfattere som Andrea Bartz og Charles Graeber var blant dem som hadde saksøkt AI-selskapet .
Forliket kom etter dommerens avgjørelse i juni 2025. Den slo fast at kjernen i praksisen – skanning av lovlig kjøpte bøker – kunne være lovlig, men saken omfattet også anklager knyttet til piratkopiert materiale .
Dermed ble saken både en viktig seier for AI-selskaper i spørsmålet om modelltrening og en alvorlig påminnelse om at måten treningsdataene skaffes på, fortsatt kan utløse betydelig juridisk ansvar.
Rundt behovet for treningsdata har det vokst frem et sekundærmarked for masseinnkjøp av bøker. AI-leverandører bruker tredjepartstjenester – blant annet ISBN-databaseselskapet ISBNdb – til å legge inn anonyme bestillinger på hundretusener av bøker. Slik skjules identiteten til den endelige kjøperen .
Bokhandlere i flere europeiske land forteller om forespørsler som ligner hverandre påfallende mye. Bøkene sendes videre til knutepunkter, blant annet i Kina eller andre behandlingssentre, der de kan bli skannet og ødelagt .
For bokhandleren kan en slik ordre se ut som et lukrativt massesalg. Men når formålet ikke er lesing, samling eller bibliotekdrift, men datautvinning, blir bøkene i praksis forbruksvarer: Verdien varer bare til den siste siden er skannet.
Arkivarer, bibliotekarer og forhandlere av sjeldne bøker advarer om at de siste fysiske eksemplarene av enkelte utgåtte akademiske titler kan bli ødelagt .
Det finnes skånsommere alternativer. Ikke-destruktiv digitalisering bruker for eksempel bokholdere og overliggende skannere som lar innbindingen være intakt. En maskin som Treventus ScanRobot er omtalt som i stand til å digitalisere opptil 2 500 sider i timen uten å skade boken .
Slike metoder er likevel langsommere og dyrere i stor skala. Industriell kutting og makulering er mer effektivt når målet er å behandle hundretusener eller millioner av bind – men etterlater ingen fysisk kopi når jobben er gjort .
For en bestselger finnes det gjerne mange eksemplarer. For en smal fagbok eller et verk som bare finnes i noen få kjente eksemplarer, er situasjonen en annen. Når den siste kopien blir skåret opp for å hente ut data, kan tapet bli både kulturelt og forskningsmessig uopprettelig .