Resultatet er en fysisk bok omgjort til maskinlesbar tekst, mens selve eksemplaret forsvinner. Det skiller seg vesentlig fra å kjøpe bøker for videresalg, lagring eller utsendelse til kunder.
Undersøkelsen gir dermed tegn på en omfattende innkjøps- og digitaliseringslinje for bøker. Den fastslår likevel ikke hvor mange bøker som totalt er involvert, eller hvilken konkret Amazon-modell som eventuelt er trent på materialet.
Amazon opplyste at selskapet kjøper bøker «for å forbedre produktene våre». Ifølge 404 Media ville selskapet ikke oppgi hvor mange bøker det kjøper, hvor mange anlegg som skanner dem, hvilke produkter som bruker materialet, eller om prosessen i Las Vegas spesifikt brukes til å trene AI-modeller.
Dette skillet er viktig. 404 Medias materiale dokumenterer en forsendelse som ble sporet, en destinasjon inne på et Amazon-anlegg, en bokbehandlingsenhet og ansattes beskrivelser av skanning og destruksjon. Det er derimot ikke det samme som en full offentlig bekreftelse på at alle bøkene som behandles, blir treningsdata for en navngitt Amazon-modell.
Den mest presise konklusjonen er derfor også den smaleste: 404 Media fant tegn på en Amazon-operasjon for digitalisering av bøker som ser ut til å kunne brukes til innsamling av AI-data. Dette skjer samtidig som Amazon satser på utvikling av avanserte AI-modeller og datatjenester. Reuters har separat meldt at Amazon legger om AI-strategien og konsentrerer seg mer om et nytt frontier-modellprosjekt.
Bokhandlere fortalte 404 Media at enkelte storkjøp virket uvanlige. Bestillingene var ofte svært sammensatte og så ut til å ta liten hensyn til bøkenes videresalgsverdi, tilstand, tema eller pris.
En kjøper som vil selge bøker videre, må vanligvis vurdere etterspørsel og fortjenestemargin. En kjøper som vil bygge et treningsdatasett, kan derimot være mer opptatt av å skaffe et bredt utvalg titler og ISBN-numre – den internasjonale identifikatoren som brukes for å katalogisere bøker.
Dette har fått bokhandlere til å frykte at AI-selskaper eller databrokere forsøker å arbeide seg gjennom den utgitte bokkatalogen, i stedet for å velge ut titler som har høy kommersiell verdi. 404 Media skrev tidligere at ISBNdb markedsførte innkjøp av store mengder trykte bøker til AI-selskaper. Etter omtalen fjernet ISBNdb det relevante materialet og sa at nettsiden hadde vært en «test av markedsinteressen».
Det er ikke bevist at alle uvanlige bestillinger har forbindelse til Amazon eller AI. Men mønsteret viser hvorfor markedet er vanskelig for bokhandlere å tolke: En tilfeldig sammensatt ordre kan gi liten mening som en vanlig detaljhandelstransaksjon, men større mening som et forsøk på å gjøre et datasett så bredt som mulig.
Trykte bøker inneholder store mengder menneskeskapt språk fra før generativ AI begynte å fylle nettet med syntetisk tekst. Eldre og utgåtte bøker kan dessuten romme spesialisert, lokal eller historisk kunnskap som aldri er gjort lett tilgjengelig på nettet.
Det gjør fysiske bøker til en potensiell kilde til tekst som både er bred og mindre preget av AI-generert innhold. I omtalen av ISBNdb beskrev 404 Media gamle bøker som attraktive blant annet fordi de er fri for det som ofte kalles «AI-slop» – masseprodusert og lavkvalitets AI-tekst.
Forskere og utviklere diskuterer også «model collapse», altså muligheten for at gjentatt trening på syntetisk materiale kan svekke kvaliteten eller mangfoldet i senere modeller. Bekymringen kan forklare interessen for eldre, menneskeskapt materiale, men den er ikke bevis på at Amazons modeller har opplevd modellkollaps – eller at bøkene fra Las Vegas ble samlet inn av nettopp denne grunnen.
Den beskrevne Amazon-prosessen minner om Anthropics Project Panama. I dette prosjektet kjøpte Anthropic fysiske bøker, fjernet innbindingene, skannet sidene og kastet papireksemplarene for å lage digitalt materiale til AI-arbeidet sitt.
I en kjennelse datert 23. juni 2025 i saken Bartz v. Anthropic skrev dommer William Alsup at bruken av bøkene til trening av Claude og forgjengerne var «svært transformativ» og utgjorde «fair use» etter amerikansk opphavsrett. Han vurderte også digitalisering av lovlig kjøpte papirbøker som «fair use», fordi Anthropic erstattet de kjøpte fysiske eksemplarene med tilsvarende, søkbare digitale kopier til et internt bibliotek.
Kjennelsen sa ikke at det automatisk er lovlig å ødelegge en bok for å trene AI. Hvordan bøkene ble anskaffet, hva materialet ble brukt til, om kopier ble beholdt eller distribuert, og de øvrige omstendighetene var fortsatt avgjørende. Retten behandlet Anthropics separate oppbygging av et bibliotek basert på piratkopierte bøker annerledes.
Det juridiske skillet er sentralt også i Amazon-saken. Selv om Amazon kjøper bøker på lovlig vis, er spørsmål om omfanget, bruken av skanningen, avtaler med forfattere og forlag, samt bevaringen av sjeldne fysiske verk, noe annet enn den avgrensede «fair use»-vurderingen i Bartz.
Bokhandlernes innvendinger handler ikke bare om tapte salg eller betaling for opphavsrett. Sjeldne og utgåtte bøker kan ha historisk, intellektuell, kulturell og sentimental verdi. Når et sjeldent eksemplar skjæres opp og resirkuleres, kan teksten overleve som en skanning – men selve kulturminnet er borte.
Det skaper et bevaringsproblem som en opphavsrettsavgjørelse ikke nødvendigvis svarer på. En prosess kan være juridisk forsvarlig under ett sett omstendigheter og likevel vekke uro hos samlere, bokhandlere, biblioteker og lesere som ser bøker som mer enn beholdere for tekst.
Saken viser også en tydelig skjevhet i informasjonen som er tilgjengelig. AI-selskaper kan forstå dataverdien i obskure bøker lenge før den enkelte selger innser at en merkelig storkjøpsordre inngår i en større innkjøpsstrategi.
Amazons uttalelse om at selskapet kjøper bøker for å forbedre produktene, lar derfor de mest praktiske spørsmålene stå åpne: Hvor omfattende er innkjøpene? Hva blir skannet? Og hva skjer med filene etterpå?
Den angivelige bokoperasjonen passer inn i Amazons bredere forsøk på å konkurrere innen avansert AI. Reuters meldte i juli 2026 at Amazon trappet ned flere av selskapets egne modeller og samlet ressursene rundt et nytt frontier-modellprosjekt.
AWS markedsfører også Nova Forge, en tjeneste som lar kunder kombinere egne data med treningsdata kuratert av Amazon når de utvikler tilpassede frontier-modeller.
Dette gir Amazon en strategisk grunn til å verdsette tekstdata av høy kvalitet, men beviser ikke i seg selv at bøkene 404 Media sporet, ble brukt til å trene en bestemt modell. De sterkeste bevisene gjelder fortsatt den direkte rapporteringen om forsendelsen og anlegget i Las Vegas.
Det store spørsmålet er dermed om bokmarkedet er i ferd med å bli en usynlig forsyningskjede for AI. 404 Medias undersøkelse tyder på at bøker i minst ett dokumentert tilfelle gikk fra en bokhandler til en Amazon-enhet der de ble skannet og destruert. Hvor stor virksomheten er, og hva filene brukes til videre, er fortsatt ukjent.