Epoch AI anslår at den totale mengden tilgjengelig, offentlig menneskeskrevet tekst er omtrent 300 billioner tokens, og at dette lageret kan være tomt mellom 2026 og 2032, med et medianestimat på 2028. OpenAI og Anthropic kjøper nå interne Slack arkiver, e poster, møteopptak og kodehistorikk fra oppstartsbedrifter f...
Research answer

Create a landscape editorial hero image for this Studio Global article: What are the key details about OpenAI and Anthropic purchasing internal corporate data — including employee chats, emails, video recordings,. Article summary: I'll research this thoroughly across multiple angles. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Det offentlige internettet holder på å gå tom for ren menneskeskrevet tekst, og verdens ledende AI-laboratorier kappes om en ny drivstoffkilde: dine interne bedriftskommunikasjoner. OpenAI og Anthropic kjøper nå aggressivt Slack-meldinger, e-poster, videoopptak og kodehistorikk fra oppstartsbedrifter – og betaler opptil 300.000 dollar per avtale i et stille, men raskt voksende marked for proprietære menneskelige interaksjonsdata .
Drivet mot bedriftsdata handler om en enkel, uunngåelig regnskapsmessig utfordring. Det mest siterte anslaget, fra forskningsgruppen Epoch AI, plasserer den totale mengden høyverdig offentlig menneskeskrevet tekst på omtrent 300 billioner tokens (90% konfidensintervall: 100 billioner til 1 000 billioner) . Ved dagens forbrukstakt for trening av avanserte modeller er dette lageret anslått å være uttømt mellom 2026 og 2032, med et medianestimat på 2028
. Noen analyser tyder på at høykvalitets menneskeskrevet tekst på det åpne nettet kan være så lite som 15–20 billioner tokens, noe som vil føre til uttømming allerede i 2026
. PBS rapporterte i slutten av 2025 at «gullrushet» etter treningsdata til chatroboter kunne ta slutt i 2026
.
Ettersom denne grensen nærmer seg, har OpenAI og Anthropic vendt oppmerksomheten mot en tidligere uutnyttet skatt: interne bedriftsdata . Oversikter over levende menneskelige interaksjoner – e-poster med forhandlinger, møtereferater med samtidige beslutninger og Slack-tråder som viser autentiske arbeidsdynamikker – tilbyr den typen organisk samtaledata som er blitt svært sjelden på det skrapte offentlige nettet.
Et nytt økosystem av mellomleddselskaper har oppstått for å mekle i disse sensitive transaksjonene. To navn dukker opp oftest: Mercor og SimpleClosure .
Generelle markedspriser, rapportert av Reuters i 2024, gir en pekepinn på verdien per enhet: omtrent 0,001 dollar per ord for tekst, 1 til 2 dollar per bilde, 2 til 4 dollar per kort video og 100 til 300 dollar per time for lengre film eller video .
SimpleClosure, et avviklingsselskap for oppstartsbedrifter, har gjennomført nærmere 100 slike transaksjoner det siste året, med utbetalinger fra 10.000 til 100.000 dollar per selskap . Selskapets «Asset Hub»-plattform hjelper gründere med å rense personidentifiserende informasjon (PII) fra dataene før de lisensieres – selv om effektiviteten og konsistensen av denne anonymiseringen er usikker og blir et stadig mer omstridt tema .
Hvor langt AI-selskaper er villige til å gå for å sikre treningsdata, ble tydelig i den ekstraordinære saken om Project Panama, Anthropics hemmelige interne program for å bygge et massivt boktreningsdatasett .
Prosjektet hadde to spor. For det første kjøpte Anthropic fysiske trykte bøker, kuttet av ryggene og skannet dem destruktivt side for side, omgjorde dem til søkbare PDF-er og kastet papiroriginalene. Målet: å konvertere opptil 2 millioner bøker på seks måneder . En intern memo anbefalte å bruke et kodenavn «fordi vi ikke vil at det skal bli kjent at vi jobber med dette» .
For det andre lastet selskapet ned mer enn 7 millioner piratkopierte ebokfiler fra skyggebiblioteker som LibGen og Pirate Library Mirror . Dette sporet førte til et gruppesøksmål innlevert i 2024 av forfatterne Andrea Bartz, Kirk Wallace Johnson og Charles Graeber, som anklaget Anthropic for å ha brukt nærmere en halv million piratkopierte bøker for å trene Claude .
Den 20. juli 2026 godkjente en føderal dommer i San Francisco et forlik på 1,5 milliarder dollar – den største kjente opphavsrettsutbetalingen i USAs historie . Mer enn 500.000 forfattere og utgivere var en del av gruppesøksmålet, og de vil motta anslagsvis 3.000 dollar per kvalifisert verk .
Viktigere: Retten trakk et juridisk skille med store implikasjoner for AI-trening. Å bruke piratkopierte ebøker var krenkende og utløste forliket. Men å kjøpe fysiske trykte bøker og destruktivt skanne dem internt for trening ble ansett for potensielt å kvalifisere som rettferdig bruk (fair use), fordi hvert fysiske eksemplar ble erstattet med en enkelt digital kopi i en prosess retten kalte «svært transformerende» . De 1,5 milliarder dollarene dekket ansvaret for de piratkopierte bøkene; det fysiske destruksjonsprogrammet ble ikke straffet .
Ettersom selskaper kappes om å tjene penger på interne data, gjenstår betydelige spørsmål. Effektiviteten av dataanonymisering utført av mellommenn som SimpleClosure er usikker og blir et stadig mer omstridt tema . Slack-meldinger og e-poster fra ansatte inneholder dypt personlig og sensitiv informasjon, og det er uklart om dagens renseteknikker er tilstrekkelige for å forhindre re-identifisering.
Samtidig øker treningskostnadene. En enkelt treningskjøring på GPT-4-skala kan allerede koste 100 millioner dollar eller mer. Etter hvert som høykvalitets offentlige data tar slutt, øker de kombinerte kostnadene ved å lisensiere proprietære bedriftsdata, betale milepælsforlik som Anthropics på 1,5 milliarder dollar, og bygge syntetiske datapipelines dramatisk. Det bredere AI-treningsdatamarkedet anslås å vokse raskt, fra anslagsvis 3,6 milliarder dollar i 2025 til 23 milliarder dollar innen 2034, ettersom lisensiering av menneskelig tekst blir en formalisert aktivaklasse .
For individuelle brukere har landskapet endret seg. Fra slutten av 2025 endret både OpenAI og Anthropic standardinnstillingene slik at de kan trene på forbrukernivå-chatter (ChatGPT Free og Plus, Claude Free, Pro og Max) med mindre brukeren aktivt reserverer seg . Bedrifts- og API-kunder er fortsatt unntatt fra trening som standard i henhold til kontraktsfestede databehandleravtaler (DPA)
.
Budskapet er klart: I kappløpet om å mette AIs umettelige sult etter menneskeskapte data, blir grensene mellom offentlig og privat, personlig og kommersiell, tegnet på nytt – ett Slack-arkiv av gangen.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Epoch AI anslår at den totale mengden tilgjengelig, offentlig menneskeskrevet tekst er omtrent 300 billioner tokens, og at dette lageret kan være tomt mellom 2026 og 2032, med et medianestimat på 2028.
Epoch AI anslår at den totale mengden tilgjengelig, offentlig menneskeskrevet tekst er omtrent 300 billioner tokens, og at dette lageret kan være tomt mellom 2026 og 2032, med et medianestimat på 2028. OpenAI og Anthropic kjøper nå interne Slack arkiver, e poster, møteopptak og kodehistorikk fra oppstartsbedrifter for opptil 300.000 dollar per avtale.
Anthropics hemmelige «Project Panama» – der de kjøpte og destruktivt skannet fysiske bøker og samtidig lastet ned millioner av piratkopierte ebøker – endte med et forlik på 1,5 milliarder dollar, det største kjente op...