Epoch AI schat dat de voorraad hoogwaardige openbare menselijke tekst ongeveer 300 biljoen tokens is, die naar verwachting tegen 2028 volledig is verbruikt. OpenAI en Anthropic betalen tot $300.000 voor Slack archieven, e mailcorpora en GitHub geschiedenissen van startups.
Research answer

Create a landscape editorial hero image for this Studio Global article: What are the key details about OpenAI and Anthropic purchasing internal corporate data — including employee chats, emails, video recordings,. Article summary: I'll research this thoroughly across multiple angles. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Het openbare internet raakt steeds meer door zijn voorraad schone, door mensen geschreven tekst heen. De toonaangevende AI-laboratoria ter wereld zoeken daarom koortsachtig naar een nieuwe brandstofbron: uw interne bedrijfscommunicatie. OpenAI en Anthropic kopen in toenemende mate Slack-berichten van werknemers, e-mails, video-opnames en codegeschiedenissen van startups op. Ze betalen daarvoor tot wel $300.000 per deal in een stille, maar snelgroeiende markt voor eigen menselijke interactiedata .
Deze push naar bedrijfsdata wordt gedreven door een eenvoudig, onontkoombaar wiskundig probleem. De meest geciteerde schatting van onderzoeksgroep Epoch AI stelt dat de totale voorraad hoogwaardige, door mensen gegenereerde openbare tekst ongeveer 300 biljoen tokens bedraagt (90%-betrouwbaarheidsinterval: 100 biljoen tot 1.000 biljoen) . Bij het huidige verbruik voor geavanceerde modellen zal die voorraad naar verwachting tussen 2026 en 2032 volledig zijn uitgeput, met een mediane schatting van 2028
. Sommige analyses suggereren dat hoogwaardige menselijke tekst op het open web slechts 15 tot 20 biljoen tokens bevat, wat uitputting al in 2026 mogelijk maakt
. PBS meldde eind 2025 dat de 'gold rush' voor chatbot-trainingsdata al in 2026 opgedroogd zou kunnen zijn
.
Nu die grens in zicht komt, hebben OpenAI en Anthropic hun aandacht gericht op een voorheen onaangesproken bron: interne bedrijfsdata . Documenten van live menselijke interacties—e-mails met onderhandelingen, transcripties van vergaderingen met besluitvorming in realtime, en Slack-threads die authentieke werkplekdynamiek tonen—bieden het soort organische conversatiedata dat schaars is geworden op het openbare web.
Er is een nieuw ecosysteem van tussenpersonen ontstaan om deze gevoelige transacties te bemiddelen. Twee namen duiken het vaakst op: Mercor en SimpleClosure .
Bredere markttarieven, gerapporteerd door Reuters in 2024, geven een idee van de waarde per eenheid: ongeveer $0,001 per woord voor tekst, $1 tot $2 per afbeelding, $2 tot $4 per korte video, en $100 tot $300 per uur voor langere film of video .
SimpleClosure, een startup-afwikkelingsbedrijf, heeft in het afgelopen jaar bijna 100 van dergelijke transacties verwerkt, met uitbetalingen variërend van $10.000 tot $100.000 per bedrijf . Het 'Asset Hub'-platform van het bedrijf helpt oprichters om persoonlijk identificeerbare informatie (PII) uit de data te verwijderen voordat deze in licentie wordt gegeven—hoewel de effectiviteit en consistentie van die anonimisering onzeker blijven en een groeiend punt van discussie zijn .
De lengtes die AI-bedrijven willen gaan om trainingsdata veilig te stellen, werden pijnlijk duidelijk in de buitengewone zaak van Project Panama, Anthropic's geheime interne programma om een enorme boekentrainingsdataset op te bouwen .
Het project had twee sporen. Ten eerste kocht Anthropic fysieke gedrukte boeken, sneed de bindingen door en scande ze destructief pagina voor pagina, waarbij ze werden omgezet in doorzoekbare PDF's en de papieren originelen werden weggegooid. Het doel: tot 2 miljoen boeken converteren in zes maanden . Een interne memo adviseerde een codenaam te gebruiken 'omdat we niet willen dat bekend wordt dat we hieraan werken' .
Ten tweede downloadde het bedrijf meer dan 7 miljoen illegale ebook-bestanden van schaduwbibliotheken, waaronder LibGen en Pirate Library Mirror . Dat spoor leidde tot een class action-rechtszaak die in 2024 werd aangespannen door auteurs Andrea Bartz, Kirk Wallace Johnson en Charles Graeber, die Anthropic ervan beschuldigden bijna een half miljoen gestolen boeken te gebruiken om Claude te trainen .
Op 20 juli 2026 keurde een federale rechter in San Francisco een schikking van $1,5 miljard goed—de grootste bekende auteursrechtelijke uitkering in de Amerikaanse geschiedenis . Meer dan 500.000 auteurs en uitgevers maakten deel uit van de class action, en zij zullen naar schatting $3.000 per in aanmerking komend werk ontvangen .
Cruciaal is dat de rechtbank een juridisch onderscheid maakte dat grote gevolgen heeft voor AI-training. Het gebruik van illegale ebooks was inbreukmakend en leidde tot de schikking. Maar het kopen van fysieke gedrukte boeken en deze intern destructief scannen voor training werd beschouwd als mogelijk redelijk gebruik (fair use), omdat elk fysiek exemplaar werd vervangen door een enkele digitale kopie in een proces dat de rechtbank 'buitengewoon transformerend' noemde . De $1,5 miljard dekte de aansprakelijkheid voor de gestolen boeken; het fysieke destructieprogramma werd niet bestraft .
Nu bedrijven haast maken om interne data te gelde te maken, blijven er belangrijke vragen bestaan. De effectiviteit van data-anonimisering door tussenpersonen zoals SimpleClosure is onzeker en een groeiend punt van discussie . Slack-berichten en e-mails van werknemers bevatten diep persoonlijke en gevoelige informatie, en het is niet duidelijk of de huidige verwijderingstechnieken voldoende zijn om heridentificatie te voorkomen.
Ondertussen stijgen de trainingskosten explosief. Een enkele trainingssessie op GPT-4-schaal kan al $100 miljoen of meer kosten . Nu hoogwaardige openbare data opraken, stijgen de gecombineerde kosten van het licentiëren van eigen bedrijfsdata, het betalen van baanbrekende schikkingen zoals die van Anthropic, en het bouwen van synthetische datapijplijnen allemaal dramatisch. De bredere markt voor AI-trainingsdatasets zal naar verwachting snel groeien, van naar schatting $3,6 miljard in 2025 tot $23 miljard in 2034, naarmate het licentiëren van menselijke tekst een geformaliseerde activaklasse wordt .
Voor individuele gebruikers is het landschap verschoven. Sinds eind 2025 hebben zowel OpenAI als Anthropic hun standaardbeleid gewijzigd om training op consumentenchats toe te staan (ChatGPT Free en Plus, Claude Free, Pro en Max), tenzij gebruikers actief uitschakelen . Zakelijke en API-klanten blijven standaard uitgesloten van training onder contractuele Data Processing Agreements
.
De boodschap is duidelijk: in de race om de onverzadigbare honger van AI naar menselijke data te voeden, worden de grenzen tussen openbaar en privé, persoonlijk en commercieel, opnieuw getrokken—één Slack-archief tegelijk.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Epoch AI schat dat de voorraad hoogwaardige openbare menselijke tekst ongeveer 300 biljoen tokens is, die naar verwachting tegen 2028 volledig is verbruikt.
Epoch AI schat dat de voorraad hoogwaardige openbare menselijke tekst ongeveer 300 biljoen tokens is, die naar verwachting tegen 2028 volledig is verbruikt. OpenAI en Anthropic betalen tot $300.000 voor Slack archieven, e mailcorpora en GitHub geschiedenissen van startups.
Anthropic's geheime 'Project Panama' om boeken te scannen leidde tot een schikking van $1,5 miljard, de grootste auteursrechtelijke uitkering in de VS.