Epoch AI uppskattar att lagret av högkvalitativ, mänskligt skriven text på den öppna webben uppgår till cirka 300 biljoner tokens, vilket bedöms vara förbrukat redan mellan 2026 och 2032. OpenAI och Anthropic köper nu aktivt interna företagsdata – Slack meddelanden, mejl, mötesanteckningar och kodhistorik – från ned...
Research answer

Create a landscape editorial hero image for this Studio Global article: What are the key details about OpenAI and Anthropic purchasing internal corporate data — including employee chats, emails, video recordings,. Article summary: I'll research this thoroughly across multiple angles. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Det offentliga internet håller på att ta slut på ren, mänskligt skriven text – och världens ledande AI-laboratorier kapplöper efter en ny bränslekälla: era interna företagskommunikationer. OpenAI och Anthropic köper nu aktivt upp anställdas Slack-meddelanden, mejl, videoinspelningar och kodhistorik från startupbolag – och betalar upp till 3 miljoner kronor per affär på en snabbt växande marknad för privatägd data .
Drivkraften bakom jakt på företagsdata är en enkel, oundviklig matematisk sanning. Den mest citerade uppskattningen, från forskningsgruppen Epoch AI, säger att det totala lagret av högkvalitativ, mänskligt skriven text på den öppna webben uppgår till cirka 300 biljoner tokens (90 procents konfidensintervall: 100 biljoner till 1 000 biljoner) . Med nuvarande förbrukningstakt beräknas den tillgången vara helt förbrukad mellan 2026 och 2032, med en medianberäkning på 2028
. Vissa analyser antyder att mängden högkvalitativ text på webben endast är 15–20 biljoner tokens, vilket skulle innebära att bristen inträffar redan 2026
. PBS rapporterade i slutet av 2025 att "guldrushen" efter träningsdata för chattrobotar kan vara över redan 2026
.
I takt med att den gränsen närmar sig har OpenAI och Anthropic riktat blicken mot en tidigare outnyttjad skattkammare: interna företagsdata . Dokumentation av verkliga mänskliga interaktioner – mejl med förhandlingar, mötesanteckningar och Slack-trådar som visar autentiska arbetsdynamiker – erbjuder den typ av organiskt konversationsdata som blivit svår att hitta på den avskrapade offentliga webben.
En ny bransch av förmedlarföretag har vuxit fram för att hantera dessa känsliga transaktioner. Två namn förekommer oftast: Mercor och SimpleClosure .
Generella marknadspriser, rapporterade av Reuters 2024, ger en bild av värdet per enhet: cirka 0,001 dollar per ord för text, 1–2 dollar per bild, 2–4 dollar per kort video och 100–300 dollar per timme för längre film .
SimpleClosure, en avvecklingsfirma för startupbolag, har genomfört närmare 100 sådana transaktioner under det senaste året, med utbetalningar från 100 000 till 1 miljon kronor per företag . Företagets "Asset Hub"-plattform hjälper grundare att rensa personlig information från datan innan den licensieras – men hur effektiv och tillförlitlig den anonymiseringen är förblir osäker och en växande källa till debatt .
Hur långt AI-bolagen är beredda att gå för att säkra träningsdata blev tydligt i det anmärkningsvärda fallet med Project Panama – Anthropics hemliga interna program för att bygga ett massivt träningsdataset med böcker .
Projektet hade två spår. För det första köpte Anthropic fysiska tryckta böcker, skar av bindningarna och skannade dem destruktivt sida för sida, omvandlade dem till sökbara PDF-filer och slängde originalpapperen. Målet: att omvandla upp till 2 miljoner böcker på sex månader . Ett internt PM rekommenderade att använda ett kodnamn "eftersom vi inte vill att det ska vara känt att vi arbetar med detta" .
För det andra laddade företaget ner mer än 7 miljoner piratkopierade e-boksfiler från skuggbibliotek som LibGen och Pirate Library Mirror . Det spåret ledde till en grupptalan som lämnades in 2024 av författarna Andrea Bartz, Kirk Wallace Johnson och Charles Graeber, som anklagade Anthropic för att ha använt nästan en halv miljon piratkopierade böcker för att träna Claude .
Den 20 juli 2026 godkände en federal domare i San Francisco en förlikning på 16 miljarder kronor – den största kända upphovsrättsuppgörelsen i USA:s historia . Mer än 500 000 författare och förlag ingick i grupptalan och de kommer att få en uppskattad ersättning på 30 000 kronor per berättigat verk .
Avgörande för fallet var en juridisk distinktion med stora konsekvenser för AI-träning. Att använda piratkopierade e-böcker var upphovsrättsintrång och utlöste förlikningen. Men att köpa fysiska tryckta böcker och destruktivt skanna dem internt för träning bedömdes av domstolen potentiellt vara fair use (tillåten användning), eftersom varje fysiskt exemplar ersattes med en enda digital kopia i en process som domstolen kallade "synnerligen omvandlande" . De 16 miljarderna täckte skulden för de piratkopierade böckerna; det fysiska destruktionsprogrammet bestraffades inte .
I takt med att företag rusar för att tjäna pengar på interna data kvarstår betydande frågor. Hur effektiv dataanonymiseringen är hos förmedlare som SimpleClosure är osäker och en växande källa till debatt . Anställdas Slack-meddelanden och mejl innehåller djupt personlig och känslig information, och det är oklart om nuvarande rensningstekniker är tillräckliga för att förhindra återidentifiering.
Samtidigt skenar träningskostnaderna. En enda GPT-4-skala träningskörning kan redan kosta över en miljard kronor . I takt med att högkvalitativ offentlig data tar slut, ökar de sammanlagda kostnaderna för att licensiera proprietär företagsdata, betala uppmärksammade förlikningar som Anthropics miljardavtal och bygga syntetiska datapipelines dramatiskt. Den bredare marknaden för AI-träningsdataset beräknas växa snabbt, från uppskattningsvis 40 miljarder kronor 2025 till 250 miljarder kronor 2034, i takt med att licensiering av mänskligt skriven text blir en etablerad tillgångsklass .
För enskilda användare har landskapet förändrats. Från och med sensommaren 2025 ändrade både OpenAI och Anthropic sina standardpolicyer för att tillåta träning på konsumentchattar (ChatGPT Free och Plus, Claude Free, Pro och Max) om inte användaren aktivt väljer bort det . Företagskunder och API-användare är fortfarande undantagna från träning som standard enligt avtalade databehandlingsavtal
.
Budskapet är tydligt: i kapplöpningen att mätta AI:s omättliga hunger efter mänskligt genererad data ritas gränserna mellan offentligt och privat, personligt och kommersiellt om – ett Slack-arkiv i taget.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Epoch AI uppskattar att lagret av högkvalitativ, mänskligt skriven text på den öppna webben uppgår till cirka 300 biljoner tokens, vilket bedöms vara förbrukat redan mellan 2026 och 2032.
Epoch AI uppskattar att lagret av högkvalitativ, mänskligt skriven text på den öppna webben uppgår till cirka 300 biljoner tokens, vilket bedöms vara förbrukat redan mellan 2026 och 2032. OpenAI och Anthropic köper nu aktivt interna företagsdata – Slack meddelanden, mejl, mötesanteckningar och kodhistorik – från nedlagda startupbolag för priser mellan 100 000 och 3 miljoner kronor per affär.
Anthropics hemliga projekt 'Project Panama' avslöjades i en rättsprocess: bolaget köpte och förstörde miljontals böcker för att skanna dem, samt laddade ner över 7 miljoner piratkopierade e böcker – vilket ledde till...