Epoch AI के अनुसार, उच्च गुणवत्ता वाला सार्वजनिक मानव लिखित टेक्स्ट लगभग 300 ट्रिलियन टोकन बचा है, जो 2026 2032 के बीच खत्म हो सकता है। OpenAI और Anthropic अब कंपनियों के आंतरिक Slack संदेश, ईमेल और मीटिंग रिकॉर्डिंग खरीद रहे हैं; एक डील में 3 लाख डॉलर तक मिल रहे हैं। Anthropic का गुप्त 'प्रोजेक्ट पनामा' लाखों किताब...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What are the key details about OpenAI and Anthropic purchasing internal corporate data — including employee chats, emails, video recordings,. Article summary: I'll research this thoroughly across multiple angles. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
दुनिया की अग्रणी AI प्रयोगशालाओं के सामने एक बड़ी समस्या है: इंटरनेट पर उच्च गुणवत्ता वाला मानव-लिखित टेक्स्ट खत्म हो रहा है। इस कमी को दूर करने के लिए, OpenAI और Anthropic ने एक नया रास्ता निकाला है—आपके ऑफिस के अंदरूनी संचार को खरीदना। कंपनियां अब कर्मचारियों के Slack संदेशों, ईमेल, वीडियो कॉल रिकॉर्डिंग और कोड हिस्ट्री को 3 लाख डॉलर तक की कीमत पर खरीद रही हैं। यह एक शांत लेकिन तेजी से बढ़ता हुआ बाजार बन गया है, जिसमें आपका निजी कार्यालयी डेटा AI के लिए नया ईंधन बन रहा है।
यह पूरी प्रक्रिया एक सरल लेकिन अनिवार्य गणितीय समस्या से प्रेरित है। Epoch AI के सबसे प्रसिद्ध अनुमान के अनुसार, उच्च गुणवत्ता वाले मानव-निर्मित सार्वजनिक टेक्स्ट का कुल भंडार लगभग 300 ट्रिलियन टोकन है। मौजूदा खपत दर पर, यह आपूर्ति 2026 और 2032 के बीच खत्म होने का अनुमान है, जिसमें 2028 को मध्यम वर्ष माना गया है।
कुछ विश्लेषण तो यह भी कहते हैं कि उच्च गुणवत्ता वाला टेक्स्ट सिर्फ 15-20 ट्रिलियन टोकन हो सकता है, जो 2026 तक ही खत्म हो सकता है।
PBS ने 2025 के अंत में रिपोर्ट दी थी कि चैटबॉट प्रशिक्षण डेटा की 'गोल्ड रश' 2026 तक खत्म हो सकती है।
इस सीमा के करीब पहुंचने पर, OpenAI और Anthropic ने अपना ध्यान एक अछूते खजाने की ओर लगाया है: आंतरिक कॉर्पोरेट सहयोग डेटा। वास्तविक मानव अंतःक्रियाओं के रिकॉर्ड—जैसे ईमेल में बातचीत, मीटिंग ट्रांसक्रिप्ट में वास्तविक समय के निर्णय, और Slack थ्रेड्स में प्रामाणिक कार्यस्थल की गतिशीलता—ऐसे जैविक संवाद डेटा प्रदान करते हैं जो सार्वजनिक वेब पर दुर्लभ हो गए हैं।
इन संवेदनशील लेन-देन को मध्यस्थ करने के लिए बिचौलियों का एक नया पारिस्थितिकी तंत्र तैयार हुआ है। दो नाम सबसे अधिक बार सामने आते हैं: Mercor और SimpleClosure।
Reuters की 2024 की एक रिपोर्ट के अनुसार, बाजार दरें लगभग $0.001 प्रति शब्द (टेक्स्ट के लिए), $1 से $2 प्रति छवि, $2 से $4 प्रति छोटा वीडियो, और $100 से $300 प्रति घंटे लंबी फिल्म या वीडियो के लिए हैं।
SimpleClosure नामक एक स्टार्टअप विंड-डाउन फर्म ने पिछले एक साल में लगभग 100 ऐसे लेन-देन किए हैं, जिनमें प्रति कंपनी 10,000 से 100,000 डॉलर तक का भुगतान शामिल है। फर्म का 'एसेट हब' प्लेटफॉर्म संस्थापकों को डेटा को लाइसेंस देने से पहले व्यक्तिगत रूप से पहचान योग्य जानकारी (PII) को हटाने में मदद करता है—हालांकि इस गुमनामी की प्रभावशीलता अनिश्चित बनी हुई है और यह बढ़ते विवाद का विषय है।
AI कंपनियां प्रशिक्षण डेटा हासिल करने के लिए किस हद तक जा सकती हैं, इसका खुलासा प्रोजेक्ट पनामा के असाधारण मामले में हुआ, जो Anthropic का विशाल पुस्तक प्रशिक्षण डेटासेट बनाने का गुप्त आंतरिक कार्यक्रम था।
इस परियोजना के दो ट्रैक थे। पहला, Anthropic ने भौतिक प्रिंट किताबें खरीदीं, उनकी बाइंडिंग काट दी, और उन्हें पृष्ठ दर पृष्ठ नष्ट करके स्कैन किया, उन्हें खोजने योग्य PDF में बदल दिया और मूल कागज को फेंक दिया। लक्ष्य: छह महीने में 20 लाख किताबों को कन्वर्ट करना था। एक आंतरिक मेमो में कोडनेम का उपयोग करने की सलाह दी गई थी "क्योंकि हम नहीं चाहते कि पता चले कि हम इस पर काम कर रहे हैं"।
दूसरा, कंपनी ने LibGen और Pirate Library Mirror जैसी शैडो लाइब्रेरी से 70 लाख से अधिक पायरेटेड ईबुक फ़ाइलें डाउनलोड कीं। इस ट्रैक के कारण 2024 में लेखकों एंड्रिया बार्ट्ज़, किर्क वालेस जॉनसन और चार्ल्स ग्रेबर द्वारा एक क्लास एक्शन मुकदमा दायर किया गया, जिसमें Anthropic पर लगभग पांच लाख पायरेटेड किताबों का उपयोग करके Claude को प्रशिक्षित करने का आरोप लगाया गया।
20 जुलाई, 2026 को, सैन फ्रांसिस्को के एक संघीय न्यायाधीश ने 1.5 अरब डॉलर के समझौते को मंजूरी दी—जो अमेरिकी इतिहास में सबसे बड़ा ज्ञात कॉपीराइट भुगतान है। इस क्लास एक्शन में 500,000 से अधिक लेखक और प्रकाशक शामिल थे, और उन्हें प्रति पात्र कार्य के लिए अनुमानित $3,000 प्राप्त होंगे।
महत्वपूर्ण रूप से, अदालत ने एक कानूनी अंतर स्थापित किया जिसके AI प्रशिक्षण के लिए बड़े निहितार्थ हैं। पायरेटेड ईबुक का उपयोग उल्लंघनकारी था और इसने समझौते को ट्रिगर किया। लेकिन भौतिक प्रिंट किताबें खरीदना और उन्हें आंतरिक रूप से नष्ट करके स्कैन करना प्रशिक्षण के लिए संभावित रूप से उचित उपयोग के रूप में योग्य हो सकता है, क्योंकि प्रत्येक भौतिक प्रति को एक डिजिटल कॉपी से बदल दिया गया था, जिसे अदालत ने "अत्यधिक परिवर्तनकारी" कहा। 1.5 अरब डॉलर पायरेटेड पुस्तक देयता को कवर करता है; भौतिक विनाश कार्यक्रम को दंडित नहीं किया गया।
जैसे-जैसे कंपनियां आंतरिक डेटा से कमाई करने की होड़ में लगी हैं, महत्वपूर्ण प्रश्न बने हुए हैं। SimpleClosure जैसे दलालों द्वारा डेटा गुमनामी की प्रभावशीलता अनिश्चित है और यह बढ़ते विवाद का विषय है। कर्मचारियों के Slack संदेशों और ईमेल में गहरी व्यक्तिगत और संवेदनशील जानकारी होती है, और यह स्पष्ट नहीं है कि वर्तमान स्ट्रिपिंग तकनीकें पुन: पहचान को रोकने के लिए पर्याप्त हैं या नहीं।
इस बीच, प्रशिक्षण लागत आसमान छू रही है। एक GPT-4-स्केल प्रशिक्षण रन की लागत पहले से ही $100 मिलियन या उससे अधिक हो सकती है। जैसे-जैसे उच्च गुणवत्ता वाला सार्वजनिक डेटा खत्म होता है, मालिकाना कॉर्पोरेट डेटा को लाइसेंस देने, Anthropic के 1.5 अरब डॉलर जैसे ऐतिहासिक समझौतों का भुगतान करने और सिंथेटिक डेटा पाइपलाइन बनाने की संयुक्त लागत तेजी से बढ़ रही है। AI प्रशिक्षण डेटासेट बाजार 2025 में अनुमानित 3.6 अरब डॉलर से बढ़कर 2034 तक 23 अरब डॉलर होने का अनुमान है, क्योंकि मानव टेक्स्ट लाइसेंसिंग एक औपचारिक परिसंपत्ति वर्ग बन रहा है।
आम उपयोगकर्ताओं के लिए, परिदृश्य बदल गया है। 2025 के अंत में, OpenAI और Anthropic दोनों ने अपनी डिफ़ॉल्ट नीतियों को बदलकर उपभोक्ता-स्तरीय चैट (जैसे ChatGPT Free और Plus, Claude Free, Pro, और Max) पर प्रशिक्षण की अनुमति देना शुरू कर दिया, जब तक कि उपयोगकर्ता सक्रिय रूप से ऑप्ट-आउट न करें। एंटरप्राइज़ और API ग्राहक अनुबंधित डेटा प्रोसेसिंग समझौतों के तहत डिफ़ॉल्ट रूप से प्रशिक्षण से बाहर रहते हैं।
संदेश स्पष्ट है: AI की मानव-निर्मित डेटा की अतृप्त भूख को खिलाने की दौड़ में, सार्वजनिक और निजी, व्यक्तिगत और वाणिज्यिक के बीच की सीमाएं फिर से खींची जा रही हैं—एक Slack आर्काइव के बाद।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Epoch AI के अनुसार, उच्च गुणवत्ता वाला सार्वजनिक मानव लिखित टेक्स्ट लगभग 300 ट्रिलियन टोकन बचा है, जो 2026 2032 के बीच खत्म हो सकता है।
Epoch AI के अनुसार, उच्च गुणवत्ता वाला सार्वजनिक मानव लिखित टेक्स्ट लगभग 300 ट्रिलियन टोकन बचा है, जो 2026 2032 के बीच खत्म हो सकता है। OpenAI और Anthropic अब कंपनियों के आंतरिक Slack संदेश, ईमेल और मीटिंग रिकॉर्डिंग खरीद रहे हैं; एक डील में 3 लाख डॉलर तक मिल रहे हैं।
Anthropic का गुप्त 'प्रोजेक्ट पनामा' लाखों किताबों को नष्ट करके स्कैन करने और 70 लाख पायरेटेड ई बुक डाउनलोड करने का मामला 1.5 अरब डॉलर के समझौते पर पहुंचा।