लेकिन इसे अभी लॉन्च हुआ मॉडल समझना जल्दबाजी होगी। परियोजना फिलहाल शुरुआती प्री-ट्रेनिंग चरण में है, अंतिम पैरामीटर संख्या तय नहीं हुई है और सार्वजनिक रिलीज में अभी कई महीने लग सकते हैं। Reuters ने Financial Times की इस रिपोर्ट की स्वतंत्र रूप से पुष्टि नहीं की है ।
Financial Times की 7 अगस्त 2026 की रिपोर्ट के अनुसार, ByteDance ने अधिकतम 10 ट्रिलियन कुल पैरामीटर वाले बड़े भाषा मॉडल की प्री-ट्रेनिंग शुरू कर दी है । आम तौर पर प्री-ट्रेनिंग में तीन से छह महीने लग सकते हैं। इसके बाद फाइन-ट्यूनिंग, सुरक्षा परीक्षण और उत्पाद में इस्तेमाल से पहले कई अन्य चरण आते हैं ।
इसलिए अभी यह कहना संभव नहीं है कि मॉडल कब जनता के लिए उपलब्ध होगा—या होगा भी या नहीं। ByteDance अभी यह तय कर रही है कि मॉडल को पूरे 10 ट्रिलियन पैरामीटर के स्तर तक प्रशिक्षित किया जाए या नहीं । इसी दिन की एक अलग LatePost रिपोर्ट में 5 ट्रिलियन से अधिक पैरामीटर वाले मॉडल पर चर्चा का उल्लेख था, जिससे संकेत मिलता है कि परियोजना का दायरा बाद में बढ़ा हो सकता है ।
अगर ByteDance का मॉडल सचमुच 10 ट्रिलियन पैरामीटर तक पहुंचता है, तो कागज पर उसका आकार Anthropic के अनुमानित 8 ट्रिलियन पैरामीटर वाले Mythos 5 से थोड़ा बड़ा होगा । मौजूदा तस्वीर कुछ इस तरह है:
| मॉडल | अनुमानित पैरामीटर | स्थिति |
|---|---|---|
| ByteDance का नया मॉडल | अधिकतम 10 ट्रिलियन | शुरुआती प्री-ट्रेनिंग; किसी चीनी कंपनी का सबसे बड़ा ज्ञात मॉडल |
| Anthropic Claude Mythos 5 | लगभग 8 ट्रिलियन | जारी हो चुका है, लेकिन इसकी पूरी क्षमताओं तक पहुंच चुनिंदा अमेरिकी संगठनों तक सीमित है |
| Moonshot AI Kimi K3 | 2.8 ट्रिलियन | ByteDance का प्रस्तावित मॉडल इससे तीन गुना से भी अधिक बड़ा हो सकता है |
| OpenAI का फ्लैगशिप मॉडल | सार्वजनिक रूप से अज्ञात; कई ट्रिलियन का अनुमान | पैरामीटर संख्या का आधिकारिक खुलासा नहीं किया गया है |
फिर भी केवल पैरामीटर गिनना मॉडल की क्षमता का सीधा पैमाना नहीं है। यह मॉडल के आर्किटेक्चर का एक मोटा संकेतक है, प्रदर्शन की गारंटी नहीं।
रिपोर्ट में बताए गए 10 ट्रिलियन पैरामीटर ‘कुल पैरामीटर’ हैं। इसका अर्थ है कि मॉडल की पूरी आर्किटेक्चर में मौजूद पैरामीटरों की संख्या।
आज के कई उन्नत मॉडल Mixture-of-Experts (MoE) आर्किटेक्चर का इस्तेमाल करते हैं। ऐसे मॉडल में हर सवाल पर पूरी आर्किटेक्चर सक्रिय नहीं होती; केवल उसका एक हिस्सा उत्तर तैयार करने में काम करता है। उदाहरण के लिए, 10 ट्रिलियन कुल पैरामीटर वाले मॉडल में किसी एक अनुरोध पर 1 से 2 ट्रिलियन पैरामीटर ही सक्रिय हो सकते हैं ।
Financial Times की रिपोर्ट और उसके बाद की कवरेज में यह स्पष्ट नहीं किया गया है कि 10 ट्रिलियन का आंकड़ा पूरी तरह कुल पैरामीटरों को दर्शाता है, सक्रिय पैरामीटरों को या किसी मिश्रित गणना को। Anthropic के Mythos 5 और दूसरे मॉडलों से निष्पक्ष तुलना के लिए यह अंतर बेहद महत्वपूर्ण है।
ByteDance के संस्थापक Zhang Yiming ने Seed टीम से कहा है कि नया मॉडल तैयार करने के लिए प्रतिद्वंद्वी AI मॉडलों के आउटपुट का इस्तेमाल करके डिस्टिलेशन नहीं किया जाएगा—भले ही इससे कंपनी को अल्पावधि में घरेलू प्रतिस्पर्धियों से पीछे रहना पड़े ।
AI डिस्टिलेशन में आम तौर पर किसी अधिक शक्तिशाली ‘टीचर’ मॉडल के आउटपुट से छोटे या नए ‘स्टूडेंट’ मॉडल को प्रशिक्षित या बेहतर किया जाता है। इससे मॉडल को जल्दी बेहतर प्रदर्शन और ऊंची बेंचमार्क रैंकिंग हासिल करने में मदद मिल सकती है।
रिपोर्टों के मुताबिक, 6 अगस्त 2026 के आसपास हुई एक आंतरिक प्रबंधन बैठक में Zhang ने इस रुख को दोहराया और इसे दीर्घकालिक सोच तथा ‘delayed gratification’ यानी तत्काल लाभ छोड़कर भविष्य की क्षमता बनाने की रणनीति के रूप में पेश किया । यह फैसला TikTok को लेकर ByteDance और अमेरिकी सरकार के जटिल नियामकीय संबंध तथा कानूनी और निर्यात-नियंत्रण से जुड़े जोखिमों से भी प्रभावित हो सकता है ।
चीनी AI कंपनियों के बीच अमेरिकी फ्रंटियर मॉडलों की क्षमताओं की नकल या उनसे तेजी से सीखने को लेकर बहस तेज है। ऐसे माहौल में ByteDance का यह निर्देश एक अलग रणनीतिक रास्ते का संकेत देता है ।
ByteDance ने ChatGPT के उभरने के बाद 2023 की शुरुआत में Seed नामक AI रिसर्च डिवीजन की स्थापना की थी । उपलब्ध रिपोर्टों के अनुसार:
ByteDance का 10 ट्रिलियन पैरामीटर वाला प्रोजेक्ट केवल एक नई कंपनी-स्तरीय AI पहल नहीं है। इसे Anthropic और OpenAI जैसी अमेरिकी फ्रंटियर लैब्स से दूरी कम करने की कोशिश के रूप में देखा जा रहा है । इसके पीछे कुछ बड़े दबाव हैं:
इससे स्पष्ट है कि फ्रंटियर AI मॉडल अब केवल व्यावसायिक उत्पाद नहीं रह गए हैं; वे तकनीकी और रणनीतिक संपत्ति भी बनते जा रहे हैं।
ByteDance ने यह नहीं बताया है कि 10 ट्रिलियन पैरामीटर वाला मॉडल सार्वजनिक रूप से जारी किया जाएगा या नहीं। कंपनी की मौजूदा दिशा मुख्य रूप से क्लोज्ड-सोर्स और उत्पाद-केंद्रित रही है।
ByteDance एक बेहद बड़ा और लंबी अवधि का AI दांव लगा रही है। परियोजना का संभावित आकार Anthropic के Mythos 5 के करीब है, लेकिन मॉडल अभी शुरुआती प्री-ट्रेनिंग में है और इसकी अंतिम पैरामीटर संख्या तय नहीं हुई है।
Zhang Yiming का प्रतिद्वंद्वी मॉडलों से डिस्टिलेशन न करने का निर्देश कंपनी को तेज शॉर्टकट के बजाय स्वतंत्र क्षमता निर्माण की राह पर ले जाता है। करीब 2,000 सदस्यों वाली Seed टीम और Wu Yonghui के नेतृत्व में यह प्रयास चीन-अमेरिका AI प्रतिस्पर्धा के अगले चरण की दिशा दिखाता है—हालांकि असली परीक्षा मॉडल के लॉन्च और उसके वास्तविक प्रदर्शन के बाद ही होगी।