openPangu 2.0 Pro के 505B कुल पैरामीटर हैं, लेकिन हर टोकन पर करीब 18B पैरामीटर सक्रिय होते हैं; 180B नहीं। Huawei ने मॉडल वेट्स, बेसिक इन्फ़रेंस कोड और तकनीकी रिपोर्ट जारी किए हैं; प्री ट्रेनिंग, पोस्ट ट्रेनिंग और ट्रेनिंग ऑपरेटर समेत अन्य घटक चरणबद्ध तरीके से जारी करने की बात कही गई है। 512K कॉन्टेक्स्ट, MoE और DSA...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: How does Huawei’s open-sourcing of openPangu-2.0-Pro—a 505B-parameter MoE model with roughly 180B active parameters, 512K context, 34T-token. Article summary: One correction: openPangu-2.0-Pro has about 505B total parameters but roughly 18B—not 180B—activated per token. The release is significant because it makes an Ascend-native, non-NVIDIA path inspectable from model design . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Huawei का openPangu-2.0-Pro रिलीज़ केवल एक मॉडल चेकपॉइंट जारी करना नहीं है। यह बड़े भाषा मॉडल को Huawei के Ascend एक्सेलेरेटर प्लेटफ़ॉर्म पर जांचने और चलाने का एक महत्वपूर्ण रास्ता खोलता है। लेकिन इसे अभी से ऐसा पूर्ण पैकेज कहना सही नहीं होगा, जिससे कोई बाहरी संगठन Huawei के मूल, फ्रंटियर-स्केल ट्रेनिंग रन को ज्यों का त्यों दोबारा बना सके।
सबसे पहले एक जरूरी सुधार: Pro एक Mixture-of-Experts (MoE) मॉडल है, जिसमें कुल लगभग 505 अरब पैरामीटर हैं, लेकिन हर टोकन के लिए लगभग 18 अरब पैरामीटर सक्रिय किए जाते हैं। यह 512K टोकन तक का कॉन्टेक्स्ट संभाल सकता है और इसके लिए लगभग 34 ट्रिलियन टोकन पर प्रशिक्षण की बात मॉडल कार्ड में कही गई है। 21
Huawei ने 31 जुलाई 2026 को openPangu-2.0-Pro के मॉडल वेट्स, बेसिक इन्फ़रेंस कोड और तकनीकी रिपोर्ट को ओपन-सोर्स रूप में उपलब्ध कराने की घोषणा की। कंपनी के अनुसार, openPangu 2.0 के अन्य घटक भी उसके ओपन-सोर्स चैनलों पर क्रमशः उपलब्ध कराए जा रहे हैं। 12
इन तीन चीज़ों का व्यावहारिक महत्व अलग-अलग है:
HDC 2026 के रोडमैप में सात घटकों को चरणबद्ध ढंग से खोलने की बात भी कही गई थी, जिनमें प्री-ट्रेनिंग कोड, पोस्ट-ट्रेनिंग कोड और ट्रेनिंग ऑपरेटर शामिल हैं। 2
10 यदि ये घटक उपयोग योग्य रूप में उपलब्ध होते हैं, तो यह रिलीज़ केवल वेट्स जारी करने की तुलना में ट्रेनिंग से इन्फ़रेंस तक अधिक पारदर्शी स्टैक के करीब पहुंचेगी।
ओपन-वेट मॉडल और पूरी तरह पुनरुत्पाद्य मॉडल एक ही चीज़ नहीं हैं। डाउनलोड किए जा सकने वाले वेट्स से यह जांचा जा सकता है कि जारी चेकपॉइंट कैसा काम करता है; इससे उन सभी परिस्थितियों का पता नहीं चलता जिनमें उसे मूल रूप से प्रशिक्षित किया गया था।
लगभग 34 ट्रिलियन टोकन वाले प्री-ट्रेनिंग रन को दोहराने के लिए कम-से-कम सटीक डेटा—या डेटा तैयार करने की पुनरुत्पाद्य विधि—पूर्ण ट्रेनिंग व पोस्ट-ट्रेनिंग इम्प्लीमेंटेशन, हाइपरपैरामीटर, क्लस्टर टोपोलॉजी, सॉफ्टवेयर व कंपाइलर संस्करण, डिस्ट्रिब्यूटेड-ट्रेनिंग कॉन्फ़िगरेशन, कस्टम ऑपरेटर, मूल्यांकन सेटअप और पर्याप्त संगत हार्डवेयर की जरूरत होगी। मौजूदा सामग्री वेट्स, बेसिक इन्फ़रेंस कोड और रिपोर्ट की पुष्टि करती है, जबकि बाकी घटकों को Huawei क्रमशः उपलब्ध कराने की बात कहता है। 12
21
इसलिए अभी सबसे संतुलित वर्णन यही है: Ascend-प्राथमिकता वाला ओपन मॉडल रिलीज़, जिसके साथ स्टैक की व्यापक पारदर्शिता का घोषित रास्ता मौजूद है। यह आज इस बात का प्रमाण नहीं है कि कोई बाहरी संस्था मूल ट्रेनिंग रन को स्वतंत्र रूप से दोहरा सकती है।
openPangu-2.0-Pro बहुत बड़ी कुल पैरामीटर क्षमता को ऐसे तंत्रों के साथ जोड़ता है जिनका घोषित उद्देश्य जनरेशन और लंबे कॉन्टेक्स्ट की लागत को नियंत्रित करना है।
MoE मॉडल हर टोकन को सभी एक्सपर्ट पैरामीटरों से नहीं, बल्कि उनके एक हिस्से से गुजारते हैं। Pro के मॉडल कार्ड में लगभग 505B कुल पैरामीटर और प्रति टोकन करीब 18B सक्रिय पैरामीटर बताए गए हैं। 21
इसका अर्थ यह नहीं कि मॉडल हल्का हो जाता है। 505B मॉडल को स्टोर करना, सर्व करना और अलग-अलग नोड्स के बीच संचार कराना अब भी गंभीर इंफ्रास्ट्रक्चर मांगता है। फिर भी समान कुल आकार वाले डेंस मॉडल के मुकाबले हर टोकन के लिए होने वाली पैरामीटर गणना कम हो सकती है।
मॉडल MLA को बनाए रखता है और DSA को स्लाइडिंग-विंडो अटेंशन (SWA) के साथ 1:2 लेयर अनुपात में मिलाता है। Huawei के अनुसार, SWA लेयर नजदीकी संदर्भ को संभालती हैं, जबकि DSA लेयर विरल वैश्विक संदर्भ को पकड़ती हैं। लक्ष्य लंबे कॉन्टेक्स्ट इन्फ़रेंस में कंप्यूट, मेमोरी उपयोग और मेमोरी-एक्सेस लागत घटाना है, बिना सटीकता से समझौता किए। 21
512K कॉन्टेक्स्ट की कठिनाई यही है कि हर टोकन का हर दूसरे टोकन पर पूर्ण अटेंशन बहुत महंगा हो जाता है। स्थानीय अटेंशन पास की जानकारी को अपेक्षाकृत कम लागत पर संभालता है, जबकि विरल वैश्विक तंत्र दूर की उपयोगी सामग्री तक पहुंच बनाए रखने का प्रयास करते हैं।
Huawei चार-स्ट्रीम mHC रेज़िडुअल टोपोलॉजी का भी वर्णन करता है, जिसका उद्देश्य रिप्रेज़ेंटेशन की विविधता और सामान्यीकरण बेहतर करना है। तीन-हेड वाला मल्टी-टोकन प्रेडिक्शन मॉड्यूल अतिरिक्त भविष्य के टोकन का अनुमान लगाता है; इसे इन्फ़रेंस तेज करने के उद्देश्य से डिज़ाइन किया गया है। मॉडल कार्ड में Muon को ट्रेनिंग ऑप्टिमाइज़र बताया गया है, जिसका घोषित लक्ष्य तेज़ कन्वर्जेन्स है। 21
ये Huawei की प्रकाशित सामग्री में दिए गए आर्किटेक्चर और अनुकूलन संबंधी दावे हैं। इन्हें हर डिप्लॉयमेंट में किसी तय स्पीडअप के स्वतंत्र प्रमाण की तरह नहीं पढ़ना चाहिए। थ्रूपुट और लेटेंसी एक्सेलेरेटर कॉन्फ़िगरेशन, प्रिसीजन, बैचिंग, कॉन्टेक्स्ट लंबाई, ट्रैफिक पैटर्न और सर्विंग सॉफ्टवेयर से काफी बदलते हैं।
512K कॉन्टेक्स्ट विंडो एक एजेंट को एक ही सत्र में अधिक सामग्री—जैसे मैनुअल, नीतिगत दस्तावेज़, लॉग, पहले के टूल आउटपुट और तकनीकी स्पेसिफिकेशन—पर विचार करने दे सकती है। इससे जरूरत से ज्यादा चंकिंग कम हो सकती है, लेकिन रिट्रीवल, अनुमति नियंत्रण, स्रोत सत्यापन और मानवीय मंजूरी की जरूरत समाप्त नहीं होती।
संभावित उपयोग क्षेत्र:
कम संसाधनों वाली कई संस्थाओं के लिए Pro को स्वयं होस्ट करना मुश्किल रहेगा, क्योंकि स्पार्स एक्टिवेशन के बावजूद इसका कुल आकार बहुत बड़ा है। Huawei ने छोटा openPangu-2.0-Flash भी जारी किया है, जिसमें 92B कुल और प्रति टोकन 6B सक्रिय पैरामीटर बताए गए हैं; मूल्यांकन और डिप्लॉयमेंट के लिहाज से यह अधिक सुलभ विकल्प हो सकता है। 15
20
Huawei के रिपोर्ट किए गए मूल्यांकन परिणामों के अनुसार, openPangu-2.0-Pro के Thinking संस्करण ने SWE-bench Verified पर 68.5 स्कोर किया। 24 यह उल्लेखनीय बेंचमार्क परिणाम है, लेकिन इससे यह निष्कर्ष नहीं निकलता कि मॉडल जटिल प्रोडक्शन सॉफ्टवेयर का भरोसेमंद स्वामी बन सकता है।
वास्तविक रिपॉजिटरी में एनवायरनमेंट सेटअप, डिपेंडेंसी, टेस्ट चलाना, सुरक्षा समीक्षा, आर्किटेक्चर संबंधी फैसले, बदलती प्रोडक्ट आवश्यकताएं और कई चरणों तक डीबगिंग शामिल होती है। बेहतर तैनाती पैटर्न ऐसा सुपरवाइज़्ड कोडिंग एजेंट होगा जिसे सीमित रिपॉजिटरी एक्सेस, सैंडबॉक्स्ड एक्ज़ीक्यूशन, ऑटोमेटेड टेस्ट, स्टैटिक एनालिसिस, कोड रिव्यू और रोलबैक प्रक्रिया दी जाए—न कि स्वचालित मर्ज करने की छूट।
रणनीतिक मूल्य सिर्फ मॉडल वेट्स में नहीं है। Ascend-नेटिव रेफरेंस मॉडल डेवलपर्स को Ascend पर वर्कलोड बनाने, टेस्ट करने और अनुकूलित करने के लिए प्रेरित कर सकता है। बदले में ये वर्कलोड बेहतर रनटाइम, ऑपरेटर, टूलिंग और प्रबंधित सेवाओं की मांग बढ़ाते हैं। Huawei ने डेवलपर्स, एंटरप्राइज़ पार्टनर्स और शोधकर्ताओं को डाउनलोड, उपयोग और फीडबैक के लिए Ascend Tribe समुदाय और Huawei Cloud MaaS सेवा की ओर निर्देशित किया है। 12
Flash और Pro को अलग-अलग स्केल पर जारी करना संभावित उपयोगकर्ताओं का दायरा बढ़ाता है। वहीं, प्रस्तावित ट्रेनिंग, पोस्ट-ट्रेनिंग और ऑपरेटर घटक उन सॉफ्टवेयर परतों को लक्ष्य करते हैं जो यह तय करती हैं कि किसी हार्डवेयर प्लेटफ़ॉर्म पर मॉडल बनाना कितना व्यावहारिक है। 10
15
इसीलिए openPangu 2.0 को Ascend-प्लस-Pangu डेवलपमेंट इकोसिस्टम को मजबूत करने की कोशिश के रूप में देखना अधिक उचित है। डिप्लॉयमेंट, निरीक्षण और प्रयोग के लिए इसकी ओपननेस पहले से महत्वपूर्ण है। पूर्ण पुनरुत्पादन का दावा तभी परखा जाना चाहिए जब शेष कोड, कॉन्फ़िगरेशन और डेटा-संबंधी विवरण उपलब्ध हों और स्वतंत्र समूह जांच सकें कि वास्तव में क्या फिर से बनाया जा सकता है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
openPangu 2.0 Pro के 505B कुल पैरामीटर हैं, लेकिन हर टोकन पर करीब 18B पैरामीटर सक्रिय होते हैं; 180B नहीं।
openPangu 2.0 Pro के 505B कुल पैरामीटर हैं, लेकिन हर टोकन पर करीब 18B पैरामीटर सक्रिय होते हैं; 180B नहीं। Huawei ने मॉडल वेट्स, बेसिक इन्फ़रेंस कोड और तकनीकी रिपोर्ट जारी किए हैं; प्री ट्रेनिंग, पोस्ट ट्रेनिंग और ट्रेनिंग ऑपरेटर समेत अन्य घटक चरणबद्ध तरीके से जारी करने की बात कही गई है।
512K कॉन्टेक्स्ट, MoE और DSA+SWA जैसी डिज़ाइनें लंबे दस्तावेज़ों व लॉग्स पर काम करने वाले एजेंटों के लिए उपयोगी हो सकती हैं, पर मानव समीक्षा, एक्सेस नियंत्रण और सत्यापन आवश्यक रहेंगे।