Huawei ने AscendNPU IR को BiSheng कंपाइलर की MLIR आधारित कंपाइलिंग नींव के रूप में ओपन सोर्स किया है। इसकी जानकारी AscendNPU IR आर्किटेक्ट Hai Lijuan ने 1 अगस्त 2026 को HyperAI के Meet AI Compiler तकनीकी सैलून में दी।... HFusion अपेक्षाकृत हार्डवेयर स्वतंत्र स्तर पर फ्यूजन, टाइलिंग और शेड्यूलिंग करता है, जबकि HIVM C...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What did Huawei AscendNPU IR architect Hai Lijuan present at HyperAI’s ninth Meet AI Compiler technical salon on August 1, 2026, and how doe. Article summary: Hai Lijuan’s August 1 salon talk, “AscendNPU IR: open compiler foundation supporting multi-language access to Ascend,” presented the newly open-sourced MLIR compiler layer beneath BiSheng and its path for bringing Triton. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Huawei का AscendNPU IR कोई नया एंड-यूज़र प्रोग्रामिंग लैंग्वेज नहीं, बल्कि BiSheng कंपाइलर के नीचे काम करने वाला ओपन-सोर्स कंपाइलर फाउंडेशन है। 1 अगस्त 2026 को बीजिंग के Zhongguancun में हुए HyperAI के नौवें Meet AI Compiler तकनीकी सैलून में Huawei की AscendNPU IR आर्किटेक्ट Hai Lijuan ने बताया कि MLIR-आधारित यह स्टैक Triton और दूसरे ऑपरेटर इकोसिस्टम को Ascend हार्डवेयर से जोड़ने के लिए कैसे तैयार किया गया है। 3
7
इसका सीधा मतलब यह है कि डेवलपर्स को हर ऑपरेटर के लिए टाइल शेड्यूलिंग, डेटा मूवमेंट, ऑन-चिप मेमोरी, सिंक्रोनाइजेशन और डिवाइस निर्देशों को अलग-अलग हाथ से लिखने की जरूरत कम हो सकती है।
AscendNPU IR, Ascend प्रोसेसर के लिए ऑपरेटर कंपाइलिंग में इस्तेमाल होने वाला MLIR-आधारित इंटरमीडिएट रिप्रेजेंटेशन है। MLIR यानी Multi-Level Intermediate Representation—एक ऐसा कंपाइलर ढांचा, जिसमें प्रोग्राम को अलग-अलग अमूर्तता स्तरों पर बदला और ऑप्टिमाइज़ किया जा सकता है। 4
11
AscendNPU IR का डिजाइन दो जरूरतों के बीच संतुलन बनाने की कोशिश करता है:
यह स्टैक कई रास्तों से इनपुट ले सकता है। Triton और TileLang जैसी DSLs अपने ऑपरेटरों को AscendNPU IR में लोअर कर सकती हैं। वहीं फ्रेमवर्क और कंपाइलर इनपुट Torch IR, Linalg/HFusion IR या HIVM IR के जरिए भी जुड़ सकते हैं। 5
22
सरल रूप में कंपाइलिंग फ्लो इस तरह समझा जा सकता है:
Triton, TileLang या फ्रेमवर्क IR
↓
MLIR-आधारित AscendNPU IR
↓
HFusion से HIVM लोअरिंग
↓
Ascend डिवाइस निर्देश और बाइनरी
दस्तावेजीकृत प्रक्रिया में bishengir-compile MLIR को डिवाइस-साइड ऑब्जेक्ट में बदलता है। इसके बाद CANN रनटाइम के जरिए ऑपरेटर को रजिस्टर कर Ascend NPU पर चलाया जा सकता है। 6
टाइल, टेंसर डेटा और गणना का एक ऐसा छोटा ब्लॉक है जिसे हार्डवेयर पर अपेक्षाकृत आसानी से शेड्यूल किया जा सकता है। हर फ्रंट एंड को प्रत्येक डेटा ट्रांसफर, मेमोरी स्तर, सिंक्रोनाइजेशन पॉइंट और हार्डवेयर निर्देश का अलग विवरण देने के बजाय AscendNPU IR एक साझा टाइल-केंद्रित प्रतिनिधित्व उपलब्ध कराता है।
ऊपरी स्तरों पर यह टेंसर ऑपरेशन को सरल रूप में व्यक्त करने देता है। निचले स्तरों पर यही टाइल GM, UB, L1 और L0 जैसे मेमोरी स्तरों तथा Vector, Cube और डेटा-मूवमेंट संसाधनों से जोड़ी जा सकती है। 5
22
इससे पोर्टेबिलिटी और परफॉर्मेंस ट्यूनिंग के बीच समझौता संभव होता है। Triton या किसी फ्रेमवर्क का फ्रंट एंड एक साझा कंपाइलर फाउंडेशन को लक्ष्य बना सकता है, जबकि अधिक प्रदर्शन की जरूरत वाले ऑपरेटर HIVM जैसे हार्डवेयर-सचेत स्तर तक नीचे जाकर बारीक ट्यून किए जा सकते हैं। आधिकारिक आर्किटेक्चर दस्तावेज Ascend निर्देशों, कोर-लोकल संसाधनों, इंटर-कोर संसाधनों और सिस्टम-ऑन-चिप संसाधनों को क्रमशः मॉडल करने वाली अलग-अलग, डिकपल्ड अमूर्त परतों का वर्णन करता है। 11
HFusion इस दो-स्तरीय मॉडल की अपेक्षाकृत हार्डवेयर-स्वतंत्र परत है। यह टेंसर ऑपरेशनों को ऊंचे स्तर पर व्यक्त करती है और फ्यूजन, बफराइजेशन, टाइलिंग, ब्लॉकिंग तथा शेड्यूलिंग जैसे बदलाव लागू करती है। 11
22
यहीं कई ऑपरेशनों को एक साथ जोड़ा जा सकता है और बड़ी गणना को ऐसे टाइलों में बांटा जा सकता है जो लक्ष्य हार्डवेयर के एक्जीक्यूशन मॉडल के अनुकूल हों। इसका उद्देश्य उच्च-स्तरीय अर्थ को बनाए रखते हुए Ascend-विशिष्ट लोअरिंग के लिए गणना तैयार करना है।
HIVM टाइल एक्सप्रेशन को Ascend की कंप्यूट यूनिट, स्टोरेज हायरार्की और पाइपलाइन व्यवहार से जुड़े ऑपरेशनों में बदलता है। इसके प्रमुख कामों में शामिल हैं:
इस विभाजन से कंपाइलर हार्डवेयर से दो अलग दूरियों पर ऑप्टिमाइज़ कर सकता है। HFusion व्यापक टेंसर संरचना और फ्यूजन अवसरों पर विचार करता है, जबकि HIVM यह तय करने के करीब जाता है कि किसी टाइल को चलाने के लिए वास्तविक मेमोरी और एक्जीक्यूशन संसाधनों का इस्तेमाल कैसे होगा।
HFusion और HIVM का मूल विभाजन Ascend 950 में भी बना रहता है, लेकिन HIVM को पहले के मेमोरी-आधारित SIMD मॉडल से आगे बढ़कर रजिस्टर-आधारित SIMD और SIMT को भी संभालना पड़ता है। 2
इस मॉडल में डेटा ऑन-चिप मेमोरी से रजिस्टरों में लाया जाता है, वहीं प्रोसेस किया जाता है और फिर वापस लिखा जाता है। यदि गणना इसकी अनुमति दे, तो रजिस्टर-स्तरीय फ्यूजन कई ऑपरेशनों के बीच इंटरमीडिएट वैल्यू को रजिस्टर में बनाए रख सकता है। इससे बार-बार होने वाले लोड और स्टोर कम हो सकते हैं। 2
SIMT उन ऑपरेटर हिस्सों के लिए उपयोगी हो सकता है जिनमें अनियमित मेमोरी एक्सेस या अलग-अलग नियंत्रण प्रवाह दिखाई देता है। वर्णित तरीका ऐसे हिस्सों को SIMT के लिए अलग करता है, घने और SIMD-अनुकूल काम पर अलग वेक्टराइजेशन लागू करता है और फिर परिणामों को व्यापक वेक्टर गणना में जोड़ता है। 2
प्रस्तुति में Cube–Vector इंटरैक्शन में बदलाव पर भी जोर दिया गया। पुराने A2/A3 फ्लो में Cube और Vector गणना के बीच कुछ डेटा आदान-प्रदान Global Memory के जरिए होता था। Ascend 950 पर समर्थित रास्तों में Cube के L0C परिणामों को Vector की ऑन-चिप मेमोरी तक और Vector परिणामों को वापस Cube मेमोरी तक ले जाया जा सकता है। इससे दोनों एक्जीक्यूशन डोमेन के बीच डेटा की दूरी कम होती है। 2
यह उन ऑपरेटरों के लिए महत्वपूर्ण हो सकता है जिनमें मैट्रिक्स-केंद्रित Cube काम के बाद वेक्टर प्रोसेसिंग होती है। हालांकि, जब Cube और Vector ऑपरेशन अलग-अलग कंट्रोल-फ्लो ब्रांच में हों, तब कंपाइलर को यह सुनिश्चित करना पड़ता है कि टेंसर कहां मौजूद है और ट्रांसफर कब आवश्यक है।
AscendNPU IR के कई नामित पास बताते हैं कि यह अमूर्तता वास्तविक मेमोरी और शेड्यूलिंग निर्णयों में कैसे बदलती है।
InsertCVLoadStoreबेहतर बनाया गया InsertCVLoadStore फ्लो जटिल कंट्रोल फ्लो में Cube–Vector संचार का विश्लेषण करता है। यह केवल स्थानीय पैटर्न देखकर ट्रांसफर डालने के बजाय मेमोरी-लोकेशन एंकर तय करता है—जैसे मैट्रिक्स इनपुट को L1, मैट्रिक्स आउटपुट को L0C और वेक्टर डेटा को UB में रखना। इसके बाद इन बाधाओं को पूरे प्रोग्राम में आगे-पीछे प्रसारित किया जाता है और जहां मेमोरी डोमेन में टकराव हो, वहां जरूरी कॉपी या कन्वर्जन डाले जाते हैं। 2
A2/A3 में ऐसे कुछ क्रॉसिंग Global Memory लोड और स्टोर से संभाले जा सकते हैं, जबकि Ascend 950 समर्थित स्थितियों में अधिक सीधे ऑन-चिप रास्तों का इस्तेमाल कर सकता है। 2
MultiBufferMultiBuffer किसी मौजूदा टेंसर की कई प्रतियां दर्शाता है। इससे ping-pong buffering संभव होती है और, उपलब्ध मेमोरी तथा शेड्यूल के आधार पर, डेटा मूवमेंट और गणना को ओवरलैप करने में मदद मिल सकती है। 17
18
AutoBlockify और DynamicCVPipelineAutoBlockify और DynamicCVPipeline Triton-Ascend स्टैक में मौजूद Ascend-विशिष्ट पासों में शामिल हैं। इनके नाम दो अहम कामों की ओर संकेत करते हैं—गणना को एक्जीक्यूटेबल ब्लॉकों में बांटना और Cube–Vector पाइपलाइन व्यवहार तैयार करना। 19
दस्तावेजीकृत फीचर सेट में ऑटोमैटिक मेमोरी प्लानिंग, सिंक्रोनाइजेशन, शेड्यूलिंग और Cube–Vector ऑप्टिमाइजेशन भी शामिल हैं। 24
प्रस्तुति में एक संबंधित Ascend कॉन्फिगरेशन के लिए एक Cube और दो Vector कोर के संबंध का वर्णन किया गया। AutoSubTiling Vector काम को इस तरह बांट सकता है कि दोनों Vector कोर अलग-अलग हिस्सों को समानांतर रूप से प्रोसेस करें। 2
14
Huawei ने AscendNPU IR के साथ Triton-Ascend को भी कम्युनिटी को-डेवलपमेंट के लिए ओपन सोर्स किया है। Triton-Ascend, Ascend प्लेटफॉर्म के लिए तैयार Triton कंपाइलिंग फ्रेमवर्क है। यह Triton की मूल सिंटैक्स को बनाए रखते हुए A2, A3 और 950 सीरीज के लिए Ascend-विशिष्ट कंपाइलिंग और डिप्लॉयमेंट सपोर्ट जोड़ता है। 30
37
इस रिलीज से उन डेवलपर्स के लिए रास्ता खुलता है जो पूरी कंपाइलर चेन खुद बनाने के बजाय कंपाइलर पास, फ्रंट-एंड इंटीग्रेशन, ऑपरेटर लोअरिंग या हार्डवेयर-सचेत ऑप्टिमाइजेशन पर काम करना चाहते हैं। उपलब्ध जानकारी के अनुसार कम्युनिटी प्रोग्राम में रिपॉजिटरी से जुड़े इंटर्नशिप अवसर और टास्क-आधारित रिवॉर्ड शामिल हैं। डेवलपर सूचीबद्ध टास्क क्लेम कर सकते हैं और नियमों के अनुसार पूरा काम जमा कर सकते हैं। 31
जिन डेवलपर्स के पास स्थानीय Ascend हार्डवेयर नहीं है, वे Ascend कम्युनिटी के HiDevLab क्लाउड एनवायरनमेंट का इस्तेमाल कर सकते हैं। रिपोर्ट के अनुसार इसमें 100 घंटे की मुफ्त कंप्यूट सुविधा दी जाती है। हालांकि उपलब्ध स्रोत पात्रता, वेरिफिकेशन, समय-सीमा या क्षेत्रीय उपलब्धता की सभी शर्तें स्पष्ट नहीं करते, इसलिए रजिस्ट्रेशन के समय नवीनतम नियम जांचना जरूरी होगा। 31
AscendNPU IR का मुख्य प्रस्ताव आर्किटेक्चर से जुड़ा है: Ascend हार्डवेयर को सामान्य कंपाइलर एंट्री पॉइंट्स के जरिए अधिक सुलभ बनाना, लेकिन जरूरत पड़ने पर गहरे हार्डवेयर ट्यूनिंग का रास्ता भी खुला रखना। Triton, TileLang और फ्रेमवर्क IR ऊंचे अमूर्तता स्तर से प्रवेश कर सकते हैं; HFusion व्यापक फ्यूजन और शेड्यूलिंग कर सकता है; और HIVM टाइलों को Ascend डिवाइस के लिए जरूरी मेमोरी, कोर, संचार और पाइपलाइन निर्णयों में बदल सकता है। 5
11
Ascend 950 रजिस्टर-आधारित SIMD, SIMT और अधिक सीधे Cube–Vector डेटा पथों के जरिए ऑप्टिमाइजेशन की संभावनाएं बढ़ाता है। फिर भी वास्तविक प्रदर्शन ऑपरेटर के आकार, मेमोरी दबाव, कंट्रोल फ्लो, कंपाइलर की परिपक्वता और लक्षित चिप पर निर्भर करेगा। ओपन-सोर्स स्टैक इन तकनीकी समझौतों को अधिक पारदर्शी बनाता है और कंपाइलर तथा ऑपरेटर डेवलपर्स को उन्हें बेहतर बनाने में सीधे योगदान देने का अवसर देता है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Huawei ने AscendNPU IR को BiSheng कंपाइलर की MLIR आधारित कंपाइलिंग नींव के रूप में ओपन सोर्स किया है। इसकी जानकारी AscendNPU IR आर्किटेक्ट Hai Lijuan ने 1 अगस्त 2026 को HyperAI के Meet AI Compiler तकनीकी सैलून में दी।...
Huawei ने AscendNPU IR को BiSheng कंपाइलर की MLIR आधारित कंपाइलिंग नींव के रूप में ओपन सोर्स किया है। इसकी जानकारी AscendNPU IR आर्किटेक्ट Hai Lijuan ने 1 अगस्त 2026 को HyperAI के Meet AI Compiler तकनीकी सैलून में दी।... HFusion अपेक्षाकृत हार्डवेयर स्वतंत्र स्तर पर फ्यूजन, टाइलिंग और शेड्यूलिंग करता है, जबकि HIVM Cube और Vector कोर, ऑन चिप मेमोरी, पाइपलाइन और निर्देशों के स्तर पर हार्डवेयर सचेत लोअरिंग संभालता है। [11][22]
Ascend 950 के लिए स्टैक में रजिस्टर आधारित SIMD, SIMT और Cube–Vector के बीच अधिक सीधे ऑन चिप डेटा आदान प्रदान जैसी क्षमताएं शामिल हैं। [2]