AMD ने 24 जुलाई 2026 को Instella MoE लॉन्च किया, जो एक पूरी तरह से ओपन 16 बिलियन पैरामीटर वाला Mixture of Experts (MoE) भाषा मॉडल है। यह AMD के अपने Instinct MI300X और MI325X GPUs पर ROCm सॉफ्टवेयर स्टैक के साथ स्क्रै... इस मॉडल की खास बात यह है कि यह प्रति टोकन सिर्फ 2.8 बिलियन पैरामीटर को एक्टिवेट करता है, जिससे य...

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What are the key details of AMD's July 24 release of Instella-MoE, a fully open 16-billion-parame. Article summary: Here are the key verified details of AMD's Instella-MoE release, based primarily on the official AMD ROCm blog post (July 24, 2026) and corroborating news sources.. Topic tags: general, academic, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails
24 जुलाई 2026 को, AMD ने Instella-MoE की घोषणा की - यह एक पूरी तरह से खुला (fully open) 16 बिलियन पैरामीटर वाला Mixture-of-Experts (MoE) भाषा मॉडल है, जिसे पूरी तरह से स्क्रैच से AMD Instinct MI300X और MI325X GPUs पर ROCm सॉफ्टवेयर स्टैक का उपयोग करके प्रशिक्षित किया गया है । यह मॉडल प्रति टोकन केवल 2.8 बिलियन पैरामीटर को सक्रिय करता है, जो इसे अत्यधिक कुशल बनाता है, साथ ही प्रतिस्पर्धी बेंचमार्क प्रदर्शन भी देता है। यह रिलीज़ एक रणनीतिक मील का पत्थर है, जो दर्शाता है कि AMD का हार्डवेयर और ओपन-सोर्स सॉफ्टवेयर स्टैक प्री-ट्रेनिंग से लेकर रीइन्फोर्समेंट लर्निंग तक बड़े पैमाने पर AI विकास का समर्थन कर सकता है, जो दबदबे वाले NVIDIA CUDA इकोसिस्टम को चुनौती देता है
।
Instella-MoE एक shared-plus-routed expert कॉन्फ़िगरेशन का उपयोग करता है, जिसमें 2 हमेशा सक्रिय रहने वाले शेयर्ड एक्सपर्ट और प्रति टोकन 64 के पूल में से चुने गए 6 रूटेड एक्सपर्ट शामिल होते हैं । मॉडल में 27 डिकोडर लेयर हैं, जिनमें से प्रत्येक का छिपा हुआ आकार (hidden size) 2,048 है
। दो आर्किटेक्चरल इनोवेशन खास तौर पर उल्लेखनीय हैं:
मॉडल अपने प्री-ट्रेनिंग और मिड-ट्रेनिंग चरणों के दौरान मल्टी-टोकन प्रेडिक्शन (MTP) ऑब्जेक्टिव का भी उपयोग करता है ।
एक समर्पित लॉन्ग-कॉन्टेक्स्ट एक्सटेंशन ट्रेनिंग चरण के बाद, Instella-MoE 64K-टोकन कॉन्टेक्स्ट को सपोर्ट करता है ।
AMD ने पूरी ट्रेनिंग पाइपलाइन प्रकाशित की, जिसमें छह क्रमिक चरण शामिल हैं :
Instella-MoE-16B-A3B बेस मॉडल ने मानक बेंचमार्क पर 76.7 का औसत स्कोर हासिल किया, जो इसे अपने पैमाने पर शीर्ष पूरी तरह से खुले मॉडलों में स्थान देता है । यह कथित तौर पर SmolLM3-3B और OLMo-3-7B से बेहतर प्रदर्शन करता है, और प्रति टोकन केवल 2.8 बिलियन पैरामीटर को सक्रिय करने के बावजूद बड़े मॉडलों के साथ प्रतिस्पर्धा करता है
।
खुले AI के प्रति अपनी प्रतिबद्धता के अनुरूप, AMD ने सभी प्रशिक्षण आर्टिफैक्ट्स को खुले तौर पर जारी किया :
सभी आर्टिफैक्ट हगिंग फेस पर amd/Instella-MoE-16B-A3B नेमस्पेस के तहत Research RAIL (Responsible AI License) के अंतर्गत अकादमिक और अनुसंधान उद्देश्यों के लिए उपलब्ध हैं ।
Instella-MoE केवल एक मॉडल रिलीज़ से कहीं अधिक है - यह एक प्रत्यक्ष प्रमाण है कि AMD का ROCm सॉफ्टवेयर स्टैक और Instinct GPU हार्डवेयर पूरी तरह से खुले बुनियादी ढांचे का उपयोग करके फ्रंटियर-स्केल AI विकास का समर्थन कर सकता है। NVIDIA हार्डवेयर पर प्रशिक्षित प्रमुख ओपन-सोर्स मॉडलों के मुकाबले प्रतिस्पर्धी बेंचमार्क देकर, AMD अपने इकोसिस्टम को बड़े पैमाने पर AI अनुसंधान और विकास के लिए NVIDIA के CUDA के एक व्यवहार्य विकल्प के रूप में स्थापित करता है ।
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
AMD ने 24 जुलाई 2026 को Instella MoE लॉन्च किया, जो एक पूरी तरह से ओपन 16 बिलियन पैरामीटर वाला Mixture of Experts (MoE) भाषा मॉडल है। यह AMD के अपने Instinct MI300X और MI325X GPUs पर ROCm सॉफ्टवेयर स्टैक के साथ स्क्रै...
AMD ने 24 जुलाई 2026 को Instella MoE लॉन्च किया, जो एक पूरी तरह से ओपन 16 बिलियन पैरामीटर वाला Mixture of Experts (MoE) भाषा मॉडल है। यह AMD के अपने Instinct MI300X और MI325X GPUs पर ROCm सॉफ्टवेयर स्टैक के साथ स्क्रै... इस मॉडल की खास बात यह है कि यह प्रति टोकन सिर्फ 2.8 बिलियन पैरामीटर को एक्टिवेट करता है, जिससे यह बेहद कुशल बनता है। इसमें Gated Multi head Latent Attention (Gated MLA) और FarSkip Collective जैसी नई आर्किटेक्चरल इनोवे...
Instella MoE ने बेंचमार्क टेस्ट में SmolLM3 3B और OLMo 3 7B जैसे मॉडलों को पीछे छोड़ते हुए 76.7 का औसत स्कोर हासिल किया। इसके सभी आर्टिफैक्ट्स मॉडल वेट्स, ट्रेनिंग कॉन्फ़िगरेशन, और कोड हगिंग फेस पर Research RAIL लाइसे...