Instella-MoE एक shared-plus-routed expert कॉन्फ़िगरेशन का उपयोग करता है, जिसमें 2 हमेशा सक्रिय रहने वाले शेयर्ड एक्सपर्ट और प्रति टोकन 64 के पूल में से चुने गए 6 रूटेड एक्सपर्ट शामिल होते हैं । मॉडल में 27 डिकोडर लेयर हैं, जिनमें से प्रत्येक का छिपा हुआ आकार (hidden size) 2,048 है । दो आर्किटेक्चरल इनोवेशन खास तौर पर उल्लेखनीय हैं:
मॉडल अपने प्री-ट्रेनिंग और मिड-ट्रेनिंग चरणों के दौरान मल्टी-टोकन प्रेडिक्शन (MTP) ऑब्जेक्टिव का भी उपयोग करता है ।
एक समर्पित लॉन्ग-कॉन्टेक्स्ट एक्सटेंशन ट्रेनिंग चरण के बाद, Instella-MoE 64K-टोकन कॉन्टेक्स्ट को सपोर्ट करता है ।
AMD ने पूरी ट्रेनिंग पाइपलाइन प्रकाशित की, जिसमें छह क्रमिक चरण शामिल हैं :
Instella-MoE-16B-A3B बेस मॉडल ने मानक बेंचमार्क पर 76.7 का औसत स्कोर हासिल किया, जो इसे अपने पैमाने पर शीर्ष पूरी तरह से खुले मॉडलों में स्थान देता है । यह कथित तौर पर SmolLM3-3B और OLMo-3-7B से बेहतर प्रदर्शन करता है, और प्रति टोकन केवल 2.8 बिलियन पैरामीटर को सक्रिय करने के बावजूद बड़े मॉडलों के साथ प्रतिस्पर्धा करता है ।
खुले AI के प्रति अपनी प्रतिबद्धता के अनुरूप, AMD ने सभी प्रशिक्षण आर्टिफैक्ट्स को खुले तौर पर जारी किया :
सभी आर्टिफैक्ट हगिंग फेस पर amd/Instella-MoE-16B-A3B नेमस्पेस के तहत Research RAIL (Responsible AI License) के अंतर्गत अकादमिक और अनुसंधान उद्देश्यों के लिए उपलब्ध हैं ।
Instella-MoE केवल एक मॉडल रिलीज़ से कहीं अधिक है - यह एक प्रत्यक्ष प्रमाण है कि AMD का ROCm सॉफ्टवेयर स्टैक और Instinct GPU हार्डवेयर पूरी तरह से खुले बुनियादी ढांचे का उपयोग करके फ्रंटियर-स्केल AI विकास का समर्थन कर सकता है। NVIDIA हार्डवेयर पर प्रशिक्षित प्रमुख ओपन-सोर्स मॉडलों के मुकाबले प्रतिस्पर्धी बेंचमार्क देकर, AMD अपने इकोसिस्टम को बड़े पैमाने पर AI अनुसंधान और विकास के लिए NVIDIA के CUDA के एक व्यवहार्य विकल्प के रूप में स्थापित करता है ।