يعتمد Instella-MoE على تكوين خبراء مشتركين وموجهين، حيث يضم خبيرين مشتركين نشطين دائمًا و6 خبراء يتم توجيههم من مجموعة تضم 64 خبيرًا لكل رمز . يتكون النموذج من 27 طبقة لفك التشفير، كل طبقة بحجم خفي يبلغ 2,048 . هناك ابتكاران معماريان رئيسيان:
كما يستخدم النموذج أسلوب التنبؤ متعدد الرموز (Multi-Token Prediction – MTP) خلال مرحلتي التدريب الأولي والمتوسط .
بعد مرحلة تدريب مخصصة لتمديد السياق الطويل، يدعم نموذج Instella-MoE نافذة سياق يصل طولها إلى 64 ألف رمز .
نشرت AMD بالكامل مسار التدريب الكامل للنموذج، والذي يتكون من ست مراحل متتالية :
حقق النموذج الأساسي Instella-MoE-16B-A3B متوسط درجات 76.7 على المعايير القياسية، مما يضعه بين أفضل النماذج المفتوحة بالكامل في فئته . وبحسب التقارير، فقد تفوق على نموذجي SmolLM3-3B وOLMo-3-7B، ونافس نماذج أكبر حجمًا على الرغم من أنه لا ينشط سوى 2.8 مليار معلمة لكل رمز .
التزامًا منها بمبدأ الذكاء الاصطناعي المفتوح، أصدرت AMD جميع مخرجات التدريب بشكل علني :
جميع المخرجات متاحة على منصة Hugging Face تحت مساحة amd/Instella-MoE-16B-A3B، ومرخصة بموجب رخصة Research RAIL (رخصة الذكاء الاصطناعي المسؤولة) لأغراض أكاديمية وبحثية .
يمثل إطلاق Instella-MoE أكثر من مجرد نموذج جديد؛ إنه إثبات مباشر على أن حزمة برامج ROCm وأجهزة معالجات Instinct من AMD قادرة على دعم تطوير الذكاء الاصطناعي على نطاق عالمي، من مرحلة ما قبل التدريب وحتى التعلم المعزز، باستخدام بنية تحتية مفتوحة بالكامل. من خلال تقديم معايير أداء منافسة لنماذج رائدة مفتوحة المصدر تم تدريبها على أجهزة Nvidia، تضع AMD نظامها البيئي كبديل عملي لنظام CUDA من Nvidia للبحث والتطوير في مجال الذكاء الاصطناعي على نطاق واسع .