Instella-MoE, paylaşımlı artı yönlendirilmiş uzman konfigürasyonu kullanır. Her bir token için 2'si her zaman aktif paylaşımlı uzman ve 64'lük bir havuzdan seçilen 6 yönlendirilmiş uzman olmak üzere toplam 27 kod çözücü katmanından oluşur . Modeldeki iki önemli mimari yenilik şunlardır:
Model ayrıca ön eğitim ve orta eğitim aşamalarında Multi-Token Prediction (MTP) hedefini kullanır .
Özel bir uzun bağlam genişletme eğitim aşamasının ardından Instella-MoE, 64K token uzunluğunda bir bağlamı destekler .
AMD, altı aşamadan oluşan tam eğitim hattını yayınladı :
Instella-MoE-16B-A3B temel modeli, standart kıyaslamalarda 76.7 ortalama puan elde ederek, kendi ölçeğindeki en iyi tamamen açık modeller arasında yer aldı . Bildirilenlere göre, SmolLM3-3B ve OLMo-3-7B modellerini geride bırakırken, token başına yalnızca 2.8 milyar parametreyi aktif hale getirmesine rağmen daha büyük modellerle rekabet etti .
AMD, açık yapay zekaya olan bağlılığı doğrultusunda tüm eğitim yapıtlarını açıkça yayınladı :
Tüm yapıtlar, Hugging Face'te amd/Instella-MoE-16B-A3B ad alanında mevcut olup, Araştırma RAIL (Sorumlu Yapay Zeka Lisansı) kapsamında akademik ve araştırma amaçları için lisanslanmıştır .
Instella-MoE, bir model sürümünden daha fazlasıdır. Bu, AMD'nin ROCm yazılım yığını ve Instinct GPU donanımının, tamamen açık bir altyapı kullanarak ön eğitimden RL'ye kadar sınır ölçeğinde yapay zeka gelişimini destekleyebileceğinin doğrudan bir kanıtıdır. NVIDIA donanımında eğitilmiş önde gelen açık kaynak modellere karşı rekabetçi kıyaslamalar sunarak AMD, ekosistemini büyük ölçekli yapay zeka araştırma ve geliştirmesi için NVIDIA'nın CUDA'sına uygun bir alternatif olarak konumlandırıyor .