Instella-MoE využívá konfiguraci sdílených a směrovaných expertů se 2 vždy aktivními sdílenými experty a 6 směrovanými experty, kteří jsou vybíráni z celkového fondu 64 expertů na každý token . Model se skládá z 27 dekodérových vrstev, každá s hidden size 2 048 . Dvě architektonické novinky stojí za pozornost:
Model také během předtréninku a středního tréninku používá cíl Multi-Token Prediction (MTP) .
Po specializované fázi prodloužení kontextu podporuje Instella-MoE kontext o délce 64K tokenů .
AMD zveřejnilo kompletní tréninkový pipeline, který se skládá ze šesti na sebe navazujících fází :
Základní model Instella-MoE-16B-A3B dosáhl průměrného skóre 76,7 ve standardních benchmarcích, čímž se zařadil mezi nejlepší plně otevřené modely své velikosti . Podle dostupných informací překonal modely SmolLM3-3B a OLMo-3-7B a dokázal konkurovat i větším modelům, přestože aktivuje jen 2,8 miliardy parametrů na token .
V souladu se svým závazkem k otevřené AI AMD zveřejnilo všechny tréninkové artefakty :
Všechny artefakty jsou k dispozici na Hugging Face pod namespacem amd/Instella-MoE-16B-A3B a jsou licencovány pod Research RAIL (Responsible AI License) pro akademické a výzkumné účely .
Instella-MoE je víc než jen vydání modelu – je to přímý důkaz, že softwarový stack AMD ROCm a hardware Instinct GPU dokážou podpořit vývoj AI na špičkové úrovni, od předtréninku po reinforcement learning, s využitím zcela otevřené infrastruktury. Tím, že dosahuje konkurenceschopných výsledků v porovnání s předními open-source modely trénovanými na hardwaru Nvidia, staví AMD svůj ekosystém do role životaschopné alternativy k Nvidia CUDA pro rozsáhlý výzkum a vývoj v oblasti umělé inteligence .