De architectuur van Instella-MoE is gebaseerd op een shared-plus-routed expert configuratie. Het model heeft 2 altijd actieve gedeelde experts en selecteert 6 gerouteerde experts uit een pool van 64 per token . Het model bestaat uit 27 decoderlagen, elk met een verborgen grootte van 2.048 . Twee architectuurinnovaties springen eruit:
Het model maakt ook gebruik van een Multi-Token Prediction (MTP) objective tijdens de pre-training en mid-training fasen .
Na een speciale trainingsfase voor lange contexten ondersteunt Instella-MoE een context van 64K tokens .
AMD heeft de volledige trainingspijplijn gepubliceerd, die uit zes opeenvolgende fasen bestaat :
Het Instella-MoE-16B-A3B basismodel behaalde een gemiddelde score van 76,7 op standaard benchmarks. Hiermee behoort het tot de best presterende volledig open modellen in zijn schaal. Het versloeg onder andere SmolLM3-3B en OLMo-3-7B, en concurreerde met grotere modellen, ondanks dat het slechts 2,8 miljard parameters per token activeert .
In lijn met de toewijding aan open AI heeft AMD alle trainingsartefacten openbaar gemaakt :
Alle artefacten zijn beschikbaar op Hugging Face onder de naamruimte amd/Instella-MoE-16B-A3B, en zijn gelicentieerd onder een Research RAIL (Responsible AI License) voor academische en onderzoeksdoeleinden .
Instella-MoE is meer dan alleen een modelrelease – het is een direct bewijs dat AMD's ROCm-softwarestack en Instinct GPU-hardware in staat zijn om AI-ontwikkeling op topniveau te ondersteunen, van pre-training tot RL, met volledig open infrastructuur. Door concurrerende benchmarks te leveren tegen toonaangevende open-source modellen die op Nvidia-hardware zijn getraind, positioneert AMD zichzelf als een geloofwaardig alternatief voor Nvidia's CUDA voor grootschalig AI-onderzoek en -ontwikkeling .