Instella-MoE benytter en delt-og-ruterkonfigurasjon med 2 alltid aktive delte eksperter og 6 ruterte eksperter valgt fra en pool på 64 per token . Modellen består av 27 dekoderlag, hver med en skjult dimensjon på 2 048 . To arkitektoniske nyvinninger skiller seg ut:
Modellen bruker også et Multi-Token Prediction (MTP) -mål under forhåndsopplærings- og mellomopplæringsfasene .
Etter en dedikert treningsfase for utvidelse av lang kontekst støtter Instella-MoE et 64K-token kontekstvindu .
AMD publiserte hele opplæringspipelinen, som består av seks sekvensielle trinn :
Instella-MoE-16B-A3B-basismodellen oppnådde en gjennomsnittlig poengsum på 76,7 på standard benchmark-tester, noe som plasserer den blant de beste fullstendig åpne modellene i sin klasse . Den skal ha prestert bedre enn SmolLM3-3B og OLMo-3-7B, og konkurrert med større modeller til tross for at den bare aktiverer 2,8 milliarder parametre per token .
I tråd med sitt engasjement for åpen KI, frigjorde AMD alle treningsartefakter åpent :
Alle artefakter er tilgjengelige på Hugging Face under navnerommet amd/Instella-MoE-16B-A3B, lisensiert under en Research RAIL (Responsible AI License) for akademiske og forskningsformål .
Instella-MoE er mer enn bare en modell – det er et direkte bevis på at AMDs ROCm-programvarestakk og Instinct-GPU-maskinvare kan støtte avansert KI-utvikling, fra forhåndsopplæring til forsterkningsopplæring, ved hjelp av fullstendig åpen infrastruktur. Ved å levere konkurransedyktige benchmarkresultater mot ledende åpne modeller trent på Nvidia-maskinvare, posisjonerer AMD sitt økosystem som et levedyktig alternativ til Nvidias CUDA for storskala KI-forskning og -utvikling .