Modellen bruker også et Multi-Token Prediction (MTP) -mål under forhåndsopplærings- og mellomopplæringsfasene .
Etter en dedikert treningsfase for utvidelse av lang kontekst støtter Instella-MoE et 64K-token kontekstvindu .
Instella-MoE-16B-A3B-basismodellen oppnådde en gjennomsnittlig poengsum på 76,7 på standard benchmark-tester, noe som plasserer den blant de beste fullstendig åpne modellene i sin klasse . Den skal ha prestert bedre enn SmolLM3-3B og OLMo-3-7B, og konkurrert med større modeller til tross for at den bare aktiverer 2,8 milliarder parametre per token
.
Alle artefakter er tilgjengelige på Hugging Face under navnerommet amd/Instella-MoE-16B-A3B, lisensiert under en Research RAIL (Responsible AI License) for akademiske og forskningsformål .
Instella-MoE er mer enn bare en modell – det er et direkte bevis på at AMDs ROCm-programvarestakk og Instinct-GPU-maskinvare kan støtte avansert KI-utvikling, fra forhåndsopplæring til forsterkningsopplæring, ved hjelp av fullstendig åpen infrastruktur. Ved å levere konkurransedyktige benchmarkresultater mot ledende åpne modeller trent på Nvidia-maskinvare, posisjonerer AMD sitt økosystem som et levedyktig alternativ til Nvidias CUDA for storskala KI-forskning og -utvikling .