Het model maakt ook gebruik van een Multi-Token Prediction (MTP) objective tijdens de pre-training en mid-training fasen .
Na een speciale trainingsfase voor lange contexten ondersteunt Instella-MoE een context van 64K tokens .
Het Instella-MoE-16B-A3B basismodel behaalde een gemiddelde score van 76,7 op standaard benchmarks. Hiermee behoort het tot de best presterende volledig open modellen in zijn schaal. Het versloeg onder andere SmolLM3-3B en OLMo-3-7B, en concurreerde met grotere modellen, ondanks dat het slechts 2,8 miljard parameters per token activeert .
Alle artefacten zijn beschikbaar op Hugging Face onder de naamruimte amd/Instella-MoE-16B-A3B, en zijn gelicentieerd onder een Research RAIL (Responsible AI License) voor academische en onderzoeksdoeleinden .
Instella-MoE is meer dan alleen een modelrelease – het is een direct bewijs dat AMD's ROCm-softwarestack en Instinct GPU-hardware in staat zijn om AI-ontwikkeling op topniveau te ondersteunen, van pre-training tot RL, met volledig open infrastructuur. Door concurrerende benchmarks te leveren tegen toonaangevende open-source modellen die op Nvidia-hardware zijn getraind, positioneert AMD zichzelf als een geloofwaardig alternatief voor Nvidia's CUDA voor grootschalig AI-onderzoek en -ontwikkeling .