Instella-MoE anvender en shared-plus-routed expert-konfiguration med 2 altid aktive delte eksperter og 6 routede eksperter udvalgt fra en pulje på 64 pr. token . Modellen består af 27 decoder-lag med en skjult størrelse på 2.048 . To arkitektoniske innovationer skiller sig ud:
Modellen bruger også et Multi-Token Prediction (MTP)-mål under præ-træning og midt-træning .
Efter en dedikeret træningsfase til forlængelse af konteksten understøtter Instella-MoE en 64K-tokens kontekst .
AMD offentliggjorde den komplette træningspipeline, som består af seks sekventielle faser :
Instella-MoE-16B-A3B-basismodellen opnåede en gennemsnitlig score på 76,7 på standardbenchmarks, hvilket placerer den blandt de bedste fuldt åbne modeller på dens skala . Den overgik angiveligt SmolLM3-3B og OLMo-3-7B og konkurrerede med større modeller på trods af kun at aktivere 2,8 milliarder parametre pr. token .
I tråd med sin forpligtelse til åben AI frigav AMD alle træningsartefakter åbent :
Alle artefakter er tilgængelige på Hugging Face under amd/Instella-MoE-16B-A3B-navnerummet og er licenseret under en Research RAIL (Responsible AI License) til akademiske og forskningsmæssige formål .
Instella-MoE er mere end blot en modeludgivelse – det er et direkte bevis på, at AMDs ROCm-softwarestak og Instinct-GPU-hardware kan understøtte frontlinje-AI-udvikling, fra præ-træning til RL, ved hjælp af fuldt åben infrastruktur. Ved at levere konkurrencedygtige benchmarks mod førende open source-modeller trænet på Nvidia-hardware positionerer AMD sit økosystem som et levedygtigt alternativ til Nvidias CUDA til storstilet AI-forskning og -udvikling .