Instella-MoE käyttää jaettujen ja reititettyjen asiantuntijoiden konfiguraatiota, jossa on 2 aina aktiivista jaettua asiantuntijaa ja 6 reititettyä asiantuntijaa, jotka valitaan 64 asiantuntijan joukosta tokenia kohden . Mallissa on 27 dekooderikerrosta, kussakin piilotettu koko 2 048 . Kaksi arkkitehtuurista innovaatiota erottuvat edukseen:
Malli käyttää myös monen tokenin ennustus (MTP) -tavoitetta esi- ja keskivaiheen koulutuksen aikana .
Omistetun pitkän kontekstin laajennuskoulutuksen jälkeen Instella-MoE tukee 64 000 tokenin kontekstia .
AMD julkaisi täydellisen koulutusputken, joka koostuu kuudesta peräkkäisestä vaiheesta :
Instella-MoE-16B-A3B -perusmalli saavutti keskiarvon 76,7 standardoiduissa vertailutesteissä, sijoittuen parhaiden täysin avoimien mallien joukossa omassa koossaan . Sen raportoitiin päihittävän SmolLM3-3B- ja OLMo-3-7B-mallit, ja se kilpaili suurempien mallien kanssa huolimatta siitä, että se aktivoi vain 2,8 miljardia parametria tokenia kohden .
Sitoutuneena avoimeen tekoälyyn AMD julkaisi kaikki koulutusartefaktit avoimesti :
Kaikki artefaktit ovat saatavilla Hugging Facessa nimiavaruudessa amd/Instella-MoE-16B-A3B, lisensoituina Research RAIL (Responsible AI License) -lisenssillä akateemisiin ja tutkimustarkoituksiin .
Instella-MoE on enemmän kuin vain mallijulkaisu – se on suora todiste siitä, että AMD:n ROCm-ohjelmistopino ja Instinct-laitteisto kykenevät tukemaan huipputason tekoälykehitystä esikoulutuksesta RL:ään täysin avointa infrastruktuuria hyödyntäen. Tarjoamalla kilpailukykyisiä vertailutuloksia Nvidian laitteistolla koulutettuja johtavia avoimen lähdekoodin malleja vastaan AMD asemoi ekosysteemsinsä varteenotettavaksi vaihtoehdoksi Nvidian CUDA:lle laajamittaisessa tekoälytutkimuksessa ja -kehityksessä .