AMD julkisti 24. heinäkuuta 2026 Instella MoE:n – täysin avoimen 16 miljardin parametrin asiantuntijamallin, joka aktivoi ainoastaan 2,8 miljardia parametria tokenia kohden ja on koulutettu kokonaan AMD Instinct MI300...

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What are the key details of AMD's July 24 release of Instella-MoE, a fully open 16-billion-parame. Article summary: Here are the key verified details of AMD's Instella-MoE release, based primarily on the official AMD ROCm blog post (July 24, 2026) and corroborating news sources.. Topic tags: general, academic, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails
AMD julkisti 24. heinäkuuta 2026 Instella-MoE-mallin, täysin avoimen 16 miljardin parametrin sekoitettu asiantuntijamalli (MoE, mixture-of-experts), joka on koulutettu alusta loppuun AMD Instinct MI300X- ja MI325X -näytönohjaimilla ROCm-ohjelmistopinoa hyödyntäen . Malli aktivoi ainoastaan 2,8 miljardia parametria kutakin tokenia kohden, mikä tekee siitä erittäin tehokkaan – silti se yltää kilpailukykyisiin tuloksiin vertailutesteissä. Julkaisu on strateginen virstanpylväs, sillä se osoittaa, että AMD:n laitteisto ja avoimen lähdekoodin ohjelmistopino kykenevät tukemaan laajamittaista tekoälyn kehitystä esikoulutuksesta vahvistusoppimiseen, haastaen Nvidian hallitsevan CUDA-ekosysteemin
.
Instella-MoE käyttää jaettujen ja reititettyjen asiantuntijoiden konfiguraatiota, jossa on 2 aina aktiivista jaettua asiantuntijaa ja 6 reititettyä asiantuntijaa, jotka valitaan 64 asiantuntijan joukosta tokenia kohden . Mallissa on 27 dekooderikerrosta, kussakin piilotettu koko 2 048
. Kaksi arkkitehtuurista innovaatiota erottuvat edukseen:
Malli käyttää myös monen tokenin ennustus (MTP) -tavoitetta esi- ja keskivaiheen koulutuksen aikana .
Omistetun pitkän kontekstin laajennuskoulutuksen jälkeen Instella-MoE tukee 64 000 tokenin kontekstia .
AMD julkaisi täydellisen koulutusputken, joka koostuu kuudesta peräkkäisestä vaiheesta :
Instella-MoE-16B-A3B -perusmalli saavutti keskiarvon 76,7 standardoiduissa vertailutesteissä, sijoittuen parhaiden täysin avoimien mallien joukossa omassa koossaan . Sen raportoitiin päihittävän SmolLM3-3B- ja OLMo-3-7B-mallit, ja se kilpaili suurempien mallien kanssa huolimatta siitä, että se aktivoi vain 2,8 miljardia parametria tokenia kohden
.
Sitoutuneena avoimeen tekoälyyn AMD julkaisi kaikki koulutusartefaktit avoimesti :
Kaikki artefaktit ovat saatavilla Hugging Facessa nimiavaruudessa amd/Instella-MoE-16B-A3B, lisensoituina Research RAIL (Responsible AI License) -lisenssillä akateemisiin ja tutkimustarkoituksiin .
Instella-MoE on enemmän kuin vain mallijulkaisu – se on suora todiste siitä, että AMD:n ROCm-ohjelmistopino ja Instinct-laitteisto kykenevät tukemaan huipputason tekoälykehitystä esikoulutuksesta RL:ään täysin avointa infrastruktuuria hyödyntäen. Tarjoamalla kilpailukykyisiä vertailutuloksia Nvidian laitteistolla koulutettuja johtavia avoimen lähdekoodin malleja vastaan AMD asemoi ekosysteemsinsä varteenotettavaksi vaihtoehdoksi Nvidian CUDA:lle laajamittaisessa tekoälytutkimuksessa ja -kehityksessä .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
AMD julkisti 24. heinäkuuta 2026 Instella MoE:n – täysin avoimen 16 miljardin parametrin asiantuntijamallin, joka aktivoi ainoastaan 2,8 miljardia parametria tokenia kohden ja on koulutettu kokonaan AMD Instinct MI300...
AMD julkisti 24. heinäkuuta 2026 Instella MoE:n – täysin avoimen 16 miljardin parametrin asiantuntijamallin, joka aktivoi ainoastaan 2,8 miljardia parametria tokenia kohden ja on koulutettu kokonaan AMD Instinct MI300... Mallin uudet arkkitehtuuriset innovaatiot – Gated Multi head Latent Attention (Gated MLA) ja FarSkip Collective – nopeuttivat esikoulutusta 12,7 prosenttia.
Kaikki koulutusvaiheiden painot, konfiguraatiot, välitarkistuspisteet ja päättelykoodi on julkaistu avoimesti Hugging Facessa Research RAIL lisenssillä.