Due innovazioni spiccano:
Il modello utilizza anche un obiettivo di Multi-Token Prediction (MTP) durante le fasi di pre-addestramento e mid-training .
Dopo una fase dedicata di estensione del contesto, Instella-MoE supporta una finestra di 64.000 token .
Il modello base Instella-MoE-16B-A3B ha ottenuto un punteggio medio di 76,7 nei benchmark standard, posizionandosi tra i migliori modelli completamente aperti della sua categoria . Secondo i report, ha superato SmolLM3-3B e OLMo-3-7B, competendo con modelli molto più grandi, nonostante attivasse solo 2,8 miliardi di parametri per token
.
Fedele al suo impegno per un'AI aperta, AMD ha rilasciato pubblicamente tutti gli artefatti dell'addestramento :
Tutti gli artefatti sono disponibili su Hugging Face sotto il namespace amd/Instella-MoE-16B-A3B, con licenza Research RAIL (Responsible AI License) per scopi accademici e di ricerca .
Instella-MoE non è solo un modello: è una prova concreta che l'hardware AMD Instinct e lo stack software ROCm possono supportare lo sviluppo di AI all'avanguardia, dalla pre-addestramento al RL, utilizzando un'infrastruttura completamente aperta. Con benchmark competitivi rispetto ai migliori modelli open-source addestrati su hardware Nvidia, AMD posiziona il proprio ecosistema come un'alternativa valida a CUDA per la ricerca e lo sviluppo di AI su larga scala .