Instella-MoE repose sur une configuration d'experts partagés et routés : 2 experts partagés toujours actifs et 6 experts routés, sélectionnés parmi un pool de 64 à chaque token . Le modèle compte 27 couches de décodeur avec une dimension cachée de 2 048 . Deux innovations architecturales se distinguent :
Le modèle utilise également un objectif de prédiction multi-tokens (MTP) pendant ses phases de pré-entraînement et d'entraînement intermédiaire .
Après une phase d'extension dédiée, Instella-MoE supporte un contexte de 64 000 tokens .
AMD a publié l'intégralité du pipeline d'entraînement, qui comprend six étapes séquentielles :
Le modèle de base Instella-MoE-16B-A3B a obtenu un score moyen de 76,7 sur des benchmarks standards, le plaçant parmi les meilleurs modèles entièrement ouverts de sa catégorie . Il surpasse notamment SmolLM3-3B et OLMo-3-7B, et rivalise avec des modèles plus gros, malgré l'activation de seulement 2,8 milliards de paramètres par token .
Conformément à son engagement pour une IA ouverte, AMD a rendu publics tous les artéfacts d'entraînement :
Tous ces éléments sont disponibles sur Hugging Face sous l'espace de noms amd/Instella-MoE-16B-A3B, avec une licence Research RAIL (Responsible AI License) pour une utilisation académique et de recherche .
Instella-MoE est bien plus qu'un simple modèle : c'est une preuve de concept que la pile logicielle ROCm d'AMD et ses GPU Instinct peuvent prendre en charge le développement d'IA de pointe, du pré-entraînement à l'apprentissage par renforcement, en utilisant une infrastructure entièrement ouverte. En offrant des performances compétitives face aux meilleurs modèles open source entraînés sur du matériel Nvidia, AMD positionne son écosystème comme une alternative crédible à CUDA pour la recherche et le développement en IA à grande échelle .