Model wykorzystuje również cel Multi-Token Prediction (MTP) podczas faz wstępnego i środkowego trenowania .
Po dedykowanym etapie rozszerzania kontekstu, Instella-MoE obsługuje kontekst o długości 64K tokenów .
AMD opublikowało kompletny pipeline treningowy składający się z sześciu następujących po sobie etapów :
Model bazowy Instella-MoE-16B-A3B osiągnął średni wynik 76,7 pkt w standardowych benchmarkach, plasując się wśród najlepszych w pełni otwartych modeli w swojej skali . Według doniesień przewyższył on modele SmolLM3-3B i OLMo-3-7B, a także konkurował z większymi modelami, mimo aktywowania tylko 2,8 miliarda parametrów na token
.
Wszystkie elementy są dostępne na Hugging Face w przestrzeni nazw amd/Instella-MoE-16B-A3B na licencji Research RAIL (Responsible AI License) do celów akademickich i badawczych .
Instella-MoE to coś więcej niż tylko wydanie modelu – to bezpośredni dowód na to, że stos oprogramowania ROCm i sprzęt Instinct GPU AMD mogą wspierać rozwój sztucznej inteligencji na skalę frontiera, od wstępnego trenowania po uczenie przez wzmocnienie, w pełni otwartej infrastrukturze. Osiągając wyniki porównywalne z wiodącymi modelami open-source trenowanymi na sprzęcie Nvidii, AMD pozycjonuje swój ekosystem jako realną alternatywę dla CUDA Nvidii w zakresie badań i rozwoju AI na dużą skalę .