El modelo también utiliza un objetivo de Predicción Multi-Token (MTP) durante sus fases de pre-entrenamiento y entrenamiento medio .
Después de una etapa dedicada de extensión de contexto largo, Instella-MoE soporta un contexto de 64 mil tokens .
El modelo base Instella-MoE-16B-A3B alcanzó una puntuación promedio de 76.7 en benchmarks estándar, posicionándose entre los mejores modelos completamente abiertos en su escala . Según los informes, superó a SmolLM3-3B y OLMo-3-7B, y compitió con modelos más grandes a pesar de activar solo 2.800 millones de parámetros por token
.
En línea con su compromiso con la IA abierta, AMD liberó todos los artefactos de entrenamiento de forma abierta :
Todos los artefactos están disponibles en Hugging Face bajo el espacio de nombres amd/Instella-MoE-16B-A3B, con una Licencia RAIL de Investigación (Responsible AI License) para fines académicos y de investigación .
Instella-MoE es más que un lanzamiento de modelo: es una prueba directa de que la pila de software ROCm de AMD y el hardware de GPU Instinct pueden respaldar el desarrollo de IA a escala de frontera, desde el pre-entrenamiento hasta el RL, utilizando infraestructura completamente abierta. Al ofrecer benchmarks competitivos contra los principales modelos de código abierto entrenados en hardware de Nvidia, AMD posiciona su ecosistema como una alternativa viable a CUDA de Nvidia para la investigación y el desarrollo de IA a gran escala .