Instella-MoE emplea una configuración de expertos compartidos y enrutados, con 2 expertos compartidos siempre activos y 6 expertos enrutados seleccionados de un grupo de 64 por cada token . El modelo consta de 27 capas de decodificador, cada una con un tamaño oculto de 2048 . Dos innovaciones arquitectónicas destacan:
El modelo también utiliza un objetivo de Predicción Multi-Token (MTP) durante sus fases de pre-entrenamiento y entrenamiento medio .
Después de una etapa dedicada de extensión de contexto largo, Instella-MoE soporta un contexto de 64 mil tokens .
AMD publicó el pipeline de entrenamiento completo, que consta de seis etapas secuenciales :
El modelo base Instella-MoE-16B-A3B alcanzó una puntuación promedio de 76.7 en benchmarks estándar, posicionándose entre los mejores modelos completamente abiertos en su escala . Según los informes, superó a SmolLM3-3B y OLMo-3-7B, y compitió con modelos más grandes a pesar de activar solo 2.800 millones de parámetros por token .
En línea con su compromiso con la IA abierta, AMD liberó todos los artefactos de entrenamiento de forma abierta :
Todos los artefactos están disponibles en Hugging Face bajo el espacio de nombres amd/Instella-MoE-16B-A3B, con una Licencia RAIL de Investigación (Responsible AI License) para fines académicos y de investigación .
Instella-MoE es más que un lanzamiento de modelo: es una prueba directa de que la pila de software ROCm de AMD y el hardware de GPU Instinct pueden respaldar el desarrollo de IA a escala de frontera, desde el pre-entrenamiento hasta el RL, utilizando infraestructura completamente abierta. Al ofrecer benchmarks competitivos contra los principales modelos de código abierto entrenados en hardware de Nvidia, AMD posiciona su ecosistema como una alternativa viable a CUDA de Nvidia para la investigación y el desarrollo de IA a gran escala .