O Instella-MoE utiliza uma configuração de especialistas compartilhados e roteados, com 2 especialistas compartilhados sempre ativos e 6 especialistas roteados selecionados de um conjunto de 64 por token . O modelo é composto por 27 camadas de decodificação, cada uma com um tamanho oculto de 2.048 . Duas inovações arquiteturais se destacam:
O modelo também utiliza um objetivo de 'Multi-Token Prediction' (MTP) durante suas fases de pré-treinamento e treinamento intermediário .
Após um estágio de treinamento dedicado à extensão de contexto longo, o Instella-MoE suporta uma janela de contexto de 64 mil tokens .
A AMD publicou o pipeline de treinamento completo, que consiste em seis estágios sequenciais :
O modelo base Instella-MoE-16B-A3B alcançou uma pontuação média de 76,7 em benchmarks padrão, posicionando-se entre os principais modelos totalmente abertos em sua escala . Ele superou modelos como SmolLM3-3B e OLMo-3-7B, e competiu com modelos maiores, apesar de ativar apenas 2,8 bilhões de parâmetros por token .
Em linha com seu compromisso com a IA aberta, a AMD disponibilizou todos os artefatos de treinamento :
Todos os artefatos estão disponíveis no Hugging Face sob o namespace amd/Instella-MoE-16B-A3B, licenciados sob uma 'Research RAIL (Responsible AI License)' para fins acadêmicos e de pesquisa .
O Instella-MoE é mais do que um simples lançamento de modelo — é uma prova direta de que a pilha de software ROCm e o hardware GPU Instinct da AMD podem suportar o desenvolvimento de IA de ponta, do pré-treinamento ao aprendizado por reforço, usando infraestrutura totalmente aberta. Ao entregar benchmarks competitivos contra os principais modelos open source treinados em hardware Nvidia, a AMD posiciona seu ecossistema como uma alternativa viável ao CUDA da Nvidia para pesquisa e desenvolvimento de IA em larga escala .