Модель також використовує об'єкт Multi-Token Prediction (MTP) під час фаз попереднього та проміжного навчання .
Після спеціального етапу розширення довгого контексту Instella-MoE підтримує 64K-токенів контексту .
Базова модель Instella-MoE-16B-A3B досягла середнього балу 76,7 на стандартних тестах, що ставить її в ряд найкращих повністю відкритих моделей свого масштабу . За повідомленнями, вона випередила SmolLM3-3B та OLMo-3-7B, а також конкурувала з більшими моделями, активуючи лише 2,8 млрд параметрів на токен
.
Усі артефакти доступні на Hugging Face у просторі імен amd/Instella-MoE-16B-A3B під Research RAIL (Responsible AI License) для академічних і дослідницьких цілей .
Instella-MoE — це більше, ніж просто випуск моделі. Це прямий доказ того, що програмний стек AMD ROCm та апаратне забезпечення Instinct GPU здатні підтримувати розробку ШІ переднього краю — від попереднього навчання до навчання з підкріпленням — з використанням повністю відкритої інфраструктури. Демонструючи конкурентоспроможні результати проти провідних моделей з відкритим кодом, навчених на обладнанні NVIDIA, AMD позиціонує свою екосистему як життєздатну альтернативу NVIDIA CUDA для масштабних ШІ-досліджень та розробок .