Instella-MoE использует конфигурацию shared-plus-routed experts: 2 постоянно активных общих эксперта и 6 маршрутизируемых экспертов, выбираемых из пула из 64 на каждый токен . Модель состоит из 27 слоёв декодера с размером скрытого слоя 2048 . Две архитектурные инновации заслуживают особого внимания:
Кроме того, модель использует цель Multi-Token Prediction (MTP) на этапах предобучения и промежуточного обучения .
После специального этапа обучения расширению контекста Instella-MoE поддерживает 64K-токенный контекст .
AMD опубликовала полный конвейер обучения, который состоит из шести последовательных этапов :
Базовая модель Instella-MoE-16B-A3B показала средний балл 76,7 на стандартных бенчмарках, заняв место среди лучших полностью открытых моделей своего масштаба . Сообщается, что она превзошла SmolLM3-3B и OLMo-3-7B, а также конкурировала с более крупными моделями, активируя всего 2,8 миллиарда параметров на токен .
В соответствии с приверженностью открытому AI, AMD открыто опубликовала все артефакты обучения :
Все артефакты доступны на Hugging Face в пространстве имён amd/Instella-MoE-16B-A3B под лицензией Research RAIL (Responsible AI License) для академических и исследовательских целей .
Instella-MoE — это не просто выпуск модели; это прямое доказательство того, что стек ПО ROCm и аппаратное обеспечение Instinct от AMD способны поддерживать разработку AI передового уровня — от предобучения до обучения с подкреплением — с использованием полностью открытой инфраструктуры. Демонстрируя конкурентоспособные бенчмарки по сравнению с ведущими открытыми моделями, обученными на оборудовании Nvidia, AMD позиционирует свою экосистему как жизнеспособную альтернативу Nvidia CUDA для крупномасштабных AI-исследований и разработок .