AMD 24 июля 2026 года выпустила Instella MoE — языковую модель смешения экспертов на 16 млрд параметров (активно 2,8 млрд на токен), обученную с нуля на GPU AMD Instinct MI300X и MI325X с использованием открытого стек... Среди архитектурных инноваций — Gated Multi head Latent Attention (Gated MLA) и FarSkip Collecti...

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What are the key details of AMD's July 24 release of Instella-MoE, a fully open 16-billion-parame. Article summary: Here are the key verified details of AMD's Instella-MoE release, based primarily on the official AMD ROCm blog post (July 24, 2026) and corroborating news sources.. Topic tags: general, academic, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails
24 июля 2026 года компания AMD анонсировала Instella-MoE — полностью открытую языковую модель на основе архитектуры смешения экспертов (MoE) с 16 миллиардами параметров, обученную с нуля на GPU AMD Instinct MI300X и MI325X с использованием программного стека ROCm . При обработке каждого токена модель активирует лишь 2,8 миллиарда параметров, что делает её чрезвычайно эффективной и при этом позволяет демонстрировать конкурентоспособные результаты на стандартных бенчмарках. Этот выпуск — стратегический шаг, доказывающий, что аппаратное обеспечение AMD и открытый стек ПО способны поддерживать разработку AI больших масштабов — от предобучения до обучения с подкреплением, бросая вызов доминирующей экосистеме Nvidia CUDA
.
Instella-MoE использует конфигурацию shared-plus-routed experts: 2 постоянно активных общих эксперта и 6 маршрутизируемых экспертов, выбираемых из пула из 64 на каждый токен . Модель состоит из 27 слоёв декодера с размером скрытого слоя 2048
. Две архитектурные инновации заслуживают особого внимания:
Кроме того, модель использует цель Multi-Token Prediction (MTP) на этапах предобучения и промежуточного обучения .
После специального этапа обучения расширению контекста Instella-MoE поддерживает 64K-токенный контекст .
AMD опубликовала полный конвейер обучения, который состоит из шести последовательных этапов :
Базовая модель Instella-MoE-16B-A3B показала средний балл 76,7 на стандартных бенчмарках, заняв место среди лучших полностью открытых моделей своего масштаба . Сообщается, что она превзошла SmolLM3-3B и OLMo-3-7B, а также конкурировала с более крупными моделями, активируя всего 2,8 миллиарда параметров на токен
.
В соответствии с приверженностью открытому AI, AMD открыто опубликовала все артефакты обучения :
Все артефакты доступны на Hugging Face в пространстве имён amd/Instella-MoE-16B-A3B под лицензией Research RAIL (Responsible AI License) для академических и исследовательских целей .
Instella-MoE — это не просто выпуск модели; это прямое доказательство того, что стек ПО ROCm и аппаратное обеспечение Instinct от AMD способны поддерживать разработку AI передового уровня — от предобучения до обучения с подкреплением — с использованием полностью открытой инфраструктуры. Демонстрируя конкурентоспособные бенчмарки по сравнению с ведущими открытыми моделями, обученными на оборудовании Nvidia, AMD позиционирует свою экосистему как жизнеспособную альтернативу Nvidia CUDA для крупномасштабных AI-исследований и разработок .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
AMD 24 июля 2026 года выпустила Instella MoE — языковую модель смешения экспертов на 16 млрд параметров (активно 2,8 млрд на токен), обученную с нуля на GPU AMD Instinct MI300X и MI325X с использованием открытого стек...
AMD 24 июля 2026 года выпустила Instella MoE — языковую модель смешения экспертов на 16 млрд параметров (активно 2,8 млрд на токен), обученную с нуля на GPU AMD Instinct MI300X и MI325X с использованием открытого стек... Среди архитектурных инноваций — Gated Multi head Latent Attention (Gated MLA) и FarSkip Collective, ускоривший предобучение на 12,7%.
Все артефакты — веса модели после каждого этапа, конфигурации, промежуточные чекпоинты и код инференса — полностью открыты на Hugging Face под лицензией Research RAIL, что делает Instella MoE важным шагом в демонстрац...