Qwen3.8 Flash Next випустили 26 серпня 2026 року, а наступного дня з’явилися додаткові повідомлення про реліз. Модель поєднує 125 млрд параметрів основної мережі та ще 51 млрд параметрів N gram ембедингів, активуючи приблизно 6 млрд параметрів на кожен токен.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Flash—also released as Qwen3.8-Flash-Next—and why is it significant as an open multimodal mixture-of-experts techn. Article summary: Qwen3.8-Flash, released as the open-weight Qwen3.8-Flash-Next, is Alibaba Qwen’s multimodal mixture-of-experts (MoE) technical-preview model for the architecture intended to underpin Qwen4. It matters less as a conventio. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
Alibaba та команда Qwen випустили Qwen3.8-Flash-Next 26 серпня 2026 року; додаткове висвітлення релізу з’явилося 27 серпня. Це відкрита за вагами мультимодальна модель класу mixture-of-experts (MoE). Однак називати її повноцінним Qwen4 було б неточно: Qwen позиціонує реліз як раннє, доступне для перевірки прев’ю архітектури, на якій будуватиметься сімейство Qwen4. 1
2
15
Її найцікавіша особливість — співвідношення загального та активного розміру. Основна мережа має 125 млрд параметрів, доповнених 51 млрд параметрів N-gram-ембедингів, але для обробки одного токена активується лише близько 6 млрд параметрів. Ідея полягає в тому, щоб зберегти високу загальну місткість моделі, не сплачуючи повну обчислювальну ціну щокроку. 4
15
Назва Qwen3.8-Flash-Next стосується відкритої моделі, яку можна завантажити та досліджувати. Натомість Qwen3.8-Flash — це виробнича версія та API-пропозиція, орієнтована на використання через хмарні сервіси. Реліз Next задуманий як технічний зразок і своєрідна карта для розробників перед появою повного сімейства Qwen4. 1
2
15
Така відмінність важлива: відкриття ваг не означає, що Qwen4 уже запущено. Розробники отримали можливість заздалегідь перевірити архітектуру на власних навантаженнях, підготувати інструменти інференсу, протестувати квантизацію та повідомити Qwen про проблеми до ширшого релізу. 2
3
15
Важливо не плутати мільйон токенів із нативним контекстним вікном. У стандартній конфігурації модель підтримує 262 144 токени. Позначка в 1 мільйон стосується розширеної конфігурації з YaRN, тому її практичні результати потрібно оцінювати окремо. 1
4
16
Qwen3.8-Flash-Next поєднує Gated DeltaNet (GDN) та Qwen Sparse Attention (QSA). GDN призначена для стискання інформації з попереднього контексту, тоді як QSA використовує легкий індекс, щоб знаходити релевантні мікроблоки й не застосовувати повну увагу до всієї історії однаково. 4
Мета такого підходу — стримати зростання вартості та затримки під час роботи з дуже довгими послідовностями. Qwen заявляє про прискорення prefill до 7,6 раза та декодування до 4,9 раза на послідовностях довжиною 1 мільйон токенів. Це показники, наведені виробником: вони залежать від обладнання, реалізації, довжини послідовності та методики тестування, тож не є універсальним прогнозом для будь-якого розгортання. 4
Окремий компонент N-gram-ембедингів збільшує представницьку здатність системи, не вимагаючи повної обробки всіх параметрів для кожного токена. Qwen також передбачила можливість винесення цієї таблиці до оперативної пам’яті хоста та асинхронного попереднього завантаження даних. Так передавання даних може відбуватися паралельно з обчисленнями моделі. 4
Для операторів, які працюють із великими моделями, це не менш важливо, ніж саме число параметрів. У довгих документах і великих пакетних завданнях розміщення пам’яті та переміщення даних часто визначають економіку системи не менше, ніж пікова обчислювальна потужність.
Прев’ю охоплює також оптимізацію та масштабування. Qwen повідомляє про використання оптимізатора Muon, зміни в його взаємодії з AdamW і роботі з параметрами, а також про нове підігнане правило масштабування для цієї конструкції. 4
Отже, йдеться не просто про черговий чекпойнт із новим блоком уваги. Qwen відкрила для перевірки ширший підхід до створення моделей із великою сумарною місткістю та відносно невеликим обсягом активних обчислень.
Qwen стверджує, що навчання Qwen3.8-Flash коштувало приблизно в дев’ять разів дешевше, ніж навчання Qwen3.7-Plus, водночас показники в програмуванні та офісних завданнях покращилися. Reuters також повідомило про заяви компанії щодо вищої продуктивності в цих категоріях і нижчої вартості навчання. 1
4
У матеріалах про реліз наведено такі результати: 58,7 бала на DeepSWE 1.1, 62,5 на SWE-bench Pro та 84,5 на AndroidWorld. Qwen позиціонує ці показники як вищі за результати DeepSeek V4 Flash у ціновому сегменті. Водночас це порівняння, заявлене компанією; надані джерела не підтверджують незалежного відтворення результатів за повністю еквівалентних умов тестування. 4
Заявлена ціна API для виробничої версії Qwen3.8-Flash становить 1 юань за 1 мільйон вхідних токенів і 3 юані за 1 мільйон вихідних токенів. У матеріалах релізу не описано окремих пікових і непікових тарифів. Прямі порівняння з іншими моделями все одно залежать від версії, кешування, довжини контексту, рівня сервісу та вимог до відповіді. 1
4
Відкриті ваги роблять Qwen3.8-Flash-Next практичною платформою для експериментів ще до появи Qwen4. Команди можуть:
Архітектура особливо цікава для таких сценаріїв:
Це логічні сфери застосування, які випливають із дизайну моделі, а не гарантія, що вона перевершить кожну щільну модель або альтернативу з повною увагою у виробничому середовищі. Реальна економіка залежатиме від обладнання, програмного забезпечення для сервінгу, якості квантизації, стратегії пошуку та конкретного складу навантаження.
Значення Qwen3.8-Flash-Next полягає в тому, що Qwen рано відкрила архітектурний напрям. Тепер спільнота може перевірити, чи здатні розріджена й стиснена увага, великі допоміжні ембединги та мале число активних параметрів зробити роботу з дуже довгим контекстом дешевшою без неприйнятної втрати якості.
Водночас найсильніші твердження релізу — про прискорення, лідерство в бенчмарках, зменшення вартості навчання та вигідність — переважно походять від Qwen або з матеріалів, що спираються на заяви компанії. Потрібні незалежні тести на різному обладнанні, мовах, довжині контексту, мультимодальних завданнях і виробничих агентських сценаріях.
Найточніший висновок тому звучить скромніше, ніж «Qwen3.8-Flash-Next перемагає всі конкуруючі моделі». Це відкрите мультимодальне технічне прев’ю MoE, яке дає розробникам незвично ранній доступ до системної архітектури, що Alibaba готує для Qwen4, і до перевірюваного плану здешевлення роботи ШІ з наддовгим контекстом.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen3.8 Flash Next випустили 26 серпня 2026 року, а наступного дня з’явилися додаткові повідомлення про реліз.
Qwen3.8 Flash Next випустили 26 серпня 2026 року, а наступного дня з’явилися додаткові повідомлення про реліз. Модель поєднує 125 млрд параметрів основної мережі та ще 51 млрд параметрів N gram ембедингів, активуючи приблизно 6 млрд параметрів на кожен токен.
Нативне контекстне вікно становить 262 144 токени; розширення до 1 мільйона токенів можливе за допомогою YaRN.