V4 Flash — продуктивніша за ціною та швидша версія сімейства DeepSeek V4, орієнтована на великі обсяги запитів і сценарії, де важлива низька затримка. У моделі 284 млрд загальних параметрів, але для обробки кожного токена активуються лише 13 млрд .
Це ключова ідея MoE: модель має великий набір спеціалізованих «експертів», однак під час конкретного запиту задіює лише частину з них. Такий підхід дає змогу поєднати широкий обсяг знань із нижчою вартістю інференсу.
| Характеристика | Значення |
|---|---|
| Загальна кількість параметрів | 284 млрд |
| Параметри, активні на токен | 13 млрд |
| Архітектура | Mixture-of-Experts (MoE) |
| Контекстне вікно | 1 млн токенів |
| Максимальна довжина відповіді | 384 тис. токенів |
| Точність | Змішана FP4 + FP8 |
| Ліцензія | MIT |
| Розмір завантаження | близько 160 ГБ |
Деякі матеріали вказують на 304 млрд параметрів у репозиторії, якщо враховувати доданий модуль чернеткового декодування DSpark .
V4 Flash і старша V4 Pro поширюються під ліберальною ліцензією MIT. Вона дозволяє використовувати, змінювати та поширювати модель, зокрема в комерційних продуктах, без роялті . Ваги доступні через Hugging Face, тому організації можуть розгорнути модель у власній інфраструктурі або адаптувати її під свої завдання.
Для бізнесу це важливо з двох причин: компанія не прив’язана лише до API-постачальника, а також може контролювати дані, налаштування та процес розгортання. Водночас «відкрита модель» не означає, що локальний запуск буде простим: повна версія залишається дуже вимогливою до пам’яті та GPU.
Мільйон токенів — це надзвичайно великий контекст, але пряме застосування стандартної уваги зробило б обчислення надто дорогими. DeepSeek поєднала два механізми стиснення:
Шари CSA та HCA чергуються: парні шари, починаючи з другого, використовують стиснення 4:1, а непарні, починаючи з третього, — 128:1. Для збереження актуальності інформації модель постійно працює зі «ковзним вікном» останніх 128 необроблених токенів .
У чекпойнті використано змішане квантування, щоб зменшити вимоги до пам’яті:
nvidia/DeepSeek-V4-Flash-NVFP4 .У режимі FP8 самі ваги 284-мільярдної моделі потребували б приблизно 284 ГБ пам’яті. Для повного контексту на 1 млн токенів рекомендована конфігурація — чотири NVIDIA H200 SXM5 із сумарно 564 ГБ відеопам’яті .
DeepSeek V4 Flash має параметр reasoning_effort, який дає розробникам змогу обирати баланс між швидкістю та глибиною аналізу:
Для розробника це практичніше, ніж використовувати одну й ту саму модель у всіх сценаріях: прості запити можна обробляти швидко, а для складного коду чи планування збільшувати бюджет міркування .
Ціна API становить $0,14 за 1 млн вхідних токенів, якщо запит не потрапляє до кешу, і $0,28 за 1 млн вихідних токенів . Для кешованого введення, наприклад повторюваного системного промпту або спільного префікса, тариф знижується до $0,0028 за 1 млн токенів — на 98% дешевше .
За даними порівняльних оглядів, вихідні токени V4 Flash приблизно у 54 рази дешевші за Sonnet 4.6 із тарифом $15 за мільйон і у 107 разів дешевші за GPT-5.5 із тарифом $30 . Саме тому низка джерел називає V4 Flash найдешевшим API «фронтирного» класу .
У production-релізі V4-Flash-0731 DeepSeek заявила про значне покращення результатів у програмуванні та агентних сценаріях. Важливо, що йдеться не про зміну архітектури, а про додаткове посттренування .
В офіційному журналі оновлень наведено такі результати:
DeepSeek стверджує, що офіційна Flash-версія тепер демонструє результати, зіставні з V4-Pro у програмістських та агентних тестах . Це послаблює традиційне правило «Pro — точніша, Flash — лише швидша»: принаймні для частини агентних робочих процесів молодша модель може бути вигіднішим вибором.
Водночас у зібраних джерелах не вдалося незалежно підтвердити точні показники SWE-bench для V4-Flash-0731 . Тому ці цифри не варто автоматично переносити на всі тести програмування або порівнювати без урахування методики оцінювання.
DeepSeek Harness — це не ще одна мовна модель, а фреймворк виконання агентів. Він має працювати поза межами самої LLM, керувати контекстом, викликати інструменти та допомагати моделі доводити завдання до завершення .
Назва Harness уперше з’явилася в журналі змін V4-Flash-0731 із позначкою «буде випущено незабаром» . 1 серпня 2026 року DeepSeek почала набирати до закритого бета-тестування розробників open-source проєктів, які мають досвід роботи з Agent Harness. Від кандидатів вимагали GitHub ID і приклади власних проєктів .
Команду Harness, за повідомленнями джерел, почали формувати в березні 2026 року після приходу до DeepSeek Цуй Тяньї, який очолив цей напрям . Його попередній досвід у TSY Capital та Jane Street згадується лише в одному матеріалі й не був незалежно підтверджений іншими зібраними джерелами . Точну дату публічного релізу Harness DeepSeek не назвала .
V4 Flash поєднує три характеристики, які зазвичай важко отримати одночасно: великий контекст, відкриті ваги та низьку ціну API. Це робить модель цікавою для:
Але для самостійного розгортання потрібно враховувати витрати на GPU, відеопам’ять, охолодження й обслуговування. Ліцензія MIT спрощує юридичний бік використання, однак не скасовує технічних вимог до інфраструктури.
Стратегія DeepSeek, яку пов’язують із генеральним директором Лян Веньфеном, робить ставку на дешеві, але потужні моделі як один зі шляхів до AGI . Ціну V4 Flash — $0,14 за мільйон вхідних і $0,28 за мільйон вихідних токенів — разом із відкритими вагами під MIT можна розглядати як практичне втілення цього підходу .
На китайському ринку DeepSeek конкурує із серіями Qwen від Alibaba, Doubao від ByteDance, а також із Moonshot AI, MiniMax і Z.AI . При цьому джерела називають сімейство V4 єдиною моделлю такого класу з відкритими вагами, мільйонним контекстом і ліберальною ліцензією MIT .
Повідомлення про можливу підготовку DeepSeek до IPO також з’являлися в окремих матеріалах, але конкретні строки, андеррайтери чи підтверджені документи не встановлені .
Попри велику кількість технічних деталей, частина гучних тверджень залишається неперевіреною:
Наразі головний висновок простий: DeepSeek V4 Flash — це не просто дешевша версія великої моделі. Компанія одночасно тисне на ринок ціною API, відкритими вагами, ефективною роботою з довгим контекстом і переходом від чат-ботів до повноцінної агентної інфраструктури.