V4 Flash — более быстрый и экономичный вариант по сравнению с V4 Pro. При этом DeepSeek заявляет, что новая версия приблизилась к старшей модели на тестах, связанных с программированием и автономными агентами .
| Параметр | Значение |
|---|---|
| Архитектура | Mixture-of-Experts (MoE) |
| Всего параметров | 284 млрд |
| Активных параметров на токен | 13 млрд |
| Контекстное окно | 1 млн токенов |
| Максимальный ответ | 384 тыс. токенов |
| Точность | Смешанная FP4 + FP8 |
| Лицензия | MIT |
| Размер загрузки | Около 160 ГБ |
Если учитывать подключённый модуль чернового декодирования DSpark, размер репозитория оценивается примерно в 304 млрд параметров . Но в работе на каждом шаге задействуется лишь около 13 млрд. Именно такой подход позволяет MoE-модели сочетать широкий набор специализированных «экспертов» с более умеренными затратами на инференс .
Веса V4 Flash доступны для загрузки и самостоятельного развёртывания. Лицензия MIT допускает коммерческое использование, модификацию и распространение без лицензионных отчислений . Для компаний это означает возможность запускать модель в собственной инфраструктуре, дообучать её и встраивать в коммерческие продукты — с учётом условий самой лицензии и требований конкретной инфраструктуры, через которую предоставляется доступ.
Модель опубликована на Hugging Face и доступна в экосистемах, поддерживающих её форматы. Однако «открытые веса» не означают, что полноценный запуск будет простым на обычном компьютере: при FP8 одни только веса занимают около 284 ГБ . Для работы с контекстом в 1 млн токенов рекомендуемая конфигурация — четыре NVIDIA H200 SXM5 с суммарно 564 ГБ видеопамяти .
Ключевая особенность V4 — гибридная система внимания, состоящая из двух механизмов.
Слои CSA и HCA чередуются. При этом отдельная скользящая область сохраняет последние 128 исходных токенов — это помогает модели не терять самые свежие детали разговора или документа .
Проще говоря, модель не обрабатывает весь миллион токенов одинаково подробно: недавняя информация хранится почти без сжатия, а более ранний контекст представляется в компактном виде и подключается выборочно.
Веса MoE-экспертов хранятся в формате FP4, тогда как параметры внимания, нормализации, маршрутизатора и общих экспертов остаются в FP8 . Такой смешанный формат уменьшает объём модели на диске и в видеопамяти по сравнению с полностью FP8-вариантом .
Также доступна версия DeepSeek-V4-Flash-NVFP4, подготовленная NVIDIA . Это может упростить запуск на совместимом оборудовании, но требования к памяти всё равно остаются значительно выше, чем у большинства компактных локальных моделей.
Разработчики могут управлять затратами на рассуждение через параметр reasoning_effort. Доступны три режима:
Для прикладных систем это означает возможность выбирать баланс между скоростью, стоимостью и качеством ответа отдельно для каждого сценария — например, использовать Non-think для маршрутизации запросов, а Think High или Think Max для отладки кода.
Текущая заявленная цена DeepSeek V4 Flash составляет:
| Тип токенов | Цена за 1 млн токенов |
|---|---|
| Входные, cache miss | $0,14 |
| Входные, cache hit | $0,0028 |
| Выходные | $0,28 |
Кэшированные входные данные — например, повторяющийся системный промпт или общий префикс — обходятся на 98% дешевле обычных входных токенов .
На фоне крупных закрытых моделей разница особенно заметна на выходных токенах, которые часто составляют значительную часть расходов в агентных и программных сценариях. По сравнению с приведёнными в источниках тарифами $15 за 1 млн выходных токенов у Sonnet 4.6 и $30 у GPT-5.5, цена V4 Flash ниже примерно в 54 и 107 раз соответственно . Поэтому ряд отраслевых обзоров называет модель самым дешёвым API «фронтирного» класса .
DeepSeek сообщила о заметном росте результатов на задачах, связанных с программированием и автономной работой агентов. В официальном журнале обновлений указаны следующие показатели:
В релизных материалах говорится, что V4-Flash-0731 теперь показывает результаты, сопоставимые с V4 Pro на агентных и программных бенчмарках . Это размывает привычную схему «Pro — качество, Flash — скорость»: для массовых агентных задач более дешёвая версия может оказаться практичнее старшей.
При этом точные показатели SWE-bench для V4-Flash-0731 в рассмотренных материалах независимо не подтверждены . Поэтому сравнивать модель с конкурентами по одному конкретному тесту следует осторожно.
Параллельно с обновлением модели DeepSeek развивает собственный агентный слой — DeepSeek Harness. Это не ещё одна языковая модель, а фреймворк исполнения агентов: он должен управлять контекстом, вызывать внешние инструменты и помогать LLM самостоятельно доводить задачи до результата .
Название Harness впервые появилось в журнале изменений V4-Flash-0731 с пометкой «скоро будет выпущен» . 1 августа компания начала приглашать разработчиков open source в закрытое бета-тестирование. От кандидатов требуется опыт работы с проектами, связанными с Agent Harness, а также GitHub ID и примеры собственных проектов .
Команду Harness, по имеющимся сообщениям, начали формировать в марте 2026 года после прихода в DeepSeek Цуй Тяньи . Дата публичного релиза фреймворка пока не объявлена . Утверждения о предыдущей работе Цуй Тяньи в TSY Capital и Jane Street встречаются лишь в одном из рассмотренных материалов и не были независимо подтверждены .
В V4 Flash сходятся сразу три тенденции:
Стратегия DeepSeek связывается с идеей создания дешёвых и при этом сильных моделей как одного из путей к AGI . Лицензия MIT и тариф $0,14/$0,28 за миллион токенов — наиболее наглядные практические проявления этого подхода, хотя прямые цитаты главы компании Ляна Вэньфэна о стратегии AGI в собранных материалах не подтверждены.
На внутреннем рынке DeepSeek конкурирует с Alibaba и её семейством Qwen, ByteDance с Doubao, Moonshot AI, MiniMax и Z.AI . Отдельные публикации также сообщают о подготовке возможного IPO DeepSeek, однако сроки, андеррайтеры и детали подачи документов не подтверждены .
DeepSeek V4 Flash — это не просто очередная большая модель. Её ставка сделана на сочетание открытых весов, огромного контекстного окна, экономичной MoE-архитектуры и очень низкой цены API. Для разработчиков, которым нужны массовая генерация кода, обработка длинных документов или агентные сценарии, модель выглядит особенно интересной.
Но есть и практичесное ограничение: самостоятельное развёртывание полной версии требует серьёзной GPU-инфраструктуры. Поэтому для большинства команд реальный выбор будет стоять между недорогим API и локальным запуском квантованной версии, а не между «запустить на ноутбуке» и «не запускать вовсе».