DeepSeek V4.1 Flash вышла 10 сентября 2026 года и стала актуальной мультимодальной моделью линейки Flash. Прежние V4 Flash и V4 Flash Vision Exp сняты с API: старые идентификаторы пока перенаправляются на V4.1 Flash по тарифам Flash.
ОпубликовалОтредактировано с помощью GPT-5.6 TerraИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What are DeepSeek V4.1 Flash’s launch date, global OpenRouter adoption, relationship to the earlier V4 Flash, V4 Flash Vision, and V4 Pro of. Article summary: DeepSeek-V4.1-Flash launched on September 10, 2026. It is an open-weight, multimodal successor to the V4 Flash line that prioritizes long-context and inference efficiency; however, several claims about its market adoptio. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4.1-Flash вышла 10 сентября 2026 года. Это открытая мультимодальная модель — она работает не только с текстом, но и с изображениями. Для API актуальный идентификатор теперь — deepseek-flash. 15
17
Предыдущие модели V4 Flash и экспериментальная V4 Flash Vision Exp выведены из эксплуатации. Старые имена deepseek-v4-flash и deepseek-v4-flash-vision-exp пока принимаются для совместимости, но фактически запросы обслуживает V4.1 Flash, а тарификация идёт по ставкам Flash. 15
23
С V4 Pro ситуация иная. Ранее сообщалось о временном перенаправлении его трафика на V4.1 Flash до выхода V4.1 Pro. Однако позднее DeepSeek указала в официальном журнале изменений, что по просьбам пользователей продолжит предоставлять API-доступ к V4 Pro после 14 сентября 2026 года — без изменения схемы оплаты. Если в продукте важна воспроизводимость результатов, стоит использовать документированные актуальные ID моделей и прогонять регрессионные тесты, а не рассчитывать на поведение старого маршрута. 15
23
V4.1 Flash построена по схеме Mixture of Experts (MoE), или «смесь экспертов». У неё 552 млрд базовых параметров, но при обработке каждого токена используются не все параметры сразу.
По данным DeepSeek, на этапе обработки входного контекста — prefill — активируются 8 млрд параметров, а при генерации ответа — decoding — 16 млрд. В основе лежит архитектура Causal Encoder–Decoder. 17
35
Практический смысл в том, что длинный запрос и длинная генерация создают разные нагрузки, и модель пытается оптимизировать оба сценария отдельно. Но сама по себе разреженная активация не гарантирует низкую цену или высокую скорость: на итоговую производительность влияют ускорители, батчинг, квантизация, серверный стек, длина контекста и профиль запросов.
Заявленное окно контекста V4.1 Flash — до 1 млн токенов. 35
Главная техническая проблема таких объёмов — KV-кэш: сохранённое состояние механизма внимания, необходимое модели для генерации каждого следующего токена. Чем длиннее диалог, документ или история агента, тем больше памяти может требовать этот кэш.
В карточке модели DeepSeek объясняет, что в Causal Encoder–Decoder глобальный KV-кэш декодера проецируется из финальных скрытых состояний энкодера, а не формируется отдельно на каждом слое декодера. В сочетании с Compressed Sparse Attention 2 и FP4-кэшированием это, по заявлению компании, снижает объём глобального KV-кэша до примерно 890 байт на токен — около четверти соответствующего показателя V4 Flash. 35
39
Это важнее, чем может показаться: сокращение памяти — один из ключей к обслуживанию очень длинных запросов. Однако поддержка миллиона токенов не означает, что модель одинаково надёжно извлечёт нужный факт, выполнит инструкцию или проведёт рассуждение по всему этому массиву. Для кодовых баз, больших наборов документов и агентных историй нужно отдельно измерять полноту извлечения, задержку и стоимость на реальных задачах.
Веса V4.1 Flash опубликованы на Hugging Face по лицензии MIT. Это даёт организациям возможность скачать модель, оценить её на собственной инфраструктуре и развернуть свой стек инференса в рамках условий лицензии. 35
Открытые веса не делают запуск модели простым: базовая модель на 552 млрд параметров остаётся сложной для эксплуатации. Но в отличие от API-only решений, этот подход оставляет пользователю больше контроля над инфраструктурой, данными и оптимизацией.
DeepSeek утверждает, что новые методы предобучения и более масштабное постобучение с подкреплением позволили V4.1 Flash показать в бенчмарках результаты выше флагманской V4 Pro. Компания также ссылается на тесты нескольких сторон, где V4.1 Flash опережает V4 Pro по качеству, стоимости, скорости и полному времени выполнения. 17
Это существенные заявления, но не окончательный вердикт для любого сценария. Результаты бенчмарков зависят от набора задач, промптов, конфигурации инструментов, способа оценки и версии модели. Перед миграцией продакшен-процесса разумно сравнить модели на собственных данных: сложных рассуждениях, качестве кода, использовании инструментов, работе с изображениями, стабильности, контролях безопасности, задержке и полной стоимости.
V4.1 Flash появилась в экосистеме, где модели DeepSeek и других китайских разработчиков уже имели заметный трафик. OpenRouter ранжирует модели по числу токенов, обработанных через собственный API, включая токены в запросах и ответах.
В рейтинге от 13 сентября OpenRouter указал для DeepSeek V4.1 Flash 4,94 трлн токенов с пометкой о новинке. Там же V4 Flash 0731 имела 11,6 трлн, V4 Flash 0423 — 4,36 трлн, а Xiaomi MiMo-V2.5 — 7,77 трлн токенов. 57
Данные быстро меняются: августовский снимок показывал 7,1 трлн токенов за неделю у V4 Flash и сообщал, что девять из десяти наиболее используемых моделей в этой выборке были китайскими. 50
Важна оговорка: статистика OpenRouter отражает только трафик, прошедший через OpenRouter. Она не измеряет весь мировой спрос на ИИ, корпоративные внедрения, выручку или объективное качество моделей. Это полезный индикатор спроса среди пользователей платформы, но не доказательство лидерства на рынке в целом.
Сильная сторона V4.1 Flash — сочетание нативной мультимодальности, контекста до миллиона токенов, открытых весов и архитектуры, которая должна уменьшать затраты памяти при длинном инференсе. 17
35
Практичный план перехода:
deepseek-flash.Наиболее заметные технические заявления V4.1 Flash — это разреженная активация и глобальный KV-кэш на уровне 890 байт на токен. Их реальная ценность определится тем, насколько эти преимущества превратятся в стабильную и экономически оправданную работу на практических нагрузках.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
DeepSeek V4.1 Flash вышла 10 сентября 2026 года и стала актуальной мультимодальной моделью линейки Flash.
DeepSeek V4.1 Flash вышла 10 сентября 2026 года и стала актуальной мультимодальной моделью линейки Flash. Прежние V4 Flash и V4 Flash Vision Exp сняты с API: старые идентификаторы пока перенаправляются на V4.1 Flash по тарифам Flash.
Модель заявляет окно контекста до 1 млн токенов, 552 млрд базовых параметров и лишь 8–16 млрд активных параметров на токен.