DeepSeek V4.1 Flash поддерживает контекст до миллиона токенов, но это не гарантия, что модель найдёт любую деталь длинной сессии. При обработке ввода модель задействует около 8 млрд параметров на токен, при генерации — 16 млрд; глобальный KV кэш, по данным DeepSeek, занимает 890 байт на токен.
ОпубликовалОтредактировано с помощью GPT-6 SolИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
ИИ-агент может долго читать историю переписки, документы и результаты работы инструментов, а затем выдать сравнительно короткий ответ. DeepSeek-V4.1-Flash рассчитана именно на такие задачи: это мультимодальная модель с открытыми весами и архитектурой «смесь экспертов» (MoE), поддерживающая контекст до миллиона токенов. Но размер контекстного окна означает лишь, что такой объём ввода поддерживается, — он не гарантирует безошибочный поиск каждой детали в длинной сессии. 2
8
Чтение и генерация обходятся по-разному. Основа модели насчитывает 552 млрд параметров и состоит из 20 слоёв причинного энкодера и 20 слоёв декодера. Глобальный KV-кэш декодера — сохранённые данные, которые нужны механизму внимания при продолжении ответа, — строится из конечных состояний энкодера, а не создаётся заново каждым слоем декодера. По данным DeepSeek, при обработке входного текста (prefill) активируются около 8 млрд параметров на токен, при генерации (decode) — 16 млрд. Для агента, который читает больше, чем пишет, такая асимметрия особенно важна. 2
8
Меньше памяти на историю. Механизм Compressed Sparse Attention 2 (CSA2) назначает слоям внимания один из трёх фиксированных режимов — Full, Reindex или Reuse. Они позволяют совместно использовать данные кэша и повторно применять выборку для разреженного внимания. Вместе с хранением основного KV-кэша в формате FP4 это, по оценке DeepSeek, сокращает глобальный KV-кэш до 890 байт на токен — примерно четверти объёма у DeepSeek-V4-Flash. Речь о размере кэша, а не об обещании снизить все затраты на развёртывание в четыре раза. 6
8
Восстановление вместо постоянного хранения. SWA Bounded Replay восстанавливает недостающие состояния KV-кэша для внимания со скользящим окном, повторно обрабатывая только последние токены этого окна. Благодаря этому их не требуется постоянно хранить на SSD. В карточке модели объём постоянно хранимого KV-кэша оценивается примерно в одну восьмую от показателя V4-Flash. Это другая метрика, не равная приведённой выше четверти для глобального KV-кэша. 5
9
Согласно описанию модели, её обучали с нуля на мультимодальном корпусе из 45 трлн токенов. Обучение разреженного внимания проходило на последовательностях длиной 64 тыс. токенов, а расширение контекста до 1 млн токенов произошло на отметке 34 трлн токенов. DeepSeek также связывает улучшения с новыми методами предобучения и более масштабным дообучением с подкреплением, но приведённые материалы не раскрывают подробный рецепт последнего. 9
16
Модель изначально работает с текстом и изображениями; DeepSeek заявляет о мультимодальной поддержке и в API. Приведённые источники, однако, не позволяют подробно оценить её результаты в тестах на понимание изображений. 2
16
По собственным оценкам DeepSeek, базовая версия V4.1-Flash сопоставима с V4-Pro-Base в знаниях, рассуждении и программировании, а на отложенных проверках показывает улучшение на 5–10% при примерно втрое меньшем общем числе параметров и вчетверо меньшем числе активируемых параметров. Компания также утверждает, что выпущенная модель превосходит V4-Pro в агентных задачах. Доступные здесь выдержки не дают оснований для надёжного сравнения по каждому отдельному тесту: это заявленные результаты, а не независимое сопоставление моделей. 1
16
Для API DeepSeek указывает имя модели deepseek-flash. Опубликованные веса перечислены под лицензией MIT. В материалах модели описан запуск через SGLang; в карточках также указана поддержка Transformers и vLLM. Перед развёртыванием стоит проверить требования выбранной среды: поддержка модели не означает, что длинный контекст и работа с изображениями реализованы везде одинаково. 8
9
16
DeepSeek объявила V4-Flash и V4-Flash-Vision-Exp выведенными из эксплуатации: старые имена API deepseek-v4-flash и deepseek-v4-flash-vision-exp временно перенаправляются на V4.1-Flash. Компания также сообщила, что с 14 сентября 2026 года запросы к deepseek-v4-pro будут направляться на V4.1-Flash по тарифам Flash до выхода V4.1-Pro. Если приложение зависит от особенностей Pro, проверять нужно фактически обслуживающую запрос модель, а не только имя в настройках. 16
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
DeepSeek V4.1 Flash поддерживает контекст до миллиона токенов, но это не гарантия, что модель найдёт любую деталь длинной сессии.
DeepSeek V4.1 Flash поддерживает контекст до миллиона токенов, но это не гарантия, что модель найдёт любую деталь длинной сессии. При обработке ввода модель задействует около 8 млрд параметров на токен, при генерации — 16 млрд; глобальный KV кэш, по данным DeepSeek, занимает 890 байт на токен.
Для API используется имя deepseek flash. Заявленные сравнения с V4 Pro не следует принимать за независимую оценку.