DeepSeek V4.1 Flash підтримує контекст до мільйона токенів і активує близько 8 млрд параметрів на токен під час обробки вхідного тексту та 16 млрд під час генерації. За даними DeepSeek, CSA2 разом зі зберіганням основного KV кешу у форматі FP4 скорочує його глобальний обсяг до 890 байтів на токен — приблизно чверті...
ОпублікувавВідредаговано за допомогою GPT-6 SolЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Для ШІ-агента, який перечитує довгу історію розмови, документи та результати попередніх кроків, важливий не лише розмір контекстного вікна. Важливо й те, скільки обчислень і пам’яті потрібно, щоб цю історію обробити та зберігати під час роботи. Саме на такі сценарії орієнтована DeepSeek-V4.1-Flash — модель із відкритими вагами, яка працює з текстом і зображеннями та підтримує контекст до мільйона токенів. Це технічна межа довжини контексту, а не обіцянка, що модель однаково надійно знайде будь-яку подробицю в усій сесії. 2
8
В основі моделі — архітектура суміші експертів (MoE) із 552 млрд параметрів у базовій частині. Її 40 шарів поділено порівну: 20 шарів каузального енкодера обробляють вхід, а 20 шарів декодера беруть участь у формуванні відповіді. Глобальний KV-кеш декодера — збережені дані, потрібні механізму уваги для роботи з попередніми токенами, — проєктується з кінцевих станів енкодера, а не створюється окремо кожним шаром декодера. 2
8
Це дає асиметрію обчислень: за даними DeepSeek, під час prefill — первинної обробки вхідного тексту — активується близько 8 млрд параметрів на токен, а під час decode, тобто генерації відповіді, — 16 млрд. Такий розподіл особливо доречний для агента, який читає значно більше, ніж пише. Сам по собі він, утім, не визначає підсумкову вартість конкретного розгортання. 2
8
Механізм Compressed Sparse Attention 2 (CSA2) закріплює за шарами уваги один із трьох режимів — Full, Reindex або Reuse. Завдяки цьому шари можуть спільно використовувати частину кешованих даних і повторно застосовувати вибрані позиції для розрідженої уваги. Разом зі зберіганням основного KV-кешу у форматі FP4 це, за даними DeepSeek, зменшує обсяг глобального KV-кешу до 890 байтів на токен — приблизно чверті показника DeepSeek-V4-Flash. Ідеться саме про порівняння обсягу кешу, а не про підтверджене чотириразове здешевлення всіх сценаріїв використання. 6
8
Інший прийом, SWA Bounded Replay, стосується станів KV для уваги в ковзному вікні. Замість постійного зберігання цих станів на SSD система за потреби відновлює їх, повторно обробляючи лише останнє вікно токенів. У картці моделі DeepSeek оцінює обсяг постійно збереженого KV-кешу приблизно у восьму частину показника V4-Flash. Це інша метрика, ніж наведена вище чверть обсягу глобального кешу. 5
9
Згідно з описом моделі, її навчали з нуля на мультимодальному корпусі обсягом 45 трлн токенів. Навчання механізму розрідженої уваги відбувалося на послідовностях завдовжки 64 тис. токенів, а контекст розширили до 1 млн токенів після позначки у 34 трлн токенів. DeepSeek також пов’язує покращення з новими методами попереднього навчання та масштабнішим донавчанням із підкріпленням, але наведені матеріали не дають підстав докладніше описувати його схему. 9
16
Модель нативно працює із зображеннями й текстом; DeepSeek заявляє про мультимодальну підтримку і в API. Водночас наведені джерела не дають достатньо даних для докладного висновку про якість роботи із зображеннями в окремих тестах. 2
16
У власних оцінюваннях DeepSeek базова версія V4.1-Flash показала результати, зіставні з V4-Pro-Base у знаннях, міркуванні та програмуванні, а на відкладених наборах перевірки — перевагу 5–10%. За твердженням компанії, для цього вона використовує приблизно третину загальної кількості та чверть кількості активованих параметрів порівняно з V4-Pro-Base. DeepSeek також заявляє, що випущена модель перевершує V4-Pro в агентних завданнях. Наведені матеріали, однак, не дають надійної основи для порівняння результатів кожного окремого тесту; це заявлені результати, а не незалежне очне випробування. 1
16
Для API DeepSeek вказує назву моделі deepseek-flash. Опубліковані ваги зазначені під ліцензією MIT. У матеріалах моделі описано запуск через SGLang, а в описах середовищ виконання також згадано Transformers і vLLM. Перед розгортанням варто перевіряти вимоги конкретного середовища: це не означає, що всі вони однаково підтримують мультимодальність і максимальну довжину контексту. 8
9
16
За повідомленням DeepSeek, V4-Flash і V4-Flash-Vision-Exp виведені з використання, а їхні старі API-назви deepseek-v4-flash та deepseek-v4-flash-vision-exp тимчасово перенаправляються на V4.1-Flash. Компанія також оголосила, що з 14 вересня 2026 року запити до deepseek-v4-pro спрямовуватимуться на V4.1-Flash за тарифами Flash до виходу V4.1-Pro. Якщо застосунок залежить від поведінки Pro, перевіряйте, яка модель фактично обробляє запити, а не покладайтеся лише на назву в налаштуваннях. 16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4.1 Flash підтримує контекст до мільйона токенів і активує близько 8 млрд параметрів на токен під час обробки вхідного тексту та 16 млрд під час генерації.
DeepSeek V4.1 Flash підтримує контекст до мільйона токенів і активує близько 8 млрд параметрів на токен під час обробки вхідного тексту та 16 млрд під час генерації. За даними DeepSeek, CSA2 разом зі зберіганням основного KV кешу у форматі FP4 скорочує його глобальний обсяг до 890 байтів на токен — приблизно чверті показника V4 Flash.
Модель доступна через API під назвою deepseek flash. Заявлені переваги в тестах слід відрізняти від незалежного порівняння моделей.