DeepSeek V4.1 Flash obsługuje kontekst do miliona tokenów i aktywuje około 8 mld parametrów na token podczas przetwarzania danych wejściowych oraz 16 mld podczas generowania odpowiedzi. Według DeepSeek mechanizmy CSA2 i zapis FP4 zmniejszają globalną pamięć podręczną KV do 890 bajtów na token — około jednej czwartej...
Opublikowane przezEdytowane za pomocą GPT-6 SolObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Agent AI, który analizuje obszerną dokumentację lub wraca do długiej historii zadania, zwykle czyta znacznie więcej, niż pisze. Z myślą o takich zastosowaniach powstał DeepSeek-V4.1-Flash: model multimodalny typu mixture of experts (MoE), z publicznie udostępnionymi wagami i kontekstem o długości do miliona tokenów. Jego konstrukcja ma ograniczać nakład obliczeń przy odczycie oraz ilość pamięci potrzebnej do przechowywania historii. Sam limit kontekstu nie gwarantuje jednak, że model niezawodnie odnajdzie każdy szczegół długiej sesji. 2
8
Mniej obliczeń przy odczycie niż przy pisaniu. Trzon modelu liczy 552 mld parametrów. Składa się z 20-warstwowego enkodera przyczynowego i 20-warstwowego dekodera. Globalna pamięć podręczna kluczy i wartości, czyli KV cache, używana przez dekoder powstaje z końcowych stanów enkodera, zamiast być wyznaczana osobno przez każdą warstwę dekodera. Według DeepSeek podczas przetwarzania wejścia (prefill) model aktywuje około 8 mld parametrów na token, a podczas generowania odpowiedzi (decode) — 16 mld. Ta różnica ma szczególne znaczenie, gdy agent analizuje długie dane wejściowe, lecz udziela krótkich odpowiedzi. 2
8
Mniejsza pamięć dla historii sesji. Mechanizm Compressed Sparse Attention 2 (CSA2) przypisuje warstwom uwagi jeden z trzech stałych trybów: Full, Reindex lub Reuse. Pozwala to współdzielić zapisane informacje między warstwami i ponownie wykorzystywać wybory dokonane przez mechanizm uwagi. W połączeniu z zapisem głównej pamięci KV w formacie FP4 daje to, według DeepSeek, 890 bajtów na token w globalnej pamięci podręcznej KV — około jednej czwartej wartości dla DeepSeek-V4-Flash. To porównanie rozmiaru pamięci, a nie dowód, że całkowity koszt każdego wdrożenia spadnie czterokrotnie. 6
8
Odtwarzanie zamiast trwałego przechowywania. SWA Bounded Replay odtwarza brakujące stany KV mechanizmu uwagi o przesuwanym oknie, ponownie przetwarzając jedynie ostatni fragment tokenów. Dzięki temu nie trzeba przechowywać tych stanów na dysku SSD. Karta modelu podaje, że pamięć KV wymagająca trwałego zapisu zajmuje w tym rozwiązaniu około jednej ósmej miejsca potrzebnego w V4-Flash. To inna miara niż wspomniana jedna czwarta dla globalnej pamięci KV. 5
9
Zestawienie parametrów treningu opisuje uczenie modelu od podstaw na multimodalnym zbiorze obejmującym 45 bilionów tokenów. Trening mechanizmu uwagi rzadkiej odbywał się przy sekwencjach długości 64 tys. tokenów, a kontekst rozszerzono do miliona tokenów po przetworzeniu 34 bilionów tokenów. DeepSeek przypisuje poprawę wyników także nowym metodom treningu wstępnego i późniejszemu treningowi ze wzmocnieniem na większą skalę; przytoczone materiały nie pozwalają jednak szczegółowo odtworzyć tej ostatniej procedury. 9
16
Model natywnie obsługuje tekst i obrazy, a DeepSeek deklaruje obsługę multimodalną również w API. Dostępne tu źródła nie dają podstaw do szczegółowej oceny jego wyników w zadaniach dotyczących obrazów. 2
16
W testach model bazowy osiągał, według DeepSeek, wyniki porównywalne z V4-Pro-Base w zakresie wiedzy, rozumowania i programowania. Firma podaje też poprawę o 5–10% w testach odłożonych na potrzeby oceny, przy około jednej trzeciej całkowitej liczby parametrów i jednej czwartej liczby parametrów aktywowanych. DeepSeek twierdzi ponadto, że udostępniona wersja przewyższa V4-Pro w zadaniach wykonywanych przez agentów. Przytoczone źródła nie wystarczają jednak do rzetelnego porównania poszczególnych benchmarków. Są to wyniki podawane przez twórcę modelu, a nie niezależny test porównawczy. 1
16
W API DeepSeek należy używać nazwy deepseek-flash. Udostępnione wagi są wymienione jako objęte licencją MIT. Materiały modelu opisują uruchamianie przez SGLang, a zestawienia wskazują również obsługę w Transformers i vLLM. Przed wdrożeniem warto sprawdzić wymagania wybranego środowiska — zwłaszcza zamiast zakładać, że każde tak samo obsługuje obrazy i maksymalną długość kontekstu. 8
9
16
DeepSeek informuje, że V4-Flash i V4-Flash-Vision-Exp zostały wycofane, a ich dawne nazwy w API tymczasowo kierują do V4.1-Flash. Firma zapowiedziała również, że od 14 września 2026 r. żądania wysyłane pod nazwą deepseek-v4-pro będą kierowane do V4.1-Flash według stawek Flash, do czasu wprowadzenia V4.1-Pro. Jeśli aplikacja zależy od zachowania konkretnej wersji Pro, nie powinna wnioskować o użytym modelu wyłącznie z nazwy w żądaniu. 16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4.1 Flash obsługuje kontekst do miliona tokenów i aktywuje około 8 mld parametrów na token podczas przetwarzania danych wejściowych oraz 16 mld podczas generowania odpowiedzi.
DeepSeek V4.1 Flash obsługuje kontekst do miliona tokenów i aktywuje około 8 mld parametrów na token podczas przetwarzania danych wejściowych oraz 16 mld podczas generowania odpowiedzi. Według DeepSeek mechanizmy CSA2 i zapis FP4 zmniejszają globalną pamięć podręczną KV do 890 bajtów na token — około jednej czwartej wartości dla V4 Flash.
Wyniki porównań z V4 Pro pochodzą od DeepSeek, a aplikacje korzystające ze starszych nazw modeli w API powinny sprawdzić, który model faktycznie obsługuje żądania.