V4 Flash jest „wydajnościową” wersją rodziny DeepSeek V4. Model został zaprojektowany z myślą o dużej liczbie zapytań, niskich opóźnieniach i kosztach niższych niż w przypadku największych komercyjnych modeli.
| Parametr | Wartość |
|---|---|
| Łączna liczba parametrów | 284 mld |
| Parametry aktywne na token | 13 mld |
| Parametry repozytorium z modułem DSpark | 304 mld |
| Architektura | Mixture-of-Experts (MoE) |
| Okno kontekstowe | 1 mln tokenów |
| Maksymalna długość odpowiedzi | 384 tys. tokenów |
| Precyzja | mieszana FP4 + FP8 |
| Licencja | MIT |
| Rozmiar pobieranych wag | około 160 GB |
Źródła:
W architekturze MoE wszystkie parametry są dostępne jako pula wyspecjalizowanych ekspertów, ale przy generowaniu konkretnego tokena wykorzystywana jest tylko ich część. Dzięki temu model może mieć bardzo dużą łączną pojemność, nie uruchamiając za każdym razem całej sieci.
Zarówno V4 Flash, jak i większy V4 Pro zostały udostępnione z otwartymi wagami na licencji MIT . W praktyce pozwala ona na użytek komercyjny, modyfikowanie modelu, jego dalszą dystrybucję i wdrażanie na własnej infrastrukturze — bez opłat licencyjnych za samo korzystanie z wag.
Modele są dostępne między innymi w serwisie Hugging Face, więc organizacje mogą korzystać z API DeepSeek albo spróbować uruchomić model prywatnie. Trzeba jednak pamiętać, że otwarta licencja nie oznacza niskich wymagań sprzętowych: pełna obsługa bardzo długiego kontekstu nadal wymaga znacznych zasobów GPU.
Tak długie okno kontekstowe jest możliwe dzięki hybrydowej architekturze uwagi, łączącej dwa mechanizmy: Compressed Sparse Attention (CSA) i Heavily Compressed Attention (HCA).
Warstwy CSA i HCA są przeplatane. Warstwy parzyste od drugiej wykorzystują kompresję 4:1, a nieparzyste od trzeciej — kompresję 128:1. Jednocześnie model zachowuje przesuwane okno obejmujące ostatnie 128 nieprzetworzonych tokenów, aby nie tracić najświeższych informacji .
Checkpoint V4 Flash wykorzystuje mieszaną kwantyzację:
nvidia/DeepSeek-V4-Flash-NVFP4 .Przy FP8 same wagi modelu zajmowałyby około 284 GB. Według dostępnych zaleceń uruchomienie pełnego kontekstu miliona tokenów wymaga konfiguracji z czterema układami NVIDIA H200 SXM5 i łącznie 564 GB pamięci VRAM . To pokazuje, że choć model jest „Flash” pod względem aktywnych parametrów i kosztu, nie jest małym modelem do uruchomienia na typowym komputerze.
V4 Flash udostępnia parametr reasoning_effort, za pomocą którego deweloper może wybrać kompromis między szybkością odpowiedzi a głębokością analizy:
Deweloperzy mogą więc dobrać tryb do konkretnego zadania: od klasyfikacji i ekstrakcji danych po generowanie kodu i planowanie wieloetapowych działań .
Cena DeepSeek V4 Flash wynosi:
W przypadku powtarzających się promptów systemowych lub wspólnych prefiksów koszt wejścia spada więc o 98 proc. . Według porównań publikowanych przez serwisy branżowe generowanie tekstu w V4 Flash jest około 54 razy tańsze niż w Sonnet 4.6 i 107 razy tańsze niż w GPT-5.5 . Część źródeł określa go dlatego mianem najtańszego API klasy frontier .
Wersja produkcyjna V4-Flash-0731 nie otrzymała nowej architektury. Według informacji DeepSeek najważniejsze poprawki wynikają z ponownego treningu po fazie bazowej, czyli re-post-trainingu . W oficjalnym dzienniku aktualizacji podano między innymi następujące wyniki:
DeepSeek twierdzi, że nowa wersja osiąga poziom porównywalny z większym V4 Pro w benchmarkach dotyczących agentów i programowania . Może to osłabiać tradycyjny podział, w którym wariant „Pro” oferuje wyraźnie wyższą jakość, a „Flash” nadrabia głównie szybkością i ceną .
Dokładne wyniki SWE-bench dla V4-Flash-0731 nie zostały jednak potwierdzone w przeanalizowanych materiałach .
Drugim ważnym elementem najnowszych działań DeepSeek jest DeepSeek Harness. „Harness” można tu rozumieć jako środowisko wykonawcze lub warstwę orkiestracji dla agenta. Taki system działa obok modelu językowego: zarządza kontekstem, wywołuje narzędzia i pomaga doprowadzić zadanie do końca .
Nazwa Harness pojawiła się w dzienniku zmian V4-Flash-0731 z dopiskiem „wkrótce do wydania” . 1 sierpnia 2026 r. DeepSeek zaczął zapraszać deweloperów projektów open source do zamkniętych testów frameworka . Kandydaci powinni mieć doświadczenie z projektami związanymi z Agent Harness oraz przesłać swój identyfikator GitHub i przykłady pracy .
Zespół Harness powstał w marcu 2026 r., gdy Cui Tianyi dołączył do DeepSeek, aby zbudować go od podstaw . Nie ogłoszono jednak daty publicznego wydania frameworka .
Podejście DeepSeek, kojarzone z prezesem Liangiem Wenfengiem, opiera się na tworzeniu modeli, które są jednocześnie tanie i zdolne — co firma przedstawia jako drogę do sztucznej inteligencji ogólnej (AGI) . Ceny API na poziomie 0,14/0,28 dol. za milion tokenów oraz otwarte wagi na licencji MIT są najbardziej namacalnym wyrazem tej strategii .
DeepSeek konkuruje w Chinach między innymi z Alibabą i jej rodziną Qwen, ByteDance’em i modelem Doubao, Moonshot AI, MiniMax oraz Z.AI . Według przywoływanych analiz rodzina V4 wyróżnia się tym, że jako model open weight w swojej klasie jest dostępna na liberalnej licencji MIT .
Pojawiają się również doniesienia o przygotowaniach DeepSeek do debiutu giełdowego, ale konkretna data, wybrani subemitenci i szczegóły ewentualnej oferty nie zostały potwierdzone .
Dostępne materiały pozwalają dość dokładnie opisać architekturę, ceny i kierunek rozwoju produktu, ale nie wszystkie informacje mają równie mocne potwierdzenie:
Najważniejszy wniosek jest jednak jasny: DeepSeek nie ogranicza się już do udostępniania taniego modelu. V4 Flash łączy otwarte wagi, bardzo długi kontekst, sterowanie poziomem rozumowania i niskie ceny API, a Harness ma dołożyć do tego warstwę pozwalającą agentom samodzielnie korzystać z narzędzi i wykonywać zadania.