DeepSeek V4.1 Flash deklaruje zmniejszenie zapotrzebowania cache’a KV na HBM do jednej czwartej oraz trwałej przestrzeni cache’a do jednej ósmej poziomu V4 Flash. Po premierze przecenione zostały m.in.
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s V4.1 Flash model trigger a selloff in memory-chip and broader technology stocks, what architectural changes did it introd. Article summary: DeepSeek V4.1 Flash caused a sharp reassessment of AI-memory demand because it claimed to cut the KV-cache memory used in long-context inference to one-quarter of its predecessor’s level and persistent SSD use to one-eig. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeek V4.1 Flash uderzył w bardzo ważne założenie stojące za hossą na infrastrukturę AI: że rosnące użycie sztucznej inteligencji musi automatycznie oznaczać coraz więcej pamięci potrzebnej do obsługi każdego zadania.
Chińska firma twierdzi, że jej nowy model istotnie ogranicza zapotrzebowanie na pamięć przy inferencji, czyli w czasie faktycznego generowania odpowiedzi przez model. To wystarczyło, by rynek zaczął przeliczać perspektywy producentów pamięci HBM oraz dostawców nośników NAND i dysków enterprise SSD. Nie oznacza to jednak, że DeepSeek „usunął” potrzebę stosowania pamięci ani że cały sektor chipów stracił fundamenty wzrostu. 9
10
Kluczowym pojęciem jest cache KV (key-value cache). To pamięć, w której model przechowuje stan uwagi dotyczący wcześniej przetworzonych tokenów — fragmentów tekstu. Dzięki temu nie musi odtwarzać całego kontekstu przy kolejnym kroku generowania odpowiedzi.
Cache KV staje się szczególnie kosztowny przy długich rozmowach, agentach AI wykonujących wieloetapowe zadania oraz obsłudze wielu użytkowników jednocześnie.
DeepSeek podał, że V4.1 Flash łączy ponowne wykorzystywanie cache’a KV między warstwami w architekturze Compressed Sparse Attention 2 z przechowywaniem KV w formacie FP4. Według deklaracji firmy globalny cache KV zajmuje 890 bajtów na token — około jedną czwartą odpowiadającego mu poziomu w modelu V4-Flash. 9
Dodatkowo zastosowano rozwiązanie wdrożeniowe nazwane SWA Bounded Replay. Dla mechanizmu uwagi o krótkim oknie system nie musi stale zapisywać cache’a na SSD ani w pamięci hosta. Zamiast tego korzysta tymczasowo z rozproszonej puli pamięci DRAM hosta i, w przypadku braku danych w cache’u, odtwarza ograniczoną część kontekstu. Według DeepSeek zmniejsza to trwały rozmiar cache’a do około jednej ósmej poziomu poprzedniej generacji. 1
9
W praktyce oznacza to deklarowane ograniczenie zużycia HBM o około 75% i trwałej pojemności SSD o 87,5% — ale wyłącznie dla funkcji cache’a KV, w porównaniu z V4-Flash. 9
10
Teoretycznie tak, jeśli serwer ogranicza przede wszystkim pojemność pamięci przeznaczonej na aktywne cache’e KV. Gdy pojedyncze długie zapytanie potrzebuje około jednej czwartej dotychczasowej pamięci cache, ta sama pula HBM mogłaby pomieścić około cztery razy więcej aktywnych cache’ów.
Nie jest to jednak niezależnie potwierdzony wynik testu całego systemu. Rzeczywista liczba jednoczesnych użytkowników zależy również od rozmiaru wag modelu, dostępnej mocy obliczeniowej, sieci, długości zapytań, grupowania zadań, docelowych opóźnień oraz oprogramowania serwującego model.
Rynek nie uznał, że pamięć stała się zbędna. Obawa dotyczyła raczej intensywności popytu w przyszłości.
Producenci HBM — pamięci o bardzo wysokiej przepustowości, kluczowej dla akceleratorów AI — oraz firmy z segmentu NAND i dysków SSD korzystają z przekonania, że coraz bardziej zaawansowane systemy AI będą zużywać coraz więcej pamięci i magazynu danych. Jeżeli jednak pojedyncza usługa inferencyjna wymaga mniej bitów pamięci i mniej trwałej przestrzeni dyskowej, prognozy wzrostu wolumenu, cen oraz inwestycji w moce produkcyjne mogą wymagać korekty.
11 września akcje Samsung Electronics spadły w Korei Południowej o 3,5%, a SK Hynix o 2,2%, według Bloomberga. 17 Inne relacje wskazywały, że oba walory traciły w Seulu ponad 3%, podczas gdy Micron i SanDisk początkowo zachowywały się relatywnie lepiej w handlu w USA.
8
To przede wszystkim reakcja na wyceny. Jeżeli AI będzie potrzebować mniej pamięci na jedno zapytanie, inwestorzy mogą zakwestionować tempo przyszłego wzrostu popytu i siłę cenową dostawców pamięci.
Późniejsza wyprzedaż objęła nie tylko spółki bezpośrednio związane z pamięcią, lecz szerzej cały segment inwestycji w AI.
Po apelach o spowolnienie rozwoju modeli granicznych SK Hynix i Samsung spadły odpowiednio o 6,4% i 4,1%, a japońska Kioxia straciła 6,4%. Niżej handlowano również akcjami europejskich firm półprzewodnikowych, w tym ASML, Infineon, ASM International, BE Semiconductor i STMicroelectronics. 18 Osobne doniesienia wskazywały na 11-procentowy spadek SoftBanku, spadek Kioxii o 6,5% i 1,2-procentową zniżkę Taiwan Semiconductor Manufacturing.
19
W amerykańskim handlu przedsesyjnym Marvell tracił blisko 8%, a Intel, Micron i SanDisk po około 6%. 20
Nie należy jednak odczytywać tych ruchów jako dowodu, że pojedyncza premiera DeepSeek mechanicznie wywołała każdy spadek. Na wyceny technologii jednocześnie wpływają stopy procentowe, wysokie mnożniki wycen i ogólne obawy o tempo wzrostu AI. Model DeepSeek dał jednak inwestorom konkretny powód, by sprawdzić słaby punkt dotychczasowej tezy: wzrost liczby zastosowań AI nie musi przekładać się proporcjonalnie na wzrost pamięci potrzebnej do pojedynczego zapytania. 17
Dario Amodei, prezes Anthropic, wezwał firmy AI do spowolnienia tempa zwiększania możliwości modeli granicznych. Zaproponowany przez niego trzyetapowy model miał dać więcej czasu na ograniczanie ryzyka niewłaściwego użycia technologii i zagrożeń dla bezpieczeństwa.
Dla inwestorów infrastrukturalnych pojawiły się dwa odrębne ryzyka:
Te mechanizmy są ekonomicznie różne, lecz oba mogą podważać scenariusz zakładający nieustanne, bardzo szybkie zwiększanie nakładów na AI. Relacje rynkowe łączyły szerszą przecenę chipów bezpośrednio z obawami po apelach o wolniejszy rozwój AI. 18
20
Inwestor Michael Burry skrytykował postulaty spowolnienia jako działanie we własnym interesie. Jego zdaniem liderzy firm AI mogą handlowo zyskiwać na przekazie, według którego rozwijana przez nich technologia przyspiesza w niebezpieczny sposób. Określił tę narrację jako „IPO hype & puffery” — promocyjne podbijanie atmosfery wokół przyszłych debiutów giełdowych. 14
Burry argumentował, że spowolnienie może faworyzować obecnych liderów kosztem mniejszych konkurentów, a jednocześnie wzmacniać wizerunek rzadkości i wyjątkowości technologii. To jego interpretacja bodźców biznesowych tych firm, a nie dowód na to, że obawy dotyczące bezpieczeństwa AI są nieautentyczne lub bezpodstawne. 14
DeepSeek nie twierdził, że cały model czy całe centrum danych potrzebuje o 75% mniej HBM i o 87,5% mniej SSD. Porównanie obejmuje konkretnie cache KV podczas inferencji i odnosi się do wcześniejszej architektury firmy. Poza tym zakresem pozostają m.in. wagi modelu, inne obszary pamięci systemowej, sieć i pozostałe potrzeby magazynowania danych. 10
Ujawnione usprawnienia nie dowodzą analogicznego ograniczenia pamięci i mocy obliczeniowej potrzebnych do trenowania modeli granicznych. Przenoszenie wniosków z optymalizacji cache’a KV na tezę o załamaniu całego popytu na półprzewodniki AI byłoby zbyt daleko idącym wnioskiem. 10
Tańsza inferencja może ograniczać zużycie pamięci na jedno żądanie, ale jednocześnie sprawić, że długie konteksty, agenci AI i wdrożenia lokalne lub własne staną się opłacalne dla znacznie większej liczby firm. Jeśli liczba użytkowników i zastosowań wzrośnie wystarczająco mocno, łączny popyt na pamięć może utrzymać się na wysokim poziomie albo dalej rosnąć mimo niższego zapotrzebowania na pojedyncze zadanie.
DeepSeek V4.1 Flash pokazał realną słabość optymistycznej tezy o pamięciach dla AI: architektura modelu i oprogramowanie do jego obsługi mogą szybko obniżać zużycie pamięci przy inferencji. Deklarowane 890 bajtów na token dla globalnego cache’a KV oraz ograniczenie trwałego cache’a do jednej ósmej wcześniejszego poziomu wyjaśniają, dlaczego inwestorzy tak szybko przeliczyli założenia dotyczące HBM i SSD. 9
Nie ma jednak podstaw, by traktować tę premierę jako natychmiastowy szok popytowy dla całej branży chipów. Deklarowane oszczędności dotyczą cache’a KV przy inferencji, a nie treningu modeli ani pełnego stosu infrastruktury centrum danych.
Długofalowo decydujące będzie starcie dwóch sił: spadku zużycia pamięci na zadanie oraz możliwie dużo szerszego zastosowania AI, które taka oszczędność może uruchomić. Dla inwestorów w sektor pamięci pytanie nie brzmi już wyłącznie, czy użycie AI rośnie. Brzmi: czy całkowity wzrost liczby zadań będzie szybszy niż tempo, w jakim modele uczą się oszczędzać pamięć?
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4.1 Flash deklaruje zmniejszenie zapotrzebowania cache’a KV na HBM do jednej czwartej oraz trwałej przestrzeni cache’a do jednej ósmej poziomu V4 Flash.
DeepSeek V4.1 Flash deklaruje zmniejszenie zapotrzebowania cache’a KV na HBM do jednej czwartej oraz trwałej przestrzeni cache’a do jednej ósmej poziomu V4 Flash. Po premierze przecenione zostały m.in. Samsung Electronics i SK Hynix, a później presja objęła spółki półprzewodnikowe w Azji, Europie i USA.
Najważniejsze pytanie brzmi: czy mniejsze zużycie pamięci na jedno zapytanie ograniczy zakupy pamięci, czy raczej obniży koszt AI na tyle, że powstanie znacznie więcej zastosowań.