DeepSeek podaje, że V4.1 Flash potrzebuje dla cache’a KV jednej czwartej HBM i jednej ósmej pojemności SSD względem poprzedniej generacji. Po premierze akcje Samsung Electronics i SK Hynix spadły w Seulu w ciągu dnia o ponad 3%, ponieważ rynek zaczął wyceniać mniejsze zużycie pamięci na pojedyncze zadanie AI.
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10 V4.1 Flash release, which reduced key-value cache consumption to about one-quarter of its predecessor’s high. Article summary: The selloff reflected a rapid reassessment of the “AI equals ever-more memory” trade. DeepSeek’s V4.1-Flash showed that serving long-context models can be made far less memory-intensive, while Amodei’s proposed slowing o. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Model DeepSeek V4.1-Flash, przedstawiony 10 września, wywołał niepokój na rynku opartym na prostym założeniu: coraz większe modele, dłuższy kontekst i coraz więcej agentów AI będą automatycznie wymagały stale rosnących ilości pamięci HBM, NAND oraz sprzętu magazynującego dane.
Nowa konstrukcja nie sprawia, że pamięć przestaje być potrzebna. Pokazała jednak, że dzięki architekturze modelu i lepszemu zarządzaniu cache’em można istotnie obniżyć ilość pamięci potrzebnej do obsługi danego obciążenia AI. 61
25
Cache key-value (KV) przechowuje stan mechanizmu uwagi podczas obsługi zapytania przez model. Jest szczególnie ważny w długich rozmowach i zadaniach agentowych: pozwala zachować wcześniejszy kontekst zamiast za każdym razem przetwarzać całą historię od nowa.
DeepSeek podaje, że V4.1-Flash potrzebuje dla swojego cache’a KV tylko jednej czwartej pamięci HBM oraz jednej ósmej pojemności SSD wykorzystywanej przez poprzednią generację. 61 Według karty modelu efekt wynika m.in. z architektury przyczynowego enkodera-dekodera (CED), w której globalny cache KV dekodera jest wyprowadzany z końcowych stanów ukrytych enkodera, oraz z techniki wdrożeniowej SWA Bounded Replay. Ma ona eliminować potrzebę trwałego zapisywania części stanów cache’a przesuwnego okna na SSD.
52
Niezależne omówienia premiery wskazywały na globalny rozmiar cache’a KV wynoszący około 890 bajtów na token — mniej więcej jedną czwartą poziomu V4-Flash. Taka konstrukcja może pozwolić obsłużyć w tym samym budżecie cache’a około od czterech do ośmiu razy więcej użytkowników. 53 DeepSeek deklaruje też aktywowanie 8 mld parametrów na token podczas przetwarzania wejścia i 16 mld podczas generowania odpowiedzi, co ma podnosić efektywność w zadaniach z dużą ilością danych wejściowych.
52
Kluczowe pytanie nie brzmiało, czy systemy AI nadal potrzebują pamięci — oczywiście potrzebują. Rynek zaczął natomiast zastanawiać się, czy ilość pamięci wymagana na jednostkę obsłużonego ruchu inferencyjnego może spadać znacznie szybciej, niż zakładały modele popytu i przychodów.
Jeżeli porównywalny model potrafi obsługiwać więcej równoległych, długich zapytań z tej samej puli HBM lub pamięci masowej, dostawcy chmury mogą uzyskać większą przepustowość z już posiadanej infrastruktury. To podważa założenia dotyczące przyszłych wolumenów, napiętej podaży i siły cenowej w segmentach HBM, DRAM, dysków SSD dla przedsiębiorstw oraz urządzeń do przechowywania danych.
Po publikacji akcji Samsung Electronics i SK Hynix spadły w Korei Południowej w ciągu dnia o ponad 3%. 17 Obawy rozlały się szerzej, ponieważ handel wokół infrastruktury AI łączy producentów pamięci z dostawcami magazynów danych, sieci i mocy obliczeniowej. Mniejszy ślad pamięciowy może zmienić ekonomię wdrożeń modeli, nawet jeśli nie obniża popytu na każdą kategorię sprzętu w takim samym stopniu.
Przypadek SanDisk pokazuje, jak wrażliwa stała się teza inwestycyjna na oczekiwania wobec popytu napędzanego przez AI. Dane rynkowe z tego okresu wskazywały na 52-tygodniowy przedział kursu mniej więcej od 85 do 2354 USD, podczas gdy konsensus analityków pozostawał na poziomie „kupuj” lub „umiarkowanie kupuj”. 35
37 Pozytywny konsensus nie rozstrzyga jednak podstawowej niewiadomej: jaka część przyszłego popytu na pamięć masową zależy od utrzymania obecnych, bardziej pamięciożernych architektur inferencyjnych.
Wiadomość od DeepSeek była szokiem efektywnościowym. Apel Dario Amodei o „pace the frontier”, czyli celowe spowolnienie wzrostu możliwości najbardziej zaawansowanych modeli, otworzył odrębne pytanie o tempo rozwoju zdolności AI, a w konsekwencji o tempo wydatków na infrastrukturę.
W opublikowanym we wrześniu eseju prezes Anthropicu argumentował, że firmy powinny świadomie zwolnić tempo poprawy możliwości modeli granicznych, wykorzystując dodatkowy czas na prace nad bezpieczeństwem i zgodnością systemów z ludzkimi celami. Zaproponował stały dostęp niezależnych ewaluatorów do firm, koordynację między spółkami z państw demokratycznych, a docelowo porozumienia między rządami. 4
5
Nie był to postulat całkowitego zatrzymania rozwoju AI. Publiczne poparcie innych znaczących liderów branży sprawiło jednak, że rynek zaczął brać pod uwagę, czy dobrowolna koordynacja lub przyszłe regulacje nie ograniczą wzrostu wydatków na akceleratory, centra danych i pamięci. Kontrakty terminowe na Nasdaq 100 miały w tamten weekend spaść o 1%. 8
Dla inwestorów było to niewygodne połączenie dwóch scenariuszy: DeepSeek zasugerował mniejsze zużycie pamięci na jedno zadanie, a debata o spowolnieniu modeli granicznych podniosła możliwość wolniejszego wzrostu liczby samych zadań.
Inwestor Michael Burry odrzucił apele o wolniejszy rozwój AI jako „self-serving”, czyli służące własnym interesom. Argumentował, że spowolnienie może faworyzować już ugruntowane laboratoria rozwijające modele graniczne i utrudniać mniejszym konkurentom dogonienie liderów. Kwestionował również, czy obecne chatboty AI prowadzą w ogóle do sztucznej inteligencji ogólnej. 15
Komentarze Burry’ego są krytyką bodźców ekonomicznych, a nie dowodem na motywy firm. Jego sugestie, że przekaz o bezpieczeństwie ma wspierać planowane wejścia na giełdę, należy traktować jako zarzut inwestora, nie jako ustalony fakt. 11
15
Najmocniejszy wniosek jest ograniczony, ale istotny: DeepSeek podważył uproszczoną wersję tezy o pamięci dla AI. Pokazał, że oprogramowanie, architektura modelu, kwantyzacja i techniki zarządzania cache’em mogą wyraźnie obniżyć pamięciochłonność inferencji. 52
55
Nie dowiódł natomiast, że całkowity popyt na pamięć spadnie. Podane redukcje dotyczą cache’a KV podczas inferencji i są porównaniem z wcześniejszą architekturą DeepSeek. Nie oznaczają, że cały model lub centrum danych zużywa o 75% mniej HBM i o 87,5% mniej przestrzeni SSD. Nie eliminują też pamięci potrzebnej na wagi modelu ani na trening. 25
Niższy koszt obsługi może ponadto zwiększyć wykorzystanie technologii: tańsza inferencja może umożliwić większej liczbie użytkowników korzystanie z modeli, wydłużyć kontekst i uruchomić więcej pętli agentowych. Ostateczny efekt dla popytu będzie zależał od tego, co okaże się silniejsze — oszczędność na pojedynczym zapytaniu czy wzrost liczby i złożoności zapytań.
DeepSeek V4.1-Flash nie przekreślił długoterminowego argumentu za HBM, NAND ani infrastrukturą AI. Uczynił go jednak bardziej warunkowym. Nie można już po prostu zakładać, że rosnące użycie AI przełoży się jeden do jednego na wzrost zużycia pamięci na każde obciążenie.
Ważniejsze pytanie brzmi teraz: czy poprawa efektywności wyprzedzi skalę wdrożeń AI? DeepSeek dostarczył dowodu, że inferencja może stać się znacznie oszczędniejsza. Nie rozstrzygnął jednak, jak szybko po tej zmianie będą rosły globalne wykorzystanie AI, skala treningu modeli i popyt na sprzęt.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek podaje, że V4.1 Flash potrzebuje dla cache’a KV jednej czwartej HBM i jednej ósmej pojemności SSD względem poprzedniej generacji.
DeepSeek podaje, że V4.1 Flash potrzebuje dla cache’a KV jednej czwartej HBM i jednej ósmej pojemności SSD względem poprzedniej generacji. Po premierze akcje Samsung Electronics i SK Hynix spadły w Seulu w ciągu dnia o ponad 3%, ponieważ rynek zaczął wyceniać mniejsze zużycie pamięci na pojedyncze zadanie AI.
Apel prezesa Anthropicu Dario Amodei o spowolnienie rozwoju modeli granicznych dołożył drugie ryzyko: wydatki na infrastrukturę AI mogą rosnąć wolniej, niż wcześniej zakładano.