DeepSeek uvádí, že V4.1 Flash potřebuje pro KV cache jen čtvrtinu HBM a osminu SSD kapacity oproti předchozí generaci. Po oznámení klesly akcie Samsung Electronics a SK Hynix v Jižní Koreji během obchodování o více než 3 %.
PublikovalUpraveno pomocí GPT-5.6 TerraObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10 V4.1 Flash release, which reduced key-value cache consumption to about one-quarter of its predecessor’s high. Article summary: The selloff reflected a rapid reassessment of the “AI equals ever-more memory” trade. DeepSeek’s V4.1-Flash showed that serving long-context models can be made far less memory-intensive, while Amodei’s proposed slowing o. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeek 10. září představil model V4.1-Flash a zpochybnil velmi jednoduchý investiční příběh: větší modely, delší kontext a více autonomních AI agentů automaticky znamenají stále vyšší spotřebu pamětí HBM, NAND a úložišť. Nový model paměti nepotřebuje odstranit, aby tento předpoklad narušil. Stačí, když dokáže stejný objem AI úloh obsloužit s výrazně menší paměťovou stopou. 61
25
KV cache (key-value cache) uchovává stav pozornosti modelu během vyřizování požadavku. Je zásadní zejména pro dlouhé konverzace a agentní úlohy: model díky ní nemusí při každém dalším kroku znovu zpracovávat celou předchozí historii.
DeepSeek uvádí, že KV cache modelu V4.1-Flash potřebuje oproti předchozí generaci jen čtvrtinu HBM a osminu SSD úložiště. 61 Modelová karta připisuje zlepšení architektuře kauzálního enkodéru a dekodéru (CED), v níž se globální KV cache dekodéru odvozuje z konečných skrytých stavů enkodéru. K tomu přidává techniku nasazení SWA Bounded Replay, která omezuje nutnost ukládat některé stavy cache posuvného okna na SSD.
52
Nezávislé pokrytí vydání uvádělo globální KV cache přibližně 890 bajtů na token — zhruba čtvrtinu oproti V4-Flash. Při stejné kapacitě KV cache by návrh mohl obsloužit přibližně čtyřikrát až osmkrát více uživatelů. 53 DeepSeek zároveň uvádí aktivaci 8 miliard parametrů na token při zpracování vstupu a 16 miliard při generování odpovědi, což má zlepšit efektivitu zejména u úloh s rozsáhlými vstupy.
52
Bezprostřední otázka nebyla, zda AI nadále potřebuje paměti — potřebuje. Trh řešil, zda může spotřeba pamětí na jednotku inferenčního výkonu klesat mnohem rychleji, než předpokládaly dosavadní modely poptávky a výnosů.
Jestliže srovnatelný model zvládne z pevně daného objemu HBM či úložiště obsloužit více souběžných dlouhých požadavků, cloudoví provozovatelé mohou z existující infrastruktury vytěžit vyšší výkon. To ohrožuje předpoklady o budoucích objemech dodávek, napjatosti nabídky i cenové síle výrobců HBM, DRAM, podnikových SSD a navazujících dodavatelů úložišť.
Podle zpráv po vydání modelu klesly akcie Samsung Electronics a SK Hynix v Jižní Koreji v průběhu obchodování každé o více než 3 %. 17 Obava se šířila i do dalších částí dodavatelského řetězce AI infrastruktury, kde se prolínají paměti, úložiště, sítě a výpočetní technika. Menší paměťová stopa může změnit ekonomiku nasazování modelů, i když automaticky neznamená stejný dopad na všechny hardwarové kategorie.
U SanDisku okolnosti ukázaly, jak citlivý se investiční příběh stal na očekávání spojená s AI. Tržní data z daného období uváděla 52týdenní rozpětí zhruba 85 až 2 354 dolarů, zatímco širší analytický konsenzus zůstával na stupni Buy či Moderate Buy. 35
37 Pozitivní hodnocení analytiků ale samo o sobě neřeší klíčovou nejistotu: jak velká část budoucí poptávky po úložištích závisí na tom, že inferenční architektury budou dál vyžadovat stále více paměti.
Zpráva od DeepSeeku byla šokem z vyšší efektivity. Výzva Daria Amodeie k „udržování tempa na hranici možností“ AI přinesla samostatnou otázku: jak rychle porostou schopnosti AI — a s nimi i investice do infrastruktury.
Šéf Anthropicu ve svém zářijovém eseji navrhl, aby firmy záměrně zpomalily tempo, jímž zlepšují schopnosti nejpokročilejších modelů, a získaný čas využily pro práci na bezpečnosti a sladění systémů s lidskými cíli. Navrhl přítomnost nezávislých hodnotitelů s přístupem do firem, koordinaci společností v demokratických zemích a později také dohody mezi vládami. 4
5
Nešlo o požadavek na úplné zastavení vývoje AI. Podpora dalších významných lídrů v oboru však přiměla trh uvažovat, zda dobrovolná koordinace či budoucí pravidla nemohou zbrzdit výdaje na akcelerátory, datová centra a paměti. Futures na Nasdaq 100 byly podle zpráv o daném víkendu níže o 1 %. 8
Pro investory tak vznikla nepříjemná kombinace: DeepSeek naznačil nižší spotřebu paměti na jednu obslouženou úlohu a debata o zpomalení vývoje otevřela možnost pomalejšího růstu samotného objemu těchto úloh.
Investor Michael Burry výzvy k pomalejšímu vývoji AI odmítl jako „self-serving“, tedy účelové ve prospěch těch, kdo je prosazují. Argumentoval, že zpomalení by mohlo pomoci zavedeným laboratořím vyvíjejícím špičkové modely a ztížit dohánění menším konkurentům. Zpochybnil také, zda jsou současné AI chatboty na cestě k obecné umělé inteligenci. 15
Burryho výroky jsou kritikou pobídek, nikoli důkazem skutečných motivů těchto firem. Také tvrzení, že bezpečnostní argumentace má sloužit plánovaným vstupům na burzu, je nutné chápat jako jeho obvinění, nikoli jako prokázaný fakt. 11
15
Nejpřesnější závěr je užší, ale důležitý: DeepSeek zpochybnil zjednodušenou verzi teze o AI pamětech. Ukázal, že software, architektura modelu, kvantizace a správa cache mohou podstatně snížit paměťovou náročnost inference. 52
55
Neprokázal však, že celková poptávka po pamětech klesne. Oznámené úspory se týkají KV cache při inferenci a srovnání s předchozí architekturou DeepSeeku. Neznamenají, že celý model nebo datové centrum spotřebují o 75 % méně HBM a o 87,5 % méně SSD. Neodstraňují ani paměť potřebnou pro váhy modelu a jeho trénování. 25
Nižší náklady na obsluhu modelu navíc mohou zvýšit jeho používání. Levnější inference může přivést více uživatelů, umožnit delší kontexty i více kroků agentů. Konečný výsledek pro poptávku proto závisí na tom, co převáží: úspora na jeden požadavek, nebo růst počtu a složitosti požadavků.
DeepSeek V4.1-Flash nezrušil dlouhodobý argument pro HBM, NAND ani AI infrastrukturu. Udělal jej ale podmíněnějším. Investoři už nemohou jednoduše předpokládat, že rostoucí využívání AI se automaticky promítne do stejně rychle rostoucí spotřeby pamětí na jednotlivou úlohu.
Důležitější otázkou je, zda efektivita poroste rychleji než nasazování AI. DeepSeek dodal důkaz, že inference může být dramaticky úspornější. Nevyřešil však, jak rychle následně poroste globální využití AI, rozsah trénování a poptávka po hardwaru.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek uvádí, že V4.1 Flash potřebuje pro KV cache jen čtvrtinu HBM a osminu SSD kapacity oproti předchozí generaci.
DeepSeek uvádí, že V4.1 Flash potřebuje pro KV cache jen čtvrtinu HBM a osminu SSD kapacity oproti předchozí generaci. Po oznámení klesly akcie Samsung Electronics a SK Hynix v Jižní Koreji během obchodování o více než 3 %.
Výzva šéfa Anthropicu Daria Amodeie ke zpomalení růstu schopností špičkové AI přidala další obavu: investice do AI infrastruktury by mohly růst pomaleji, než trh čekal.