DeepSeek uppger att V4.1 Flash använder en fjärdedel så mycket HBM och en åttondel så mycket SSD lagring för sin KV cache som föregående generation. Beskedet fick investerare att omvärdera AI exponerade minnesaktier; Samsung Electronics och SK Hynix föll båda över 3 procent som mest i Seoul.
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10 V4.1 Flash release, which reduced key-value cache consumption to about one-quarter of its predecessor’s high. Article summary: The selloff reflected a rapid reassessment of the “AI equals ever-more memory” trade. DeepSeek’s V4.1-Flash showed that serving long-context models can be made far less memory-intensive, while Amodei’s proposed slowing o. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeeks lansering av V4.1-Flash den 10 september skakade en marknad som i allt högre grad byggt på en enkel AI-berättelse: större modeller, längre kontextfönster och fler AI-agenter skulle kräva ständigt mer högbandbreddsminne, HBM, NAND-flash och lagringshårdvara. Den nya modellen gör inte minne överflödigt. Men den visade att minnesbehovet för att köra en viss AI-arbetslast kan minska kraftigt genom annan modellarkitektur och smartare cachehantering. 61
25
En KV-cache (key-value-cache) sparar information om modellens uppmärksamhetstillstånd medan en AI-modell svarar på en förfrågan. Den är särskilt viktig i långa konversationer och agentbaserade arbetsflöden, där modellen annars behöver bearbeta samma tidigare kontext på nytt.
DeepSeek uppger att V4.1-Flash behöver en fjärdedel så mycket HBM och en åttondel så mycket SSD-lagring för sin KV-cache jämfört med föregående generation. 61 I modellkortet kopplas förbättringen till en kausal encoder-decoder-arkitektur. Decoderns globala KV-cache projiceras då från encoderns slutliga dolda tillstånd, i stället för att härledas från varje decoderlager. Tekniken SWA Bounded Replay ska dessutom undvika att vissa cachetillstånd för glidande fönster behöver sparas på SSD.
52
Oberoende rapportering uppskattade den globala KV-cachen till omkring 890 byte per token, ungefär en fjärdedel av V4-Flash. Det skulle kunna ge plats för cirka fyra till åtta gånger fler användare inom samma KV-cacheutrymme. 53 DeepSeek säger också att modellen aktiverar 8 miljarder parametrar per token vid inmatningsbearbetning och 16 miljarder vid generering av svar – ett upplägg som ska förbättra effektiviteten i arbetslaster med mycket indata.
52
Marknadens omedelbara fråga var inte om AI-system behöver minne. Det gör de. Frågan var om minnesbehovet per enhet av AI-inferens, alltså när modeller används för att leverera svar, kan falla mycket snabbare än vad många prognoser för efterfrågan och intäkter har räknat med.
Om en jämförbar modell kan hantera fler samtidiga, kontexttunga förfrågningar med samma mängd HBM och lagring, kan molnleverantörer få ut högre kapacitet ur befintlig infrastruktur. Det utmanar antaganden om framtida försäljningsvolymer, utbudsbrist och prissättningskraft för HBM, DRAM, företags-SSD:er och närliggande lagringsutrustning.
Aktierna i Samsung Electronics och SK Hynix föll båda mer än 3 procent som mest i Sydkorea efter lanseringen, enligt rapporter. 17 Oron spred sig bredare eftersom AI-infrastruktursektorn knyter ihop minnestillverkare med leverantörer av lagring, nätverk och beräkningskraft. Ett lägre minnesavtryck kan ändra ekonomin i att driftsätta AI-modeller, även om efterfrågan inte påverkas lika mycket i varje hårdvarukategori.
För SanDisk visade situationen hur känsligt investeringscaset blivit för förväntningar på AI-efterfrågan. Marknadsdata under perioden visade ett 52-veckorsintervall på ungefär 85–2 354 dollar, samtidigt som analytikerkonsensus låg på Köp eller Måttligt köp. 35
37 En positiv konsensus löser dock inte kärnfrågan: hur stor del av den framtida lagringsefterfrågan bygger på att allt mer minnesintensiva inferensarkitekturer fortsätter oförändrade.
DeepSeeks besked var en effektivitetschock. Dario Amodeis uppmaning att ”pace the frontier” – att medvetet sänka takten i kapacitetsutvecklingen för de mest avancerade modellerna – väckte en separat fråga om takten i AI-utvecklingen och därmed investeringarna i infrastruktur.
I en essä i september argumenterade Anthropics vd för att bolag avsiktligt bör bromsa hur snabbt de förbättrar de mest avancerade AI-modellernas kapacitet och använda tiden till säkerhets- och kontrollarbete. Han föreslog externa utvärderare med insyn i bolagen, samordning mellan företag i demokratiska länder och på sikt överenskommelser mellan regeringar. 4
5
Förslaget var inte ett krav på att stoppa all AI-utveckling. Men stödet från andra framträdande AI-ledare fick marknaden att väga in möjligheten att frivillig samordning eller framtida reglering kan dämpa investeringarna i acceleratorer, datacenter och minne. Terminer för Nasdaq 100 uppgavs ha fallit 1 procent den helgen när diskussionen satte AI-handeln under lupp. 8
Tillsammans skapade händelserna en obekväm kombination för investerare: DeepSeek antydde att AI-tjänster kan behöva mindre minne per arbetslast, medan debatten om att bromsa fronten öppnade för en långsammare tillväxt i själva arbetslasterna.
Investeraren Michael Burry avfärdade kraven på långsammare AI-utveckling som ”self-serving”, alltså självbetjänande. Hans argument var att en inbromsning kan gynna redan etablerade frontlabb och samtidigt göra det svårare för mindre konkurrenter att komma ikapp. Han ifrågasatte också om dagens AI-chattbotar faktiskt är på väg mot artificiell generell intelligens. 15
Burrys uttalanden är en kritik av incitament, inte bevis för bolagens motiv. Påståenden om att säkerhetsbudskapet är utformat för att gynna planerade börsnoteringar bör därför ses som hans anklagelse, inte som fastslagna fakta. 11
15
Den starkaste slutsatsen är begränsad men viktig: DeepSeek utmanade en förenklad version av investeringscaset för AI-minne. Bolaget visade att mjukvara, modellarkitektur, kvantisering och cachehantering kan minska minnesintensiteten i inferens påtagligt. 52
55
Det visar inte att den totala efterfrågan på minne kommer att minska. De annonserade förbättringarna gäller KV-cache vid inferens och jämförs med DeepSeeks föregående arkitektur. Det är inte ett påstående om att hela modellen eller datacentret använder 75 procent mindre HBM och 87,5 procent mindre SSD-lagring. Förbättringarna tar heller inte bort minnesbehovet för modellvikter eller träning. 25
Lägre kostnader för att köra modeller kan dessutom öka användningen. Billigare inferens kan möjliggöra fler användare, längre kontext och fler agentloopar. Det slutliga utfallet för efterfrågan beror på vilken kraft som blir starkast: effektivitet per förfrågan eller tillväxten i antalet och komplexiteten hos förfrågningarna.
DeepSeek V4.1-Flash kullkastade inte det långsiktiga argumentet för HBM, NAND eller AI-infrastruktur. Men den gjorde argumentet mer villkorat. Investerare kan inte längre utgå från att ökad AI-användning automatiskt innebär lika stor ökning av minnesförbrukningen per arbetslast.
Den mer relevanta frågan är om effektivitetsvinsterna kommer att gå snabbare än utbyggnaden av AI. DeepSeek gav belägg för att inferens kan bli dramatiskt mer resurssnål – men inte ett definitivt svar på hur snabbt den globala AI-användningen, träningsskalan och efterfrågan på hårdvara växer därefter.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek uppger att V4.1 Flash använder en fjärdedel så mycket HBM och en åttondel så mycket SSD lagring för sin KV cache som föregående generation.
DeepSeek uppger att V4.1 Flash använder en fjärdedel så mycket HBM och en åttondel så mycket SSD lagring för sin KV cache som föregående generation. Beskedet fick investerare att omvärdera AI exponerade minnesaktier; Samsung Electronics och SK Hynix föll båda över 3 procent som mest i Seoul.
Anthropic chefen Dario Amodeis förslag om att bromsa utvecklingen av de mest avancerade AI modellerna gav marknaden ytterligare en risk: att investeringarna i AI infrastruktur kan växa långsammare än väntat.