DeepSeek oplyser, at V4.1 Flash bruger en fjerdedel så meget HBM og en ottendedel så meget SSD lagring til sin KV cache som den foregående generation. Udmeldingen udløste en revurdering af AI eksponerede hukommelsesaktier: Samsung Electronics og SK Hynix faldt hver mere end 3 % intradag i Seoul.
Udgivet afRedigeret med GPT-5.6 TerraBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10 V4.1 Flash release, which reduced key-value cache consumption to about one-quarter of its predecessor’s high. Article summary: The selloff reflected a rapid reassessment of the “AI equals ever-more memory” trade. DeepSeek’s V4.1-Flash showed that serving long-context models can be made far less memory-intensive, while Amodei’s proposed slowing o. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeeks lancering af V4.1-Flash den 10. september forstyrrede en stadig mere enkel fortælling på AI-markedet: Større modeller, længere kontekstvinduer og flere AI-agenter ville kræve støt voksende mængder high-bandwidth memory (HBM), NAND-flash og lagringshardware.
Modellens tekniske påstand gør ikke hukommelse overflødig. Men den viser, at hukommelsesbehovet ved at betjene en bestemt AI-opgave kan reduceres betydeligt gennem modelarkitektur og bedre cache-håndtering. 61
25
En KV-cache (key-value-cache) gemmer information om opmærksomhedstilstanden, mens en model behandler en forespørgsel. Den er særligt vigtig i samtaler med lang kontekst og i agentbaserede AI-opgaver, hvor modellen ellers ville skulle behandle hele historikken igen og igen.
DeepSeek oplyser, at V4.1-Flash reducerer behovet for KV-cache til en fjerdedel af HBM-forbruget og en ottendedel af SSD-lagringen sammenlignet med den foregående generation. 61 Ifølge modelkortet skyldes det et kausalt encoder-decoder-design, hvor dekoderens globale KV-cache afledes fra encoderens endelige skjulte tilstande, kombineret med en implementeringsteknik kaldet SWA Bounded Replay. Den undgår at gemme visse cache-tilstande for glidende vinduer på SSD.
52
Uafhængig omtale af lanceringen anslog den globale KV-cache til omkring 890 byte pr. token – cirka en fjerdedel af V4-Flash – og vurderede, at designet kan understøtte omtrent fire til otte gange så mange brugere inden for samme KV-cache-kapacitet. 53 DeepSeek oplyser desuden, at modellen aktiverer 8 mia. parametre pr. token ved inputbehandling og 16 mia. under generering af svar, hvilket skal gøre den mere effektiv ved inputtunge opgaver.
52
Det umiddelbare spørgsmål var ikke, om AI-systemer fortsat har brug for hukommelse. Det har de tydeligvis. Spørgsmålet var, om mængden af hukommelse pr. enhed AI-output kan falde langt hurtigere, end mange modeller for omsætning og efterspørgsel havde forudsat.
Hvis en sammenlignelig model kan håndtere flere samtidige forespørgsler med lang kontekst fra den samme HBM- eller lagerkapacitet, kan cloududbydere få mere kapacitet ud af den eksisterende infrastruktur. Det udfordrer antagelser om fremtidige salgsmængder, forsyningsknaphed og prisstyrke på tværs af HBM, DRAM, enterprise-SSD'er og tilstødende lagringsudstyr.
Aktierne i Samsung Electronics og SK Hynix faldt hver mere end 3 % intradag i Sydkorea efter lanceringen, ifølge medieomtale. 17 Bekymringen bredte sig, fordi AI-infrastrukturhandlen binder hukommelsesproducenter sammen med leverandører af lagring, netværk og datakraft: Et lavere hukommelsesaftryk kan ændre økonomien i at udrulle modeller, selv om efterspørgslen ikke nødvendigvis falder lige meget i alle hardwarekategorier.
For SanDisk viste udviklingen, hvor følsom investeringscasen er blevet over for forventninger til AI-efterspørgsel. Markedsdata viste i perioden et 52-ugers interval på cirka 85 til 2.354 dollar, mens den brede analytikerkonsensus fortsat var Køb eller Moderat køb. 35
37 En positiv konsensus fjerner dog ikke den centrale usikkerhed: Hvor stor en del af den fremtidige lagringsefterspørgsel bygger på, at stadig mere hukommelseskrævende inferensarkitekturer fortsætter uændret?
DeepSeek-nyheden var et effektivitetsschok. Dario Amodeis opfordring til at "pace the frontier" – altså sænke tempoet ved AI-fronten – rejste et andet spørgsmål: tempoet i AI-modellernes kapacitetsudvikling og dermed investeringerne i infrastruktur.
I et essay i september argumenterede Anthropics administrerende direktør for, at virksomheder bevidst bør sænke hastigheden, hvormed de forbedrer frontmodellernes kapaciteter, og bruge den ekstra tid på sikkerheds- og alignmentarbejde. Han foreslog fast indlejrede tredjepartsevaluatorer, koordinering mellem virksomheder i demokratiske lande og på sigt aftaler mellem regeringer. 4
5
Forslaget var ikke en opfordring til at standse al AI-udvikling. Men offentlig støtte fra andre fremtrædende AI-ledere fik markedet til at overveje, om frivillig koordinering eller kommende regulering kan dæmpe de investeringer i acceleratorer, datacentre og hukommelse, som har båret den brede AI-handel. Nasdaq 100-futures blev rapporteret 1 % lavere den weekend, hvor debatten satte handlen under lup. 8
Tilsammen skabte de to udviklinger en ubehagelig kombination for investorer: DeepSeek pegede på mindre hukommelsesforbrug pr. opgave, mens debatten om at sænke tempoet rejste udsigten til langsommere vækst i selve antallet af opgaver.
Investoren Michael Burry afviste opfordringerne til langsommere AI-udvikling som "self-serving" – selvbetjenende. Hans argument var, at en opbremsning kan gavne de etablerede frontlaboratorier og samtidig gøre det sværere for mindre konkurrenter at indhente dem. Han satte også spørgsmålstegn ved, om nutidens AI-chatbots overhovedet er på vej mod kunstig generel intelligens. 15
Burrys udtalelser er en kritik af incitamenterne, ikke dokumentation for virksomhedernes motiver. Påstande om, at sikkerhedsbudskaber er udformet for at understøtte planlagte børsnoteringer, bør tilsvarende ses som hans anklage – ikke som et fastslået forhold. 11
15
Den mest solide konklusion er afgrænset, men vigtig: DeepSeek udfordrede en forenklet udgave af tesen om AI-hukommelse. Selskabet viste, at software, modelarkitektur, kvantisering og cache-håndtering kan sænke hukommelsesintensiteten ved inferens markant. 52
55
Det fastslår ikke, at den samlede efterspørgsel efter hukommelse vil falde. De annoncerede reduktioner gælder KV-cache under inferens og sammenlignes med DeepSeeks foregående arkitektur. Det er ikke en påstand om, at hele modellen eller datacentret bruger 75 % mindre HBM og 87,5 % mindre SSD-lagring, og det fjerner heller ikke hukommelsesbehovet til modelvægte eller træning. 25
Lavere omkostninger ved at betjene modeller kan også øge brugen: Billigere inferens kan give flere brugere, længere kontekster og flere agentforløb. Det endelige udfald for efterspørgslen afhænger af, hvilken kraft der bliver stærkest – effektiviteten pr. forespørgsel eller væksten i antallet og kompleksiteten af forespørgsler.
DeepSeek V4.1-Flash underkendte ikke den langsigtede case for HBM, NAND eller AI-infrastruktur. Men den gjorde den mere betinget. Investorer kan ikke længere uden videre antage, at voksende AI-brug omsættes én til én i stigende hukommelsesforbrug pr. opgave.
Det centrale spørgsmål er i stedet, om effektivitetsgevinsterne vil vokse hurtigere end AI-udrulningen. DeepSeek leverede bevis for, at inferens kan blive markant mere ressourcelet; lanceringen afgjorde ikke, hvor hurtigt den globale AI-brug, træningsskalaen og hardwareefterspørgslen derefter vil vokse.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek oplyser, at V4.1 Flash bruger en fjerdedel så meget HBM og en ottendedel så meget SSD lagring til sin KV cache som den foregående generation.
DeepSeek oplyser, at V4.1 Flash bruger en fjerdedel så meget HBM og en ottendedel så meget SSD lagring til sin KV cache som den foregående generation. Udmeldingen udløste en revurdering af AI eksponerede hukommelsesaktier: Samsung Electronics og SK Hynix faldt hver mere end 3 % intradag i Seoul.
Anthropic chef Dario Amodeis forslag om at sænke tempoet i udviklingen af frontmodeller skabte en yderligere bekymring: Investeringerne i AI infrastruktur kan vokse langsommere end ventet.