DeepSeek oppgir at V4.1 Flash trenger en firedel så mye HBM og en åttedel så mye SSD lagring til KV cache som forrige generasjon. Markedet tolket forbedringen som en mulig reduksjon i minnebehovet per AI arbeidslast, og minne og lagringsaksjer falt.
Publisert avRedigert med GPT-5.6 TerraBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10, 2026 release of its V4.1 Flash AI model—whose architectural changes reduced key-value-cache usage to about. Article summary: The selloff was a rapid repricing of an AI-memory scarcity thesis, not proof that memory demand has permanently collapsed. DeepSeek showed that serving long-context models can require far less KV-cache HBM and persistent. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
DeepSeeks lansering av V4.1-Flash fikk markedet til å stille spørsmål ved en sentral antakelse bak AI-aksjene: at stadig kraftigere modeller nødvendigvis krever stadig mer minne og lagring per arbeidslast. Salget var derfor først og fremst en revurdering av denne forutsetningen – ikke et bevis på at den langsiktige AI-drevne minnesyklusen er over.
DeepSeek opplyste at V4.1-Flash trenger en firedel så mye høybåndbredde-minne (HBM) og en åttedel så mye SSD-lagring til sin key-value-cache, eller KV-cache, som forrige generasjon. Selskapet fremhevet særlig betydningen av cache-treffkostnader i agentbaserte AI-arbeidslaster. 29
KV-cache lagrer oppmerksomhetstilstanden fra tidligere tekstbiter, slik at modellen kan fortsette en lang samtale eller prosess uten å beregne hele den foregående konteksten på nytt. Den er dermed en viktig kapasitetsbegrensning når AI-modeller skal betjene mange brukere samtidig, særlig ved lange kontekstvinduer og autonome AI-agenter.
Dette betyr imidlertid ikke at et helt AI-system plutselig bruker 75 prosent mindre HBM eller 87,5 prosent mindre lagring. DeepSeeks sammenligning gjelder KV-cache mot selskapets forrige arkitektur. Modellvekter, treningsinfrastruktur og andre komponenter bruker fortsatt betydelige mengder minne og lagring. 25
For investorer var den umiddelbare slutningen enkel: Dersom en modell kan levere tilsvarende inferens – altså kjøring av en ferdigtrent modell – med langt mindre cache-minne, kan den samme maskinvareparken betjene flere sesjoner. Det kan dempe forventningene til minneintensiteten per arbeidslast, og dermed til etterspørsel og prising for HBM og bedriftslagring på kort sikt.
Reaksjonen kom raskt. I Seoul falt Samsung-aksjen 3,5 prosent og SK Hynix 2,2 prosent etter lanseringen, ifølge samtidig markedsdekning. 49 I senere amerikansk handel kom også minne- og lagringsselskaper under press, ettersom investorer vurderte konsekvensene av DeepSeeks lavere behov for HBM og SSD-kapasitet.
51
52
Det beviser ikke at én modellansering alene forklarer alle kursbevegelsene. Halvlederaksjer påvirkes også av resultatutvikling, tilbudssituasjon, renter, risikovilje og prognoser for investeringer i datasentre. Men reaksjonen viste hvor følsomme AI-relaterte verdsettelser er for tegn på at programvare og modellarkitektur kan redusere maskinvarebehovet per AI-tjeneste.
Effektivitetsnyheten kom samtidig med en annen bekymring om etterspørselen. Anthropics toppsjef Dario Amodei argumenterte i essayet We Must Pace the Frontier for å dempe tempoet i forbedringen av AI-kapasiteter, slik at selskaper og myndigheter får tid til å sikre og tilpasse stadig mer avanserte systemer. Han presiserte at «pacing» ikke innebærer å stanse modelltrening eller teknisk utvikling, og foreslo blant annet innebygde tredjepartsevaluatorer, koordinering mellom demokratiske land og global koordinering. 40
Markedet kan tolke en lavere utviklingstakt – selv uten treningsstans – som en risiko for at deler av investeringene i AI-akseleratorer, nettverk, minne og datasentre blir utsatt. På dagen som ble omtalt i markedsrapportene, var Nasdaq-100-futures ned 1,77 prosent. Marvell falt mer enn 7 prosent, Intel rundt 6 prosent og Micron mer enn 5 prosent. 51
De to forholdene er likevel forskjellige:
Sammen gjorde de de mest optimistiske prognosene for AI-infrastruktur mindre selvfølgelige.
Investoren Michael Burry kalte retorikken om å senke AI-tempoet «self-serving», altså egeninteressert. Han mente at den kan gagne etablerte frontlinjelaboratorier ved å gjøre konkurransen vanskeligere, skape «hype & puffery» foran mulige børsnoteringer og gi dekning for avtakende vekst. Han argumenterte også for at store språkmodeller ikke er kunstig generell intelligens, AGI, og at det derfor ikke finnes noe slikt å bremse. 14
Dette er Burrys syn på konkurranse, verdsettelser og AI-kapasitet – ikke en etablert teknisk konklusjon. Markedets viktige poeng var at debatten om tempo ble vurdert både gjennom et sikkerhetsperspektiv og et insentivperspektiv.
Den enkle utgaven av AI-tesen for minnebransjen var lineær: Større modeller, lengre kontekstvinduer og flere AI-brukere skulle gi mer behov for HBM, NAND-flash og lagringskapasitet. DeepSeek viser en viktig motkraft: arkitektonisk effektivitet.
En mer presis måte å vurdere etterspørselen på er å skille mellom to forhold:
At det første faller, avgjør ikke automatisk det andre. Billigere og mer effektiv inferens kan utvide bruken og gi flere samlede forespørsler. Men dersom effektiviteten sprer seg raskere enn bruken vokser, kan det bety mindre maskinvare for å levere et gitt nivå av AI-output.
V4.1-Flash er mest direkte relevant for inferens og KV-cache. DeepSeeks oppgitte forbedring fjerner ikke minnebehovet knyttet til modellvekter eller trening. 25 Det er et viktig skille, fordi trening og drift av modeller stiller ulike krav til datakraft, minne og sammenkobling mellom systemer.
Det sentrale spørsmålet er derfor ikke om effektivitetsgevinsten er betydelig – det er den – men om den endrer den samlede etterspørselen. Investorer må følge med på hvor raskt tilsvarende cache-besparende teknikker tas i bruk, veksten i lange kontekster og agentarbeidslaster, prisutviklingen for HBM og lagring, og om trening og utrulling av frontlinjemodeller fortsetter å øke.
Foreløpig er salget best forstått som en påminnelse om at AI-drevet minneknapphet ikke er en enveis handel. Modellinnovasjon kan redusere maskinvarebehovet per forespørsel like raskt som nye bruksområder øker antallet forespørsler.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek oppgir at V4.1 Flash trenger en firedel så mye HBM og en åttedel så mye SSD lagring til KV cache som forrige generasjon.
DeepSeek oppgir at V4.1 Flash trenger en firedel så mye HBM og en åttedel så mye SSD lagring til KV cache som forrige generasjon. Markedet tolket forbedringen som en mulig reduksjon i minnebehovet per AI arbeidslast, og minne og lagringsaksjer falt.
Effektiviteten gjelder først og fremst inferens og KV cache. Det er fortsatt usikkert om lavere behov per forespørsel vil redusere samlet etterspørsel.