DeepSeek oplyser, at V4.1 Flash bruger en fjerdedel så meget HBM og en ottendedel så meget SSD lager til KV cache som den forrige generation. Markederne læste det som en mulig dæmper på efterspørgslen efter hukommelse og lager pr.
Udgivet afRedigeret med GPT-5.6 TerraBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10, 2026 release of its V4.1 Flash AI model—whose architectural changes reduced key-value-cache usage to about. Article summary: The selloff was a rapid repricing of an AI-memory scarcity thesis, not proof that memory demand has permanently collapsed. DeepSeek showed that serving long-context models can require far less KV-cache HBM and persistent. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
DeepSeeks lancering af V4.1-Flash gav investorerne grund til at udfordre en central antagelse bag AI-hardwarehandlen: at mere avancerede modeller nødvendigvis kræver stadig mere hukommelse og lager pr. AI-tjeneste. Den umiddelbare kursreaktion var derfor en revurdering af netop den antagelse – forstærket af en separat debat om at sænke tempoet i udviklingen af de mest avancerede AI-modeller. Det er ikke det samme som et bevis på, at den langsigtede AI-efterspørgsel efter hukommelse er forbi.
DeepSeek oplyste, at V4.1-Flash behøver en fjerdedel af den high-bandwidth memory (HBM) og en ottendedel af SSD-lageret til sin key-value-cache (KV-cache) sammenlignet med den forrige generation. Selskabet fremhævede især, at omkostninger ved cache-træffere kan udgøre en stor del af udgifterne ved AI-agenter. 29
KV-cachen gemmer opmærksomhedstilstanden fra tidligere tokens, så modellen kan fortsætte en lang samtale eller proces uden at genberegne hele den tidligere kontekst. Den er derfor en væsentlig kapacitetsbegrænsning, når AI-modeller skal levere svar i drift – særligt ved lange kontekster og agentbaserede opgaver.
Forbedringen betyder dog ikke, at et helt AI-system pludselig bruger 75 % mindre HBM eller 87,5 % mindre lager. DeepSeeks sammenligning handler specifikt om KV-cachebehovet i forhold til selskabets egen tidligere arkitektur. Modelvægte, træningsinfrastruktur og andre dele af systemet kræver fortsat betydelige mængder hukommelse og lager. 25
For investorer var budskabet enkelt: Hvis en model kan levere tilsvarende inferens med langt mindre cachehukommelse, kan den samme hardware i princippet håndtere flere samtidige brugere eller sessioner. Det kan svække de kortsigtede forventninger til, hvor meget hukommelse der kræves pr. AI-arbejdsbelastning – og dermed også forventningerne til efterspørgsel og prissætning for HBM og enterprise-lager.
Reaktionen var synlig i markedet. I Seoul faldt Samsung 3,5 %, mens SK Hynix faldt 2,2 % efter lanceringen, ifølge samtidig markedsdækning. 49 Senere kom også amerikanske hukommelses- og lageraktier under pres. Markedsrapporter pegede på DeepSeeks lavere behov for HBM og SSD-lager som en del af investorernes nye vurdering af AI-infrastrukturens efterspørgselsudsigter.
51
52
Det beviser ikke, at én modellancering alene forklarede alle kursbevægelser. Halvlederaktier påvirkes også af blandt andet indtjeningsforventninger, udbudssituationen, renter, generel risikoappetit og prognoser for datacenterinvesteringer. Men faldet viste, hvor følsomme AI-relaterede værdiansættelser var blevet over for tegn på, at software og modelarkitektur kan reducere hardwarebehovet pr. AI-forespørgsel.
Effektivitetsnyheden kom samtidig med en anden mulig dæmper for hardwareefterspørgslen. Anthropics direktør Dario Amodei argumenterede i essayet We Must Pace the Frontier for at sænke hastigheden i forbedringen af AI-kapabiliteter, så virksomheder og myndigheder får tid til at tilpasse og sikre stadigt stærkere systemer.
Amodei skelnede udtrykkeligt mellem at "pace" udviklingen og at stoppe træning eller tekniske fremskridt. Hans forslag omfattede blandt andet indlejrede tredjepartsevaluatorer, koordinering mellem demokratiske regeringer og global koordinering. 40
Markederne kan tolke et langsommere kapabilitetsforløb – selv uden træningsstop – som en risiko for, at dele af investeringerne i acceleratorer, netværk, hukommelse og datacentre bliver udskudt. På dagen omtalt i markedsrapporterne faldt Nasdaq-100-futures 1,77 %, mens Marvell faldt over 7 %, Intel omkring 6 % og Micron over 5 %. 51
De to forhold er forskellige:
Sammen gjorde de mest aggressive prognoser for AI-infrastrukturens efterspørgsel mindre selvindlysende.
Investoren Michael Burry kaldte branchens retorik om at sænke tempoet for "self-serving" – altså drevet af egeninteresse. Han argumenterede for, at det kan gavne etablerede frontier-laboratorier ved at gøre konkurrencen sværere, levere "hype & puffery" før mulige børsnoteringer og fungere som dække for aftagende vækst. Han argumenterede også for, at store sprogmodeller ikke er kunstig generel intelligens, AGI, og at der derfor efter hans opfattelse ikke er noget af den slags at sænke tempoet for. 14
Det er Burrys syn på konkurrence, værdiansættelser og AI-kapabiliteter – ikke fastslåede tekniske konklusioner. Markedets centrale pointe var, at debatten blev læst både gennem en sikkerhedspolitisk og en incitamentsmæssig linse.
Den enkle udgave af AI-tesen for hukommelsessektoren var lineær: Større modeller, længere kontekstvinduer og flere AI-brugere skulle føre til mere HBM, NAND og lagerkapacitet. DeepSeek indfører en væsentlig modkraft: arkitektonisk effektivitet.
Et bedre analysegrundlag skelner mellem to forhold:
Et fald i det første mål afgør ikke automatisk det andet. Billigere og mere effektiv inferens kan udvide anvendelsen og skabe flere samlede forespørgsler. Omvendt kan udbredt effektivisering reducere den hardware, der behøves for at levere et givet niveau af AI-output, hvis den slår hurtigere igennem end væksten i brugen.
V4.1-Flash er mest direkte relevant for inferens og KV-cache. DeepSeeks oplyste sammenligning fjerner ikke behovet for hukommelse til modelvægte eller træning. 25 Det er en vigtig skelnen, fordi træning og drift af modeller stiller forskellige krav til regnekraft, hukommelse og forbindelser mellem chips.
Det centrale usikkerhedspunkt er derfor ikke, om effektivitetsforbedringen er betydningsfuld – det er den – men om den ændrer den samlede efterspørgsel. Investorer vil især skulle følge udbredelsen af lignende cachebesparende teknikker, væksten i lange kontekster og agentarbejdsbelastninger, priserne på HBM og lager samt om træning og implementering af frontier-modeller fortsat accelererer.
Indtil videre er salget bedst forstået som en påmindelse om, at knaphed på AI-hukommelse ikke nødvendigvis er en ensrettet investeringstese. Modelinnovation kan sænke hardwarebehovet pr. forespørgsel lige så hurtigt, som nye anvendelser kan øge antallet af forespørgsler.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek oplyser, at V4.1 Flash bruger en fjerdedel så meget HBM og en ottendedel så meget SSD lager til KV cache som den forrige generation.
DeepSeek oplyser, at V4.1 Flash bruger en fjerdedel så meget HBM og en ottendedel så meget SSD lager til KV cache som den forrige generation. Markederne læste det som en mulig dæmper på efterspørgslen efter hukommelse og lager pr.
Det afgørende er nu, om mere effektiv inferens skaber så meget ekstra brug, at den samlede efterspørgsel efter hukommelse alligevel fortsætter opad.