DeepSeek stelt dat V4.1 Flash voor zijn KV cache een kwart van het HBM en een achtste van de SSD opslag van de vorige generatie nodig heeft. Beleggers zagen daarin een risico voor de geheugenintensiteit per AI workload, waarna onder meer Samsung, SK Hynix en Amerikaanse geheugen en opslagfondsen daalden.
Gepubliceerd doorBewerkt met GPT-5.6 TerraAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10, 2026 release of its V4.1 Flash AI model—whose architectural changes reduced key-value-cache usage to about. Article summary: The selloff was a rapid repricing of an AI-memory scarcity thesis, not proof that memory demand has permanently collapsed. DeepSeek showed that serving long-context models can require far less KV-cache HBM and persistent. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
DeepSeeks release van V4.1-Flash gaf de markt reden om een cruciale aanname achter de AI-hardwarehausse opnieuw te beoordelen: dat krachtigere AI-modellen per uitgerolde toepassing vanzelf steeds meer geheugen en opslag vereisen. De koersreactie was vooral een herwaardering van die aanname, versterkt door de afzonderlijke discussie over een mogelijk langzamer tempo van geavanceerde AI-ontwikkeling. Het is geen bewijs dat de structurele vraag naar AI-geheugen voorbij is.
DeepSeek meldde dat V4.1-Flash voor zijn key-value-cache, meestal afgekort tot KV-cache, een kwart van het high-bandwidth memory (HBM) en een achtste van de SSD-opslag van de vorige generatie nodig heeft. Volgens het bedrijf vormen de kosten van cache-hits vaak een groot deel van de kosten van AI-agenttoepassingen. 29
Een KV-cache bewaart de aandachtsstatus van eerdere tokens, zodat een model een lang gesprek of proces kan voortzetten zonder alle eerdere context opnieuw te hoeven berekenen. Dat maakt de cache een belangrijke capaciteitsfactor bij het aanbieden van AI-inferentie, zeker voor lange contextvensters en AI-agents.
De vergelijking betekent nadrukkelijk niet dat een compleet AI-systeem plotseling 75% minder HBM of 87,5% minder opslag nodig heeft. Het gaat uitsluitend om de KV-cache en om een vergelijking met de voorgaande DeepSeek-architectuur. Modelgewichten, trainingsinfrastructuur en andere onderdelen blijven aanzienlijk geheugen en opslag vergen. 25
De conclusie voor beleggers lag voor de hand: als een model vergelijkbare inferentieactiviteit kan afhandelen met veel minder cachegeheugen, kan een vaste hoeveelheid AI-hardware mogelijk meer gelijktijdige sessies bedienen. Dat zet verwachtingen over de benodigde hoeveelheid geheugen per workload onder druk, en daarmee ook aannames over de vraag naar en prijszetting van HBM en zakelijke opslag.
De markt reageerde direct. In Seoul daalde Samsung 3,5% en SK Hynix 2,2% na de release, volgens berichtgeving uit die periode. 49 In de daaropvolgende Amerikaanse handel kwamen ook geheugen- en opslagbedrijven onder druk te staan. Verslagen koppelden die daling aan DeepSeeks lagere behoefte aan HBM en SSD-opslag, terwijl beleggers de vooruitzichten voor AI-infrastructuur opnieuw inschatten.
51
52
Daarmee is niet aangetoond dat één modelrelease alle koersbewegingen veroorzaakte. Aandelen van chipbedrijven reageren ook op winstverwachtingen, aanbod, rente, algemeen risicosentiment en prognoses voor investeringen in datacenters. Wel liet de reactie zien hoe gevoelig AI-gerelateerde waarderingen zijn geworden voor software- en architectuurverbeteringen die de benodigde hardware per geleverde AI-dienst verminderen.
Het efficiëntienieuws viel samen met een andere zorg over de vraag. Dario Amodei, topman van Anthropic, betoogde in zijn essay We Must Pace the Frontier dat de verbetering van AI-capaciteiten langzamer moet verlopen, zodat bedrijven en overheden tijd krijgen om steeds krachtigere systemen veilig af te stemmen en te controleren. Hij maakte expliciet onderscheid tussen het tempo verlagen en het stopzetten van modeltraining of technische vooruitgang. Zijn voorstel omvatte permanente externe evaluatoren binnen bedrijven, coördinatie tussen democratische overheden en wereldwijde afstemming. 40
De markt kan een trager ontwikkelingstempo — ook zonder trainingsstop — lezen als een risico dat uitgaven aan accelerators, netwerken, geheugen en datacenters later plaatsvinden. Op de dag waarop marktrapporten hierover verschenen, stonden Nasdaq-100-futures 1,77% lager; Marvell verloor meer dan 7%, Intel circa 6% en Micron meer dan 5%. 51
De twee ontwikkelingen zijn niet hetzelfde:
Samen maakten ze de meest optimistische ramingen voor de vraag naar AI-infrastructuur minder vanzelfsprekend.
Belegger Michael Burry noemde de oproep tot vertraging door de sector „zelfdienend”. Volgens hem kan zo'n koers gevestigde AI-labs helpen door concurrentie moeilijker te maken, dienen als „hype & puffery” rond mogelijke beursgangen en dekking bieden voor afnemende groei. Ook stelde hij dat grote taalmodellen geen artificial general intelligence (AGI) zijn en dat er dus „niets” van die aard valt af te remmen. 14
Dat zijn Burry's opvattingen over concurrentie, waarderingen en AI-capaciteiten, geen vaststaande technische conclusies. Voor de markt was vooral relevant dat het debat over vertraging niet alleen door de veiligheidsbril werd bekeken, maar ook door die van belangen en concurrentie.
De eenvoudige versie van de AI-geheugenthese was lineair: grotere modellen, langere contextvensters en meer AI-gebruikers zouden automatisch meer HBM, NAND-flash en opslagcapaciteit vereisen. DeepSeek voegt daar een wezenlijke tegenkracht aan toe: architectuurefficiëntie.
Een beter kader splitst de vraag op in twee variabelen:
Een daling van het eerste bepaalt het tweede dus niet automatisch. Goedkopere en efficiëntere inferentie kan de adoptie vergroten en meer totale aanvragen opleveren. Maar als efficiëntiewinst zich sneller verspreidt dan het gebruik groeit, kan voor dezelfde hoeveelheid AI-output minder hardware nodig zijn.
V4.1-Flash is vooral relevant voor inferentie en KV-cache. DeepSeeks vergelijking neemt het geheugen voor modelgewichten en training niet weg. 25 Dat verschil is belangrijk, omdat het trainen en aanbieden van modellen heel andere eisen stelt aan rekenkracht, geheugen en verbindingen tussen chips.
De kernvraag is dus niet óf de gemelde efficiëntiewinst betekenisvol is — dat is zij — maar of die de totale vraag verandert. Beleggers zullen moeten volgen hoe breed vergelijkbare cachebesparende technieken worden toegepast, hoe snel lange-context- en agentworkloads groeien, hoe HBM- en opslagprijzen zich ontwikkelen en of training en uitrol van geavanceerde modellen blijven versnellen.
Voorlopig is de verkoopgolf vooral een waarschuwing tegen het behandelen van AI-geheugenschaarste als een eenrichtingshandel. Modelinnovatie kan de benodigde hardware per aanvraag verlagen, net zo snel als nieuwe toepassingen het aantal aanvragen kunnen opvoeren.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek stelt dat V4.1 Flash voor zijn KV cache een kwart van het HBM en een achtste van de SSD opslag van de vorige generatie nodig heeft.
DeepSeek stelt dat V4.1 Flash voor zijn KV cache een kwart van het HBM en een achtste van de SSD opslag van de vorige generatie nodig heeft. Beleggers zagen daarin een risico voor de geheugenintensiteit per AI workload, waarna onder meer Samsung, SK Hynix en Amerikaanse geheugen en opslagfondsen daalden.
De langetermijneffecten blijven onzeker: efficiëntere inferentie kan het geheugenverbruik per aanvraag verlagen, maar ook meer AI gebruik aanjagen.