DeepSeek stelt dat V4.1 Flash voor zijn KV cache slechts een kwart van het HBM en een achtste van de SSD opslag van de vorige generatie nodig heeft. Beleggers heroverwogen daarop de vooruitzichten voor AI geheugen: Samsung Electronics en SK Hynix verloren in Seoul elk meer dan 3% gedurende de handelsdag.
Gepubliceerd doorBewerkt met GPT-5.6 TerraAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10 V4.1 Flash release, which reduced key-value cache consumption to about one-quarter of its predecessor’s high. Article summary: The selloff reflected a rapid reassessment of the “AI equals ever-more memory” trade. DeepSeek’s V4.1-Flash showed that serving long-context models can be made far less memory-intensive, while Amodei’s proposed slowing o. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeek bracht beleggers op 10 september aan het twijfelen over een eenvoudig AI-verhaal: grotere modellen, langere contexten en meer autonome AI-agents zouden vanzelf leiden tot steeds meer vraag naar high-bandwidth memory (HBM), NAND-flash en opslaghardware. De technische claim van het bedrijf maakt geheugen niet overbodig. Maar zij laat wel zien dat de geheugenbehoefte om een bepaalde AI-taak te bedienen sterk kan dalen door een andere modelarchitectuur en slimmer cachebeheer. 61
25
Een key-value-cache (KV-cache) bewaart de aandachtstoestand van een model terwijl het een verzoek afhandelt. Dat is vooral relevant bij lange gesprekken en AI-agents: eerdere context hoeft dan niet telkens volledig opnieuw te worden verwerkt.
Volgens DeepSeek heeft V4.1-Flash voor zijn KV-cache nog maar een kwart van het HBM en een achtste van de SSD-opslag van de vorige generatie nodig. 61 Op de modelkaart schrijft DeepSeek dit toe aan een causale encoder-decoderarchitectuur. Daarbij wordt de globale KV-cache van de decoder afgeleid van de uiteindelijke verborgen toestanden van de encoder. Daarnaast gebruikt het bedrijf een uitroltechniek, SWA Bounded Replay, die voorkomt dat bepaalde cachetoestanden van een schuivend venster blijvend op SSD moeten worden opgeslagen.
52
Onafhankelijke berichtgeving schatte de globale KV-cache op circa 890 bytes per token — ongeveer een kwart van die van V4-Flash. Daarmee zouden binnen dezelfde KV-cachecapaciteit naar schatting vier tot acht keer zoveel gebruikers tegelijk kunnen worden bediend. 53 DeepSeek zegt bovendien per token 8 miljard parameters te activeren bij de invoerverwerking en 16 miljard bij het genereren van tekst; dat moet de kosten bij invoerintensieve agenttaken drukken.
52
De directe vraag voor de markt was niet of AI nog geheugen nodig heeft. Dat staat buiten kijf. Het ging erom of de geheugenbehoefte per eenheid inferentie-output veel sneller kan dalen dan in omzet- en vraagramingen was verondersteld.
Als een vergelijkbaar model meer gelijktijdige langcontextverzoeken aankan met dezelfde HBM- of opslagcapaciteit, kunnen cloudbedrijven meer rekenwerk uit bestaande infrastructuur halen. Dat zet aannames over toekomstige volumes, krapte en prijszettingsmacht onder druk bij HBM, DRAM, zakelijke SSD's en aangrenzende leveranciers van opslagapparatuur.
Na de release daalden Samsung Electronics en SK Hynix in Korea elk meer dan 3% tijdens de handel, volgens berichten. 17 De zorg sloeg breder over, omdat de AI-infrastructuurhandel geheugenproducenten verbindt met aanbieders van opslag, netwerken en rekenkracht. Een lagere geheugenvoetafdruk verandert de rekensom voor het uitrollen van modellen — ook als niet elke hardwarecategorie in dezelfde mate geraakt wordt.
Voor SanDisk onderstreepte de reactie hoe gevoelig de beleggingscase is geworden voor verwachtingen rond AI-vraag. Marktgegevens uit die periode toonden een 52-weeksbandbreedte van ongeveer $ 85 tot $ 2.354, terwijl de brede analistenconsensus op Buy of Moderate Buy bleef staan. 35
37 Zo'n positief advies neemt één fundamentele onzekerheid echter niet weg: welk deel van de toekomstige opslagvraag steunt op de aanname dat inferentiearchitecturen steeds even geheugenintensief blijven?
Het DeepSeek-nieuws was een efficiëntieschok. Dario Amodei, CEO van Anthropic, bracht met zijn oproep om de AI-grens te "doseren" een andere onzekerheid naar voren: het tempo waarin AI-capaciteiten groeien — en daarmee mogelijk ook de investeringen in infrastructuur.
In een essay van september stelde Amodei dat bedrijven doelbewust minder snel de capaciteiten van de meest geavanceerde modellen moeten verbeteren, zodat er meer tijd komt voor onderzoek naar afstemming en veiligheid. Hij pleitte voor ingebedde externe evaluatoren, samenwerking tussen bedrijven in democratische landen en uiteindelijk afspraken tussen overheden. 4
5
Dit was geen oproep om alle AI-ontwikkeling stil te leggen. Maar steun van andere prominente AI-leiders bracht beleggers ertoe rekening te houden met vrijwillige coördinatie of toekomstig beleid dat uitgaven aan versnellers, datacenters en geheugen zou kunnen temperen. Nasdaq 100-futures stonden dat weekend naar verluidt 1% lager, terwijl de discussie de AI-handel kritisch in beeld bracht. 8
Samen vormden de ontwikkelingen een ongemakkelijke combinatie voor beleggers: DeepSeek suggereerde dat AI-diensten minder geheugen per taak kunnen vragen, terwijl het debat over het afremmen van de AI-grens de mogelijkheid opriep dat ook het aantal taken minder snel groeit.
Belegger Michael Burry zette de oproepen om AI langzamer te ontwikkelen weg als "self-serving" — zelfdienend. Volgens hem kan een vertraging gevestigde laboratoria met geavanceerde modellen bevoordelen en het voor kleinere uitdagers moeilijker maken om in te lopen. Hij betwijfelde ook of de huidige AI-chatbots op weg zijn naar kunstmatige algemene intelligentie. 15
Burry's uitlatingen zijn kritiek op prikkels, geen bewijs van de motieven van deze bedrijven. Ook de suggestie dat veiligheidsretoriek bedoeld zou zijn om geplande beursgangen te ondersteunen, moet daarom als zijn aantijging worden gezien en niet als vastgesteld feit. 11
15
De stevigste conclusie is beperkt, maar belangrijk: DeepSeek heeft een al te simpele versie van de AI-geheugenthese ter discussie gesteld. Het model laat zien dat software, modelarchitectuur, kwantisatie en cachebeheer de geheugenintensiteit van inferentie aanzienlijk kunnen terugdringen. 52
55
Het bewijst niet dat de totale geheugenvraag zal dalen. De aangekondigde besparingen gaan over de KV-cache tijdens inferentie, vergeleken met DeepSeeks voorgaande architectuur. Het bedrijf claimt dus niet dat het hele model of datacenter 75% minder HBM en 87,5% minder SSD-opslag gebruikt. Ook verdwijnt het geheugen voor modelgewichten of training niet. 25
Lagere kosten voor het bedienen van modellen kunnen juist meer gebruik uitlokken: goedkopere inferentie kan meer gebruikers, langere contexten en meer agentlussen mogelijk maken. De uiteindelijke vraagontwikkeling hangt af van welke kracht overheerst: efficiëntie per verzoek, of groei in het aantal en de complexiteit van verzoeken.
DeepSeek V4.1-Flash heeft de langetermijncase voor HBM, NAND of AI-infrastructuur niet onderuitgehaald. Wel is die case minder vanzelfsprekend geworden. Beleggers kunnen niet langer zonder meer aannemen dat groeiend AI-gebruik één-op-één leidt tot meer geheugenverbruik per taak.
De relevantere vraag is of efficiëntiewinst sneller zal gaan dan de uitbreiding van AI-toepassingen. DeepSeek levert bewijs dat inferentie veel zuiniger kan worden, maar geeft nog geen definitief antwoord op hoe snel wereldwijd AI-gebruik, trainingsschaal en hardwarevraag daarna zullen groeien.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek stelt dat V4.1 Flash voor zijn KV cache slechts een kwart van het HBM en een achtste van de SSD opslag van de vorige generatie nodig heeft.
DeepSeek stelt dat V4.1 Flash voor zijn KV cache slechts een kwart van het HBM en een achtste van de SSD opslag van de vorige generatie nodig heeft. Beleggers heroverwogen daarop de vooruitzichten voor AI geheugen: Samsung Electronics en SK Hynix verloren in Seoul elk meer dan 3% gedurende de handelsdag.
De oproep van Anthropic topman Dario Amodei om de ontwikkeling van grensverleggende AI modellen af te remmen, voegde een tweede zorg toe: AI infrastructuuruitgaven zouden minder snel kunnen groeien dan verwacht.