DeepSeek oppgir at V4.1 Flash bruker en firedel så mye HBM og en åttedel så mye SSD lagring til KV cache som forrige generasjon. Etter lanseringen falt Samsung Electronics og SK Hynix begge over 3 prosent intradag i Seoul, ifølge rapporter.
Publisert avRedigert med GPT-5.6 TerraBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10 V4.1 Flash release, which reduced key-value cache consumption to about one-quarter of its predecessor’s high. Article summary: The selloff reflected a rapid reassessment of the “AI equals ever-more memory” trade. DeepSeek’s V4.1-Flash showed that serving long-context models can be made far less memory-intensive, while Amodei’s proposed slowing o. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeeks lansering av V4.1-Flash 10. september utfordret en stadig enklere fortelling i AI-markedet: Større modeller, lengre kontekstvinduer og flere AI-agenter skulle automatisk gi jevnt økende behov for høybåndbreddeminne (HBM), NAND-flash og lagringsutstyr. Den tekniske nyheten betyr ikke at minne blir overflødig. Den viste derimot at minnebehovet for å betjene en bestemt AI-arbeidsoppgave kan kuttes betydelig gjennom modellarkitektur og smartere cache-håndtering. 61
25
En KV-cache (key-value-cache) lagrer informasjon om modellens oppmerksomhetstilstand mens den besvarer en forespørsel. Den er særlig viktig i lange samtaler og agentbaserte arbeidsflyter, der modellen ellers måtte behandlet hele samtalehistorikken på nytt.
DeepSeek oppgir at V4.1-Flash trenger en firedel av HBM-minnet og en åttedel av SSD-lagringen til KV-cache sammenlignet med forrige generasjon. 61 I modellkortet forklares dette med en kausal encoder-decoder-arkitektur: Decoderens globale KV-cache projiseres fra encoderens endelige skjulte tilstander, i stedet for å bygges separat i hvert decoder-lag. I tillegg brukes en distribusjonsteknikk kalt SWA Bounded Replay, som unngår å lagre bestemte cache-tilstander for glidende vinduer permanent på SSD.
52
Uavhengig dekning av lanseringen anslo et globalt KV-cache-avtrykk på om lag 890 byte per token, omtrent en firedel av V4-Flash. Det kan i teorien gi kapasitet til om lag fire til åtte ganger flere samtidige brukere innenfor samme KV-cache-avtrykk. 53 DeepSeek sier også at modellen aktiverer 8 milliarder parametere per token under innlesing av input og 16 milliarder under generering av svar – et oppsett rettet mot bedre effektivitet i arbeidsoppgaver med mye inndata.
52
Markedets umiddelbare spørsmål var ikke om AI fortsatt trenger minne. Det gjør den. Spørsmålet var om minnebehovet per enhet AI-inferens – altså når modellen kjører og svarer brukeren – kan falle raskere enn mange prognoser for omsetning og etterspørsel har lagt til grunn.
Hvis en sammenlignbar modell kan håndtere flere lange forespørsler samtidig med samme mengde HBM eller lagring, kan skyleverandører få høyere kapasitet ut av dagens infrastruktur. Det utfordrer antakelser om fremtidige enhetsvolumer, knapphet og prissettingsmakt innen HBM, DRAM, bedrifts-SSD-er og nærliggende lagringsutstyr.
Aksjene i Samsung Electronics og SK Hynix falt begge mer enn 3 prosent intradag i Korea etter lanseringen, ifølge rapporter. 17 Uroen spredte seg fordi AI-infrastruktur knytter sammen minneprodusenter med leverandører av lagring, nettverk og datakraft. Et lavere minneavtrykk kan endre økonomien i modellutrulling, selv om det ikke nødvendigvis demper etterspørselen etter alle typer maskinvare like mye.
SanDisk illustrerte hvor følsom investeringscaset var blitt for forventninger om AI-drevet etterspørsel. Markedsdata fra perioden viste et 52-ukers intervall på omtrent 85 til 2 354 dollar, samtidig som analytikerkonsensus fortsatt var Buy eller Moderate Buy. 35
37 En positiv konsensus løser likevel ikke hovedusikkerheten: Hvor stor del av fremtidig lagringsetterspørsel avhenger av at AI-inferens fortsetter å bli mer minnekrevende på samme måte som før?
DeepSeek-nyheten var et effektivitetsstøt. Dario Amodeis oppfordring om å «pace the frontier» – dempe tempoet i kappløpet ved AI-fronten – reiste et annet spørsmål: tempoet i veksten i AI-kapasitet, og dermed i investeringene i infrastrukturen.
I et essay i september argumenterte Anthropic-sjefen for at selskaper bevisst bør bremse hvor raskt de forbedrer kapasiteten i de mest avanserte AI-modellene, og bruke tiden til arbeid med sikkerhet og kontroll. Han foreslo innebygde uavhengige evaluatorer, koordinering mellom selskaper i demokratiske land og på sikt avtaler mellom myndigheter. 4
5
Forslaget var ikke en oppfordring til å stanse all AI-utvikling. Men støtte fra andre fremtredende AI-ledere fikk markedet til å vurdere om frivillig samordning eller framtidig regulering kan dempe investeringene i akseleratorer, datasentre og minne. Nasdaq 100-futures ble rapportert ned 1 prosent den helgen, mens debatten satte AI-handelen under lupen. 8
For investorene var kombinasjonen ubehagelig: DeepSeek viste at AI-tjenester kan trenge mindre minne per arbeidsoppgave, mens debatten om et lavere utviklingstempo åpnet for lavere vekst i selve arbeidsmengden.
Investoren Michael Burry avfeide oppfordringene om langsommere AI-utvikling som «self-serving», eller selvinteresserte. Hans argument var at en nedbremsing kan gagne de etablerte laboratoriene i toppsjiktet, samtidig som mindre konkurrenter får vanskeligere for å ta dem igjen. Han stilte også spørsmål ved om dagens AI-chatboter i det hele tatt er på vei mot kunstig generell intelligens. 15
Burrys uttalelser er kritikk av insentiver, ikke dokumentasjon på selskapenes motiver. Påstander om at sikkerhetsbudskap er utformet for å støtte planlagte børsnoteringer, må på samme måte behandles som hans påstand – ikke som et fastslått forhold. 11
15
Den mest presise konklusjonen er avgrenset, men viktig: DeepSeek utfordret en for enkel versjon av AI-minnefortellingen. Selskapet har vist at programvare, modellarkitektur, kvantisering og cache-håndtering kan redusere minneintensiteten i inferens vesentlig. 52
55
Det betyr ikke at den samlede minneetterspørselen vil falle. De varslede reduksjonene gjelder KV-cache under inferens, sammenlignet med DeepSeeks foregående arkitektur. Det er ikke en påstand om at hele modellen eller datasenteret bruker 75 prosent mindre HBM og 87,5 prosent mindre SSD-lagring. Det fjerner heller ikke minnebehovet til modellvekter eller trening. 25
Lavere kostnad for å betjene modeller kan dessuten øke bruken. Billigere inferens kan gi flere brukere, lengre kontekster og flere agentløp. Det endelige utfallet for etterspørselen avhenger av hva som vinner: effektivisering per forespørsel eller vekst i antallet og kompleksiteten på forespørslene.
DeepSeek V4.1-Flash har ikke underkjent den langsiktige investeringscasen for HBM, NAND eller AI-infrastruktur. Men den har gjort caset mer betinget. Investorer kan ikke lenger uten videre anta at økende AI-bruk gir en én-til-én-vekst i minneforbruk per arbeidsoppgave.
Det sentrale spørsmålet er om effektiviseringsgevinstene vil komme raskere enn utbyggingen av AI-tjenester. DeepSeek har lagt fram bevis på at inferens kan bli dramatisk mer minneeffektiv. Selskapet har ikke avgjort hvor raskt global AI-bruk, treningsskala og etterspørsel etter maskinvare vil vokse etterpå.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek oppgir at V4.1 Flash bruker en firedel så mye HBM og en åttedel så mye SSD lagring til KV cache som forrige generasjon.
DeepSeek oppgir at V4.1 Flash bruker en firedel så mye HBM og en åttedel så mye SSD lagring til KV cache som forrige generasjon. Etter lanseringen falt Samsung Electronics og SK Hynix begge over 3 prosent intradag i Seoul, ifølge rapporter.
Anthropic sjef Dario Amodeis forslag om å dempe tempoet i utviklingen av de mest avanserte AI modellene la til en ny usikkerhet om veksten i AI investeringer.