DeepSeekin mukaan V4.1 Flash tarvitsee KV välimuistilleen vain neljänneksen edeltäjän HBM muistista ja kahdeksasosan SSD tallennuksesta. Uutinen ravisteli AI muistille altistuneita osakkeita: Samsung Electronicsin ja SK Hynixin kurssit laskivat Koreassa päivänsisäisesti yli 3 prosenttia.
JulkaisijaMuokattu mallilla GPT-5.6 TerraKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10 V4.1 Flash release, which reduced key-value cache consumption to about one-quarter of its predecessor’s high. Article summary: The selloff reflected a rapid reassessment of the “AI equals ever-more memory” trade. DeepSeek’s V4.1-Flash showed that serving long-context models can be made far less memory-intensive, while Amodei’s proposed slowing o. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeekin 10. syyskuuta julkaisema V4.1-Flash horjutti markkinoilla yleistynyttä, yksinkertaistettua AI-tarinaa: suuremmat mallit, pidemmät kontekstit ja yhä useammat agentit merkitsisivät automaattisesti jatkuvasti kasvavaa HBM-muistin, NAND-flashin ja tallennuslaitteiden kysyntää. Uusi malli ei tee muistista tarpeetonta. Se kuitenkin osoitti, että saman AI-työkuorman palvelemiseen tarvittavaa muistimäärää voidaan pienentää huomattavasti malliarkkitehtuurin ja välimuistitekniikan avulla. 61
25
KV-välimuisti (key-value cache) säilyttää mallin huomiomekanismin tilatietoa, kun malli käsittelee pyyntöä. Se on erityisen tärkeä pitkissä keskusteluissa ja agenttipohjaisissa työkuormissa: aiempaa kontekstia ei tarvitse laskea kokonaan uudelleen joka kerta.
DeepSeekin mukaan V4.1-Flash tarvitsee KV-välimuistilleen vain neljänneksen HBM-muistista ja kahdeksasosan SSD-tallennuksesta verrattuna edelliseen sukupolveen. 61 Mallikortin mukaan tehostus perustuu kausaaliseen enkooderi-dekooderiarkkitehtuuriin. Siinä dekooderin globaali KV-välimuisti johdetaan enkooderin viimeisten piilotilojen perusteella sen sijaan, että se muodostettaisiin erikseen jokaisessa dekooderikerroksessa. Lisäksi SWA Bounded Replay -niminen käyttöönotto-optimointi vähentää tarvetta säilyttää tiettyjä liukuvan ikkunan välimuistitiloja SSD:llä.
52
Julkaisua käsitellyt riippumaton media arvioi globaalin KV-välimuistin kooksi noin 890 tavua tokenia kohti, eli noin neljänneksen V4-Flashista. Saman välimuistikapasiteetin puitteissa ratkaisu voisi mahdollistaa noin neljästä kahdeksaan kertaa enemmän samanaikaisia käyttäjiä. 53 DeepSeekin mukaan malli aktivoi esitäytössä 8 miljardia parametria tokenia kohti ja dekoodauksessa 16 miljardia parametria tokenia kohti. Tavoitteena on parempi tehokkuus etenkin paljon syötettä käsittelevissä agenttityökuormissa.
52
Välitön markkinakysymys ei ollut, tarvitsevatko AI-järjestelmät muistia. Ne tarvitsevat. Olennaista oli se, voiko tarvittava muistimäärä yhtä tuotettua inferenssitulosta kohti pienentyä paljon nopeammin kuin sijoittajien kysyntä- ja liikevaihto-oletuksissa oli laskettu.
Jos vertailukelpoinen malli pystyy palvelemaan enemmän samanaikaisia pitkän kontekstin pyyntöjä samalla HBM- tai tallennuskapasiteetilla, pilvipalveluyhtiöt voivat saada nykyisestä infrastruktuuristaan enemmän suorituskykyä irti. Tämä kyseenalaistaa oletuksia tulevista kappalemääristä, toimitusten niukkuudesta ja hinnoitteluvoimasta HBM:n, DRAM-muistin, yritys-SSD:iden ja niitä lähellä olevan tallennuslaitteiston markkinoilla.
Samsung Electronicsin ja SK Hynixin osakkeet laskivat Koreassa julkaisun jälkeen päivänsisäisesti yli 3 prosenttia, uutisraportit kertoivat. 17 Huoli levisi laajemmin, sillä AI-infrastruktuurin sijoitusteemassa muistinvalmistajat ovat kytkeytyneet tallennus-, verkko- ja laskentatoimittajiin. Pienempi muistikulutus voi muuttaa mallien käyttöönoton taloutta, vaikka vaikutus ei olisi samanlainen kaikissa laiteluokissa.
SanDiskin tapaus havainnollisti, kuinka herkäksi sijoitusnäkemys oli muuttunut AI-kysyntäodotuksille. Ajanjakson markkinatiedoissa yhtiön 52 viikon vaihteluväli oli suunnilleen 85–2 354 dollaria, vaikka analyytikkokonsensus pysyi tasolla Buy tai Moderate Buy. 35
37 Myönteinen konsensus ei silti ratkaise keskeistä epävarmuutta: kuinka suuri osa tulevasta tallennuskysynnästä nojaa siihen oletukseen, että inferenssiarkkitehtuurit pysyvät entisellään ja kuluttavat jatkuvasti enemmän muistia.
DeepSeekin uutinen oli tehokkuusshokki. Anthropicin toimitusjohtajan Dario Amodein kehotus pace the frontier eli hidastaa tarkoituksellisesti huippumallien kyvykkyyksien kehitystahtia nosti esiin erillisen kysymyksen: voisiko myös AI-kyvykkyyksien ja niitä tukevien infrastruktuuri-investointien kasvu hidastua?
Syyskuun esseessään Amodei esitti, että yritysten pitäisi tietoisesti hidastaa huippumallien kyvykkyyksien parantamista, jotta turvallisuus- ja yhteensovittamistyölle jäisi enemmän aikaa. Hän ehdotti muun muassa yrityksiin sijoitettuja riippumattomia arvioijia, demokraattisten maiden yritysten välistä koordinaatiota ja myöhemmin hallitustenvälisiä sopimuksia. 4
5
Kyse ei ollut kehotuksesta pysäyttää kaikkea AI-kehitystä. Muiden tunnettujen AI-johtajien julkinen tuki kuitenkin sai markkinat pohtimaan, voisiko vapaaehtoinen koordinaatio tai tuleva sääntely hillitä kiihdytinlaskennan, datakeskusten ja muistin hankintoja. Nasdaq 100 -futuurien kerrottiin laskeneen tuona viikonloppuna 1 prosenttia, kun keskustelu kohdisti huomion AI-sijoitusteemaan. 8
Yhdessä nämä kaksi kehitystä loivat sijoittajille hankalan asetelman: DeepSeek viittasi siihen, että AI-palvelut voivat tarvita vähemmän muistia työkuormaa kohti, ja keskustelu kehityksen hidastamisesta nosti esiin mahdollisuuden, että myös itse työkuormien kasvu jäisi hitaammaksi.
Sijoittaja Michael Burry kutsui AI-kehityksen hidastamiseen vedonneita puheenvuoroja ”itsekkäiksi”. Hänen perustelunsa oli, että kehityksen hidastuminen voisi hyödyttää vakiintuneita huippulaboratorioita ja vaikeuttaa pienempien kilpailijoiden kiinnikuromista. Burry myös kyseenalaisti, ovatko nykyiset AI-chatbotit ylipäätään matkalla kohti yleistä tekoälyä. 15
Burryn kommentit ovat tulkinta kannustimista, eivät näyttö yritysten todellisista motiiveista. Myös väitteet, joiden mukaan turvallisuuspuheella pyrittäisiin tukemaan suunnitteilla olevia listautumisia, on pidettävä Burryn väitteenä eikä vahvistettuna tosiasiana. 11
15
Vahvin johtopäätös on rajattu mutta tärkeä: DeepSeek haastoi yksinkertaistetun AI-muistiteesin. Se osoitti, että ohjelmisto, malliarkkitehtuuri, kvantisointi ja välimuistin hallintatekniikat voivat olennaisesti vähentää inferenssin muistintarvetta. 52
55
Se ei kuitenkaan osoittanut, että kokonaismuistikysyntä vähenisi. Ilmoitetut säästöt koskevat inferenssin aikaista KV-välimuistia ja vertailukohtana on DeepSeekin edeltävä arkkitehtuuri. Yhtiö ei väittänyt, että koko malli tai datakeskus käyttäisi 75 prosenttia vähemmän HBM-muistia ja 87,5 prosenttia vähemmän SSD-tallennusta. Säästöt eivät myöskään poista mallipainojen tai koulutuksen muistitarvetta. 25
Pienemmät palvelukustannukset voivat lisäksi kasvattaa käyttöä. Halvempi inferenssi voi mahdollistaa enemmän käyttäjiä, pidempiä konteksteja ja enemmän agenttien suorituslenkkejä. Lopullinen vaikutus riippuu siitä, kumpi voima on vahvempi: tehokkuus pyyntöä kohti vai pyyntöjen määrän ja monimutkaisuuden kasvu.
DeepSeek V4.1-Flash ei kumonnut HBM-muistin, NAND-flashin tai AI-infrastruktuurin pitkän aikavälin perusteluja. Se teki niistä ehdollisempia. Sijoittajat eivät voi enää pitää itsestään selvänä, että kasvava AI-käyttö tarkoittaa yksi yhteen kasvavaa muistin kulutusta työkuormaa kohti.
Hyödyllisempi kysymys on, ylittävätkö tehokkuusparannukset AI:n käyttöönoton kasvun. DeepSeek toi näyttöä siitä, että inferenssistä voidaan tehdä huomattavasti kevyempää. Se ei ratkaissut sitä, kuinka nopeasti maailmanlaajuinen AI-käyttö, koulutuksen mittakaava ja laitteistokysyntä kasvavat tämän jälkeen.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeekin mukaan V4.1 Flash tarvitsee KV välimuistilleen vain neljänneksen edeltäjän HBM muistista ja kahdeksasosan SSD tallennuksesta.
DeepSeekin mukaan V4.1 Flash tarvitsee KV välimuistilleen vain neljänneksen edeltäjän HBM muistista ja kahdeksasosan SSD tallennuksesta. Uutinen ravisteli AI muistille altistuneita osakkeita: Samsung Electronicsin ja SK Hynixin kurssit laskivat Koreassa päivänsisäisesti yli 3 prosenttia.
Anthropicin toimitusjohtajan Dario Amodein ehdotus hidastaa huippumallien kyvykkyyksien kehitystä toi markkinoille toisen huolen: myös AI infrainvestointien kasvuvauhti voisi jäädä odotettua hitaammaksi.