DeepSeek V4.1 Flashin mukaan sen inferenssissä käyttämä KV välimuisti tarvitsee HBM muistia vain neljänneksen edeltäjäänsä verrattuna ja pysyvää välimuistitallennusta kahdeksasosan. Ensireaktio painoi Samsung Electronicsin ja SK Hynixin kursseja Etelä Koreassa.
JulkaisijaMuokattu mallilla GPT-5.6 TerraKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s V4.1 Flash model trigger a selloff in memory-chip and broader technology stocks, what architectural changes did it introd. Article summary: DeepSeek V4.1 Flash caused a sharp reassessment of AI-memory demand because it claimed to cut the KV-cache memory used in long-context inference to one-quarter of its predecessor’s level and persistent SSD use to one-eig. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeekin V4.1 Flash -julkaisu ravisteli sijoittajia, koska se haastoi AI-infrastruktuuribuumin keskeisen oletuksen: että AI:n käytön lisääntyminen kasvattaa väistämättä myös jokaista työkuormaa kohti tarvittavan muistin määrää. Yhtiön ilmoittamat tehokkuusparannukset ovat merkittäviä erityisesti pitkän kontekstin inferenssissä eli mallin ajossa, mutta ne koskevat vain yhtä AI-järjestelmän osaa – KV-välimuistia. Ne eivät kuvaa suurten mallien koko muisti- ja laskentatarvetta koulutuksessa tai palvelussa. 9
10
KV-välimuisti säilyttää mallin aiemmista tokeneista tarvitsemia huomiotietoja, jotta samaa keskustelukontekstia ei tarvitse laskea jokaisella askeleella uudelleen. Se on erityisen tärkeä – ja kallis – pitkissä keskusteluissa sekä agenttipohjaisissa AI-työnkuluissa.
DeepSeekin mukaan V4.1 Flash yhdistää kerrosten välisen KV-välimuistin uudelleenkäytön Compressed Sparse Attention 2 -menetelmässä ja FP4-muotoisen KV-välimuistin. Yhtiön ilmoittama globaalin KV-välimuistin koko on 890 tavua tokenia kohti, eli noin neljännes V4-Flash-mallin vastaavasta luvusta. 9
Yhtiö kuvasi myös käyttöönotto-optimoinnin nimeltä SWA Bounded Replay lyhyen ikkunan huomiointia varten. Välimuistia ei pidetä pysyvästi SSD-levyllä tai isäntäkoneen muistissa, vaan järjestelmä käyttää tilapäistä, hajautettua isäntäkoneen DRAM-muistin allasta ja laskee välimuistin ohitustilanteessa rajatun osan kontekstista uudelleen. DeepSeekin mukaan tämä pienentää pysyvän KV-välimuistin tarpeen noin kahdeksasosaan edellisestä sukupolvesta. 1
9
Käytännössä väitteet tarkoittavat noin 75 prosenttia vähemmän HBM-muistia ja 87,5 prosenttia vähemmän pysyvää SSD-kapasiteettia – mutta nimenomaan KV-välimuistitoimintoa varten verrattuna V4-Flashiin. 9
10
Se on mahdollista palvelujärjestelmässä, jonka keskeinen pullonkaula on aktiivisten KV-välimuistien kapasiteetti. Jos yksi pitkän kontekstin pyyntö kuluttaa noin neljänneksen aiemmasta välimuistista, sama HBM-muistin määrä voisi teoriassa pitää muistissa noin nelinkertaisen määrän aktiivisia välimuisteja.
Kyse on kuitenkin ilmoitetusta tokenikohtaisesta luvusta johdetusta kapasiteettivaikutuksesta, ei riippumattomasti varmennetusta koko järjestelmän samanaikaisten käyttäjien testituloksesta. Todellinen kapasiteetti riippuu myös mallin painoista, laskentatehosta, verkkoyhteyksistä, pyyntöjen pituudesta, eräajosta, viivetavoitteista ja palvelinohjelmistosta.
Markkinoiden reaktio liittyi tulevaan kysynnän intensiteettiin, ei siihen, että DeepSeek olisi tehnyt muistista tarpeetonta. HBM-muistin toimittajat sekä NAND- ja yritys-SSD-yhtiöt ovat hyötyneet odotuksista, joiden mukaan yhä kyvykkäämmät AI-järjestelmät tarvitsevat yhä enemmän muistia ja tallennusinfrastruktuuria. Tehokkuusloikka nostaa esiin mahdollisuuden, että yksittäinen inferenssityökuorma tarvitsee vähemmän muistibittejä ja vähemmän pysyvää tallennustilaa.
Bloombergin mukaan Samsung Electronicsin osake laski Etelä-Koreassa 3,5 prosenttia ja SK Hynixin 2,2 prosenttia 11. syyskuuta DeepSeekin ilmoituksen jälkeen. 17 Tuolloisen uutisoinnin mukaan Samsung ja SK Hynix laskivat Soulissa yli 3 prosenttia, kun taas Micron ja SanDisk kestivät Yhdysvaltain kaupankäynnin alkuvaiheessa paremmin.
8
Sijoittajariski oli siis ennen kaikkea arvostuksiin liittyvä: jos AI-työkuormat muuttuvat vähemmän muistivaltaisiksi, muistivalmistajien odotettua kysynnän kasvua, hinnoitteluvoimaa ja investointisuunnitelmia saatetaan joutua arvioimaan uudelleen.
Liike muuttui myöhemmin yksittäisestä inferenssitehokkuuteen liittyvästä huolesta laajemmaksi AI-investointisyklin uudelleenarvioinniksi.
Uutisissa, jotka seurasivat kehotuksia hidastaa huipputason AI:n kehitystä, SK Hynix laski 6,4 prosenttia, Samsung 4,1 prosenttia ja Japanin Kioxia 6,4 prosenttia. Myös eurooppalaiset puolijohdeyhtiöt, kuten ASML, Infineon, ASM International, BE Semiconductor ja STMicroelectronics, laskivat. 18 Toisen raportin mukaan SoftBank putosi Aasian kaupankäynnissä 11 prosenttia, Kioxia 6,5 prosenttia ja Taiwan Semiconductor Manufacturing 1,2 prosenttia.
19
Yhdysvaltain osakkeiden ennakkomarkkinassa Marvell laski lähes 8 prosenttia, ja Intelin, Micronin sekä SanDiskin raportoitiin laskeneen kukin noin 6 prosenttia. 20
Lukuja ei pidä tulkita todisteeksi siitä, että yksi DeepSeekin julkaisu olisi mekaanisesti aiheuttanut jokaisen kurssilaskun. Korko-odotukset, arvostustasot ja AI-kasvuun liittyvät huolet vaikuttavat teknologiaosakkeisiin samanaikaisesti. Julkaisu antoi silti markkinoille konkreettisen syyn testata haavoittuvaa oletusta: AI-kysynnän kasvu ei automaattisesti tarkoita suhteellisesti suurempaa muistitarvetta jokaista pyyntöä kohti. 17
Myyntiaalto voimistui, kun Anthropicin toimitusjohtaja Dario Amodei kehotti AI-yhtiöitä hidastamaan huippumallien kyvykkyyksien kehitystahtia. Hänen ehdottamansa malli pyrki antamaan enemmän aikaa väärinkäyttö- ja turvallisuusriskien hallintaan.
Infrastruktuurisijoittajille tämä toi DeepSeekin tehokkuusväitteen rinnalle toisen huolen:
Nämä kaksi asiaa ovat taloudellisesti erillisiä, mutta markkinat voivat perustellusti nähdä molemmat haasteena AI-rakentamiselle, jonka hinnoittelu nojaa jatkuvaan nopeaan kasvuun. Uutisointi liitti laajemman siruosakkeiden laskun suoraan sijoittajien huoleen AI-kehityksen hidastamista koskevista vaatimuksista. 18
20
Sijoittaja Michael Burry arvosteli hidastamisviestiä omaa etua palvelevaksi. Hänen mukaansa johtavat AI-yhtiöt voivat hyötyä siitä, että ne kuvaavat omaa teknologiaansa vaarallisen nopeasti kehittyväksi; hän kutsui kehystystä ”IPO hype & puffery” -puheeksi. 14
Burryn tulkinnan mukaan hidastaminen voi suosia vakiintuneita yhtiöitä pienempien haastajien kustannuksella ja samalla vahvistaa niukkuuden, uskottavuuden sekä tuleviin pörssilistautumisiin liittyvää tarinaa. Tämä on Burryn näkemys yhtiöiden kannustimista, ei todiste siitä, että turvallisuushuolet olisivat epäaitoja tai perusteettomia. 14
DeepSeekin ilmoitus on merkityksellinen, koska sen taustalla olevat keinot eivät ole sijoitusnäkökulmasta ainutlaatuisia. Matalampi tarkkuus, välimuistin pakkaaminen, huomiointimekanismien uudelleensuunnittelu, uudelleenkäyttö ja paremmat palvelujärjestelmät ovat suuntia, joita muutkin mallikehittäjät voivat tavoitella. Siksi inferenssin muistitehokkuus on rakenteellinen riski toimittajille, joiden odotukset nojaavat AI-pyyntöä kohden kasvavaan muistisisältöön. 9
Väitteillä on kuitenkin selvät rajat.
DeepSeek ei väittänyt, että koko malli tai datakeskus tarvitsisi 75 prosenttia vähemmän HBM-muistia ja 87,5 prosenttia vähemmän SSD-kapasiteettia. Vertailu koskee nimenomaan inferenssin KV-välimuistin tarvetta edelliseen arkkitehtuuriin verrattuna. Mallin painot, muu järjestelmämuisti, verkkoratkaisut ja tallennustarpeet jäävät tämän rajatun vertailun ulkopuolelle. 10
Julkistetut parannukset eivät osoita vastaavia vähennyksiä huippumallien koulutukseen tarvittavassa laskennassa tai muistissa. KV-välimuistin optimoinnin tulkitseminen todisteeksi koko AI-puolijohdekysynnän romahtamisesta liioittelisi sitä, mitä ilmoitus todella osoittaa. 10
Edullisempi ja vähemmän muistia kuluttava inferenssi voi heikentää muistin kulutusta pyyntöä kohden. Samalla se voi tehdä pitkän kontekstin avustajista, agenttityönkuluista ja itse hallituista käyttöönotosta kannattavia useammissa tilanteissa. Jos käyttäjien ja sovellusten määrä kasvaa riittävästi, kokonaismuistikysyntä voi säilyä vahvana tai jopa kasvaa, vaikka yhden työkuorman vaatimus pienenee.
DeepSeek V4.1 Flash paljasti heikon kohdan AI-muistia koskevassa nousutarinassa: muistitarve inferenssityökuormaa kohti voi pudota jyrkästi, kun malliarkkitehtuuri ja palvelinohjelmistot kehittyvät. Ilmoitettu 890 tavun tokenikohtainen globaali KV-välimuisti ja pysyvän välimuistin kutistuminen kahdeksasosaan selittävät, miksi sijoittajat arvioivat nopeasti uudelleen HBM- ja SSD-oletuksiaan. 9
Silti näyttö ei riitä kuvaamaan tätä välittömäksi siruteollisuuden kysyntäshokiksi. Ilmoitetut vähennykset rajoittuvat inferenssin KV-välimuistiin, eivät mallien koulutukseen tai koko datakeskuspinon tarpeisiin. Pitkän aikavälin lopputulos riippuu kahden voiman kilpailusta: pienemmästä muistitarpeesta AI-tehtävää kohti ja mahdollisesti paljon laajemmasta AI:n käyttöönotosta, jonka pienemmät kustannukset mahdollistavat.
Muistiosakkeiden sijoittajille olennainen kysymys ei siis enää ole vain se, kasvaako AI:n käyttö. Ratkaisevaa on, pystyykö työkuormien kokonaiskasvu ylittämään tahdin, jolla AI-järjestelmät oppivat käyttämään muistia tehokkaammin.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4.1 Flashin mukaan sen inferenssissä käyttämä KV välimuisti tarvitsee HBM muistia vain neljänneksen edeltäjäänsä verrattuna ja pysyvää välimuistitallennusta kahdeksasosan.
DeepSeek V4.1 Flashin mukaan sen inferenssissä käyttämä KV välimuisti tarvitsee HBM muistia vain neljänneksen edeltäjäänsä verrattuna ja pysyvää välimuistitallennusta kahdeksasosan. Ensireaktio painoi Samsung Electronicsin ja SK Hynixin kursseja Etelä Koreassa. Myöhemmin myyntiaalto levisi Japanin, Euroopan ja Yhdysvaltain siruosakkeisiin.
Ratkaisevaa on, vähentääkö pienempi muistinkulutus pyyntöä kohden kokonaiskysyntää vai tekeekö se AI:sta niin edullista, että käyttö ja työkuormat kasvavat voimakkaasti.