DeepSeekin 10. syyskuuta julkaisema V4.1 Flash tarvitsee KV välimuistiinsa edeltäjäänsä verrattuna vain neljänneksen HBM muistista ja kahdeksasosan SSD tallennuksesta.
JulkaisijaMuokattu mallilla GPT-5.6 TerraKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10, 2026 release of its V4.1 Flash AI model—whose architectural changes reduced key-value-cache usage to about. Article summary: The selloff was a rapid repricing of an AI-memory scarcity thesis, not proof that memory demand has permanently collapsed. DeepSeek showed that serving long-context models can require far less KV-cache HBM and persistent. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
DeepSeekin V4.1-Flash antoi markkinoille syyn kyseenalaistaa keskeisen oletuksen tekoälylaitteistoihin liittyvässä sijoitustarinassa: että kyvykkäämmät mallit tarvitsevat väistämättä yhä enemmän muistia ja tallennuskapasiteettia jokaista käytössä olevaa työkuormaa kohti.
Reaktio oli ennen kaikkea tämän oletuksen uudelleenhinnoittelu. Se ei yksin todista, että tekoälymuistin pitkä noususykli olisi ohi.
DeepSeek ilmoitti, että V4.1-Flash tarvitsee avain–arvo-välimuistiinsa eli KV-välimuistiin vain neljänneksen suuren kaistanleveyden HBM-muistista ja kahdeksasosan SSD-tallennuskapasiteetista verrattuna edelliseen sukupolveen. Yhtiö korosti, että välimuistiosumien kustannus voi muodostaa suuren osan agenttipohjaisten AI-palvelujen kustannuksista. 29
KV-välimuisti säilyttää mallin jo käsittelemien tokenien huomiointitilan. Siten mallin ei tarvitse laskea koko aiempaa keskustelu- tai prosessikontekstia uudelleen jokaisella jatkovastauksella. Pitkissä keskusteluissa, laajoissa konteksteissa ja AI-agenttien käytössä se on keskeinen inferenssipalvelun kapasiteettirajoite.
Lukuja ei kuitenkaan pidä tulkita siten, että koko AI-järjestelmän HBM-tarve putosi 75 prosenttia tai SSD-tarve 87,5 prosenttia. Vertailu koskee vain KV-välimuistia ja DeepSeekin omaa edeltävää arkkitehtuuria. Mallin painot, koulutusinfrastruktuuri ja muut osat tarvitsevat yhä huomattavasti muistia ja tallennustilaa. 25
Sijoittajalle johtopäätös oli nopea: jos vastaavaa inferenssityötä voidaan tehdä huomattavasti pienemmällä välimuistilla, sama asennettu AI-laitteistokanta voi palvella useampia samanaikaisia käyttökertoja. Tämä voi heikentää lähiajan odotuksia muistitiheydestä työkuormaa kohden sekä HBM-muistin ja yritystason tallennuksen kysynnästä ja hinnoittelusta.
Seoulissa Samsungin osake laski julkaisun jälkeen 3,5 prosenttia ja SK Hynixin 2,2 prosenttia. 49 Myöhemmässä Yhdysvaltain kaupankäynnissä myös muisti- ja tallennusyhtiöt joutuivat myyntiin: markkinakommentaareissa DeepSeekin pienempää HBM- ja SSD-tarvetta pidettiin yhtenä syynä siihen, että AI-infrastruktuurin kysyntänäkymiä arvioitiin uudelleen.
51
52
Yksittäinen mallijulkaisu ei tietenkään selitä kaikkia pörssiliikkeitä. Puolijohdeosakkeisiin vaikuttavat samanaikaisesti esimerkiksi tulosennusteet, tarjontatilanne, korot, yleinen riskinottohalu ja suurten teknologiayhtiöiden investointisuunnitelmat. Reaktio kuitenkin paljasti, kuinka herkäksi AI-osakkeiden arvostukset ovat muuttuneet ohjelmistojen ja malliarkkitehtuurin tehokkuusparannuksille.
Tehokkuusuutinen osui samaan aikaan eri tyyppisen kysyntähuolen kanssa. Anthropicin toimitusjohtaja Dario Amodei esitti kirjoituksessaan We Must Pace the Frontier, että AI-kyvykkyyksien kehitysvauhtia tulisi hillitä, jotta yrityksillä ja valtioilla olisi aikaa varmistaa yhä kyvykkäämpien järjestelmien turvallisuus ja yhteensopivuus ihmisten tavoitteiden kanssa.
Amodei täsmensi, ettei "pacing" tarkoita mallien koulutuksen tai teknisen kehityksen pysäyttämistä. Hänen ehdotukseensa kuuluivat muun muassa ulkopuolisten arvioijien jatkuva pääsy yrityksiin, demokraattisten maiden välinen koordinointi ja maailmanlaajuinen yhteistyö. 40
Markkinat voivat silti tulkita hitaamman kyvykkyyskehityksen riskiksi, että osa laskenta-, verkko-, muisti- ja datakeskusinvestoinneista lykkääntyy. Päivänä, jota markkinaraportit käsittelivät, Nasdaq-100-futuurit laskivat 1,77 prosenttia, Marvell yli 7 prosenttia, Intel noin 6 prosenttia ja Micron yli 5 prosenttia. 51
Kyse on kahdesta eri asiasta:
Yhdessä ne tekivät kaikkein aggressiivisimmista AI-infrastruktuurin kysyntäennusteista aiempaa vähemmän itsestäänselviä.
Sijoittaja Michael Burry kuvasi AI-alan hidastuspuhetta "self-serving" eli omia etuja palvelevaksi. Hänen mukaansa se voisi hyödyttää jo vahvoja huippumallilaboratorioita vaikeuttamalla kilpailua, tuottaa "hype & puffery" -tyyppistä nostatusta mahdollisia listautumisia varten ja tarjota selityksen kasvun hidastumiselle. Burry myös väitti, etteivät suuret kielimallit ole tekoälyn yleisälyä eli AGI:tä, joten hänen mielestään mitään sellaista ei ole hidastettavana. 14
Nämä ovat Burryn näkemyksiä kilpailusta, arvostuksista ja AI:n kyvykkyyksistä, eivät vakiintuneita teknisiä johtopäätöksiä. Markkinoiden kannalta olennaista oli, että turvallisuus- ja kehitysvauhtikeskustelua luettiin myös kannustimien ja kilpailuasetelmien kautta.
Yksinkertaistettu AI-muistin nousutarina oli lineaarinen: suuremmat mallit, pidemmät konteksti-ikkunat ja kasvava käyttäjämäärä tarkoittavat enemmän HBM-muistia, NAND-flashia ja tallennuskapasiteettia.
DeepSeek tuo tähän merkittävän vastavoiman: arkkitehtuuritehokkuuden.
Kysyntää kannattaa tarkastella kahden muuttujan kautta:
Ensimmäisen mittarin lasku ei automaattisesti ratkaise toista. Halvempi ja tehokkaampi inferenssi voi laajentaa AI:n käyttöä ja lisätä pyyntöjen kokonaismäärää. Jos tehokkuusparannukset kuitenkin leviävät nopeammin kuin käyttö kasvaa, tietyn AI-tuotoksen aikaansaamiseen voidaan tarvita vähemmän laitteistoa.
V4.1-Flashin vaikutus kohdistuu suoraan inferenssipalveluun ja KV-välimuistiin. DeepSeekin esittämä vertailu ei poista mallipainojen tai koulutuksen muistitarpeita. 25 Tämä ero on tärkeä, sillä mallien koulutus ja niiden palveleminen tuotannossa kuormittavat laskentaa, muistia ja verkkoyhteyksiä eri tavoin.
Keskeinen epävarmuus ei siis ole se, onko raportoitu tehokkuusparannus merkittävä — se on. Ratkaisematta on, muuttaako se kokonaiskysyntää. Sijoittajien on seurattava, yleistyvätkö vastaavat välimuistia säästävät tekniikat, kuinka nopeasti pitkän kontekstin ja agenttityökuormat kasvavat, miten HBM-muistin ja tallennuksen hinnat kehittyvät sekä jatkuuko huippumallien koulutus ja käyttöönotto nopeana.
Toistaiseksi myyntiaaltoa kannattaa pitää varoituksena siitä, ettei AI-muistin niukkuutta voi pitää yksisuuntaisena sijoitusteemana. Malli-innovaatio voi pienentää yhden pyynnön laitteistotarvetta yhtä nopeasti kuin uudet käyttötavat kasvattavat pyyntöjen määrää.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeekin 10. syyskuuta julkaisema V4.1 Flash tarvitsee KV välimuistiinsa edeltäjäänsä verrattuna vain neljänneksen HBM muistista ja kahdeksasosan SSD tallennuksesta.
DeepSeekin 10. syyskuuta julkaisema V4.1 Flash tarvitsee KV välimuistiinsa edeltäjäänsä verrattuna vain neljänneksen HBM muistista ja kahdeksasosan SSD tallennuksesta. Markkinat tulkitsivat, että sama AI laitteistokanta voisi palvella enemmän inferenssikuormaa, mikä heikentäisi muistia per työkuorma koskevia kysyntäodotuksia.
Myyntipainetta lisäsi keskustelu huippumallien kehitysvauhdin hidastamisesta, mutta tehokkaampi inferenssi voi myös kasvattaa AI:n käyttöä ja siten kokonaiskysyntää.