Huawei esitteli HUAWEI CONNECT 2026 tapahtumassa OceanStor M900:n: hyperskaalan tekoälyinferenssiin tarkoitetun jaetun KV välimuistikerroksen, jonka kapasiteetti on yhtiön mukaan enintään 64 PB klusteria kohti. Lingqu UnifiedBusin avulla KV välimuisti voidaan jakaa ja porrastaa kiihdyttimien muistista ja DRAM muisti...
JulkaisijaMuokattu mallilla GPT-5.6 TerraKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Huawei announce at Huawei Connect 2026 about its OceanStor M900 AI memory storage for hyperscale inference SuperPoDs, including how. Article summary: Huawei announced OceanStor M900 Context Memory Storage: an SSD-backed, shared KV-cache tier for hyperscale AI inference SuperPoDs. It is intended to extend—not replace—accelerators’ HBM/DRAM or the SuperPoD interconnect:. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Huawei esitteli OceanStor M900 Context Memory Storage -ratkaisun hyperskaalan datakeskusten tekoälyinferenssiä varten. Sen tarkoitus ei ole korvata kiihdyttimien HBM- tai DRAM-muistia, vaan lisätä SuperPoD-kokonaisuuksiin jaettu ja skaalautuva kontekstimuistikerros. Tämä on olennaista, kun KV-välimuisti alkaa rajoittaa suorituskykyä erittäin pitkissä kehotteissa ja monivaiheisissa agenttityökuormissa. 2
23
Kun suuri kielimalli tuottaa vastausta, KV-välimuisti säilyttää jo käsiteltyihin tokeneihin liittyvää välitilaa. Välimuistin uudelleenkäyttö on hyödyllistä esimerkiksi silloin, kun keskustelun sama tai samankaltainen konteksti toistuu myöhemmillä kierroksilla tai agentti jatkaa tehtävää useissa vaiheissa.
Huawei asemoi M900:n ratkaisuksi tilanteisiin, joissa sirun oma muisti ja DRAM eivät enää tarjoa riittävästi kapasiteettia pitkille konteksti-ikkunoille ja usean kierroksen inferenssille. Yhtiön UnifiedBus, josta käytetään myös nimeä Lingqu, muodostaa maailmanlaajuisen, monitasoisen KV-välimuistin yhden hypyn yhteyksillä. Samalla välimuistitaso laajenee kiihdyttimen muistista ja DRAM:sta SSD-levyille. 2
26
Käytännössä tavoitteena on, että huomattavasti suurempi osa mallin kontekstista voidaan tallentaa, jakaa ja käyttää uudelleen ilman, että kaiken täytyy pysyä kalleimmissa muistikerroksissa.
Huawein mukaan yksi M900-klusteri voi tarjota enintään 64 PB KV-välimuistia. Yhtiö myös arvioi, että NPU:ta kohden käytettävissä oleva KV-välimuisti voidaan kasvattaa gigatavuluokasta teratavuluokkaan, mikä voisi parantaa pitkän kontekstin pyyntöjen välimuistiosumia. 2
26
Kyse ei kuitenkaan ole yksittäisen piirin paikallisen HBM-muistin kasvattamisesta. M900 on SuperPoD-tason jaettu muistiratkaisu. Sen käytännön hyöty riippuu siten siitä, miten ohjelmisto sijoittaa, hakee ja käyttää KV-välimuistia uudelleen – sekä siitä, millainen pyyntöjakauma tuotantoympäristössä todellisuudessa on.
Huawei kertoo yhdistäneensä CPU:n, verkkokontrollerin ja NAND-kontrollerin samaan arkkitehtuuriin. Yhtiön mukaan ratkaisu tarjoaa natiivin KV-semanttiikan ja mahdollistaa yhden hypyn yhteyden NPU:lta SSD:lle ilman protokollamuunnoksia tai CPU:n kautta tapahtuvaa välitystä. 20
26
Huawein julkaisemat tavoiteluvut ovat:
Luvut ovat valmistajan ilmoittamia. Tiedotteessa ei avata kattavasti käytettyä mallia, samanaikaisten pyyntöjen määrää, välimuistiosumien osuutta, klusterikokoonpanoa tai vertailumenetelmää. Siksi riippumattomia mittauksia tuotantoa vastaavilla työkuormilla tarvitaan ennen kuin suorituskyvystä voi tehdä laajempia johtopäätöksiä.
Tyypillisessä tekoälykoodauksen inferenssityökuormassa Huawei ilmoittaa kaksinkertaisen token-läpimenon ja puolittuvan ajan ensimmäiseen tokeniin (TTFT, time to first token). 14 Koska vertailutason ja työkuorman yksityiskohtia ei ole julkaistu, luvuista ei voi päätellä vastaavaa hyötyä kaikille malleille tai inferenssialustoille.
Yhtiö kuvailee myös KV-tietoista adaptiivista tallennusta, jossa datan sijoittelu huomioi välimuistimerkinnän arvon ja säilytysajan, jotta sille valitaan sopiva tallennusmedia. Huawei väittää ratkaisun tukevan enintään 24 DWPD:tä (drive writes per day) sekä parantavan SSD-levyjen luku- ja kirjoituskestävyyttä noin 16-kertaiseksi hybridimedian ja optimoidun säilytysalgoritmin avulla. 16
18 Myös nämä väitteet on vahvistettava todellisilla kirjoituskuormilla ja välimuistinhallinnan käytännöillä.
M900:n julkistus on ennen kaikkea arkkitehtuuriviesti, ei pelkkä erillinen tallennustuote. Huawei kuvailee UnifiedBusin klustereita ja SuperPoD-kokonaisuuksia yhdistäväksi liityntätekniikaksi agenttipohjaista tekoälyä varten. M900 toimii tässä kokonaisuudessa tallennus- ja kontekstimuistikerroksena. 23
Kokonaisuudessa:
M900 ei siis itsessään lisää mallin laskentatehoa eikä korvaa kiihdyttimiä tai nopeita kytkentätekniikoita. Sen lupaus on helpottaa muistipainetta tilanteissa, joissa pitkät konteksti-ikkunat ja toistuvat agenttivaiheet tekevät KV-välimuistista laskennan ohella keskeisen rajoitteen. 2
23
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Huawei esitteli HUAWEI CONNECT 2026 tapahtumassa OceanStor M900:n: hyperskaalan tekoälyinferenssiin tarkoitetun jaetun KV välimuistikerroksen, jonka kapasiteetti on yhtiön mukaan enintään 64 PB klusteria kohti.
Huawei esitteli HUAWEI CONNECT 2026 tapahtumassa OceanStor M900:n: hyperskaalan tekoälyinferenssiin tarkoitetun jaetun KV välimuistikerroksen, jonka kapasiteetti on yhtiön mukaan enintään 64 PB klusteria kohti. Lingqu UnifiedBusin avulla KV välimuisti voidaan jakaa ja porrastaa kiihdyttimien muistista ja DRAM muistista SSD levyille.
Huawei ilmoittaa noin 60 µs:n käyttöviiveen, 40 TB/s:n yhteenlasketun kaistanleveyden ja kaksinkertaisen token läpimenon tekoälykoodauksen esimerkkityökuormassa.