L’OceanStor M900 étend le cache KV des SuperPoD de la mémoire des puces et de la DRAM vers des SSD partagés. Huawei avance une latence d’accès d’environ 60 microsecondes et un débit agrégé de 40 To/s par cluster.
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is Huawei’s OceanStor M900 Context Memory Storage, introduced at HUAWEI CONNECT 2026 for AI inference SuperPoDs, and how does its Unifi. Article summary: Huawei’s OceanStor M900 is a storage system for SuperPoD AI inference, introduced at HUAWEI CONNECT 2026. It uses UnifiedBus to make the key–value (KV) cache—a reusable record of attention calculations—available across a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Présenté lors de HUAWEI CONNECT 2026, l’OceanStor M900 est un système de stockage destiné à l’inférence IA dans les clusters SuperPoD de Huawei. Son objectif : rendre disponible à plusieurs accélérateurs une plus grande quantité de contexte déjà calculé, alors que les requêtes longues et les échanges répétés avec des agents IA sollicitent davantage le cache. 1
9
Pendant qu’un modèle traite une requête, il produit des données intermédiaires conservées dans un cache clé-valeur, ou cache KV. Si une nouvelle requête peut reprendre un préfixe déjà calculé, le système évite de refaire une partie du travail. Mais ce cache devient difficile à loger entièrement dans la mémoire proche de chaque NPU, le processeur dédié aux calculs d’IA. Le M900 vise à mettre en commun cette capacité à l’échelle d’un SuperPoD. 1
3
6
Grâce au réseau UnifiedBus, Huawei répartit le cache KV entre la mémoire intégrée aux puces, la DRAM et les SSD. L’entreprise annonce 64 pétaoctets (Po) de capacité de cache KV par cluster et affirme que la capacité accessible à un NPU passe de l’ordre du gigaoctet à celui du téraoctet. Il s’agit d’un espace partagé dans le cluster, pas de 64 Po de mémoire embarqués dans chaque NPU. Conserver plus de contexte peut favoriser sa réutilisation, à condition que les requêtes aient effectivement des parties communes exploitables. 3
6
17
Pour rendre le niveau SSD suffisamment réactif, Huawei décrit un accès « en un saut » entre le NPU et les SSD. L’architecture intègre des fonctions de processeur, de contrôleur réseau et de contrôleur NAND afin d’éviter certaines conversions de protocole et certains relais par le processeur. Huawei annonce une latence d’accès d’environ 60 microsecondes et une bande passante agrégée de 40 To/s par cluster. Ces valeurs caractérisent l’architecture annoncée ; elles ne garantissent pas la vitesse de chaque accès au cache. 3
6
28
32
Réutiliser un calcul peut réduire l’attente avant l’apparition du premier token, c’est-à-dire le premier élément de la réponse générée. Cela peut aussi libérer de la capacité de calcul pour produire davantage de tokens. Dans un scénario présenté comme typique de programmation assistée par IA, Huawei affirme avoir doublé le débit de tokens du cluster d’inférence et divisé par deux le délai avant le premier token. Le résultat dépend toutefois de la charge de travail et de la part du cache réellement réutilisée. 28
33
Huawei décrit également un placement des données tenant compte du cache KV pour gérer leur durée de conservation sur les différents supports. L’entreprise évoque une endurance des SSD pouvant atteindre 24 écritures complètes du disque par jour, une durée de vie multipliée par 16 et un objectif de stabilité sur trois ans. La logique économique est de réduire à la fois les calculs répétés et les remplacements de supports, afin d’abaisser le coût d’inférence par token. Les éléments disponibles ne démontrent toutefois pas de manière indépendante ces gains de performance, de longévité ou de coût dans des SuperPoD en production. 6
8
33
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
L’OceanStor M900 étend le cache KV des SuperPoD de la mémoire des puces et de la DRAM vers des SSD partagés.
L’OceanStor M900 étend le cache KV des SuperPoD de la mémoire des puces et de la DRAM vers des SSD partagés. Huawei avance une latence d’accès d’environ 60 microsecondes et un débit agrégé de 40 To/s par cluster.