Huawei annonce jusqu’à 64 Po de capacité par cluster en étendant le cache KV des SuperPoD à un espace partagé sur SSD. Les téraoctets accessibles à chaque NPU correspondent à une capacité mutualisée, pas à de la mémoire supplémentaire intégrée à la puce.
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: How does Huawei’s OceanStor M900 AI memory storage address the KV Cache memory wall in hyperscale, long-context and agentic inference SuperP. Article summary: Huawei positions OceanStor M900 as a shared, SSD-backed **KV-cache tier** for SuperPoD inference, not as a replacement for the NPU’s fast memory. Its aim is to keep and reuse more context across long-running and agentic . Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Lorsqu’une IA traite de longs échanges ou enchaîne des tâches avec des agents, elle produit un cache de clés et de valeurs, dit cache KV. Ce cache permet de réutiliser du contexte déjà calculé, mais peut dépasser la capacité de la mémoire proche des processeurs. Avec OceanStor M900, Huawei propose d’ajouter aux SuperPoD — ses ensembles de machines de calcul IA — un espace de cache partagé sur SSD, sous la mémoire intégrée aux puces et la DRAM. Il s’agit d’étendre la capacité disponible, pas de remplacer la mémoire la plus rapide des NPU, les processeurs dédiés à l’IA. 8
10
12
Grâce à son interconnexion Lingqu, aussi appelée UnifiedBus, Huawei dit pouvoir mutualiser le cache KV à l’échelle d’un SuperPoD et répartir les données entre mémoire sur puce, DRAM et SSD. Le constructeur annonce jusqu’à 64 pétaoctets (Po) par cluster : la capacité de cache accessible à chaque NPU passerait ainsi de l’ordre du gigaoctet à celui du téraoctet. Ce chiffre ne signifie pas que chaque puce reçoit des téraoctets de mémoire embarquée. 8
10
Le M900 est donc un système de stockage du contexte conçu pour l’inférence, plutôt qu’une nouvelle puce de calcul ou un substitut à l’interconnexion. Huawei le destine notamment aux charges faisant intervenir des agents et de longs contextes ; la presse spécialisée cite les Atlas 960 SuperPoD parmi les environnements visés. 12
6
Huawei décrit une architecture réunissant les fonctions de processeur, de contrôleur réseau et de contrôleur NAND. Elle permettrait un accès du NPU au SSD en un seul saut, sans relais par le processeur ni conversion de protocole. Selon l’entreprise, la latence d’accès baisse de 90 %, à 60 microsecondes. Elle annonce aussi 40 To/s de bande passante cumulée par cluster, soit 1,5 fois celle de la solution qu’elle prend pour comparaison. Ce débit concerne l’ensemble du cluster, et non chaque NPU individuellement. 8
Dans un scénario qu’elle qualifie de « typique » pour la programmation assistée par IA, Huawei affirme que le débit de production de tokens du cluster double et que le délai avant le premier token est divisé par deux. Cela ne démontre pas que toutes les requêtes longues ou faisant appel à des agents connaîtront les mêmes gains. 8
14
La fonction KV-Aware prédirait la durée de vie utile des données du cache pour organiser leur placement entre les différents supports. Huawei revendique jusqu’à 24 écritures complètes du disque par jour, une durée de vie des SSD multipliée par 16 et trois ans de fonctionnement stable. Moins de remplacements et de maintenance pourraient réduire les coûts d’exploitation, mais les éléments cités ne chiffrent pas une économie effectivement mesurée par token. 8
La distinction décisive est celle-ci : mettre davantage de cache à portée des NPU ne prouve pas encore que l’inférence sera partout plus rapide et moins coûteuse. Il faudrait des essais indépendants sur des charges réelles pour mesurer la capacité utilisable, les taux de réutilisation du cache, la latence et le débit sous forte sollicitation, puis comparer les gains en tokens, l’usure des SSD et les coûts dans la durée. Pour l’heure, les articles tiers disponibles rapportent les chiffres de Huawei sans les valider par leurs propres tests. 6
14
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Huawei annonce jusqu’à 64 Po de capacité par cluster en étendant le cache KV des SuperPoD à un espace partagé sur SSD.
Huawei annonce jusqu’à 64 Po de capacité par cluster en étendant le cache KV des SuperPoD à un espace partagé sur SSD. Les téraoctets accessibles à chaque NPU correspondent à une capacité mutualisée, pas à de la mémoire supplémentaire intégrée à la puce.
Les chiffres de latence, de débit, de performances et d’endurance sont des annonces de Huawei qui demandent encore une validation indépendante.