Inspur annonce un supernœud de 128 accélérateurs capable, selon l’entreprise, d’exécuter Kimi K3, un modèle de 2 800 milliards de paramètres, à moins de 5,85 ms par jeton généré. Le HC2000 vise la production de davantage de jetons à investissement égal, et non la même latence pour un utilisateur isolé.
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did Inspur Information announce about the MetaBrain SD200 Ultra at AICC2026, including its intended workloads, 128-chip and memory conf. Article summary: Inspur Information announced the MetaBrain SD200 Ultra at AICC2026 as a tightly coupled supernode for large frontier models and latency-sensitive AI-agent workloads. It also introduced the MetaBrain HC2000 as a separate,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
À la conférence AICC2026, Inspur Information a présenté deux systèmes d’inférence aux objectifs distincts. Le MetaBrain SD200 Ultra vise les très grands modèles et les usages d’agents d’IA sensibles à la latence. Le MetaBrain HC2000 met plutôt l’accent sur le volume de jetons produits. Leurs performances publiées sont celles annoncées par Inspur, pas des résultats vérifiés de manière indépendante. 3
18
20
Son architecture 3D Hyper Mesh relie étroitement 128 accélérateurs d’IA fabriqués en Chine. Inspur annonce 8 To de mémoire d’accélérateur à adressage unifié et 64 To de mémoire système. Selon l’entreprise, une seule machine peut exécuter Kimi K3, doté de 2 800 milliards de paramètres, et prendre en charge des modèles allant jusqu’à 10 000 milliards de paramètres. Ce dernier chiffre décrit une capacité annoncée : il ne dit rien, à lui seul, de la vitesse d’inférence à cette échelle. 3
17
Sur Kimi K3, Inspur revendique moins de 5,85 millisecondes par jeton généré, soit environ 170 jetons par seconde pour un utilisateur. L’entreprise présente ce résultat comme cinq fois supérieur à une moyenne du secteur, mais les conditions de test publiées ne permettent pas d’établir une comparaison à périmètre égal. Cette mesure ne correspond pas non plus au délai avant le premier jeton ni au temps nécessaire pour obtenir une réponse complète. 1
3
D’après Inspur, l’adressage global unifié et les communications fondées sur la mémoire limitent les transferts de données entre puces. Une technique de mémoire symétrique permettrait à un accélérateur d’accéder directement à la mémoire d’un autre. L’entreprise annonce une latence de communication descendant à 0,69 microseconde et un temps de communication AllReduce divisé par 3,5. Il s’agit de mesures de communication, pas du temps de réponse d’une application. 2
17
Pour Kimi K3, Inspur dit également regrouper des opérations liées à KDA, Gated MLA et MoE en opérateurs combinant calcul et communication. Selon elle, leur nombre serait réduit d’environ dix fois et les performances d’inférence seraient plus que triplées. Ce gain revendiqué concerne cette charge de travail : il ne peut pas être extrapolé automatiquement à d’autres modèles. 17
19
Le HC2000 répond à une autre priorité : augmenter la capacité de production de jetons. Il associe une baie refroidie par liquide, l’architecture DirectCom 2.0 et le logiciel d’inférence MCIS. Inspur affirme obtenir dix fois plus de jetons pour un même investissement. Ce chiffre porte sur le débit et l’économie du système, non sur une latence par utilisateur comparable à celle annoncée pour le SD200 Ultra. Pour l’évaluer, il faut connaître la configuration de référence, la charge de travail et les coûts inclus. 18
20
Les comptes rendus disponibles qualifient les accélérateurs du SD200 Ultra de puces chinoises, sans nommer leur fournisseur. Avant toute commande, un acheteur devrait demander leur identité et les détails de la prise en charge logicielle, puis tester ses propres modèles selon un protocole reproductible : précision numérique, longueur du contexte et nombre de requêtes simultanées. Les mesures devraient couvrir le délai avant le premier jeton, le débit soutenu, la consommation électrique et le coût total. Sans ces éléments, les chiffres du lancement ne permettent pas de prévoir de façon fiable les performances d’un déploiement réel. 1
3
18
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Inspur annonce un supernœud de 128 accélérateurs capable, selon l’entreprise, d’exécuter Kimi K3, un modèle de 2 800 milliards de paramètres, à moins de 5,85 ms par jeton généré.
Inspur annonce un supernœud de 128 accélérateurs capable, selon l’entreprise, d’exécuter Kimi K3, un modèle de 2 800 milliards de paramètres, à moins de 5,85 ms par jeton généré. Le HC2000 vise la production de davantage de jetons à investissement égal, et non la même latence pour un utilisateur isolé.