Inspur zegt dat één SD200 Ultra het Kimi K3 model met 2,8 biljoen parameters kan draaien, met minder dan 5,85 milliseconden generatietijd per token. De HC2000 is bedoeld voor hogere tokenproductie.
Gepubliceerd doorBewerkt met GPT-6 SolAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inspur Information announce about the MetaBrain SD200 Ultra at AICC2026, including its intended workloads, 128-chip and memory conf. Article summary: Inspur Information announced the MetaBrain SD200 Ultra at AICC2026 as a tightly coupled supernode for large frontier models and latency-sensitive AI-agent workloads. It also introduced the MetaBrain HC2000 as a separate,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Inspur Information presenteerde de MetaBrain SD200 Ultra op de AI-rekenconferentie AICC2026 als supernode: een systeem dat veel AI-chips nauw laat samenwerken. Het is bedoeld voor zeer grote modellen en AI-agenttoepassingen waarbij vertraging telt. Tegelijk kondigde Inspur de MetaBrain HC2000 aan, die een ander doel heeft: meer tokens produceren over vergelijkbare inferentieworkloads. De prestatiecijfers voor beide systemen zijn afkomstig van Inspur en zijn geen onafhankelijk bevestigde benchmarks. 3
18
20
Volgens Inspur verbindt de 3D Hyper Mesh-architectuur 128 in eigen land geproduceerde AI-accelerators. Het systeem heeft 8 TB gezamenlijk adresseerbaar geheugen voor de accelerators en 64 TB systeemgeheugen. Inspur zegt dat één machine Kimi K3 met 2,8 biljoen parameters kan draaien en modellen tot 10 biljoen parameters ondersteunt. Dat laatste is een claim over modelcapaciteit, niet over de snelheid waarmee zo’n model antwoorden geeft. 3
17
Voor Kimi K3 meldt het bedrijf een generatietijd van minder dan 5,85 milliseconden per token. Dat komt volgens Inspur neer op ongeveer 170 tokens per seconde voor één gebruiker, vijf keer het gemiddelde in de sector. Zonder voldoende details over de testopzet is niet vast te stellen of die vergelijking gelijkwaardige workloads betreft. Bovendien is de tijd per gegenereerd token iets anders dan de wachttijd tot het eerste token of tot een volledig antwoord. 1
3
Met gezamenlijke adressering en communicatie waarbij chips rechtstreeks met elkaars geheugen kunnen werken, wil Inspur het verplaatsen van data beperken. Het bedrijf noemt een communicatietijd van minimaal 0,69 microseconde en zegt dat de tijd voor AllReduce-communicatie — het samenvoegen van resultaten van meerdere chips — 3,5 keer korter is. Dat zijn cijfers over communicatie tussen chips, niet over de reactietijd van een AI-toepassing. 2
17
Specifiek voor Kimi K3 zegt Inspur bewerkingen voor KDA, Gated MLA en MoE samen te voegen tot grotere reken- en communicatiestappen. Volgens het bedrijf levert dat ongeveer tien keer minder bewerkingen en meer dan drie keer betere inferentieprestaties op. Die verbetering is gekoppeld aan deze workload en kan niet zonder meer naar andere modellen worden doorgetrokken. 17
19
De HC2000 richt zich op productiecapaciteit. Het systeem combineert een vloeistofgekoeld rack met DirectCom 2.0 en MCIS-inferentiesoftware. Inspur claimt tien keer zoveel tokenoutput bij dezelfde investering. Dat zegt iets over doorvoer en kosten volgens de fabrikant, maar niet dat de HC2000 dezelfde lage vertraging voor één gebruiker haalt als de SD200 Ultra. Voor een zinvolle vergelijking zijn een duidelijk referentiesysteem, dezelfde workload en een afgebakende kostenberekening nodig. 18
20
De beschikbare berichtgeving noemt de accelerators van de SD200 Ultra alleen ‘binnenlands’ en vermeldt geen leverancier. Kopers doen er daarom goed aan de chipidentiteit en softwareondersteuning op te vragen en beide systemen met hun eigen modellen te testen. Leg daarbij de rekenprecisie, contextlengte en het aantal gelijktijdige gebruikers vast; meet ook de tijd tot het eerste token, de volgehouden tokenproductie, het stroomverbruik en de totale kosten. Zonder die gegevens zeggen de lanceringscijfers weinig over de prestaties in een concrete toepassing. 1
3
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Inspur zegt dat één SD200 Ultra het Kimi K3 model met 2,8 biljoen parameters kan draaien, met minder dan 5,85 milliseconden generatietijd per token.
Inspur zegt dat één SD200 Ultra het Kimi K3 model met 2,8 biljoen parameters kan draaien, met minder dan 5,85 milliseconden generatietijd per token. De HC2000 is bedoeld voor hogere tokenproductie. Ook de claim van tien keer zoveel output bij dezelfde investering vraagt om een vergelijkbare test en een helder referentiepunt.