Inspur säger att MetaBrain SD200 Ultra kan köra Kimi K3 med 2,8 biljoner parametrar på en maskin och generera en token på under 5,85 millisekunder. Den samtidigt presenterade HC2000 ska prioritera tokenproduktion vid given investering, inte nödvändigtvis låg svarstid för en enskild användare.
Publicerad avRedigerad med GPT-6 SolBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inspur Information announce about the MetaBrain SD200 Ultra at AICC2026, including its intended workloads, 128-chip and memory conf. Article summary: Inspur Information announced the MetaBrain SD200 Ultra at AICC2026 as a tightly coupled supernode for large frontier models and latency-sensitive AI-agent workloads. It also introduced the MetaBrain HC2000 as a separate,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Inspur Information presenterade MetaBrain SD200 Ultra på AI-datorkonferensen AICC2026 som en supernod för mycket stora AI-modeller och AI-agenter där svarstiden är viktig. Samtidigt lanserades MetaBrain HC2000 med en annan inriktning: högre tokenproduktion över många inferensjobb. Prestandasiffrorna för båda systemen kommer från Inspur, inte från oberoende jämförande tester. 3
18
20
Enligt Inspur kopplar arkitekturen 3D Hyper Mesh samman 128 kinesiskt tillverkade AI-acceleratorer. Systemet har 8 TB acceleratorminne med gemensam adressering och 64 TB systemminne. Företaget uppger att en maskin kan köra Kimi K3 med 2,8 biljoner parametrar och stödja modeller på upp till 10 biljoner parametrar. Den senare siffran gäller uppgiven modellkapacitet – den säger inte hur snabbt en så stor modell skulle köras. 3
17
För Kimi K3 anger Inspur under 5,85 millisekunder per genererad token, motsvarande cirka 170 token per sekund för en användare. Företaget beskriver det som fem gånger ett branschgenomsnitt, men underlaget anger inte tillräckligt tydliga testvillkor för att jämförelsen ska kunna bedömas som likvärdig. Tiden per genererad token är inte heller samma sak som tiden till första token eller väntan på ett färdigt svar. 1
3
Inspur säger att gemensam adressering och kommunikation med minnessemantik minskar behovet av att flytta data mellan kretsarna. Med så kallat symmetriskt minne ska en accelerator kunna nå en annans minne direkt. Företaget uppger en kommunikationslatens på ned till 0,69 mikrosekunder och 3,5 gånger kortare kommunikationstid för AllReduce, en metod för att sammanställa data mellan acceleratorer. Det är mått på kommunikation i systemet, inte på hur länge användaren väntar på ett svar. 2
17
För just Kimi K3 uppger Inspur att beräknings- och kommunikationssteg kopplade till KDA, Gated MLA och MoE har slagits samman till större operatorer. Enligt företaget minskar antalet operatorer ungefär tiofalt och inferensprestandan förbättras mer än trefalt. Det är ett påstående om en specifik arbetslast, inte en utlovad hastighetsökning för andra modeller. 17
19
HC2000 bygger enligt Inspur på ett vätskekylt rack, DirectCom 2.0 och inferensmjukvaran MCIS. Företaget hävdar tio gånger högre tokenproduktion för samma investering. Det handlar om kapacitet och ekonomi, inte om att HC2000 skulle ha samma uppgivna svarstid för en enskild användare som SD200 Ultra. För att värdera påståendet behövs en tydlig jämförelsepunkt, samma arbetslast och en avgränsning av vilka kostnader som räknas. 18
20
Publicerade uppgifter beskriver SD200 Ultras acceleratorer som inhemskt tillverkade, men namnger inte leverantören. Den som överväger något av systemen bör därför begära besked om kretsarna och mjukvarustödet samt köra reproducerbara tester med sina egna modeller. Ange bland annat beräkningsprecision, kontextlängd och antal samtidiga användare; mät tid till första token, uthållig tokentakt, effektförbrukning och totalkostnad. Utan sådana villkor är lanseringssiffrorna ett svagt beslutsunderlag för den egna driftsmiljön. 1
3
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Inspur säger att MetaBrain SD200 Ultra kan köra Kimi K3 med 2,8 biljoner parametrar på en maskin och generera en token på under 5,85 millisekunder.
Inspur säger att MetaBrain SD200 Ultra kan köra Kimi K3 med 2,8 biljoner parametrar på en maskin och generera en token på under 5,85 millisekunder. Den samtidigt presenterade HC2000 ska prioritera tokenproduktion vid given investering, inte nödvändigtvis låg svarstid för en enskild användare.