SD200 Ultra kobler sammen 128 kinesiskutviklede AI akseleratorer. Inspur hevder at én maskin kan kjøre Kimi K3 med 2,8 billioner parametere og generere tokener på under 5,85 millisekunder per token.
Publisert avRedigert med GPT-6 SolBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inspur Information announce about the MetaBrain SD200 Ultra at AICC2026, including its intended workloads, 128-chip and memory conf. Article summary: Inspur Information announced the MetaBrain SD200 Ultra at AICC2026 as a tightly coupled supernode for large frontier models and latency-sensitive AI-agent workloads. It also introduced the MetaBrain HC2000 as a separate,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Inspur Information lanserte MetaBrain SD200 Ultra på AI-datakraftkonferansen AICC2026 som en supernode for svært store modeller og AI-agenter der responstid er viktig. Samtidig presenterte selskapet MetaBrain HC2000, som er innrettet mot å produsere flere tokener på tvers av arbeidsbelastninger. Ytelsestallene for begge systemene kommer fra Inspur, ikke fra uavhengige tester. 3
18
20
SD200 Ultra bruker arkitekturen 3D Hyper Mesh til å koble tett sammen 128 kinesiskutviklede AI-akseleratorer. Inspur oppgir 8 TB akseleratorminne med felles adressering og 64 TB systemminne. Selskapet sier at én maskin kan kjøre Kimi K3, en modell med 2,8 billioner parametere, og støtte modeller på opptil 10 billioner parametere. Det siste er en påstand om modellkapasitet, ikke et mål på hvor raskt en så stor modell kan kjøres. 3
17
For Kimi K3 oppgir Inspur under 5,85 millisekunder per genererte token, tilsvarende omtrent 170 tokener i sekundet for én bruker. Selskapet kaller dette fem ganger et bransjegjennomsnitt, men de oppgitte testdetaljene er ikke tilstrekkelige til å vurdere om sammenligningen er gjort på like vilkår. Tiden per genererte token er heller ikke det samme som ventetiden til første token eller til et helt svar er ferdig. 1
3
Ifølge Inspur gjør felles minneadressering og kommunikasjon med direkte minnetilgang at mindre data må flyttes mellom brikkene. Selskapet sier at én akselerator kan få direkte tilgang til minnet i en annen, og oppgir en kommunikasjonsforsinkelse ned mot 0,69 mikrosekunder samt 3,5 ganger kortere AllReduce-tid. Dette er målinger av kommunikasjon, ikke av tiden brukeren venter på et svar. 2
17
Inspur sier også at systemet slår sammen operasjoner knyttet til KDA, Gated MLA og MoE i Kimi K3. Selskapet hevder at dette reduserer antallet operasjoner omtrent tidobbelt og forbedrer inferensytelsen mer enn tredobbelt. Det er en påstand for denne arbeidsbelastningen, ikke en garantert gevinst for andre modeller. 17
19
HC2000 har et annet mål enn SD200 Ultra: Med væskekjølt rack, DirectCom 2.0 og inferensprogramvaren MCIS hevder Inspur at systemet kan produsere ti ganger så mange tokener for samme investering. Det er en påstand om kapasitet og økonomi, ikke om at HC2000 har SD200 Ultras oppgitte forsinkelse for én bruker. For å vurdere tallet trengs et tydelig sammenligningsgrunnlag, en definert arbeidsbelastning og en avgrensning av kostnadene. 18
20
Publiserte omtaler beskriver akseleratorene i SD200 Ultra som kinesiskutviklede, men navngir ikke leverandøren. Før et kjøp bør man derfor be om brikkeidentitet og detaljer om programvarestøtte, og teste egne modeller under dokumenterte forhold: tallpresisjon, kontekstlengde og antall samtidige brukere. Mål både tid til første token, vedvarende tokengjennomstrømning, strømforbruk og totalkostnad. Uten slike opplysninger er lanseringstallene et usikkert grunnlag for å anslå ytelsen i egen drift. 1
3
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SD200 Ultra kobler sammen 128 kinesiskutviklede AI akseleratorer. Inspur hevder at én maskin kan kjøre Kimi K3 med 2,8 billioner parametere og generere tokener på under 5,85 millisekunder per token.
SD200 Ultra kobler sammen 128 kinesiskutviklede AI akseleratorer. Inspur hevder at én maskin kan kjøre Kimi K3 med 2,8 billioner parametere og generere tokener på under 5,85 millisekunder per token. HC2000 er rettet mot produksjon av flere tokener for samme investering. Verken dette eller SD200 Ultras ytelsestall er dokumentert som uavhengige, sammenlignbare målinger.