SD200 Ultra forbinder ifølge Inspur 128 kinesisk fremstillede AI acceleratorer og kan køre Kimi K3 med 2,8 billioner parametre på én maskine. Inspurs tal på under 5,85 millisekunder gælder generering af ét token – ikke ventetiden på et færdigt svar.
Udgivet afRedigeret med GPT-6 SolBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inspur Information announce about the MetaBrain SD200 Ultra at AICC2026, including its intended workloads, 128-chip and memory conf. Article summary: Inspur Information announced the MetaBrain SD200 Ultra at AICC2026 as a tightly coupled supernode for large frontier models and latency-sensitive AI-agent workloads. It also introduced the MetaBrain HC2000 as a separate,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Inspur Information præsenterede MetaBrain SD200 Ultra på AI-computerkonferencen AICC2026 som en supernode: et system, hvor mange AI-chips arbejder tæt sammen om blandt andet meget store modeller og AI-agenter, der er følsomme over for svartid. Samtidig lancerede virksomheden MetaBrain HC2000 med fokus på at producere flere tokens på tværs af opgaver. Ydelsestallene for begge systemer stammer fra Inspur og bør læses som producentens påstande. 3
18
20
SD200 Ultra bruger arkitekturen 3D Hyper Mesh til at forbinde 128 kinesisk fremstillede AI-acceleratorer. Inspur oplyser, at systemet har 8 TB acceleratorhukommelse med fælles adressering og 64 TB systemhukommelse. Ifølge virksomheden kan én maskine køre Kimi K3 med 2,8 billioner parametre og understøtte modeller på op til 10 billioner parametre. Det sidste er en påstand om, hvor stor en model systemet kan rumme – ikke et mål for, hvor hurtigt den vil køre. 3
17
For Kimi K3 angiver Inspur under 5,85 millisekunder pr. genereret token, svarende til cirka 170 tokens i sekundet for én bruger. Virksomheden kalder det fem gange hurtigere end et branchegennemsnit, men kilderne beskriver ikke testen godt nok til, at sammenligningen kan betragtes som en ensartet benchmark. Tiden pr. genereret token er heller ikke det samme som tiden til det første token eller til et helt svar. 1
3
Ifølge Inspur skal fælles adressering og kommunikation, der giver adgang til hukommelse på tværs af chips, mindske behovet for at flytte data. Virksomheden oplyser, at en accelerator kan få direkte adgang til en andens hukommelse, at kommunikationsforsinkelsen kan komme ned på 0,69 mikrosekunder, og at tiden til den kollektive kommunikationsoperation AllReduce reduceres 3,5 gange. Det er mål for kommunikation mellem chips – ikke for brugerens samlede svartid. 2
17
Inspur siger også, at beregnings- og kommunikationsoperationer knyttet til KDA, Gated MLA og MoE er samlet i større operationer til Kimi K3. Ifølge virksomheden reducerer det antallet af operationer omtrent tidobbelt og forbedrer inferensydelsen mere end tredobbelt. Påstanden gælder denne optimerede arbejdsopgave og kan ikke uden videre overføres til andre modeller. 17
19
HC2000 har et andet formål end SD200 Ultra: høj samlet tokenproduktion. Systemet kombinerer et væskekølet rack, DirectCom 2.0 og inferenssoftwaren MCIS. Inspur hævder, at det giver ti gange så stor tokenproduktion ved samme investering. Det siger ikke, at HC2000 matcher SD200 Ultras oplyste hastighed for én bruger; påstanden kræver et klart sammenligningsgrundlag for opgave og omkostninger. 18
20
Omtalen af SD200 Ultra beskriver acceleratorerne som kinesisk fremstillede, men navngiver ikke leverandøren. Før et køb bør man derfor bede om chipidentitet og oplysninger om softwareunderstøttelse – og teste egne modeller under reproducerbare forhold. Testen bør fastlægge talpræcision, kontekstlængde og antal samtidige brugere samt måle tid til første token, vedvarende tokengennemløb, strømforbrug og samlede omkostninger. Uden de oplysninger er lanceringstallene et usikkert grundlag for at forudsige ydelsen i egen drift. 1
3
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SD200 Ultra forbinder ifølge Inspur 128 kinesisk fremstillede AI acceleratorer og kan køre Kimi K3 med 2,8 billioner parametre på én maskine.
SD200 Ultra forbinder ifølge Inspur 128 kinesisk fremstillede AI acceleratorer og kan køre Kimi K3 med 2,8 billioner parametre på én maskine. Inspurs tal på under 5,85 millisekunder gælder generering af ét token – ikke ventetiden på et færdigt svar.
HC2000 er rettet mod samlet tokenproduktion. Påstanden om tidoblet kapacitet ved samme investering kræver et oplyst sammenligningsgrundlag.