Inspurin mukaan SD200 Ultra voi ajaa 2,8 biljoonan parametrin Kimi K3 mallia alle 5,85 millisekunnin viiveellä tuotettua tokenia kohti. Järjestelmässä on 128 kiinalaisvalmisteista tekoälykiihdytintä, 8 teratavua yhtenäisesti osoitettavaa kiihdytinmuistia ja 64 teratavua järjestelmämuistia.
JulkaisijaMuokattu mallilla GPT-6 SolKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inspur Information announce about the MetaBrain SD200 Ultra at AICC2026, including its intended workloads, 128-chip and memory conf. Article summary: Inspur Information announced the MetaBrain SD200 Ultra at AICC2026 as a tightly coupled supernode for large frontier models and latency-sensitive AI-agent workloads. It also introduced the MetaBrain HC2000 as a separate,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Inspur Information esitteli MetaBrain SD200 Ultran AICC2026-tekoälylaskentakonferenssissa suurille malleille ja nopeaa vasteaikaa vaativille tekoälyagenttien tehtäville. Samalla julkistettu MetaBrain HC2000 tähtää toiseen tarpeeseen: suurempaan token-tuotantoon. Kummankin järjestelmän näkyvimmät suorituskykyluvut perustuvat Inspurin ilmoituksiin. 3
18
20
SD200 Ultra yhdistää 128 kiinalaisvalmisteista tekoälykiihdytintä 3D Hyper Mesh -arkkitehtuurilla. Inspur ilmoittaa kokoonpanolle 8 teratavua yhtenäisesti osoitettavaa kiihdytinmuistia ja 64 teratavua järjestelmämuistia. Yhtiön mukaan yksi järjestelmä pystyy ajamaan 2,8 biljoonan parametrin Kimi K3 -mallia ja tukemaan jopa 10 biljoonan parametrin malleja. Jälkimmäinen on väite mallin mahtumisesta järjestelmään, ei mittaus siitä, kuinka nopeasti näin suuri malli tuottaisi vastauksia. 3
17
Kimi K3:lla Inspur ilmoittaa viiveeksi alle 5,85 millisekuntia tuotettua tokenia kohti. Se vastaa yhtiön mukaan noin 170 tokenia sekunnissa yhdelle käyttäjälle, eli viisinkertaista nopeutta yhtiön mainitsemaan alan keskiarvoon verrattuna. Julkaistut tiedot eivät kuitenkaan riitä varmistamaan, onko vertailu tehty samoissa testiolosuhteissa. Yhden tokenin tuottamiseen kuluva aika ei myöskään ole sama asia kuin ensimmäisen tokenin viive tai koko vastauksen odotusaika. 1
3
Inspurin mukaan yhteinen muistin osoitteistus ja muistipohjainen viestintä vähentävät tiedon siirtelyä kiihdyttimien välillä. Niin sanottu symmetrinen muisti mahdollistaa toisen kiihdyttimen muistin suoran käytön. Yhtiö ilmoittaa tiedonsiirron viiveeksi parhaimmillaan 0,69 mikrosekuntia ja AllReduce-viestintään kuluvan ajan pienentyneen 3,5-kertaisesti. Nämä ovat kiihdyttimien välisen viestinnän lukuja, eivät käyttäjän kokeman vastausajan mittauksia. 2
17
Kimi K3:a varten Inspur kertoo yhdistäneensä KDA-, Gated MLA- ja MoE-toimintoihin liittyviä laskentaoperaatioita suuremmiksi kokonaisuuksiksi. Sen mukaan operaatioiden määrä vähenee noin kymmenesosaan ja päättelysuorituskyky paranee yli kolminkertaiseksi. Väite koskee kyseistä optimointia ja työkuormaa; samaa nopeutusta ei voi olettaa muille malleille. 17
19
HC2000 on suunnattu suuren päättelykapasiteetin tuottamiseen. Siinä yhdistyvät nestejäähdytteinen laitekaappi, DirectCom 2.0 -arkkitehtuuri ja MCIS-päättelyohjelmisto. Inspur väittää sen tuottavan kymmenen kertaa enemmän tokeneita samalla investoinnilla. Väite ei tarkoita, että HC2000 yltäisi SD200 Ultran ilmoitettuun yhden käyttäjän token-viiveeseen. Vertailua varten tarvitaan tieto vertailujärjestelmästä, työkuormasta ja mukaan lasketuista kustannuksista. 18
20
Julkistetuissa tiedoissa SD200 Ultran kiihdyttimiä kuvataan kiinalaisvalmisteisiksi, mutta niiden toimittajaa ei nimetä. Ennen hankintaa ostajan kannattaa pyytää tiedot siruista ja ohjelmistotuesta sekä testata omaa malliaan toistettavin menetelmin. Testissä on syytä määritellä laskentatarkkuus, kontekstin pituus ja samanaikaisten käyttäjien määrä sekä mitata ensimmäisen tokenin viive, jatkuva token-tuotanto, sähkönkulutus ja kokonaiskustannukset. Ilman näitä tietoja julkistusluvut kertovat vain rajallisesti järjestelmän toiminnasta ostajan omassa käytössä. 1
3
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Inspurin mukaan SD200 Ultra voi ajaa 2,8 biljoonan parametrin Kimi K3 mallia alle 5,85 millisekunnin viiveellä tuotettua tokenia kohti.
Inspurin mukaan SD200 Ultra voi ajaa 2,8 biljoonan parametrin Kimi K3 mallia alle 5,85 millisekunnin viiveellä tuotettua tokenia kohti. Järjestelmässä on 128 kiinalaisvalmisteista tekoälykiihdytintä, 8 teratavua yhtenäisesti osoitettavaa kiihdytinmuistia ja 64 teratavua järjestelmämuistia.
HC2000:n lupaus kymmenkertaisesta token tuotannosta samalla investoinnilla koskee eri tavoitetta kuin SD200 Ultran yhden käyttäjän viiveluku.