Inspur zufolge verbindet der SD200 Ultra 128 in China entwickelte KI Beschleuniger und kann Kimi K3 mit 2,8 Billionen Parametern auf einem System ausführen. Der gleichzeitig vorgestellte HC2000 zielt auf eine höhere Token Gesamtproduktion.
Veröffentlicht vonBearbeitet mit GPT-6 SolBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What did Inspur Information announce about the MetaBrain SD200 Ultra at AICC2026, including its intended workloads, 128-chip and memory conf. Article summary: Inspur Information announced the MetaBrain SD200 Ultra at AICC2026 as a tightly coupled supernode for large frontier models and latency-sensitive AI-agent workloads. It also introduced the MetaBrain HC2000 as a separate,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Inspur Information hat auf der KI-Rechenkonferenz AICC2026 den MetaBrain SD200 Ultra vorgestellt. Der eng gekoppelte Verbund aus KI-Beschleunigern ist für sehr große Modelle und KI-Agenten mit hohen Anforderungen an die Reaktionszeit gedacht. Parallel präsentierte Inspur den MetaBrain HC2000, bei dem die Menge produzierter Tokens im Vordergrund steht. Die Leistungszahlen zu beiden Systemen stammen vom Anbieter; unabhängige Benchmarks sind sie nicht. 3
18
20
Der SD200 Ultra verbindet laut Inspur 128 in China entwickelte KI-Beschleuniger über eine 3D-Hyper-Mesh-Architektur. Das System bietet demnach 8 TB einheitlich adressierbaren Beschleunigerspeicher und 64 TB Arbeitsspeicher. Auf einem System soll das Modell Kimi K3 mit 2,8 Billionen Parametern laufen; Inspur spricht außerdem von Unterstützung für Modelle mit bis zu zehn Billionen Parametern. Die höhere Zahl beschreibt eine beanspruchte Modellkapazität – nicht, wie schnell ein Modell dieser Größe Antworten liefert. 3
17
Für Kimi K3 nennt Inspur weniger als 5,85 Millisekunden pro generiertem Token. Das entspreche etwa 170 Tokens pro Sekunde für einen einzelnen Nutzer und sei fünfmal so schnell wie ein Branchendurchschnitt. Für einen belastbaren Vergleich fehlen jedoch Angaben zu den Testbedingungen. Die Zeit pro generiertem Token ist zudem weder die Wartezeit bis zum ersten Token noch die Dauer bis zur vollständigen Antwort. 1
3
Mit einheitlicher Adressierung und speicherorientierter Kommunikation will Inspur Datentransfers zwischen Chips verringern. Ein symmetrischer Speicheransatz soll Beschleunigern direkten Zugriff auf den Speicher anderer Beschleuniger ermöglichen. Das Unternehmen nennt eine Kommunikationslatenz von bis zu 0,69 Mikrosekunden und eine um den Faktor 3,5 kürzere AllReduce-Kommunikationszeit. Das sind Messwerte für die Kommunikation, nicht für die Antwortzeit einer Anwendung. 2
17
Speziell für Kimi K3 bündelt Inspur nach eigenen Angaben grundlegende Operationen aus KDA, Gated MLA und MoE zu größeren Rechen- und Kommunikationsoperatoren. Dadurch soll die Zahl der Operatoren um etwa den Faktor zehn sinken und die Inferenzleistung um mehr als das Dreifache steigen. Dieser behauptete Zugewinn bezieht sich auf eine bestimmte Arbeitslast und lässt sich nicht ohne Weiteres auf andere Modelle übertragen. 17
19
Der HC2000 verfolgt ein anderes Ziel: möglichst viele Tokens über entsprechende Inferenz-Workloads hinweg zu erzeugen. Inspur kombiniert dafür ein flüssigkeitsgekühltes Rack mit der DirectCom-2.0-Architektur und der MCIS-Inferenzsoftware. Nach Herstellerangaben steigt die Token-Produktion bei gleichem Investitionsaufwand um das Zehnfache. Das ist eine Aussage über Durchsatz und Wirtschaftlichkeit – kein Versprechen, dass der HC2000 die für den SD200 Ultra genannte Latenz eines einzelnen Nutzers erreicht. Ohne definierte Vergleichsbasis, Arbeitslast und Kostengrenzen bleibt die Zahl schwer bewertbar. 18
20
Vor einer Kaufentscheidung sollten Interessenten klären, von welchem Hersteller die als „in China entwickelt“ bezeichneten Beschleuniger stammen und welche Software dafür unterstützt wird; die vorliegenden Berichte nennen keinen Chiplieferanten. Anschließend braucht es reproduzierbare Tests mit den eigenen Modellen und festgelegter Rechengenauigkeit, Kontextlänge und Zahl gleichzeitiger Anfragen. Zu messen sind insbesondere die Zeit bis zum ersten Token, der dauerhaft erzielte Token-Durchsatz, der Stromverbrauch und die Gesamtkosten. Erst solche Ergebnisse zeigen, ob die Ankündigungswerte für den geplanten Betrieb aussagekräftig sind. 1
3
18
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Inspur zufolge verbindet der SD200 Ultra 128 in China entwickelte KI Beschleuniger und kann Kimi K3 mit 2,8 Billionen Parametern auf einem System ausführen.
Inspur zufolge verbindet der SD200 Ultra 128 in China entwickelte KI Beschleuniger und kann Kimi K3 mit 2,8 Billionen Parametern auf einem System ausführen. Der gleichzeitig vorgestellte HC2000 zielt auf eine höhere Token Gesamtproduktion.