Inspur dichiara che il MetaBrain SD200 Ultra collega 128 acceleratori AI e può eseguire Kimi K3, da 2.800 miliardi di parametri, con una latenza inferiore a 5,85 ms per token generato. L’HC2000 è orientato alla quantità di token prodotti: la promessa di un output dieci volte superiore a parità di investimento non eq...
Pubblicato daModificato con GPT-6 SolImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inspur Information announce about the MetaBrain SD200 Ultra at AICC2026, including its intended workloads, 128-chip and memory conf. Article summary: Inspur Information announced the MetaBrain SD200 Ultra at AICC2026 as a tightly coupled supernode for large frontier models and latency-sensitive AI-agent workloads. It also introduced the MetaBrain HC2000 as a separate,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Inspur Information ha presentato il MetaBrain SD200 Ultra alla conferenza AICC2026, dedicata al calcolo per l’intelligenza artificiale. È un supernodo pensato per modelli molto grandi e applicazioni con agenti AI sensibili ai tempi di risposta. Nella stessa occasione ha annunciato il MetaBrain HC2000, orientato invece ad aumentare la quantità complessiva di token prodotti nell’inferenza. In entrambi i casi, le cifre sulle prestazioni sono dichiarazioni del produttore, non risultati di benchmark indipendenti. 3
18
20
L’SD200 Ultra usa l’architettura 3D Hyper Mesh per collegare strettamente 128 acceleratori AI prodotti in Cina. Inspur indica 8 TB di memoria degli acceleratori con indirizzamento unificato e 64 TB di memoria di sistema. Secondo l’azienda, una singola macchina può eseguire Kimi K3, da 2.800 miliardi di parametri, e supportare modelli fino a 10.000 miliardi di parametri. Quest’ultimo numero riguarda la capacità dichiarata di ospitare un modello, non la velocità con cui verrebbe eseguito. 3
17
Con Kimi K3, Inspur riporta una latenza inferiore a 5,85 millisecondi per token generato, equivalente, secondo l’azienda, a circa 170 token al secondo per un singolo utente: un valore che definisce cinque volte superiore alla media del settore. Le fonti non specificano abbastanza condizioni di prova per considerare quel confronto un benchmark omogeneo. Inoltre, il tempo per generare un token non coincide né con l’attesa del primo token né con il tempo necessario a ricevere una risposta completa. 1
3
Secondo Inspur, l’indirizzamento unificato e la comunicazione basata sulla semantica della memoria limitano i trasferimenti di dati tra chip. La memoria simmetrica permette a un acceleratore di accedere direttamente alla memoria di un altro. L’azienda dichiara una latenza di comunicazione fino a 0,69 microsecondi e un tempo di comunicazione AllReduce ridotto di 3,5 volte. Sono misure relative alla comunicazione interna, non ai tempi di risposta percepiti da chi usa l’applicazione. 2
17
Per l’inferenza di Kimi K3, Inspur afferma inoltre di riunire operazioni legate a KDA, Gated MLA e MoE in operatori più grandi che combinano calcolo e comunicazione. Rivendica così una riduzione di circa dieci volte del numero di operatori e un miglioramento delle prestazioni di inferenza superiore a tre volte. È un risultato dichiarato per questo carico di lavoro, non un incremento garantito con altri modelli. 17
19
L’HC2000 risponde a un’esigenza diversa: produrre più token su carichi comparabili. Integra un rack raffreddato a liquido, l’architettura DirectCom 2.0 e il software di inferenza MCIS. Inspur sostiene che possa generare dieci volte più token a parità di investimento, ma per valutare il dato servono un sistema di riferimento, un carico di lavoro e un perimetro dei costi definiti. Non è una promessa di eguagliare la latenza per singolo utente attribuita all’SD200 Ultra. 18
20
Le fonti descrivono gli acceleratori dell’SD200 Ultra come prodotti in Cina, senza identificarne il fornitore. Prima di acquistare uno dei due sistemi, è quindi opportuno chiedere a Inspur quale chip utilizzi e quali strumenti software supporti, oltre a prove riproducibili sui propri modelli. I test dovrebbero dichiarare precisione numerica, lunghezza del contesto e numero di richieste simultanee, misurando latenza del primo token, produzione sostenuta di token, consumi e costo complessivo. Senza queste condizioni, i numeri del lancio non bastano a prevedere le prestazioni in un’installazione reale. 1
3
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Inspur dichiara che il MetaBrain SD200 Ultra collega 128 acceleratori AI e può eseguire Kimi K3, da 2.800 miliardi di parametri, con una latenza inferiore a 5,85 ms per token generato.
Inspur dichiara che il MetaBrain SD200 Ultra collega 128 acceleratori AI e può eseguire Kimi K3, da 2.800 miliardi di parametri, con una latenza inferiore a 5,85 ms per token generato. L’HC2000 è orientato alla quantità di token prodotti: la promessa di un output dieci volte superiore a parità di investimento non equivale a una misura della latenza per singolo utente.