Inspur presentó el SD200 Ultra con 128 aceleradores de IA y afirma que puede ejecutar Kimi K3, de 2,8 billones de parámetros, con menos de 5,85 ms por token generado. El HC2000 busca producir más tokens por inversión, no igualar necesariamente la latencia para un solo usuario del SD200 Ultra.
Publicado porEditado con GPT-6 SolImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did Inspur Information announce about the MetaBrain SD200 Ultra at AICC2026, including its intended workloads, 128-chip and memory conf. Article summary: Inspur Information announced the MetaBrain SD200 Ultra at AICC2026 as a tightly coupled supernode for large frontier models and latency-sensitive AI-agent workloads. It also introduced the MetaBrain HC2000 as a separate,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Inspur Information presentó en la conferencia de computación de inteligencia artificial AICC2026 el MetaBrain SD200 Ultra, un supernodo orientado a modelos muy grandes y aplicaciones de agentes de IA sensibles a la latencia. También anunció el MetaBrain HC2000, pensado para aumentar la capacidad de producción de tokens. Las cifras de rendimiento difundidas para ambos sistemas proceden de Inspur: conviene tratarlas como afirmaciones del fabricante, no como resultados verificados de forma independiente. 3
18
20
Según Inspur, su arquitectura 3D Hyper Mesh conecta estrechamente 128 aceleradores de IA fabricados en China. El sistema dispone de 8 TB de memoria de los aceleradores con direccionamiento unificado y 64 TB de memoria del sistema. La compañía afirma que una sola máquina puede ejecutar Kimi K3, un modelo de 2,8 billones de parámetros, y admitir modelos de hasta 10 billones de parámetros. Esta última cifra describe una capacidad anunciada; no indica a qué velocidad funcionaría un modelo de ese tamaño. 3
17
Para Kimi K3, Inspur declara una latencia inferior a 5,85 milisegundos por token generado, equivalente, según sus datos, a unos 170 tokens por segundo para un usuario. También sostiene que esa velocidad quintuplica una media del sector, pero las fuentes no detallan lo suficiente las condiciones de la prueba para considerar que se trata de una comparación en igualdad de condiciones. Además, el tiempo entre tokens no es lo mismo que la latencia hasta el primer token ni que el tiempo total que espera una persona para recibir una respuesta. 1
3
Inspur atribuye parte de la mejora al direccionamiento global unificado y a una comunicación que permite reducir los traslados de datos entre aceleradores. Su tecnología de memoria simétrica permite que un acelerador acceda directamente a la memoria de otro. La compañía comunica una latencia de comunicación de hasta 0,69 microsegundos y un tiempo de comunicación AllReduce 3,5 veces menor. Son medidas del intercambio de datos entre chips, no tiempos de respuesta de una aplicación completa. 2
17
Para la inferencia de Kimi K3 —el proceso de generar respuestas con el modelo—, Inspur dice que agrupa operaciones vinculadas a KDA, Gated MLA y MoE en operadores mayores que combinan cálculo y comunicación. Afirma que así reduce unas diez veces el número de operadores y mejora el rendimiento de inferencia más de tres veces. Es una optimización declarada para esa carga de trabajo, no una aceleración garantizada para otros modelos. 17
19
El HC2000 apuesta por la capacidad de inferencia: generar más tokens con una inversión equivalente. Combina un armario refrigerado por líquido, la arquitectura DirectCom 2.0 y el software de inferencia MCIS. Inspur afirma que ofrece diez veces más producción de tokens con la misma inversión. Esa promesa se refiere al volumen y al coste, no a que el HC2000 alcance la latencia por token anunciada para un usuario del SD200 Ultra. Para evaluarla hacen falta una referencia de comparación, una carga de trabajo definida y claridad sobre qué costes incluye el cálculo. 18
20
Antes de comprar, hay otra incógnita: los informes describen los aceleradores del SD200 Ultra como fabricados en China, pero no identifican a su proveedor. Conviene pedir a Inspur el modelo exacto de chip y los detalles de compatibilidad del software, y después exigir pruebas reproducibles con los modelos que se vayan a utilizar. Esas pruebas deberían fijar la precisión numérica, la longitud del contexto y el número de usuarios simultáneos, además de medir el tiempo hasta el primer token, la producción sostenida de tokens, el consumo eléctrico y el coste total. Sin esas condiciones, las cifras del lanzamiento no permiten predecir con fiabilidad el rendimiento en una instalación concreta. 1
3
18
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Inspur presentó el SD200 Ultra con 128 aceleradores de IA y afirma que puede ejecutar Kimi K3, de 2,8 billones de parámetros, con menos de 5,85 ms por token generado.
Inspur presentó el SD200 Ultra con 128 aceleradores de IA y afirma que puede ejecutar Kimi K3, de 2,8 billones de parámetros, con menos de 5,85 ms por token generado. El HC2000 busca producir más tokens por inversión, no igualar necesariamente la latencia para un solo usuario del SD200 Ultra.