A Inspur anunciou o SD200 Ultra com 128 aceleradores de IA e afirma que ele executa o Kimi K3, de 2,8 trilhões de parâmetros, com menos de 5,85 ms por token gerado. O HC2000 mira a produção de mais tokens por investimento, não necessariamente a menor latência para um usuário.
Publicado porEditado com GPT-6 SolImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did Inspur Information announce about the MetaBrain SD200 Ultra at AICC2026, including its intended workloads, 128-chip and memory conf. Article summary: Inspur Information announced the MetaBrain SD200 Ultra at AICC2026 as a tightly coupled supernode for large frontier models and latency-sensitive AI-agent workloads. It also introduced the MetaBrain HC2000 as a separate,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
A Inspur Information apresentou o MetaBrain SD200 Ultra na conferência AICC2026, voltada à computação para inteligência artificial, como um supernó para modelos muito grandes e aplicações com agentes de IA sensíveis à latência. No mesmo evento, anunciou o MetaBrain HC2000, com outra prioridade: ampliar a capacidade de produção de tokens em tarefas de inferência. Os números de desempenho divulgados para ambos vêm da fabricante, não de testes independentes. 3
18
20
Segundo a Inspur, a arquitetura 3D Hyper Mesh interliga 128 aceleradores de IA fabricados na China. O sistema oferece 8 TB de memória dos aceleradores com endereçamento unificado e 64 TB de memória do sistema. A empresa afirma que uma única máquina executa o Kimi K3, de 2,8 trilhões de parâmetros, e comporta modelos de até 10 trilhões de parâmetros. Essa última cifra indica a capacidade anunciada para acomodar modelos; não informa a velocidade de inferência nessa escala. 3
17
Para o Kimi K3, a Inspur informa menos de 5,85 milissegundos por token gerado, o equivalente, segundo ela, a cerca de 170 tokens por segundo para um usuário — desempenho que descreve como cinco vezes a média do setor. As fontes não detalham o teste o suficiente para confirmar se essa comparação usa condições equivalentes. Além disso, o tempo por token não é o mesmo que o tempo até o primeiro token nem que a espera por uma resposta completa. 1
3
A proposta do endereçamento unificado e da comunicação baseada em operações de memória é reduzir a movimentação de dados entre chips. A Inspur diz que sua tecnologia de memória simétrica permite a um acelerador acessar diretamente a memória de outro. Ela relata latência de comunicação de até 0,69 microssegundo e redução de 3,5 vezes no tempo de comunicação AllReduce, operação usada para combinar dados entre aceleradores. São medidas de comunicação, não do tempo de resposta de uma aplicação. 2
17
Há também otimizações específicas para o Kimi K3: a empresa afirma agrupar operações ligadas a KDA, Gated MLA e MoE em operadores maiores, que combinam computação e comunicação. Segundo a Inspur, isso reduz em cerca de dez vezes o número de operadores e melhora o desempenho de inferência em mais de três vezes. Não se deve presumir que o ganho se repita em outros modelos. 17
19
O HC2000 segue uma proposta distinta, focada em volume de inferência. Ele reúne um rack com refrigeração líquida, a arquitetura DirectCom 2.0 e o software de inferência MCIS. A Inspur afirma que produz dez vezes mais tokens com o mesmo investimento. Para avaliar essa relação, é preciso conhecer a referência de comparação, a carga de trabalho e quais custos entram na conta. A afirmação não significa que o HC2000 alcance a latência por usuário anunciada para o SD200 Ultra. 18
20
Os relatos publicados descrevem os aceleradores do SD200 Ultra como produzidos na China, mas não identificam o fornecedor. Antes de decidir pela compra de qualquer um dos sistemas, vale pedir a identificação dos chips e detalhes do suporte de software, além de testes reproduzíveis com os modelos que serão usados. Esses testes devem fixar precisão numérica, tamanho do contexto e número de usuários simultâneos, medindo tempo até o primeiro token, produção sustentada de tokens, consumo de energia e custo total. Sem essas condições, os números do lançamento não permitem prever com segurança o resultado em uma implantação real. 1
3
18
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A Inspur anunciou o SD200 Ultra com 128 aceleradores de IA e afirma que ele executa o Kimi K3, de 2,8 trilhões de parâmetros, com menos de 5,85 ms por token gerado.
A Inspur anunciou o SD200 Ultra com 128 aceleradores de IA e afirma que ele executa o Kimi K3, de 2,8 trilhões de parâmetros, com menos de 5,85 ms por token gerado. O HC2000 mira a produção de mais tokens por investimento, não necessariamente a menor latência para um usuário.