Os resultados são normalizados por acelerador e, crucialmente, por megawatt, colocando a eficiência energética no centro da discussão .
A primeira rodada usou como carga de trabalho o modelo DeepSeek V4 Pro, uma arquitetura de mistura de especialistas (MoE) representativa dos modelos de fronteira que impulsionam os agentes mais capazes da atualidade .
Nesse teste, a Nvidia GB300 NVL72 não apenas ficou em primeiro lugar. Ela redefiniu os limites da categoria.
| Plataforma | Agentes por Megawatt (SLO: 20 tokens/s, 10s TTFT) |
|---|---|
| GB300 (rack-scale, desagregado) | 61.354 |
| B300 (nó único, desagregado) | 21.053 |
| MI355X | 3.551 |
| H200 | 2.594 |
A superioridade é tão brutal que a Nvidia faz questão de comparar o novo sistema com sua própria geração anterior: o Blackwell Ultra roda até 20 vezes mais agentes por megawatt que o H200 (Hopper), tanto no nível de serviço de 20 tokens/s quanto no mais exigente de 60 tokens/s .
Este resultado é a cereja do bolo de uma campanha meticulosamente orquestrada para posicionar o Blackwell Ultra como a plataforma definitiva para IA agêntica em escala. A estratégia se apoia em quatro pilares principais.
A Nvidia atribui o ganho de 20x ao que chama de co-design extremo. Não é apenas uma GPU mais rápida, é um sistema pensado de ponta a ponta:
A vitória no AgentPerf não é um caso isolado. Ela amplia um domínio que já havia sido demonstrado nos testes tradicionais do MLPerf:
Para mostrar que não se trata apenas de números de laboratório, a Nvidia destaca que parceiros como Together AI (que alimenta o agente de codificação do Cursor) e DeepInfra (que impulsiona a força de trabalho de IA da Pam.ai) já estão rodando cargas de trabalho agênticas no Blackwell . Isso posiciona o hardware como pronto para produção, não apenas forte em benchmarks.
O blog da empresa já prepara o terreno para o futuro, anunciando que a arquitetura de próxima geração Vera Rubin entrou em produção e será o próximo passo para a capacidade de IA agêntica . As notas técnicas do AgentPerf já projetam novos saltos com os 50 PFLOPs de desempenho em NVFP4 e a aceleração de chamada de ferramentas dos LLMs
.