O que mede o AgentPerf: o primeiro benchmark multi vendor e aberto focado em cargas de trabalho de IA agêntica — não apenas chats simples [4]. Resultados da Nvidia: a plataforma GB300 NVL72 (Blackwell Ultra) foi a campeã no teste com o modelo DeepSeek V4 Pro, largamente usado em agentes de IA de ponta [4], atingindo...

Create a landscape editorial hero image for this Studio Global article: What did Nvidia achieve in the first published results of Artificial Analysis's AgentPerf benchmark, what does this new benchmark measure, a. Article summary: Here are the key findings from the first published results of Artificial Analysis's **AA-AgentPerf** benchmark, announced on June 12, 2026.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "We measure real-world performance of AI accelerator systems during language model inference. ## AA-AgentPerf: The Hardware Benchmark for the Agent Era. AA-AgentPerf has been shaped" source context "AI Hardware Benchmarking & Performance Analysis" Reference image 2: visual subject "For years, co-founder and chief executive officer Jensen Huang and other higher-ups at Nvidia have
No dia 12 de junho de 2026, a Artificial Analysis divulgou os primeiros resultados do AA-AgentPerf, um novo marco na avaliação de hardware para inteligência artificial. Diferente dos testes tradicionais que medem respostas de chatbots, este benchmark é o primeiro da indústria a focar no que realmente importa para o futuro: cargas de trabalho de IA agêntica . E o resultado foi um show de superioridade da Nvidia com sua plataforma Blackwell Ultra.
O AA-AgentPerf não se resume a gerar texto rapidamente. Ele foi criado para simular o comportamento real de um exército de agentes de IA autônomos, como assistentes de programação que trabalham em tarefas complexas .
Para isso, o benchmark:
Os resultados são normalizados por acelerador e, crucialmente, por megawatt, colocando a eficiência energética no centro da discussão .
A primeira rodada usou como carga de trabalho o modelo DeepSeek V4 Pro, uma arquitetura de mistura de especialistas (MoE) representativa dos modelos de fronteira que impulsionam os agentes mais capazes da atualidade .
Nesse teste, a Nvidia GB300 NVL72 não apenas ficou em primeiro lugar. Ela redefiniu os limites da categoria.
| Plataforma | Agentes por Megawatt (SLO: 20 tokens/s, 10s TTFT) |
|---|---|
| GB300 (rack-scale, desagregado) | 61.354 |
| B300 (nó único, desagregado) | 21.053 |
| MI355X | 3.551 |
| H200 | 2.594 |
A superioridade é tão brutal que a Nvidia faz questão de comparar o novo sistema com sua própria geração anterior: o Blackwell Ultra roda até 20 vezes mais agentes por megawatt que o H200 (Hopper), tanto no nível de serviço de 20 tokens/s quanto no mais exigente de 60 tokens/s .
Este resultado é a cereja do bolo de uma campanha meticulosamente orquestrada para posicionar o Blackwell Ultra como a plataforma definitiva para IA agêntica em escala. A estratégia se apoia em quatro pilares principais.
A Nvidia atribui o ganho de 20x ao que chama de co-design extremo. Não é apenas uma GPU mais rápida, é um sistema pensado de ponta a ponta:
A vitória no AgentPerf não é um caso isolado. Ela amplia um domínio que já havia sido demonstrado nos testes tradicionais do MLPerf:
Para mostrar que não se trata apenas de números de laboratório, a Nvidia destaca que parceiros como Together AI (que alimenta o agente de codificação do Cursor) e DeepInfra (que impulsiona a força de trabalho de IA da Pam.ai) já estão rodando cargas de trabalho agênticas no Blackwell . Isso posiciona o hardware como pronto para produção, não apenas forte em benchmarks.
O blog da empresa já prepara o terreno para o futuro, anunciando que a arquitetura de próxima geração Vera Rubin entrou em produção e será o próximo passo para a capacidade de IA agêntica . As notas técnicas do AgentPerf já projetam novos saltos com os 50 PFLOPs de desempenho em NVFP4 e a aceleração de chamada de ferramentas dos LLMs
.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
O que mede o AgentPerf: o primeiro benchmark multi vendor e aberto focado em cargas de trabalho de IA agêntica — não apenas chats simples [4].
O que mede o AgentPerf: o primeiro benchmark multi vendor e aberto focado em cargas de trabalho de IA agêntica — não apenas chats simples [4]. Resultados da Nvidia: a plataforma GB300 NVL72 (Blackwell Ultra) foi a campeã no teste com o modelo DeepSeek V4 Pro, largamente usado em agentes de IA de ponta [4], atingindo 61.340 agentes simultâneos na meta de serv...
Eficiência energética recorde: o Blackwell Ultra rodou até 20 vezes mais agentes por megawatt em comparação com sistemas da geração anterior (H200), tanto na meta de 20 tokens/s quanto na de 60 tokens/s [4].