Nos testes do AgentX, a Nvidia foi até aproximadamente 5 vezes mais eficiente em custo que a AMD no GLM 5.3, a 150 tokens de saída por segundo por usuário, e teve mais de 20 vezes o desempenho no Qwen 3.5, a 90 tokens... A vantagem resultou da combinação entre capacidade de memória, alto reaproveitamento do cache de...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
O benchmark AgentX 1.0, da SemiAnalysis, indica que o hardware da Nvidia combinado ao ecossistema CUDA e às ferramentas de serving ainda mantém uma vantagem expressiva em cargas realistas de agentes de programação com contexto longo. Nas configurações testadas com SGLang, a diferença chegou a aproximadamente 5 vezes mais eficiência de custo para a Nvidia no GLM 5.3 e a mais de 20 vezes em desempenho no Qwen 3.5, em um alvo declarado de 90 tokens de saída por segundo por usuário. 26
É um resultado relevante, mas não uma classificação universal da Nvidia acima da AMD. O AgentX mede uma combinação específica de modelo, acelerador, runtime, carga de trabalho, concorrência e meta de responsividade. O MI355X da AMD, especialmente quando usado com o mecanismo de serving ATOM, apresentou resultados competitivos em configurações selecionadas, e atualizações de software mudaram a ordem de alguns sistemas. 14
O AgentX 1.0 faz parte da suíte de benchmarks InferenceX v3, da SemiAnalysis. Diferentemente dos testes convencionais, que usam comprimentos fixos de entrada e saída, ele reproduz tráfego de agentes de programação em múltiplas rodadas, com contextos muito extensos — em alguns cenários, próximos de 1 milhão de tokens. 13
O conjunto da versão 1.0 contém 393 sessões anônimas e opt-in do Claude Code. Para serem incluídas, as sessões precisavam ter pelo menos 20 solicitações. O processamento removeu pedidos duplicados, algumas chamadas específicas do cliente e entradas reconstruídas com mais de 990 mil tokens. A solicitação mediana tinha 142 mil tokens de entrada e 444 tokens de saída, e 44% das sessões incluíam subagentes. 8
Esse padrão é importante porque agentes de programação reenviam repetidamente versões atualizadas de uma conversa extensa ou de uma base de código. Assim, o benchmark avalia mais a capacidade de manter um serviço interativo sob pressão do que o desempenho de um único prompt longo seguido por uma resposta longa.
A liderança mais clara da Nvidia apareceu nas comparações com configurações amplamente disponíveis do SGLang:
Esses números devem ser interpretados como comparações em pontos específicos de operação, e não como uma nota única para toda uma linha de produtos. O InferenceX compara plataformas em níveis definidos de interatividade e calcula o custo a partir do envelope de serving observado para cada sistema. 79
Na prática, isso significa que um teste de comprimento fixo, como uma entrada de 8 mil tokens e uma saída de 1 mil tokens, pode deixar de fora gargalos decisivos no tráfego de agentes. Um acelerador pode parecer competitivo em throughput isolado e ainda ficar para trás quando precisa manter muitos contextos grandes, parcialmente repetidos, responsivos ao mesmo tempo.
As cargas do AgentX reutilizam grande parte do contexto de uma solicitação para a seguinte. A SemiAnalysis descreve taxas de acerto do cache de prefixo, ou KV cache, frequentemente acima de 95% nesses rastros de uso agentivo. 1
Isso altera o equilíbrio entre prefill e decodificação. O sistema não processa um prompt completamente novo a cada chamada; ele mantém e amplia estados grandes já armazenados em cache enquanto gera respostas relativamente curtas. Guardar, localizar, transferir e reutilizar esses estados passa a ser essencial para o throughput e o custo.
A capacidade utilizável de memória de alta largura de banda determina quanto do estado do KV cache pode permanecer no acelerador. Quando o conjunto de trabalho ultrapassa a memória disponível no dispositivo, o sistema pode precisar mover dados para a memória do host ou administrar o cache por um caminho mais lento. 1
O uso da memória do host permite atender mais sessões, mas acrescenta custos de largura de banda e latência. Uma plataforma que mantém uma parcela maior do cache ativo na memória do acelerador — ou que administra sua movimentação de forma mais eficiente — pode preservar um nível maior de interatividade pelo mesmo custo.
A SemiAnalysis também destacou a tokenização incremental orientada por fronteiras do TensorRT-LLM. Em vez de tokenizar novamente todo o prompt que evolui a cada rodada, a abordagem identifica limites estáveis e processa apenas o material acrescentado. 1
Essa otimização é especialmente relevante para agentes de programação: as solicitações podem carregar contextos enormes, mas gerar apenas algumas centenas de tokens. Nesse cenário, o pré-processamento no CPU e a tokenização repetida podem representar uma parcela significativa do custo de serving.
A lição mais ampla é que a relação entre preço e desempenho na inferência depende de hardware × runtime × modelo × carga de trabalho × meta de latência. FLOPS, largura de banda da memória ou um único número de throughput não contam toda a história.
O AgentX não mostrou uma vitória ampla e irrestrita da Nvidia. A SemiAnalysis registrou vitórias ou quase paridade da AMD em combinações específicas de modelo, throughput e mecanismo, especialmente com o MI355X associado ao mecanismo de serving ATOM. 1
A telemetria separa os resultados do MI355X com ATOM, SGLang, vLLM e outras configurações. Essa distinção é fundamental: um “resultado da AMD” depende bastante do mecanismo de serving, da implementação do modelo e do nível de ajuste usado no teste. 4
O ATOM usa agendamento especializado, gerenciamento de cache e kernels direcionados aos aceleradores da AMD. Em situações nas quais o modelo e a carga se encaixam bem na configuração de memória do MI355X, essa combinação pode apresentar desempenho forte.
Em outras palavras, a AMD consegue ser altamente competitiva quando o operador aceita usar um runtime otimizado especificamente para a plataforma.
Um mecanismo especializado pode mostrar do que o hardware é capaz em condições favoráveis. Mas compradores de infraestrutura geralmente precisam de mais do que o melhor resultado de um kernel. Também contam a cobertura de modelos, a frequência de atualizações, as ferramentas, a experiência de implantação e a possibilidade de manter a operação ao longo do tempo.
A SemiAnalysis afirma que suas receitas seguem principalmente as orientações dos projetos upstream vLLM e SGLang, com o objetivo de medir configurações que os clientes conseguem implantar de forma realista, em vez de depender apenas de uma pilha criada especificamente para o benchmark. 1
Por isso, para muitos compradores interessados em AMD, a comparação mais relevante é com vLLM e SGLang upstream. O ATOM continua sendo uma evidência importante de que o hardware da AMD pode oferecer bom desempenho em um ambiente de software adequado, mas seu resultado não deve ser tratado como equivalente ao desempenho disponível em uma camada de serving upstream comum.
Essa é uma diferença de adoção e disponibilidade de software — não uma afirmação de que o ATOM seja inválido ou de que runtimes especializados não tenham valor.
O benchmark também mostra por que comparações de inferência envelhecem rapidamente. A telemetria inclui uma configuração AMD MI355X com MoRI/SGLang datada de 21 de agosto, ao lado de outras configurações da AMD medidas em datas diferentes. 4
Uma atualização de software em 21 de agosto alterou a ordem de pelo menos uma comparação. O episódio ilustra como melhorias em agendamento, kernels, movimentação de cache e suporte a modelos podem modificar a hierarquia aparente entre os hardwares em questão de dias. 14
Um trabalho anterior da SemiAnalysis sobre o MI355X com Qwen 3.5 traz um alerta semelhante: versões sucessivas do SGLang produziram ganhos substanciais de desempenho ao longo de 13 semanas. 12
Para quem compra infraestrutura, a conclusão prática é registrar a versão exata do runtime, a configuração, a quantização do modelo, a faixa de concorrência e a meta de interatividade ao comparar aceleradores. Um veredito sobre hardware sem esse contexto tende a ficar enganoso à medida que o software evolui.
O AgentX é um proxy valioso para agentes de programação com contexto longo, mas não representa todas as cargas de trabalho de produção. O conjunto vem de um corpus interno de rastros, obtido de forma voluntária, e contém 393 sessões selecionadas — não todo o tráfego de agentes corporativos. 8
Os resultados podem ser diferentes em casos como:
As TPUs do Google também não estavam presentes nesse primeiro conjunto de resultados comparativos. Portanto, o AgentX 1.0 não permite estabelecer uma conclusão de três vias entre Nvidia, AMD e Google. 1
A comparação ainda está em movimento. A SemiAnalysis indicou a Nvidia Rubin, a AMD MI455X UALoE72 e sistemas TPU mais recentes como futuras adições ou pontos de comparação. A inclusão desses sistemas pode mudar o quadro competitivo. 111
A SemiAnalysis liberou o conjunto de dados, o harness, as configurações, a telemetria e materiais relacionados sob a licença Apache 2.0. 1
A importância de longo prazo do AgentX pode estar menos em um único manchete sobre Nvidia contra AMD e mais no trabalho de engenharia que ele estimula. A SemiAnalysis informou que o AgentX já havia se tornado uma carga-alvo para mais de 70 pull requests upstream em projetos como vLLM, SGLang, TensorRT-LLM, ATOM, AITER, Dynamo, LMCache e Mooncake. 1
Isso oferece aos desenvolvedores de frameworks de serving uma forma reproduzível de otimizar para o comportamento real de agentes: alto reaproveitamento de prefixos, caches KV grandes, muitas rodadas curtas, subagentes, transferência de cache, pressão sobre o agendamento e custos de tokenização.
O AgentX reforça a tese de que o software da Nvidia e seu ecossistema de serving continuam sendo uma vantagem importante na inferência de agentes de programação com contexto longo. Nas comparações testadas com SGLang, a liderança reportada chegou a 5 vezes em eficiência de custo no GLM 5.3 e passou de 20 vezes em desempenho no Qwen 3.5, em metas específicas de interatividade. 26
Mas o benchmark não prova que a Nvidia sempre vence. O MI355X da AMD e o ATOM mostraram que é possível obter preço-desempenho competitivo ou superior em configurações específicas e desenvolvidas sob medida. Além disso, a rápida evolução dos softwares de serving pode inverter os rankings.
Para as equipes de infraestrutura, a conclusão mais útil não é escolher um vencedor com base em um único número. É reproduzir a comparação usando o próprio modelo, runtime, distribuição de contexto e meta de latência.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Nos testes do AgentX, a Nvidia foi até aproximadamente 5 vezes mais eficiente em custo que a AMD no GLM 5.3, a 150 tokens de saída por segundo por usuário, e teve mais de 20 vezes o desempenho no Qwen 3.5, a 90 tokens...
Nos testes do AgentX, a Nvidia foi até aproximadamente 5 vezes mais eficiente em custo que a AMD no GLM 5.3, a 150 tokens de saída por segundo por usuário, e teve mais de 20 vezes o desempenho no Qwen 3.5, a 90 tokens... A vantagem resultou da combinação entre capacidade de memória, alto reaproveitamento do cache de prefixo, comportamento do armazenamento em memória do host e softwares de serving, como o TensorRT LLM — não apenas das...
A AMD obteve vitórias ou paridade em configurações específicas com o MI355X e o mecanismo ATOM.