En las pruebas de AgentX, Nvidia fue hasta cinco veces más eficiente en costes que AMD con GLM 5.3 a 150 tokens de salida por segundo y usuario, y superó en más de 20 veces el rendimiento con Qwen 3.5 a 90 tokens por... La ventaja surgió de la combinación de capacidad de memoria, reutilización de la caché de prefijo...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
El benchmark AgentX 1.0 de SemiAnalysis sugiere que el hardware de Nvidia y su ecosistema de serving centrado en CUDA mantienen una ventaja considerable en cargas realistas de agentes de programación con contexto largo. En las configuraciones probadas con SGLang, la diferencia llegó a ser de hasta cinco veces más eficiencia de costes para Nvidia con GLM 5.3 y de más de 20 veces más rendimiento con Qwen 3.5, tomando como referencia un objetivo declarado de 90 tokens de salida por segundo y usuario. 26
Es un resultado importante, pero no equivale a una clasificación universal de Nvidia por encima de AMD. AgentX mide una combinación concreta de modelo, acelerador, runtime, carga de trabajo, concurrencia y objetivo de capacidad de respuesta. La MI355X de AMD y su motor ATOM también ofrecieron resultados competitivos en determinadas configuraciones, y algunas actualizaciones de software cambiaron el orden de los sistemas. 14
AgentX 1.0 forma parte de la suite de benchmarks InferenceX v3 de SemiAnalysis. A diferencia de las pruebas convencionales, basadas en longitudes fijas de entrada y salida, reproduce tráfico de agentes de programación con múltiples turnos y contextos muy extensos, incluidos escenarios cercanos al millón de tokens. 13
El conjunto de datos de la versión 1.0 contiene 393 sesiones anonimizadas y voluntarias de Claude Code. Las sesiones elegibles debían incluir al menos 20 solicitudes. El procesamiento eliminó solicitudes duplicadas, determinadas llamadas específicas del cliente y entradas reconstruidas de más de 990.000 tokens. La solicitud mediana contenía 142.000 tokens de entrada y 444 tokens de salida, y el 44 % de las sesiones incluía subagentes. 8
Este patrón importa porque los agentes de programación envían repetidamente versiones actualizadas de una conversación o una base de código extensa. Por eso, el benchmark pone el foco en un servicio interactivo sostenido, no en un único prompt largo seguido de una respuesta extensa.
La diferencia más clara a favor de Nvidia apareció en comparaciones realizadas con configuraciones de SGLang ampliamente disponibles:
Estas cifras deben interpretarse como comparaciones en puntos operativos concretos, no como una puntuación única para toda una familia de productos. InferenceX compara las plataformas en niveles específicos de interactividad y calcula el coste a partir del entorno de serving observado en cada una. 79
La consecuencia práctica es que un benchmark de longitud fija —por ejemplo, con 8.000 tokens de entrada y 1.000 de salida— puede pasar por alto cuellos de botella decisivos en el tráfico de agentes. Un acelerador puede parecer competitivo en rendimiento aislado y quedarse atrás cuando debe mantener simultáneamente muchos contextos grandes, parcialmente repetidos, con una respuesta ágil.
Las cargas de AgentX reutilizan buena parte del contexto entre una solicitud y la siguiente. SemiAnalysis describe tasas de acierto de la caché de prefijo o de la caché KV que a menudo superan el 95 % en estas trazas de agentes. 1
Esto modifica el equilibrio entre el procesamiento inicial del prompt —prefill— y la generación de tokens —decode—. El sistema no procesa continuamente una solicitud completamente nueva: mantiene y amplía estados grandes almacenados en caché mientras produce respuestas relativamente cortas. Guardar, localizar, transferir y reutilizar esos estados se vuelve fundamental para el rendimiento y el coste.
La capacidad utilizable de la memoria de alto ancho de banda determina cuánto estado de la caché KV puede permanecer en el acelerador. Cuando el conjunto de trabajo supera la memoria disponible del dispositivo, el sistema puede tener que trasladar datos a la memoria del sistema o gestionar la caché mediante una ruta más lenta. 1
La descarga a memoria del host permite ampliar el número de sesiones que una plataforma puede soportar, pero introduce costes de ancho de banda y latencia. Una plataforma que conserve más caché activa en el acelerador —o que gestione su movimiento con mayor eficiencia— puede mantener una mejor interactividad con el mismo presupuesto.
SemiAnalysis destacó además la tokenización incremental sensible a los límites de TensorRT-LLM. En lugar de tokenizar una y otra vez todo el prompt cambiante, este enfoque identifica límites estables y procesa únicamente el material añadido. 1
La optimización es especialmente relevante para los agentes de programación: pueden recibir contextos enormes y generar solo unos cientos de tokens. En ese escenario, el preprocesamiento en la CPU y la tokenización repetida pueden representar una parte significativa del coste del servicio.
La lección general es que la relación entre precio y rendimiento de la inferencia depende de hardware × runtime × modelo × carga de trabajo × objetivo de latencia. Los FLOPS, el ancho de banda de memoria o una cifra aislada de rendimiento no bastan para explicar el resultado.
AgentX no mostró una victoria absoluta de Nvidia. SemiAnalysis informó de victorias o resultados cercanos a la paridad para AMD en determinadas combinaciones de modelo, rendimiento y motor, especialmente con la MI355X acompañada del motor de serving ATOM de AMD. 1
La telemetría separa los resultados de la MI355X con ATOM, SGLang, vLLM y otras configuraciones. La distinción es esencial: un “resultado de AMD” depende en gran medida del motor de serving, la implementación del modelo y la optimización empleados en la prueba. 4
La planificación especializada de ATOM, su gestión de caché y sus kernels orientados a AMD pueden rendir muy bien cuando el modelo y la carga encajan con la configuración de memoria de la MI355X. Dicho de otro modo, AMD puede ser muy competitiva cuando el operador está dispuesto a utilizar un runtime optimizado específicamente para su plataforma.
Un motor especializado puede demostrar hasta dónde llega un hardware en condiciones favorables. Sin embargo, los compradores de infraestructura suelen necesitar algo más que el mejor resultado de un kernel. También necesitan cobertura de modelos, ritmo de actualizaciones, herramientas, experiencia de despliegue y una operación que puedan mantener a largo plazo.
SemiAnalysis afirma que sus recetas siguen principalmente las recomendaciones de los proyectos upstream vLLM y SGLang para medir configuraciones que los clientes puedan desplegar de forma realista, en lugar de depender únicamente de una pila diseñada para el benchmark. 1
Por eso, para muchos posibles compradores de AMD, la comparación más relevante es la de vLLM y SGLang upstream. ATOM sigue siendo una prueba importante de que el hardware de AMD puede ofrecer un rendimiento sólido en un entorno de software adecuado, pero su resultado no debe considerarse intercambiable con el rendimiento disponible mediante una capa de serving común y ampliamente adoptada.
La diferencia tiene que ver con la adopción y la disponibilidad del software; no implica que ATOM sea inválido ni que los runtimes especializados carezcan de valor.
El benchmark también muestra por qué las comparaciones de inferencia envejecen rápidamente. La telemetría incluye una configuración de AMD MI355X con MoRI/SGLang fechada el 21 de agosto, junto con otras configuraciones de AMD medidas en fechas diferentes. 4
Una actualización del 21 de agosto cambió el orden de al menos una comparación. El episodio ilustra cómo las mejoras en planificación, kernels, movimiento de caché o compatibilidad con modelos pueden alterar la jerarquía aparente del hardware en cuestión de días. 14
El trabajo anterior de SemiAnalysis sobre la MI355X con Qwen 3.5 ofrece una advertencia similar: varias versiones sucesivas de SGLang produjeron mejoras sustanciales de rendimiento durante un periodo de 13 semanas. 12
Para los compradores, la conclusión práctica es registrar siempre la versión exacta del runtime, la configuración, la cuantización del modelo, el rango de concurrencia y el objetivo de interactividad. Un veredicto sobre el hardware sin ese contexto puede quedar desfasado en cuanto mejore el software de serving.
AgentX es un indicador valioso para los agentes de programación con contexto largo, pero no representa todas las cargas de producción. El conjunto de datos procede de un corpus interno de trazas voluntarias y contiene 393 sesiones seleccionadas, no todo el tráfico de agentes empresariales. 8
Los resultados pueden ser diferentes en:
Además, las TPU de Google no aparecen en este primer conjunto de resultados comparativos, por lo que AgentX 1.0 no permite establecer una conclusión a tres bandas entre Nvidia, AMD y Google. 1
La comparación también está en movimiento. SemiAnalysis señaló a Nvidia Rubin, AMD MI455X UALoE72 y nuevas generaciones de TPU como futuras incorporaciones o próximos puntos de comparación. Su inclusión podría cambiar el panorama competitivo. 111
SemiAnalysis publicó el conjunto de datos, el arnés de pruebas, las configuraciones, la telemetría y materiales relacionados bajo la licencia Apache 2.0. 1
La importancia a largo plazo de AgentX quizá no resida tanto en un único titular sobre Nvidia y AMD como en el trabajo de ingeniería que está impulsando. SemiAnalysis informó de que AgentX ya se había convertido en una carga objetivo para más de 70 pull requests en proyectos como vLLM, SGLang, TensorRT-LLM, ATOM, AITER, Dynamo, LMCache y Mooncake. 1
Esto proporciona a los desarrolladores de frameworks de serving una forma reproducible de optimizar para el comportamiento real de los agentes: alta reutilización del prefijo, grandes cachés KV, muchos turnos breves, subagentes, transferencias de caché, presión sobre la planificación y sobrecostes de tokenización.
AgentX refuerza la idea de que el software y el ecosistema de serving de Nvidia siguen siendo una ventaja importante en la inferencia para agentes de programación con contexto largo. En las comparaciones probadas con SGLang, la ventaja de Nvidia llegó a cinco veces más eficiencia de costes con GLM 5.3 y a más de 20 veces el rendimiento con Qwen 3.5 en un objetivo de interactividad determinado. 26
Pero el benchmark no demuestra que Nvidia gane siempre. La MI355X de AMD y ATOM mostraron que es posible lograr una relación precio-rendimiento competitiva o superior en configuraciones seleccionadas y diseñadas específicamente para ello, mientras que las mejoras rápidas del software pueden invertir los rankings.
Para los equipos de infraestructura, la conclusión más útil no es elegir un ganador a partir de una sola cifra, sino repetir la comparación con su propio modelo, runtime, distribución de contextos y objetivo de latencia.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
En las pruebas de AgentX, Nvidia fue hasta cinco veces más eficiente en costes que AMD con GLM 5.3 a 150 tokens de salida por segundo y usuario, y superó en más de 20 veces el rendimiento con Qwen 3.5 a 90 tokens por...
En las pruebas de AgentX, Nvidia fue hasta cinco veces más eficiente en costes que AMD con GLM 5.3 a 150 tokens de salida por segundo y usuario, y superó en más de 20 veces el rendimiento con Qwen 3.5 a 90 tokens por... La ventaja surgió de la combinación de capacidad de memoria, reutilización de la caché de prefijo, gestión de la descarga a memoria del sistema y software de inferencia como TensorRT LLM, no solo de las especificacion...
La MI355X de AMD y el motor ATOM lograron victorias puntuales o resultados casi igualados; para la mayoría de los compradores, las mediciones con vLLM y SGLang son una referencia más práctica que un motor especializado.