Artificial Analysis ha publicado los primeros resultados de AA AgentPerf, el primer benchmark abierto y multi fabricante diseñado específicamente para medir el rendimiento en cargas de trabajo de IA agéntica [4]. El sistema Nvidia GB300 NVL72, basado en la arquitectura Blackwell Ultra, registró el rendimiento más al...

Create a landscape editorial hero image for this Studio Global article: What did Nvidia achieve in the first published results of Artificial Analysis's AgentPerf benchmark, what does this new benchmark measure, a. Article summary: Here are the key findings from the first published results of Artificial Analysis's **AA-AgentPerf** benchmark, announced on June 12, 2026.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "We measure real-world performance of AI accelerator systems during language model inference. ## AA-AgentPerf: The Hardware Benchmark for the Agent Era. AA-AgentPerf has been shaped" source context "AI Hardware Benchmarking & Performance Analysis" Reference image 2: visual subject "For years, co-founder and chief executive officer Jensen Huang and other higher-ups at Nvidia have
Nvidia ha vuelto a sacudir el tablero de la inteligencia artificial. Apenas unos meses después de establecer récords de rendimiento en las pruebas de inferencia y entrenamiento de MLPerf, la compañía ha logrado un nuevo hito en una categoría emergente: la IA agéntica. El 12 de junio de 2026, la firma de análisis independiente Artificial Analysis publicó los primeros resultados de su nuevo test AA-AgentPerf, y la plataforma Nvidia GB300 NVL72, con arquitectura Blackwell Ultra, dominó sin paliativos la clasificación .
Pero más allá del dato bruto, estos resultados revelan una estrategia meticulosa de Nvidia para posicionarse como el motor indispensable de una nueva era, donde las IAs no solo responden preguntas, sino que actúan, razonan y ejecutan tareas complejas de forma autónoma.
Hasta ahora, la mayoría de los benchmarks de rendimiento de hardware para IA, como el propio MLPerf, se centraban en medir la velocidad de la inferencia tradicional: la capacidad de un sistema para generar texto a partir de una sola instrucción. Pero los agentes de IA son otra historia .
Un agente de codificación, por ejemplo, no se limita a escribir una función cuando se le pide. Encadena múltiples llamadas al modelo de lenguaje, ejecuta herramientas externas, lee archivos, y mantiene un contexto que crece con cada paso. AgentPerf simula exactamente este tipo de carga de trabajo real, reproduciendo trayectorias de agentes de codificación tomadas de repositorios públicos en más de 12 lenguajes de programación. Introduce retrasos de CPU para emular las llamadas a herramientas y mide cuántos agentes simultáneos puede soportar un sistema cumpliendo con niveles estrictos de velocidad y latencia .
El objetivo ya no es generar tokens sin pensar, sino cuántos "compañeros de trabajo digitales" autónomos puede mantener activos una infraestructura sin que el servicio se degrade.
Los números del estreno de Blackwell Ultra en AgentPerf son abrumadores. Nvidia informa que su sistema GB300 NVL72, una solución a escala de rack con 72 GPUs interconectadas, logró hasta 20 veces más agentes concurrentes por megavatio en comparación con el sistema HGX H200 de la generación anterior (Hopper) .
La métrica no es casual. Al normalizar por consumo energético, Nvidia pone el foco en la dimensión que más preocupa a los grandes operadores de centros de datos: el coste operativo y la sostenibilidad de la factura eléctrica.
Según la publicación de Artificial Analysis en redes sociales, la configuración desagregada a escala de rack alcanzó un pico de 61.340 agentes concurrentes en el nivel de servicio más relajado —una velocidad de salida de 20 tokens por segundo y un tiempo hasta el primer token de 10 segundos— ejecutando el modelo DeepSeek V4 Pro, una inmensa red de mezcla de expertos (MoE) representativa de la IA de frontera .
¿Cómo se consigue un salto generacional semejante? Nvidia atribuye el 20x de mejora a una estrategia de co-diseño extremo, que integra y optimiza cada eslabón de la cadena :
Este no es un logro aislado. Los resultados de AgentPerf son la última pieza de una ofensiva coordinada que Nvidia ha orquestado desde el lanzamiento de Blackwell Ultra:
Con AgentPerf, la industria tiene por fin una vara de medir para una de las cargas de trabajo que definirá el futuro del centro de datos. Y en la primera foto oficial, Nvidia aparece sola en la cumbre, enviando un mensaje claro a hiperscaladores y empresas: quien quiera construir fábricas de agentes de IA a escala, encontrará en Blackwell Ultra la plataforma más potente y eficiente del mercado.
"La plataforma NVIDIA GB300 NVL72 obtiene el rendimiento más alto en el benchmark y ejecuta un número de agentes por megavatio hasta 20 veces mayor que el sistema NVIDIA HGX H200", resume el comunicado oficial, una frase que en la práctica se traduce en una ventaja competitiva sideral para la próxima gran carrera de la inteligencia artificial .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Artificial Analysis ha publicado los primeros resultados de AA AgentPerf, el primer benchmark abierto y multi fabricante diseñado específicamente para medir el rendimiento en cargas de trabajo de IA agéntica [4].
Artificial Analysis ha publicado los primeros resultados de AA AgentPerf, el primer benchmark abierto y multi fabricante diseñado específicamente para medir el rendimiento en cargas de trabajo de IA agéntica [4]. El sistema Nvidia GB300 NVL72, basado en la arquitectura Blackwell Ultra, registró el rendimiento más alto de todos, ejecutando hasta 20 veces más agentes por megavatio que la generación anterior Hopper (H200) [4].
La prueba, que simula agentes de codificación reales usando el modelo DeepSeek V4 Pro, midió un máximo de 61.340 agentes concurrentes en la configuración de servicio más laxa [14].