Il nuovo benchmark AA AgentPerf di Artificial Analysis è il primo test multi vendor progettato per carichi di lavoro di AI 'agentica', non per semplici chat [4]. Misura quanti agenti di codifica AI simultanei un sistema può supportare, rispettando precisi obiettivi di velocità e latenza (SLO) [4].

Create a landscape editorial hero image for this Studio Global article: What did Nvidia achieve in the first published results of Artificial Analysis's AgentPerf benchmark, what does this new benchmark measure, a. Article summary: Here are the key findings from the first published results of Artificial Analysis's **AA-AgentPerf** benchmark, announced on June 12, 2026.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "We measure real-world performance of AI accelerator systems during language model inference. ## AA-AgentPerf: The Hardware Benchmark for the Agent Era. AA-AgentPerf has been shaped" source context "AI Hardware Benchmarking & Performance Analysis" Reference image 2: visual subject "For years, co-founder and chief executive officer Jensen Huang and other higher-ups at Nvidia have
Nvidia ha appena alzato l'asticella nel mondo dell'intelligenza artificiale. I primi risultati pubblicati del nuovo benchmark AA-AgentPerf di Artificial Analysis, diffusi il 12 giugno 2026, vedono la sua piattaforma Blackwell Ultra dominare incontrastata . Ma cosa misurano esattamente questi test e perché sono così importanti?
Dimenticatevi i vecchi benchmark che si limitavano a misurare la velocità di una singola risposta. AA-AgentPerf è il primo test multi-vendor e open-source pensato specificamente per i carichi di lavoro dell'AI agentica . Invece di completare una frase, un agente AI pianifica, usa strumenti, scrive codice e corregge i propri errori, concatenando decine di chiamate al modello linguistico (LLM) in una singola sessione.
Il benchmark simula questo comportamento riproducendo traiettorie reali di agenti di programmazione, attingendo a repository pubblici in oltre 12 linguaggi. Durante il test, il sistema deve gestire un numero crescente di agenti simultanei, ognuno con finestre di contesto che si allargano e chiamate a strumenti esterni che introducono ritardi realistici . Il risultato finale non è solo un numero di "token al secondo", ma quanti agenti il sistema può supportare per megawatt, rispettando rigorosi obiettivi di servizio (SLO) su velocità e latenza
.
Sotto la lente di AgentPerf, il nuovo gioiello di casa Nvidia ha letteralmente polverizzato i record. Ecco i numeri chiave:
Questi risultati non sono frutto del caso, ma di una strategia meticolosa con cui Nvidia vuole imporre Blackwell Ultra come la piattaforma di riferimento per l'AI agentica su larga scala.
Non si tratta solo di hardware potente. Il guadagno di 20x, spiega l'azienda, è figlio di un'ottimizzazione full-stack che parte dalla progettazione congiunta di hardware e software: la tecnologia NVLink unisce 72 GPU in un unico tessuto computazionale, mentre i kernel CUDA e le librerie software (TensorRT LLM con tecniche come WideEP/DeepEP, DeepGEMM e MoE fuso) sovrappongono comunicazione e calcolo per mantenere alta l'efficienza anche con migliaia di sessioni agentiche simultanee .
Con AgentPerf, Nvidia estende il suo domino sui benchmark a una nuova dimensione. Aveva già stabilito record nell'inferenza con MLPerf Inference v5.1 (con un throughput 1,4x superiore su DeepSeek-R1 rispetto a Blackwell) e spazzato via la concorrenza in tutti e sette i test di MLPerf Training v5.1
. Ora aggiunge il tassello dell'AI agentica.
Per dare ulteriore concretezza, l'azienda cita partner come Together AI (che alimenta l'agente di programmazione di Cursor) e DeepInfra, che già eseguono carichi di lavoro agentici su Blackwell, dimostrando che la piattaforma è pronta per la produzione . Infine, lo sguardo è già al futuro: il blog ufficiale menziona la prossima architettura Vera Rubin, attualmente in produzione, come prossimo salto evolutivo per la capacità dell'AI agentica
.
In un mercato sempre più competitivo, Nvidia dimostra che la sfida non si vince solo con la potenza bruta, ma con la capacità di orchestrare un ecosistema di silicio, software e partner per risolvere i problemi del domani.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Il nuovo benchmark AA AgentPerf di Artificial Analysis è il primo test multi vendor progettato per carichi di lavoro di AI 'agentica', non per semplici chat [4].
Il nuovo benchmark AA AgentPerf di Artificial Analysis è il primo test multi vendor progettato per carichi di lavoro di AI 'agentica', non per semplici chat [4]. Misura quanti agenti di codifica AI simultanei un sistema può supportare, rispettando precisi obiettivi di velocità e latenza (SLO) [4].
La piattaforma Nvidia GB300 NVL72 (Blackwell Ultra) ha raggiunto le prestazioni più elevate con il modello DeepSeek V4 Pro, gestendo 61.340 agenti simultanei [4][14].