Artificial Analysis har lanserat AA AgentPerf, branschens första öppna benchmark för multi agent AI inferens, och de första resultaten publicerades den 12 juni 2026 [4]. Nvidias GB300 NVL72 (Blackwell Ultra) levererade högst prestanda med modellen DeepSeek V4 Pro och hanterade 20 gånger fler samtidiga agenter per me...

Create a landscape editorial hero image for this Studio Global article: What did Nvidia achieve in the first published results of Artificial Analysis's AgentPerf benchmark, what does this new benchmark measure, a. Article summary: Here are the key findings from the first published results of Artificial Analysis's **AA-AgentPerf** benchmark, announced on June 12, 2026.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "We measure real-world performance of AI accelerator systems during language model inference. ## AA-AgentPerf: The Hardware Benchmark for the Agent Era. AA-AgentPerf has been shaped" source context "AI Hardware Benchmarking & Performance Analysis" Reference image 2: visual subject "For years, co-founder and chief executive officer Jensen Huang and other higher-ups at Nvidia have
AA-AgentPerf är den första öppna, leverantörsoberoende hårdvarubenchmarken som är särskilt utformad för agentiska AI-inferensarbetsbelastningar – alltså inte traditionella enstaka chattkompletteringar .
Benchmarket mäter hur många samtidiga AI-kodningsagenter ett inferenssystem kan understödja samtidigt som det uppfyller definierade servicenivåmål (SLO:er) för output-token-hastighet och time-to-first-token (TTFT). Underlaget kommer från verkliga kodningsagentbanor hämtade från publika repositories i över 12 programmeringsspråk. Dessa banor kedjar samman flera LLM-anrop, verktygsanrop (simulerade med representativa CPU-fördröjningar) och växande kontextfönster . Resultaten normaliseras både per accelerator och per megawatt
.
AgentPerf är alltså ett försök att gå bortom syntetiska enstaka frågor och i stället mäta hur infrastrukturen presterar under den typ av komplexa, mångstegsarbetsbelastningar som kännetecknar agent-AI i praktiken.
Den 12 juni 2026 publicerade Artificial Analysis de första resultaten från AgentPerf. Nvidia dominerade testet på flera punkter:
För perspektiv: I samma test nådde en enskild B300-nod (disaggregerad) 21 053 agenter per megawatt, medan AMD:s MI355X nådde 3 551 och föregående generation H200 stannade på 2 594 .
Dessa resultat är inte en isolerad händelse. De är en del av en medveten, mångsidig satsning för att etablera Blackwell Ultra som den definitiva plattformen för storskalig agent-AI:
Nvidia tillskriver den stora prestandaökningen till extrem samdesign: NVLink skalar upp och knyter samman 72 GPU:er i ett enhetligt tyg, CUDA-kärnor överlappar kommunikation och beräkning för MoE-modeller, och TensorRT LLM-optimeringar (WideEP/DeepEP, DeepGEMM, fused MoE) upprätthåller effektiviteten även när antalet samtidiga agentsessioner ökar kraftigt .
AgentPerf lägger till en agentdimension till Nvidias redan breda svit av MLPerf-resultat. I MLPerf Inference v5.1 satte Blackwell Ultra rekord med 1,4 gånger högre DeepSeek-R1-genomströmning jämfört med Blackwell . I MLPerf Training v5.1 sopade Nvidia hem alla sju benchmarktesterna och satte bland annat nytt rekord för Llama 3.1 405B-förträning med 10 minuter på 5 120 Blackwell-GPU:er
.
För att visa att plattformen är produktionsredo, inte bara benchmarkstark, lyfter Nvidia fram att partners som Together AI (som driver Cursors agentiska kodning) och DeepInfra (som driver Pam.ai:s AI-arbetsstyrka) redan kör agentarbetsbelastningar på Blackwell . Detta är tydliga signaler till marknaden att hårdvaran är redo för skarp drift.
Blogginlägget antyder också nästa steg: nästa generations Vera Rubin-arkitektur, som nu är i produktion, utlovas bli nästa språng för agent-AI-kapacitet . Den tekniska djupdykningen nämner förväntade förbättringar från 50 PFLOPS NVFP4-beräkningskraft och förbättrad acceleration av LLM-verktygsanrop
.
För svenska företag och organisationer som bygger eller planerar att bygga agentbaserade AI-tjänster – från kodassistenter till autonoma arbetsflöden – är riktningen tydlig. Energieffektivitet per agentuppgift blir en allt viktigare måttstock, särskilt i en svensk kontext där hållbarhetskrav och elpriser gör effekt per megawatt till en direkt ekonomisk faktor. Att infrastruktur nu kan hantera tiotusentals samtidiga agenter med bibehållen svarstid öppnar för helt nya tillämpningar i produktionsskala.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Artificial Analysis har lanserat AA AgentPerf, branschens första öppna benchmark för multi agent AI inferens, och de första resultaten publicerades den 12 juni 2026 [4].
Artificial Analysis har lanserat AA AgentPerf, branschens första öppna benchmark för multi agent AI inferens, och de första resultaten publicerades den 12 juni 2026 [4]. Nvidias GB300 NVL72 (Blackwell Ultra) levererade högst prestanda med modellen DeepSeek V4 Pro och hanterade 20 gånger fler samtidiga agenter per megawatt jämfört med H200 systemet [4].
I den enklaste servicenivån (20 tokens/s, 10s TTFT) nådde en rack skala konfiguration hela 61 340 samtidiga agenter [14].