Platforma Nvidia GB300 NVL72 (Blackwell Ultra) osiągnęła najwyższą wydajność w pierwszej rundzie testów AA AgentPerf, nowego benchmarku dla agentowej AI od Artificial Analysis [4]. W teście z modelem DeepSeek V4 Pro system dostarczył nawet 20 razy więcej współbieżnych agentów na megawat w porównaniu do poprzedniej g...

Create a landscape editorial hero image for this Studio Global article: What did Nvidia achieve in the first published results of Artificial Analysis's AgentPerf benchmark, what does this new benchmark measure, a. Article summary: Here are the key findings from the first published results of Artificial Analysis's **AA-AgentPerf** benchmark, announced on June 12, 2026.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "We measure real-world performance of AI accelerator systems during language model inference. ## AA-AgentPerf: The Hardware Benchmark for the Agent Era. AA-AgentPerf has been shaped" source context "AI Hardware Benchmarking & Performance Analysis" Reference image 2: visual subject "For years, co-founder and chief executive officer Jensen Huang and other higher-ups at Nvidia have
Laboratorium analityczne Artificial Analysis opublikowało właśnie pierwsze wyniki swojego przełomowego testu wydajności – AA-AgentPerf. To zupełnie nowa kategoria benchmarku, która nie skupia się już na prostych, jednoetapowych odpowiedziach chatbota, lecz mierzy zdolność infrastruktury do obsługi złożonych, wieloetapowych zadań charakterystycznych dla tak zwanej agentowej AI. A premierowe rezultaty nie pozostawiają złudzeń: nowa architektura Nvidii, Blackwell Ultra, zmiata z planszy wszystko, co było przed nią .
Do tej pory branżowe benchmarki, takie jak MLPerf, koncentrowały się głównie na szybkości generowania pojedynczych odpowiedzi (tzw. single-turn inference). AgentPerf idzie o krok dalej. Mierzy on, jak wiele współbieżnych, autonomicznych agentów AI – na przykład asystentów programistycznych – może jednocześnie obsłużyć dany system, spełniając przy tym rygorystyczne cele wydajnościowe (ang. Service-Level Objectives, SLO), takie jak minimalna prędkość generowania tekstu i maksymalny czas do uzyskania pierwszego tokena (TTFT) .
Jak to działa w praktyce? Benchmark odtwarza rzeczywiste, złożone sekwencje działań agentów programistycznych, zaczerpnięte z publicznych repozytoriów kodu w ponad 12 językach programowania. Pojedyncze zadanie agenta to nie jedno, a seria zapytań do modelu językowego (LLM), symulowanych wywołań zewnętrznych narzędzi (z realistycznymi opóźnieniami procesora) i stale rosnące okno kontekstowe . Wyniki są normalizowane, aby pokazać wydajność na jeden akcelerator oraz – co kluczowe z punktu widzenia ekonomii i ekologii centrów danych – na jedną megawatogodzinę (MWh) zużytej energii. W pierwszej rundzie testów użyto modelu DeepSeek V4 Pro, dużego modelu klasy Mixture-of-Experts (MoE), reprezentatywnego dla dzisiejszych najbardziej zaawansowanych agentów
.
W teście z modelem DeepSeek V4 Pro, platforma Nvidia GB300 NVL72, będąca sercem architektury Blackwell Ultra, osiągnęła „najwyższą wydajność spośród wszystkich testowanych platform” . Przewaga nad poprzednią generacją jest kolosalna:
Te liczby to nie tylko sucha statystyka – to dowód, że architektura Nvidii potrafi obsłużyć całe rzesze cyfrowych pracowników przy radykalnie niższym śladzie energetycznym, co bezpośrednio przekłada się na koszty operacyjne firm wdrażających agentową AI.
Te spektakularne wyniki w AgentPerf nie są dziełem przypadku. To część szeroko zakrojonej strategii Nvidii, która pozycjonuje Blackwell Ultra jako platformę numer jeden dla skalowalnej, komercyjnej agentowej AI.
1. Opowieść o pełnej optymalizacji stosu (full-stack)
Nvidia przypisuje 20-krotny wzrost wydajności ekstremalnej koordynacji sprzętu i oprogramowania. Kluczowe elementy to:
2. Dominacja na wszystkich frontach benchmarków
AgentPerf to najnowszy dodatek do rosnącej kolekcji testów, w której Blackwell Ultra już wcześniej ustanawiał rekordy. W testach MLPerf Inference v5.1 platforma osiągnęła 1,4-krotnie większą przepustowość dla modelu DeepSeek-R1 niż Blackwell poprzedniej generacji , a w MLPerf Training v5.1 zmiażdżyła konkurencję, wygrywając wszystkie siedem testów treningowych
. Łącznie daje to Nvidii 291 zwycięstw w historii MLPerf – dziewięć razy więcej niż wszyscy pozostali uczestnicy razem wzięci
.
3. Dowody z ekosystemu, nie tylko z laboratorium
Nvidia podkreśla, że Blackwell to nie tylko „bestia benchmarkowa”, ale platforma gotowa do wdrożeń produkcyjnych. Partnerzy tacy jak Together AI (zasilający agentowe kodowanie w edytorze Cursor) i DeepInfra (wspierający cyfrową siłę roboczą Pam.ai) już teraz uruchamiają na niej komercyjne obciążenia agentowe .
4. Wizja przyszłości: Vera Rubin i dalsza droga
Nvidia nie spoczywa na laurach. W oficjalnym blogu firma wyraźnie zapowiada, że kolejnym krokiem w zwiększaniu mocy dla agentowej AI będzie architektura nowej generacji o nazwie kodowej Vera Rubin, która – jak zdradzono – jest już w produkcji . Wcześniejsze analizy techniczne wspominają o skoku do 50 PFLOPS mocy obliczeniowej w formacie NVFP4 i jeszcze lepszej akceleracji wywołań narzędzi przez modele
.
Podsumowując, premiera benchmarku AgentPerf i wyniki Nvidii to coś więcej niż kolejny wpis w tabeli rekordów. To sygnał dla całej branży, że sprzęt dojrzał do obsługi nowej generacji autonomicznych, wieloetapowych aplikacji AI – a Blackwell Ultra, z jej bezprecedensową efektywnością energetyczną, wyrasta na fundament tej transformacji.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Platforma Nvidia GB300 NVL72 (Blackwell Ultra) osiągnęła najwyższą wydajność w pierwszej rundzie testów AA AgentPerf, nowego benchmarku dla agentowej AI od Artificial Analysis [4].
Platforma Nvidia GB300 NVL72 (Blackwell Ultra) osiągnęła najwyższą wydajność w pierwszej rundzie testów AA AgentPerf, nowego benchmarku dla agentowej AI od Artificial Analysis [4]. W teście z modelem DeepSeek V4 Pro system dostarczył nawet 20 razy więcej współbieżnych agentów na megawat w porównaniu do poprzedniej generacji Nvidia HGX H200 (Hopper) [4].
W najbardziej podstawowym scenariuszu (SLO: 20 tokenów/s, 10s TTFT) konfiguracja rack scale GB300 obsłużyła aż 61 340 agentów jednocześnie, znacząco dystansując AMD MI355X (3 551 agentów) [14].