W testach SemiAnalysis Nvidia była nawet 5 razy bardziej efektywna kosztowo od AMD dla modelu GLM 5.3 przy 150 tokenach wyjściowych na sekundę na użytkownika, a dla Qwen 3.5 osiągnęła ponad 20 razy wyższą wydajność pr... Przewaga wynikała ze współdziałania pojemności pamięci, wysokiego wykorzystania prefiksowego cac...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Benchmark AgentX 1.0 firmy SemiAnalysis sugeruje, że sprzęt Nvidii oraz oparty na CUDA ekosystem obsługi modeli nadal mają wyraźną przewagę w realistycznych zadaniach agentów programistycznych z bardzo długim kontekstem. W testowanych konfiguracjach SGLang różnica sięgała około 5 razy lepszej efektywności kosztowej Nvidii dla GLM 5.3 oraz ponad 20 razy wyższej wydajności dla Qwen 3.5 przy deklarowanym celu 90 tokenów wyjściowych na sekundę na użytkownika. 26
To ważny wynik, ale nie jest uniwersalnym rankingiem, w którym Nvidia zawsze pokonuje AMD. AgentX mierzy konkretną kombinację modelu, akceleratora, środowiska uruchomieniowego, obciążenia, poziomu równoległości i wymaganego czasu reakcji. MI355X firmy AMD oraz silnik ATOM osiągały konkurencyjne rezultaty w wybranych konfiguracjach, a aktualizacje oprogramowania zmieniały kolejność niektórych systemów. 14
AgentX 1.0 jest częścią zestawu testów InferenceX v3 firmy SemiAnalysis. W przeciwieństwie do klasycznych benchmarków opartych na stałej długości promptu i odpowiedzi, odtwarza on wieloturowy ruch generowany przez agentów programistycznych, z bardzo długimi kontekstami — w niektórych scenariuszach sięgającymi niemal miliona tokenów. 13
Zbiór danych w wersji 1.0 obejmuje 393 anonimowe sesje Claude Code, udostępnione dobrowolnie. Zakwalifikowane sesje musiały zawierać co najmniej 20 żądań. Dane przetworzono tak, aby usunąć duplikaty, wybrane wywołania charakterystyczne dla klienta oraz odtworzone wejścia przekraczające 990 000 tokenów. Mediana żądania obejmowała 142 000 tokenów wejściowych i 444 tokeny wyjściowe, a w 44 proc. sesji wykorzystywano podagentów. 8
Taki profil ruchu ma znaczenie, ponieważ agent programistyczny wielokrotnie przesyła zmieniające się wersje dużej rozmowy lub bazy kodu. Benchmark bada więc przede wszystkim stabilną, interaktywną obsługę wielu żądań, a nie pojedynczy długi prompt i następującą po nim długą odpowiedź.
Najwyraźniejszą przewagę Nvidii pokazano w porównaniach wykorzystujących szerzej dostępne konfiguracje SGLang:
Liczby te należy traktować jako porównanie w określonym punkcie pracy, a nie pojedynczą ocenę całej linii produktowej. InferenceX zestawia platformy przy określonym poziomie interaktywności i wylicza koszty na podstawie zaobserwowanego dla każdej z nich zakresu efektywnej obsługi. 79
W praktyce oznacza to, że klasyczny test typu 8 tys. tokenów wejściowych i 1 tys. tokenów wyjściowych może pomijać ograniczenia, które stają się kluczowe w wieloturowej pracy agentów. Akcelerator może wyglądać konkurencyjnie w izolowanym teście przepustowości, a jednocześnie tracić dystans, gdy musi utrzymywać responsywność wielu dużych, częściowo powtarzających się kontekstów.
W obciążeniach AgentX duża część kontekstu jest wykorzystywana ponownie przy kolejnych żądaniach. SemiAnalysis opisuje współczynnik trafień prefiksowego cache’u, czyli pamięci podręcznej przechowującej wcześniejsze stany KV, często przekraczający 95 proc. 1
Zmienia to proporcje między etapem „prefill”, w którym system przetwarza kontekst wejściowy, a etapem dekodowania, w którym generuje odpowiedź. System nie analizuje za każdym razem całkowicie nowego promptu. Utrzymuje i rozszerza duże zapisane stany, jednocześnie generując stosunkowo krótkie odpowiedzi. Kluczowe stają się więc przechowywanie, wyszukiwanie, przesyłanie i ponowne wykorzystywanie tych danych.
Użyteczna pojemność szybkiej pamięci urządzenia określa, jak duża część stanu KV może pozostać bezpośrednio na akceleratorze. Gdy zestaw roboczy przekracza dostępną pamięć, system obsługujący inferencję może być zmuszony do przenoszenia danych do pamięci hosta albo zarządzania cache’em przez wolniejszą ścieżkę. 1
Offload do pamięci hosta pozwala obsłużyć więcej sesji, ale wiąże się z kosztami przepustowości i opóźnień. Platforma, która przechowuje większą część aktywnego cache’u lokalnie lub sprawniej zarządza jego przenoszeniem, może utrzymać wyższy poziom interaktywności przy tym samym koszcie.
SemiAnalysis zwróciła również uwagę na stosowaną w TensorRT-LLM tokenizację przyrostową uwzględniającą granice kontekstu. Zamiast wielokrotnie tokenizować cały zmieniający się prompt, rozwiązanie rozpoznaje stabilne granice i przetwarza tylko nowo dopisany materiał. 1
Ta optymalizacja jest szczególnie istotna w pracy agentów programistycznych: żądania mogą zawierać bardzo duże konteksty, ale generować zaledwie kilkaset tokenów. W takim obciążeniu przetwarzanie po stronie CPU i powtarzana tokenizacja mogą stanowić zauważalną część kosztu obsługi.
Szerszy wniosek jest taki, że efektywność kosztowa inferencji to wynik działania sprzętu × środowiska uruchomieniowego × modelu × obciążenia × celu dotyczącego opóźnień. Same FLOPS, przepustowość pamięci albo jeden wynik przepustowości nie opisują całego obrazu.
AgentX nie pokazał bezwarunkowego zwycięstwa Nvidii. SemiAnalysis odnotowała znaczące wygrane AMD lub wyniki zbliżone do konkurenta w wybranych kombinacjach modelu, przepustowości i silnika — szczególnie w przypadku MI355X połączonego z silnikiem ATOM firmy AMD. 1
Dane telemetryczne rozdzielają wyniki MI355X dla ATOM, SGLang, vLLM i innych konfiguracji. To istotne rozróżnienie: „wynik AMD” zależy w dużej mierze od użytego silnika, implementacji modelu i zastosowanych optymalizacji. 4
Wyspecjalizowane planowanie zadań w ATOM, obsługa cache’u i jądra zoptymalizowane pod kątem AMD mogą działać bardzo dobrze, gdy model i obciążenie pasują do konfiguracji pamięci MI355X. Innymi słowy, AMD może być wysoce konkurencyjne, jeśli operator zdecyduje się na środowisko uruchomieniowe specjalnie dostrojone do tej platformy.
Wyspecjalizowany silnik może pokazać, na co stać sprzęt w sprzyjających warunkach. Firmy kupujące infrastrukturę potrzebują jednak czegoś więcej niż najlepszego wyniku pojedynczego jądra. Liczą się również obsługiwane modele, tempo wydań, narzędzia, kompetencje wdrożeniowe oraz środowisko, które można utrzymywać przez dłuższy czas.
SemiAnalysis podaje, że jej receptury bazują przede wszystkim na zaleceniach upstreamowych projektów vLLM i SGLang, aby mierzyć konfiguracje, które klienci mogą realistycznie wdrożyć, a nie wyłącznie środowisko stworzone na potrzeby benchmarku. 1
Dlatego dla wielu potencjalnych nabywców AMD bardziej miarodajne będzie porównanie upstreamowych vLLM i SGLang. ATOM pozostaje ważnym dowodem na to, że sprzęt AMD może zapewniać wysoką wydajność w odpowiednim środowisku programowym, ale jego wyników nie należy automatycznie utożsamiać z wydajnością dostępną w powszechnie stosowanej warstwie obsługi modeli.
To rozróżnienie dotyczy adopcji i dostępności oprogramowania — nie oznacza, że ATOM jest niewiarygodny ani że wyspecjalizowane środowiska nie mają wartości.
Benchmark pokazuje również, dlaczego porównania inferencji szybko się dezaktualizują. Telemetria obejmuje konfigurację AMD MI355X MoRI/SGLang z 21 sierpnia, a także inne konfiguracje AMD mierzone w odmiennych terminach. 4
Aktualizacja oprogramowania z 21 sierpnia zmieniła kolejność w co najmniej jednym porównaniu. Pokazuje to, że usprawnienia w planowaniu, jądrach obliczeniowych, przenoszeniu cache’u i obsłudze modeli mogą w ciągu kilku dni zmienić pozorną hierarchię sprzętu. 14
Podobne ostrzeżenie płynie z wcześniejszych testów MI355X dla Qwen 3.5 przeprowadzonych przez SemiAnalysis: kolejne wydania SGLang przyniosły znaczne wzrosty wydajności w okresie 13 tygodni. 12
Dla kupujących praktyczny wniosek jest prosty: przy porównywaniu akceleratorów trzeba zapisywać dokładną wersję środowiska uruchomieniowego, konfigurację, kwantyzację modelu, zakres współbieżności oraz wymagany poziom interaktywności. Werdykt dotyczący sprzętu pozbawiony tego kontekstu szybko może stać się mylący.
AgentX jest wartościowym przybliżeniem obciążenia typowego dla agentów programistycznych z długim kontekstem, ale nie stanowi reprezentatywnego przekroju wszystkich produkcyjnych zastosowań. Zbiór danych pochodzi z wewnętrznego, dobrowolnego korpusu śladów i obejmuje 393 wybrane sesje, a nie całość ruchu generowanego przez agentów w przedsiębiorstwach. 8
Wyniki mogą wyglądać inaczej w przypadku:
W początkowym zestawie porównawczym zabrakło również układów Google TPU, dlatego AgentX 1.0 nie pozwala wyciągnąć pełnego wniosku w trójstronnym porównaniu Nvidia–AMD–Google. 1
Porównanie pozostaje też ruchomym celem. SemiAnalysis zapowiedziała przyszłe uwzględnienie układów Nvidia Rubin, AMD MI455X UALoE72 oraz nowszych systemów TPU. Ich dodanie może zmienić obraz rywalizacji. 111
SemiAnalysis opublikowała zbiór danych AgentX, narzędzie testowe, konfiguracje, telemetrię i powiązane materiały na licencji Apache 2.0. 1
Długoterminowe znaczenie AgentX może wykraczać poza jeden nagłówek o przewadze Nvidii nad AMD. Benchmark zachęca do pracy nad rozwiązaniami, które lepiej odzwierciedlają zachowanie prawdziwych agentów. SemiAnalysis podała, że AgentX stał się już obciążeniem testowym dla ponad 70 upstreamowych pull requestów obejmujących m.in. vLLM, SGLang, TensorRT-LLM, ATOM, AITER, Dynamo, LMCache i Mooncake. 1
Deweloperzy silników obsługujących modele otrzymują dzięki temu powtarzalny sposób optymalizacji pod kątem wysokiego ponownego wykorzystania prefiksów, dużych cache’ów KV, wielu krótkich tur, podagentów, transferu cache’u, presji na planowanie oraz kosztów tokenizacji.
AgentX wzmacnia tezę, że oprogramowanie Nvidii i jej ekosystem obsługi modeli pozostają dużym atutem w inferencji agentów programistycznych z długim kontekstem. W testowanych porównaniach SGLang przewaga Nvidii wynosiła nawet 5 razy pod względem efektywności kosztowej dla GLM 5.3 i ponad 20 razy pod względem wydajności dla Qwen 3.5 przy określonym poziomie interaktywności. 26
Benchmark nie dowodzi jednak, że Nvidia zawsze wygrywa. AMD MI355X i ATOM pokazały, że w wybranych, specjalnie dostrojonych konfiguracjach możliwa jest konkurencyjna lub lepsza relacja ceny do wydajności, a szybki rozwój oprogramowania może odwracać rankingi. Najrozsądniejszy wniosek dla zespołów infrastrukturalnych nie polega więc na wyborze zwycięzcy na podstawie jednej liczby. Należy odtworzyć porównanie z własnym modelem, środowiskiem uruchomieniowym, rozkładem długości kontekstu i wymaganym czasem reakcji.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
W testach SemiAnalysis Nvidia była nawet 5 razy bardziej efektywna kosztowo od AMD dla modelu GLM 5.3 przy 150 tokenach wyjściowych na sekundę na użytkownika, a dla Qwen 3.5 osiągnęła ponad 20 razy wyższą wydajność pr...
W testach SemiAnalysis Nvidia była nawet 5 razy bardziej efektywna kosztowo od AMD dla modelu GLM 5.3 przy 150 tokenach wyjściowych na sekundę na użytkownika, a dla Qwen 3.5 osiągnęła ponad 20 razy wyższą wydajność pr... Przewaga wynikała ze współdziałania pojemności pamięci, wysokiego wykorzystania prefiksowego cache’u, sposobu przenoszenia danych do pamięci hosta oraz oprogramowania serwerowego, w tym TensorRT LLM — nie tylko z para...
AMD MI355X wraz z silnikiem ATOM notował zwycięstwa lub wyniki zbliżone do Nvidii w wybranych konfiguracjach.