I SemiAnalysis’ AgentX tester var Nvidia opptil fem ganger mer kostnadseffektiv enn AMD på GLM 5.3 ved 150 genererte tokens per sekund per bruker, og leverte over 20 ganger høyere ytelse på Qwen 3.5 ved 90 tokens per... Forspranget skyldtes samspillet mellom minnekapasitet, høy gjenbruk av prefiksbufferen, håndterin...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
SemiAnalysis’ AgentX 1.0-benchmark tyder på at Nvidias CUDA-baserte maskinvare- og programvareøkosystem fortsatt har et betydelig forsprang i realistiske kodeagent-arbeidslaster med svært lang kontekst. I de testede SGLang-oppsettene var forskjellen opptil fem ganger bedre kostnadseffektivitet for Nvidia på GLM 5.3 og over 20 ganger høyere ytelse på Qwen 3.5 ved et oppgitt mål på 90 genererte tokens per sekund per bruker. 26
Det er et markant resultat, men ikke en universell rangering der Nvidia alltid slår AMD. AgentX måler en bestemt kombinasjon av modell, akselerator, kjøremotor, arbeidslast, samtidighet og krav til responstid. AMDs MI355X og ATOM-serveringsmotoren leverte konkurransedyktige resultater i enkelte oppsett, og programvareoppdateringer endret rekkefølgen mellom noen av systemene. 14
AgentX 1.0 er en del av SemiAnalysis’ InferenceX v3-benchmark. I motsetning til tradisjonelle inferenstester med faste lengder på instruksjon og svar, gjenskaper AgentX flersidige kodeagent-samtaler med svært lange kontekster – i enkelte tilfeller nær én million tokens. 13
Datasettet i versjon 1.0 består av 393 samtykkebaserte og anonymiserte Claude Code-økter. Øktene måtte inneholde minst 20 forespørsler. Dataene ble behandlet for å fjerne duplikater, enkelte klientspesifikke kall og rekonstruerte inndata over 990 000 tokens. En typisk forespørsel i datasettet hadde 142 000 input-tokens og 444 output-tokens, mens 44 prosent av øktene brukte underagenter. 8
Dette er viktig fordi kodeagenter hele tiden sender nye versjoner av en stor samtale eller et omfattende kodegrunnlag. Benchmarken måler derfor vedvarende, interaktiv servering – ikke bare én lang instruksjon etterfulgt av én lang tekst.
Det tydeligste forspranget for Nvidia kom i sammenligninger med bredt tilgjengelige SGLang-oppsett:
Tallene bør forstås som sammenligninger ved bestemte driftsnivåer – ikke som én samlet karakter for en hel produktserie. InferenceX beregner kostnad ut fra den beste serveringsprofilen som ble observert for hver plattform, ved et spesifisert nivå av interaktivitet. 79
I praksis betyr det at en fast test som 8 000 input-tokens og 1 000 output-tokens kan overse flaskehalser som blir avgjørende i flertrinns agenttrafikk. En akselerator kan se konkurransedyktig ut i en isolert gjennomstrømningstest, men likevel sakke akterut når den samtidig må holde mange store og delvis gjentatte kontekster responsive.
AgentX-arbeidslastene gjenbruker store deler av konteksten fra én forespørsel til den neste. SemiAnalysis beskriver treffrater for prefiks- eller KV-bufferen på ofte over 95 prosent i disse agentsporene. 1
Da endres balansen mellom forhåndsbehandling og generering. Systemet behandler ikke en helt ny instruksjon hver gang. I stedet må det vedlikeholde og utvide store bufrede tilstander, samtidig som det produserer relativt korte svar. Hvor effektivt disse tilstandene lagres, finnes frem og gjenbrukes, blir dermed avgjørende for både kapasitet og kostnad.
Den tilgjengelige kapasiteten i høybåndbreddeminnet avgjør hvor mye av KV-bufferen som kan holdes på selve akseleratoren. Når arbeidssettet blir større enn enhetens minne, kan serveringssystemet måtte flytte data til vertsminnet eller håndtere bufferinnholdet over en tregere forbindelse. 1
Avlasting til vertsminnet kan gjøre det mulig å støtte flere økter, men medfører kostnader i form av båndbredde og forsinkelse. En plattform som holder mer av den aktive bufferen på akseleratoren – eller flytter data mer effektivt – kan opprettholde bedre respons ved samme kostnadsnivå.
SemiAnalysis trakk også frem TensorRT-LLMs grensebevisste, inkrementelle tokenisering. I stedet for å tokenisere hele den stadig voksende instruksjonen på nytt, identifiserer metoden stabile grenser og behandler bare materialet som er lagt til. 1
Det er særlig relevant for kodeagenter: Forespørslene kan inneholde svært store kontekster, men genererer kanskje bare noen hundre tokens. Da kan CPU-basert forbehandling og gjentatt tokenisering bli en merkbar del av serveringskostnaden.
Den overordnede lærdommen er at pris–ytelse i inferens er et resultat av maskinvare × kjøremotor × modell × arbeidslast × mål for responstid. FLOPS, minnebåndbredde eller ett enkelt gjennomstrømningstall forteller ikke hele historien.
AgentX viste ikke en fullstendig Nvidia-seier. SemiAnalysis rapporterte tydelige AMD-seire eller tilnærmet like resultater i enkelte kombinasjoner av modell, gjennomstrømning og serveringsmotor – særlig med MI355X sammen med AMDs ATOM-motor. 1
Telemetrien skiller mellom MI355X-resultater for ATOM, SGLang, vLLM og andre oppsett. Det skillet er avgjørende: Et «AMD-resultat» avhenger i stor grad av hvilken serveringsmotor, modellimplementasjon og optimalisering som brukes i testen. 4
ATOMs spesialiserte planlegging, bufferhåndtering og AMD-tilpassede kjerner kan prestere godt når modellen og arbeidslasten passer MI355Xs minnekonfigurasjon. AMD kan med andre ord være svært konkurransedyktig når operatøren er villig til å bruke en kjøremotor som er optimalisert spesielt for plattformen.
En spesialisert motor kan vise hva maskinvaren er i stand til under gunstige forhold. Infrastrukturkjøpere trenger imidlertid vanligvis mer enn et best mulig resultat fra én enkelt kjerne. De trenger også modellstøtte, jevnlige oppdateringer, verktøy, driftskompetanse og en løsning som kan vedlikeholdes over tid.
SemiAnalysis opplyser at oppsettene i hovedsak følger anbefalinger fra oppstrøms vLLM og SGLang, slik at målingene skal gjenspeile konfigurasjoner kunder faktisk kan ta i bruk – ikke bare en benchmarkspesifikk programvarestakk. 1
For de fleste som vurderer AMD, er derfor resultater med oppstrøms vLLM og SGLang mer relevante enn resultater fra en svært spesialisert motor. ATOM er fortsatt viktig dokumentasjon på at AMD-maskinvare kan levere høy ytelse i riktig programvaremiljø, men resultatet kan ikke uten videre sidestilles med ytelsen i en vanlig, bredt brukt serveringsløsning.
Dette handler om tilgjengelighet og utbredelse av programvare – ikke om at ATOM er ugyldig eller at spesialiserte kjøremotorer ikke har verdi.
Benchmarken viser også hvorfor sammenligninger av inferensytelse raskt blir foreldet. Telemetrien inneholder blant annet en AMD MI355X-konfigurasjon med MoRI/SGLang målt 21. august, sammen med andre AMD-oppsett som ble målt på andre datoer. 4
En programvareoppdatering 21. august endret rekkefølgen i minst én sammenligning. Det illustrerer hvor raskt planlegging, kjerner, flytting av bufferdata og modellstøtte kan endre den tilsynelatende rangeringen mellom maskinvaresystemer. 14
Tidligere arbeid fra SemiAnalysis med MI355X og Qwen 3.5 gir en lignende advarsel: På 13 uker ga nye SGLang-versjoner betydelige ytelsesforbedringer. 12
For kjøpere er lærdommen praktisk: Noter alltid nøyaktig versjon av kjøremotoren, konfigurasjon, modellkvantisering, samtidighetsområde og mål for interaktivitet når akseleratorer sammenlignes. En maskinvarekonklusjon uten denne konteksten kan fort bli misvisende når serveringsprogramvaren forbedres.
AgentX er en nyttig representasjon av lange kodeagent-arbeidslaster, men er ikke et representativt tverrsnitt av alle produksjonsmiljøer. Datasettet kommer fra en intern, samtykkebasert samling og inneholder 393 utvalgte økter – ikke all agenttrafikk i virksomheter. 8
Resultatene kan bli annerledes ved:
Google TPU-er var heller ikke med i det første sammenligningssettet. AgentX 1.0 kan derfor ikke etablere en treveis konklusjon mellom Nvidia, AMD og Google. 1
Sammenligningen er dessuten i stadig endring. SemiAnalysis har varslet Nvidia Rubin, AMD MI455X UALoE72 og nyere TPU-systemer som kommende tillegg eller fremtidige sammenligningspunkter. De kan endre konkurransebildet. 111
SemiAnalysis publiserte datasettet, testverktøyet, konfigurasjonene, telemetrien og tilhørende materiale under Apache 2.0-lisensen. 1
På lengre sikt kan AgentX bli viktigere for arbeidet med inferens enn for én enkelt overskrift om Nvidia mot AMD. SemiAnalysis opplyser at AgentX allerede var blitt en mål-arbeidslast for mer enn 70 oppstrøms pull requests i prosjekter som vLLM, SGLang, TensorRT-LLM, ATOM, AITER, Dynamo, LMCache og Mooncake. 1
Det gir utviklere av serveringsrammeverk en reproduserbar måte å optimalisere for faktisk agentatferd: høy gjenbruk av prefikser, store KV-buffere, mange korte trinn, underagenter, flytting av bufferdata, press på planleggingen og kostnader ved tokenisering.
AgentX styrker bildet av at Nvidias programvare- og serveringsøkosystem fortsatt er et stort konkurransefortrinn for inferens med lange kodeagent-kontekster. I de testede SGLang-sammenligningene ble Nvidias forsprang rapportert til opptil fem ganger bedre kostnadseffektivitet på GLM 5.3 og over 20 ganger høyere ytelse på Qwen 3.5 ved et spesifisert interaktivitetsnivå. 26
Benchmarken beviser likevel ikke at Nvidia alltid vinner. AMDs MI355X og ATOM viste at konkurransedyktig eller bedre pris–ytelse er mulig i utvalgte, spesialtilpassede oppsett, mens raske forbedringer i serveringsprogramvaren kan snu rangeringen.
Den mest nyttige konklusjonen for infrastruktทีม er derfor ikke å kåre en vinner basert på ett overskriftstall, men å gjenskape testen med sin egen modell, kjøremotor, kontekstfordeling og mål for responstid.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
I SemiAnalysis’ AgentX tester var Nvidia opptil fem ganger mer kostnadseffektiv enn AMD på GLM 5.3 ved 150 genererte tokens per sekund per bruker, og leverte over 20 ganger høyere ytelse på Qwen 3.5 ved 90 tokens per...
I SemiAnalysis’ AgentX tester var Nvidia opptil fem ganger mer kostnadseffektiv enn AMD på GLM 5.3 ved 150 genererte tokens per sekund per bruker, og leverte over 20 ganger høyere ytelse på Qwen 3.5 ved 90 tokens per... Forspranget skyldtes samspillet mellom minnekapasitet, høy gjenbruk av prefiksbufferen, håndtering av avlasting til vertsminne og serveringsprogramvare som TensorRT LLM – ikke bare rå maskinvareytelse.
AMDs MI355X sammen med ATOM motoren leverte likevel enkelte seire eller resultater på nivå med Nvidia.