I SemiAnalysis’ AgentX tests var Nvidia op til fem gange mere omkostningseffektiv end AMD på GLM 5.3 ved 150 genererede tokens i sekundet pr. Fordelen kom fra samspillet mellem hukommelseskapacitet, høj genbrug af prefix cache, håndtering af data i værtshukommelsen og serving software som TensorRT LLM – ikke fra rå...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
SemiAnalysis’ AgentX 1.0-benchmark peger på, at Nvidia fortsat har et betydeligt forspring, når realistiske coding-agenter skal håndtere meget lange kontekster. I de testede SGLang-konfigurationer nåede forskellen op på fem gange bedre omkostningseffektivitet for Nvidia på GLM 5.3 og over 20 gange højere ydelse på Qwen 3.5 ved et angivet mål på 90 outputtokens i sekundet pr. bruger. 26
Det er et markant resultat, men ikke en universel rangliste, hvor Nvidia altid slår AMD. AgentX måler en bestemt kombination af model, accelerator, runtime, arbejdsbelastning, samtidighed og krav til svartid. AMDs MI355X og ATOM-servingmotor leverede konkurrencedygtige resultater i udvalgte opsætninger, og softwareopdateringer ændrede rækkefølgen mellem nogle systemer. 14
AgentX 1.0 er en del af SemiAnalysis’ InferenceX v3-benchmark. I modsætning til traditionelle inferenstests med faste længder for input og output afspiller den flertrådede coding-agent-sessioner med meget lange kontekster – i nogle tilfælde tæt på 1 million tokens. 13
Datasættet indeholder 393 anonymiserede Claude Code-sessioner, som brugerne frivilligt har bidraget med. Sessionerne skulle indeholde mindst 20 forespørgsler. Duplikater, bestemte klientspecifikke kald og rekonstruerede input på over 990.000 tokens blev fjernet. En typisk forespørgsel i datasættet indeholdt 142.000 inputtokens og 444 outputtokens, mens 44 procent af sessionerne benyttede underagenter. 8
Det er vigtigt, fordi coding-agenter igen og igen sender nye versioner af en stor samtale eller et helt kodeprojekt. Benchmarken måler derfor vedvarende, interaktiv serving – ikke blot én lang prompt efterfulgt af én lang tekst.
Den tydeligste Nvidia-fordel viste sig i sammenligninger med bredt tilgængelige SGLang-konfigurationer:
Tallene bør læses som sammenligninger ved bestemte driftspunkter – ikke som én samlet karakter for en hel produktserie. InferenceX sammenligner platforme ved fastlagte niveauer for interaktivitet og beregner omkostninger ud fra det bedste observerede serving-setup for hver platform. 79
Den praktiske pointe er, at en standardtest med eksempelvis 8.000 inputtokens og 1.000 outputtokens kan overse flaskehalse, som bliver afgørende i flertrådede agentforløb. En accelerator kan se konkurrencedygtig ud i en isoleret throughput-test, men sakke bagud, når den samtidig skal holde mange store og delvist gentagne kontekster responsive.
AgentX-workloads genbruger en stor del af konteksten fra den ene forespørgsel til den næste. SemiAnalysis beskriver ofte hitrater for prefix- eller KV-cache på over 95 procent i disse agentforløb. 1
Det ændrer balancen mellem såkaldt prefill og decode. Systemet behandler ikke en helt ny prompt fra bunden hver gang. I stedet skal det vedligeholde og udbygge store cachede tilstande, mens det genererer relativt korte svar. Derfor bliver evnen til at gemme, finde, flytte og genbruge disse tilstande central for både hastighed og pris.
Den brugbare kapacitet i den hurtige hukommelse afgør, hvor meget KV-cache der kan blive liggende på acceleratorens egen hukommelse. Hvis datasættet bliver større end den tilgængelige kapacitet, kan serving-systemet være nødt til at flytte data til værtshukommelsen eller håndtere cachen via en langsommere dataforbindelse. 1
Offload til værtshukommelsen kan gøre det muligt at understøtte flere sessioner, men det koster båndbredde og latenstid. En platform, der kan holde mere af den aktive cache på acceleratorens egen hukommelse – eller flytte data mere effektivt – kan derfor opretholde en højere interaktivitet til samme pris.
SemiAnalysis fremhæver også TensorRT-LLM’s grænsebevidste, inkrementelle tokenisering. I stedet for at tokenisere hele den voksende prompt igen og igen identificerer metoden stabile grænser og behandler det materiale, der er blevet tilføjet. 1
Det er særligt relevant for coding-agenter, hvor forespørgslerne kan indeholde meget store kontekster, men kun generere nogle få hundrede tokens. I den type workload kan CPU-forbehandling og gentagen tokenisering udgøre en mærkbar del af serving-overheadet.
Den bredere læring er, at pris/ydelse ved AI-inferens er et produkt af hardware × runtime × model × workload × krav til latenstid. FLOPS, hukommelsesbåndbredde eller ét enkelt throughput-tal kan ikke forklare hele resultatet.
AgentX viste ikke en total Nvidia-sejr. SemiAnalysis fandt markante AMD-fordele eller resultater tæt på paritet i udvalgte kombinationer af model, throughput og servingmotor – især med MI355X sammen med AMDs ATOM-servingmotor. 1
Telemetrien adskiller resultater for MI355X med ATOM, SGLang, vLLM og andre konfigurationer. Den sondring er afgørende: Et “AMD-resultat” afhænger i høj grad af servingmotoren, modelimplementeringen og den anvendte optimering. 4
ATOMs specialiserede planlægning, cachehåndtering og AMD-fokuserede kernels kan levere stærke resultater, når modellen og workloaden passer til MI355X’s hukommelseskonfiguration. AMD kan altså være meget konkurrencedygtig, hvis operatøren er villig til at anvende en runtime, der er optimeret specifikt til platformen.
En specialiseret engine kan vise, hvad hardwaren kan præstere under gunstige forhold. Men infrastrukturkøbere har normalt brug for mere end et imponerende kernel-resultat. De skal også tage højde for modelunderstøttelse, udgivelsestakt, værktøjer, kompetencer og en driftsmodel, der kan vedligeholdes over tid.
SemiAnalysis oplyser, at benchmarkens opskrifter hovedsageligt følger anbefalinger fra upstream-projekterne vLLM og SGLang. Formålet er at måle konfigurationer, som kunder realistisk kan implementere – ikke kun en benchmark-specifik stack. 1
For mange potentielle AMD-købere er resultaterne fra upstream vLLM og SGLang derfor den mest relevante sammenligning. ATOM er stadig vigtigt som dokumentation for, at AMD-hardware kan levere stærk ydelse i et passende softwaremiljø, men resultatet kan ikke sidestilles med den ydelse, der er tilgængelig gennem en almindelig upstream-servinglayer.
Det er en forskel i udbredelse og softwaretilgængelighed – ikke en påstand om, at ATOM er ugyldig, eller at specialiserede runtimes ikke har værdi.
Benchmarken viser også, hvorfor sammenligninger af inferenssystemer hurtigt bliver forældede. Telemetrien indeholder en AMD MI355X MoRI/SGLang-konfiguration dateret 21. august samt andre AMD-konfigurationer målt på andre datoer. 4
En softwareopdatering 21. august ændrede rækkefølgen i mindst én sammenligning. Det illustrerer, hvordan forbedringer i planlægning, kernels, cacheflytning og modelunderstøttelse kan ændre den tilsyneladende hardwarehierarki på få dage. 14
Tidligere SemiAnalysis-målinger af MI355X med Qwen 3.5 peger i samme retning: Efterfølgende SGLang-versioner gav betydelige ydelsesforbedringer over en periode på 13 uger. 12
For købere er den praktiske konklusion, at man bør notere den præcise runtime-version, konfiguration, modelkvantisering, samtidighedsområde og krav til interaktivitet, når acceleratorer sammenlignes. En hardwarekonklusion uden den kontekst risikerer at blive misvisende, efterhånden som serving-softwaren udvikler sig.
AgentX er en værdifuld målestok for coding-agenter med lange kontekster, men den er ikke en repræsentativ optælling af alle produktionsworkloads. Datasættet bygger på et internt, frivilligt bidraget sporarkiv og indeholder 393 udvalgte sessioner – ikke al virksomhedstrafik fra AI-agenter. 8
Resultaterne kan være anderledes ved:
Google TPU’er var desuden ikke med i det første sammenligningsresultat. AgentX v1.0 kan derfor ikke afgøre en samlet konkurrence mellem Nvidia, AMD og Google. 1
Sammenligningen er også under konstant forandring. SemiAnalysis har peget på Nvidia Rubin, AMD MI455X UALoE72 og nyere TPU-systemer som kommende tilføjelser eller fremtidige sammenligningspunkter. De kan ændre billedet af konkurrencen. 111
SemiAnalysis udgav AgentX-datasættet, testværktøjet, konfigurationerne, telemetrien og relaterede materialer under Apache 2.0-licensen. 1
Benchmarkens langsigtede betydning handler muligvis mindre om én overskrift om Nvidia mod AMD og mere om den udvikling, som benchmarken sætter i gang. SemiAnalysis rapporterede, at AgentX allerede var blevet et mål for over 70 upstream-pull requests på tværs af projekter som vLLM, SGLang, TensorRT-LLM, ATOM, AITER, Dynamo, LMCache og Mooncake. 1
Det giver udviklere af serving-frameworks en reproducerbar måde at optimere til reel agentadfærd: høj genbrug af prefix-cache, store KV-caches, mange korte omgange, underagenter, cacheflytning, pres på planlægningen og tokeniseringsomkostninger.
AgentX styrker billedet af, at Nvidias software- og serving-økosystem fortsat er en væsentlig fordel ved inferens til coding-agenter med lange kontekster. I de testede SGLang-sammenligninger blev Nvidias forspring rapporteret til op mod fem gange bedre omkostningseffektivitet på GLM 5.3 og over 20 gange højere ydelse på Qwen 3.5 ved et angivet interaktivitetsmål. 26
Benchmarken beviser dog ikke, at Nvidia altid vinder. AMDs MI355X og ATOM viste, at konkurrencedygtig eller bedre pris/ydelse er mulig i udvalgte, målrettede konfigurationer, mens hurtige forbedringer i serving-software kan vende ranglisten.
Den mest brugbare konklusion for infrastrukturteams er derfor ikke at udpege en vinder ud fra ét overskriftstal, men at gentage sammenligningen med deres egen model, runtime, kontekstfordeling og krav til latenstid.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
I SemiAnalysis’ AgentX tests var Nvidia op til fem gange mere omkostningseffektiv end AMD på GLM 5.3 ved 150 genererede tokens i sekundet pr.
I SemiAnalysis’ AgentX tests var Nvidia op til fem gange mere omkostningseffektiv end AMD på GLM 5.3 ved 150 genererede tokens i sekundet pr. Fordelen kom fra samspillet mellem hukommelseskapacitet, høj genbrug af prefix cache, håndtering af data i værtshukommelsen og serving software som TensorRT LLM – ikke fra rå hardwarespecifikationer alene.
AMDs MI355X og ATOM motor leverede stadig enkelte sejre eller resultater på niveau med Nvidia.