I SemiAnalysis AgentX tester var Nvidia upp till fem gånger mer kostnadseffektivt än AMD på GLM 5.3 vid 150 genererade token per sekund och användare, samt över 20 gånger snabbare på Qwen 3.5 vid 90 token per sekund o... Försprånget kom från samspelet mellan minneskapacitet, hög återanvändning av prefixcache, hanter...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
SemiAnalysis benchmark AgentX 1.0 pekar på att Nvidias CUDA-baserade hårdvara och ekosystem för inferenstjänster fortfarande har ett betydande försprång i realistiska arbetslaster för kodande AI-agenter med mycket långa kontexter. I de testade SGLang-konfigurationerna nådde Nvidia upp till fem gånger bättre kostnadseffektivitet på GLM 5.3 och över 20 gånger högre prestanda på Qwen 3.5 vid ett angivet mål på 90 genererade token per sekund och användare. 26
Det är ett tydligt resultat, men inte en universell ranking där Nvidia alltid slår AMD. AgentX mäter en specifik kombination av modell, accelerator, körtidsmiljö, arbetslast, samtidighet och krav på svarshastighet. AMD:s MI355X och ATOM-motor levererade konkurrenskraftiga resultat i vissa konfigurationer, och mjukvaruuppdateringar ändrade ordningen mellan vissa system. 14
AgentX 1.0 ingår i SemiAnalysis benchmarksvit InferenceX v3. Till skillnad från traditionella inferenstester med fasta längder på indata och utdata spelar AgentX upp flerturnarstrafik från kodagenter med mycket långa kontexter – i vissa fall nära en miljon token. 13
Version 1.0 bygger på 393 anonymiserade Claude Code-sessioner som användarna frivilligt bidragit med. Sessionerna skulle innehålla minst 20 förfrågningar. Dubbletter, vissa klientspecifika anrop och återskapade indata över 990 000 token togs bort. En typisk förfrågan i materialet innehöll 142 000 indatatoken och 444 utdata-token, och 44 procent av sessionerna använde underagenter. 8
Det här trafikmönstret spelar stor roll. En kodagent skickar ofta nya versioner av samma stora konversation eller kodbas om och om igen. Testet fokuserar därför på stabil, interaktiv inferens – inte bara på hur snabbt ett system kan behandla en ensam lång prompt.
De tydligaste fördelarna syntes i jämförelser med brett tillgängliga SGLang-konfigurationer:
Siffrorna ska läsas som jämförelser vid bestämda driftspunkter, inte som ett enda totalbetyg för en hel produktserie. InferenceX jämför plattformarna vid specificerade nivåer av interaktivitet och beräknar kostnader utifrån den bästa uppmätta driftprofilen för respektive plattform. 79
Det praktiska budskapet är att ett traditionellt test med exempelvis 8 000 indatatoken och 1 000 utdata-token kan missa flaskhalsar som blir avgörande i flerturnarstrafik. En accelerator kan verka konkurrenskraftig i isolerad genomströmning men hamna efter när många stora, delvis upprepade kontexter måste hållas responsiva samtidigt.
AgentX-arbetslaster återanvänder stora delar av kontexten från en förfrågan till nästa. SemiAnalysis beskriver träffsäkerheten för prefix- eller KV-cache ofta som över 95 procent i dessa agentspår. 1
Det förändrar balansen mellan så kallad prefill – den första bearbetningen av prompten – och dekodning, där modellen genererar svaret. Systemet bearbetar inte ständigt en helt ny prompt. I stället ska det lagra, hitta, flytta och återanvända stora cachade tillstånd medan relativt korta svar produceras.
Den användbara kapaciteten i acceleratorns snabbminne avgör hur mycket KV-cache som kan hållas kvar lokalt. Om arbetsmängden blir större än enhetens minne kan systemet behöva flytta data till värdminnet eller hantera cachen via en långsammare väg. 1
Avlastning till värdminne gör det möjligt att stödja fler sessioner, men kostar bandbredd och tid. En plattform som kan hålla en större del av den aktiva cachen lokalt – eller flytta den mer effektivt – kan därför ge bättre interaktivitet till samma kostnad.
SemiAnalysis lyfte också fram TensorRT-LLM:s gränsmedvetna inkrementella tokenisering. I stället för att tokenisera hela den växande prompten på nytt identifierar metoden stabila gränser och bearbetar endast det material som lagts till. 1
Det är särskilt relevant för kodagenter: förfrågningarna kan innehålla enorma kontexter men bara generera några hundra token. Då kan förbehandling på CPU:n och upprepad tokenisering bli en märkbar del av kostnaden.
Den bredare lärdomen är att inferensens pris-prestanda beror på hårdvara × körtidsmiljö × modell × arbetslast × latensmål. FLOPS, minnesbandbredd eller ett enskilt genomströmningstal räcker inte för att beskriva helheten.
AgentX visade inte en total Nvidia-seger. SemiAnalysis rapporterade tydliga AMD-fördelar eller ungefärlig paritet i utvalda kombinationer av modell, genomströmning och inferensmotor – framför allt för MI355X tillsammans med AMD:s ATOM-motor. 1
Telemetrin redovisar separata resultat för MI355X med ATOM, SGLang, vLLM och andra konfigurationer. Den skillnaden är central: ett ”AMD-resultat” beror i hög grad på vilken inferensmotor, modellimplementation och optimering som används. 4
ATOM:s specialiserade schemaläggning, cachehantering och AMD-anpassade kärnor kan prestera mycket bra när modellen och arbetslasten passar MI355X-minnets egenskaper. AMD kan alltså vara högst konkurrenskraftigt när operatören är beredd att använda en körtidsmiljö som är särskilt optimerad för plattformen.
En specialiserad inferensmotor kan visa vad hårdvaran klarar under gynnsamma förhållanden. Infrastrukturköpare behöver däremot oftast mer än ett optimalt kärnresultat: stöd för många modeller, regelbundna uppdateringar, verktyg, driftskompetens och en lösning som går att underhålla över tid.
SemiAnalysis uppger att deras recept i huvudsak följer riktlinjerna för uppströmsversionerna av vLLM och SGLang, för att mäta konfigurationer som kunder realistiskt kan använda – snarare än att enbart förlita sig på en benchmarkspecialiserad stack. 1
För de flesta som överväger AMD blir resultat med uppströms vLLM och SGLang därför mer beslutsrelevanta än ett resultat från ATOM. ATOM är fortfarande viktigt som bevis på att AMD-hårdvara kan ge stark prestanda i rätt mjukvarumiljö, men resultatet kan inte behandlas som utbytbart mot vad som är tillgängligt genom ett vanligt, brett stödlager.
Detta handlar om införande och mjukvarutillgänglighet – inte om att ATOM skulle vara ogiltigt eller sakna praktiskt värde.
Benchmarken visar också varför inferensjämförelser snabbt blir inaktuella. Telemetrin innehåller en AMD MI355X-konfiguration med MoRI/SGLang från den 21 augusti, tillsammans med andra AMD-konfigurationer som mättes vid andra tidpunkter. 4
En mjukvaruuppdatering den 21 augusti ändrade ordningen i minst en jämförelse. Det visar hur förbättringar i schemaläggning, beräkningskärnor, cacheflytt och modellstöd kan förändra den upplevda hårdvaruhierarkin på bara några dagar. 14
Tidigare arbete från SemiAnalysis om MI355X och Qwen 3.5 ger en liknande varning: successiva versioner av SGLang gav stora prestandavinster under en period på 13 veckor. 12
För köpare är slutsatsen praktisk: dokumentera alltid exakt version av körtidsmiljön, konfiguration, modellens kvantisering, samtidighetsintervall och mål för interaktivitet. Ett hårdvaruomdöme utan den kontexten riskerar att bli missvisande när inferensmjukvaran förbättras.
AgentX är en värdefull modell för långkontextbaserade kodagenter, men är inte en representativ kartläggning av alla produktionsarbetslaster. Materialet kommer från ett internt, frivilligt insamlat spårarkiv och består av 393 utvalda sessioner – inte av all företagsrelaterad agenttrafik. 8
Resultaten kan därför se annorlunda ut för:
Google TPU:er saknades dessutom i den första jämförelsen. AgentX 1.0 kan därför inte fastställa en fullständig trevägskamp mellan Nvidia, AMD och Google. 1
Jämförelsen är också rörlig. SemiAnalysis har pekat ut Nvidia Rubin, AMD MI455X UALoE72 och nya TPU-system som kommande tillägg eller framtida jämförelsepunkter. När de inkluderas kan konkurrensbilden förändras. 111
SemiAnalysis släppte AgentX-datasetet, testverktyget, konfigurationerna, telemetrin och relaterat material under Apache 2.0-licensen. 1
Benchmarkens långsiktiga betydelse kan därför ligga mindre i en enskild Nvidia–AMD-rubrik och mer i den teknikutveckling som den sätter fart på. SemiAnalysis uppgav att AgentX redan blivit en målworkload för över 70 uppströms-pull requests i projekt som vLLM, SGLang, TensorRT-LLM, ATOM, AITER, Dynamo, LMCache och Mooncake. 1
Det ger utvecklare av inferensramverk ett reproducerbart sätt att optimera för verkligt agentbeteende: hög prefixåteranvändning, stora KV-cacher, många korta turer, underagenter, cacheöverföringar, schemaläggningsbelastning och tokeniseringskostnad.
AgentX stärker bilden av att Nvidias mjukvara och ekosystem för inferenstjänster fortfarande är en stor konkurrensfördel för AI-agenter med långa kontexter. I de testade SGLang-jämförelserna uppgavs Nvidia ha upp till fem gånger bättre kostnadseffektivitet på GLM 5.3 och över 20 gånger högre prestanda på Qwen 3.5 vid ett specificerat interaktivitetsmål. 26
Men benchmarken bevisar inte att Nvidia alltid vinner. AMD:s MI355X och ATOM visade att konkurrenskraftig eller bättre pris-prestanda är möjlig i utvalda, specialanpassade konfigurationer. Samtidigt kan snabba förbättringar i inferensmjukvaran vända resultaten.
Den mest användbara slutsatsen för infrastrukturteam är därför inte att utse en vinnare utifrån ett enda rubrikvärde, utan att återskapa jämförelsen med den egna modellen, körtidsmiljön, kontextfördelningen och latensmålet.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
I SemiAnalysis AgentX tester var Nvidia upp till fem gånger mer kostnadseffektivt än AMD på GLM 5.3 vid 150 genererade token per sekund och användare, samt över 20 gånger snabbare på Qwen 3.5 vid 90 token per sekund o...
I SemiAnalysis AgentX tester var Nvidia upp till fem gånger mer kostnadseffektivt än AMD på GLM 5.3 vid 150 genererade token per sekund och användare, samt över 20 gånger snabbare på Qwen 3.5 vid 90 token per sekund o... Försprånget kom från samspelet mellan minneskapacitet, hög återanvändning av prefixcache, hantering av avlastning till värdminne och inferensmjukvara som TensorRT LLM – inte enbart från rå hårdvaruprestanda.
AMD:s MI355X tillsammans med ATOM nådde ändå konkurrenskraftiga resultat eller paritet i vissa tester.