V testech SemiAnalysis byla Nvidia u modelu GLM 5.3 až pětkrát nákladově efektivnější než AMD při cíli 150 výstupních tokenů za sekundu na uživatele. Výsledek nevychází jen ze specifikací čipů.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Benchmark AgentX 1.0 od analytické společnosti SemiAnalysis naznačuje, že ekosystém hardwaru a obslužného softwaru kolem platformy CUDA si u realistických úloh dlouhého kontextu stále drží výrazný náskok. V testovaných konfiguracích SGLang dosáhla Nvidia až pětkrát lepší nákladové efektivity u modelu GLM 5.3 a více než dvacetinásobného výkonu u Qwen 3.5 při stanoveném cíli 90 výstupních tokenů za sekundu na uživatele. 26
Nejde ale o univerzální žebříček, v němž by Nvidia vždy porazila AMD. AgentX měří konkrétní kombinaci modelu, akcelerátoru, runtime prostředí, typu zátěže, míry souběžnosti a požadované odezvy. AMD MI355X i vlastní obslužný engine ATOM v některých konfiguracích nabídly konkurenceschopné výsledky a aktualizace softwaru změnily pořadí několika systémů. 14
AgentX 1.0 je součástí benchmarkové sady InferenceX v3 od SemiAnalysis. Na rozdíl od tradičních testů s pevně danou délkou vstupu a výstupu přehrává vícekrokovou komunikaci programovacích agentů, a to včetně scénářů s kontextem blížícím se jednomu milionu tokenů. 13
Datová sada v1.0 obsahuje 393 anonymizovaných relací Claude Code, jejichž účastníci s poskytnutím dat souhlasili. Zařazené relace měly nejméně 20 požadavků. Zpracování odstranilo duplicitní požadavky, některá volání specifická pro klienta a rekonstruované vstupy delší než 990 000 tokenů. Medián jednoho požadavku činil 142 000 vstupních tokenů a 444 výstupních tokenů; 44 % relací zahrnovalo podagenty. 8
To je podstatný rozdíl oproti běžnému testu typu „8 000 tokenů na vstupu a 1 000 na výstupu“. Programovací agent opakovaně odesílá stále se vyvíjející verzi rozsáhlé konverzace nebo kódu. Benchmark proto sleduje především dlouhodobou interaktivní obsluhu, nikoli jednorázové zpracování dlouhého dotazu.
Nejvýraznější rozdíl se objevil při porovnání konfigurací SGLang, které jsou obecně dostupné:
Tato čísla je třeba chápat jako srovnání konkrétního provozního bodu, nikoli jako jedno celkové skóre celé produktové řady. InferenceX porovnává platformy při určitých úrovních interaktivity a náklady počítá podle nejlepšího pozorovaného obslužného prostředí dané platformy. 79
Praktický závěr je důležitý: syntetický test s pevnou délkou vstupu může přehlédnout úzká hrdla, která se u vícekrokových agentů stanou rozhodujícími. Akcelerátor může v izolovaném měření propustnosti vypadat konkurenceschopně, ale zaostávat ve chvíli, kdy musí současně udržovat mnoho rozsáhlých, částečně opakovaných kontextů a reagovat bez výrazného zpoždění.
AgentX při přechodu mezi požadavky opakovaně využívá velkou část kontextu. SemiAnalysis u těchto agentních stop popisuje míru zásahů prefixové, respektive KV mezipaměti často nad 95 %. 1
Mění se tím poměr mezi úvodním zpracováním vstupu a generováním odpovědi. Systém nemusí pokaždé zpracovávat zcela nový prompt; místo toho udržuje a rozšiřuje velké mezipaměťové stavy a generuje relativně krátké odpovědi. Efektivní ukládání, vyhledávání, přesouvání a opětovné používání těchto stavů se proto přímo promítá do výkonu i ceny.
Kapacita použitelné vysokorychlostní paměti určuje, jak velká část stavu KV mezipaměti může zůstat přímo na akcelerátoru. Když pracovní sada překročí kapacitu zařízení, musí obslužný systém data přesouvat do hostitelské paměti nebo jinak spravovat mezipaměť přes pomalejší cestu. 1
Odkládání do hostitelské paměti sice může rozšířit počet relací, které platforma zvládne, zároveň ale přináší náklady na propustnost a latenci. Platforma, která udrží větší část aktivní mezipaměti v zařízení nebo dokáže přesuny lépe naplánovat, může při stejné ceně nabídnout svižnější interakci.
SemiAnalysis upozorňuje také na hraničně uvědomělou inkrementální tokenizaci v TensorRT-LLM. Místo opakované tokenizace celého vyvíjejícího se promptu systém rozpozná stabilní hranice a zpracuje pouze nově připojenou část. 1
U programovacích agentů je taková optimalizace obzvlášť relevantní. Požadavek může obsahovat stovky tisíc tokenů, ale odpověď často čítá jen několik set tokenů. Zpracování na CPU a opakovaná tokenizace se proto mohou stát významnou částí režie.
Širší poučení zní, že poměr ceny a výkonu při inferenci je výsledkem vztahu hardware × runtime × model × zátěž × požadovaná latence. Samotný počet operací za sekundu, propustnost paměti ani jedno číslo o výkonu nedokážou popsat celý výsledek.
AgentX nepřinesl bezvýhradné vítězství Nvidie. SemiAnalysis uvádí, že AMD v některých kombinacích modelu, propustnosti a obslužného enginu dosáhlo výrazně lepších výsledků nebo téměř srovnatelného výkonu. Nejvýrazněji se to týkalo akcelerátoru MI355X v kombinaci s obslužným enginem ATOM. 1
Telemetrie rozlišuje výsledky MI355X pro ATOM, SGLang, vLLM a další konfigurace. To je zásadní: „výsledek AMD“ závisí na použitém enginu, implementaci modelu i ladění konkrétního testu. 4
Specializované plánování v ATOM, práce s mezipamětí a kernely optimalizované pro AMD mohou podat velmi dobrý výkon v situacích, kdy model a zátěž dobře odpovídají paměťové konfiguraci MI355X. AMD tedy může být vysoce konkurenceschopné, pokud je provozovatel ochoten nasadit runtime optimalizovaný přímo pro danou platformu.
Specializovaný engine může ukázat, čeho je hardware za příznivých podmínek schopen. Zákazníci infrastruktury ale obvykle potřebují víc než výsledek z ideálního scénáře. Důležitá je podpora modelů, tempo vydávání nových verzí, nástroje, dostupná odbornost i provozní cesta, kterou lze dlouhodobě udržovat.
SemiAnalysis uvádí, že její receptury se při měření především řídí doporučeními upstream projektů vLLM a SGLang, aby zachytily konfigurace, které mohou zákazníci realisticky nasadit, a nespoléhaly pouze na benchmarkový stack vytvořený pro jeden test. 1
Pro většinu potenciálních kupců AMD je proto relevantnější porovnání na upstream vLLM a SGLang než nejlepší výsledek ve vysoce specializovaném enginu ATOM. ATOM zůstává důkazem, že hardware AMD může v dobře zvoleném softwarovém prostředí nabídnout silný výkon. Jeho výsledek ale nelze automaticky zaměňovat s výkonem dostupným přes běžnou upstreamovou obslužnou vrstvu.
Jde o rozdíl v dostupnosti softwaru a náročnosti adopce, nikoli o tvrzení, že ATOM je neplatný nebo že specializované runtime prostředí nemá smysl.
Benchmark zároveň ukazuje, proč výsledky inferenčních testů rychle zastarávají. Telemetrie obsahuje konfiguraci AMD MI355X MoRI/SGLang měřenou 21. srpna vedle dalších konfigurací AMD získaných v jiných termínech. 4
Aktualizace z 21. srpna změnila pořadí alespoň jednoho srovnání. Ukazuje se tak, že plánování, optimalizace kernelů, přesuny mezipaměti nebo podpora modelu mohou během několika dní změnit zdánlivou hierarchii hardwaru. 14
Podobné varování přinesla i dřívější práce SemiAnalysis s MI355X a Qwen 3.5: postupné verze SGLang přinesly během 13 týdnů výrazný nárůst výkonu. 12
Při výběru akcelerátorů je proto nutné zaznamenat přesnou verzi runtime, konfiguraci, kvantizaci modelu, rozsah souběžnosti a cílovou úroveň interaktivity. Verdikt o hardwaru bez tohoto kontextu může být po další aktualizaci softwaru zavádějící.
AgentX je cennou aproximací dlouhých kontextů u programovacích agentů, není však reprezentativním průřezem všech produkčních úloh. Datová sada pochází z interního, dobrovolně poskytnutého korpusu stop a obsahuje 393 vybraných relací, nikoli veškerý provoz podnikových agentů. 8
Výsledky se mohou lišit například u:
V prvním srovnávacím souboru AgentX navíc chyběly Google TPU. Benchmark verze 1.0 proto nemůže nabídnout úplný závěr ve trojici Nvidia–AMD–Google. 1
Srovnání se také průběžně mění. SemiAnalysis avizovala budoucí doplnění systémů Nvidia Rubin, AMD MI455X UALoE72 a novějších TPU. Jejich zařazení může konkurenční obraz změnit. 111
SemiAnalysis zveřejnila datovou sadu AgentX, testovací nástroj, konfigurace, telemetrii i související materiály pod licencí Apache 2.0. 1
Dlouhodobý význam benchmarku tak možná nespočívá pouze v titulku o souboji Nvidie s AMD. AgentX podle SemiAnalysis už posloužil jako cílová zátěž pro více než 70 upstream pull requestů v projektech vLLM, SGLang, TensorRT-LLM, ATOM, AITER, Dynamo, LMCache a Mooncake. 1
Vývojáři obslužných frameworků díky tomu získávají reprodukovatelný způsob, jak optimalizovat skutečné chování agentů: vysoké opakované využití prefixu, velké KV mezipaměti, mnoho krátkých kroků, podagenty, přesuny mezipaměti, tlak na plánování i režii tokenizace.
AgentX posiluje argument, že softwarový a obslužný ekosystém Nvidie zůstává u inference dlouhého kontextu pro programovací agenty významnou konkurenční výhodou. V testovaných srovnáních SGLang činil náskok Nvidie podle SemiAnalysis až pětinásobek v nákladové efektivitě u GLM 5.3 a více než dvacetinásobek ve výkonu u Qwen 3.5 při stanovené úrovni interaktivity. 26
Benchmark ale nedokazuje, že Nvidia vyhrává vždy. AMD MI355X a ATOM v určitých účelově optimalizovaných konfiguracích ukázaly konkurenceschopný nebo lepší poměr ceny a výkonu a rychlý vývoj obslužného softwaru může pořadí znovu obrátit.
Nejrozumnější závěr pro týmy budující AI infrastrukturu proto není vybrat vítěze podle jediného titulku. Je třeba zopakovat měření s vlastním modelem, runtime prostředím, rozložením délek kontextu a požadavky na latenci.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
V testech SemiAnalysis byla Nvidia u modelu GLM 5.3 až pětkrát nákladově efektivnější než AMD při cíli 150 výstupních tokenů za sekundu na uživatele.
V testech SemiAnalysis byla Nvidia u modelu GLM 5.3 až pětkrát nákladově efektivnější než AMD při cíli 150 výstupních tokenů za sekundu na uživatele. Výsledek nevychází jen ze specifikací čipů. Rozhodující byla kombinace kapacity paměti, vysokého využití prefixové mezipaměti, práce s odkládáním do hostitelské paměti a obslužného softwaru, například TensorRT LLM.
AMD MI355X a specializovaný engine ATOM v některých scénářích nabídly vítězství nebo srovnatelný poměr ceny a výkonu.