AgentX परीक्षणों में GLM 5.3 पर Nvidia की लागत दक्षता AMD से लगभग 5 गुना बेहतर और Qwen 3.5 पर 90 आउटपुट टोकन प्रति सेकंड प्रति उपयोगकर्ता के लक्ष्य पर प्रदर्शन 20 गुना से अधिक बताया गया। [2][6] इस बढ़त का कारण केवल हार्डवेयर नहीं था; मेमोरी क्षमता, उच्च prefix cache reuse, host memory offload और TensorRT LLM जैसे se...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
SemiAnalysis के AgentX 1.0 बेंचमार्क से संकेत मिलता है कि लंबे संदर्भ वाले, multi-turn coding-agent workloads में Nvidia का CUDA-केंद्रित हार्डवेयर और serving ecosystem अब भी बड़ी बढ़त रखता है। परीक्षण किए गए SGLang कॉन्फिगरेशन में GLM 5.3 पर Nvidia की लागत-दक्षता AMD से 5 गुना तक बेहतर और Qwen 3.5 पर 90 आउटपुट टोकन प्रति सेकंड प्रति उपयोगकर्ता के लक्ष्य पर प्रदर्शन 20 गुना से अधिक बताया गया। 26
हालांकि, इसे Nvidia की हर स्थिति में जीत के रूप में पढ़ना सही नहीं होगा। AgentX किसी GPU की सार्वभौमिक रैंकिंग नहीं करता। इसके नतीजे मॉडल, accelerator, runtime, workload, concurrency और तय responsiveness target के संयोजन पर निर्भर हैं। AMD का MI355X और उसका ATOM serving engine कुछ चुनिंदा कॉन्फिगरेशन में प्रतिस्पर्धी, बराबर या बेहतर साबित हुआ। 14
AgentX 1.0, SemiAnalysis के InferenceX v3 benchmark suite का हिस्सा है। सामान्य inference benchmarks अक्सर तय input और output लंबाई पर आधारित होते हैं—जैसे 8k input और 1k output tokens। इसके विपरीत AgentX वास्तविक multi-turn coding-agent traffic को दोहराता है, जिसमें context लगभग 10 लाख tokens तक पहुंच सकता है। 13
v1.0 dataset में 393 opt-in और anonymized Claude Code sessions शामिल हैं। योग्य sessions में कम-से-कम 20 requests थीं। डेटा से duplicate requests, कुछ client-specific calls और 990,000 tokens से अधिक के reconstructed inputs को हटाया गया। प्रत्येक request में median input 142,000 tokens और median output 444 tokens था; 44% sessions में subagents शामिल थे। 8
यह पैटर्न महत्वपूर्ण है क्योंकि coding agents हर नए request के साथ बड़ी conversation या codebase के बदलते हुए संस्करण को फिर से भेजते हैं। इसलिए AgentX केवल peak throughput नहीं, बल्कि लंबे समय तक interactive serving, cache management और कई concurrent sessions को responsive बनाए रखने की क्षमता को परखता है।
व्यापक रूप से उपलब्ध SGLang serving configurations में Nvidia की बढ़त सबसे स्पष्ट दिखी:
इन आंकड़ों को किसी पूरी product line का एकल score नहीं समझना चाहिए। InferenceX अलग-अलग platforms को तय interactivity levels पर तुलना करता है और प्रत्येक platform के observed serving envelope के आधार पर लागत रिपोर्ट करता है। 79
व्यावहारिक अर्थ यह है कि केवल 8k-input/1k-output जैसे fixed-length test में कोई accelerator प्रतिस्पर्धी दिख सकता है, लेकिन multi-turn agent traffic में पीछे रह सकता है। जब सिस्टम को एक साथ कई बड़े, आंशिक रूप से दोहराए गए contexts को responsive रखना हो, तब memory hierarchy, cache reuse और serving software निर्णायक बन जाते हैं।
AgentX traffic में एक request से अगली request तक context का बड़ा हिस्सा दोहराया जाता है। SemiAnalysis के अनुसार, इन agentic traces में prefix या KV-cache hit rate अक्सर 95% से अधिक था। 1
इसका मतलब है कि सिस्टम हर बार पूरी तरह नया prompt process नहीं कर रहा। उसे बड़े cached states को सुरक्षित रखना, ढूंढना, transfer करना और दोबारा इस्तेमाल करना होता है, जबकि नया output अपेक्षाकृत छोटा होता है। इसलिए cache की दक्षता throughput और लागत—दोनों पर सीधा असर डालती है।
Accelerator की usable high-bandwidth memory यह तय करती है कि कितना KV-cache state उसी डिवाइस पर resident रह सकता है। जब working set उपलब्ध memory से बड़ा हो जाता है, serving system को data host memory में भेजना या cache state को किसी धीमे path पर manage करना पड़ सकता है। 1
Host-memory offload से ज्यादा sessions संभालना संभव हो सकता है, लेकिन इसके साथ bandwidth और latency की कीमत आती है। जो platform अधिक active cache को accelerator memory में रख सके या data movement को बेहतर तरीके से schedule कर सके, वह समान लागत पर अधिक responsiveness दे सकता है।
SemiAnalysis ने TensorRT-LLM की boundary-aware incremental tokenization को भी महत्वपूर्ण बताया। यह तरीका हर बार पूरे बदलते हुए prompt को tokenize करने के बजाय स्थिर boundaries पहचानता है और केवल नया जोड़ा गया material process करता है। 1
Coding agents में context बहुत बड़ा, लेकिन output अक्सर कुछ सौ tokens का होता है। ऐसे में CPU-side preprocessing और बार-बार tokenization serving overhead का महत्वपूर्ण हिस्सा बन सकते हैं।
बड़ा सबक यह है कि inference price-performance का परिणाम केवल FLOPS या memory bandwidth से तय नहीं होता। यह hardware × runtime × model × workload × latency target का संयुक्त परिणाम है।
AgentX ने Nvidia की हर मामले में जीत नहीं दिखाई। SemiAnalysis ने कुछ model, throughput और engine combinations में AMD की मजबूत बढ़त या लगभग बराबरी दर्ज की, खासकर MI355X और AMD के ATOM serving engine के साथ। 1
Telemetry में MI355X के लिए ATOM, SGLang, vLLM और अन्य configurations के अलग-अलग परिणाम दिए गए हैं। यह अंतर अहम है, क्योंकि “AMD का परिणाम” इस बात पर काफी निर्भर करता है कि कौन-सा serving engine, model implementation और tuning इस्तेमाल की गई। 4
ATOM की specialized scheduling, cache handling और AMD-केंद्रित kernels उन workloads में अच्छा प्रदर्शन कर सकते हैं जहां model और बड़े KV-cache की जरूरत MI355X की memory configuration के अनुकूल हो। यानी AMD सही runtime और tuning के साथ काफी प्रतिस्पर्धी हो सकता है।
कोई specialized engine हार्डवेयर की क्षमता का बेहतरीन उदाहरण दिखा सकता है। लेकिन infrastructure खरीदारों को केवल best-case kernel result नहीं चाहिए। उन्हें model coverage, नियमित software releases, tooling, deployment expertise और लंबे समय तक maintain किया जा सकने वाला operational setup भी चाहिए।
SemiAnalysis के अनुसार, उसके recipes मुख्य रूप से upstream vLLM और SGLang guidance का पालन करते हैं, ताकि ऐसे configurations को मापा जा सके जिन्हें ग्राहक वास्तविक रूप से deploy कर सकते हैं, न कि केवल benchmark के लिए तैयार किए गए stack को। 1
इसीलिए अधिकांश संभावित AMD खरीदारों के लिए upstream vLLM और SGLang पर प्रदर्शन, ATOM के अत्यधिक optimized परिणामों की तुलना में अधिक decision-relevant है। ATOM यह महत्वपूर्ण प्रमाण देता है कि AMD हार्डवेयर उपयुक्त software environment में मजबूत प्रदर्शन कर सकता है, लेकिन उसके परिणाम को सामान्य upstream serving layer के परिणाम के बराबर नहीं माना जाना चाहिए।
यह adoption और software availability का अंतर है—ATOM के invalid होने या specialized runtimes के बेकार होने का दावा नहीं।
AgentX यह भी दिखाता है कि inference comparisons कितनी तेजी से पुराने हो सकते हैं। Telemetry में 21 अगस्त की AMD MI355X MoRI/SGLang configuration के साथ अलग-अलग तारीखों पर मापे गए अन्य AMD configurations भी शामिल हैं। 4
21 अगस्त के software update ने कम-से-कम एक तुलना का performance ordering बदल दिया। इससे पता चलता है कि scheduling, kernels, cache movement और model support में सुधार कुछ ही दिनों में hardware hierarchy की तस्वीर बदल सकते हैं। 14
Qwen 3.5 पर MI355X के पहले के SemiAnalysis परीक्षण भी यही संकेत देते हैं: 13 सप्ताह के दौरान successive SGLang releases से प्रदर्शन में बड़ा सुधार हुआ। 12
इसलिए accelerator की तुलना करते समय runtime version, configuration, model quantization, concurrency range और target interactivity को दर्ज करना जरूरी है। इन विवरणों के बिना दिया गया hardware verdict software update के बाद भ्रामक हो सकता है।
AgentX लंबे संदर्भ वाले coding agents के लिए उपयोगी proxy है, लेकिन यह हर production workload का प्रतिनिधि सर्वेक्षण नहीं है। इसका dataset एक internal, opt-in trace corpus से आया है और इसमें enterprise-agent traffic के बजाय चुने गए 393 sessions शामिल हैं। 8
नतीजे इन workloads में अलग हो सकते हैं:
इस शुरुआती comparative result set में Google TPU शामिल नहीं थे। इसलिए AgentX v1.0 Nvidia, AMD और Google के बीच कोई तीन-तरफा निष्कर्ष स्थापित नहीं करता। 1
तुलना आगे भी बदल सकती है। SemiAnalysis ने Nvidia Rubin, AMD MI455X UALoE72 और नई TPU systems को भविष्य के comparison points के रूप में सूचीबद्ध किया है। इनके शामिल होने पर competitive picture बदल सकती है। 111
SemiAnalysis ने AgentX dataset, harness, configurations, telemetry और संबंधित सामग्री को Apache 2.0 license के तहत जारी किया। 1
इस release का दीर्घकालीन महत्व शायद केवल “Nvidia बनाम AMD” headline से अधिक है। SemiAnalysis के अनुसार, AgentX पहले ही vLLM, SGLang, TensorRT-LLM, ATOM, AITER, Dynamo, LMCache और Mooncake जैसे projects में 70 से अधिक upstream pull requests के लिए target workload बन चुका था। 1
इससे serving-framework developers को वास्तविक agent behavior के अनुरूप reproducible optimization target मिलता है—जिसमें high prefix reuse, बड़े KV caches, कई छोटे turns, subagents, cache transfers, scheduling pressure और tokenization overhead शामिल हैं।
AgentX लंबे संदर्भ वाले coding-agent inference के लिए Nvidia के software और serving ecosystem की बड़ी बढ़त को मजबूत करता है। परीक्षण किए गए SGLang comparisons में Nvidia की बढ़त GLM 5.3 पर लागत-दक्षता में 5 गुना तक और Qwen 3.5 पर तय interactivity target पर प्रदर्शन में 20 गुना से अधिक बताई गई। 26
लेकिन benchmark यह साबित नहीं करता कि Nvidia हमेशा जीतेगा। AMD का MI355X और ATOM कुछ purpose-built configurations में प्रतिस्पर्धी या बेहतर price-performance दे सकते हैं, और serving software में तेज बदलाव rankings उलट सकते हैं। Infrastructure teams के लिए सबसे उपयोगी निष्कर्ष किसी एक headline number से विजेता चुनना नहीं, बल्कि अपने model, runtime, context distribution और latency target पर तुलना को दोबारा चलाना है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
AgentX परीक्षणों में GLM 5.3 पर Nvidia की लागत दक्षता AMD से लगभग 5 गुना बेहतर और Qwen 3.5 पर 90 आउटपुट टोकन प्रति सेकंड प्रति उपयोगकर्ता के लक्ष्य पर प्रदर्शन 20 गुना से अधिक बताया गया। [2][6]
AgentX परीक्षणों में GLM 5.3 पर Nvidia की लागत दक्षता AMD से लगभग 5 गुना बेहतर और Qwen 3.5 पर 90 आउटपुट टोकन प्रति सेकंड प्रति उपयोगकर्ता के लक्ष्य पर प्रदर्शन 20 गुना से अधिक बताया गया। [2][6] इस बढ़त का कारण केवल हार्डवेयर नहीं था; मेमोरी क्षमता, उच्च prefix cache reuse, host memory offload और TensorRT LLM जैसे serving software ने भी अहम भूमिका निभाई। [1]
AMD का MI355X और ATOM इंजन कुछ मॉडल, throughput और serving engine कॉन्फिगरेशन में Nvidia के बराबर या उससे बेहतर रहा। इसलिए अधिकांश खरीदारों के लिए upstream vLLM और SGLang की तुलना अधिक उपयोगी है। [1][4]