Dalam ujian AgentX SemiAnalysis, Nvidia sehingga 5 kali lebih cekap kos berbanding AMD pada GLM 5.3 dengan sasaran 150 token output sesaat bagi setiap pengguna, serta mencatat prestasi lebih 20 kali ganda pada Qwen 3.... Kelebihan itu datang daripada gabungan kapasiti memori, penggunaan semula cache awalan yang ting...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Penanda aras AgentX 1.0 oleh SemiAnalysis menguatkan dakwaan bahawa ekosistem perkakasan dan penyajian berasaskan CUDA milik Nvidia masih mempunyai kelebihan besar untuk beban kerja ejen pengekodan dengan konteks panjang. Dalam konfigurasi SGLang yang diuji, Nvidia mencatat sehingga 5 kali ganda kecekapan kos pada GLM 5.3 dan lebih 20 kali ganda prestasi pada Qwen 3.5 pada sasaran 90 token output sesaat bagi setiap pengguna. 26
Namun, keputusan ini bukan bermaksud Nvidia sentiasa mengatasi AMD. AgentX mengukur gabungan model, pemecut AI, runtime, corak beban kerja, tahap keserentakan dan sasaran respons tertentu. MI355X AMD bersama enjin penyajian ATOM pula memberikan keputusan kompetitif dalam beberapa konfigurasi. 14
AgentX 1.0 ialah sebahagian daripada suite penanda aras InferenceX v3 oleh SemiAnalysis. Berbeza daripada ujian inferens konvensional yang menggunakan panjang input dan output tetap, AgentX memainkan semula trafik ejen pengekodan berbilang giliran dengan konteks yang sangat panjang — termasuk senario yang menghampiri 1 juta token. 13
Set data v1.0 mengandungi 393 sesi Claude Code tanpa nama yang menyertai kajian secara pilihan. Sesi yang dipilih perlu mempunyai sekurang-kurangnya 20 permintaan. Data itu diproses untuk membuang permintaan pendua, panggilan tertentu yang khusus kepada klien dan input yang dibina semula melebihi 990,000 token. Median setiap permintaan mengandungi 142,000 token input dan 444 token output, manakala 44% sesi menggunakan subejen. 8
Corak ini penting kerana ejen pengekodan berulang kali menghantar versi perbualan atau pangkalan kod yang besar dan sentiasa berubah. Maka, AgentX lebih menilai keupayaan penyajian interaktif secara berterusan — bukan sekadar satu arahan panjang yang diikuti jawapan panjang.
Kelebihan paling ketara Nvidia muncul dalam perbandingan yang menggunakan konfigurasi SGLang yang tersedia secara lebih meluas:
Angka ini perlu dibaca sebagai perbandingan pada titik operasi tertentu, bukannya satu skor muktamad untuk keseluruhan barisan produk. InferenceX membandingkan platform pada tahap interaktiviti yang ditetapkan dan mengira kos berdasarkan konfigurasi penyajian terbaik yang diperhatikan bagi setiap platform. 79
Implikasi praktikalnya: ujian tetap seperti input 8k dan output 1k mungkin terlepas kesesakan yang menjadi penentu dalam trafik ejen berbilang giliran. Sesuatu pemecut mungkin kelihatan kompetitif dari segi kadar pemprosesan terpencil, tetapi ketinggalan apabila perlu memastikan banyak konteks besar yang berulang kekal responsif pada masa yang sama.
Beban kerja AgentX menggunakan semula sebahagian besar konteks daripada satu permintaan ke permintaan berikutnya. SemiAnalysis menyatakan kadar cache awalan atau cache KV lazimnya melebihi 95% dalam jejak ejen ini. 1
Keadaan tersebut mengubah keseimbangan antara proses prefill dan decode. Sistem tidak perlu memproses arahan baharu sepenuhnya setiap kali; sebaliknya, ia mengekalkan dan melanjutkan keadaan cache yang besar sambil menghasilkan respons yang agak pendek. Keupayaan menyimpan, mencari, memindahkan dan menggunakan semula keadaan itu menjadi faktor utama kepada kos serta kadar respons.
Kapasiti memori lebar jalur tinggi yang boleh digunakan menentukan jumlah keadaan cache KV yang boleh kekal dalam pemecut. Apabila set kerja melebihi memori peranti, sistem mungkin perlu memindahkan data ke memori hos atau mengurus keadaan cache melalui laluan yang lebih perlahan. 1
Pemindahan ke memori hos boleh meningkatkan jumlah sesi yang disokong, tetapi ia membawa kos dari segi lebar jalur dan kependaman. Platform yang mampu mengekalkan lebih banyak cache aktif dalam memori tempatan — atau mengurus pemindahannya dengan lebih cekap — boleh mengekalkan tahap interaktiviti lebih tinggi pada kos yang sama.
SemiAnalysis turut menonjolkan tokenisasi tambahan berasaskan sempadan dalam TensorRT-LLM. Daripada menukar keseluruhan arahan yang sentiasa berubah kepada token berulang kali, pendekatan ini mengenal pasti sempadan yang stabil dan hanya memproses bahan yang baharu ditambah. 1
Pengoptimuman ini sangat relevan untuk ejen pengekodan: permintaan boleh mempunyai konteks yang amat besar tetapi hanya menghasilkan beberapa ratus token. Dalam keadaan sedemikian, prapemprosesan di CPU dan tokenisasi berulang boleh menjadi sebahagian penting daripada beban penyajian.
Kesimpulan lebih luasnya ialah prestasi-harga inferens bergantung pada perkakasan × runtime × model × beban kerja × sasaran kependaman. FLOPS, lebar jalur memori atau satu angka kadar pemprosesan sahaja tidak mampu menggambarkan keseluruhan keputusan.
AgentX tidak menunjukkan kemenangan mutlak Nvidia. SemiAnalysis melaporkan kemenangan atau keputusan hampir setara untuk AMD dalam gabungan model, kadar pemprosesan dan enjin tertentu — khususnya MI355X yang dipadankan dengan enjin penyajian ATOM AMD. 1
Data telemetri membezakan keputusan MI355X untuk ATOM, SGLang, vLLM dan konfigurasi lain. Perbezaan ini penting kerana keputusan “AMD” sangat bergantung pada enjin penyajian, pelaksanaan model dan tahap pengoptimuman yang digunakan dalam ujian. 4
Penjadualan khusus ATOM, pengurusan cache dan kernel yang disasarkan kepada AMD boleh berfungsi dengan baik apabila model serta beban kerja sepadan dengan konfigurasi memori MI355X. Ringkasnya, AMD mampu menjadi sangat kompetitif apabila pengendali sanggup menggunakan runtime yang dioptimumkan khusus untuk platform tersebut.
Enjin khusus boleh menunjukkan kemampuan perkakasan dalam keadaan yang menguntungkan. Tetapi pembeli infrastruktur biasanya memerlukan lebih daripada keputusan kernel terbaik. Mereka juga memerlukan sokongan pelbagai model, kekerapan keluaran, alat pembangunan, kepakaran penggunaan dan laluan operasi yang boleh diselenggara dalam jangka panjang.
SemiAnalysis menyatakan bahawa resipi ujiannya sebahagian besarnya mengikuti panduan upstream vLLM dan SGLang bagi mengukur konfigurasi yang realistik untuk digunakan pelanggan, bukannya hanya bergantung pada stack khusus untuk penanda aras. 1
Oleh itu, bagi kebanyakan bakal pembeli AMD, perbandingan yang lebih berguna ialah keputusan upstream vLLM dan SGLang. ATOM kekal sebagai bukti bahawa perkakasan AMD boleh memberikan prestasi yang kukuh dalam persekitaran perisian yang sesuai, tetapi keputusannya tidak wajar disamakan terus dengan prestasi yang tersedia melalui lapisan penyajian upstream yang lebih umum.
Ini ialah perbezaan dari segi penggunaan dan ketersediaan perisian — bukan dakwaan bahawa ATOM tidak sah atau runtime khusus tidak bernilai.
Penanda aras ini turut menunjukkan mengapa perbandingan inferens cepat berubah. Telemetri menyenaraikan konfigurasi AMD MI355X MoRI/SGLang bertarikh 21 Ogos, di samping konfigurasi AMD lain yang diukur pada tarikh berbeza. 4
Kemas kini perisian pada 21 Ogos mengubah susunan sekurang-kurangnya satu perbandingan. Ini menunjukkan bagaimana penambahbaikan penjadualan, kernel, pemindahan cache dan sokongan model boleh mengubah hierarki perkakasan yang kelihatan dalam masa beberapa hari. 14
Kajian terdahulu SemiAnalysis mengenai MI355X dan Qwen 3.5 memberikan amaran yang sama: beberapa keluaran SGLang berturut-turut menghasilkan peningkatan prestasi besar dalam tempoh 13 minggu. 12
Bagi pembeli, langkah paling praktikal ialah merekod versi runtime, konfigurasi, kuantisasi model, julat keserentakan dan sasaran interaktiviti yang tepat ketika membandingkan pemecut. Keputusan perkakasan tanpa konteks ini berisiko menjadi mengelirukan apabila perisian penyajian terus bertambah baik.
AgentX ialah proksi yang berguna untuk ejen pengekodan konteks panjang, tetapi ia bukan gambaran menyeluruh semua beban kerja produksi. Set datanya datang daripada korpus jejak dalaman yang menyertai kajian secara pilihan dan mengandungi 393 sesi terpilih, bukannya keseluruhan trafik ejen perusahaan. 8
Keputusan mungkin berbeza untuk:
Google TPU juga tidak termasuk dalam set keputusan perbandingan awal ini. Maka, AgentX v1.0 belum boleh mengesahkan kesimpulan tiga penjuru antara Nvidia, AMD dan Google. 1
Perbandingan ini juga sentiasa berubah. SemiAnalysis menyenaraikan Nvidia Rubin, AMD MI455X UALoE72 dan sistem TPU generasi baharu sebagai tambahan atau titik perbandingan pada masa akan datang. Kemasukan sistem tersebut boleh mengubah gambaran persaingan. 111
SemiAnalysis menerbitkan set data AgentX, harness, konfigurasi, telemetri dan bahan berkaitan di bawah lesen Apache 2.0. 1
Kepentingan jangka panjang AgentX mungkin bukan sekadar tajuk “Nvidia lawan AMD”, tetapi usaha kejuruteraan yang dicetuskan olehnya. SemiAnalysis melaporkan AgentX sudah menjadi sasaran beban kerja untuk lebih 70 pull request upstream merentasi projek seperti vLLM, SGLang, TensorRT-LLM, ATOM, AITER, Dynamo, LMCache dan Mooncake. 1
Ini memberikan pembangun framework penyajian cara yang boleh diulang untuk mengoptimumkan tingkah laku ejen sebenar: penggunaan semula awalan yang tinggi, cache KV yang besar, banyak giliran pendek, subejen, pemindahan cache, tekanan penjadualan dan kos tokenisasi.
AgentX mengukuhkan hujah bahawa perisian Nvidia dan ekosistem penyajiannya masih menjadi kelebihan besar untuk inferens ejen pengekodan konteks panjang. Dalam perbandingan SGLang yang diuji, Nvidia mencatat sehingga 5 kali ganda kecekapan kos pada GLM 5.3 dan lebih 20 kali ganda prestasi pada Qwen 3.5 pada sasaran interaktiviti tertentu. 26
Namun, penanda aras ini tidak membuktikan Nvidia sentiasa menang. MI355X AMD dan ATOM menunjukkan bahawa prestasi-harga yang kompetitif atau lebih baik boleh dicapai dalam konfigurasi khusus, manakala peningkatan pantas dalam perisian penyajian boleh mengubah kedudukan dalam masa singkat.
Bagi pasukan infrastruktur, kesimpulan paling berguna bukanlah memilih pemenang berdasarkan satu angka utama. Sebaliknya, ulangi perbandingan menggunakan model, runtime, taburan konteks dan sasaran kependaman yang benar-benar digunakan dalam operasi anda.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Dalam ujian AgentX SemiAnalysis, Nvidia sehingga 5 kali lebih cekap kos berbanding AMD pada GLM 5.3 dengan sasaran 150 token output sesaat bagi setiap pengguna, serta mencatat prestasi lebih 20 kali ganda pada Qwen 3....
Dalam ujian AgentX SemiAnalysis, Nvidia sehingga 5 kali lebih cekap kos berbanding AMD pada GLM 5.3 dengan sasaran 150 token output sesaat bagi setiap pengguna, serta mencatat prestasi lebih 20 kali ganda pada Qwen 3.... Kelebihan itu datang daripada gabungan kapasiti memori, penggunaan semula cache awalan yang tinggi, pengurusan pemindahan ke memori hos dan perisian penyajian seperti TensorRT LLM — bukan spesifikasi perkakasan semata...
MI355X AMD bersama enjin ATOM masih mencatat kemenangan atau keputusan hampir setara dalam konfigurasi tertentu, menjadikan keputusan upstream vLLM dan SGLang lebih relevan kepada kebanyakan pembeli berbanding runtime...