SemiAnalysis’in AgentX testlerinde Nvidia, GLM 5.3’te kullanıcı başına saniyede 150 çıktı tokenı hedefinde AMD’ye kıyasla 5 kata kadar daha iyi maliyet verimliliği sağladı; Qwen 3.5’te ise kullanıcı başına saniyede 90... Avantaj yalnızca ham donanım özelliklerinden kaynaklanmadı; bellek kapasitesi, yüksek prefix cac...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
SemiAnalysis’in AgentX 1.0 benchmark’ı, Nvidia’nın CUDA merkezli donanım ve yapay zekâ modeli sunum ekosisteminin, gerçekçi ve uzun bağlamlı kodlama ajanı iş yüklerinde hâlâ belirgin bir avantaj taşıdığını gösteriyor. Test edilen SGLang yapılandırmalarında Nvidia için GLM 5.3’te 5 kata kadar daha iyi maliyet verimliliği, Qwen 3.5’te ise kullanıcı başına saniyede 90 çıktı tokenı hedefinde 20 katın üzerinde performans farkı raporlandı. 26
Bu sonuç dikkat çekici olsa da Nvidia’nın AMD karşısında her koşulda kazandığını kanıtlamıyor. AgentX; belirli bir model, hızlandırıcı, çalışma zamanı, iş yükü, eşzamanlılık seviyesi ve yanıt verme hedefinin birleşimini ölçüyor. AMD’nin MI355X hızlandırıcısı ve ATOM sunum motoru da belirli yapılandırmalarda rekabetçi, hatta daha iyi sonuçlar verdi. Yazılım güncellemeleri bazı sistemlerin sıralamasını da değiştirdi. 14
AgentX 1.0, SemiAnalysis’in InferenceX v3 benchmark ailesinin bir parçası. Sabit uzunlukta giriş ve çıkışlardan oluşan geleneksel çıkarım testlerinin aksine, çok uzun bağlamlı ve çok turlu kodlama ajanı trafiğini yeniden oynatıyor. Bazı senaryolarda bağlam uzunluğu yaklaşık 1 milyon tokene yaklaşıyor. 13
v1.0 veri setinde, kullanıcıların gönüllü olarak paylaştığı anonimleştirilmiş 393 Claude Code oturumu bulunuyor. Uygun oturumlarda en az 20 istek yer alıyor. Yinelenen istekler, bazı istemciye özgü çağrılar ve 990.000 tokenın üzerindeki yeniden oluşturulmuş girdiler veri işleme sürecinden çıkarıldı. İstek başına medyan değer 142.000 giriş tokenı ve 444 çıkış tokenı olurken, oturumların yüzde 44’ünde alt ajanlar kullanıldı. 8
Bu trafik modeli önemli; çünkü kodlama ajanları her turda büyük bir konuşma geçmişinin veya kod tabanının güncellenmiş hâlini yeniden gönderiyor. Dolayısıyla benchmark tek bir uzun istemin ardından uzun bir yanıt üretme hızından çok, büyük ve kısmen tekrarlanan bağlamları sürekli etkileşimli biçimde sunma kabiliyetini ölçüyor.
Nvidia’nın en belirgin üstünlüğü, yaygın biçimde erişilebilen SGLang sunum yapılandırmalarındaki karşılaştırmalarda görüldü:
Bu rakamlar, tek bir ürün ailesi için evrensel puanlar değil; belirli çalışma noktalarındaki sonuçlar olarak okunmalı. InferenceX, platformları belirlenmiş etkileşim düzeylerinde karşılaştırıyor ve maliyeti her platformda gözlemlenen sunum kapasitesine göre hesaplıyor. 79
Pratik sonuç şu: 8 bin giriş ve 1 bin çıkış tokenından oluşan sabit uzunluklu bir test, çok turlu ajan trafiğinde kritik hâle gelen darboğazları gözden kaçırabilir. Bir hızlandırıcı izole toplam üretim hızında rekabetçi görünürken, aynı anda çok sayıda büyük ve kısmen tekrarlanan bağlamı yanıt verebilir tutmak gerektiğinde geride kalabilir.
AgentX iş yüklerinde bir istekten diğerine bağlamın büyük bölümü yeniden kullanılıyor. SemiAnalysis, bu ajan izlerinde prefix veya KV-cache isabet oranlarının sıklıkla yüzde 95’in üzerine çıktığını belirtiyor. 1
Bu durum, ön işleme ve çözümleme aşamaları arasındaki dengeyi değiştiriyor. Sistem her seferinde tamamen yeni bir istemi işlemek yerine, büyük önbelleğe alınmış durumları koruyup genişletiyor ve görece kısa yanıtlar üretiyor. Bu durumların verimli biçimde saklanması, bulunması, taşınması ve yeniden kullanılması hem performans hem de maliyet açısından merkezi önem kazanıyor.
Kullanılabilir yüksek bant genişlikli bellek kapasitesi, KV-cache durumunun ne kadarının hızlandırıcı üzerinde tutulabileceğini belirliyor. Etkin çalışma kümesi cihaz belleğini aştığında sistemler verileri ana belleğe taşımak veya önbellek durumunu daha yavaş bir yol üzerinden yönetmek zorunda kalabiliyor. 1
Ana bellek aktarımı desteklenen oturum sayısını artırabilir; ancak bant genişliği ve gecikme maliyeti yaratır. Aktif önbelleğin daha büyük bölümünü cihaz belleğinde tutabilen veya veri hareketini daha verimli yönetebilen bir platform, aynı maliyetle daha yüksek etkileşim düzeyini koruyabilir.
SemiAnalysis ayrıca TensorRT-LLM’nin sınır farkındalıklı artımlı tokenizasyon yaklaşımına dikkat çekti. Bu yöntemde, gelişen istemin tamamı tekrar tekrar tokenleştirilmek yerine sabit kalan sınırlar belirleniyor ve yalnızca yeni eklenen bölüm işleniyor. 1
Bu optimizasyon kodlama ajanları için özellikle önemli. İstekler yüz binlerce tokenlık bağlam içerebilirken yanıtlar yalnızca birkaç yüz tokenla sınırlı kalabiliyor. Böyle bir iş yükünde CPU tarafındaki ön işleme ve tekrarlanan tokenizasyon, sunum maliyetinin anlamlı bir bölümünü oluşturabilir.
Daha geniş ders şu: Çıkarımda fiyat-performans, donanım × çalışma zamanı × model × iş yükü × gecikme hedefi bileşimidir. FLOPS, bellek bant genişliği veya tek bir toplam üretim hızı bu sonucu tek başına açıklayamaz.
AgentX, Nvidia’nın her senaryoda kazandığı bir tablo ortaya koymadı. SemiAnalysis, özellikle AMD’nin ATOM sunum motoruyla eşleştirilen MI355X üzerinde, seçili model, üretim hızı ve motor kombinasyonlarında AMD’nin önemli kazanımlar veya başa baş sonuçlar elde ettiğini bildirdi. 1
Telemetri, MI355X sonuçlarını ATOM, SGLang, vLLM ve diğer yapılandırmalara ayrı ayrı ayırıyor. Bu ayrım kritik; çünkü “AMD sonucu” kullanılan sunum motoruna, model uygulamasına ve yapılan ayarlara büyük ölçüde bağlı. 4
ATOM’un uzmanlaşmış zamanlama yaklaşımı, önbellek yönetimi ve AMD’ye odaklanan çekirdekleri, model ve iş yükü MI355X’in bellek düzenine uygun olduğunda iyi sonuç verebiliyor. Başka bir deyişle AMD, platforma özel optimize edilmiş bir çalışma zamanını kullanmaya hazır operatörler için oldukça rekabetçi olabilir.
Özel bir motor, donanımın uygun koşullarda neler yapabileceğini gösterebilir. Ancak altyapı satın alan şirketler genellikle yalnızca en iyi çekirdek performansına bakmaz. Model desteği, güncelleme sıklığı, araçlar, dağıtım uzmanlığı ve uzun vadede sürdürülebilecek bir işletim modeli de önemlidir.
SemiAnalysis, müşterilerin gerçekçi biçimde dağıtabileceği yapılandırmaları ölçmek amacıyla tariflerini ağırlıklı olarak upstream vLLM ve SGLang yönergelerini izleyerek hazırladığını söylüyor; yalnızca benchmark’a özel bir yazılım yığınına dayanmıyor. 1
Bu nedenle çoğu potansiyel AMD alıcısı için karar açısından daha anlamlı karşılaştırma, upstream vLLM ve SGLang üzerindeki sonuçlar. ATOM, AMD donanımının uygun bir yazılım ortamında güçlü performans verebildiğine dair önemli bir kanıt olmaya devam ediyor; ancak sonucu, yaygın upstream sunum katmanında elde edilebilecek performansla aynı kabul etmemek gerekiyor.
Bu, benimsenme ve yazılım erişilebilirliğiyle ilgili bir ayrım. ATOM’un geçersiz olduğu veya özel çalışma zamanlarının değer taşımadığı anlamına gelmiyor.
Benchmark, çıkarım karşılaştırmalarının neden hızla eskidiğini de gösteriyor. Telemetride, 21 Ağustos tarihli bir AMD MI355X MoRI/SGLang yapılandırmasının yanı sıra farklı tarihlerde ölçülen başka AMD yapılandırmaları da yer alıyor. 4
21 Ağustos’taki bir yazılım güncellemesi, en az bir karşılaştırmadaki sıralamayı değiştirdi. Bu durum; zamanlama iyileştirmelerinin, çekirdeklerin, önbellek hareketinin ve model desteğinin yalnızca birkaç gün içinde görünen donanım hiyerarşisini değiştirebileceğini ortaya koyuyor. 14
SemiAnalysis’in Qwen 3.5 üzerindeki önceki MI355X çalışması da benzer bir uyarı içeriyor: Art arda yayımlanan SGLang sürümleri, 13 haftalık dönemde önemli performans artışları sağladı. 12
Alıcılar için pratik çıkarım, hızlandırıcıları karşılaştırırken çalışma zamanının tam sürümünü, yapılandırmayı, model niceleme ayarını, eşzamanlılık aralığını ve hedef etkileşim düzeyini kaydetmek. Bu bağlam olmadan verilen bir donanım hükmü, sunum yazılımı geliştikçe yanıltıcı hâle gelebilir.
AgentX, uzun bağlamlı kodlama ajanları için değerli bir iş yükü temsili olsa da her üretim senaryosunu temsil eden bir nüfus sayımı değil. Veri seti, şirket içi ve gönüllülük esaslı bir iz havuzundan seçilen 393 oturuma dayanıyor; tüm kurumsal ajan trafiğini kapsamıyor. 8
Sonuçlar şu alanlarda farklılaşabilir:
İlk karşılaştırmalı sonuç setinde Google TPU’lar da bulunmuyor. Bu nedenle AgentX v1.0, Nvidia, AMD ve Google arasında üçlü bir sıralama ortaya koyamaz. 1
Karşılaştırma aynı zamanda sürekli değişen bir hedef. SemiAnalysis, Nvidia Rubin, AMD MI455X UALoE72 ve yeni nesil TPU sistemlerini gelecekteki karşılaştırmalara eklenecek sistemler arasında gösterdi. Bu sistemlerin dahil edilmesi rekabet tablosunu değiştirebilir. 111
SemiAnalysis, AgentX veri setini, test aracını, yapılandırmaları, telemetriyi ve ilgili materyalleri Apache 2.0 lisansı altında yayımladı. 1
Benchmark’ın uzun vadeli etkisi, tek bir Nvidia-AMD manşetinden çok, teşvik ettiği mühendislik çalışmasında yatabilir. SemiAnalysis, AgentX’in vLLM, SGLang, TensorRT-LLM, ATOM, AITER, Dynamo, LMCache ve Mooncake gibi projelerde 70’ten fazla upstream pull request için hedef iş yükü hâline geldiğini bildirdi. 1
Bu, sunum çerçevesi geliştiricilerine gerçek ajan davranışlarını optimize etmek için tekrarlanabilir bir yöntem sağlıyor: yüksek prefix-cache kullanımı, büyük KV önbellekleri, çok sayıda kısa tur, alt ajanlar, önbellek transferleri, zamanlama baskısı ve tokenizasyon maliyeti.
AgentX, uzun bağlamlı kodlama ajanlarının çıkarımında Nvidia’nın yazılım ve sunum ekosisteminin önemli bir avantaj olmaya devam ettiği tezini güçlendiriyor. Test edilen SGLang karşılaştırmalarında Nvidia’nın GLM 5.3’te maliyet verimliliği 5 kata kadar, Qwen 3.5’te ise belirlenen etkileşim hedefinde performansı 20 katın üzerinde daha iyi raporlandı. 26
Ancak benchmark, Nvidia’nın her zaman kazandığını göstermiyor. AMD’nin MI355X ve ATOM kombinasyonu, seçili ve amaca özel yapılandırmalarda rekabetçi veya daha iyi fiyat-performans sunabildi. Ayrıca sunum yazılımındaki hızlı gelişmeler sıralamaları tersine çevirebiliyor.
Altyapı ekipleri için en sağlıklı sonuç, tek bir manşet rakamına bakarak kazanan seçmek değil; kendi modelleri, çalışma zamanları, bağlam dağılımları ve gecikme hedefleriyle karşılaştırmayı yeniden üretmek.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SemiAnalysis’in AgentX testlerinde Nvidia, GLM 5.3’te kullanıcı başına saniyede 150 çıktı tokenı hedefinde AMD’ye kıyasla 5 kata kadar daha iyi maliyet verimliliği sağladı; Qwen 3.5’te ise kullanıcı başına saniyede 90...
SemiAnalysis’in AgentX testlerinde Nvidia, GLM 5.3’te kullanıcı başına saniyede 150 çıktı tokenı hedefinde AMD’ye kıyasla 5 kata kadar daha iyi maliyet verimliliği sağladı; Qwen 3.5’te ise kullanıcı başına saniyede 90... Avantaj yalnızca ham donanım özelliklerinden kaynaklanmadı; bellek kapasitesi, yüksek prefix cache kullanımı, ana bellekten veri aktarımı ve TensorRT LLM gibi sunum yazılımlarının birlikte etkisi belirleyici oldu.
AMD’nin MI355X hızlandırıcısı ve ATOM motoru bazı özel yapılandırmalarda Nvidia ile başa baş sonuçlar veya kazanımlar elde etti.