SemiAnalysisin AgentX testeissä Nvidia oli GLM 5.3:ssa jopa noin 5 kertaa AMD:tä kustannustehokkaampi, kun tavoite oli 150 tuotettua tokenia sekunnissa käyttäjää kohden. Etumatka ei perustunut vain raakaa laskentatehoa koskeviin lukuihin, vaan muistin kapasiteetin, suuren prefix välimuistin osumatarkkuuden, isäntämu...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
SemiAnalysisin AgentX 1.0 -benchmarki antaa Nvidialle merkittävän etumatkan realistisissa, pitkää kontekstia käyttävissä koodausagenttien työkuormissa. Testatuissa SGLang-kokoonpanoissa Nvidian kerrotaan saavuttaneen GLM 5.3 -mallilla jopa 5 kertaa paremman kustannustehokkuuden kuin AMD ja Qwen 3.5 -mallilla yli 20 kertaa paremman suorituskyvyn 90 tuotetun tokenin sekuntitavoitteella käyttäjää kohden. 26
Tulos ei kuitenkaan ole yleispätevä paremmuusjärjestys Nvidian ja AMD:n välillä. AgentX mittaa tietyn mallin, kiihdyttimen, ajonaikaisen palveluympäristön, työkuorman, rinnakkaisuuden ja vasteaikatavoitteen yhdistelmää. AMD:n MI355X ja ATOM-palvelumoottori olivat kilpailukykyisiä tietyissä kokoonpanoissa, ja ohjelmistopäivitykset muuttivat joidenkin järjestelmien keskinäistä järjestystä. 14
AgentX 1.0 on osa SemiAnalysisin InferenceX v3 -benchmark-kokonaisuutta. Perinteisten testien sijaan se toistaa monikierroksista koodausagenttiliikennettä erittäin pitkillä konteksteilla – joissakin tilanteissa konteksti lähestyy miljoonaa tokenia. 13
Version 1.0 aineisto sisältää 393 vapaaehtoista ja anonymisoitua Claude Code -istuntoa. Mukaan hyväksyttyjen istuntojen piti sisältää vähintään 20 pyyntöä. Aineistosta poistettiin muun muassa päällekkäiset pyynnöt, tietyt asiakaskohtaiset kutsut sekä uudelleen muodostetut syötteet, joiden pituus ylitti 990 000 tokenia. Mediaanipyyntö sisälsi 142 000 syötetokenia ja 444 tulostetokenia, ja 44 prosentissa istunnoista käytettiin aliagentteja. 8
Tällä on käytännössä väliä, koska koodausagentti lähettää keskustelun tai koodipohjan muuttuvia versioita toistuvasti. Testi mittaa siis jatkuvaa, vuorovaikutteista palvelua eikä vain yhtä pitkää kehotetta ja sen jälkeen tuotettavaa vastausta.
Selvin ero näkyi laajasti saatavilla olevissa SGLang-palvelukokoonpanoissa:
Lukuja pitää tulkita tietyn käyttötilanteen vertailuina, ei koko tuoteperheiden yhtenäisinä pistemäärinä. InferenceX vertaa alustoja määritellyillä vuorovaikutteisuuden tasoilla ja laskee kustannukset kullekin alustalle havaitun palvelukapasiteetin perusteella. 79
Käytännön opetus on, että esimerkiksi 8 000 syötetokenin ja 1 000 tulostetokenin vakiotesti voi jättää huomiotta pullonkaulat, jotka ratkaisevat monikierroksisessa agenttiliikenteessä. Kiihdytin voi näyttää kilpailukykyiseltä yksittäisessä läpimenotestissä mutta jäädä jälkeen, kun sen on pidettävä useita suuria, osittain toistuvia konteksteja nopeasti käytettävissä samanaikaisesti.
AgentX:n pyynnöissä suuri osa kontekstista toistuu kierroksesta toiseen. SemiAnalysis kuvaa näiden agenttijälkien prefix- eli KV-välimuistin osumatarkkuuden olevan usein yli 95 prosenttia. 1
Järjestelmä ei siis käsittele joka kerta kokonaan uutta kehotetta, vaan ylläpitää ja laajentaa suuria välimuistissa olevia tiloja samalla, kun se tuottaa suhteellisen lyhyitä vastauksia. Näiden tilojen tehokas tallennus, paikantaminen, siirtäminen ja uudelleenkäyttö vaikuttavat ratkaisevasti sekä läpimenoon että kustannuksiin.
Käytettävissä oleva nopean muistin kapasiteetti määrittää, kuinka suuri osa KV-välimuistin tilasta voidaan säilyttää suoraan kiihdyttimessä. Jos työjoukko ylittää laitemuistin kapasiteetin, palvelujärjestelmä joutuu siirtämään tietoa isäntämuistiin tai hallitsemaan välimuistia hitaamman väylän kautta. 1
Isäntämuistiin siirtäminen voi kasvattaa tuettujen istuntojen määrää, mutta samalla se lisää kaistanleveys- ja viivekustannuksia. Alusta, joka pitää suuremman osan aktiivisesta välimuistista paikallaan tai hallitsee siirtoja tehokkaammin, voi säilyttää paremman reagointikyvyn samalla kustannustasolla.
SemiAnalysis nosti esiin myös TensorRT-LLM:n rajat huomioivan inkrementaalisen tokenisoinnin. Koko muuttuvaa kehotetta ei tarvitse tokenisoida yhä uudelleen, vaan järjestelmä tunnistaa vakaat rajat ja käsittelee vain uuden, lisätyn sisällön. 1
Optimointi on erityisen merkityksellinen koodausagenteille: pyyntö voi sisältää valtavan kontekstin mutta tuottaa vain muutamia satoja tokeneita. Tällöin suorittimen esikäsittely ja toistuva tokenisointi voivat muodostaa huomattavan osan palvelun kuormasta.
Laajempi johtopäätös on, että päättelyn hinta–suorituskyky syntyy yhdistelmästä laitteisto × ajonaikainen palveluympäristö × malli × työkuorma × viivetavoite. Yksittäiset FLOPS-, muistikaistanleveys- tai läpimenoluvut eivät kuvaa kokonaisuutta.
AgentX ei osoittanut Nvidian voittavan kaikkialla. SemiAnalysis raportoi AMD:lle voittoja tai lähes tasatuloksia tietyissä mallin, läpimenon ja palvelumoottorin yhdistelmissä – erityisesti MI355X:n ja AMD:n ATOM-palvelumoottorin kanssa. 1
Telemetriassa MI355X:n tulokset on eroteltu ATOM-, SGLang-, vLLM- ja muille kokoonpanoille. Erottelu on olennainen: ”AMD-tulos” riippuu voimakkaasti käytetystä palvelumoottorista, mallin toteutuksesta ja optimoinneista. 4
ATOMin erikoistunut ajoitus, välimuistin käsittely ja AMD:lle suunnatut kernelit voivat toimia hyvin, kun malli ja työkuorma sopivat MI355X:n muistijärjestelmään. AMD voi siis olla erittäin kilpailukykyinen, jos operaattori on valmis käyttämään alustalle erityisesti optimoitua ajonaikaista ympäristöä.
Räätälöity palvelumoottori voi osoittaa, mihin laitteisto parhaimmillaan pystyy. Infrastruktuurin ostajat tarvitsevat kuitenkin yleensä muutakin kuin yksittäisen tehokkaan kernelin: mallituen, päivitykset, työkalut, käyttöönottotaidon ja ylläpidettävän toimintamallin.
SemiAnalysis kertoo noudattaneensa resepteissään pääosin vLLM:n ja SGLangin avoimen lähdekoodin upstream-ohjeita. Tavoitteena on mitata kokoonpanoja, joita asiakkaat voivat realistisesti ottaa käyttöön, eikä nojata pelkästään benchmarkia varten rakennettuun ohjelmistopinoon. 1
Siksi upstream-vLLM ja SGLang ovat monille AMD:n mahdollisille ostajille päätöksenteon kannalta olennaisempi vertailukohta kuin ATOM. ATOM on tärkeää näyttöä siitä, että AMD:n laitteisto voi saavuttaa vahvan suorituskyvyn sopivassa ohjelmistoympäristössä, mutta sen tulosta ei pidä rinnastaa automaattisesti yleisesti käytettävissä olevan palvelukerroksen suorituskykyyn.
Kyse on käyttöönotosta ja ohjelmiston saatavuudesta – ei väitteestä, että ATOM olisi epäkelpo tai että erikoistuneilla ajonaikaisilla ympäristöillä ei olisi arvoa.
Benchmarki osoittaa myös, kuinka nopeasti päättelyvertailut vanhenevat. Telemetria sisältää 21. elokuuta päivätyn AMD MI355X MoRI/SGLang -kokoonpanon muiden eri päivinä mitattujen AMD-kokoonpanojen rinnalla. 4
Elokuun 21. päivän ohjelmistopäivitys muutti ainakin yhden vertailun järjestystä. Tämä havainnollistaa, että ajoituksen, kernelien, välimuistin siirron ja mallituen parannukset voivat muuttaa näennäistä laitteistohierarkiaa muutamassa päivässä. 14
SemiAnalysisin aiempi MI355X-tutkimus Qwen 3.5:llä tarjoaa saman varoituksen: peräkkäiset SGLang-julkaisut toivat huomattavia suorituskykyparannuksia 13 viikon aikana. 12
Ostajien kannattaa siksi kirjata vertailuja tehdessään tarkka ajonaikaisen ympäristön versio, kokoonpano, mallin kvantisointi, rinnakkaisuuden vaihteluväli ja tavoiteltu vuorovaikutteisuus. Ilman tätä kontekstia annettu laitteistotuomio voi muuttua harhaanjohtavaksi jo ohjelmiston seuraavan päivityskierroksen myötä.
AgentX on hyödyllinen mittari pitkän kontekstin koodausagenteille, mutta se ei ole kaikkien tuotantotyökuormien edustava otos. Aineisto perustuu sisäiseen, vapaaehtoiseen jälkikokoelmaan ja 393 valittuun istuntoon, ei kaikkeen yritysten agenttiliikenteeseen. 8
Tulokset voivat poiketa toisistaan esimerkiksi seuraavissa tilanteissa:
Google TPU:t puuttuivat myös tästä ensimmäisestä vertailukokonaisuudesta. AgentX 1.0 ei siksi mahdollista kattavaa Nvidia–AMD–Google-johtopäätöstä. 1
Vertailu elää lisäksi jatkuvasti. SemiAnalysis on ilmoittanut tuleviksi vertailukohteiksi muun muassa Nvidian Rubinin, AMD:n MI455X UALoE72:n ja uudemmat TPU-järjestelmät. Niiden mukaan ottaminen voi muuttaa kilpailuasetelmaa. 111
SemiAnalysis julkaisi AgentX-aineiston, testikehyksen, kokoonpanot, telemetrian ja siihen liittyvät materiaalit Apache 2.0 -lisenssillä. 1
Benchmarkin pitkäaikainen merkitys voi olla suurempi kuin yksi Nvidia–AMD-otsikko. SemiAnalysisin mukaan AgentX oli jo muuttunut kohdekuormaksi yli 70:lle upstream-pull requestille, jotka liittyivät muun muassa vLLM-, SGLang-, TensorRT-LLM-, ATOM-, AITER-, Dynamo-, LMCache- ja Mooncake-projekteihin. 1
Kehittäjät saavat näin toistettavan tavan optimoida palvelukehyksiä todellisen agenttikäyttäytymisen mukaan: suuri prefix-välimuistin uudelleenkäyttö, isot KV-välimuistit, monet lyhyet kierrokset, aliagentit, välimuistin siirrot, ajoituspaine ja tokenisoinnin aiheuttama kuorma tulevat kaikki näkyviin.
AgentX vahvistaa käsitystä, että Nvidian ohjelmisto- ja palveluekosysteemi on edelleen merkittävä etu pitkän kontekstin koodausagenttien päättelyssä. Testatuissa SGLang-vertailuissa Nvidian etumatkaksi raportoitiin GLM 5.3:ssa jopa 5-kertainen kustannustehokkuus ja Qwen 3.5:ssä yli 20-kertainen suorituskyky määritellyllä vuorovaikutteisuuden tasolla. 26
Benchmarki ei silti todista Nvidian voittavan aina. AMD:n MI355X ja ATOM osoittivat, että valikoiduissa, tarkoitukseen rakennetuissa kokoonpanoissa on mahdollista saavuttaa kilpailukykyinen tai parempi hinta–suorituskyky. Lisäksi nopeasti kehittyvä palveluohjelmisto voi kääntää järjestyksen.
Infrastruktuuritiimeille hyödyllisin johtopäätös ei siksi ole yhden voittajan valitseminen otsikkoluvun perusteella. Vertailu kannattaa toistaa omalla mallilla, ajonaikaisella ympäristöllä, kontekstijakaumalla ja viivetavoitteella.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SemiAnalysisin AgentX testeissä Nvidia oli GLM 5.3:ssa jopa noin 5 kertaa AMD:tä kustannustehokkaampi, kun tavoite oli 150 tuotettua tokenia sekunnissa käyttäjää kohden.
SemiAnalysisin AgentX testeissä Nvidia oli GLM 5.3:ssa jopa noin 5 kertaa AMD:tä kustannustehokkaampi, kun tavoite oli 150 tuotettua tokenia sekunnissa käyttäjää kohden. Etumatka ei perustunut vain raakaa laskentatehoa koskeviin lukuihin, vaan muistin kapasiteetin, suuren prefix välimuistin osumatarkkuuden, isäntämuistiin siirtämisen ja palveluohjelmiston, kuten TensorRT LLM:n, yhtei...
AMD:n MI355X ja ATOM palvelumoottori saavuttivat tietyissä testeissä voittoja tai lähes tasatuloksia.