AgentXのテストでは、NVIDIAがGLM 5.3でAMDを最大約5倍上回るコスト効率を示し、Qwen 3.5では毎秒90出力トークン/ユーザーの条件で20倍超の性能差が報告された。 優位性はGPUの仕様だけでなく、プレフィックスキャッシュの再利用、DRAM容量、ホストメモリへのオフロード、TensorRT LLMの増分トークナイズなど、ハードウェアとソフトウェアの組み合わせから生まれた。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
SemiAnalysisのオープンソースベンチマーク「AgentX 1.0」は、長文コンテキストを扱うマルチターンのコーディングAIエージェントで、NVIDIAのCUDAを中心としたハードウェアと推論サービング基盤が大きな優位性を保っている可能性を示した。
公開されたSGLang構成では、NVIDIAがGLM 5.3で最大約5倍のコスト効率、Qwen 3.5で20倍超の性能を達成したと報告されている。26 ただし、これはNVIDIAがあらゆる条件でAMDを上回るという総合ランキングではない。モデル、アクセラレーター、推論ランタイム、同時実行数、目標レイテンシーを組み合わせた、特定の運用条件での比較だ。14
AgentX 1.0は、SemiAnalysisの「InferenceX v3」ベンチマーク群に追加されたシナリオだ。入力と出力の長さを固定する従来型の推論テストとは異なり、実際のコーディングエージェントの通信を再現する。複数ターンにわたって大規模な会話履歴やコードベースを引き継ぎ、コンテキスト長が約100万トークンに達するケースも含まれる。13
v1.0のデータセットは、オプトインで収集された匿名のClaude Codeセッション393件から成る。対象セッションは20件以上のリクエストを含み、重複リクエストや一部のクライアント固有の呼び出し、99万トークンを超える再構成入力などを除外して処理された。1リクエストあたりの入力トークン数の中央値は14万2,000、出力トークン数は444で、44%のセッションにサブエージェントが含まれていた。8
この特徴が重要なのは、コーディングエージェントが毎回まったく新しいプロンプトを送るのではなく、更新された会話やコードの大部分を繰り返し送るためだ。AgentXは、単発の長文入力に対するピーク性能ではなく、大きな状態を維持しながら短い応答を連続して返す対話型サービングを重視している。
比較的導入しやすいSGLang構成で、特に明確な差が報告された。
これらは製品ライン全体に一つの点数を付けた結果ではない。InferenceXは、各プラットフォームで確認されたサービング環境をもとに、指定された対話性の水準におけるコストを比較している。79
つまり、たとえば入力8,000・出力1,000トークンの固定長テストだけでは、実際のエージェント処理で決定的になるボトルネックを見落とす可能性がある。単発のスループットでは互角に見えるアクセラレーターでも、大容量のコンテキストを複数セッションで同時に維持し、応答性を保つ場面では差が広がり得る。
AgentXのトレースでは、リクエスト間でコンテキストの大部分が再利用される。SemiAnalysisによると、こうしたエージェント処理ではプレフィックス、つまりKVキャッシュのヒット率がしばしば95%を超える。1
この場合、毎回ゼロから長い入力を処理するのではなく、キャッシュされた状態を保持・検索・転送しながら、追加部分を処理して応答を生成する。キャッシュをどれだけ効率的に保存し、必要な場所へ移動し、再利用できるかが、スループットとコストの両方を左右する。
アクセラレーター上で利用できる高速メモリ容量は、どれだけのKVキャッシュを常駐させられるかを決める。作業セットがデバイスメモリを超えると、ホストメモリへの移動など、より遅い経路でキャッシュを管理しなければならない場合がある。1
ホストメモリへのオフロードは対応できるセッション数を増やせる一方、帯域幅とレイテンシーのコストを伴う。アクティブなキャッシュをより多くアクセラレーター上に置けるプラットフォームや、データ移動を効率的に制御できるシステムほど、同じコストで高い対話性を維持しやすい。
SemiAnalysisは、TensorRT-LLMの「境界を認識した増分トークナイズ」にも注目している。変化し続けるプロンプト全体を毎回トークナイズするのではなく、安定した境界を特定し、新たに追加された部分を処理する手法だ。1
コーディングエージェントでは、入力コンテキストが非常に長い一方、1回の応答は数百トークン程度にとどまることが多い。そのため、CPU側の前処理や同じ内容の再トークナイズが、無視できないサービング負荷になる。
ここから分かるのは、推論の価格性能が単純な演算性能やメモリ帯域幅だけで決まらないということだ。実際の結果は、ハードウェア×ランタイム×モデル×ワークロード×レイテンシー目標の組み合わせで決まる。
AgentXは、NVIDIAの全面勝利を示したわけではない。SemiAnalysisは、モデル、スループット、推論エンジンの組み合わせによって、AMDが勝利または互角に近い結果を出したケースも報告している。特に注目されるのが、MI355XとAMDのATOMサービングエンジンの組み合わせだ。1
テレメトリでは、MI355XについてATOM、SGLang、vLLMなどを使った結果が別々に記録されている。この区別は重要だ。「AMDの結果」と一括りにしても、実際の性能はエンジン、モデル実装、チューニングに大きく左右される。4
ATOMは、専用のスケジューリング、キャッシュ処理、AMD向けカーネルを備える。モデルとワークロードがMI355Xのメモリ構成にうまく適合する場合、強い性能を発揮し得る。言い換えれば、AMDはプラットフォーム専用に最適化されたランタイムを採用・運用できる事業者にとって、十分に競争力のある選択肢になり得る。
専用エンジンは、ハードウェアが好条件でどこまで性能を出せるかを示す。しかし、AIインフラを導入する企業が必要とするのは、最良のカーネル性能だけではない。モデル対応範囲、リリースの継続性、周辺ツール、運用ノウハウ、長期的に保守できる導入経路も必要になる。
SemiAnalysisは、顧客が現実に導入できる構成を測るため、ベンチマーク専用のスタックだけに依存せず、主に上流版のvLLMとSGLangのガイダンスに沿ってレシピを作成していると説明している。1
そのため、AMD導入を検討する多くの企業にとって、意思決定上より重要なのはATOMの最適値ではなく、一般的なサービング層である上流版vLLMやSGLangでMI355Xがどの程度の性能を出すかだ。これはATOMが無効だという意味でも、専用ランタイムに価値がないという意味でもない。性能の高さと、幅広いユーザーが継続的に利用できるソフトウェア環境は、別の評価軸だということだ。
推論ベンチマークの結果が古くなりやすいことも、AgentXは示している。テレメトリには、8月21日に測定されたAMD MI355XのMoRI/SGLang構成が含まれるほか、別の日付のAMD構成も記録されている。4
8月21日のソフトウェア更新によって、少なくとも一つの比較では順位が変わった。スケジューリング、カーネル、キャッシュ移動、モデル対応の改善によって、ハードウェアの見かけ上の優劣が数日で変わり得ることを示す事例だ。14
SemiAnalysisが以前に公開したMI355X上のQwen 3.5の分析でも、13週間の間にSGLangのリリースが性能を大きく押し上げたと報告されている。12
アクセラレーターを比較する際は、ランタイムのバージョン、具体的な構成、モデルの量子化方式、同時実行数の範囲、目標とする対話性を記録しておく必要がある。こうした条件を欠いた「このGPUが勝つ」という結論は、ソフトウェアの改善によってすぐに意味を失う可能性がある。
AgentXは長文コーディングエージェントの有力な代理指標だが、あらゆる本番ワークロードを代表するものではない。データセットはオプトインの内部トレースから選ばれた393セッションであり、企業のAIエージェント利用全体を網羅した調査ではない。8
結果は、次のような用途では異なる可能性がある。
また、初期の比較結果にはGoogleのTPUが含まれていない。そのため、AgentX 1.0だけでNVIDIA、AMD、Googleの3社を比較した結論を出すことはできない。1
今後の比較対象としては、NVIDIA Rubin、AMD MI455X UALoE72、新世代のTPUなどが挙げられている。これらが加われば、競争地図は変わる可能性がある。111
SemiAnalysisは、AgentXのデータセット、ハーネス、構成、テレメトリなどの関連資料をApache 2.0ライセンスで公開した。1
この取り組みの長期的な価値は、NVIDIAとAMDの一度きりの比較結果よりも、推論基盤の改善を促す点にあるかもしれない。SemiAnalysisによれば、AgentXはすでにvLLM、SGLang、TensorRT-LLM、ATOM、AITER、Dynamo、LMCache、Mooncakeなどを対象とする70件超の上流プルリクエストで、目標ワークロードとして使われている。1
高いプレフィックス再利用率、大規模なKVキャッシュ、多数の短いターン、サブエージェント、キャッシュ転送、スケジューリングの負荷、トークナイズのオーバーヘッド――AgentXは、こうした実際のエージェント処理に近い条件で各フレームワークを改善するための、再現可能な基準を提供する。
AgentXは、長文コンテキストのコーディングエージェント推論において、NVIDIAのハードウェアとソフトウェア、サービングエコシステムの組み合わせが依然として大きな強みであることを示した。テストされたSGLang比較では、NVIDIAの優位性はGLM 5.3のコスト効率で最大5倍、Qwen 3.5の性能で20倍超と報告されている。26
ただし、NVIDIAが常に勝つことを証明したわけではない。AMDのMI355XとATOMは、特定の目的に合わせた構成で競争力のある、またはそれを上回る価格性能を示した。さらに、推論ソフトウェアの更新によって順位が短期間で逆転する可能性もある。
AIインフラを選ぶ企業にとっての教訓は、一つの見出しの数字だけで勝者を決めないことだ。実際に使うモデル、ランタイム、コンテキスト分布、同時実行数、必要な応答速度をそろえ、自社のワークロードで比較することが、最も現実的な判断につながる。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
AgentXのテストでは、NVIDIAがGLM 5.3でAMDを最大約5倍上回るコスト効率を示し、Qwen 3.5では毎秒90出力トークン/ユーザーの条件で20倍超の性能差が報告された。
AgentXのテストでは、NVIDIAがGLM 5.3でAMDを最大約5倍上回るコスト効率を示し、Qwen 3.5では毎秒90出力トークン/ユーザーの条件で20倍超の性能差が報告された。 優位性はGPUの仕様だけでなく、プレフィックスキャッシュの再利用、DRAM容量、ホストメモリへのオフロード、TensorRT LLMの増分トークナイズなど、ハードウェアとソフトウェアの組み合わせから生まれた。
AMDのMI355XとATOMには勝利または互角の構成もあり、多くの導入企業にとっては、特殊なランタイムの最適値よりも上流版のvLLMやSGLangでの実用性能が重要になる。