2026年6月12日、AIエージェント処理性能を測る初のマルチベンダー向けオープンベンチマーク「AA AgentPerf」の初公開結果が発表された [4]。 このベンチマークは、従来の単発チャット応答ではなく、コーディングエージェントがツール呼び出しや複数LLMコールを連鎖的に実行する際の処理能力を測るものだ [4]。

Create a landscape editorial hero image for this Studio Global article: What did Nvidia achieve in the first published results of Artificial Analysis's AgentPerf benchmark, what does this new benchmark measure, a. Article summary: Here are the key findings from the first published results of Artificial Analysis's **AA-AgentPerf** benchmark, announced on June 12, 2026.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "We measure real-world performance of AI accelerator systems during language model inference. ## AA-AgentPerf: The Hardware Benchmark for the Agent Era. AA-AgentPerf has been shaped" source context "AI Hardware Benchmarking & Performance Analysis" Reference image 2: visual subject "For years, co-founder and chief executive officer Jensen Huang and other higher-ups at Nvidia have
人工知能が「思考し、行動する」段階へと進化する中、ハードウェアの評価軸もまた変革を迫られています。2026年6月12日、AI分析で知られるArtificial Analysis社が、エージェントAI推論処理に特化した全く新しい業界標準ベンチマーク「AA-AgentPerf」の初回結果を公開しました 。従来のベンチマークが単発の質疑応答の速度を競っていたのに対し、AgentPerfは複雑な指示を自律的に達成するAIエージェントの性能を測るものです。そして、この最初の公開ラウンドで、NVIDIAの次世代プラットフォームが圧倒的な存在感を示しました。
従来のAIベンチマークが1問1答形式だったのに対し、AA-AgentPerfは「ツールを使い、試行錯誤しながら複数ステップの作業を自律的に完了するAI」の実力を測定するために設計されました 。具体的には、12以上のプログラミング言語を用いた公開リポジトリから収集された、実際のコーディングエージェントの行動履歴に基づき、複数のLLM呼び出しやAPIツールの利用をともなう複雑なタスクを再現するものです
。
このベンチマークが重視するのは、システムがどれだけ多くの同時接続エージェントを、実用的な速度と応答性を保ちながら処理できるかです。評価は応答生成速度と初回応答までの待ち時間に対して厳格なSLO(サービスレベル目標)を設け、結果を「アクセラレータ(GPU)あたり」および「1メガワットの電力あたり」で正規化。これにより、データセンター事業者が最も関心を持つとされる「電力効率と大規模処理能力」を公平に比較できるようになっています 。
今回、DeepSeek V4 Proという、最前線のエージェントAIを駆動する巨大なMoE(Mixture-of-Experts)モデルを用いたテストで、NVIDIAの「GB300 NVL72 (Blackwell Ultra) ラックスケールシステム」が、他プラットフォームを突き放し最高性能を達成しました 。
特に驚異的なのはその電力効率です。旧世代の「NVIDIA HGX H200 (Hopper)」システムと比較して、1メガワットあたり最大20倍のエージェントを同時処理できることが明らかになりました 。
Artificial Analysis社が公開した生データでは、最も基準の緩いSLO(20 tokens/秒, 初回応答10秒以内)において、ラックスケールの分散構成により61,340のエージェントを同時処理したことも報告されており、まさに桁違いの性能を見せつけました 。
この20倍という飛躍的な性能向上は、単なるプロセスルールの微細化だけでは達成できません。NVIDIAは、ハードウェアからCUDAカーネル、推論エンジンに至るまでの徹底的な「コ・デザイン(協調設計)」の成果だとしています 。
今回のAgentPerfでの結果は、単発的な成功ではなく、NVIDIAが描く「エージェントAI時代のインフラ覇権」を固める大きな戦略の一部です。
NVIDIAは、単に速いチップを作っているだけではありません。エージェントが自律的にソフトウェアを書き、業務を改革する未来において、その「頭脳」を動かすための揺るぎない基盤を、電力効率という極めて現実的な指標とともに業界へ突きつけたのです。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
2026年6月12日、AIエージェント処理性能を測る初のマルチベンダー向けオープンベンチマーク「AA AgentPerf」の初公開結果が発表された [4]。
2026年6月12日、AIエージェント処理性能を測る初のマルチベンダー向けオープンベンチマーク「AA AgentPerf」の初公開結果が発表された [4]。 このベンチマークは、従来の単発チャット応答ではなく、コーディングエージェントがツール呼び出しや複数LLMコールを連鎖的に実行する際の処理能力を測るものだ [4]。
結果、NVIDIAの次世代GPU「GB300 NVL72 (Blackwell Ultra)」が、DeepSeek V4 Proを用いたワークロードにおいて、他プラットフォームを圧倒しトップの性能を記録した [4]。