首個專為「代理式 AI」設計的公開硬體基準測試 AgentPerf 正式登場,衡量的是系統能同時穩定服務多少個 AI 編碼代理,而非傳統的單次問答速度 [4]。 NVIDIA GB300 NVL72 (Blackwell Ultra) 在 DeepSeek V4 Pro 測試中全面領先,在 20 tokens/s 與 60 tokens/s 兩種服務水準下,每兆瓦可支援的同時代理數量皆為前代 HGX H200 的 20 倍 [4]。

Create a landscape editorial hero image for this Studio Global article: What did Nvidia achieve in the first published results of Artificial Analysis's AgentPerf benchmark, what does this new benchmark measure, a. Article summary: Here are the key findings from the first published results of Artificial Analysis's **AA-AgentPerf** benchmark, announced on June 12, 2026.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "We measure real-world performance of AI accelerator systems during language model inference. ## AA-AgentPerf: The Hardware Benchmark for the Agent Era. AA-AgentPerf has been shaped" source context "AI Hardware Benchmarking & Performance Analysis" Reference image 2: visual subject "For years, co-founder and chief executive officer Jensen Huang and other higher-ups at Nvidia have
2026 年 6 月 12 日,人工智慧效能分析機構 Artificial Analysis 公布了業界第一份 AA-AgentPerf 基準測試結果 。這不只是一般的跑分競賽,而是一場徹底的思維轉向:當 AI 的戰場從「回答一個問題」變成「交辦一件事」,運算基礎建設的能耐要如何重新丈量?
傳統 MLPerf 推論測試看的是 AI 模型每秒能吐出多少 token;AA-AgentPerf 則把場景換成更接近真實世界的 代理式 AI (Agentic AI) 工作負載 。
所謂代理式 AI,指的是能自主規劃、調用工具、多步驟執行任務的 AI 系統,例如一個 AI 編碼代理會自行讀取程式碼、搜尋文件、呼叫編譯器、迭代除錯,整個過程包含數十次 LLM 推理呼叫、工具呼叫(模擬真實 CPU 延遲)與不斷膨脹的上下文窗口,而非單純的一次性問答 。
AgentPerf 的核心衡量指標是:「在同一個服務水準協議 (SLO) 下,一個推論系統最多可以同時服務多少個 AI 代理?」測試定義了不同嚴格程度的 SLO,包括輸出 token 速度(例如 20 tokens/s 或 60 tokens/s)與首次 token 生成時間 (Time-to-First-Token, TTFT),並以真實世界開源程式碼庫的編碼代理軌跡為題材,涵蓋超過 12 種程式語言。最終成績會以「每加速器」與「每兆瓦 (per megawatt)」兩種方式歸一化,凸顯電力效率 。
首輪 AgentPerf 測試採用的模型是 DeepSeek V4 Pro ——一款大型混合專家 (Mixture-of-Experts, MoE) 模型,被視為當前頂尖代理式 AI 的代表性架構 。在這個擂台上,NVIDIA GB300 NVL72 (Blackwell Ultra) 的表現是:
這樣的差距,反映的不是單一硬體的改朝換代,而是整個運算平台的世代跳躍。
Blackwell Ultra 在 AgentPerf 上的成績,是 NVIDIA 刻意構建的一張全方位故事拼圖,目的只有一個:把 Blackwell Ultra 打造成大規模代理式 AI 的「預設基礎設施」。
NVIDIA 把 20 倍的效能增益,歸因於極致的共同設計 (co-design) :
AgentPerf 的紀錄並非孤例。在它之前,Blackwell Ultra 已經在業界老牌 MLPerf 基準測試中「刷榜」:
AgentPerf 的出現,等於是在「跑得快」的基礎上,再補上「扛得住複雜多工」這塊拼圖。
NVIDIA 特別點出,合作伙伴已將 Blackwell 用於真實的代理式 AI 服務 :
這類訊息的核心用意是傳達:Blackwell Ultra 不是只在實驗室跑分好看,而是已經在生產環境中服役的成熟平台。
在宣布 AgentPerf 成果的同一篇官方部落格中,NVIDIA 已預告已進入生產的次世代 Vera Rubin 架構將是代理式 AI 容量的下一步 ;技術細節也揭露了未來 NVFP4 精度下的 50 PFLOPs 算力,以及針對 LLM 工具呼叫的加速設計,顯示這是一場精心規劃的多年期市場塑造戰
。
從 MLPerf 到 AgentPerf,NVIDIA 正在系統性地將 AI 效能的定義,從「模型跑多快」重新定錨為「一個資料中心能養多少個 AI 代理人」。而 Blackwell Ultra 在第一個真正為代理式 AI 設計的公開擂台上繳出的成績單,正是一場對整個產業的宣言:未來的 AI 算力之爭,比的不是晶片,而是從晶片、互連、軟體到生態系的整套系統級能耐。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
首個專為「代理式 AI」設計的公開硬體基準測試 AgentPerf 正式登場,衡量的是系統能同時穩定服務多少個 AI 編碼代理,而非傳統的單次問答速度 [4]。
首個專為「代理式 AI」設計的公開硬體基準測試 AgentPerf 正式登場,衡量的是系統能同時穩定服務多少個 AI 編碼代理,而非傳統的單次問答速度 [4]。 NVIDIA GB300 NVL72 (Blackwell Ultra) 在 DeepSeek V4 Pro 測試中全面領先,在 20 tokens/s 與 60 tokens/s 兩種服務水準下,每兆瓦可支援的同時代理數量皆為前代 HGX H200 的 20 倍 [4]。
若只看最寬鬆的條件(每秒 20 tokens 輸出、10 秒內回應),GB300 機架級分散式配置最多可同時服務 61,340 個代理,遠超其他平台 [14]。