在 SemiAnalysis 的 AgentX 測試中,Nvidia 於 GLM 5.3、每位用戶每秒 150 個輸出 token 的操作點,成本效益最高約為 AMD 的 5 倍;在 Qwen 3.5、每位用戶每秒 90 個輸出 token 的比較中,性能則高出 20 倍以上。[2][6] 長上下文 Agent 工作負載的關鍵,不只在 GPU 規格,還包括 KV cache 重用率、DRAM 容量、主機記憶體卸載,以及 TensorRT LLM、SGLang 等推理軟件的調度和優化。[1] AMD 的 MI355X 配合 ATOM 推理引擎,在部分模型和吞吐量配置取得勝出或接近持平的結果;不過對大部分買家而言,上游 vLLM...
研究答案

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
SemiAnalysis 發表的 AgentX 1.0,測試的不是一般「固定輸入、固定輸出」的 AI 推理,而是更貼近實際使用情況的長上下文、多輪編程 Agent 工作負載。
結果顯示,在測試的 SGLang 配置中,Nvidia 的硬件與 CUDA 為核心的推理生態,對 AMD 保持明顯優勢:GLM 5.3 的成本效益最高約領先 5 倍,而 Qwen 3.5 在指定互動速度下的性能更高出 20 倍以上。26
但這並不等於「Nvidia 永遠勝過 AMD」。AgentX 測量的是特定模型、加速器、推理引擎、工作負載、並行度和響應速度目標的組合。AMD MI355X 配合 ATOM,在部分配置仍然取得有競爭力、甚至更佳的結果;而軟件更新亦足以在短時間內改變排名。14
AgentX 1.0 是 SemiAnalysis InferenceX v3 基準測試套件的一部分。傳統推理測試通常預設固定長度,例如 8k 輸入加 1k 輸出;AgentX 則重播多輪編程 Agent 流量,讓上下文隨對話和代碼庫逐步累積,部分情境接近 100 萬 token。13
v1.0 數據集包括 393 個自願提供、匿名化的 Claude Code 工作階段。符合條件的工作階段至少有 20 次請求;數據經處理後,剔除了重複請求、部分客戶端專用呼叫,以及重建後超過 990,000 token 的輸入。每個請求的輸入 token 中位數為 142,000,輸出 token 中位數為 444;44% 的工作階段包括子 Agent。8
這種流量模式與普通聊天很不一樣。編程 Agent 會一再把不斷更新的對話、代碼和工具結果送回模型,因此系統要長時間維持互動反應,而不是只處理一次超長 prompt 再生成一段長答案。
在較容易部署、以 SGLang 為基礎的比較中,最突出的是兩組結果:
這些數字應理解為特定操作點的比較,而不是整條產品線的單一總排名。InferenceX 會按各平台實際觀察到的服務範圍,在指定互動速度下比較每百萬 token 的成本。79
換句話說,一項 GPU 在單次 8k 輸入、1k 輸出的測試中看似接近,並不代表它在多輪 Agent 流量下也一樣。當系統要同時維持大量大型、部分重複的上下文時,記憶體層級、cache 管理和調度效率可能變成決勝因素。
AgentX 的請求之間會重用大量上下文。SemiAnalysis 指出,這類 Agent trace 的 prefix 或 KV cache 命中率經常高於 95%。1
因此,系統並不是每次都從頭處理一個全新的 prompt,而是要保存並延伸一個很大的已快取狀態,同時只輸出相對短的回覆。如何儲存、搜尋、搬移和重用這些狀態,會直接影響吞吐量、延遲和成本。
加速器可用的高頻寬記憶體容量,決定多少 KV cache 能夠留在設備內。如果工作集超出顯存,服務系統便可能要把數據搬到主機記憶體,或者透過較慢的路徑管理 cache 狀態。1
主機記憶體卸載可以令平台支援更多工作階段,但代價是額外頻寬需求和延遲。能夠讓更多活躍 cache 留在加速器上,或者更有效率地安排數據搬移的平台,便較容易在同一成本下維持較高互動速度。
SemiAnalysis 亦特別提到 TensorRT-LLM 的「邊界感知增量 tokenization」。系統不必每次都重新 tokenization 整段不斷增長的 prompt,而是識別穩定的邊界,只處理新加入的內容。1
對編程 Agent 而言,這項優化尤其重要:請求可能包含十幾萬甚至更多輸入 token,但每次只生成幾百個 token。此時,CPU 預處理和重複 tokenization 可能佔去相當一部分服務開銷。
更廣義來看,AI 推理的性價比其實是:
硬件 × 推理引擎 × 模型 × 工作負載 × 延遲目標
單看 FLOPS、記憶體頻寬,或者一個孤立的吞吐量數字,都不足以解釋完整結果。
AgentX 沒有顯示 Nvidia 在所有情況下都贏。SemiAnalysis 表示,AMD 在部分模型、吞吐量和推理引擎組合中取得明顯勝出或接近持平,尤其是 MI355X 配合 AMD 的 ATOM 推理引擎。1
遙測數據把 MI355X 配合 ATOM、SGLang、vLLM 和其他配置分開列出。這個區分非常重要:所謂「AMD 的結果」,很大程度取決於使用哪一個推理引擎、模型實作和調校方式。4
ATOM 的專門調度、cache 管理和針對 AMD 的 kernel,在模型和工作負載配合 MI355X 記憶體配置時,可以發揮很好的效果。即是話,AMD 並非硬件本身沒有競爭力;在願意採用針對平台優化的 runtime 時,它仍然可以做到相當強的性能價格比。
特製化引擎可以展示硬件在有利條件下能做到甚麼,但企業部署通常不只看 benchmark 的最佳成績。買家還要考慮模型支援範圍、版本更新、工具鏈、部署經驗,以及日後能否長期維護。
SemiAnalysis 表示,其測試配方主要跟隨上游 vLLM 和 SGLang 的指引,目的是衡量客戶較現實可部署的配置,而不是只依賴為基準測試度身訂造的軟件堆疊。1
因此,對大部分考慮 AMD 的買家而言,更有決策價值的問題是:MI355X 在上游 vLLM 和 SGLang 上表現如何,而不只是 ATOM 在高度優化環境下能做到甚麼。
這是採用門檻和軟件可用性的分別,並不是說 ATOM 的結果無效,亦不是說特製化 runtime 沒有價值。對有能力自行調校和維護整套服務的營運商來說,ATOM 仍然可能是重要選項。
這次測試亦提醒大家,AI 推理比較很容易過時。遙測資料包括一個在 8 月 21 日測量的 AMD MI355X MoRI/SGLang 配置,其他 AMD 配置則在不同日期測試。4
一次軟件更新已經改變至少一組比較的先後次序,反映調度器、kernel、cache 搬移方式和模型支援一旦改善,硬件之間的表面排名可能幾日內就會變。SemiAnalysis 早前針對 MI355X 和 Qwen 3.5 的工作亦顯示,SGLang 在 13 星期內的版本更新帶來大幅性能提升。12
對基礎設施買家來說,實際做法是記錄完整的 runtime 版本、部署配置、模型量化方式、並行度範圍,以及目標互動速度。沒有這些背景,一個「邊張卡贏」的結論很快便可能失去參考價值。
AgentX 是研究長上下文編程 Agent 的有用代理指標,但並不是所有生產環境工作負載的普查。數據來自內部、自願參與的 trace corpus,只有 393 個按條件挑選的工作階段,未必代表所有企業 Agent 流量。8
以下情況可能得出不同結果:
此外,Google TPU 並未出現在這次初始比較結果中,因此 AgentX v1.0 不能據此作出 Nvidia、AMD 和 Google 三方的完整結論。1
比較亦會持續變動。SemiAnalysis 已把 Nvidia Rubin、AMD MI455X UALoE72 和更新一代 TPU 列作將來加入或比較的系統;它們出場後,競爭格局可能再變。111
SemiAnalysis 以 Apache 2.0 授權公開 AgentX 的數據集、測試 harness、配置、遙測資料和相關材料。1
這個項目的長遠意義,可能不只是一次「Nvidia 對 AMD」的標題戰。SemiAnalysis 表示,AgentX 已成為超過 70 個上游 pull request 的目標工作負載,涉及 vLLM、SGLang、TensorRT-LLM、ATOM、AITER、Dynamo、LMCache 和 Mooncake 等項目。1
對推理框架開發者來說,這提供了一個可重現、而且更像真實 Agent 的優化目標:高 prefix 重用、大型 KV cache、多輪短回合、子 Agent、cache 搬移、調度壓力,以及 tokenization 開銷。
AgentX 強化了這個判斷:在長上下文編程 Agent 推理上,Nvidia 的軟件和服務生態仍然是一項重要優勢。在測試的 SGLang 比較中,Nvidia 在 GLM 5.3 的成本效益最高領先約 5 倍,在 Qwen 3.5 的指定互動速度下性能則高出 20 倍以上。26
不過,這並不證明 Nvidia 任何時候都會贏。AMD MI355X 配合 ATOM 在特定、度身訂造的配置中已展示具競爭力、甚至更佳的性價比;而快速的推理軟件更新亦可以令排名反轉。
對基礎設施團隊而言,最穩妥的結論不是單靠一個 headline 數字揀「贏家」,而是用自己的模型、runtime、上下文分佈和延遲目標,重新跑一次真正貼近業務的比較。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
在 SemiAnalysis 的 AgentX 測試中,Nvidia 於 GLM 5.3、每位用戶每秒 150 個輸出 token 的操作點,成本效益最高約為 AMD 的 5 倍;在 Qwen 3.5、每位用戶每秒 90 個輸出 token 的比較中,性能則高出 20 倍以上。[2][6]
在 SemiAnalysis 的 AgentX 測試中,Nvidia 於 GLM 5.3、每位用戶每秒 150 個輸出 token 的操作點,成本效益最高約為 AMD 的 5 倍;在 Qwen 3.5、每位用戶每秒 90 個輸出 token 的比較中,性能則高出 20 倍以上。[2][6] 長上下文 Agent 工作負載的關鍵,不只在 GPU 規格,還包括 KV cache 重用率、DRAM 容量、主機記憶體卸載,以及 TensorRT LLM、SGLang 等推理軟件的調度和優化。[1]
AMD 的 MI355X 配合 ATOM 推理引擎,在部分模型和吞吐量配置取得勝出或接近持平的結果;不過對大部分買家而言,上游 vLLM 和 SGLang 的表現,較特製化的 ATOM 更具參考價值。[1][4]