在 SemiAnalysis 的 AgentX 測試中,Nvidia 於 GLM 5.3、每位使用者每秒輸出 150 個 token 的目標下,成本效益最高約為 AMD 的 5 倍;在 Qwen 3.5、每位使用者每秒輸出 90 個 token 的目標下,效能則高出 20 倍以上。[2][6] Nvidia 的優勢並非只來自硬體規格,而是記憶體容量、前綴快取重用、主機記憶體卸載行為,以及 TensorRT LLM 等推論軟體共同作用的結果。 AMD 的 MI355X 搭配 ATOM 引擎在部分模型與工作負載中仍達到領先或接近 Nvidia 的表現;對多數採購者而言,上游 vLLM 與 SGLang 的結果比高度客製化的專用執行...
研究答案

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
SemiAnalysis 發布的 AgentX 1.0,將焦點從傳統的固定長度推論測試,轉向更接近實際使用情境的長上下文、多輪程式設計代理工作負載。結果顯示,在測試的 SGLang 配置中,Nvidia 的硬體與 CUDA 推論生態系仍保有顯著優勢:GLM 5.3 的成本效益最高約領先 AMD 5 倍,Qwen 3.5 在指定互動性目標下的效能更高出 20 倍以上。26
但這並不代表 Nvidia 在所有 AI 推論工作負載中都必然勝出。AgentX 測量的是特定模型、加速器、推論執行引擎、工作負載、並行度與回應速度目標的組合;AMD MI355X 搭配 ATOM 引擎,在部分配置仍展現競爭力,甚至取得價格效能優勢。14
AgentX 1.0 是 SemiAnalysis InferenceX v3 基準測試套件的一部分。與以固定輸入、輸出長度為主的傳統推論測試不同,AgentX 重播多輪程式設計代理的真實流量,包含上下文接近 100 萬 token 的情境。13
v1.0 資料集包含 393 個經使用者選擇加入、匿名化處理的 Claude Code 工作階段。符合條件的工作階段至少包含 20 個請求;資料處理則移除了重複請求、部分用戶端特定呼叫,以及重建後超過 990,000 token 的輸入。每個請求的輸入 token 數中位數為 142,000,輸出 token 數中位數為 444;其中 44% 的工作階段包含子代理。8
這種流量模式之所以重要,是因為程式設計代理會反覆傳送不斷更新的大型對話內容或程式碼庫。系統不只是處理一次超長提示,再產生一次長回答,而是要在多輪互動中持續維持大量快取狀態,同時快速回應相對短的輸出。
在較普遍可取得的 SGLang 服務配置中,Nvidia 的優勢最為明顯:
這些數字應被理解為特定運作點的比較,而不是對整個產品線給出單一總分。InferenceX 會在指定的互動性水準下比較不同平台,並根據各平台實際觀察到的服務條件計算成本。79
換句話說,單純測試「8k 輸入/1k 輸出」等固定長度,可能無法反映多輪代理流量中的關鍵瓶頸。某款加速器在單次推論吞吐量上看似接近競爭對手,但當系統必須同時維持大量大型、部分重複的上下文,並確保回應保持即時,就可能迅速拉開差距。
AgentX 工作負載會在相鄰請求之間重用大量上下文。SemiAnalysis 表示,這些代理流量中的前綴快取或 KV 快取命中率經常高於 95%。1
這會改變預填充(prefill)與解碼(decode)之間的效能平衡。系統不是每次都重新處理一個完全不同的提示,而是要儲存、尋找、傳輸並重用大型快取狀態,再在其上延伸產生短回答。因此,KV 快取能否有效留在加速器上,以及服務軟體如何管理這些狀態,會直接影響吞吐量與成本。
可用的高頻寬記憶體容量,決定了多少 KV 快取狀態能夠常駐於加速器。當工作集超過裝置記憶體容量,服務系統可能必須將資料移至主機記憶體,或透過較慢的路徑管理快取狀態。1
主機記憶體卸載可以增加平台可支援的工作階段數量,但也會帶來頻寬與延遲成本。能保留更多活躍快取、或更有效率管理資料搬移的平台,便有機會在相同成本下維持更高的互動性。
SemiAnalysis 也特別提到 TensorRT-LLM 的「邊界感知增量 tokenization」。這種方法不必每次都重新處理不斷變化的完整提示,而是辨識穩定的邊界,只處理新追加的內容。1
對程式設計代理而言,這項最佳化尤其重要:請求可能帶有非常龐大的上下文,實際只產生幾百個 token。在這種模式下,CPU 端前處理與重複 tokenization 可能成為不可忽視的服務開銷。
更廣泛的啟示是,推論的價格效能取決於 硬體 × 執行引擎 × 模型 × 工作負載 × 延遲目標。單看 FLOPS、記憶體頻寬或某個吞吐量數字,都不足以解釋完整結果。
AgentX 並沒有呈現 Nvidia 全面勝出的結果。SemiAnalysis 報告指出,AMD 在特定模型、吞吐量與推論引擎組合中取得明顯優勢或接近持平的表現,尤其是 MI355X 搭配 AMD 的 ATOM 服務引擎。1
遙測資料將 MI355X 搭配 ATOM、SGLang、vLLM 等不同配置分開列出。這個區分非常重要:所謂「AMD 的結果」高度取決於採用哪個服務引擎、模型實作與調校方式。4
ATOM 的專用排程、快取處理與針對 AMD 的核心,在模型與工作負載適合 MI355X 記憶體配置的情況下,可能發揮很好的效能。也就是說,只要營運方願意採用專門為 AMD 平台最佳化的執行環境,AMD 仍能具備很強的競爭力。
專用引擎可以展示硬體在有利條件下的能力,但基礎設施採購者通常不只需要最佳情境下的核心效能。他們還要考慮模型支援範圍、版本更新速度、工具鏈、部署經驗,以及能否長期維護的營運路徑。
SemiAnalysis 表示,其測試配方主要依循上游 vLLM 與 SGLang 的建議,目的是測量客戶較有可能實際部署的配置,而不是只依賴為基準測試量身打造的軟體堆疊。1
因此,對多數考慮採用 AMD 的買家而言,更具決策意義的問題是:MI355X 在上游 vLLM/SGLang 中能有什麼表現,而不只是 ATOM 這類高度專用的 AMD 最佳化引擎能跑出多高的成績。前者還涉及一般版本的模型覆蓋、工具支援與營運可行性。
這是軟體可取得性與採用門檻的差異,並不是說 ATOM 的結果無效,也不是說專用執行引擎沒有價值。
這項基準測試也說明,AI 推論比較很快就會過時。遙測資料列出一組日期為 8 月 21 日的 AMD MI355X MoRI/SGLang 配置,另有其他在不同日期測得的 AMD 配置。4
8 月 21 日的軟體更新改變了至少一項比較的排序,顯示排程、核心、快取搬移與模型支援等改進,可能在短短數日內改變表面上的硬體競爭格局。14
SemiAnalysis 先前針對 MI355X 與 Qwen 3.5 的工作,也提供了類似警示:在 13 週期間,接連推出的 SGLang 版本帶來大幅效能提升。12
對採購者而言,實務上的重點是:比較加速器時,必須記錄確切的執行引擎版本、配置、模型量化方式、並行度範圍,以及目標互動性。若缺乏這些背景,一個看似明確的硬體排名,很可能在服務軟體改進後失去參考價值。
AgentX 是衡量長上下文程式設計代理的有價值代理指標,但不是所有生產環境工作負載的普查。資料集來自內部、使用者選擇加入的追蹤語料,包含 393 個經篩選的工作階段,並不能代表全部企業代理流量。8
以下工作負載可能得到不同結果:
此外,初始比較結果並未納入 Google TPU,因此 AgentX v1.0 無法據此建立 Nvidia、AMD 與 Google 三方的完整結論。1
這場競爭也仍在變動。SemiAnalysis 表示,Nvidia Rubin、AMD MI455X UALoE72,以及新一代 TPU 系統將成為後續或未來的比較對象;它們加入後,競爭格局可能再次改變。111
SemiAnalysis 已依 Apache 2.0 授權條款發布 AgentX 的資料集、測試工具、配置、遙測資料及相關材料。1
這項計畫長期而言的重要性,可能不只在於一次 Nvidia 對 AMD 的比較。SemiAnalysis 表示,AgentX 已成為超過 70 個上游 Pull Request 的目標工作負載,涉及 vLLM、SGLang、TensorRT-LLM、ATOM、AITER、Dynamo、LMCache 與 Mooncake 等專案。1
這讓推論服務框架開發者有一套可重現、且更接近代理實際行為的最佳化目標:高前綴快取重用率、大型 KV 快取、多次短回合互動、子代理、快取傳輸、排程壓力與 tokenization 開銷。
AgentX 強化了這項判斷:在長上下文程式設計代理推論上,Nvidia 的軟體與服務生態系仍是一項重要優勢。在測試的 SGLang 比較中,Nvidia 於 GLM 5.3 的成本效益最高領先約 5 倍,於 Qwen 3.5 的效能則在指定互動性目標下高出 20 倍以上。26
然而,這項基準測試並未證明 Nvidia 永遠勝出。AMD MI355X 與 ATOM 已在特定、針對平台最佳化的配置中展現具競爭力甚至更好的價格效能;同時,推論服務軟體的快速更新也可能改寫排名。
對基礎設施團隊而言,最有用的結論不是根據一個醒目的倍數直接選邊站,而是使用自己的模型、執行引擎、上下文分布與延遲目標重現測試。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
在 SemiAnalysis 的 AgentX 測試中,Nvidia 於 GLM 5.3、每位使用者每秒輸出 150 個 token 的目標下,成本效益最高約為 AMD 的 5 倍;在 Qwen 3.5、每位使用者每秒輸出 90 個 token 的目標下,效能則高出 20 倍以上。[2][6]
在 SemiAnalysis 的 AgentX 測試中,Nvidia 於 GLM 5.3、每位使用者每秒輸出 150 個 token 的目標下,成本效益最高約為 AMD 的 5 倍;在 Qwen 3.5、每位使用者每秒輸出 90 個 token 的目標下,效能則高出 20 倍以上。[2][6] Nvidia 的優勢並非只來自硬體規格,而是記憶體容量、前綴快取重用、主機記憶體卸載行為,以及 TensorRT LLM 等推論軟體共同作用的結果。
AMD 的 MI355X 搭配 ATOM 引擎在部分模型與工作負載中仍達到領先或接近 Nvidia 的表現;對多數採購者而言,上游 vLLM 與 SGLang 的結果比高度客製化的專用執行引擎更具參考價值。