從雙插槽的 Graviton4 邁向單晶片的 Graviton5,最直接的影響就是徹底消除了跨插槽通訊的頻寬與延遲瓶頸。對於將運算分散在多核心上執行的工作來說——像是即時推論管線、記憶體內資料庫,或是大規模微服務——光是這項延遲的改善,就能在單核心指令週期(IPC)提升之外,再貢獻一層可觀的吞吐量增益。
AWS 官方公佈的世代效能提升數據,與第三方分析及早期客戶的實際測試結果相當一致:
運算與吞吐量:
I/O 與頻寬:
來自真實客戶的營運數據:
這些數據的背後,正是架構變革帶來的直接效益。放大 5 倍的 L3 快取大幅減少了對 DRAM 的頻繁存取,這在需要遍歷龐大工作集的資料庫和分析型工作負載上尤其受惠。更快的 DDR5-8800 記憶體與 PCIe Gen 6 介面,則一口氣打通了過往限制吞吐量的頻寬瓶頸。而單晶片設計,則免除了橫向擴展應用在 NUMA 架構上需付出的延遲代價。
針對需要將高速暫存資料保存在最靠近 CPU 位置的應用,AWS 提供了 M9gd 變體。這類執行個體在相同的 Graviton5 運算平台上,加裝了本機 NVMe SSD 區塊儲存,提供最高 11.4 TB 的 NVMe 儲存容量,且 IOPS 較前一代的本機儲存提升 30% 。
大規模快取叢集、日誌處理管線、以及即時分析引擎等應用,對資料存取延遲極度敏感,M9gd 正是為此類需求而生。更快的核心、更低的核心間延遲,再搭配更高的本機儲存 IOPS,讓 M9gd 成為任何試圖縮短「儲存與運算間距離」之工作負載的首選。
Graviton5 另一個在定位上值得關注的轉變,是 AWS 明確將其瞄準 代理式 AI(Agentic AI) 工作負載——也就是運用大型語言模型(LLM)與其他生成式 AI 技術,來進行即時推理、程式碼生成、多步驟任務編排的系統 。
這類應用在當今的討論中,多半聚焦於 GPU 或 AI 加速器在模型訓練與大量批次推論上的角色。然而,當代理式 AI 進入大規模生產階段時,會創造出一種截然不同的運算模式:在模型推論步驟與編排邏輯之間不斷高速切換的 CPU 密集工作,並須嚴格遵守多重互動的延遲預算。AWS 主張 Graviton5 的低核心間延遲、超大型快取與高核心密度,讓它特別適合這類毋需背負 GPU 高昂成本、但卻需要大規模生產力來支撐的 AI 工作 。
這套引擎以 Rust 語言實作,是一個功能極簡、專門為了在共居的多台虛擬機之間,強制執行隔離而生的虛擬化管理程式元件 。它與現今所有其他生產中虛擬化軟體的最大差異,就在於 形式驗證:AWS 使用 Isabelle 證明輔助工具,產生了機器可驗證的數學證明,來保證以下事項
:
這意味著 AWS 可以提供數學上的確定性,保證某個客戶的工作負載完全無法存取另一個客戶的資料,或干擾其執行,而 AWS 的營運人員也受到相同的隔離限制 。AWS 更承諾,將開放 Nitro Isolation Engine 的實作程式碼與證明文件,供客戶公開檢視
。
已公開的早期採用者與基準測試合作夥伴包括 Meta、Snowflake、Uber、Honeycomb、SAP、Atlassian 及 ClickHouse,以及透過效能數據揭露的 HubSpot 等 。
這些客戶回報的實際營運數據橫跨多種工作負載類型:
這些成果再次印證了 Graviton 採用的典型路徑:多數工作負載從 x86 遷移到 Arm 時,在幾乎不需或僅需少量程式碼修改的情況下,就能立刻感受到效能提升,而這樣的效益會隨著矽晶片的世代更迭而持續疊加 。
Graviton5 的登場,正處於 Arm 架構伺服器晶片,從「成本優化替代方案」轉變為「主流效能選擇」的關鍵時刻。在過去三年間,AWS 過半數的新增 CPU 容量都由 Graviton 驅動,且前一千大 EC2 客戶中,高達 98% 已在採用 Graviton 執行個體 。
透過單晶片 192 核心設計、3 奈米製程、PCIe Gen 6、DDR5-8800 記憶體,以及數學上可證明的虛擬機隔離能力,Graviton5 不僅拉高了 AWS 自家執行個體家族的規格天花板,也形同為整個雲端原生運算的未來劃下了一道新的標竿:效能、能效與安全的保證,理應立基於可被驗證的科學事實,而非僅是營運上的承諾。
隨著 M9g 與 M9gd 執行個體正式全面可用,這些能力現已可透過標準的 EC2 採用路徑供所有客戶取用;專為運算密集型設計的 C9g,以及專為記憶體密集型設計的 R9g 等變體,也預計在不久的將來跟進推出 。