Intel 在 Hot Chips 2026 詳細介紹了代號為 Diamond Rapids 的下一代 Xeon 7 伺服器平台,產品預計於 2027 年推出。其旗艦配置大幅提高單一處理器的實體核心密度,最高可搭載 256 顆 Panther Cove 效能核心、1.28GB 共享末級快取,並以全新的記憶體與 Chiplet 互連拓撲打造 22 Tile 封裝。
1
2
3
不過,這項規格提升也伴隨一個重要取捨:Diamond Rapids 不支援同時多執行緒(Simultaneous Multithreading,SMT),也就是 Intel 過去稱為 Hyper-Threading 的技術。因此,標示為 256 核心的旗艦型號,實際上對應 256 條硬體執行緒;Intel 則表示,SMT 預計會在後續的 Coral Rapids 世代回歸。
7
8
Diamond Rapids 的封裝如何組成?
理解 Diamond Rapids 的關鍵,在於它不是傳統的單體式 CPU,而是一個把運算、快取、記憶體控制器與 I/O 分散到不同矽元件的完整伺服器封裝。最高配置包括:
- 16 個 Intel 18A-P 運算 Chiplet
- 每個 Chiplet 搭載 16 顆 Panther Cove P-core,合計 256 顆核心
- 4 個 Intel 3-T 基礎 Tile
- 2 個 Intel 3 Fabric Hub Tile,負責記憶體與外部 I/O
- 總計 22 個 Tile
1
3
運算 Chiplet 會透過 Foveros Direct 封裝技術,堆疊到基礎 Tile 上方。這種模組化設計讓 Intel 能夠以不同矽元件分別處理運算、快取、記憶體控制與 I/O,避免將所有功能集中在單一大型 Die 中。
3
5
UCIe-S Fan-out Fabric 取代 EMIB
Diamond Rapids 的另一項重大變化,是不同模組之間的連接方式。Intel 將使用 UCIe-S 銅連接與 Fan-out Fabric,連接運算元件與 Fabric Hub,而不是延續前幾代 Xeon 採用的 EMIB 方案。
3
11
Intel 的架構目標,是在整個封裝內建立更一致的記憶體存取模式。對實際伺服器而言,這可能減少軟體與系統管理員處理明顯不同本地與遠端記憶體區域時的複雜度。至於這項設計能否穩定轉化為效能優勢,仍要等實際出貨系統與獨立應用程式測試驗證。
4 個 Intel 3-T 基礎 Tile 也提供了封裝內的大容量共享末級快取。Intel 與相關報導將總容量描述為最高 1.28GB LLC。不過,直接把這整個容量稱為「L3」可能過於簡化,因為目前公開資料尚未完整說明快取階層,以及不同區域的存取行為。
1
2
16 通道記憶體與 PCIe 6.0 瞄準高頻寬伺服器
對高核心數處理器來說,記憶體頻寬與 I/O 連接能力往往會成為效能瓶頸。Diamond Rapids 平台支援 16 通道 DDR5 記憶體,速度最高可達 DDR5-8000;若採用 MRDIMM,則最高可達 12,800 MT/s,實際上限取決於記憶體技術與配置。
3
4
I/O 方面,平台最高提供 128 條 PCIe Gen 6 通道。I/O 子系統可配置為 PCIe、CXL 3.0 或 UPI 3.0,讓系統設計者能夠連接更多加速器、擴充記憶體、網路設備,以及多插槽伺服器所需的處理器互連。
3
14
這種平台級平衡相當重要。若只是增加核心數,卻沒有同步提高記憶體與 I/O 能力,處理器可能會因資料供應不足而無法充分發揮,尤其是在資料密集型分析、虛擬化與 AI 工作流程中。Diamond Rapids 的 16 通道記憶體與 PCIe 6.0 支援顯示,Intel 競爭的重點不只是 CPU 核心本身,也包括整個伺服器平台。
APX、AVX10.2 與 AMX 強化運算能力
Intel 的開發者資料指出,Diamond Rapids 支援 Intel APX、AVX10.2 與更多 Intel AMX 功能。
5
6
APX 會增加 x86 程式可使用的架構通用暫存器數量。Intel 表示,APX 可讓通用暫存器數目由 16 個增加至 32 個,減少編譯後軟體需要從記憶體載入或寫回資料的次數。
9
AMX 主要針對矩陣運算密集的 AI 工作負載,AVX10.2 則延伸向量處理能力。這些功能讓 Diamond Rapids 同時具備處理一般伺服器軟體與 AI 相關計算的工具;但實際效能提升,仍會取決於編譯器支援、軟體最佳化程度,以及工作負載使用的指令組合。
最大疑問:為何取消 Hyper-Threading?
Diamond Rapids 是全效能核心的 Xeon 設計,但不支援 SMT。Intel 已承認,對於能從每個實體核心執行兩條邏輯執行緒中受益的工作負載,取消多執行緒可能造成競爭劣勢。公司表示,SMT 預計會在下一代 P-core Xeon——Coral Rapids——重新推出。
7
8
不過,沒有 SMT 並不代表所有應用程式都會變慢。若工作負載已經充分佔滿核心的執行資源,尤其是高度平行且向量化程度良好的程式,第二條硬體執行緒帶來的收益可能有限。相反地,經常等待記憶體、受延遲影響,或更重視執行緒吞吐量的工作負載,通常更可能受益於 SMT。
因此,「256 核心」不應被視為適用所有情境的效能保證。採購者仍需要針對自身應用程式進行測試,並同時評估擴展效率、記憶體配置規則、運作頻率、功耗與軟體授權成本。
與 AMD 高核心數伺服器的競爭
就規格而言,Diamond Rapids 已更接近目前最高密度的 x86 伺服器設計。其最高 256 核心配置,與 AMD Venice EPYC 世代所報導的頂級核心數相同;16 通道記憶體、大容量 LLC 與 PCIe Gen 6 連接能力,也讓它落在同一類高頻寬資料中心平台的競爭範圍內。
2
14
36
但這些相似之處並不能直接判定誰會勝出。Intel 尚未公布完整的最終出貨規格、產品定價與獨立應用程式基準測試,因此目前還無法進行完整的直接比較。核心數也只是其中一項指標,時脈、記憶體延遲、持續功耗、軟體效率與系統供貨情況同樣重要。
Diamond Rapids 能否在 2027 年進入大量部署,最後仍取決於一個務實問題:Intel 能否以足夠的每瓦效能與總持有成本優勢,說服資料中心採用?這套架構確實針對核心密度、記憶體頻寬、I/O 擴充與跨 Tile 存取等壓力點提出方案,但產品價格與實際基準測試,才會決定這些改進能否轉化為市場份額。