英特尔在 Hot Chips 2026 上详细介绍了下一代 Xeon 7 服务器平台 Diamond Rapids,产品计划于 2027 年推出。其旗舰配置将单插槽核心数量提升至最多 256 个 Panther Cove 性能核心,并配备 1.28GB 共享末级缓存和全新的 22-Tile 封装架构。
1
2
3
不过,这款处理器也有一个不容忽视的取舍:Diamond Rapids 不支持同时多线程(SMT),也就是英特尔传统上称作的 Hyper-Threading。因此,所谓的 256 核同时也意味着 256 条硬件线程,而不是过去部分至强处理器那样的“核心数 × 2”。英特尔已表示,SMT 预计会在下一代 Coral Rapids 中回归。
7
8
不是一块大芯片,而是一套完整的服务器封装
理解 Diamond Rapids 的关键,不应只盯着核心数量,而要把它看成一套由多个功能模块组成的服务器处理器平台。顶级配置包括:
- 16 个 Intel 18A-P 计算芯粒;
- 每个计算芯粒集成 16 个 Panther Cove P-core,合计 256 核;
- 4 个 Intel 3-T 基础 Tile,负责承载大容量共享末级缓存;
- 2 个 Intel 3 Fabric Hub Tile,负责内存和外部 I/O;
- 整个封装共 22 个 Tile。
1
3
计算芯粒通过 Foveros Direct 先进封装技术堆叠到基础 Tile 上。这样的模块化设计,可以把计算、缓存、内存控制器和 I/O 分配到不同的硅模块中,避免将所有功能都塞进一块大型单片芯片。
3
5
需要注意的是,22 个 Tile 并不等同于 22 个计算芯粒。公开资料显示,顶级型号中的计算部分由 16 个芯粒构成,其余 Tile 主要承担基础、缓存、内存和互连功能。
UCIe-S Fan-out Fabric 取代此前的 EMIB 思路
Diamond Rapids 的另一项重要变化在于芯片内部模块的连接方式。英特尔将采用 UCIe-S 铜互连和 Fan-out Fabric,将计算模块与 Fabric Hub 连接起来,而不是继续使用此前部分至强设计中的 EMIB 方案。
3
11
英特尔希望借此打造更加统一的内存访问模型,让封装内不同核心访问内存时的差异更加可控。对于大型多 Tile 处理器而言,这一目标有望降低软件和服务器管理者处理本地、远程内存区域差异的复杂度。
但“统一访问”目前仍属于架构设计目标。最终效果还需要等实际出货系统以及独立应用测试来验证,尤其要看不同核心数量、内存插法和工作负载下的访问延迟是否始终保持稳定。
4 个 Intel 3-T 基础 Tile 还提供了整颗封装的大容量共享末级缓存。英特尔及相关报道将总容量描述为最高 1.28GB LLC。
1
2 不过,把这整块缓存直接称为“1.28GB L3”可能过于简单,因为目前公开资料尚未完整披露缓存层级结构,也没有说明每一级缓存的具体访问行为。
16 通道内存与 PCIe 6.0 面向带宽型服务器
Diamond Rapids 的设计重点并不只是增加核心,还包括解决高核心数处理器常见的“吃不饱”问题:内存带宽和 I/O 连接不足。
该平台支持 16 个 DDR5 内存通道,具体速率最高可达 DDR5-8000,或在采用 MRDIMM 时达到 12,800 MT/s,实际规格取决于内存技术和系统配置。
3
4
I/O 方面,Diamond Rapids 最多提供 128 条 PCIe Gen 6 通道。相关接口还可以配置为 PCIe、CXL 3.0 或 UPI 3.0,为加速器、内存扩展、网络设备、存储和多路服务器互连预留更大的空间。
3
14
这套配置的意义在于,单纯增加核心并不能自动带来更高的整机性能。如果内存带宽和外部连接跟不上,数据密集型分析、虚拟化以及 AI 工作流中的 CPU 可能长期处于等待状态。Diamond Rapids 同时强化 16 通道内存和 PCIe 6.0,说明英特尔竞争的对象已经不只是“谁的 CPU 核心更多”,而是整个平台的吞吐能力。
APX、AVX10.2 和 AMX 瞄准通用计算与 AI
英特尔开发者资料显示,Diamond Rapids 将支持 Intel APX、AVX10.2 以及更多 Intel AMX 能力。
5
6
APX 会增加 x86 代码可使用的通用寄存器数量。英特尔称,APX 将通用寄存器数量从 16 个增加到 32 个,使编译器可以在寄存器中保留更多数据,从而减少部分内存加载和存储操作。
9
AMX 主要面向矩阵运算密集型 AI 任务,AVX10.2 则继续扩展向量计算能力。相关指令集组合既服务于传统服务器软件,也服务于 AI 推理和其他矩阵计算场景。不过,能否转化为实际性能提升,仍取决于编译器支持、软件优化程度以及具体工作负载的指令构成。
最大悬念:没有超线程,256 核并非万能性能保证
Diamond Rapids 是一款全性能核心 Xeon 设计,但不提供 SMT。英特尔已经承认,放弃多线程可能让其在依赖每个物理核心运行两个逻辑线程的工作负载上处于竞争劣势,并表示 Coral Rapids 将重新加入 SMT。
7
8
这并不意味着 Diamond Rapids 在所有应用中都会因此变慢。对于已经能够充分占用执行资源的计算密集型、向量化程度较高的程序,第二条硬件线程带来的收益可能有限。部分 HPC 工作负载就是如此,HPL 等高度计算密集型程序通常不一定能从 SMT 中获得明显提升。
但对于经常因等待内存而停顿、更加依赖线程吞吐量,或包含多种混合任务的应用,SMT 可能仍然相当重要。因此,256 核更适合作为规格上限,而不能直接视为普遍的性能保证。
服务器采购方最终需要关注自身应用的基准测试,包括扩展效率、内存填充规则、实际频率、持续功耗以及软件授权成本。对部分按核心数收费的软件而言,核心数量增加本身还可能显著影响总拥有成本。
与 AMD Venice 的较量,仍要等实测结果
从规格来看,Diamond Rapids 已进入高密度 x86 服务器处理器的第一梯队。其最高 256 核配置与 AMD Venice EPYC 这一代产品的顶级核心数量相当,同时拥有 16 通道内存、大容量末级缓存和 PCIe Gen 6 连接能力,定位于同一类高带宽数据中心平台。
2
14
36
但这些规格相似并不能直接证明谁会胜出。英特尔目前尚未公布完整的量产规格、产品价格和独立应用基准测试。核心数量之外,时钟频率、内存延迟、持续功耗、软件效率以及系统供货情况,都可能改变最终结果。
因此,Diamond Rapids 能否在 2027 年真正赢得大规模部署,关键问题仍然很明确:英特尔能否提供足够高的每瓦性能和有竞争力的总拥有成本?这套架构确实针对核心密度、内存带宽、I/O 扩展以及跨 Tile 访问等关键压力点进行了升级,但价格、供货和真实业务性能,才会决定它能否从“规格亮眼”走向数据中心的批量采购。