这也反映出一个更大的趋势:现代AI训练基础设施正在从“GPU服务器”,转变为机架级超级计算机(rack‑scale supercomputer)。
分析师预计,搭载Rubin架构的 NVL72 AI机架 单套成本约 780万美元。
相比之下,当前Blackwell架构的GB300机架成本约 400万美元。换句话说,一代产品之间价格几乎翻倍。
供应链研究指出,这种上涨几乎涉及整套系统的所有部分,例如:
这说明:AI服务器的成本正在从“芯片为中心”,转向“整机系统为中心”。
Rubin平台中最明显的成本增长来自内存系统。
首先是GPU端使用的 HBM4(高带宽内存)。这是HBM3和HBM3e之后的新一代技术,主要用于支持超大规模AI模型训练所需的极高带宽。
同时,Rubin平台还引入了新的 Vera CPU,并搭配一个巨大的 LPDDR5X内存子系统。通过SOCAMM模块,这部分内存容量可达到 最高1.5TB。
因此,一个Rubin机架实际上包含两种大型内存池:
内存厂商已经开始为这一生态准备产能。例如美光已宣布:
分析估计,内存成本在Rubin机架中可能占到约26%,远高于上一代系统。
除了内存,Rubin平台本身的系统架构也更加复杂。
英伟达将多种专用芯片整合到一个高度协同的系统中,包括:
这种高度协同设计意味着机架内部需要更复杂的硬件结构,例如:
单个组件看起来成本不高,但在一个拥有数十颗加速芯片和大量网络设备的机架中,这些成本会迅速累积。
GPU仍然是系统中最昂贵的单一部件。
一些估算显示:
不过,随着内存和系统组件成本大幅增长,GPU在整机成本中的占比正在下降。
换句话说:
AI计算性能越来越依赖 整体系统架构,而不是单一的加速芯片。
这种成本结构变化,对半导体产业链影响很大。
首先,AI基础设施的价值正在向更多环节扩散,例如:
其次,内存产能 正在成为AI基础设施扩张的关键瓶颈之一,因为Rubin系统高度依赖HBM4供应。
此外,随着系统复杂度提升,负责整机组装的 ODM/OEM服务器厂商 也可能在AI产业链中获得更高价值份额。
780万美元的价格,本质上反映了AI硬件架构的一次重大转变。
早期AI服务器基本是:
GPU + 标准服务器。
而像Rubin这样的新平台,则更接近:
整机架设计的AI超级计算机。
它将计算、内存、网络和系统架构深度整合在一起,从而在训练和推理效率上实现大幅提升。
这也是为什么今天一个AI机架的价格已经可以接近一个小型数据中心部署成本。
需要注意的是,780万美元仍属于分析师基于供应链数据的估算,英伟达尚未公布Rubin系统的官方价格。
但可以确定的一点是:未来AI硬件的竞争,不再只取决于一颗GPU,而是取决于整套系统工程能力。