这些合作的重要意义在于:Trainium 的使用者不仅包括亚马逊内部系统,还包括前沿 AI 实验室和大型互联网平台。
但行业出现了几种推动多元化算力的压力。
供应紧张
训练大型 AI 模型需要成千上万颗加速器。如果完全依赖单一供应商,在需求高峰期容易出现算力瓶颈。
成本压力
算力已经成为 AI 开发最大的开支之一。针对特定工作负载设计的定制芯片,有机会降低整体训练成本。
云厂商的垂直整合
通过自研芯片,云厂商可以同时控制硬件、网络和数据中心架构,从而优化性能并降低价格。
现实情况是,大多数公司并没有彻底放弃 Nvidia GPU,而是采用多供应商策略:在 GPU 集群之外,加入 Trainium 或 Google TPU 等定制芯片。
AWS 最新一代架构 Trainium3 专门针对大规模 AI 模型训练进行了升级。
不过需要注意的是,目前跨多种工作负载的独立基准测试仍然有限,而 Nvidia 在开发工具和软件生态方面仍具有明显优势。
当前 AI 硬件市场正逐渐形成三种主要路线。
Nvidia
AI 芯片领域的主导者,其 GPU 和 CUDA 软件生态仍是训练大型模型的主流平台。
Google
最早布局定制 AI 芯片的科技公司之一,其 TPU(Tensor Processing Unit) 已在 Google 内部和云平台广泛使用。
Amazon
AWS 正在构建一个完整的自研硬件体系,包括 Graviton CPU、Trainium AI 加速器以及自研网络硬件,全部整合进 AWS 云基础设施。
与 Nvidia 单纯销售 GPU 不同,亚马逊更侧重于把芯片、云服务和长期算力合同绑定在一起,形成完整的 AI 基础设施平台。
Amazon 的 Trainium 芯片之所以迅速获得关注,是因为 AWS 正在把自研芯片变成一个规模巨大的 AI 基础设施业务。
来自 Anthropic、OpenAI 等 AI 实验室的巨额算力协议、企业客户的逐渐采用,以及持续提升的价格性能比,都让 Trainium 成为大型 AI 工作负载的一个可信替代方案。
Nvidia 依然是 AI 硬件领域最强大的力量,其生态优势短期内难以撼动。但随着云巨头不断推出定制芯片,未来的 AI 基础设施很可能不再由单一硬件平台主导,而是形成多种架构并存的格局。