這些合作很關鍵,因為它們顯示 Trainium 不只用於 Amazon 自家系統,也正在被 前沿 AI 實驗室與大型企業平台採用。
但幾個結構性因素讓企業開始尋找替代方案。
1. GPU 供應與需求壓力
大型 AI 模型需要數萬甚至數十萬顆加速器。如果完全依賴單一供應商,可能出現供應瓶頸。
2. 計算成本快速上升
AI 訓練已成為科技公司最大的支出之一。針對 AI 設計的專用晶片,有機會降低整體成本。
3. 雲端平台的垂直整合
透過設計自家晶片,AWS 能同時控制硬體、網路與雲端服務架構,提高效率並降低成本。
因此,多數企業的策略並不是放棄 Nvidia,而是採用 多供應商算力架構:
AWS 最新推出的 Trainium3 是目前最強的版本,主要針對大型生成式 AI 工作負載。
此外,AWS 也指出:
不過需要注意的是,目前跨平台、獨立機構的完整基準測試仍然有限,而 Nvidia 在開發工具與 CUDA 軟體生態上仍具明顯優勢。
目前 AI 硬體市場逐漸形成三種主要模式。
Nvidia
仍是 AI 訓練硬體的核心供應商,其 GPU 和 CUDA 軟體平台已成為業界標準。
Google
透過 TPU(Tensor Processing Unit)長期發展自研 AI 晶片,並在 Google Cloud 提供給客戶。
Amazon
AWS 正打造完整自研硬體堆疊,包括:
Amazon 的策略並不只是做晶片,而是把晶片、雲端服務與長期算力合約整合成一個平台。
AWS 的 Trainium 正逐漸成為 AI 基礎設施市場的重要玩家。超過 2250 億美元的收入承諾、與 Anthropic、OpenAI 等 AI 實驗室的合作,以及企業客戶的測試與部署,都顯示其影響力正在擴大。
儘管 Nvidia 仍然主導市場,但雲端巨頭開始發展自研晶片,意味著未來的 AI 基礎設施很可能不再由單一硬體架構主導,而是多種晶片平台並存的生態系。