與通用 GPU 不同,Trainium 專門針對深度學習所需的大量矩陣與向量運算設計。透過客製化硬體與 AWS 雲端平台整合,Amazon 希望在 效能、能耗與成本上取得更好的平衡。
這其實是大型雲端公司的一個共同趨勢:
目標都是減少對 Nvidia GPU 的依賴,同時優化自家 AI 工作負載。
Trainium 成長最明顯的指標,是多家 AI 公司簽下長期算力合作。
AWS 已宣布與多家企業達成多年、多吉瓦(gigawatt)級的 AI 算力協議。
幾個重要案例包括:
這些合作很關鍵,因為它們顯示 Trainium 不只用於 Amazon 自家系統,也正在被 前沿 AI 實驗室與大型企業平台採用。
儘管競爭加劇,Nvidia 仍然是 AI 晶片市場的主導者。估計顯示其在資料中心 AI 晶片市場仍握有約 81% 市占率。
但幾個結構性因素讓企業開始尋找替代方案。
1. GPU 供應與需求壓力
大型 AI 模型需要數萬甚至數十萬顆加速器。如果完全依賴單一供應商,可能出現供應瓶頸。
2. 計算成本快速上升
AI 訓練已成為科技公司最大的支出之一。針對 AI 設計的專用晶片,有機會降低整體成本。
3. 雲端平台的垂直整合
透過設計自家晶片,AWS 能同時控制硬體、網路與雲端服務架構,提高效率並降低成本。
因此,多數企業的策略並不是放棄 Nvidia,而是採用 多供應商算力架構:
AWS 最新推出的 Trainium3 是目前最強的版本,主要針對大型生成式 AI 工作負載。
根據 AWS 公布資料,與 Trainium2 相比,Trainium3 系統可帶來多項改進:
AWS 表示,在部分 AI 工作負載中,使用 Trainium 的系統可降低最高約 50% 的訓練與推論成本。
此外,AWS 也指出:
不過需要注意的是,目前跨平台、獨立機構的完整基準測試仍然有限,而 Nvidia 在開發工具與 CUDA 軟體生態上仍具明顯優勢。
目前 AI 硬體市場逐漸形成三種主要模式。
Nvidia
仍是 AI 訓練硬體的核心供應商,其 GPU 和 CUDA 軟體平台已成為業界標準。
Google
透過 TPU(Tensor Processing Unit)長期發展自研 AI 晶片,並在 Google Cloud 提供給客戶。
Amazon
AWS 正打造完整自研硬體堆疊,包括:
Amazon 的策略並不只是做晶片,而是把晶片、雲端服務與長期算力合約整合成一個平台。
AWS 的 Trainium 正逐漸成為 AI 基礎設施市場的重要玩家。超過 2250 億美元的收入承諾、與 Anthropic、OpenAI 等 AI 實驗室的合作,以及企業客戶的測試與部署,都顯示其影響力正在擴大。
儘管 Nvidia 仍然主導市場,但雲端巨頭開始發展自研晶片,意味著未來的 AI 基礎設施很可能不再由單一硬體架構主導,而是多種晶片平台並存的生態系。