與通用 GPU 不同,Trainium 的架構是為深度學習運算(例如矩陣運算和 Transformer 模型)度身訂造。AWS 的想法很直接:
這種策略其實是「超大型雲端公司」(hyperscalers)的一個大趨勢:愈來愈多企業希望減少完全依賴 Nvidia,而是設計自己的 AI 晶片。
Trainium 最明顯的增長信號,是來自幾個超大型 AI 公司長期算力合約。
AWS 已經宣布多項 多年期、以 GW(吉瓦)計算規模的算力協議,主要用於部署 Trainium 基礎設施。
幾個關鍵合作包括:
Anthropic
這間 AI 公司承諾在未來 10 年 於 AWS 技術上投入超過 1000 億美元,其中包括大量 Trainium 算力,用來訓練和運行 Claude 模型。
OpenAI
AWS 取得約 2 GW Trainium 算力容量的承諾,成為其 AI 基建合作的一部分。
Uber
Uber 擴大與 AWS 的合作,不但在生產系統使用 Amazon 的 Graviton CPU,亦開始 測試用 Trainium3 訓練 AI 模型。
這些合作的重要之處在於:Trainium 不再只用於 Amazon 內部,而是被前沿 AI 實驗室與大型企業平台採用。
即使如此,Nvidia 仍然是 AI 硬件市場的霸主。估計顯示它仍然控制約 81% 的資料中心 AI 晶片市場。
但幾個結構性因素正在推動企業尋找替代方案。
1. GPU 供應緊張
訓練大型 AI 模型需要數萬甚至數十萬個加速器。如果只依賴單一供應商,一旦需求暴增就容易出現瓶頸。
2. 計算成本壓力
AI 訓練已成為科技公司最大的開支之一。專門為 AI 工作負載設計的晶片,有機會降低整體成本。
3. 雲端平台垂直整合
AWS 等公司若自行設計晶片,可以同時控制硬件供應、數據中心架構與價格策略。
因此目前不少公司採取的其實不是「棄用 Nvidia」,而是 多架構算力策略:
不同工作負載使用不同晶片。
AWS 最新一代架構是 Trainium3,主要目標是提升大型 AI 模型訓練效率。
官方資料顯示,相比上一代 Trainium2,Trainium3 有幾項明顯升級:
AWS 表示,一些客戶在 Trainium 系統上訓練或推理模型時,成本最多可降低約 50%,但實際效果仍視乎模型架構與軟件優化程度。
此外,AWS 指 Trainium2 的價格性能比已比可比較 GPU 高約 30%,而 Trainium3 再提升 30–40%。
不過需要留意的是,目前跨不同工作負載的獨立 benchmark 仍然不多,而 Nvidia 在軟件工具和開發者生態方面仍然佔有明顯優勢。
現在 AI 晶片市場大致形成三種不同策略。
Nvidia:GPU 生態系統
Nvidia 仍是 AI 訓練的主流平台,其 CUDA 軟件生態成熟,廣泛被 AI 研究機構使用。
Google:TPU 自研晶片
Google 是最早自研 AI 加速器的大型公司之一,Tensor Processing Units(TPU)已在 Google Cloud 提供給客戶。
Amazon:雲端整合型架構
AWS 正建立完整硬件堆疊,包括:
Amazon 的策略並非單純比拼單顆晶片性能,而是把晶片、雲服務與長期基建合約綁在一起。
Amazon 的 Trainium 正逐步從「內部優化工具」變成一個 大型 AI 基建平台。
與 Anthropic、OpenAI 等 AI 實驗室的巨額合作,加上企業客戶的逐步採用,以及不斷改善的價格性能比,都令 Trainium 成為訓練大型 AI 模型的可行選擇。
短期內,Nvidia 仍然是 AI 硬件市場的主導者。但隨著 Amazon、Google 等雲端巨頭加速自研晶片,未來 AI 基建很可能不再由單一晶片平台主導,而是進入 多架構並存的時代。