微軟的自研 AI 晶片之路,始於 2023 年 11 月的公開亮相。以下是各世代的比較:
Maia 計畫在第二代產品階段遭遇了顯著的動盪。代號為「Braga」的晶片量產時程至少延遲了六個月,從 2025 年推遲到 2026 年 。多篇報導指出,延遲是由於以下幾個因素疊加所致:
這些挫折迫使微軟重新調整了其更廣泛的晶片路線圖,包括將更為雄心勃勃的「Braga-R」設計以及「Cleato」晶片的計畫,推遲到 2028 年或更晚 。
Maia 300 代表了一個重大轉折:從內部實驗性質的晶片,轉向 外部商用化。關鍵細節如下:
微軟目前處於追趕地位。Google 和 Amazon 都已經擁有更成熟的客製化晶片計畫,且在可用性與規模化程度上更為領先:
Google(TPU) — 發展最成熟的計畫。TPU Trillium (v6e) 已在 Google Cloud 上廣泛提供,最新的世代則是 TPU v7「Ironwood」。Google 的 TPU v5p 用於大規模訓練 Gemini 模型(可組成 8,960 顆晶片的超級計算叢集)。根據 Google 自身的基準測試,其 TPU 在大型語言模型(LLM)工作負載上,性價比約為 H100 實例的 4 倍,並透過自研晶片的高效率,將 Cloud 業務的利潤率推升至 36% 。
Amazon(Trainium/Inferentia) — Trainium2 和 Trainium3 已透過 AWS 的 EC2 Trn 實例進入量產。Trainium3 已於 2025 年 12 月的 re:Invent 大會上全面上市。Amazon 的優勢在於其通路——不僅將 Trainium 運算能力租借給 Anthropic,也租借給 OpenAI,並推動了 AWS 高達 37% 的營收成長 。
對微軟的關鍵差別:Google 和 Amazon 的客製化晶片早已直接以「可租用運算資源」的形式提供給雲端客戶。而微軟的 Maia 100 和 200 在很大程度上是「封閉」的——僅用於微軟自身的內部工作負載 。藉由 Maia 300,微軟的目標是縮小這個差距,讓這款晶片成為 公開的 Azure 服務品項,而不僅僅是內部的基礎設施 。
Maia 300 的到來,始於一個跌跌撞撞的開端——Maia 200 的延遲暴露了其在設計、人員與執行上的弱點。微軟的賭注在於,這第三代晶片最終能達到 Google TPU 和 AWS Trainium 那樣的規模與開放性。如果它能達成超過 30 萬顆的產量目標,並實現其所宣稱的效率提升,那麼它將能顯著改變微軟 AI 基礎設施的經濟效益,並為 Azure 客戶提供一個真正的 Nvidia 替代方案。然而,在 Google 和 Amazon 早已擁有經過驗證、且廣泛供應的客製化晶片計畫的競賽中,微軟仍只是個後來者。