Microsoft 自研 AI 晶片嘅公開旅程係由 2023 年 11 月開始。以下係各代嘅比較:
Maia 計劃去到第二代 Braga 嗰陣遇到咗重大波折。呢粒晶片嘅量產時間表由 2025 年推遲到 2026 年,至少延誤咗六個月。 多個報道(最初由《The Information》爆出)指出,延遲係由以下幾個因素疊加造成:
呢次挫折令 Microsoft 要重新調整成個晶片路線圖,包括將更進取嘅「Braga-R」設計同「Cleato」晶片推遲到 2028 年或之後。
Maia 300 嘅最大轉變係由內部實驗性質,轉向 對外開放。關鍵細節包括:
Microsoft 係喺度追落後。Google 同 Amazon 嘅自研晶片計劃都已經好成熟,喺供應量同可用性上都行前咗好多:
Google (TPU) — 最成熟嘅計劃。TPU Trillium (v6e) 已經喺 Google Cloud 上廣泛可用,最新一代係 TPU v7「Ironwood」。Google 嘅 TPU v5p 以超大型規模(8,960 塊晶片一組)訓練 Gemini 模型。 據報 Google 喺 LLM 工作負載上做到比 H100 執行個體大約 4 倍 嘅價格性能比,透過晶片效率將 Cloud 業務利潤率推到 36%。
Amazon (Trainium/Inferentia) — Trainium2 同 Trainium3 已經喺 AWS 上透過 EC2 Trn 執行個體投入生產。Trainium3 喺 2025 年 12 月嘅 re:Invent 大會全面上市。Amazon 嘅優勢在於分銷渠道 — 將 Trainium 產能租畀 Anthropic 同 OpenAI,帶動 AWS 增長 37%。
Microsoft 嘅關鍵分別:Google 同 Amazon 嘅自研晶片已經可以直接畀雲端客戶租用。Microsoft 嘅 Maia 100 同 200 基本上係「自用」— 只用喺 Microsoft 自己嘅內部工作負載。 透過 Maia 300,Microsoft 嘅目標係要收窄呢個差距,將晶片變成一個 公開可用嘅 Azure 產品,而唔只係內部基建。
Maia 300 嘅誕生背景係一個唔順嘅開局 — Maia 200 嘅延遲暴露咗設計、人手同執行上嘅弱點。Microsoft 嘅賭注係,第三代晶片終於可以做到 Google TPU 同 Amazon Trainium 嘅規模同開放程度。如果真係達到 30 萬塊以上嘅出貨目標,並且做到佢哋所講嘅效率提升,咁就可以實質上改變 Microsoft 嘅 AI 基建成本結構,為 Azure 客戶提供一個真正嘅 Nvidia 替代選擇。不過,喺 Google 同 Amazon 已經有成熟、廣泛可用嘅自研晶片計劃嘅賽道上,Microsoft 仍然係落後嘅挑戰者。