微软的自研AI芯片之路始于2023年11月。以下是各代产品的对比:
Maia项目在第二代时遭遇波折。代号“Braga”的芯片量产计划至少延迟了六个月,从2025年推迟到了2026年。多家媒体(最初由The Information报道)将此次延误归因于几个叠加因素:
这次挫败迫使微软重新调整了其整体的芯片路线图,包括将更雄心勃勃的“Braga-R”设计和“Cleato”芯片推迟到2028年或更晚。
Maia 300代表了从内部实验到对外供应的重大战略转向。关键细节包括:
微软正在奋起直追。谷歌和亚马逊都拥有更为成熟的定制芯片项目,在可用性和规模上都走在前列:
谷歌(TPU) — 最成熟的项目。TPU Trillium (v6e) 已在谷歌云上大规模可用,最新的TPU v7 "Ironwood"也已推出。谷歌的TPU v5p 以超过8000芯片的巨型集群为Gemini的训练提供动力。据报道,在大型语言模型工作负载方面,谷歌的价格性能比H100实例高出约4倍,并通过芯片效率将其云业务利润率提升至36%。
亚马逊(Trainium/Inferentia) — Trainium2和Trainium3已在AWS上通过EC2 Trn实例投入生产。Trainium3于2025年12月在re:Invent大会上正式可用。亚马逊的优势在于其分发能力——它将Trainium容量同时租给Anthropic和OpenAI,并推动了AWS 37%的增长。
对微软的关键差异:谷歌和亚马逊的定制芯片已可直接作为租赁计算资源提供给云客户。而微软的Maia 100和200在很大程度上是“自留地”——仅用于微软自己的内部工作负载。随着Maia 300的推出,微软的目标是弥合这一差距,使其成为一个公开可用的Azure服务,而不仅仅是内部基础设施的补充。
Maia 300是在磕磕绊绊中诞生的——Maia 200的延误暴露了设计、人员和执行方面的弱点。微软的赌注是,第三代芯片最终能达到谷歌TPU和亚马逊Trainium的量产规模和开放程度。如果它能实现30万片以上的出货目标并带来宣称的效率提升,那么它将深刻地重塑微软的AI基础设施经济性,并为Azure客户提供一个真正的英伟达替代方案。然而,在这场竞逐中,它依然是一个后来者,而谷歌和亚马逊已经拥有经过验证且广泛可用的定制芯片体系。