L'aventure des puces IA sur mesure de Microsoft a commencé publiquement en novembre 2023. Voici comment les générations se comparent :
Le programme Maia a connu des turbulences au stade de la version 200. La production en masse de la puce "Braga" a glissé d'au moins six mois, passant de 2025 à 2026 . Plusieurs rapports, initialement révélés par The Information, attribuent ce retard à plusieurs facteurs :
Ce revers a forcé Microsoft à recalibrer sa feuille de route, y compris en reportant les conceptions plus ambitieuses "Braga-R" et "Cleato" à 2028 ou plus tard .
Le Maia 300 représente un pivot majeur, passant d'une expérimentation interne à une disponibilité externe. Voici les détails clés :
Microsoft joue un rôle de rattrapage. Google et Amazon disposent déjà de programmes de puces sur mesure matures, plus avancés en termes de disponibilité et d'échelle :
Google (TPU) — Le programme le plus mature. Le TPU Trillium (v6e) est largement disponible sur Google Cloud, et le TPU v7 "Ironwood" est la dernière génération. Le TPU v5p de Google alimente l'entraînement de Gemini à une échelle massive (pods de 8 960 puces) . Google obtiendrait un rapport performance-prix environ 4 fois supérieur à celui des instances H100 pour les charges de travail de grands modèles de langage (LLM), et a porté ses marges cloud à 36% grâce à l'efficacité de son silicium .
Amazon (Trainium/Inferentia) — Le Trainium2 et le Trainium3 sont en production et disponibles sur AWS via les instances EC2 Trn. Le Trainium3 est devenu généralement disponible lors du re:Invent en décembre 2025. Amazon l'emporte grâce à sa distribution — en louant la capacité Trainium à la fois à Anthropic et à OpenAI, et en alimentant une croissance de 37% d'AWS .
Différence clé pour Microsoft : les puces sur mesure de Google et d'Amazon sont déjà directement disponibles pour les clients du cloud en tant que capacité de calcul locative. Les Maia 100 et 200 de Microsoft étaient largement captives — utilisées uniquement pour les charges de travail internes de Microsoft . Avec le Maia 300, l'objectif de Microsoft est de combler cet écart en faisant de la puce une offre Azure publique, et non plus un simple jeu d'infrastructure privé .
Le Maia 300 arrive après un départ poussif — les retards du Maia 200 ont exposé des faiblesses en matière de conception, de personnel et d'exécution. Le pari de Microsoft est que la troisième génération atteigne enfin l'échelle et l'ouverture des TPU de Google et des Trainium d'Amazon. Si elle atteint son objectif de plus de 300 000 unités et offre les gains d'efficacité annoncés, elle pourrait redéfinir significativement l'économie de l'infrastructure IA de Microsoft et offrir aux clients Azure une véritable alternative à Nvidia. Mais elle reste l'entrée la plus récente dans une course où Google et Amazon disposent déjà de programmes de silicium sur mesure éprouvés et largement disponibles.