Frozen v2 est un moteur d'inférence spécifique à une application, et non un processeur tensoriel généraliste comme les Tensor Processing Units (TPU) de Google. Les TPU sont des accélérateurs programmables qui prennent en charge une large gamme de modèles d'IA via une reconfiguration logicielle . Frozen v2 est tout le contraire : l'architecture spécifique de Gemini — ses couches, ses opérateurs et son flux de données — est gravée dans la puce au moment de la fabrication, ce qui en fait un "Gemini-dans-une-puce" à usage unique.
| Dimension | TPU existants (Ironwood, TPU 8i/8t) | Frozen v2 |
|---|---|---|
| Philosophie de conception | Accélérateur d'IA à usage général ; unités matricielles programmables, flux de données flexible | ASIC à fonction fixe ; l'architecture de Gemini est intégrée au silicium, non programmable sur le terrain |
| Objectif d'efficacité | Bon pour l'entraînement et l'inférence sur de nombreux modèles | 6 à 10 fois plus de tokens par watt que les TPU les plus récents de Google sur l'inférence de Gemini |
| Modèle de mémoire | HBM + SRAM pour les poids du modèle chargés dynamiquement | Poids du modèle et chemins de calcul intégrés directement dans la ROM de masque / logique câblée |
| Flexibilité | Peut exécuter n'importe quel modèle via une reconfiguration logicielle | Un seul modèle (Gemini) — pas de changement de modèle en cours d'exécution |
Le gain d'efficacité est le point central : les ingénieurs de Google prévoiraient que Frozen v2 pourrait fournir de 6 à 10 fois plus de tokens d'IA par unité de consommation électrique que les dernières puces TPU .
Selon le rapport de The Information et les articles de presse qui le corroborent, Frozen v2 est destinée à être déployée dès 2028 . Cela signifie que la puce est encore à des années de la production et n'entrera en service qu'après le déploiement et la maturation de la famille actuelle de TPU de huitième génération (Sunfish et Zebrafish).
La startup Taalas illustre parfaitement ce que ce compromis signifie en pratique. En février 2026, Taalas a dévoilé sa puce HC1, qui encode l'intégralité du modèle Llama 3.1 8B — chaque paramètre — directement dans les circuits à transistors de la puce à l'aide d'une ROM de masque, sans HBM externe pour le stockage des poids .
Les chiffres sont époustouflants :
L'inconvénient est tout aussi dramatique :
Le fondateur de Taalas a décrit l'architecture comme associant un "tissu de rappel ROM de masque" à un tissu de rappel SRAM pour stocker à la fois le modèle et effectuer toutes les opérations du cache KV sur la puce, éliminant ainsi complètement les mouvements de mémoire externe . C'est la même approche fondamentale que Frozen v2 devrait utiliser.
La capacité de calcul d'IA de Google est tellement tendue qu'elle a commencé à rationner l'accès, même pour des géants payants. Plusieurs éléments de contexte rendent la motivation claire :
Le refus de capacité à Meta (mars 2026) : Google a informé Meta en mars 2026 qu'elle ne pourrait pas fournir toute la capacité de calcul Gemini que Meta souhaitait acheter . Ce manque a retardé certains des projets d'IA internes de Meta et a forcé Meta à demander à ses ingénieurs d'économiser les tokens d'IA .
Chiffres du carnet de commandes : Le carnet de commandes de Google Cloud a presque doublé pour atteindre 462 milliards de dollars au premier trimestre 2026, représentant une demande environ 23 fois supérieure à sa capacité de traitement disponible . Le PDG Sundar Pichai a confirmé lors de la conférence téléphonique sur les résultats : "Nous sommes contraints en termes de calcul à court terme... nos revenus cloud auraient été plus élevés si nous avions pu répondre à cette demande" .
Pression plus large sur la capacité : Google loue même environ 920 millions de dollars par mois en GPU Nvidia à SpaceX pour combler son déficit de calcul . Amin Vahdat, VP cloud de Google, a déclaré en novembre 2025 que l'entreprise aurait besoin de doubler sa capacité d'IA tous les six mois pour répondre à la demande .
Ces contraintes motivent directement Frozen v2 : si Google peut obtenir 6 à 10 fois plus d'inférence Gemini par watt, elle multiplie effectivement sa capacité sans avoir besoin de nouveaux centres de données.
Frozen v2 n'est qu'une pièce d'une stratégie matérielle bien plus large :
1. TPU de huitième génération divisés en puces d'entraînement et d'inférence. Lors du Cloud Next 2026, Google a présenté la famille de TPU de huitième génération, divisée pour la première fois en deux variantes spécialisées :
2. Accord à long terme avec Broadcom jusqu'en 2031. Broadcom a déposé un formulaire 8-K auprès de la SEC divulguant un accord à long terme pour développer et fournir des TPU personnalisés pour les futures générations de Google, ainsi qu'un accord d'assurance d'approvisionnement pour les composants réseau jusqu'en 2031 . Parallèlement, Anthropic a signé un accord pour environ 3,5 GW de capacité TPU Google, mis en service à partir de 2027 .
3. Location de TPU à des clients, y compris OpenAI. Des rapports indiquent que Google propose de plus en plus sa capacité TPU comme produit de location à des entreprises d'IA externes, OpenAI étant nommé comme client .
4. Projet "Icefish" avec MediaTek. Le nom de code "Icefish" semble lié à l'implication de MediaTek sur un projet de puce personnalisée spécifique à Google au-delà du TPU 8i — peut-être un accélérateur d'inférence ou de périphérie à plus faible consommation .
5. Discussions avec Intel. Google aurait eu des discussions avec Intel concernant des conceptions de puces IA personnalisées, bien qu'aucun accord formel n'ait été annoncé .
6. Ironwood (TPU de septième génération) généralement disponible. Ironwood a été rendu généralement disponible pour les clients cloud en avril 2026 . Construit sur un processus 3 nm avec une architecture à deux chips, il a été optimisé pour les modèles MoE alimentant l'écosystème Gemini .
Le rapport de The Information indique explicitement que Frozen v2 est conçue pour compléter, et non remplacer, la feuille de route des TPU de Google . La logique est simple :
C'est analogue à la façon dont les hyper-scalers utilisent à la fois des CPU à usage général pour la plupart des charges de travail et des ASIC à fonction fixe pour des tâches spécifiques à volume élevé (par exemple, le transcodage vidéo, le déchargement réseau). Frozen v2 est l'équivalent IA : un moteur d'inférence spécialisé qui coexiste avec la flotte de TPU programmables.