Google développe « Frozen v2 », une puce serveur qui grave l'architecture de son modèle d'IA Gemini directement dans le silicium sous forme d'ASIC à fonction fixe, visant un gain de 6 à 10 fois plus de tokens par watt... Le projet est motivé par une grave pénurie de capacité de calcul qui a forcé Google à rationner...

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Google's new custom server chip that bakes its Gemini AI model's architecture directly in. Article summary: Here is a comprehensive, sourced answer to your full question.. Topic tags: general, general web, user generated, news, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Google fait le pari matériel le plus audacieux de son histoire. L'entreprise développe une puce serveur, nom de code interne « Frozen v2 », qui intègre des éléments architecturaux de son modèle d'IA Gemini directement dans le silicium sous la forme d'un ASIC à fonction fixe. Révélé par The Information le 20 juillet 2026, ce projet vise à améliorer considérablement l'efficacité tokens par watt pour le déploiement de Gemini — au prix de ne plus jamais pouvoir faire tourner un autre modèle .
Frozen v2 est un moteur d'inférence spécifique à une application, et non un processeur tensoriel généraliste comme les Tensor Processing Units (TPU) de Google. Les TPU sont des accélérateurs programmables qui prennent en charge une large gamme de modèles d'IA via une reconfiguration logicielle . Frozen v2 est tout le contraire : l'architecture spécifique de Gemini — ses couches, ses opérateurs et son flux de données — est gravée dans la puce au moment de la fabrication, ce qui en fait un "Gemini-dans-une-puce" à usage unique.
Le gain d'efficacité est le point central : les ingénieurs de Google prévoiraient que Frozen v2 pourrait fournir de 6 à 10 fois plus de tokens d'IA par unité de consommation électrique que les dernières puces TPU .
Selon le rapport de The Information et les articles de presse qui le corroborent, Frozen v2 est destinée à être déployée dès 2028 . Cela signifie que la puce est encore à des années de la production et n'entrera en service qu'après le déploiement et la maturation de la famille actuelle de TPU de huitième génération (Sunfish et Zebrafish).
La startup Taalas illustre parfaitement ce que ce compromis signifie en pratique. En février 2026, Taalas a dévoilé sa puce HC1, qui encode l'intégralité du modèle Llama 3.1 8B — chaque paramètre — directement dans les circuits à transistors de la puce à l'aide d'une ROM de masque, sans HBM externe pour le stockage des poids .
Les chiffres sont époustouflants :
L'inconvénient est tout aussi dramatique :
Le fondateur de Taalas a décrit l'architecture comme associant un "tissu de rappel ROM de masque" à un tissu de rappel SRAM pour stocker à la fois le modèle et effectuer toutes les opérations du cache KV sur la puce, éliminant ainsi complètement les mouvements de mémoire externe . C'est la même approche fondamentale que Frozen v2 devrait utiliser.
La capacité de calcul d'IA de Google est tellement tendue qu'elle a commencé à rationner l'accès, même pour des géants payants. Plusieurs éléments de contexte rendent la motivation claire :
Le refus de capacité à Meta (mars 2026) : Google a informé Meta en mars 2026 qu'elle ne pourrait pas fournir toute la capacité de calcul Gemini que Meta souhaitait acheter . Ce manque a retardé certains des projets d'IA internes de Meta et a forcé Meta à demander à ses ingénieurs d'économiser les tokens d'IA
.
Chiffres du carnet de commandes : Le carnet de commandes de Google Cloud a presque doublé pour atteindre 462 milliards de dollars au premier trimestre 2026, représentant une demande environ 23 fois supérieure à sa capacité de traitement disponible . Le PDG Sundar Pichai a confirmé lors de la conférence téléphonique sur les résultats : "Nous sommes contraints en termes de calcul à court terme... nos revenus cloud auraient été plus élevés si nous avions pu répondre à cette demande"
.
Pression plus large sur la capacité : Google loue même environ 920 millions de dollars par mois en GPU Nvidia à SpaceX pour combler son déficit de calcul . Amin Vahdat, VP cloud de Google, a déclaré en novembre 2025 que l'entreprise aurait besoin de doubler sa capacité d'IA tous les six mois pour répondre à la demande
.
Ces contraintes motivent directement Frozen v2 : si Google peut obtenir 6 à 10 fois plus d'inférence Gemini par watt, elle multiplie effectivement sa capacité sans avoir besoin de nouveaux centres de données.
Frozen v2 n'est qu'une pièce d'une stratégie matérielle bien plus large :
1. TPU de huitième génération divisés en puces d'entraînement et d'inférence. Lors du Cloud Next 2026, Google a présenté la famille de TPU de huitième génération, divisée pour la première fois en deux variantes spécialisées :
2. Accord à long terme avec Broadcom jusqu'en 2031. Broadcom a déposé un formulaire 8-K auprès de la SEC divulguant un accord à long terme pour développer et fournir des TPU personnalisés pour les futures générations de Google, ainsi qu'un accord d'assurance d'approvisionnement pour les composants réseau jusqu'en 2031 . Parallèlement, Anthropic a signé un accord pour environ 3,5 GW de capacité TPU Google, mis en service à partir de 2027
.
3. Location de TPU à des clients, y compris OpenAI. Des rapports indiquent que Google propose de plus en plus sa capacité TPU comme produit de location à des entreprises d'IA externes, OpenAI étant nommé comme client .
4. Projet "Icefish" avec MediaTek. Le nom de code "Icefish" semble lié à l'implication de MediaTek sur un projet de puce personnalisée spécifique à Google au-delà du TPU 8i — peut-être un accélérateur d'inférence ou de périphérie à plus faible consommation .
5. Discussions avec Intel. Google aurait eu des discussions avec Intel concernant des conceptions de puces IA personnalisées, bien qu'aucun accord formel n'ait été annoncé .
6. Ironwood (TPU de septième génération) généralement disponible. Ironwood a été rendu généralement disponible pour les clients cloud en avril 2026 . Construit sur un processus 3 nm avec une architecture à deux chips, il a été optimisé pour les modèles MoE alimentant l'écosystème Gemini
.
Le rapport de The Information indique explicitement que Frozen v2 est conçue pour compléter, et non remplacer, la feuille de route des TPU de Google . La logique est simple :
C'est analogue à la façon dont les hyper-scalers utilisent à la fois des CPU à usage général pour la plupart des charges de travail et des ASIC à fonction fixe pour des tâches spécifiques à volume élevé (par exemple, le transcodage vidéo, le déchargement réseau). Frozen v2 est l'équivalent IA : un moteur d'inférence spécialisé qui coexiste avec la flotte de TPU programmables.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google développe « Frozen v2 », une puce serveur qui grave l'architecture de son modèle d'IA Gemini directement dans le silicium sous forme d'ASIC à fonction fixe, visant un gain de 6 à 10 fois plus de tokens par watt...
Google développe « Frozen v2 », une puce serveur qui grave l'architecture de son modèle d'IA Gemini directement dans le silicium sous forme d'ASIC à fonction fixe, visant un gain de 6 à 10 fois plus de tokens par watt... Le projet est motivé par une grave pénurie de capacité de calcul qui a forcé Google à rationner même Meta, avec un carnet de commandes cloud de 460 milliards de dollars et son PDG Sundar Pichai confirmant que l'entrep...
La startup Taalas a déjà prouvé le concept : sa puce HC1 encode le modèle Llama 3.1 8B dans une ROM de masque, atteignant 17 000 tokens/seconde et un coût 20 fois inférieur à celui des GPU, mais est verrouillée sur un...