Le TPU est un ASIC spécialisé pour le calcul tensoriel dans les systèmes de machine learning . Cette spécialisation peut devenir un avantage net lorsque le travail est régulier : formes de tenseurs stables, lots bien dimensionnés, partitionnement efficace et chemin de compilation adapté. Dans ce cas, une part importante du silicium peut rester occupée.
Le H100 adopte une logique plus polyvalente. Il est très optimisé pour l’IA grâce à ses Tensor Cores, mais sa fiche publique couvre aussi des performances FP64 et FP32 classiques, ainsi que plusieurs modes Tensor Core en plus basse précision . Cette amplitude est précieuse lorsqu’un même parc d’accélérateurs doit servir à des expérimentations diverses, à des modèles aux exigences numériques différentes ou à des charges qui ne sont pas toutes du deep learning pur.
Les chiffres publics donnent une idée du terrain de jeu, pas un classement universel. Les tableaux TPU et GPU ne comparent pas toujours les mêmes modes de précision, les mêmes hypothèses système ni les mêmes chemins de mise à l’échelle.
| Accélérateur | Mémoire publique | Bande passante publique | Calcul public | À lire surtout comme |
|---|---|---|---|---|
| TPU v5e | 16 Go HBM par puce | 8,1 × 10^11 octets/s par puce | 1,97 × 10^14 FLOP/s BF16 par puce ; 3,94 × 10^14 FLOP/s INT8 par puce | Une option TPU avec moins de HBM par puce que v5p ou v6e dans le tableau JAX ; vérifiez soigneusement l’adéquation mémoire . |
| TPU v5p | 96 Go HBM par puce | 2,8 × 10^12 octets/s par puce | 4,59 × 10^14 FLOP/s BF16 par puce ; 9,18 × 10^14 FLOP/s INT8 par puce | La ligne TPU avec le plus de HBM par puce parmi v5e, v5p et v6e dans le tableau JAX . |
| TPU v6e | 32 Go HBM par puce | 1,6 × 10^12 octets/s par puce | 9,20 × 10^14 FLOP/s BF16 par puce ; 1,84 × 10^15 FLOP/s INT8 par puce | Le débit BF16 et INT8 par puce le plus élevé parmi ces lignes TPU . |
| NVIDIA H100 SXM | 80 Go HBM3 | 3,35 To/s | 67 TFLOPS FP32 ; 989 TFLOPS TF32 Tensor Core ; 1 979 TFLOPS BF16/FP16 Tensor Core ; 3 958 TFLOPS FP8 Tensor Core ; 3 958 TOPS INT8 Tensor Core | Une couverture large des précisions, une forte bande passante mémoire et un profil d’accélérateur plus généraliste . |
Google Cloud documente aussi des types de machines A3 avec 1, 2, 4 ou 8 GPU H100 attachés, chacun doté de 80 Go de HBM3 . Et dans sa communication autour de l’AI Hypercomputer, Google Cloud présente les TPU et les VM A3 avec GPU H100 comme deux options d’un même portefeuille d’infrastructure IA . Le choix n’est donc pas toujours « TPU sur Google Cloud » contre « GPU ailleurs » : il peut aussi se poser à l’intérieur du même environnement cloud.
Un TPU devient particulièrement intéressant lorsque sa spécialisation sert votre charge de travail au lieu de la contraindre. Mettez-le en haut de la liste si :
Les TPU peuvent être très convaincants lorsque la charge maintient les puces occupées et évite de coûteuses réécritures. Mais c’est un résultat dépendant de la charge, pas une propriété universelle. Google a d’ailleurs publié des analyses de performance par dollar pour l’inférence IA sur GPU et TPU, ce qui rappelle que l’économie du serving dépend du modèle et de la configuration, et non d’un classement unique des accélérateurs .
Le H100 devient le meilleur candidat lorsque la flexibilité vaut plus que la spécialisation. Il est particulièrement pertinent si :
Le meilleur argument du H100 n’est pas forcément qu’un GPU bat toujours une puce TPU dans tous les benchmarks. C’est plutôt qu’il offre une plateforme d’accélération plus souple lorsque les besoins changent.
Les comparaisons tarifaires sont séduisantes, mais elles peuvent être trompeuses. Une comparaison tierce citait par exemple le TPU v5e de Google Cloud autour de 1,20 dollar par puce-heure et un exemple Azure ND H100 v5 autour de 12,84 dollars par heure pour un GPU H100 de 80 Go . Comme il s’agit d’une comparaison non officielle et entre clouds différents, elle doit être lue comme un signal directionnel, pas comme une conclusion générale selon laquelle le TPU serait toujours moins cher.
Une comparaison sérieuse doit mesurer le système complet :
La bonne métrique est le coût par sortie utile : par étape d’entraînement, par modèle convergé, par jeton d’inférence ou par objectif de latence.
| Priorité | Choix par défaut | Pourquoi |
|---|---|---|
| Deep learning compatible TPU sur Google Cloud | Google TPU | Les documents TPU publics mettent l’accent sur l’échelle des pods, la HBM, la bande passante et les débits BF16/INT8 pour planifier le scaling des modèles . |
| Large support des précisions numériques | NVIDIA H100 | Le H100 SXM liste des modes FP64, FP32, TF32 Tensor Core, BF16/FP16 Tensor Core, FP8 Tensor Core et INT8 Tensor Core . |
| Déploiement Google Cloud avec besoin d’options | Benchmark des deux | Google Cloud documente les machines A3 H100 et positionne aussi les TPU et les VM A3 H100 dans son portefeuille d’infrastructure IA . |
| Coût d’inférence le plus bas | Benchmark des deux | Google a publié une analyse de performance par dollar pour l’inférence IA, tandis que les exemples tiers de prix à l’heure restent directionnels et inter-clouds . |
| Production déjà pensée GPU | NVIDIA H100 | Réduire le risque de migration peut compter davantage qu’un gain théorique d’efficacité de l’accélérateur. |
Considérez le TPU comme l’accélérateur IA le plus spécialisé, et le H100 comme la plateforme d’accélération la plus flexible. Si votre modèle est compatible TPU, très orienté deep learning et déjà destiné à Google Cloud, un TPU peut être le meilleur pari en coût-performance. Si vous avez besoin de nombreux modes numériques, de charges mixtes, de continuité opérationnelle autour des GPU ou d’un risque de migration plus faible, les GPU NVIDIA H100 sont généralement le choix le plus prudent .
La seule réponse vraiment fiable reste un benchmark propre à votre charge : débit, comportement mémoire, taux d’utilisation, coût total et effort d’ingénierie sur le modèle exact que vous comptez entraîner ou servir.