L'abandon d'une architecture à deux sockets élimine les pénalités de communication entre les puces. Pour les applications qui sollicitent de nombreux cœurs en parallèle — comme les pipelines d'inférence en temps réel, les bases de données en mémoire, ou les flottes de microservices à grande échelle — cette seule réduction de latence se traduit par des gains de débit mesurables.
Les améliorations générationnelles annoncées par AWS sont cohérentes entre les sources officielles, les analyses de tiers et les premiers retours clients :
Puissance de calcul et débit :
Bande passante réseau et stockage :
Résultats concrets chez les clients :
Ces chiffres sont en ligne avec les changements architecturaux. Le cache L3 cinq fois plus grand réduit les accès coûteux à la mémoire DRAM. La mémoire DDR5-8800 plus véloce et le PCIe Gen 6 lèvent les goulots d'étranglement qui brident le débit des générations précédentes. Le design mono-puce réduit, lui, la « taxe de latence » à laquelle sont soumises les applications distribuées sur des architectures NUMA.
Pour les besoins en stockage éphémère rapide directement attaché à l'instance, AWS propose la variante M9gd. Ces instances ajoutent du stockage SSD NVMe local à la plateforme Graviton5, offrant jusqu'à 11,4 To de capacité avec des opérations d'entrée/sortie par seconde (IOPS) supérieures de 30 % à la génération précédente .
Les M9gd ciblent des usages comme les grandes flottes de cache, les pipelines de traitement de logs, ou les moteurs d'analyse en temps réel. Dans ces cas d'usage, rapprocher les données du CPU réduit directement la latence des requêtes. La combinaison de cœurs plus rapides, d'une latence inter-cœurs réduite et d'IOPS de stockage local accrus font de M9gd un choix naturel pour tout besoin qui profite d'un rapprochement calcul-stockage.
L'un des messages les plus notables autour de Graviton5 est le ciblage explicite par AWS des charges de travail d'IA agentique. Il s'agit de systèmes qui effectuent du raisonnement en temps réel, de la génération de code, ou de l'orchestration de tâches complexes, en s'appuyant sur de grands modèles de langage et d'autres techniques d'IA générative .
Alors que les GPU dominent les phases d'entraînement et de traitement par lots, l'IA agentique à grande échelle crée un profil différent : un travail CPU intensif et continu, alternant étapes d'inférence et logique d'orchestration, avec de stricts budgets de latence pour les interactions en plusieurs tours. AWS affirme que la latence inter-cœurs réduite d'un tiers, le cache cinq fois plus grand et le nombre élevé de cœurs par instance de Graviton5 répondent parfaitement à ce besoin, à l'échelle de la production, sans l'équation économique des GPU.
Au-delà de la performance brute, l'ajout le plus significatif de la plateforme Graviton5 est le moteur d'isolation Nitro, un nouveau composant du système Nitro AWS de sixième génération.
Écrit en Rust, ce moteur est un composant d'hyperviseur minimal, conçu pour faire respecter l'isolation entre les machines virtuelles colocataires . Il se distingue de tout autre hyperviseur en production par sa vérification formelle : AWS a produit des preuves vérifiables par machine à l'aide de l'assistant de preuve Isabelle, démontrant mathématiquement
:
Concrètement, cela signifie qu'AWS peut fournir une certitude mathématique que les données d'un client ne peuvent pas être consultées par un autre, que leurs exécutions ne peuvent pas interférer entre elles, et que les opérateurs d'AWS sont soumis aux mêmes frontières d'isolation . AWS s'est engagé à rendre l'implémentation du moteur et les preuves correspondantes accessibles à ses clients pour examen
.
Le moteur est activé par défaut sur les instances M9g . Il s'agit d'un changement de paradigme dans l'assurance sécurité du cloud : on passe des contrôles opérationnels et des discours d'audit à des garanties vérifiables par machine portant sur la couche fondamentale d'isolation.
Parmi les premiers utilisateurs et partenaires de référence nommés, on trouve Meta, Snowflake, Uber, Honeycomb, SAP, Atlassian et ClickHouse, ainsi que HubSpot et d'autres identifiés via leurs partages de résultats.
Les retours clients couvrent plusieurs catégories :
Ces résultats suivent la tendance observée avec l'adoption de Graviton : la plupart des charges de travail voient une amélioration immédiate avec peu ou pas de modifications de code lors du passage de x86 à Arm, et les gains se cumulent de génération en génération.
Graviton5 arrive à un moment où les puces serveur Arm sont devenues un choix de performance grand public, et plus seulement une alternative d'optimisation des coûts. Plus de la moitié des nouvelles capacités CPU d'AWS tournent sur Graviton depuis trois ans, et 98 % des 1000 plus gros clients EC2 utilisent déjà des instances Graviton.
Avec une puce monolithique de 192 cœurs en 3 nm, le support du PCIe Gen 6, de la mémoire DDR5-8800 et une isolation des charges de travail garantie par des preuves mathématiques, Graviton5 repousse les limites non seulement pour les instances AWS, mais aussi pour ce que les clients sont en droit d'attendre du calcul cloud natif : performance, efficacité énergétique et des garanties de sécurité fondées sur la preuve mathématique plutôt que sur des promesses opérationnelles.
La disponibilité générale des instances M9g et M9gd signifie que ces capacités sont désormais accessibles à tous, via les chemins d'adoption EC2 standards. Les variantes C9g (optimisées pour le calcul) et R9g (optimisées pour la mémoire) devraient suivre .