Sur le benchmark public InferenceX de SemiAnalysis, OpenAI affirme que Jalapeño réalise 1,5 à 1,9 fois plus de travail d’IA par watt et réduit la latence de bout en bout de 1,7 à 3,6 fois face aux systèmes Nvidia testés. Les essais ont porté sur GPT OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T, dans le cadre d’un scén...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip achieve in its August 2026 benchmarks against Nvidia’s GB200 and GB300 systems, which model. Article summary: OpenAI’s August 2026 results position Jalapeño as a potentially much more efficient, lower-latency option for high-volume LLM serving than the specific Nvidia GB200 and GB300 configurations tested—not as a general replac. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Les premiers résultats détaillés publiés par OpenAI défendent une thèse précise : sa puce maison Jalapeño pourrait exécuter des modèles de langage avec moins d’énergie et une latence plus faible que les systèmes Nvidia GB200 et GB300 utilisés comme référence. Sur le benchmark public InferenceX, conçu par SemiAnalysis pour mesurer le service complet d’une requête d’IA, OpenAI annonce 1,5 à 1,9 fois plus de travail d’IA par watt et 1,7 à 3,6 fois moins de latence de bout en bout sur trois modèles à poids ouverts.
Pour une entreprise qui traite des volumes considérables de requêtes, l’enjeu est majeur. Mais ces chiffres ne démontrent pas que Jalapeño serait partout plus rapide ou moins chère qu’un GPU. Les tests sont ciblés, la puce est exclusivement destinée à l’inférence et les résultats proviennent principalement d’essais réalisés par OpenAI sur du silicium d’ingénierie. 14
OpenAI a comparé Jalapeño à des systèmes Nvidia GB200 et GB300 sur InferenceX. Pour calculer l’efficacité énergétique, l’entreprise a normalisé les résultats à partir des puissances nominales publiées pour les accélérateurs.
Les performances annoncées sont les suivantes :
L’écart de latence le plus important apparaît dans l’essai consacré à DeepSeek R1 670B : OpenAI indique que Jalapeño a traité une requête en 1,65 seconde, contre 5,99 secondes pour le système basé sur GB300. 1112
Ces résultats restent des écarts relatifs observés dans un benchmark. Ils ne signifient pas que les réponses de ChatGPT seront automatiquement 3,6 fois plus rapides, ni que les tarifs de l’API baisseront dans les mêmes proportions. En production, les performances dépendent notamment du modèle, des logiciels de service, du regroupement des requêtes, du réseau, de la longueur du contexte, de la taille de la réponse et du compromis recherché entre latence et débit.
Le protocole portait sur trois modèles publics à poids ouverts :
| Modèle | Système Nvidia de comparaison | Résultat annoncé pour Jalapeño |
|---|---|---|
| GPT-OSS 120B | GB200 | Environ 1,9 fois plus de travail par watt ; 1,03 seconde contre 1,80 seconde de latence de bout en bout |
| DeepSeek R1 670B | GB300 | Environ 1,7 fois plus de travail par watt ; 1,65 seconde contre 5,99 secondes de latence |
| Kimi K2.5 1T | GB300 | Environ 1,5 fois plus de travail par watt ; 1,56 seconde contre 5,31 secondes de latence |
Ces chiffres correspondent aux synthèses publiées des essais et non à une reproduction indépendante de l’ensemble de la suite de tests. 61112
Le scénario était nominalement à un seul échange, avec 8 000 jetons en entrée et 1 000 jetons en sortie. Cette configuration facilite une comparaison contrôlée, mais elle ne couvre pas toutes les situations rencontrées par un service d’IA. Elle laisse notamment ouvertes les questions liées aux conversations multi-échanges, aux appels d’outils, aux agents, aux réponses de longueur variable, au traitement par lots et aux requêtes dotées d’un très long contexte. 813
Les mesures correspondent également à des configurations matérielles et logicielles précises. Une évolution des compilateurs, des noyaux logiciels, de la quantification, de l’ordonnancement, de l’architecture des modèles ou de la pile logicielle Nvidia pourrait modifier l’ampleur de l’écart.
Jalapeño est un circuit intégré spécifique, ou ASIC, développé par OpenAI avec Broadcom pour l’inférence des grands modèles de langage. À la différence d’un GPU polyvalent, il est optimisé pour exécuter un modèle déjà entraîné et produire des réponses. 15
Les caractéristiques annoncées à l’échelle du système comprennent :
La version B0 de la puce utiliserait un die de calcul de taille maximale autorisée par le masque de lithographie, fabriqué par TSMC avec son procédé N3P. Elle serait créditée de 13,4 pétaflops de calcul MXFP4. 18
L’approche ne se limite pas au processeur lui-même. Mémoire, interconnexions, réseau et communications entre baies sont essentiels pour servir de très grands modèles, dont l’exécution doit souvent être répartie sur de nombreuses puces. 1819
OpenAI et Broadcom seraient passés du concept à la validation de la conception — le « tape-out » — en environ neuf mois, un calendrier particulièrement court pour une puce haute performance. 720
Des outils d’IA ont participé au processus de conception, mais cela ne signifie pas qu’un modèle d’IA aurait conçu et fabriqué seul le processeur. Le développement a continué de mobiliser des équipes humaines chargées de l’architecture et de l’ingénierie, ainsi que Broadcom pour l’implémentation des semi-conducteurs, les partenaires de fabrication et l’intégration du système. 713
La conclusion la plus solide est donc qu’OpenAI a combiné sa connaissance des charges de travail des modèles de langage avec des outils d’IA au sein du processus d’ingénierie, afin de concevoir conjointement le matériel et les logiciels pour une cible d’utilisation étroite. Cette spécialisation peut améliorer l’efficacité, mais elle réduit aussi la souplesse par rapport à un GPU programmable.
Jalapeño est conçue pour servir des modèles entraînés, et non pour entraîner de nouveaux modèles de frontière. OpenAI continuera donc d’avoir besoin d’accélérateurs programmables — notamment de GPU — pour l’entraînement, la recherche, les expérimentations et les charges qui s’adaptent mal à une architecture d’inférence spécialisée. 813
Cette distinction nuance fortement l’idée d’une « victoire sur Nvidia ». Jalapeño peut dépasser les configurations Nvidia testées sur certains indicateurs d’inférence, tandis que le matériel Nvidia reste indispensable ailleurs dans l’infrastructure d’OpenAI. Un ASIC peut être très performant pour une tâche prévisible et exécutée à grande échelle sans remplacer la plateforme plus polyvalente qui permet l’entraînement et l’évolution rapide des modèles.
Il faut lire ces chiffres comme « meilleure dans les tests publiés », et non comme « meilleure solution d’IA dans tous les domaines ». Plusieurs réserves sont importantes :
Rien dans ces données ne permet donc d’affirmer une réduction universelle de 50 % des coûts, une baisse garantie des prix de l’API ou un remplacement immédiat des GPU Nvidia. Les éléments disponibles étayent des gains de performance et d’efficacité dans des conditions précises, pas ces conclusions commerciales plus larges.
OpenAI prévoit de commencer à déployer Jalapeño dans sa propre infrastructure d’ici la fin de 2026, avec une production en volume et un déploiement plus large attendus en 2027. À plus long terme, l’entreprise vise des centres de données à l’échelle du gigawatt avec Microsoft et d’autres partenaires d’infrastructure, sur plusieurs générations de puces. 16
La puce est destinée en priorité aux besoins internes d’OpenAI, et non à la vente comme processeur disponible sur le marché. Les entreprises extérieures ne doivent donc pas s’attendre, sur la base de ces annonces, à pouvoir acheter du matériel Jalapeño ou louer une instance cloud publique équipée de cette puce. 16
Garder le matériel en interne permet à OpenAI de l’optimiser pour ses propres modèles, noyaux logiciels et systèmes de service. Cela lui évite aussi les contraintes liées au support client, à l’écosystème logiciel, à la vente et à la concurrence avec ses propres clients, qui accompagnent généralement une activité de fournisseur de semi-conducteurs. Il s’agit d’une interprétation stratégique du modèle de déploiement ; le point confirmé est qu’OpenAI prévoit un usage interne plutôt qu’une vente de puces à des tiers. 16
Jalapeño doit être comprise comme un élément du portefeuille de calcul d’OpenAI, et non comme un remplacement général des GPU. La stratégie de l’entreprise combine la capacité cloud de Microsoft et d’autres partenaires, des GPU de type Nvidia pour les charges d’entraînement et les usages flexibles, ainsi que du silicium maison pour les tâches d’inférence stables et suffisamment volumineuses pour justifier une spécialisation. OpenAI décrit aujourd’hui un portefeuille comprenant notamment Microsoft, Nvidia, AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy et SoftBank.
Cette stratégie s’inscrit dans une évolution plus large du secteur. Google développe ses TPU, Amazon propose Trainium et Inferentia, Microsoft a conçu Maia, AMD concurrence Nvidia avec des GPU d’IA polyvalents et Nvidia continue de fournir des systèmes largement programmables. Anthropic cherche également à développer une infrastructure de plus en plus personnalisée grâce à ses relations avec les fournisseurs cloud, même si les éléments disponibles ici ne permettent pas de comparer directement les performances de ses systèmes à celles de Jalapeño.
L’impact stratégique à court terme est donc plus nuancé qu’un scénario de remplacement des GPU. Jalapeño pourrait donner à OpenAI davantage de contrôle sur le coût marginal de l’inférence, la latence, l’approvisionnement et sa feuille de route matérielle. Mais Nvidia reste essentiel pour l’entraînement et la flexibilité, tandis que la puce maison offre à OpenAI une solution spécialisée pour les charges de service prévisibles et massives qui représentent une part importante de ses besoins d’infrastructure. 813
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Sur le benchmark public InferenceX de SemiAnalysis, OpenAI affirme que Jalapeño réalise 1,5 à 1,9 fois plus de travail d’IA par watt et réduit la latence de bout en bout de 1,7 à 3,6 fois face aux systèmes Nvidia testés.
Sur le benchmark public InferenceX de SemiAnalysis, OpenAI affirme que Jalapeño réalise 1,5 à 1,9 fois plus de travail d’IA par watt et réduit la latence de bout en bout de 1,7 à 3,6 fois face aux systèmes Nvidia testés. Les essais ont porté sur GPT OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T, dans le cadre d’un scénario à un seul échange avec 8 000 jetons en entrée et 1 000 en sortie.
Jalapeño est un ASIC de 700 watts conçu uniquement pour l’inférence. OpenAI prévoit un déploiement interne à partir de la fin 2026, puis une montée en production en 2027.