L'optimisation logicielle spécifique qu'OpenAI a développée pour réduire les coûts d'inférence de plus de moitié est le routage multi-modèles. Cette technique achemine automatiquement les requêtes simples vers des modèles plus petits et moins chers, tout en réservant les modèles les plus puissants (et les plus coûteux) aux demandes complexes .
Les guides du secteur décrivent cette approche hybride comme permettant une réduction de 30 à 75 % au niveau du modèle, grâce à la quantification, la distillation et le dimensionnement adéquat, combinés à des optimisations d'exécution comme le batching, le décodage spéculatif et la gestion du cache KV, qui peuvent générer des gains de débit de 40 à 80 % . OpenAI a également opérationnalisé cette stratégie en offrant des réductions de 50 % pour l'inférence différée via son API Batch — à condition que les clients acceptent d'attendre jusqu'à 24 heures pour les résultats
.
Au-delà du routage, des ingénieurs d'OpenAI ont confié à The Information que ces techniques sont si puissantes qu'à un moment donné, ils ont servi ChatGPT aux visiteurs non connectés avec seulement quelques centaines de GPU Nvidia .
Le 24 juin 2026, OpenAI et Broadcom ont dévoilé Jalapeño, la première puce d'inférence sur mesure d'OpenAI . Voici l'essentiel :
OpenAI décrit cette puce comme « la première brique d'une feuille de route pluriannuelle en matière de silicium sur mesure » visant à construire sa propre pile de calcul et à contrer le pouvoir de fixation des prix de Nvidia . La puce est intégrée verticalement — OpenAI l'utilisera exclusivement pour ses propres charges de travail d'inférence, sans la vendre à des clients externes
.
Chiffres clés issus des documents destinés aux actionnaires pour le T1 2026 :
La marge opérationnelle de l'entreprise était d'environ -122 %, ce qui signifie qu'elle perdait environ 1,22 $ pour chaque dollar gagné . Sur l'ensemble de l'année 2025, OpenAI a enregistré environ 38,5 milliards $ de pertes sur 34 milliards $ de dépenses
.
Les mesures de réduction des coûts d'OpenAI s'inscrivent dans une guerre des prix généralisée qui redessine l'économie de l'IA :
La combinaison des optimisations logicielles et matérielles permet à OpenAI de potentiellement réduire de moitié ses coûts d'inférence tout en montant en échelle. Mais l'entreprise n'agit pas en vase clos. L'effondrement général des prix de l'inférence — alimenté par les concurrents, les alternatives open source et le matériel spécialisé — signifie que le pouvoir de fixation des prix s'érode dans toute l'industrie .
Pour les entreprises, c'est une bonne nouvelle : le coût effectif de l'exécution des charges de travail d'IA diminue plus vite que les capacités n'augmentent. L'API Batch d'OpenAI offre déjà des réductions de 50 % pour les charges de travail différées, tandis que le routage multi-modèles peut réduire les coûts de 40 à 60 % sans sacrifier la qualité . La question est de savoir si un fournisseur unique peut maintenir des prix élevés dans un marché où les modèles open source chinois offrent des capacités de pointe à une fraction du coût
.