Cette annonce intervient environ trois semaines après la sortie publique de la famille GPT-5.6, lancée le 9 juillet 2026 . Pour les développeurs et les entreprises qui traitent de gros volumes de requêtes, la baisse de Luna est particulièrement spectaculaire.
Présenté comme le modèle le plus rapide et le plus abordable de la gamme, GPT-5.6 Luna passe de 1 dollar à 0,20 dollar par million de tokens en entrée, et de 6 dollars à 1,20 dollar par million de tokens en sortie .
| Indicateur | Ancien tarif par million de tokens | Nouveau tarif par million de tokens |
|---|---|---|
| Entrée | 1,00 $ | 0,20 $ |
| Entrée mise en cache | — | 0,10 $ |
| Sortie | 6,00 $ | 1,20 $ |
Le coût cumulé d’un million de tokens en entrée et d’un million en sortie atteint ainsi 1,40 dollar, hors éventuels frais ou conditions spécifiques liés à l’utilisation de l’API . Les nouveaux tarifs s’appliquent immédiatement à l’offre API standard à compter du 30 juillet 2026 .
La baisse concerne également le modèle intermédiaire GPT-5.6 Terra, dont le tarif passe de 2,50 à 2 dollars par million de tokens en entrée, et de 15 à 12 dollars en sortie, soit une réduction de 20 % .
Le modèle le plus puissant de la gamme, GPT-5.6 Sol, reste facturé 5 dollars en entrée et 30 dollars en sortie par million de tokens .
OpenAI avance d’abord une raison technique : des progrès d’efficacité réalisés à plusieurs niveaux de la chaîne de production. L’entreprise affirme avoir amélioré le code, l’architecture des systèmes et les mécanismes de service des modèles afin de fournir « nettement plus d’intelligence par dollar » . Elle présente cette évolution comme une nouvelle étape dans l’amélioration du rapport entre performances et coût .
OpenAI indique notamment que le travail effectué sur les noyaux logiciels a réduit de 20 % le coût de fonctionnement des modèles. D’autres expérimentations auraient augmenté de plus de 15 % l’efficacité de la génération de tokens . Selon plusieurs sources, GPT-5.6 Sol a même contribué à réécrire de manière autonome certains noyaux de code utilisés en production, ce qui a participé à la baisse des coûts de service .
Mais le contexte commercial compte aussi. Les entreprises examinent de plus près leurs factures d’IA et hésitent davantage à déployer des modèles coûteux lorsque le retour sur investissement reste difficile à mesurer . OpenAI doit par ailleurs composer avec des solutions moins chères, notamment des modèles chinois à poids ouverts, ainsi qu’avec la concurrence de grands acteurs technologiques qui mettent eux aussi en avant leur rapport coût-performance .
Le PDG d’OpenAI, Sam Altman, a résumé l’objectif sur X : « Nous voulons proposer le meilleur compromis entre prix et intelligence à chaque niveau » .
Pour les applications qui enchaînent un grand nombre de requêtes — assistants automatisés, traitement de documents, génération de code ou flux de travail d’entreprise — Luna devient une option nettement plus économique. Sa position de modèle rapide et orienté vers les usages à fort volume pourrait permettre de réduire les coûts d’inférence, c’est-à-dire les dépenses nécessaires pour faire fonctionner un modèle après son entraînement .
Les réductions se reflètent également dans le décompte de l’utilisation des abonnements payants ChatGPT Work et Codex : les abonnés professionnels peuvent effectuer davantage de tâches avec leur enveloppe existante, sans hausse annoncée du prix de l’abonnement .
Cette décision marque donc un tournant important pour l’API GPT-5.6. OpenAI la présente comme le résultat de progrès d’ingénierie ; dans les faits, elle intervient aussi dans un marché où les entreprises veulent davantage de capacité pour chaque euro dépensé et où la concurrence rend les modèles avancés de moins en moins faciles à vendre au prix fort.