OpenAI dévoile le mode Ultrafast pour son modèle GPT 5.6 Sol : 14× plus rapide que le traitement standard, avec un débit de 750 tokens par seconde, grâce aux puces wafer scale Cerebras CS 3. Ce nouveau palier API premium est d’abord réservé à un groupe restreint de clients, en attente d’une liste d’accès.
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is OpenAI's new "Ultrafast" mode for GPT-5.6 Sol, how fast is it compared to standard processing, what token throughput does it achieve. Article summary: Here is the full breakdown of OpenAI's Ultrafast mode for GPT-5.6 Sol:. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Le 13 août 2026, OpenAI a présenté « Ultrafast », une nouvelle offre API qui fait tourner son modèle le plus performant, GPT-5.6 Sol, à des vitesses d’inférence nettement accrues . Ce service est propulsé par les puces wafer-scale de Cerebras (systèmes CS-3) et vise à éliminer le compromis habituel entre la qualité du modèle et la rapidité de réponse pour les applications professionnelles
.
Selon OpenAI, Ultrafast est jusqu’à 14 fois plus rapide que le palier Standard . Il atteint jusqu’à 750 tokens de sortie par seconde, soit environ 14 fois le débit de l’inférence standard de GPT-5.6 Sol
. Pour les tâches où chaque milliseconde compte, cela réduit les temps de réponse de plusieurs secondes à un quasi-temps réel
. Cerebras précise que cette accélération se fait sans aucun compromis sur la qualité, ce qui signifie que Sol Ultrafast offre les mêmes performances de pointe, mais beaucoup plus rapidement
.
Ultrafast est propulsé par les puces wafer-scale Cerebras CS-3 . Cerebras et OpenAI ont annoncé conjointement ce partenariat, Cerebras fournissant le matériel d’inférence à faible latence qui rend cette accélération possible
. Il ne s’agit pas d’un nouveau modèle — Ultrafast fait tourner l’existant GPT-5.6 Sol, présenté en juin 2026 et accessible depuis juillet, sur une infrastructure Cerebras spécialisée
.
OpenAI cible les processus d’entreprise où chaque milliseconde est cruciale . Durant l’aperçu, les clients testent Ultrafast dans cinq secteurs principaux
:
OpenAI applique également Ultrafast à des workflows de recherche impliquant des recherches de connaissances, des requêtes de données, des outils connectés et la synthèse d’informations .
Ultrafast est en aperçu limité (sur liste d’attente) pour certains clients API, à compter du 13-14 août 2026 . OpenAI indique que l’accès sera élargi à davantage d’entreprises à mesure que la capacité des systèmes Cerebras augmentera
. Le prix n’a pas été communiqué — seulement qu’il s’agira d’un palier API premium
. Les prix standards de l’API GPT-5.6 restent inchangés : Sol 5/30 $, Terra 2/12 $, et Luna 0,20/1,20 $ par million de tokens d’entrée/sortie
.
Cet aperçu limité reflète l’approche prudente d’OpenAI quant au déploiement de ce nouveau partenariat d’infrastructure. Une fois la capacité sur les systèmes Cerebras augmentée, un accès plus large est prévu, mais aucun calendrier n’a été annoncé .
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
OpenAI dévoile le mode Ultrafast pour son modèle GPT 5.6 Sol : 14× plus rapide que le traitement standard, avec un débit de 750 tokens par seconde, grâce aux puces wafer scale Cerebras CS 3.
OpenAI dévoile le mode Ultrafast pour son modèle GPT 5.6 Sol : 14× plus rapide que le traitement standard, avec un débit de 750 tokens par seconde, grâce aux puces wafer scale Cerebras CS 3. Ce nouveau palier API premium est d’abord réservé à un groupe restreint de clients, en attente d’une liste d’accès.
Les premiers tests concernent des environnements professionnels où la latence est cruciale : réponse aux incidents, service client, analyse financière, codage et commerce en ligne.