OpenAI presenta Ultrafast, un nuevo modo para GPT 5.6 Sol que acelera la inferencia hasta 14 veces respecto al procesamiento estándar, alcanzando 750 tokens por segundo gracias a los chips wafer scale Cerebras CS 3. El modo está diseñado para flujos de trabajo empresariales donde cada milisegundo importa: respuesta...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is OpenAI's new "Ultrafast" mode for GPT-5.6 Sol, how fast is it compared to standard processing, what token throughput does it achieve. Article summary: Here is the full breakdown of OpenAI's Ultrafast mode for GPT-5.6 Sol:. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
El 13 de agosto de 2026, OpenAI presentó en vista previa Ultrafast, un nuevo nivel de servicio en su API que ejecuta su modelo más potente, GPT-5.6 Sol, a velocidades de inferencia dramáticamente superiores . Este nivel funciona con los chips wafer-scale de Cerebras (sistemas Cerebras CS-3) y aspira a eliminar el tradicional dilema entre calidad del modelo y velocidad de respuesta para aplicaciones empresariales
.
OpenAI afirma que Ultrafast funciona hasta 14 veces más rápido que el nivel de procesamiento estándar . El servicio alcanza hasta 750 tokens de salida por segundo, aproximadamente 14 veces el rendimiento de la inferencia estándar de GPT-5.6 Sol
. Para tareas sensibles a la latencia, esto reduce los tiempos de respuesta de varios segundos a un tiempo casi instantáneo
. Cerebras asegura que la aceleración se logra sin ningún compromiso en la calidad, ofreciendo el mismo rendimiento de vanguardia a una velocidad mucho mayor
.
Ultrafast funciona con chips wafer-scale de Cerebras (sistemas Cerebras CS-3) . Cerebras y OpenAI anunciaron conjuntamente la alianza, en la que Cerebras proporciona el hardware de inferencia de baja latencia que hace posible la aceleración
. No se trata de un modelo nuevo: Ultrafast ejecuta el GPT-5.6 Sol ya existente (presentado en junio de 2026 y disponible de forma general desde julio) en la infraestructura especializada de Cerebras
.
OpenAI apunta a procesos empresariales donde cada milisegundo cuenta . Durante la vista previa, los clientes están probando Ultrafast en cinco áreas principales
:
OpenAI también está aplicando Ultrafast a flujos de trabajo de investigación que implican búsquedas de conocimiento, consultas de datos, herramientas conectadas y síntesis de información .
Ultrafast se encuentra en vista previa limitada (basada en lista de espera) para clientes API seleccionados a partir del 13 y 14 de agosto de 2026 . OpenAI afirma que el acceso se ampliará a más empresas a medida que crezca la capacidad de Cerebras
. El precio no se ha revelado; solo se sabe que será un nivel API premium
. Los precios estándar de la API de GPT-5.6 permanecen en Sol: $5/$30, Terra: $2/$12, y Luna: $0.20/$1.20 por millón de tokens de entrada/salida
.
La vista previa limitada refleja el enfoque cauteloso de OpenAI para escalar una nueva alianza de infraestructura. A medida que aumente la capacidad en los sistemas de Cerebras, se espera un acceso más amplio, aunque no se ha anunciado un cronograma .
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
OpenAI presenta Ultrafast, un nuevo modo para GPT 5.6 Sol que acelera la inferencia hasta 14 veces respecto al procesamiento estándar, alcanzando 750 tokens por segundo gracias a los chips wafer scale Cerebras CS 3.
OpenAI presenta Ultrafast, un nuevo modo para GPT 5.6 Sol que acelera la inferencia hasta 14 veces respecto al procesamiento estándar, alcanzando 750 tokens por segundo gracias a los chips wafer scale Cerebras CS 3. El modo está diseñado para flujos de trabajo empresariales donde cada milisegundo importa: respuesta a incidentes, atención al cliente, análisis financiero, programación y comercio electrónico.
Ultrafast no es un modelo nuevo, sino una capa de servicio premium sobre GPT 5.6 Sol.