En las pruebas de agosto de 2026, OpenAI afirmó que Jalapeño logró entre 1,5 y 1,9 veces más trabajo de IA por vatio y entre 1,7 y 3,6 veces menos latencia de extremo a extremo que los sistemas Nvidia GB200 y GB300 co... El ensayo utilizó GPT OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T en InferenceX, con una carga de...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip achieve in its August 2026 benchmarks against Nvidia’s GB200 and GB300 systems, which model. Article summary: OpenAI’s August 2026 results position Jalapeño as a potentially much more efficient, lower-latency option for high-volume LLM serving than the specific Nvidia GB200 and GB300 configurations tested—not as a general replac. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Los primeros resultados detallados de Jalapeño respaldan una afirmación concreta: el silicio personalizado de OpenAI podría ejecutar modelos de lenguaje grandes con menos consumo y menor latencia que determinados sistemas Nvidia GB200 y GB300 utilizados como referencia. En el benchmark público InferenceX, de SemiAnalysis, OpenAI informó entre 1,5 y 1,9 veces más trabajo de IA por vatio y entre 1,7 y 3,6 veces menos latencia de extremo a extremo en tres modelos de pesos abiertos.
Es un resultado relevante para una empresa que atiende cantidades masivas de solicitudes de IA, pero no equivale a demostrar que Jalapeño sea un sustituto más rápido o barato de las GPU en cualquier escenario. Las pruebas fueron acotadas, el chip está diseñado únicamente para inferencia y las cifras proceden principalmente de ensayos realizados por OpenAI con silicio de ingeniería. 14
OpenAI comparó Jalapeño con sistemas Nvidia GB200 y GB300 utilizando InferenceX, una prueba que pretende medir el proceso completo de atender una solicitud de IA. Para calcular la eficiencia, la empresa normalizó los resultados según las potencias publicadas de los aceleradores.
En el conjunto de pruebas presentado, Jalapeño consiguió:
La mayor diferencia de latencia comunicada aparece en DeepSeek R1 670B: Jalapeño completó una solicitud en 1,65 segundos, frente a 5,99 segundos en el sistema basado en GB300. 1112
Estas cifras son resultados relativos de laboratorio, no una promesa de que ChatGPT vaya a responder exactamente 3,6 veces más rápido ni de que los precios de la API vayan a bajar en la misma proporción. El rendimiento real depende del modelo, el software de servicio, la agrupación de solicitudes —batching—, la red, la longitud del contexto, el tamaño de la respuesta y el equilibrio elegido entre latencia y capacidad total.
El ensayo cubrió tres modelos de pesos abiertos disponibles públicamente:
| Modelo | Comparación con Nvidia | Resultado comunicado para Jalapeño |
|---|---|---|
| GPT-OSS 120B | GB200 | Aproximadamente 1,9 veces más trabajo por vatio; 1,03 segundos frente a 1,80 segundos de latencia total |
| DeepSeek R1 670B | GB300 | Aproximadamente 1,7 veces más trabajo por vatio; 1,65 segundos frente a 5,99 segundos de latencia |
| Kimi K2.5 1T | GB300 | Aproximadamente 1,5 veces más trabajo por vatio; 1,56 segundos frente a 5,31 segundos de latencia |
Los datos anteriores proceden de resúmenes de las pruebas comunicadas, no de una reproducción independiente de todo el conjunto de InferenceX. 61112
La carga era nominalmente de una sola interacción, con 8.000 tokens de entrada y 1.000 tokens de salida. Este formato facilita una comparación controlada, pero no representa todo el tráfico de un servicio de IA. Deja abiertas cuestiones sobre conversaciones de varios turnos, llamadas a herramientas, flujos de agentes, respuestas de longitud variable, comportamiento con batching y solicitudes con contextos muy extensos. 813
También se midieron configuraciones concretas de hardware y software. Cambios en compiladores, kernels, cuantización, planificación, arquitectura del modelo o la pila de ejecución de Nvidia podrían modificar la magnitud de la diferencia.
Jalapeño es un circuito integrado de aplicación específica —ASIC, por sus siglas en inglés— desarrollado por OpenAI y Broadcom para la inferencia de modelos de lenguaje grandes. A diferencia de una GPU de propósito más general, está optimizado para ejecutar modelos ya entrenados y generar respuestas. 15
Las especificaciones comunicadas para el sistema a escala de rack incluyen:
A nivel de chip, la versión B0 comunicada utiliza un dado de cálculo del tamaño máximo permitido por la retícula de fabricación, producido con el proceso N3P de TSMC, y alcanza una cifra anunciada de 13,4 PFLOPS de cálculo MXFP4. 18
El diseño apuesta por optimizar el sistema completo, no solo el acelerador aislado. La memoria, las interconexiones, la red y la comunicación entre racks son elementos decisivos para ejecutar modelos muy grandes, cuyas solicitudes pueden tener que repartirse entre numerosos chips. 1819
OpenAI y Broadcom habrían pasado del concepto a la entrega del diseño para fabricación —tape-out— en aproximadamente nueve meses, un plazo especialmente corto para un chip de alto rendimiento. 720
Las herramientas de inteligencia artificial formaron parte del proceso de diseño, pero eso no significa que un modelo de IA haya diseñado y fabricado el procesador de forma autónoma. El desarrollo siguió dependiendo de equipos humanos de arquitectura e ingeniería, del trabajo de implementación de semiconductores de Broadcom, de los socios de fabricación y de la integración del sistema. 713
La conclusión más prudente es que OpenAI utilizó su conocimiento de las cargas de trabajo de los modelos de lenguaje —junto con herramientas de IA en el flujo de ingeniería— para diseñar conjuntamente hardware y software alrededor de un objetivo de servicio muy concreto. Esa especialización puede mejorar la eficiencia, aunque reduce la flexibilidad frente a una GPU programable.
Jalapeño está pensado para ejecutar modelos entrenados, no para entrenar nuevos modelos de frontera. Por eso OpenAI seguirá necesitando aceleradores programables, especialmente GPU, para el entrenamiento, la investigación, la experimentación y las cargas que no encajen bien en un diseño de inferencia más fijo. 813
Esta diferencia limita el significado de la idea de que Jalapeño “vence a Nvidia”. El ASIC puede superar a las configuraciones Nvidia probadas en determinadas métricas de inferencia, mientras que el hardware de Nvidia continúa siendo esencial en otras partes de la infraestructura de OpenAI. Un chip especializado puede ser excelente para una tarea predecible y de gran volumen sin reemplazar la plataforma más amplia que permite entrenar modelos y adaptarlos rápidamente.
Los resultados deben interpretarse como “mejor en estas pruebas comunicadas”, no como “el mejor sistema de IA en términos generales”. Hay varios matices importantes:
Tampoco hay base en estas pruebas para afirmar una reducción universal del 50 % en los costes, una bajada garantizada del precio de la API o un desplazamiento inmediato de Nvidia. La evidencia disponible respalda afirmaciones de rendimiento y eficiencia bajo condiciones concretas, no esas conclusiones comerciales más amplias.
OpenAI planea comenzar el despliegue de Jalapeño en su propia infraestructura a finales de 2026, con producción en volumen y una expansión más amplia prevista para 2027. El plan a más largo plazo contempla centros de datos a escala de gigavatios con Microsoft y otros socios de infraestructura, a lo largo de varias generaciones de chips. 16
El procesador está destinado principalmente a cubrir la demanda interna de OpenAI, no a venderse como un chip comercial para terceros. Por tanto, las empresas externas no deberían esperar poder comprar hardware Jalapeño ni alquilar una instancia pública basada en él a partir de estos anuncios. 16
Mantenerlo dentro de la propia infraestructura permite a OpenAI optimizarlo para sus modelos, kernels y sistemas de servicio. También evita las exigencias de soporte de software, competencia con clientes, ventas y construcción de ecosistema que implicaría convertirse en un proveedor convencional de semiconductores. Esas son ventajas estratégicas interpretadas a partir del modelo de despliegue; el plan confirmado es el uso interno, no la venta externa de chips. 16
Jalapeño encaja mejor como una pieza de la cartera de computación de OpenAI que como un reemplazo total de las GPU. La empresa combina capacidad de nube de Microsoft y otros proveedores, GPU de clase Nvidia para cargas flexibles y entrenamiento intensivo, y silicio propio para tareas de inferencia estables en las que la especialización puede resultar rentable. La propia OpenAI describe una cartera que también incluye AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy y SoftBank.
El movimiento forma parte de una tendencia más amplia de integración vertical en la industria. Google desarrolla sus TPU; Amazon ofrece Trainium e Inferentia; Microsoft trabaja con Maia; AMD compite con GPU de IA de propósito general; y Nvidia continúa suministrando sistemas ampliamente programables. Anthropic también avanza hacia una infraestructura cada vez más personalizada mediante sus relaciones con proveedores de nube, aunque las pruebas disponibles no ofrecen una comparación directa de rendimiento con sus sistemas.
El impacto estratégico inmediato es, por tanto, más matizado que una historia de sustitución de GPU. Jalapeño podría dar a OpenAI mayor control sobre los costes de inferencia, la latencia, el suministro y su hoja de ruta de hardware. Nvidia seguirá siendo importante para el entrenamiento y la flexibilidad, mientras el chip propio ofrece una opción especializada para las cargas de servicio predecibles y de gran volumen que dominan las necesidades internas de OpenAI. 813
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
En las pruebas de agosto de 2026, OpenAI afirmó que Jalapeño logró entre 1,5 y 1,9 veces más trabajo de IA por vatio y entre 1,7 y 3,6 veces menos latencia de extremo a extremo que los sistemas Nvidia GB200 y GB300 co...
En las pruebas de agosto de 2026, OpenAI afirmó que Jalapeño logró entre 1,5 y 1,9 veces más trabajo de IA por vatio y entre 1,7 y 3,6 veces menos latencia de extremo a extremo que los sistemas Nvidia GB200 y GB300 co... El ensayo utilizó GPT OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T en InferenceX, con una carga de una sola interacción, 8.000 tokens de entrada y 1.000 de salida.
Jalapeño es un ASIC de 700 vatios diseñado exclusivamente para inferencia y desarrollado con Broadcom.