A OpenAI afirma que o Jalapeño entregou de 1,5 a 1,9 vez mais trabalho de IA por watt e de 1,7 a 3,6 vezes menos latência de ponta a ponta que os sistemas Nvidia GB200 e GB300 testados em agosto de 2026. Os testes usaram GPT OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T no benchmark InferenceX, com uma carga nominal de...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip achieve in its August 2026 benchmarks against Nvidia’s GB200 and GB300 systems, which model. Article summary: OpenAI’s August 2026 results position Jalapeño as a potentially much more efficient, lower-latency option for high-volume LLM serving than the specific Nvidia GB200 and GB300 configurations tested—not as a general replac. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Os primeiros resultados detalhados do Jalapeño sustentam uma tese específica: o chip desenvolvido pela OpenAI pode executar inferência de grandes modelos de linguagem com menor consumo de energia e menor latência do que determinadas configurações Nvidia GB200 e GB300 usadas na comparação. No benchmark público InferenceX, da SemiAnalysis, a OpenAI relatou de 1,5 a 1,9 vez mais trabalho de IA por watt e de 1,7 a 3,6 vezes menos latência de ponta a ponta em três modelos de pesos abertos.
Para uma empresa que processa solicitações de IA em escala gigantesca, o resultado é relevante. Mas ele não equivale a provar que o Jalapeño seja um substituto mais rápido ou mais barato para GPUs em qualquer situação. Os testes foram concentrados, o chip foi projetado apenas para inferência e os números foram produzidos principalmente pela própria OpenAI em silício de engenharia. 14
A OpenAI comparou o Jalapeño com sistemas Nvidia GB200 e GB300 no InferenceX, um benchmark criado para medir o processo completo de atendimento de uma solicitação de IA. Para calcular a eficiência, a empresa normalizou os resultados usando as potências nominais publicadas para os aceleradores.
Nos testes divulgados, o Jalapeño alcançou:
A maior diferença de latência apresentada nos resultados fornecidos ocorreu com o DeepSeek R1 670B: o Jalapeño concluiu uma solicitação em 1,65 segundo, contra 5,99 segundos no sistema baseado no GB300. 1112
Esses números são resultados relativos de benchmark, não uma promessa de redução equivalente no tempo de resposta do ChatGPT ou nos preços da API. O desempenho real depende do modelo, do software de serving, do agrupamento de solicitações, da rede, do tamanho do contexto, do comprimento da resposta e do equilíbrio desejado entre latência e throughput.
A avaliação cobriu três modelos públicos de pesos abertos:
| Modelo | Comparação com a Nvidia | Resultado relatado para o Jalapeño |
|---|---|---|
| GPT-OSS 120B | GB200 | Cerca de 1,9 vez mais trabalho por watt; 1,03 segundo contra 1,80 segundo de latência de ponta a ponta |
| DeepSeek R1 670B | GB300 | Cerca de 1,7 vez mais trabalho por watt; 1,65 segundo contra 5,99 segundos de latência |
| Kimi K2.5 1T | GB300 | Cerca de 1,5 vez mais trabalho por watt; 1,56 segundo contra 5,31 segundos de latência |
Os valores acima vêm de resumos dos benchmarks divulgados, e não de uma reprodução independente de toda a suíte de testes. 61112
A carga era nominalmente de um único turno, com 8.000 tokens de entrada e 1.000 tokens de saída. Esse formato ajuda a controlar a comparação, mas não representa todos os tipos de tráfego de IA. Ele deixa em aberto questões importantes sobre conversas com múltiplos turnos, chamadas de ferramentas, fluxos de agentes, respostas de tamanhos variados, comportamento com várias solicitações agrupadas e pedidos com contextos muito longos. 813
O benchmark também mediu combinações específicas de hardware e software. Mudanças em compiladores, kernels, quantização, escalonamento, arquitetura dos modelos ou na pilha de execução da Nvidia podem alterar o tamanho da vantagem.
O Jalapeño é um circuito integrado de aplicação específica — ou ASIC, na sigla em inglês — desenvolvido pela OpenAI em parceria com a Broadcom para inferência de modelos de linguagem de grande porte. Diferentemente de uma GPU de uso geral, ele foi otimizado para executar modelos já treinados e gerar respostas. 15
As especificações de sistema divulgadas incluem:
No nível do chip, a versão B0 informada usa um die de computação em escala de retícula, fabricado pela TSMC no processo N3P, e é especificada em 13,4 PFLOPS de computação MXFP4. 18
O projeto adota uma abordagem de sistema completo, e não apenas de acelerador isolado. Memória, interconexão, rede e comunicação entre racks são componentes centrais para executar modelos muito grandes, cujas solicitações podem precisar ser distribuídas por vários chips. 1819
A OpenAI e a Broadcom teriam levado aproximadamente nove meses entre o conceito e o tape-out, etapa em que o projeto do chip é finalizado para fabricação. É um prazo particularmente curto para um processador de alto desempenho. 720
Ferramentas de engenharia assistidas por IA participaram do processo, mas isso não significa que um modelo de IA tenha projetado e fabricado o processador de forma autônoma. O desenvolvimento ainda envolveu equipes humanas de arquitetura e engenharia, o trabalho de implementação de semicondutores da Broadcom, parceiros de fabricação e integração de sistemas. 713
A conclusão mais segura é que a OpenAI combinou seu conhecimento sobre cargas de trabalho de modelos de linguagem com ferramentas de IA para co projetar hardware e software voltados a um objetivo de serving bastante específico. Essa especialização pode elevar a eficiência, mas reduz a flexibilidade em comparação com uma GPU programável.
O Jalapeño foi criado para executar modelos treinados, não para treinar novos modelos de fronteira. Por isso, a OpenAI continuará precisando de aceleradores programáveis — especialmente GPUs — para treinamento, pesquisa, experimentação e cargas que não se adaptam bem a um projeto fixo de inferência. 813
Essa distinção limita o significado de dizer que o chip “superou a Nvidia”. O Jalapeño pode ter desempenho melhor que as configurações Nvidia testadas em determinadas métricas de inferência, enquanto o hardware da Nvidia continua essencial em outras áreas da infraestrutura da OpenAI. Um ASIC especializado pode ser excelente em uma tarefa previsível e de alto volume sem substituir a plataforma mais ampla necessária para treinamento e mudanças rápidas nos modelos.
Os resultados devem ser interpretados como “melhor nos testes divulgados”, e não como “o melhor sistema de IA em geral”. Vários pontos exigem cautela:
Também não há base nesses resultados para afirmar uma redução universal de 50% nos custos, uma queda garantida no preço da API ou uma substituição imediata da Nvidia. As evidências apresentadas sustentam afirmações de desempenho e eficiência sob condições determinadas — não conclusões comerciais mais amplas.
A OpenAI planeja começar a implantar o Jalapeño em sua própria infraestrutura até o fim de 2026, com produção em volume e expansão mais ampla previstas para 2027. O plano de longo prazo envolve data centers em escala de gigawatts com a Microsoft e outros parceiros de infraestrutura, ao longo de várias gerações de chips. 16
O processador foi concebido principalmente para atender à demanda interna da OpenAI, e não para ser vendido como um produto de prateleira. Portanto, empresas externas não devem esperar comprar o hardware Jalapeño ou alugar uma instância pública de nuvem baseada nele a partir desses anúncios. 16
Manter o hardware dentro da própria operação permite à OpenAI otimizá-lo para seus modelos, kernels e sistemas de serving. Também evita as obrigações de suporte de software, competição com clientes, vendas e construção de ecossistema que acompanham uma operação convencional de fornecimento de semicondutores. Esses benefícios estratégicos são uma interpretação do modelo de implantação; o plano confirmado é de uso interno, não de venda de chips para terceiros. 16
O Jalapeño faz mais sentido como uma peça do portfólio de computação da OpenAI do que como uma substituição completa às GPUs. A estratégia combina capacidade de nuvem da Microsoft e de outros parceiros, GPUs de classe Nvidia para cargas flexíveis e intensivas em treinamento e silício próprio para inferência estável, na qual a especialização pode compensar. A própria OpenAI descreve seu portfólio como incluindo Microsoft, Nvidia, AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy e SoftBank.
A abordagem acompanha uma mudança mais ampla no setor. O Google desenvolve TPUs; a Amazon oferece Trainium e Inferentia; a Microsoft tem a Maia; a AMD compete com GPUs de IA de uso geral; e a Nvidia continua fornecendo sistemas amplamente programáveis. A Anthropic também busca uma infraestrutura cada vez mais personalizada por meio de suas relações com provedores de nuvem, embora os benchmarks fornecidos não permitam uma comparação direta de desempenho com os sistemas da empresa.
O impacto estratégico mais imediato, portanto, é mais complexo do que uma história de substituição das GPUs. O Jalapeño pode dar à OpenAI mais controle sobre a economia da inferência, a latência, o fornecimento e o roteiro de hardware. A Nvidia continua importante para treinamento e flexibilidade, enquanto o chip próprio oferece uma alternativa especializada para cargas previsíveis e de alto volume — justamente aquelas que concentram parte relevante das necessidades internas de serving da OpenAI. 813
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A OpenAI afirma que o Jalapeño entregou de 1,5 a 1,9 vez mais trabalho de IA por watt e de 1,7 a 3,6 vezes menos latência de ponta a ponta que os sistemas Nvidia GB200 e GB300 testados em agosto de 2026.
A OpenAI afirma que o Jalapeño entregou de 1,5 a 1,9 vez mais trabalho de IA por watt e de 1,7 a 3,6 vezes menos latência de ponta a ponta que os sistemas Nvidia GB200 e GB300 testados em agosto de 2026. Os testes usaram GPT OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T no benchmark InferenceX, com uma carga nominal de turno único, 8.000 tokens de entrada e 1.000 de saída.
O Jalapeño é um ASIC de 700 watts desenvolvido com a Broadcom exclusivamente para inferência.