Nos testes do InferenceX, a OpenAI registrou de 1,5 a 1,9 vez mais trabalho de IA por watt e de 1,7 a 3,6 vezes menos latência de ponta a ponta que os sistemas Nvidia comparados. No DeepSeek R1, o Jalapeño alcançou cerca de 700 tokens por segundo por usuário, contra 169 no GB300, segundo os dados divulgados pela Ope...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip, co-developed with Broadcom, demonstrate in its latest benchmarks against Nvidia’s GB200 an. Article summary: OpenAI says Jalapeño, its first Broadcom co-developed custom accelerator, beats the compared Nvidia GB200/GB300 rack systems on the tested inference workloads in both energy efficiency and response speed. These are early. Topic tags: general, documentation, general web, education, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
Os primeiros resultados divulgados pela OpenAI colocam seu acelerador personalizado Jalapeño à frente dos sistemas Nvidia GB200 e GB300 usados como referência em alguns testes de inferência: mais trabalho de IA por watt, menor latência de ponta a ponta e taxas muito altas de geração de tokens para interações individuais. A empresa afirma que os ganhos apareceram nos modelos GPT‑OSS 120B, DeepSeek R1 e Kimi K2.5 1T. 34
A ressalva é importante: trata-se de uma avaliação inicial, divulgada pela própria OpenAI e realizada em uma configuração específica do InferenceX. O resultado não equivale a uma comparação independente e universal de todas as cargas de trabalho de IA, nem necessariamente representa o desempenho das plataformas Nvidia mais novas quando o Jalapeño chegar à escala. 47
Nos três modelos avaliados, a OpenAI reportou 1,5 a 1,9 vez mais trabalho de IA por watt no pico de processamento e 1,7 a 3,6 vezes menos latência de ponta a ponta em relação aos sistemas de comparação. Em cenários altamente interativos, o ganho informado foi de 2,1 a 4,1 vezes. 3
Os números mais claros por modelo foram:
GPT‑OSS 120B contra Nvidia GB200: o Jalapeño chegou a 85.448 unidades de processamento misto por quilowatt, contra 44.960 do GB200. A latência de ponta a ponta foi de 1,03 segundo, contra 1,80 segundo. No menor intervalo entre tokens, o sistema entregou cerca de 1.459 tokens por segundo por usuário, ante 535 no GB200. 4
DeepSeek R1 MXFP4 contra Nvidia GB300: o Jalapeño alcançou 19.641 unidades de processamento misto por quilowatt, contra 11.781 do GB300. A latência de ponta a ponta foi de 1,65 segundo, contra 5,99 segundos. No menor intervalo entre tokens, a OpenAI reportou aproximadamente 700 tokens por segundo por usuário, ante 169 no GB300. 46
Kimi K2.5 MXFP4 contra Nvidia GB300: a OpenAI informou 1,5 vez mais desempenho de pico por quilowatt, 3,4 vezes menos latência de ponta a ponta e cerca de 694 tokens por segundo por usuário, contra 182 no GB300. 4
A métrica “tokens por segundo por usuário” mede a interatividade: indica a velocidade com que uma solicitação individual recebe tokens, e não apenas quantos tokens um rack inteiro consegue gerar sob alta concorrência. Isso é especialmente relevante para chatbots, programação e aplicações com agentes, nas quais a sensação de resposta imediata faz parte da experiência do produto.
O Jalapeño foi projetado especificamente para a inferência de modelos de linguagem — a execução de um modelo já treinado — em vez de adaptar uma GPU de uso geral para essa tarefa. A OpenAI criou a arquitetura, a Broadcom ficou responsável pela implementação do silício e pela rede, e a Celestica contribuiu com a integração de placas, racks e sistemas. 1732
O desenho em escala de rack usa um grande domínio de rede conectado, pensado para manter a carga de trabalho dentro de um único sistema. Segundo a OpenAI, o sistema posiciona e mantém localmente o estado do modelo, incluindo o cache KV, sempre que possível. Isso reduz a movimentação de dados entre chips e os atrasos de comunicação que podem prejudicar a geração de texto. 46
Outra característica é a ausência de pools fixos separados para as etapas de prefill e decode. A OpenAI descreve os recursos de computação, memória e rede como intercambiáveis entre as duas fases. O prefill processa o prompt e tende a exigir mais computação; o decode gera a resposta token a token e costuma ser limitado pelo movimento de dados e pela largura de banda da memória. 46
Os detalhes técnicos públicos ainda são incompletos. Uma descrição técnica menciona um sistema com 128 chips, cerca de 1,7 exaflops e 27 TB de HBM, mas o anúncio dos benchmarks não traz a lista completa de componentes do rack nem informações suficientes para reproduzir de forma independente todos os resultados. 4
A OpenAI afirma que levou o Jalapeño do projeto inicial ao tape-out — a etapa em que o desenho final é enviado para fabricação — em nove meses, um prazo excepcionalmente curto para um acelerador personalizado avançado. 1721
A empresa também diz que seus modelos ajudaram na exploração de projetos, implementação, medições, verificação, otimização de circuitos aritméticos e programação. Segundo a OpenAI, o Codex com GPT‑Astra ajudou a levar três modelos de pesos abertos que não estavam originalmente planejados a um alto nível de desempenho em dois meses.
Em blocos específicos de atenção e de mistura de especialistas do GPT‑OSS, a empresa afirmou que implementações geradas por IA foram 1,5 a 1,8 vez mais rápidas que implementações anteriores escritas por humanos. Esses números valem para blocos selecionados, não para o desempenho completo de um modelo em produção. 4
A vantagem anunciada pelo Jalapeño precisa ser interpretada dentro do contexto do teste.
O Jalapeño foi concebido para servir modelos treinados e não para treiná-los. Por isso, a OpenAI espera continuar usando aceleradores da Nvidia, AMD e de outros fornecedores no treinamento e em parte de sua capacidade de inferência. 46
Na prática, o chip é uma adição especializada à infraestrutura da empresa, e não uma substituição completa das GPUs usadas em suas diferentes cargas de trabalho.
A comparação usou o benchmark público InferenceX, da SemiAnalysis, com solicitações nominais de uma única rodada contendo 8.000 tokens de entrada e 1.000 tokens de saída. O teste mediu o atendimento completo da solicitação, igualou os sistemas em termos de experiência do usuário e normalizou os resultados com base nos valores publicados de potência dos chips. 47
A SemiAnalysis afirmou ter acompanhado execuções no laboratório da OpenAI, mas não ter realizado sozinha toda a suíte de benchmarks. A empresa também alertou que a configuração não testa contextos mais longos, agentes em várias rodadas, roteamento, cache de prefixo, gerenciamento de cache ou operações de offload. Essas decisões de software e de atendimento podem alterar significativamente o desempenho em produção. 6
A OpenAI lista o Jalapeño com 700 watts de potência no encapsulamento e afirma que o consumo sustentado medido ficou em 550 watts ou menos nas cargas avaliadas. Para comparação, foram usados valores modelados de 1.200 watts para o GB200 e 1.400 watts para o GB300. Assim, a vantagem por watt depende em parte da carga de trabalho, do ponto de medição e do método de contabilização de energia. 4
Os testes compararam o Jalapeño com os melhores resultados disponíveis para GB200 ou GB300 naquele momento. Sistemas Nvidia mais novos, porém, podem ser referências mais relevantes quando o chip da OpenAI for implantado em maior escala.
A Nvidia também divulga resultados do GB300 com DeepSeek R1 usando a metodologia offline do MLPerf. Esses números não devem ser comparados diretamente com as métricas interativas de tokens por usuário apresentadas para o Jalapeño. 124
A OpenAI planeja uma implantação limitada do Jalapeño em sua própria infraestrutura de computação até o fim de 2026, com aumento de capacidade previsto para 2027. A empresa afirma que a segunda geração está em desenvolvimento avançado e que uma terceira começou a ser planejada. 46
Por enquanto, o Jalapeño é uma plataforma interna: empresas externas não podem comprar ou alugar o chip. O executivo de hardware da OpenAI, Richard Ho, afirmou que a demanda interna é alta demais para que vendas externas estejam nos planos. 6
A estratégia, portanto, é complementar — e não substituir imediatamente — as soluções da Nvidia e da AMD. A OpenAI ainda precisa de aceleradores de uso geral para treinamento, e sua infraestrutura futura deve continuar sendo heterogênea.
A movimentação também coloca a empresa na mesma tendência de integração vertical de outras gigantes de tecnologia. O Google desenvolve TPUs para treinamento e inferência; Amazon e Microsoft criaram chips próprios para IA; e a Anthropic também descreveu esforços para desenvolver silício personalizado. 6
Os dados iniciais sugerem que um acelerador projetado para uma carga específica pode superar sistemas de uso mais geral nas métricas que mais importam para servir modelos de linguagem interativos: eficiência energética, tempo total de resposta e quantidade de tokens recebidos por cada usuário.
Mas as evidências sustentam uma conclusão mais restrita do que dizer que a “OpenAI derrotou a Nvidia”. A vantagem informada vale para modelos selecionados, uma carga de trabalho específica do InferenceX e configurações GB200 e GB300 usadas como referência. Ainda será necessário observar o desempenho do Jalapeño em tráfego real mais amplo, agentes com contexto longo, diferentes pilhas de software, cargas próximas de treinamento e nas plataformas Nvidia disponíveis quando a implantação crescer.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Nos testes do InferenceX, a OpenAI registrou de 1,5 a 1,9 vez mais trabalho de IA por watt e de 1,7 a 3,6 vezes menos latência de ponta a ponta que os sistemas Nvidia comparados.
Nos testes do InferenceX, a OpenAI registrou de 1,5 a 1,9 vez mais trabalho de IA por watt e de 1,7 a 3,6 vezes menos latência de ponta a ponta que os sistemas Nvidia comparados. No DeepSeek R1, o Jalapeño alcançou cerca de 700 tokens por segundo por usuário, contra 169 no GB300, segundo os dados divulgados pela OpenAI.
O Jalapeño foi criado para inferência, não para treinamento, e terá implantação interna limitada até o fim de 2026; a OpenAI não prevê vendas externas neste momento.