A OpenAI afirma que o Jalapeño entregou de 1,5 a 1,9 vez mais trabalho de IA por watt e latência de ponta a ponta de 1,7 a 3,6 vez menor que sistemas Nvidia GB200 e GB300 em três modelos testados. O Jalapeño é um ASIC voltado à inferência, desenvolvido com a Broadcom.
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What are the reported performance results, power and cost-efficiency benefits, testing details and caveats, deployment timeline, development. Article summary: OpenAI reports that Jalapeño—a Broadcom co-developed, inference-focused ASIC—beats Nvidia’s Blackwell GB200/GB300 systems on the tested LLM-serving workloads for work per watt and latency. It is a meaningful proof point . Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Os primeiros resultados publicados do Jalapeño sustentam uma afirmação específica — e não uma vitória universal sobre a Nvidia. A OpenAI diz que seu ASIC personalizado para inferência superou sistemas Nvidia GB200 e GB300 em trabalho realizado por watt e latência em testes selecionados de atendimento de modelos de linguagem. 57
O resultado é relevante porque o custo de operar modelos de IA depende cada vez mais de eletricidade, refrigeração e distribuição de energia. Mas o Jalapeño foi projetado para inferência, não para substituir GPUs de uso geral em todas as tarefas. 57
Jalapeño é um circuito integrado de aplicação específica — ou ASIC — desenvolvido pela OpenAI em parceria com a Broadcom para executar inferência de grandes modelos de linguagem. Inferência é a etapa em que um modelo já treinado gera respostas; treinamento é o processo usado para criar o modelo. 619
Um chip dedicado pode abrir mão de flexibilidade para ganhar eficiência em cargas previsíveis e de alto volume. Essa especialização é fundamental para interpretar os números: as GPUs da Nvidia atendem a uma variedade muito maior de tarefas, enquanto o Jalapeño foi otimizado para as necessidades de operação da OpenAI e para sua integração entre hardware e software. 56
A OpenAI afirma ter comparado o Jalapeño com sistemas baseados nos Nvidia GB200 e GB300 usando três modelos públicos: GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T, da Moonshot AI. No conjunto dos testes, o chip teria entregue 1,5 a 1,9 vez mais trabalho de IA por watt no pico de throughput e latência de ponta a ponta 1,7 a 3,6 vez menor. 5713
Os números por modelo mostram a variação dos resultados:
Em pontos de operação altamente interativos, nos quais responder rapidamente é mais importante que maximizar o throughput total, a OpenAI relatou uma vantagem de desempenho de 2,1 a 4,1 vezes. 413
O consumo nominal também favorece o chip dedicado. O Jalapeño é especificado em 700 watts, enquanto os aceleradores comparados são classificados em 1.200 watts para o GB200 e 1.400 watts para o GB300. Nos workloads avaliados, a OpenAI diz que o consumo sustentado do Jalapeño ficou em 550 watts ou menos. 61213
Isso não significa automaticamente que o custo total de um data center cairá na mesma proporção. Ainda assim, realizar mais trabalho de inferência com menos energia pode reduzir a pressão sobre sistemas elétricos, refrigeração e distribuição de energia. Em uma escala como a planejada pela OpenAI, esse é o principal argumento econômico para desenvolver silício próprio. 5
Os testes utilizaram o InferenceX, benchmark público da SemiAnalysis, e mediram o atendimento de modelos de ponta a ponta em diferentes modelos e pontos de operação. Isso é mais representativo de uma operação real de inferência do que uma comparação baseada apenas em especificações teóricas de chips. 7
Ainda assim, os resultados devem ser tratados como números divulgados pela OpenAI, e não como uma conclusão independente e replicada por um avaliador neutro. 45
Há também uma ressalva importante sobre a geração do hardware. O Jalapeño usa memória HBM4, enquanto os sistemas GB200 e GB300 testados não usam. A SemiAnalysis classificou a comparação como incompleta e não totalmente justa por esse motivo. 5
A diferença importa porque capacidade e largura de banda de memória influenciam diretamente o atendimento de modelos grandes. A plataforma Rubin, da Nvidia, também utiliza HBM4 e pode ser um comparativo geracional mais adequado que os sistemas Blackwell avaliados. Portanto, a vantagem divulgada sobre GB200 e GB300 não prova que o Jalapeño superará o Rubin. 517
Outro limite é que um chip exclusivamente voltado à inferência está sendo comparado com sistemas desenvolvidos para usos mais amplos. GPUs Nvidia podem ser usadas em treinamento, ajuste fino, inferência e novas arquiteturas de modelos. Um ASIC tende a ser mais vantajoso quando o workload é estável o suficiente para justificar a especialização. 520
A OpenAI planeja começar a instalar o Jalapeño em sua própria infraestrutura computacional em volumes muito pequenos até o fim de 2026, seguida por uma expansão mais significativa em 2027. 1133
O projeto foi concebido como uma plataforma de várias gerações. A OpenAI afirma que os chips de segunda e terceira geração já estão em desenvolvimento, enquanto a Broadcom descreve um roteiro voltado a implantações em escala de gigawatts com a Microsoft e outros parceiros de data centers. 31130
A estratégia é de codesign vertical: alinhar modelos, software de inferência, memória, redes, sistemas e silício, em vez de tratar o acelerador como um componente isolado. O possível benefício é maior controle sobre latência e custo de atendimento; a contrapartida é uma solução menos reutilizável que uma GPU de uso geral. 3633
O ciclo de desenvolvimento acelerado chama atenção, mas chegar rapidamente ao tape-out não equivale a comprovar produção em grande volume. Rendimento de fabricação, integração dos sistemas, maturidade do software, disponibilidade de componentes e compatibilidade com modelos futuros ainda determinarão se a vantagem de benchmark se transformará em uma vantagem estrutural. As informações disponíveis confirmam o cronograma planejado, mas não a escala final de produção. 3033
A OpenAI afirmou que continuará contando com a Nvidia para treinamento e como parceira de computação. 411
Essa divisão de funções faz sentido. O treinamento de modelos de fronteira exige sistemas flexíveis, capazes de acompanhar mudanças em arquiteturas, algoritmos e experimentos. As GPUs da Nvidia também contam com o ecossistema de software CUDA e com uma plataforma completa que inclui redes e sistemas de data center. 5
O Jalapeño deve ser entendido, portanto, como uma estratégia de substituição seletiva. A OpenAI pode utilizá-lo em workloads recorrentes e previsíveis de inferência, nos quais controla os modelos, o software de atendimento e a infraestrutura. A Nvidia continua importante para treinamento, pesquisa, iteração de modelos e tarefas em que a flexibilidade vale mais que a especialização. 45
A defesa da Nvidia não depende de provar que um ASIC personalizado jamais vencerá um benchmark específico de inferência. O argumento é que os clientes geralmente precisam de uma plataforma capaz de lidar com vários tipos de trabalho à medida que modelos e softwares mudam.
As GPUs podem treinar, ajustar e executar modelos, enquanto um chip dedicado concentra sua vantagem em uma faixa mais estreita de workloads. O software, as redes e os sistemas da Nvidia também ampliam a comparação para além do throughput isolado do chip. 5
A escala inicial de implantação limita ainda mais o impacto imediato. No começo, o Jalapeño atenderá à própria infraestrutura da OpenAI, em vez de se tornar uma alternativa disponível para compra e implantação ampla no mercado. 14
Por isso, o anúncio altera mais rapidamente o poder de negociação da OpenAI no segmento de inferência do que a estrutura geral do mercado de computação para IA. A empresa demonstrou uma alternativa potencial para parte de sua carga, mas ainda não encerrou sua dependência da Nvidia.
Analistas veem o Jalapeño como evidência de que um ASIC desenvolvido por uma grande plataforma de tecnologia pode igualar ou superar sistemas da classe Blackwell em eficiência de inferência. Isso pode pressionar a Nvidia nesse segmento, especialmente à medida que grandes operadores de IA tentam reduzir o custo de atendimento e a dependência de um único fornecedor. 1732
A OpenAI também não está sozinha. Google, AWS e Meta são citadas entre as grandes empresas de tecnologia que desenvolvem chips próprios, reforçando a tendência de infraestrutura específica para cada workload. 5
O cenário mais provável não é um colapso imediato das GPUs, mas um mercado mais segmentado:
A questão decisiva é saber se os ganhos divulgados pelo Jalapeño resistirão a comparações mais equilibradas, a novos modelos e à implantação em escala de produção. Por enquanto, as evidências sustentam uma conclusão mais restrita: o silício personalizado pode ser extremamente competitivo com o Blackwell em workloads selecionados de inferência, mas a Nvidia continua profundamente integrada ao restante da infraestrutura de computação para IA.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A OpenAI afirma que o Jalapeño entregou de 1,5 a 1,9 vez mais trabalho de IA por watt e latência de ponta a ponta de 1,7 a 3,6 vez menor que sistemas Nvidia GB200 e GB300 em três modelos testados.
A OpenAI afirma que o Jalapeño entregou de 1,5 a 1,9 vez mais trabalho de IA por watt e latência de ponta a ponta de 1,7 a 3,6 vez menor que sistemas Nvidia GB200 e GB300 em três modelos testados. O Jalapeño é um ASIC voltado à inferência, desenvolvido com a Broadcom. Tem potência nominal de 700 watts e registrou consumo sustentado de até 550 watts nos testes; a implantação em pequena escala deve começar no fim...
A comparação não é totalmente equivalente: o Jalapeño usa memória HBM4, enquanto os sistemas Blackwell avaliados não usam.