W sierpniu 2026 roku OpenAI podało, że Jalapeño zapewnił 1,5–1,9 raza więcej pracy AI na wat oraz 1,7–3,6 raza niższe opóźnienia end to end niż testowane systemy Nvidia GB200 i GB300. Testy przeprowadzono dla modeli GPT OSS 120B, DeepSeek R1 670B i Kimi K2.5 1T w benchmarku InferenceX firmy SemiAnalysis.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip achieve in its August 2026 benchmarks against Nvidia’s GB200 and GB300 systems, which model. Article summary: OpenAI’s August 2026 results position Jalapeño as a potentially much more efficient, lower-latency option for high-volume LLM serving than the specific Nvidia GB200 and GB300 configurations tested—not as a general replac. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Pierwsze szczegółowe wyniki Jalapeño pokazują, że własny układ OpenAI może obsługiwać duże modele językowe przy mniejszym zużyciu energii i niższych opóźnieniach niż konkretne konfiguracje Nvidia GB200 i GB300 wykorzystane w porównaniu. W publicznym benchmarku InferenceX firmy SemiAnalysis OpenAI zaraportowało 1,5–1,9 raza więcej pracy AI na wat oraz 1,7–3,6 raza niższe opóźnienie end-to-end dla trzech modeli z otwartymi wagami.
To ważny wynik dla firmy przetwarzającej ogromną liczbę zapytań AI, ale nie oznacza jeszcze, że Jalapeño jest wszędzie szybszym lub tańszym zamiennikiem GPU. Testy miały ograniczony zakres, układ zaprojektowano wyłącznie do inferencji, a większość wyników pochodzi z pomiarów OpenAI wykonanych na układach inżynieryjnych. 14
OpenAI porównało Jalapeño z systemami Nvidia GB200 i GB300 w benchmarku InferenceX, który ma mierzyć cały proces obsługi zapytania AI — od jego przyjęcia do wygenerowania odpowiedzi. Wskaźniki efektywności energetycznej zostały znormalizowane na podstawie opublikowanych wartości mocy akceleratorów.
W raportowanych testach Jalapeño osiągnął:
Największą różnicę w opóźnieniu odnotowano dla DeepSeek R1 670B: Jalapeño ukończył żądanie w 1,65 sekundy, podczas gdy system oparty na GB300 potrzebował 5,99 sekundy. 1112
Nie są to jednak obietnice proporcjonalnego skrócenia czasu odpowiedzi w ChatGPT ani obniżenia cen API. Rzeczywista wydajność zależy między innymi od modelu, oprogramowania serwującego, łączenia żądań w partie, sieci, długości kontekstu, długości odpowiedzi oraz tego, czy priorytetem jest niskie opóźnienie, czy maksymalna przepustowość.
Benchmark objął trzy publicznie dostępne modele z otwartymi wagami:
| Model | System Nvidia użyty do porównania | Wynik zgłoszony dla Jalapeño |
|---|---|---|
| GPT-OSS 120B | GB200 | Około 1,9 raza więcej pracy na wat; 1,03 sekundy wobec 1,80 sekundy opóźnienia end-to-end |
| DeepSeek R1 670B | GB300 | Około 1,7 raza więcej pracy na wat; 1,65 sekundy wobec 5,99 sekundy opóźnienia |
| Kimi K2.5 1T | GB300 | Około 1,5 raza więcej pracy na wat; 1,56 sekundy wobec 5,31 sekundy opóźnienia |
Powyższe wartości pochodzą z opublikowanych podsumowań benchmarku, a nie z niezależnie odtworzonego pełnego zestawu testów. 61112
Obciążenie było nominalnie jednoturowe i obejmowało 8000 tokenów wejściowych oraz 1000 tokenów wyjściowych. Taki układ ułatwia kontrolowane porównanie, ale nie odzwierciedla wszystkich rodzajów ruchu produkcyjnego. Nadal niewiele mówi o rozmowach wieloturowych, wywoływaniu narzędzi, pracy agentów, odpowiedziach o zmiennej długości, zachowaniu przy grupowaniu żądań ani o zapytaniach z bardzo długim kontekstem. 813
Benchmark obejmował również konkretne konfiguracje sprzętu i oprogramowania. Zmiana kompilatorów, jąder obliczeniowych, kwantyzacji, harmonogramowania, architektury modelu lub stosu uruchomieniowego Nvidii może zmienić skalę przewagi.
Jalapeño to układ ASIC, czyli wyspecjalizowany układ scalony, opracowany wspólnie przez OpenAI i Broadcom z myślą o inferencji dużych modeli językowych. W przeciwieństwie do uniwersalnego GPU jest zoptymalizowany pod kątem uruchamiania wytrenowanych modeli i generowania przez nie odpowiedzi. 15
Raportowane parametry systemu obejmują:
Na poziomie pojedynczego układu raportowana wersja B0 korzysta z matrycy obliczeniowej wielkości retikla, produkowanej w procesie N3P firmy TSMC, i oferuje 13,4 PFLOPS obliczeń MXFP4. 18
Architektura Jalapeño została pomyślana jako rozwiązanie obejmujące cały system, a nie tylko pojedynczy akcelerator. W przypadku bardzo dużych modeli kluczowe znaczenie mają pamięć, połączenia między układami, sieć i komunikacja na poziomie całej szafy, ponieważ obsługa jednego zapytania może wymagać rozdzielenia obliczeń między wiele chipów. 1819
Według dostępnych informacji OpenAI i Broadcom przeszły od koncepcji do etapu tape-out — przekazania projektu do produkcji próbnej — w około dziewięć miesięcy. To wyjątkowo krótki czas jak na wysokowydajny układ projektowany na zamówienie. 720
W procesie projektowym wykorzystywano narzędzia wspomagane przez AI, ale nie oznacza to, że model AI samodzielnie zaprojektował i wyprodukował procesor. Za projekt architektury i inżynierię nadal odpowiadały zespoły ludzi, a w realizację zaangażowani byli Broadcom, partnerzy produkcyjni oraz zespoły integrujące cały system. 713
Ostrożniejszy i lepiej uzasadniony wniosek brzmi więc: OpenAI wykorzystało wiedzę o obciążeniach charakterystycznych dla modeli językowych — a także narzędzia AI w pracy inżynieryjnej — by wspólnie projektować sprzęt i oprogramowanie pod konkretny cel. Taka specjalizacja może poprawić efektywność, ale ogranicza elastyczność w porównaniu z programowalnym GPU.
Jalapeño służy do uruchamiania wytrenowanych modeli, a nie do trenowania nowych modeli granicznych. OpenAI nadal będzie więc potrzebować programowalnych akceleratorów, przede wszystkim GPU, do treningu, badań, eksperymentów oraz zadań, które nie pasują dobrze do wyspecjalizowanego układu inferencyjnego. 813
To rozróżnienie ogranicza znaczenie hasła „pokonać Nvidię”. Jalapeño może przewyższać testowane konfiguracje Nvidii w wybranych wskaźnikach inferencji, podczas gdy sprzęt Nvidii pozostanie niezbędny w innych częściach infrastruktury OpenAI. Wyspecjalizowany ASIC może świetnie radzić sobie z przewidywalnym zadaniem wykonywanym na ogromną skalę, nie zastępując platformy, która zapewnia możliwość trenowania modeli i szybkiego zmieniania ich architektury.
Wyniki należy odczytywać jako „lepsze w opisanych testach”, a nie jako dowód, że Jalapeño jest „najlepszym systemem AI ogółem”. Kilka zastrzeżeń ma tu szczególne znaczenie:
Na podstawie tych wyników nie ma również podstaw, by twierdzić, że OpenAI obniży koszty o 50%, zagwarantuje niższe ceny API albo natychmiast uniezależni się od Nvidii. Dostępne dowody potwierdzają twierdzenia o wydajności i efektywności w określonych warunkach, a nie tak szerokie wnioski biznesowe.
OpenAI planuje rozpocząć wdrażanie Jalapeño we własnej infrastrukturze do końca 2026 roku, a produkcję seryjną i szersze wdrożenie przewiduje na 2027 rok. Długoterminowy plan obejmuje centra danych o skali gigawatów, budowane z Microsoftem i innymi partnerami infrastrukturalnymi, oraz kilka generacji własnych układów. 16
Jalapeño ma służyć przede wszystkim wewnętrznym potrzebom OpenAI, a nie być sprzedawany jako procesor dostępny na rynku. Zewnętrzne firmy nie powinny więc zakładać, że będą mogły kupić sprzęt Jalapeño lub wynająć publiczną instancję chmurową opartą na tym układzie. 16
Zachowanie sprzętu wewnątrz firmy pozwala OpenAI optymalizować go pod własne modele, jądra obliczeniowe i systemy serwowania. Firma unika też obowiązków związanych ze wsparciem klientów, konkurencją na rynku, sprzedażą oraz budowaniem ekosystemu typowych dla dostawcy półprzewodników. To interpretacja strategiczna modelu wdrożenia; potwierdzony plan zakłada wewnętrzne wykorzystanie, a nie sprzedaż zewnętrzną. 16
Jalapeño najlepiej traktować jako jeden z elementów szerszej, pełnostackowej strategii obliczeniowej OpenAI. Firma łączy moce chmurowe Microsoftu i innych partnerów, GPU klasy Nvidia do elastycznych oraz treningowych obciążeń, a także własny krzem do stabilnych zadań inferencyjnych, w których specjalizacja może przynieść korzyści. W opisie swojego portfela obliczeniowego OpenAI wymienia Microsoft, Nvidię, AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy i SoftBank.
To podejście wpisuje się w szerszy ruch w branży. Google rozwija układy TPU, Amazon oferuje Trainium i Inferentia, Microsoft ma własne akceleratory Maia, AMD konkuruje uniwersalnymi GPU do AI, a Nvidia nadal dostarcza szeroko programowalne systemy. Anthropic również zmierza w stronę coraz bardziej dopasowanej infrastruktury dzięki relacjom z dostawcami chmurowymi, choć przedstawione wyniki nie pozwalają na bezpośrednie porównanie z systemami tej firmy.
Najbliższy wpływ Jalapeño jest więc bardziej złożony niż historia o zastąpieniu GPU. Układ może dać OpenAI większą kontrolę nad kosztami inferencji, opóźnieniami, dostawami i własną mapą rozwoju sprzętu. Nvidia pozostanie ważna w treningu i elastycznych pracach badawczych, natomiast własny chip zapewni OpenAI wyspecjalizowaną opcję dla przewidywalnych, masowych obciążeń związanych z obsługą modeli. 813
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
W sierpniu 2026 roku OpenAI podało, że Jalapeño zapewnił 1,5–1,9 raza więcej pracy AI na wat oraz 1,7–3,6 raza niższe opóźnienia end to end niż testowane systemy Nvidia GB200 i GB300.
W sierpniu 2026 roku OpenAI podało, że Jalapeño zapewnił 1,5–1,9 raza więcej pracy AI na wat oraz 1,7–3,6 raza niższe opóźnienia end to end niż testowane systemy Nvidia GB200 i GB300. Testy przeprowadzono dla modeli GPT OSS 120B, DeepSeek R1 670B i Kimi K2.5 1T w benchmarku InferenceX firmy SemiAnalysis.
Jalapeño to opracowany z Broadcom układ ASIC o mocy znamionowej 700 W, przeznaczony wyłącznie do inferencji.