У серпні 2026 року OpenAI заявила, що Jalapeño забезпечив у 1,5–1,9 раза більше AI роботи на ват і в 1,7–3,6 раза нижчу наскрізну затримку, ніж протестовані системи Nvidia GB200 і GB300. Тести на публічному бенчмарку InferenceX охопили GPT OSS 120B, DeepSeek R1 670B і Kimi K2.5 1T за одноповоротного сценарію з 8 000...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip achieve in its August 2026 benchmarks against Nvidia’s GB200 and GB300 systems, which model. Article summary: OpenAI’s August 2026 results position Jalapeño as a potentially much more efficient, lower-latency option for high-volume LLM serving than the specific Nvidia GB200 and GB300 configurations tested—not as a general replac. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Перші детальні результати OpenAI щодо Jalapeño містять конкретну, але вузьку заяву: власний спеціалізований чип може запускати великі мовні моделі з меншим енергоспоживанням і нижчою затримкою, ніж саме ті конфігурації Nvidia GB200 і GB300, з якими його порівнювали. На публічному бенчмарку InferenceX від SemiAnalysis OpenAI повідомила про 1,5–1,9 раза більше AI-роботи на ват і в 1,7–3,6 раза нижчу наскрізну затримку для трьох відкритих моделей.
Для компанії, яка обробляє величезну кількість AI-запитів, це важливий результат. Однак він не доводить, що Jalapeño всюди буде швидшою або дешевшою заміною GPU. Тести були обмеженими, чип створений лише для інференсу, а основні результати отримала сама OpenAI на інженерних зразках. 14
OpenAI порівняла Jalapeño із системами на базі Nvidia GB200 і GB300 у InferenceX — бенчмарку, який вимірює повний процес обслуговування AI-запиту. Показники ефективності нормалізували за опублікованими значеннями потужності прискорювачів.
За заявленими результатами, Jalapeño показав:
Найбільший розрив у затримці, наведений у доступних результатах, стосувався DeepSeek R1 670B: Jalapeño завершив запит за 1,65 секунди проти 5,99 секунди у системи на базі GB300. 1112
Ці цифри є відносними результатами бенчмарку, а не обіцянкою аналогічного скорочення часу відповіді ChatGPT чи зниження цін на API. Реальна продуктивність залежить від моделі, програмного забезпечення для обслуговування запитів, пакетування, мережі, довжини контексту, обсягу відповіді та того, чи оптимізована система під мінімальну затримку або максимальну пропускну здатність.
У тестах використали три загальнодоступні моделі з відкритими вагами:
| Модель | Система Nvidia для порівняння | Заявлений результат Jalapeño |
|---|---|---|
| GPT-OSS 120B | GB200 | Приблизно у 1,9 раза більше роботи на ват; 1,03 секунди проти 1,80 секунди наскрізної затримки |
| DeepSeek R1 670B | GB300 | Приблизно у 1,7 раза більше роботи на ват; 1,65 секунди проти 5,99 секунди затримки |
| Kimi K2.5 1T | GB300 | Приблизно у 1,5 раза більше роботи на ват; 1,56 секунди проти 5,31 секунди затримки |
Наведені показники походять із опублікованих підсумків тестування, а не з повного незалежно відтвореного набору вимірювань. 61112
Сценарій був номінально одноповоротним: 8 000 вхідних токенів і 1 000 вихідних. Така конфігурація зручна для контрольованого порівняння, але не охоплює весь спектр реального AI-трафіку. Зокрема, залишаються питання щодо багатоповоротних діалогів, викликів інструментів, агентських процесів, відповідей змінної довжини, поведінки пакетування та запитів із дуже довгим контекстом. 813
Крім того, бенчмарк вимірював конкретне поєднання апаратного та програмного забезпечення. Оновлення компіляторів, ядер, квантування, планувальників, архітектури моделі або програмного стека Nvidia можуть змінити розмір розриву.
Jalapeño — це спеціалізована інтегральна схема, або ASIC, яку OpenAI розробила спільно з Broadcom для інференсу великих мовних моделей. На відміну від універсальнішого GPU, вона оптимізована саме для запуску вже навчених моделей і генерації відповідей. 15
Заявлені характеристики системи рівня стійки включають:
Повідомляється, що версія B0 використовує обчислювальний кристал розміром із ретикл, виготовлений за техпроцесом TSMC N3P, і має заявлену продуктивність 13,4 петафлопса MXFP4. 18
Архітектура Jalapeño розрахована не на окремий прискорювач, а на всю систему. Для роботи з дуже великими моделями критичними є пам’ять, внутрішні з’єднання, мережа та комунікація на рівні стійки: запит часто потрібно розподілити між багатьма чипами. 1819
За повідомленнями, OpenAI та Broadcom пройшли шлях від концепції до передачі дизайну у виробництво приблизно за дев’ять місяців — надзвичайно короткий термін для високопродуктивного спеціалізованого чипа. 720
У процесі розробки використовували інженерні інструменти з підтримкою ШІ. Але це не означає, що модель штучного інтелекту самостійно спроєктувала та виготовила процесор. У роботі брали участь людські команди з проєктування й інженерії, Broadcom відповідала за реалізацію напівпровідника, а виробничі партнери — за виготовлення та інтеграцію системи. 713
Коректніший висновок полягає в тому, що OpenAI використала власне розуміння навантажень великих мовних моделей і AI-інструменти в інженерному процесі, щоб спільно оптимізувати апаратне та програмне забезпечення під вузьку задачу обслуговування запитів. Така спеціалізація може підвищити ефективність, але водночас зменшує гнучкість порівняно з програмованим GPU.
Jalapeño створювали для запуску вже навчених моделей, а не для тренування нових передових систем. Тому OpenAI і надалі потребуватиме програмованих прискорювачів, передусім GPU, для навчання моделей, досліджень, експериментів і завдань, які погано відповідають фіксованій архітектурі інференсного ASIC. 813
Саме це обмежує сенс формулювання «перемога над Nvidia». Jalapeño може перевершувати протестовані конфігурації Nvidia за окремими показниками інференсу, тоді як обладнання Nvidia залишатиметься важливою частиною обчислювального стека OpenAI. Спеціалізований ASIC може бути дуже ефективним у передбачуваній роботі з великим обсягом запитів, не замінюючи платформу, потрібну для навчання та швидкої зміни моделей.
Результати варто читати як «краще в цих опублікованих тестах», а не як «найкраща AI-система загалом». Важливі кілька застережень:
Також ці результати не дають підстав стверджувати про універсальне скорочення витрат на 50%, гарантоване зниження цін на API або негайне витіснення Nvidia. Доступні дані підтверджують заяви про продуктивність та ефективність лише за визначених умов, а не ширші комерційні висновки.
OpenAI планує почати використовувати Jalapeño у власній інфраструктурі до кінця 2026 року, а масштабне виробництво та ширше розгортання очікуються у 2027-му. Довгостроковий план передбачає дата-центри гігаватного масштабу з Microsoft та іншими інфраструктурними партнерами, а також кілька поколінь чипів. 16
Чип призначений передусім для внутрішніх потреб OpenAI, а не для продажу як універсальний процесор. Тому стороннім компаніям не варто очікувати можливості придбати Jalapeño або орендувати публічний хмарний інстанс на його базі лише на підставі цих анонсів. 16
Використання чипа всередині компанії дає OpenAI змогу оптимізувати його під власні моделі, ядра та системи обслуговування запитів. Водночас компанії не доведеться будувати повноцінний бізнес постачання напівпровідників із технічною підтримкою, екосистемою програмного забезпечення, продажами та конкуренцією за клієнтів. Це стратегічна інтерпретація моделі розгортання; підтверджений план полягає саме у внутрішньому використанні, а не у зовнішніх продажах чипа. 16
Jalapeño найкраще розглядати як частину ширшого обчислювального портфеля OpenAI. Компанія поєднує потужності Microsoft та інших хмарних партнерів, GPU класу Nvidia для гнучких і ресурсоємних завдань навчання та власний спеціалізований чип для стабільних інференсних навантажень. За описом OpenAI, її обчислювальний портфель також охоплює AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy і SoftBank.
Цей підхід відповідає ширшій тенденції в індустрії. Google розробляє TPU, Amazon пропонує Trainium та Inferentia, Microsoft має Maia, AMD конкурує універсальними AI-GPU, а Nvidia продовжує постачати широко програмовані системи. Anthropic також рухається до більш індивідуалізованої інфраструктури через хмарні партнерства, хоча надані результати не містять прямого порівняння з її системами.
Отже, найближчий стратегічний ефект Jalapeño складніший за історію про заміну GPU. Чип може дати OpenAI більше контролю над вартістю інференсу, затримкою, постачанням і власною апаратною дорожньою картою. Nvidia водночас залишатиметься важливою для навчання та гнучких дослідницьких задач, а Jalapeño стане спеціалізованим варіантом для передбачуваних високонавантажених сценаріїв обслуговування моделей. 813
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
У серпні 2026 року OpenAI заявила, що Jalapeño забезпечив у 1,5–1,9 раза більше AI роботи на ват і в 1,7–3,6 раза нижчу наскрізну затримку, ніж протестовані системи Nvidia GB200 і GB300.
У серпні 2026 року OpenAI заявила, що Jalapeño забезпечив у 1,5–1,9 раза більше AI роботи на ват і в 1,7–3,6 раза нижчу наскрізну затримку, ніж протестовані системи Nvidia GB200 і GB300. Тести на публічному бенчмарку InferenceX охопили GPT OSS 120B, DeepSeek R1 670B і Kimi K2.5 1T за одноповоротного сценарію з 8 000 вхідних і 1 000 вихідних токенів.
Jalapeño — це 700 ватний ASIC лише для інференсу, розроблений спільно з Broadcom.