במבחני InferenceX של SemiAnalysis דיווחה OpenAI כי Jalapeño סיפק פי 1.5–1.9 יותר עבודת AI לכל ואט ולטנסי נמוך פי 1.7–3.6 לעומת מערכות Nvidia GB200 ו‑GB300 שנבדקו. הבדיקה כללה את GPT‑OSS 120B, את DeepSeek R1 670B ואת Kimi K2.5 1T, בתרחיש חד־פעמי של 8,000 טוקני קלט ו‑1,000 טוקני פלט.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip achieve in its August 2026 benchmarks against Nvidia’s GB200 and GB300 systems, which model. Article summary: OpenAI’s August 2026 results position Jalapeño as a potentially much more efficient, lower-latency option for high-volume LLM serving than the specific Nvidia GB200 and GB300 configurations tested—not as a general replac. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
הפרסום הראשון של OpenAI עם תוצאות מפורטות לשבב Jalapeño מציג טענה ממוקדת: השבב הייעודי עשוי להריץ מודלי שפה גדולים בפחות חשמל ובזמן תגובה קצר יותר ממערכות Nvidia GB200 ו‑GB300 הספציפיות ששימשו להשוואה. במבחן הציבורי InferenceX של SemiAnalysis דיווחה OpenAI על פי 1.5–1.9 יותר עבודת AI לכל ואט ועל לטנסי נמוך פי 1.7–3.6, בשלושה מודלים פתוחים.
זהו נתון משמעותי עבור חברה שמשרתת כמויות עצומות של בקשות AI, אך הוא אינו מוכיח ש‑Jalapeño הוא תחליף מהיר או זול יותר ל‑GPU בכל מצב. הבדיקה הייתה מוגבלת, השבב מיועד להסיקה בלבד, ורוב התוצאות הופקו על ידי OpenAI עצמה באמצעות שבב הנדסי. 14
OpenAI השוותה את Jalapeño למערכות המבוססות על Nvidia GB200 ו‑GB300 באמצעות InferenceX — מבחן שמנסה למדוד את התהליך המלא של שירות בקשת AI, ולא רק ביצועי חישוב גולמיים. נתוני היעילות חושבו מחדש לפי דירוגי ההספק שפורסמו עבור המאיצים.
לפי התוצאות שפרסמה החברה, Jalapeño השיג:
פער הלטנסי הגדול ביותר בדוגמאות שסופקו נרשם ב‑DeepSeek R1 670B: Jalapeño השלים בקשה בתוך 1.65 שניות, לעומת 5.99 שניות במערכת המבוססת על GB300. 1112
עם זאת, מדובר בתוצאות יחסיות של מבחן ביצועים — לא בהבטחה ש‑ChatGPT יענה תמיד מהר פי 3.6, ולא בהתחייבות להוזלה מקבילה במחירי ה‑API. הביצועים בפועל תלויים במודל, בתוכנת ההגשה, באצווה של בקשות, ברשת, באורך ההקשר, באורך התשובה ובאיזון הרצוי בין לטנסי לתפוקה.
ההשוואה כללה שלושה מודלים בעלי משקלים פתוחים:
| מודל | מערכת Nvidia להשוואה | התוצאה שדווחה עבור Jalapeño |
|---|---|---|
| GPT‑OSS 120B | GB200 | בערך פי 1.9 יותר עבודת AI לכל ואט; לטנסי של 1.03 שניות לעומת 1.80 שניות |
| DeepSeek R1 670B | GB300 | בערך פי 1.7 יותר עבודת AI לכל ואט; לטנסי של 1.65 שניות לעומת 5.99 שניות |
| Kimi K2.5 1T | GB300 | בערך פי 1.5 יותר עבודת AI לכל ואט; לטנסי של 1.56 שניות לעומת 5.31 שניות |
הנתונים הללו מבוססים על סיכומי המבחנים שפורסמו, ולא על שחזור עצמאי ומלא של כל סדרת הבדיקות. 61112
התרחיש היה nominally חד־פעמי, עם 8,000 טוקני קלט ו‑1,000 טוקני פלט. הגדרה כזו מאפשרת השוואה מבוקרת, אך אינה מייצגת בהכרח את כל סוגי התעבורה בשירותי AI. היא אינה עונה במלואה על שאלות הנוגעות לשיחות מרובות סבבים, שימוש בכלים, סוכנים אוטונומיים, תשובות באורך משתנה, התנהגות תחת עומס של בקשות מקובצות או בקשות עם הקשר ארוך במיוחד. 813
גם תוכנות ההידור, ה‑kernels, הכימות, תזמון העבודה, ארכיטקטורת המודל וסביבת ההרצה של Nvidia משפיעים על התוצאה. שינוי באחד מהם עשוי להגדיל או לצמצם את הפער.
Jalapeño הוא ASIC — מעגל משולב ייעודי — שפותח במשותף על ידי OpenAI ו‑Broadcom להסיקה של מודלי שפה גדולים. בניגוד ל‑GPU רב־שימושי, הוא מתוכנן בעיקר להרצת מודלים שאומנו מראש ולהפקת תשובות. 15
המפרט שדווח כולל:
ברמת השבב, גרסת B0 שדווחה משתמשת במטריצת חישוב בגודל המרבי שניתן לייצר בחשיפה אחת, המיוצרת בתהליך N3P של TSMC, ומדורגת ב‑13.4 פטה־FLOPS של חישובי MXFP4. 18
הגישה של OpenAI אינה מתמקדת רק במאיץ בודד. הזיכרון, הקישוריות, הרשת והתקשורת בין השבבים הם חלק מרכזי מהתכנון, משום שמודלים גדולים במיוחד דורשים לעיתים קרובות חלוקת עבודה על פני שבבים רבים. 1819
לפי הדיווחים, OpenAI ו‑Broadcom עברו משלב הרעיון ל‑tape-out — העברת התכנון הסופי לייצור — בתוך כ‑תשעה חודשים, פרק זמן קצר במיוחד עבור שבב ביצועים גבוהים. 720
כלי AI אכן השתתפו בתהליך ההנדסי, אך אין פירוש הדבר שמודל AI תכנן וייצר את המעבד באופן עצמאי. בתהליך השתתפו צוותי ארכיטקטורה והנדסה אנושיים, Broadcom בעבודת מימוש השבב, שותפי ייצור וספקי אינטגרציה של מערכות. 713
המסקנה הזהירה יותר היא ש‑OpenAI שילבה את הידע שלה על עומסי עבודה של מודלי שפה — לצד כלי AI בתהליך ההנדסי — כדי לתכנן יחד חומרה ותוכנה עבור יעד צר ומוגדר: שירות מודלים בקנה מידה גדול. התמחות כזו עשויה לשפר יעילות, אך היא גם מצמצמת את הגמישות בהשוואה ל‑GPU שניתן לתכנת מחדש למגוון משימות.
Jalapeño תוכנן להרצת מודלים מאומנים, לא לאימון מודלי־על חדשים. לכן OpenAI עדיין תזדקק למאיצים גמישים — ובראשם GPUs — לאימון, למחקר, לניסויים ולמשימות שאינן מתאימות היטב לעיצוב ייעודי וקבוע. 813
ההבחנה הזו מגבילה את המשמעות של הכותרת “ניצחון על Nvidia”. Jalapeño עשוי לנצח את תצורות Nvidia שנבדקו במדדי הסיקה מסוימים, בעוד שהחומרה של Nvidia תישאר חיונית בחלקים אחרים ממערך המחשוב של OpenAI. ASIC ייעודי יכול להיות מצוין במשימה צפויה ובנפח גבוה, בלי להחליף את הפלטפורמה הרחבה שמאפשרת אימון, מחקר ושינויים מהירים במודלים.
יש לקרוא את התוצאות כ־“טוב יותר בתנאי הבדיקה שדווחו”, ולא כ־“מערכת ה‑AI הטובה ביותר באופן כללי”. כמה הסתייגויות חשובות:
אין בתוצאות הללו בסיס לטענה בדבר הוזלה אוניברסלית של 50% בעלויות, ירידה מובטחת במחירי ה‑API או החלפה מיידית של Nvidia. הראיות שסופקו תומכות בטענות ביצועים ויעילות בתנאים מוגדרים — לא במסקנות מסחריות רחבות יותר.
OpenAI מתכננת להתחיל לפרוס את Jalapeño בתשתיות שלה עד סוף 2026, כאשר ייצור בכמויות גדולות והתרחבות רחבה יותר צפויים ב‑2027. התוכנית ארוכת הטווח כוללת מרכזי נתונים בקנה מידה של ג׳יגה־ואט, בשיתוף Microsoft ושותפי תשתית נוספים, לאורך כמה דורות של שבבים. 16
השבב מיועד בראש ובראשונה לשימוש פנימי של OpenAI, ולא למכירה כמעבד מסחרי. לכן חברות חיצוניות לא צריכות לצפות שיוכלו לרכוש חומרת Jalapeño או לשכור מכונת ענן ציבורית המבוססת עליו בעקבות ההכרזה. 16
שמירת החומרה בתוך החברה מאפשרת ל‑OpenAI להתאים אותה למודלים, ל‑kernels ולמערכות ההגשה שלה. היא גם חוסכת את הצורך לבנות מערך תמיכה, אקוסיסטם תוכנה, ערוצי מכירה והתמודדות עם לקוחות שהם גם מתחרים. אלה הם יתרונות אסטרטגיים אפשריים של מודל הפריסה; התוכנית המאושרת היא שימוש פנימי ולא מכירת שבבים לגורמים חיצוניים. 16
Jalapeño הוא חלק מתיק המחשוב הרחב של OpenAI, ולא ניסיון להחליף את כל החומרה שבה היא משתמשת. האסטרטגיה משלבת קיבולת ענן של Microsoft ושל שותפים נוספים, GPUs בסגנון Nvidia למשימות אימון ולעומסי עבודה גמישים, ושבב ייעודי להסיקה יציבה ובנפח גבוה — תחום שבו התמחות עשויה להשתלם. OpenAI מונה בתיק המחשוב שלה גם את AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy ו‑SoftBank.
הגישה הזו משקפת שינוי רחב יותר בתעשייה. Google מפתחת שבבי TPU, Amazon מציעה את Trainium ואת Inferentia, ל‑Microsoft יש את Maia, AMD מתחרה באמצעות GPUs כלליים, ו‑Nvidia ממשיכה לספק מערכות ניתנות לתכנות במגוון רחב. גם Anthropic פועלת לעבר תשתיות מותאמות יותר דרך קשרי הענן שלה, אף שהראיות שסופקו כאן אינן כוללות השוואת ביצועים ישירה למערכות של Anthropic.
לכן ההשפעה האסטרטגית הקרובה מורכבת יותר מסיפור של “החלפת GPUs”. Jalapeño עשוי להעניק ל‑OpenAI שליטה רבה יותר בעלויות ההסקה, בזמני התגובה, באספקת החומרה ובמפת הדרכים הטכנולוגית שלה. במקביל, Nvidia תישאר חשובה לאימון ולמחקר גמיש, בעוד שהשבב העצמאי מספק ל‑OpenAI אפשרות ייעודית לעומסי השירות הצפויים והנפחיים שמאפיינים את התשתית שלה. 813
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
במבחני InferenceX של SemiAnalysis דיווחה OpenAI כי Jalapeño סיפק פי 1.5–1.9 יותר עבודת AI לכל ואט ולטנסי נמוך פי 1.7–3.6 לעומת מערכות Nvidia GB200 ו‑GB300 שנבדקו.
במבחני InferenceX של SemiAnalysis דיווחה OpenAI כי Jalapeño סיפק פי 1.5–1.9 יותר עבודת AI לכל ואט ולטנסי נמוך פי 1.7–3.6 לעומת מערכות Nvidia GB200 ו‑GB300 שנבדקו. הבדיקה כללה את GPT‑OSS 120B, את DeepSeek R1 670B ואת Kimi K2.5 1T, בתרחיש חד־פעמי של 8,000 טוקני קלט ו‑1,000 טוקני פלט.
Jalapeño הוא ASIC בהספק של 700 ואט, שפותח עם Broadcom ומיועד להסיקה בלבד. OpenAI מתכננת להתחיל לפרוס אותו בתשתיות שלה עד סוף 2026, כאשר ייצור בהיקף רחב צפוי ב‑2027.