OpenAI के अनुसार, Jalapeño ने InferenceX परीक्षणों में Nvidia GB200 और GB300 सिस्टमों की तुलना में प्रति वॉट 1.5–1.9 गुना अधिक AI काम और 1.7–3.6 गुना कम एंड टू एंड लेटेंसी दी। DeepSeek R1 पर Jalapeño ने न्यूनतम टाइम बिटवीन टोकन्स स्थिति में लगभग 700 टोकन प्रति सेकंड प्रति यूज़र की गति दिखाई, जबकि GB300 के लिए यह आंक...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip, co-developed with Broadcom, demonstrate in its latest benchmarks against Nvidia’s GB200 an. Article summary: OpenAI says Jalapeño, its first Broadcom co-developed custom accelerator, beats the compared Nvidia GB200/GB300 rack systems on the tested inference workloads in both energy efficiency and response speed. These are early. Topic tags: general, documentation, general web, education, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
OpenAI की पहली कस्टम AI एक्सेलरेटर चिप Jalapeño ने कंपनी के ताज़ा इन्फरेंस परीक्षणों में Nvidia के GB200 और GB300 सिस्टमों के मुकाबले बेहतर ऊर्जा दक्षता, कम प्रतिक्रिया-विलंब और तेज़ इंटरैक्टिव टोकन दर का दावा किया है। OpenAI के अनुसार, ये लाभ GPT‑OSS 120B, DeepSeek R1 और Kimi K2.5 1T—तीनों मॉडलों पर दिखाई दिए। 34
हालांकि, इस दावे को सही संदर्भ में देखना ज़रूरी है। ये शुरुआती, कंपनी द्वारा बताए गए नतीजे हैं, जो एक खास InferenceX कॉन्फिगरेशन पर आधारित हैं। इन्हें हर तरह के प्रोडक्शन AI वर्कलोड या Nvidia के मौजूदा और भविष्य के सभी प्लेटफॉर्मों की स्वतंत्र, सार्वभौमिक तुलना नहीं माना जा सकता। 47
तीनों परीक्षण किए गए मॉडलों में OpenAI ने पीक थ्रूपुट पर प्रति वॉट 1.5–1.9 गुना अधिक AI काम और 1.7–3.6 गुना कम एंड-टू-एंड लेटेंसी रिपोर्ट की। अत्यधिक इंटरैक्टिव वर्कलोड में कंपनी ने 2.1–4.1 गुना बेहतर प्रदर्शन का दावा किया। 3
मॉडल के हिसाब से प्रमुख नतीजे इस तरह रहे:
GPT‑OSS 120B बनाम Nvidia GB200: Jalapeño ने कथित तौर पर 85,448 पीक मिक्स्ड-थ्रूपुट यूनिट प्रति किलोवॉट हासिल किए, जबकि GB200 का आंकड़ा 44,960 था। एंड-टू-एंड लेटेंसी 1.03 सेकंड रही, जबकि GB200 पर यह 1.80 सेकंड थी। न्यूनतम टाइम-बिटवीन-टोकन्स 0.69 मिलीसेकंड रहा, जो लगभग 1,459 टोकन प्रति सेकंड प्रति यूज़र के बराबर है; GB200 पर यह गति 535 टोकन प्रति सेकंड प्रति यूज़र थी। 4
DeepSeek R1 MXFP4 बनाम Nvidia GB300: Jalapeño ने रिपोर्ट के अनुसार 19,641 पीक मिक्स्ड-थ्रूपुट यूनिट प्रति किलोवॉट हासिल किए, जबकि GB300 का आंकड़ा 11,781 था। एंड-टू-एंड लेटेंसी 1.65 सेकंड बनाम 5.99 सेकंड रही। न्यूनतम टाइम-बिटवीन-टोकन्स पर OpenAI ने लगभग 700 टोकन प्रति सेकंड प्रति यूज़र की गति बताई, जबकि GB300 पर यह 169 थी। 46
Kimi K2.5 MXFP4 बनाम Nvidia GB300: OpenAI ने प्रति किलोवॉट पीक थ्रूपुट में 1.5 गुना बढ़त, एंड-टू-एंड लेटेंसी में 3.4 गुना कमी और लगभग 694 टोकन प्रति सेकंड प्रति यूज़र की गति बताई। GB300 पर यह आंकड़ा 182 टोकन प्रति सेकंड प्रति यूज़र था। 4
“टोकन प्रति सेकंड प्रति यूज़र” इंटरैक्टिव अनुभव का माप है। यह बताता है कि किसी एक अनुरोध को जवाब के टोकन कितनी तेजी से मिलते हैं। यह उस कुल क्षमता से अलग है, जिसमें भारी समानांतर लोड के दौरान पूरा रैक कितने टोकन तैयार कर सकता है। चैट, कोडिंग और AI एजेंट जैसे उत्पादों में उपयोगकर्ता को मिलने वाली प्रतिक्रिया की गति बेहद महत्वपूर्ण होती है।
Jalapeño को बड़े भाषा मॉडल (LLM) इन्फरेंस के लिए विशेष रूप से बनाया गया है। इसके विपरीत, सामान्य GPU को ट्रेनिंग और इन्फरेंस दोनों तरह के कामों के लिए इस्तेमाल किया जाता है। OpenAI ने आर्किटेक्चर तैयार किया, Broadcom ने सिलिकॉन इम्प्लीमेंटेशन और नेटवर्किंग में योगदान दिया, जबकि Celestica ने बोर्ड, रैक और सिस्टम इंटीग्रेशन संभाला। 1732
रैक-स्केल डिजाइन एक बड़े, आपस में जुड़े नेटवर्क डोमेन पर आधारित है, ताकि वर्कलोड को यथासंभव एक ही सिस्टम के भीतर रखा जा सके। OpenAI के अनुसार, मॉडल की स्थिति—जिसमें KV कैश भी शामिल है—को स्थानीय रूप से बनाए रखने से चिप्स के बीच डेटा ट्रांसफर और कम्युनिकेशन रुकावटें घटती हैं। यही रुकावटें अक्सर टेक्स्ट जनरेशन को धीमा कर सकती हैं। 46
यह सिस्टम इन्फरेंस के prefill और decode चरणों के लिए अलग-अलग स्थायी संसाधन पूल भी नहीं बनाता। OpenAI के मुताबिक, कंप्यूट, मेमोरी और नेटवर्किंग संसाधनों को दोनों चरणों में लचीले ढंग से इस्तेमाल किया जा सकता है। Prefill में यूज़र के पूरे प्रॉम्प्ट को प्रोसेस किया जाता है और यह अपेक्षाकृत कंप्यूट-इंटेंसिव होता है। Decode चरण में जवाब टोकन-दर-टोकन तैयार होता है और यह अक्सर मेमोरी मूवमेंट तथा बैंडविड्थ से सीमित रहता है। 46
सार्वजनिक तकनीकी जानकारी अभी अधूरी है। एक तकनीकी विवरण में लगभग 1.7 एक्साफ्लॉप्स और 27 TB HBM वाले 128-चिप सिस्टम का उल्लेख है, लेकिन OpenAI की बेंचमार्क घोषणा में पूरे रैक की सामग्री-सूची या हर नतीजे को स्वतंत्र रूप से दोहराने के लिए पर्याप्त जानकारी नहीं दी गई है। 4
OpenAI का कहना है कि Jalapeño शुरुआती डिजाइन से मैन्युफैक्चरिंग टेप-आउट तक केवल नौ महीनों में पहुंची। उन्नत कस्टम एक्सेलरेटर के लिए यह असामान्य रूप से तेज़ समयसीमा है। 1721
कंपनी के अनुसार, उसके AI मॉडल्स ने डिजाइन एक्सप्लोरेशन, इम्प्लीमेंटेशन, मापन, वेरिफिकेशन, अरिथमेटिक-सर्किट ऑप्टिमाइजेशन और प्रोग्रामिंग में सहायता की। OpenAI ने बताया कि GPT‑Astra के साथ Codex ने दो महीनों में तीन ऐसे ओपन-वेट मॉडल्स को उच्च प्रदर्शन तक पहुंचाने में मदद की, जिन्हें शुरुआत में योजना में शामिल नहीं किया गया था।
कंपनी ने GPT‑OSS के कुछ attention और mixture-of-experts ब्लॉक्स पर AI-जनरेटेड इम्प्लीमेंटेशन को मानव द्वारा लिखे गए पुराने इम्प्लीमेंटेशन की तुलना में 1.5–1.8 गुना तेज़ बताया। यह आंकड़ा केवल चुने हुए ब्लॉक्स पर लागू होता है, पूरे मॉडल-सर्विंग प्रदर्शन पर नहीं। 4
Jalapeño की सुर्खियों में आई बढ़त को कुछ महत्वपूर्ण सीमाओं के साथ पढ़ना चाहिए।
Jalapeño को प्रशिक्षित मॉडलों को चलाने यानी इन्फरेंस के लिए बनाया गया है। यह मॉडल ट्रेनिंग के लिए डिजाइन नहीं की गई है। इसलिए OpenAI को ट्रेनिंग और अपनी इन्फरेंस क्षमता के कुछ हिस्सों के लिए Nvidia, AMD और अन्य एक्सेलरेटरों पर निर्भर रहना जारी रखना होगा। 46
इसका मतलब है कि Jalapeño OpenAI के बुनियादी ढांचे में एक विशेषीकृत अतिरिक्त प्लेटफॉर्म है, न कि कंपनी के सभी AI वर्कलोड के लिए GPU का पूर्ण विकल्प।
तुलना SemiAnalysis के सार्वजनिक InferenceX बेंचमार्क पर की गई। इसमें सामान्यतः एकल-टर्न अनुरोधों के लिए 8,000 टोकन का इनपुट और 1,000 टोकन का आउटपुट इस्तेमाल किया गया। परीक्षण में पूरे अनुरोध को सर्व करने की प्रक्रिया मापी गई, यूज़र अनुभव के लिहाज से सिस्टमों को मिलान किया गया और प्रकाशित चिप-पावर रेटिंग के आधार पर नतीजों को सामान्यीकृत किया गया। 47
SemiAnalysis ने कहा कि उसने OpenAI की लैब में रन देखे, लेकिन पूरी बेंचमार्क श्रृंखला खुद निष्पादित नहीं की। उसने यह भी चेतावनी दी कि यह सेटअप लंबे कॉन्टेक्स्ट, मल्टी-टर्न एजेंट वर्कलोड, रूटिंग, prefix caching, कैश प्रबंधन या offload व्यवहार को नहीं परखता। प्रोडक्शन में ये सॉफ्टवेयर और सर्विंग विकल्प प्रदर्शन को काफी बदल सकते हैं। 6
OpenAI Jalapeño की पैकेज पावर 700 वॉट बताती है और कहती है कि परीक्षण किए गए वर्कलोड में लगातार मापी गई पावर 550 वॉट या उससे कम थी। तुलना में GB200 के लिए 1,200 वॉट और GB300 के लिए 1,400 वॉट के मॉडल किए गए आंकड़े इस्तेमाल किए गए। इसलिए प्रति-वॉट बढ़त वर्कलोड, मापने के बिंदु और पावर-अकाउंटिंग पद्धति पर आंशिक रूप से निर्भर करती है। 4
परीक्षण में उस समय उपलब्ध GB200 और GB300 के सर्वश्रेष्ठ परिणामों से तुलना की गई थी। Jalapeño के बड़े पैमाने पर तैनात होने तक Nvidia के नए सिस्टम अधिक प्रासंगिक प्रतिद्वंद्वी हो सकते हैं। Nvidia DeepSeek R1 के लिए GB300 के नतीजे MLPerf की अलग offline पद्धति से भी रिपोर्ट करती है। इसलिए उन आंकड़ों की सीधी तुलना Jalapeño के इंटरैक्टिव टोकन-प्रति-यूज़र नतीजों से नहीं की जानी चाहिए। 124
OpenAI की योजना 2026 के अंत तक अपने कंप्यूट इन्फ्रास्ट्रक्चर में Jalapeño की सीमित तैनाती करने की है। 2027 में क्षमता बढ़ाने की उम्मीद है। कंपनी का कहना है कि दूसरी पीढ़ी का चिप गहरे विकास चरण में है, जबकि तीसरी पीढ़ी पर शुरुआती काम शुरू हो चुका है। 46
फिलहाल Jalapeño एक आंतरिक प्लेटफॉर्म है। बाहरी कंपनियां इसे खरीद या किराये पर नहीं ले सकतीं। OpenAI के हार्डवेयर कार्यकारी Richard Ho ने कहा कि आंतरिक मांग इतनी अधिक है कि बाहरी बिक्री की कल्पना नहीं की जा रही है। 6
इसलिए मौजूदा रणनीति Nvidia और AMD को तुरंत हटाने की नहीं, बल्कि उनके साथ OpenAI के कंप्यूट संसाधनों को पूरक बनाने की है। ट्रेनिंग के लिए OpenAI को सामान्य-उद्देश्य वाले एक्सेलरेटरों की आवश्यकता बनी रहेगी और उसका भविष्य का इन्फ्रास्ट्रक्चर अलग-अलग प्रकार के चिप्स वाला यानी heterogeneous रहने की संभावना है। 6
Google पहले से ट्रेनिंग और इन्फरेंस के लिए TPU विकसित करता है। Amazon और Microsoft ने अपने AI चिप्स बनाए हैं, जबकि Anthropic ने भी कस्टम सिलिकॉन विकसित करने की कोशिश का वर्णन किया है। 6
Jalapeño के शुरुआती नतीजे संकेत देते हैं कि किसी खास वर्कलोड के लिए डिजाइन किया गया एक्सेलरेटर इंटरैक्टिव LLM सर्विंग के महत्वपूर्ण मापदंडों—ऊर्जा दक्षता, एंड-टू-एंड प्रतिक्रिया समय और हर यूज़र तक टोकन पहुंचाने की गति—पर सामान्य-उद्देश्य वाले सिस्टमों से बेहतर प्रदर्शन कर सकता है।
लेकिन उपलब्ध साक्ष्य के आधार पर यह कहना जल्दबाजी होगी कि “OpenAI ने Nvidia को हरा दिया।” रिपोर्ट की गई बढ़त कुछ चुने हुए मॉडलों, एक खास InferenceX वर्कलोड और GB200 तथा GB300 कॉन्फिगरेशन के मुकाबले तक सीमित है। Jalapeño लंबे-कॉन्टेक्स्ट एजेंट, अलग-अलग सॉफ्टवेयर स्टैक, व्यापक प्रोडक्शन ट्रैफिक, ट्रेनिंग से जुड़े वर्कलोड और उस समय उपलब्ध Nvidia सिस्टमों पर कैसा प्रदर्शन करेगी, यह अभी स्पष्ट नहीं है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
OpenAI के अनुसार, Jalapeño ने InferenceX परीक्षणों में Nvidia GB200 और GB300 सिस्टमों की तुलना में प्रति वॉट 1.5–1.9 गुना अधिक AI काम और 1.7–3.6 गुना कम एंड टू एंड लेटेंसी दी।
OpenAI के अनुसार, Jalapeño ने InferenceX परीक्षणों में Nvidia GB200 और GB300 सिस्टमों की तुलना में प्रति वॉट 1.5–1.9 गुना अधिक AI काम और 1.7–3.6 गुना कम एंड टू एंड लेटेंसी दी। DeepSeek R1 पर Jalapeño ने न्यूनतम टाइम बिटवीन टोकन्स स्थिति में लगभग 700 टोकन प्रति सेकंड प्रति यूज़र की गति दिखाई, जबकि GB300 के लिए यह आंकड़ा 169 था।
Jalapeño केवल इन्फरेंस के लिए बनाई गई है, ट्रेनिंग के लिए नहीं। OpenAI 2026 के अंत तक सीमित आंतरिक तैनाती और 2027 में अधिक क्षमता की योजना बना रही है।