OpenAI के अनुसार, अगस्त 2026 के InferenceX परीक्षणों में Jalapeño ने Nvidia GB200 और GB300 systems की तुलना में 1.5–1.9 गुना अधिक AI work per watt और 1.7–3.6 गुना कम end to end latency दी। परीक्षण GPT OSS 120B, DeepSeek R1 670B और Kimi K2.5 1T पर हुए। workload single turn था, जिसमें लगभग 8,000 input tokens और 1,000...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What did OpenAI’s custom Jalapeño inference chip achieve in its August 2026 benchmarks against Nvidia’s GB200 and GB300 systems, which model. Article summary: OpenAI’s August 2026 results position Jalapeño as a potentially much more efficient, lower-latency option for high-volume LLM serving than the specific Nvidia GB200 and GB300 configurations tested—not as a general replac. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
OpenAI के पहले विस्तृत Jalapeño परिणाम एक सीमित लेकिन अहम दावा पेश करते हैं: बड़े language models को serve करने के लिए बनाया गया उसका custom silicon, तुलना में इस्तेमाल किए गए Nvidia GB200 और GB300 systems के मुकाबले कम बिजली और कम response latency दे सकता है। SemiAnalysis के सार्वजनिक InferenceX benchmark पर OpenAI ने तीन open-weight models में 1.5–1.9 गुना अधिक AI work per watt और 1.7–3.6 गुना कम end-to-end latency रिपोर्ट की।
AI requests को बहुत बड़े पैमाने पर serve करने वाली कंपनी के लिए यह महत्वपूर्ण है। लेकिन इसका अर्थ यह नहीं है कि Jalapeño हर तरह के workload में GPU से तेज या सस्ता विकल्प साबित हो गया है। परीक्षण सीमित थे, चिप केवल inference के लिए बनाई गई है और आंकड़े मुख्यतः OpenAI ने engineering silicon पर खुद तैयार किए। 14
OpenAI ने SemiAnalysis के InferenceX पर Jalapeño की तुलना Nvidia के GB200 और GB300 systems से की। यह benchmark किसी AI request को serve करने की पूरी प्रक्रिया—यानी input लेने से लेकर response लौटाने तक—को मापने के लिए बनाया गया है। ऊर्जा-दक्षता के आंकड़ों को accelerator की प्रकाशित power ratings के आधार पर normalize किया गया।
OpenAI के मुताबिक, परीक्षणों में Jalapeño ने:
सबसे बड़ा latency अंतर DeepSeek R1 670B के परीक्षण में बताया गया। Jalapeño ने request को 1.65 सेकंड में पूरा किया, जबकि GB300-based system को 5.99 सेकंड लगे। 1112
ध्यान रहे, ये relative benchmark results हैं। इनसे ChatGPT की response speed या API pricing में उतनी ही कमी की गारंटी नहीं मिलती। वास्तविक प्रदर्शन model, serving software, batching, networking, context length, output length और चुने गए latency या throughput target पर निर्भर करेगा।
तुलना तीन सार्वजनिक रूप से उपलब्ध open-weight models पर की गई:
| Model | Nvidia comparison | Jalapeño का reported result |
|---|---|---|
| GPT-OSS 120B | GB200 | लगभग 1.9 गुना अधिक work per watt; latency 1.03 सेकंड बनाम 1.80 सेकंड |
| DeepSeek R1 670B | GB300 | लगभग 1.7 गुना अधिक work per watt; latency 1.65 सेकंड बनाम 5.99 सेकंड |
| Kimi K2.5 1T | GB300 | लगभग 1.5 गुना अधिक work per watt; latency 1.56 सेकंड बनाम 5.31 सेकंड |
ऊपर दिए गए आंकड़े reported benchmark summaries से लिए गए हैं; पूरे test suite का स्वतंत्र रूप से दोहराया गया परीक्षण उपलब्ध नहीं है। 61112
Workload nominally single-turn था, जिसमें 8,000 input tokens और 1,000 output tokens रखे गए। इससे नियंत्रित तुलना संभव होती है, लेकिन यह हर तरह के production AI traffic का प्रतिनिधित्व नहीं करता। Multi-turn बातचीत, tool calls, agent workflows, अलग-अलग लंबाई वाले responses, batching और बहुत लंबे context वाले requests पर नतीजे अलग हो सकते हैं। 813
इसके अलावा, benchmark में खास hardware और software configurations का इस्तेमाल हुआ। Compiler, kernels, quantization, scheduling, model architecture या Nvidia runtime stack में बदलाव performance gap को बदल सकते हैं।
Jalapeño एक application-specific integrated circuit यानी ASIC है, जिसे OpenAI ने Broadcom के साथ मिलकर बड़े language models के inference के लिए विकसित किया है। General-purpose GPU के विपरीत, यह trained models को चलाकर responses तैयार करने के काम के लिए विशेष रूप से optimized है। 15
Reported system specifications में शामिल हैं:
Chip स्तर पर reported B0 version में TSMC की N3P process पर बना reticle-scale compute die है, जिसकी rating 13.4 PFLOPS MXFP4 compute है। 18
इसका design केवल standalone accelerator पर आधारित नहीं है। बहुत बड़े models को serve करते समय requests को कई chips में बांटना पड़ सकता है, इसलिए memory, interconnect, networking और rack-scale communication भी उतने ही महत्वपूर्ण हैं जितना raw compute। 1819
Reports के अनुसार, OpenAI और Broadcom ने concept से tape-out तक का सफर लगभग नौ महीनों में पूरा किया। High-performance custom chip के लिए यह असामान्य रूप से तेज timeline है। 720
Design process में AI-assisted engineering का भी इस्तेमाल हुआ। हालांकि इसका अर्थ यह नहीं है कि किसी AI model ने processor को स्वतंत्र रूप से design और manufacture कर दिया। Architecture और engineering teams, Broadcom की semiconductor implementation टीम, manufacturing partners और system integration विशेषज्ञ इस प्रक्रिया में शामिल रहे। 713
अधिक सावधानी से कहें तो OpenAI ने LLM workloads की अपनी समझ और engineering workflow में AI tools का इस्तेमाल कर hardware तथा software को एक सीमित serving target के लिए साथ-साथ optimize किया। ऐसी specialization efficiency बढ़ा सकती है, लेकिन programmable GPU की तुलना में flexibility घटा देती है।
Jalapeño trained models को serve करने के लिए बनाया गया है, नए frontier models को train करने के लिए नहीं। इसलिए OpenAI को model training, research, experimentation और ऐसे workloads के लिए programmable accelerators—खासकर GPUs—की जरूरत बनी रहेगी, जो fixed-function inference design के अनुकूल नहीं हैं। 813
यही अंतर “Nvidia को मात” देने वाले दावे की सीमा तय करता है। Jalapeño चुने गए inference metrics में Nvidia configurations से आगे हो सकता है, जबकि OpenAI के compute stack में Nvidia hardware training और अन्य flexible workloads के लिए जरूरी रह सकता है। Specialized ASIC किसी predictable और high-volume काम में शानदार हो सकता है, फिर भी वह training, नए models और तेज software बदलावों के लिए इस्तेमाल होने वाले व्यापक platform की जगह नहीं लेता।
इन परिणामों को “इन रिपोर्ट किए गए tests में बेहतर” के रूप में पढ़ना चाहिए, न कि “हर AI system से बेहतर” के रूप में। कुछ प्रमुख सीमाएं हैं:
इन results के आधार पर universal 50% cost reduction, API price में निश्चित कमी या Nvidia के तत्काल विस्थापन का दावा नहीं किया जा सकता। उपलब्ध evidence खास परिस्थितियों में performance और efficiency claims को support करता है, व्यापक commercial conclusions को नहीं।
OpenAI की योजना 2026 के अंत तक Jalapeño को अपने infrastructure में deploy करना शुरू करने की है। Volume production और व्यापक rollout 2027 में अपेक्षित है। लंबी अवधि की योजना Microsoft और अन्य infrastructure partners के साथ कई chip generations में gigawatt-scale data centers बनाने की है। 16
यह chip मुख्य रूप से OpenAI की internal demand के लिए है, merchant processor के रूप में बिक्री के लिए नहीं। इसलिए बाहरी कंपनियों को इन घोषणाओं के आधार पर Jalapeño hardware खरीदने या public cloud पर Jalapeño instance किराए पर मिलने की उम्मीद नहीं करनी चाहिए। 16
Hardware को अपने भीतर रखने से OpenAI इसे अपने models, kernels और serving systems के लिए optimize कर सकती है। इससे semiconductor supplier बनने से जुड़ी software support, customer competition, sales और ecosystem obligations से भी बचा जा सकता है। ये deployment model से निकली रणनीतिक व्याख्याएं हैं; पुष्टि की गई योजना internal use की है, external chip sales की नहीं। 16
Jalapeño को OpenAI के व्यापक full-stack compute portfolio के एक हिस्से के रूप में समझना बेहतर है। कंपनी की रणनीति में Microsoft और अन्य cloud capacity, flexible तथा training-heavy workloads के लिए Nvidia-class GPUs और stable inference workloads के लिए custom silicon शामिल हैं। OpenAI ने अपने compute portfolio में Microsoft, Nvidia, AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy और SoftBank का उल्लेख किया है।
यह रणनीति पूरे उद्योग में चल रहे एक बड़े बदलाव से मेल खाती है। Google अपने TPUs विकसित करता है, Amazon के पास Trainium और Inferentia हैं, Microsoft Maia पर काम कर रहा है, AMD general-purpose AI GPUs के जरिए प्रतिस्पर्धा करता है और Nvidia broadly programmable systems की प्रमुख supplier बनी हुई है। Anthropic भी cloud relationships के जरिए अधिक customized infrastructure की दिशा में बढ़ रहा है, हालांकि उपलब्ध benchmark evidence उसके systems के साथ सीधी performance तुलना नहीं देता।
इसलिए निकट भविष्य की कहानी GPU replacement की नहीं, बल्कि workload specialization की है। Jalapeño OpenAI को inference economics, latency, supply और hardware roadmap पर अधिक नियंत्रण दे सकता है। वहीं training और flexible research workloads के लिए Nvidia hardware महत्वपूर्ण बना रहेगा। OpenAI का custom chip उसके लिए predictable, high-volume serving workloads का एक विशेष विकल्प है—पूरे GPU ecosystem का तत्काल विकल्प नहीं। 813
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
OpenAI के अनुसार, अगस्त 2026 के InferenceX परीक्षणों में Jalapeño ने Nvidia GB200 और GB300 systems की तुलना में 1.5–1.9 गुना अधिक AI work per watt और 1.7–3.6 गुना कम end to end latency दी।
OpenAI के अनुसार, अगस्त 2026 के InferenceX परीक्षणों में Jalapeño ने Nvidia GB200 और GB300 systems की तुलना में 1.5–1.9 गुना अधिक AI work per watt और 1.7–3.6 गुना कम end to end latency दी। परीक्षण GPT OSS 120B, DeepSeek R1 670B और Kimi K2.5 1T पर हुए। workload single turn था, जिसमें लगभग 8,000 input tokens और 1,000 output tokens शामिल थे।
Jalapeño, Broadcom के साथ विकसित 700 वॉट का inference only ASIC है। OpenAI इसे 2026 के अंत से अपने infrastructure में लगाना शुरू करने और 2027 में बड़े पैमाने पर rollout करने की योजना बना रही है।