Nvidia ने 24 अगस्त को बताया कि Groq 3 LPX फुल प्रोडक्शन में पहुंच गया है। Artificial Analysis के परीक्षण में Gemma 4 31B मॉडल और 100,000 टोकन संदर्भ के साथ इसने 3,400 आउटपुट टोकन प्रति सेकंड की गति हासिल की; Nvidia ने... LPX Nvidia के GPU का विकल्प नहीं है। यह मुख्य रूप से AI inference के decode चरण के लिए बनाया गया...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce at Hot Chips 2026 about the full-production launch of its Groq 3 LPX dedicated AI-inference accelerator—acquired th. Article summary: At Hot Chips on August 24, Nvidia said its Groq 3 LPX rack-scale accelerator had entered full production as the low-latency, long-context inference component of the Vera Rubin platform. It is intended for rapid token gen. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Nvidia ने 24 अगस्त को Hot Chips सम्मेलन में घोषणा की कि Groq 3 LPX रैक-स्केल inference accelerator अब फुल प्रोडक्शन में पहुंच गया है। यह सिस्टम Nvidia के Vera Rubin NVL72 के साथ काम करने के लिए बनाया गया है और इसका मुख्य लक्ष्य AI सिस्टम के जवाब तैयार करने वाले चरण—यानी token generation—को तेज करना है। 26
Artificial Analysis के एक बेंचमार्क में Groq 3 LPX ने Google के ओपन-सोर्स Gemma 4 31B मॉडल को 100,000-टोकन संदर्भ के साथ चलाते हुए 3,400 आउटपुट टोकन प्रति सेकंड की गति दिखाई। अधिक सटीक रूप से दर्ज median परिणाम 3,431 टोकन प्रति सेकंड था, जिसे Nvidia ने अपनी घोषणा में 3,400 तक राउंड किया। कंपनी का कहना है कि इस परीक्षण में यह निकटतम वैकल्पिक प्लेटफॉर्म से चार गुना तेज था। 1735
Groq 3 LPX को कम-विलंबता वाले AI inference के लिए तैयार किया गया है। इसका इस्तेमाल agentic AI, coding assistants और ऐसे इंटरैक्टिव सिस्टम में हो सकता है जिन्हें लंबे संदर्भ को समझने के बाद भी तेजी से जवाब देना होता है। Nvidia इसे predictable और हाई-स्पीड token generation के लिए बना interactive inference accelerator कहता है। 1926
यहां दो तकनीकी चरणों को समझना जरूरी है:
LPX का प्राथमिक फोकस decode चरण को तेज करना है। इसके विपरीत, Vera Rubin NVL72 training, व्यापक inference, लंबे context की प्रोसेसिंग और हाई-थ्रूपुट वाले सामान्य कामों के लिए ज्यादा लचीला प्लेटफॉर्म बना रहता है। 34
इसलिए Nvidia LPX को अपने GPU इंफ्रास्ट्रक्चर का सीधा प्रतिस्थापन नहीं, बल्कि उसका पूरक बता रहा है। GPU सामान्य-purpose accelerated computing संभालते हैं, जबकि Groq से जुड़ी architecture को उन कामों के लिए लगाया जाता है जहां यूजर को जवाब की रफ्तार तुरंत महसूस होती है।
Artificial Analysis के 100K-context benchmark में Gemma 4 31B पर LPX का median परिणाम 3,431 आउटपुट टोकन प्रति सेकंड था। Nvidia ने इसे 3,400 टोकन प्रति सेकंड के रूप में पेश किया। 17
Nvidia ने इस workload में LPX को निकटतम विकल्प से चार गुना अधिक responsive बताया है। 35 हालांकि, इसे AI प्रदर्शन का सार्वभौमिक पैमाना नहीं माना जा सकता। यह दावा खास मॉडल, 100,000-टोकन context और उसी benchmark setup पर आधारित है।
वास्तविक एप्लिकेशन में प्रदर्शन पर कई चीजों का असर पड़ता है—मॉडल का आकार, prompt की लंबाई, एक साथ चल रहे अनुरोधों की संख्या, memory, networking और शुरुआती context को प्रोसेस करने में लगने वाला समय। इसलिए benchmark की बड़ी संख्या यह संकेत देती है कि LPX किस तरह के workload के लिए बनाया गया है, लेकिन हर AI सेवा में समान बढ़त की गारंटी नहीं देती।
Nebius पहला घोषित AI-cloud adopter है। कंपनी 2026 के अंत से पहले Groq 3 LPX को अपने production-inference प्लेटफॉर्म Nebius Token Factory में शामिल करने की योजना बना रही है। 2
Groq ने भी कहा है कि वह शुरुआती adopters में शामिल होगा। वह LPX को अपने purpose-built AI-inference cloud में Vera Rubin NVL72 के साथ तैनात करेगा। इस संयोजन में Rubin सिस्टम व्यापक प्लेटफॉर्म क्षमताएं उपलब्ध कराएगा, जबकि LPX context-heavy workloads में token generation की रफ्तार बढ़ाएगा। 18
Nvidia ने Groq 3 LPX को Vera Rubin प्लेटफॉर्म का सातवां प्रमुख component बताया है। इस प्लेटफॉर्म में Vera CPU भी शामिल है, जिसमें Nvidia के अनुसार 88 custom-designed Olympus cores हैं। 33
Vera CPU उन कामों को संभालने के लिए बनाया गया है जो model inference के आसपास होते हैं—जैसे orchestration, data processing, tool use और code execution। Nvidia ने यह भी कहा कि SpaceXAI अगली पीढ़ी के agentic AI applications के लिए Vera CPUs तैनात करने की योजना बना रहा है और पहली पीढ़ी के Starmind AI satellite के लिए optimized Vera Rubin NVL72 system का इस्तेमाल करेगा। 40
इन घोषणाओं से Nvidia की व्यापक रणनीति साफ होती है: हर AI workload को केवल GPU पर चलाने के बजाय अलग-अलग कामों के लिए specialized components वाला AI factory बनाना। इस मॉडल में CPU agent workloads को coordinate करता है, GPU लचीली बड़े पैमाने की computing संभालता है और LPX तेज, कम-विलंबता वाले response generation पर ध्यान देता है।
Groq 3 LPX, Nvidia और Groq के बीच दिसंबर 2025 में हुए 20 अरब डॉलर के समझौते का अब तक का सबसे स्पष्ट product outcome है। लेकिन इसे Groq की सीधी खरीद कहना पूरी तरह सही नहीं होगा। उपलब्ध रिपोर्टिंग के अनुसार, समझौते में Groq की inference technology का non-exclusive license और Groq के संस्थापक एवं CEO Jonathan Ross, President Sunny Madra तथा अन्य प्रमुख कर्मचारियों को Nvidia में शामिल करना था। 48
सौदे के बाद Groq स्वतंत्र रूप से सक्रिय रहा और बाद में उसने अतिरिक्त funding भी जुटाई। यह स्थिति पूरे operating company के अधिग्रहण के बजाय technology-and-talent deal की ओर इशारा करती है। 3
यही संरचना LPX की positioning को भी समझाती है। Nvidia ने Groq की language-processing technology को अपने rack-scale platform में शामिल किया है, जबकि Groq एक स्वतंत्र कंपनी के रूप में काम जारी रखे हुए है और अपने cloud में Nvidia के इस hardware को इस्तेमाल करने की योजना बना रहा है।
यह घोषणा केवल एक नए AI chip के उत्पादन में आने की खबर नहीं है। असली बदलाव यह है कि Nvidia AI सेवा देने की प्रक्रिया को अलग-अलग चरणों में बांटकर सबसे latency-sensitive हिस्से के लिए dedicated accelerator पेश कर रहा है।
Interactive agents के लिए तेज decode का अर्थ है कि multi-step tasks के दौरान जवाब अधिक तुरंत महसूस हो सकते हैं। Nvidia का benchmark लंबे context वाले एक configuration में मजबूत प्रदर्शन दिखाता है, लेकिन LPX की वास्तविक उपयोगिता इस बात पर निर्भर करेगी कि इसे cloud providers और application developers पूरे serving stack के साथ कैसे तैनात करते हैं।
Full-production milestone, Nebius की तैनाती और Groq का planned adoption यह तय करने में ज्यादा अहम होंगे कि benchmark में दिखी बढ़त बड़े पैमाने पर उपलब्ध cloud performance में बदल पाती है या नहीं।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Nvidia ने 24 अगस्त को बताया कि Groq 3 LPX फुल प्रोडक्शन में पहुंच गया है। Artificial Analysis के परीक्षण में Gemma 4 31B मॉडल और 100,000 टोकन संदर्भ के साथ इसने 3,400 आउटपुट टोकन प्रति सेकंड की गति हासिल की; Nvidia ने...
Nvidia ने 24 अगस्त को बताया कि Groq 3 LPX फुल प्रोडक्शन में पहुंच गया है। Artificial Analysis के परीक्षण में Gemma 4 31B मॉडल और 100,000 टोकन संदर्भ के साथ इसने 3,400 आउटपुट टोकन प्रति सेकंड की गति हासिल की; Nvidia ने... LPX Nvidia के GPU का विकल्प नहीं है। यह मुख्य रूप से AI inference के decode चरण के लिए बनाया गया है, जिसमें मॉडल एक एक करके जवाब के टोकन तैयार करता है।
Nebius पहला घोषित AI क्लाउड अपनाने वाला है और 2026 के अंत से पहले इसे अपने Token Factory प्लेटफॉर्म में जोड़ने की योजना रखता है। Groq भी इसे Vera Rubin NVL72 के साथ अपने AI inference क्लाउड में लगाने की तैयारी में है।...