NVIDIA के अनुसार, Jetson AGX Orin और AGX Thor पर Nemotron 3.5 Lightning तथा Qwen3.8 27B को लोकल तौर पर चलाया जा सकता है; Thor पर NVFP4 और speculative decoding के संयोजन से BF16 के मुकाबले अधिकतम 6.28 गुना डिकोड थ्रूपु... Nemotron 3.5 Lightning एक 30B MoE मॉडल है, लेकिन हर टोकन पर केवल 3B पैरामीटर सक्रिय करता है; वही...
प्रकाशितकर्ताGPT-5.6 Terra से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: How does NVIDIA’s September 4 developer guide show that Jetson AGX Thor and AGX Orin modules can run compact reasoning and agentic AI models. Article summary: NVIDIA’s September 4 guide argues that recent compact open models, combined with Jetson-optimized serving and decoding techniques, make multi-step reasoning and agent loops practical on-device rather than requiring a rou. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
मल्टी-स्टेप रीजनिंग करने वाले AI मॉडल को किसी एम्बेडेड डिवाइस पर चलाने का मतलब लंबे समय तक क्षमता और प्रतिक्रिया-गति के बीच समझौता रहा है। NVIDIA की 4 सितंबर की डेवलपर गाइड का तर्क है कि अब यह बदल रहा है: अनुकूलित ओपन मॉडल, कम-प्रिसीजन इन्फरेंस और तेज़ डिकोडिंग की मदद से Jetson AGX Orin तथा Jetson AGX Thor मॉड्यूल पर सक्षम रीजनिंग और एजेंटिक AI सीधे डिवाइस पर चलाया जा सकता है। 1
NVIDIA का सबसे प्रमुख आंकड़ा Jetson AGX Thor से जुड़ा है। कंपनी ने NVFP4 क्वांटाइज़ेशन और speculative decoding को मिलाकर BF16 की तुलना में अधिकतम 6.28 गुना अधिक डिकोड थ्रूपुट रिपोर्ट किया है। यह हर मॉडल या हर वर्कलोड के लिए टोकन-प्रति-सेकंड की गारंटी नहीं है, लेकिन यह दिखाता है कि रोबोटिक्स, वाहनों और औद्योगिक मशीनों के लिए लोकल AI एजेंट अधिक व्यावहारिक हो रहे हैं। 1
NVIDIA ने Jetson AGX Orin और Jetson AGX Thor के लिए Nemotron 3.5 Lightning और Qwen3.8-27B को उपयुक्त विकल्प बताया है। डेवलपर इन मॉडलों को Jetson पर vLLM के जरिए सर्व कर सकते हैं और इन्फरेंस दक्षता बढ़ाने के लिए दो पूरक तकनीकों का इस्तेमाल कर सकते हैं। 1
NVFP4 चार-बिट फ्लोटिंग-पॉइंट प्रतिनिधित्व का उपयोग करता है, जिससे मॉडल ऑपरेशनों के लिए जरूरी मेमोरी और कंप्यूट कार्य घट सकता है। एम्बेडेड इन्फरेंस में यह खास तौर पर महत्वपूर्ण है, क्योंकि आउटपुट जनरेट करते समय चुनौती केवल कच्ची कंप्यूट क्षमता नहीं, बल्कि मॉडल वेट और एक्टिवेशन को पर्याप्त तेजी से मेमोरी में स्थानांतरित करना भी होती है। 1
Jetson Thor इस तरीके के लिए विशेष रूप से अनुकूल है। NVIDIA के मुताबिक, इसके Blackwell GPU में Transformer Engine के जरिए नेटिव FP4 सपोर्ट है। 3
Speculative decoding में एक छोटा draft मॉडल अगले कई टोकन प्रस्तावित करता है। मुख्य मॉडल उन्हें एक साथ सत्यापित करता है और अंतिम निर्णय उसी का होता है। यदि कई प्रस्तावित टोकन स्वीकार हो जाते हैं, तो मॉडल एक बार की सत्यापन प्रक्रिया में कई टोकन आगे बढ़ सकता है, बजाय हर बार केवल एक टोकन बनाने के। 1
इस तकनीक से मिलने वाला लाभ इस बात पर निर्भर करता है कि draft मॉडल के कितने टोकन स्वीकार होते हैं। इसलिए मॉडल, प्रॉम्प्ट और डिकोडिंग सेटिंग बदलने पर प्रदर्शन भी बदल सकता है। इसे स्थिर स्पीड-मल्टीप्लायर नहीं, बल्कि वर्कलोड-विशिष्ट अनुकूलन मानना चाहिए।
इन दोनों मॉडलों के बीच चुनाव केवल कुल पैरामीटर संख्या देखकर नहीं करना चाहिए। उनकी आर्किटेक्चर अलग-अलग एज AI कार्यप्रवाहों के लिए अलग फायदे और सीमाएं देती है।
Nemotron 3.5 Lightning 30 अरब पैरामीटर वाला mixture-of-experts (MoE) मॉडल है, लेकिन हर टोकन पर केवल 3 अरब पैरामीटर सक्रिय करता है। NVIDIA इसे लंबे समय तक लगातार चलने वाले एजेंटों की execution layer के लिए बनाया गया मॉडल बताता है। 2
यह संरचना उन स्थितियों में उपयोगी हो सकती है जहां एजेंट को बार-बार आउटपुट देना हो या लगातार संचालन-चक्र चलाना हो—जैसे किसी घटना को समझना, अनुमत टूल चलाना, नतीजा जांचना और तय करना कि अगला कदम लेना है या मामले को आगे भेजना है। ऐसे मामलों में कुल पैरामीटर संख्या के साथ-साथ प्रति टोकन सक्रिय पैरामीटर और निरंतर जनरेशन गति अहम होती है।
Qwen3.8-27B एक dense मॉडल है, यानी प्रत्येक टोकन के लिए इसके सभी 27 अरब पैरामीटर सक्रिय होते हैं। NVIDIA इसे Nemotron 3.5 Lightning के साथ Jetson के लिए एक मजबूत विकल्प के रूप में रखता है। 1
ऐसा मॉडल उन अनुप्रयोगों के लिए समझदारी भरा विकल्प हो सकता है जहां निर्णय कम हों, लेकिन हर निर्णय की जटिलता और गुणवत्ता अधिक महत्वपूर्ण हो। इसका व्यावहारिक समझौता यह है कि हर टोकन पर पूरा नेटवर्क सक्रिय होने से sparse MoE मॉडल की तुलना में कंप्यूट की मांग अधिक हो सकती है।
NVIDIA की दिशा स्पष्ट है: वास्तविक एप्लिकेशन के आधार पर बेंचमार्क करें—प्रॉम्प्ट और जवाब की लंबाई, टूल, लेटेंसी बजट, उपलब्ध मेमोरी और निर्णय लेने के पैटर्न को ध्यान में रखें। 1
बहुत अधिक प्रतिक्रियाएं देने वाले एजेंट के लिए तेज़ आउटपुट जनरेशन वाला sparse मॉडल बेहतर हो सकता है। दूसरी ओर, कम लेकिन कठिन निर्णय लेने वाली प्रणाली अधिक समय लेकर dense मॉडल के व्यवहार को प्राथमिकता दे सकती है। कोई भी आर्किटेक्चर हर edge deployment के लिए अपने-आप बेहतर नहीं है।
NVIDIA ने Jetson AGX Thor पर NVFP4 क्वांटाइज़ेशन और speculative decoding को जोड़ने के बाद BF16 के मुकाबले अधिकतम 6.28 गुना डिकोड-थ्रूपुट सुधार रिपोर्ट किया। कंपनी के परीक्षण में speculative decoding की सर्वोत्तम कॉन्फ़िगरेशन भी मॉडल के हिसाब से अलग रही: Nemotron 3.5 Lightning के लिए DSpark और Qwen3.8-27B के लिए DFlash2 बेहतर पाया गया। 1
यह परिणाम इसलिए अहम है क्योंकि इंटरैक्टिव एजेंट की महसूस होने वाली प्रतिक्रिया-गति अक्सर आउटपुट टोकन को एक-एक करके बनाने वाली डिकोडिंग प्रक्रिया से तय होती है। फिर भी, इसे हर प्रॉम्प्ट, मॉडल या डिप्लॉयमेंट पर लागू होने वाला सामान्य स्पीड दावा नहीं मानना चाहिए। draft मॉडल की गुणवत्ता, टोकन स्वीकार्यता दर, बैच आकार, कॉन्टेक्स्ट लंबाई और रनटाइम कॉन्फ़िगरेशन वास्तविक थ्रूपुट को प्रभावित करते हैं। 1
डिवाइस पर चलने वाला मॉडल हर रीजनिंग अनुरोध के लिए दूरस्थ डेटा सेंटर तक नेटवर्क राउंड-ट्रिप की जरूरत घटाता है। भौतिक प्रणालियों के लिए इसका अर्थ नेटवर्क से जुड़ी देरी में कमी, कनेक्टिविटी अस्थिर होने पर भी संचालन जारी रखने की क्षमता और सेंसर स्ट्रीम या ऑपरेशनल लॉग को डिवाइस पर ही रखने का विकल्प हो सकता है। NVIDIA विशेष रूप से उन परिस्थितियों में edge reasoning और agentic AI को उपयोगी बताता है जहां डेटा की स्थानीयता और रीयल-टाइम प्रतिक्रिया महत्वपूर्ण हो। 1
इसका अर्थ यह नहीं कि क्लाउड की भूमिका खत्म हो जाती है। मॉडल ट्रेनिंग, बड़ी संख्या में डिवाइसों का प्रबंधन, बड़े पैमाने का विश्लेषण या डिवाइस की मेमोरी व कंप्यूट क्षमता से बड़े कार्यों के लिए केंद्रीकृत इन्फ्रास्ट्रक्चर की जरूरत बनी रह सकती है। बदलाव यह है कि अब हर निर्णय के लिए डेटा सेंटर से जुड़ाव अनिवार्य नहीं रहना चाहिए।
NVIDIA ने इन-कैबिन असिस्टेंट, रीयल-टाइम विसंगति पहचान और कठोर या दूरदराज़ वातावरण में काम करने वाले रोबोटों का उल्लेख किया है। 1
इन उदाहरणों में एक साझा जरूरत है: सिस्टम को स्थानीय संदर्भ समझकर पर्याप्त तेजी से प्रतिक्रिया देनी चाहिए। संभावित उपयोगों में शामिल हैं:
सबसे उपयुक्त समाधान केवल वे डिवाइस नहीं हैं जो LLM चला सकते हैं। बेहतर उम्मीदवार वे प्रणालियां हैं जहां प्रतिक्रिया समय, डेटा-स्थानीयता या गोपनीयता और ऑफलाइन लचीलापन सीधे परिचालन मूल्य पैदा करते हैं।
Jetson AGX Thor, मांग वाले physical-AI वर्कलोड के लिए NVIDIA का उच्च-स्तरीय प्लेटफॉर्म है। NVIDIA के अनुसार इसमें Blackwell GPU, 128 GB मेमोरी और 130 W पावर एनवेलप में अधिकतम 2,070 FP4 TFLOPS की क्षमता है। 3
यह हार्डवेयर प्रोफाइल NVFP4, उच्च-थ्रूपुट डिकोडिंग और बड़े लोकल रीजनिंग मॉडलों पर गाइड के फोकस से मेल खाता है। AGX Orin पहले से स्थापित एम्बेडेड डिप्लॉयमेंट के लिए प्रासंगिक बना हुआ है, जबकि Thor अधिक मांग वाले जनरेटिव और मल्टीमॉडल वर्कलोड को लक्ष्य करता है।
एंट्री स्तर पर NVIDIA ने रोबोटिक्स, डिलीवरी और निरीक्षण ड्रोन तथा विज़न-AI प्रणालियों के लिए Jetson Orin Nano 2 की घोषणा भी की है। कंपनी के अनुसार, मॉड्यूल और डेवलपर किट के 2027 की पहली छमाही में उपलब्ध होने की उम्मीद है। 1
इस तरह Jetson लाइनअप एक स्तरीय रणनीति दिखाता है: एंट्री-लेवल edge AI के लिए छोटे सिस्टम, परिपक्व एम्बेडेड डिप्लॉयमेंट के लिए AGX Orin और लोकल जनरेटिव रीजनिंग के लिए अधिक मेमोरी व कंप्यूट चाहने वाले उपयोगों के लिए AGX Thor।
NVIDIA की गाइड यह नहीं कहती कि अब हर अत्याधुनिक मॉडल हर एम्बेडेड मॉड्यूल पर आसानी से चल जाएगा। इसका अधिक उपयोगी निष्कर्ष सीमित लेकिन महत्वपूर्ण है: कॉम्पैक्ट रीजनिंग मॉडल, vLLM डिप्लॉयमेंट, NVFP4 क्वांटाइज़ेशन और speculative decoding के मेल से Jetson-श्रेणी के हार्डवेयर पर सक्षम लोकल एजेंट संभव हो सकते हैं। 1
डेवलपर्स के लिए अगला कदम सैद्धांतिक नहीं, व्यावहारिक है—लक्ष्य Jetson डिवाइस पर लक्ष्य मॉडल को वास्तविक प्रॉम्प्ट, टूल, कॉन्टेक्स्ट विंडो और उत्पाद की प्रतिक्रिया-समय जरूरतों के साथ परखें। 6.28 गुना का परिणाम अनुकूलन की संभावित बढ़त दिखाता है; लेकिन किसी एप्लिकेशन के लिए वही बढ़त उपयोगी बनेगी या नहीं, इसका फैसला उसका अपना बेंचमार्क करेगा। 1
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
NVIDIA के अनुसार, Jetson AGX Orin और AGX Thor पर Nemotron 3.5 Lightning तथा Qwen3.8 27B को लोकल तौर पर चलाया जा सकता है; Thor पर NVFP4 और speculative decoding के संयोजन से BF16 के मुकाबले अधिकतम 6.28 गुना डिकोड थ्रूपु...
NVIDIA के अनुसार, Jetson AGX Orin और AGX Thor पर Nemotron 3.5 Lightning तथा Qwen3.8 27B को लोकल तौर पर चलाया जा सकता है; Thor पर NVFP4 और speculative decoding के संयोजन से BF16 के मुकाबले अधिकतम 6.28 गुना डिकोड थ्रूपु... Nemotron 3.5 Lightning एक 30B MoE मॉडल है, लेकिन हर टोकन पर केवल 3B पैरामीटर सक्रिय करता है; वहीं Qwen3.8 27B एक dense मॉडल है जिसमें सभी 27B पैरामीटर सक्रिय होते हैं। [1][2]
लोकल इन्फरेंस रोबोट, वाहन और औद्योगिक उपकरणों की डेटा सेंटर पर निर्भरता घटा सकता है, लेकिन वास्तविक उपयोग से पहले अपने प्रॉम्प्ट, टूल, लेटेंसी और मेमोरी सीमाओं के साथ बेंचमार्क करना जरूरी है। [1]