تذكر NVIDIA أن Jetson AGX Thor وAGX Orin يمكنهما تشغيل Nemotron 3.5 Lightning وQwen3.8 27B محلياً؛ وعلى Thor حقق الجمع بين NVFP4 وفك التشفير التخميني تحسناً يصل إلى 6.28× في إنتاجية فك التشفير مقارنةً بـ BF16 ضمن اختب... يستخدم Nemotron 3.5 Lightning بنية الخبراء المختلطين MoE: 30 مليار معلَمة إجمالاً لكن 3 مليارات...
نشر بواسطةتم التحرير باستخدام GPT-5.6 Terraتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: How does NVIDIA’s September 4 developer guide show that Jetson AGX Thor and AGX Orin modules can run compact reasoning and agentic AI models. Article summary: NVIDIA’s September 4 guide argues that recent compact open models, combined with Jetson-optimized serving and decoding techniques, make multi-step reasoning and agent loops practical on-device rather than requiring a rou. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
لم يعد تشغيل نموذج استدلال متعدد الخطوات على جهاز مدمج يعني بالضرورة الاختيار بين قدرات النموذج وسرعة الاستجابة. فبحسب دليل NVIDIA المنشور في 4 سبتمبر، يمكن للنماذج المفتوحة المحسّنة، والاستدلال منخفض الدقة، وتسريع مرحلة توليد الرموز أن تجعل الذكاء الاصطناعي القائم على الوكلاء قابلاً للتشغيل مباشرةً على وحدات Jetson AGX Orin وJetson AGX Thor. 1
وأبرز رقم في الدليل هو تحسن يصل إلى 6.28× في إنتاجية فك التشفير مقارنةً بـ BF16 على Jetson AGX Thor عند الجمع بين تكميم NVFP4 وفك التشفير التخميني. لكن هذا الرقم نتيجة مرجعية مرتبطة بنموذج وحِمل عمل وإعدادات بعينها، وليس وعداً ثابتاً بعدد الرموز في الثانية لكل استخدام. 1
ترشح NVIDIA نموذجي Nemotron 3.5 Lightning وQwen3.8-27B كخيارين مناسبين لـ Jetson AGX Orin وJetson AGX Thor. ويمكن تقديم النموذج محلياً عبر إطار vLLM على Jetson، ثم رفع كفاءة الاستدلال بأسلوبين متكاملين: تكميم NVFP4 وفك التشفير التخميني. 1
يستخدم NVFP4 تمثيلاً عشرياً عائماً من 4 بتات لتقليل العمل الحسابي والذاكرة المطلوبة لعمليات النموذج. وهذه النقطة مهمة في الأجهزة المدمجة، إذ لا تكون المشكلة دائماً في القدرة الحسابية وحدها، بل في سرعة نقل أوزان النموذج والتنشيطات أثناء التوليد. 1
وتتمتع منصة Jetson Thor بملاءمة خاصة لهذا الأسلوب، لأن NVIDIA تقول إن معالج الرسوميات Blackwell فيها يدعم FP4 أصلياً عبر Transformer Engine. 3
في فك التشفير التخميني، يقترح نموذج صغير عدة رموز تالية، ثم يتحقق النموذج الرئيسي منها دفعة واحدة مع احتفاظه بالقرار النهائي. وإذا قبل النموذج الرئيسي عدداً من المقترحات، يمكن أن يتقدم التوليد عدة رموز في خطوة تحقق واحدة بدلاً من توليد رمز واحد في كل مرة. 1
لذلك، تتغير الفائدة الفعلية بحسب معدل قبول الرموز المقترحة، ونوع النموذج، والمطالبة، وإعدادات التوليد. إنها تقنية تحسين لحِمل عمل محدد، وليست مضاعف أداء مضموناً في كل الظروف.
يضم Nemotron 3.5 Lightning 30 مليار معلَمة ضمن بنية «الخبراء المختلطين» (MoE)، لكنه يفعّل 3 مليارات معلَمة فقط لكل رمز. وتصفه NVIDIA بأنه موجه لطبقة التنفيذ لدى الوكلاء طويلَي التشغيل والدائمَي العمل. 2
قد يناسب ذلك الوكيل الذي يكرر دورة تشغيلية بسرعة: يفسر حدثاً، ويستدعي أداة مسموحاً بها، ويفحص النتيجة، ثم يقرر الاستمرار أو التصعيد. هنا لا يهم إجمالي المعلمات وحده، بل عدد المعلمات النشطة لكل رمز وسرعة التوليد المستدامة.
أما Qwen3.8-27B فهو نموذج كثيف، أي إن جميع معلماته البالغة 27 ملياراً تشارك في معالجة كل رمز. وتضعه NVIDIA ضمن خيارات Jetson القوية إلى جانب Nemotron 3.5 Lightning. 1
وقد يكون هذا النهج مناسباً لتطبيق يتخذ قرارات أقل عدداً، لكنه يمنح وزناً أكبر لجودة كل قرار. والمقابل هو أن تفعيل الشبكة كاملةً لكل رمز قد يتطلب قدرة حوسبة أكبر من نموذج MoE المتناثر.
الخلاصة العملية من إرشادات NVIDIA: اختبر النموذج وفق التطبيق الحقيقي، بما يشمل طول المطالبات والردود، والأدوات المستخدمة، وميزانية زمن الاستجابة، وحدود الذاكرة، ونمط القرارات المطلوب. 1
قد يفضّل وكيل كثير الردود نموذجاً متناثراً سريع التوليد، بينما قد يقبل نظام يتخذ أحكاماً أقل وأكثر تعقيداً بزمن توليد أطول. ولا تتفوق أي من البنيتين تلقائياً في كل نشر عند الحافة.
تفيد NVIDIA بأن الجمع بين NVFP4 وفك التشفير التخميني حقق تحسناً أقصى قدره 6.28× في إنتاجية فك التشفير مقارنةً بـ BF16 على Jetson AGX Thor. كما اختلف الإعداد الأفضل لفك التشفير التخميني حسب النموذج: حقق DSpark أفضل نتيجة مع Nemotron 3.5 Lightning، بينما كان DFlash2 الأفضل مع Qwen3.8-27B. 1
وتكتسب النتيجة أهميتها لأن فك التشفير، أي إنشاء رموز الإجابة تباعاً، هو ما يحدد غالباً مدى إحساس المستخدم باستجابة الوكيل التفاعلي. لكن السرعة الواقعية ستتأثر بجودة نموذج المسودة، ومعدل قبول الرموز، وحجم الدفعات، وطول السياق، وإعدادات بيئة التشغيل. 1
عندما يعمل النموذج على الجهاز، لا تحتاج كل عملية استدلال إلى رحلة ذهاب وإياب إلى مركز بيانات بعيد. وفي الأنظمة المادية، قد يعني ذلك تقليل التأخير المرتبط بالشبكة، واستمرار العمل عند ضعف الاتصال أو انقطاعه، والاحتفاظ بتدفقات المستشعرات والسجلات التشغيلية على الجهاز. وتربط NVIDIA الاستدلال عند الحافة بالسيناريوهات التي تهم فيها محلية البيانات والاستجابة الفورية. 1
ولا يعني ذلك الاستغناء عن السحابة: فما زالت مفيدة للتدريب، وإدارة أساطيل الأجهزة، والتحليلات واسعة النطاق، والمهام التي تتجاوز ذاكرة الجهاز وقدرته الحاسوبية. لكن الاتصال بمركز البيانات لا يعود بالضرورة جزءاً حرجاً من مسار كل قرار.
تسلط NVIDIA الضوء على المساعدات داخل المقصورة، واكتشاف الشذوذ في الزمن الحقيقي، والروبوتات العاملة في البيئات القاسية أو النائية. 1
وتشترك هذه الاستخدامات في حاجة عملية واضحة: فهم السياق المحلي والاستجابة بسرعة كافية لكي يكون القرار مفيداً. ومن الأمثلة المحتملة:
وليست أفضل الحالات مجرد أجهزة قادرة على تشغيل نموذج لغوي كبير؛ بل هي الأنظمة التي تمنح فيها سرعة الاستجابة، ومحلية البيانات، والقدرة على الصمود دون اتصال قيمة تشغيلية مباشرة.
تمثل Jetson AGX Thor الفئة العليا لدى NVIDIA لأحمال «الذكاء الاصطناعي المادي» الأكثر تطلباً. وتقول الشركة إنها تجمع معالج رسوميات Blackwell مع 128 غيغابايت من الذاكرة، وتصل إلى 2,070 تيرافلوب FP4 ضمن سقف طاقة يبلغ 130 واطاً. 3
ويتوافق هذا الملف العتادي مع التركيز على NVFP4 وفك التشفير عالي الإنتاجية ونماذج الاستدلال المحلية الأكبر. ويبقى AGX Orin مهماً للنشرات المدمجة الراسخة، فيما يستهدف Thor أحمال الذكاء التوليدي ومتعدد الوسائط الأكثر تطلباً.
وفي الفئة الابتدائية، أعلنت NVIDIA أيضاً عن Jetson Orin Nano 2 الموجه للروبوتات وطائرات التوصيل والفحص وأنظمة الرؤية الحاسوبية. ومن المتوقع أن تتاح الوحدة وحزمة المطورين خلال النصف الأول من عام 2027. 1
وبذلك ترسم NVIDIA محفظة متدرجة: أنظمة أصغر للذكاء الاصطناعي الطرفي الأساسي، وAGX Orin للنشرات المدمجة الناضجة، وAGX Thor للتطبيقات التي تحتاج ذاكرة وقدرة حوسبة أكبر للاستدلال التوليدي محلياً.
لا يقول دليل NVIDIA إن كل نموذج متقدم يمكن تشغيله بسهولة على كل وحدة مدمجة. والنتيجة الأدق هي أن نماذج الاستدلال المدمجة، والتشغيل عبر vLLM، وتكميم NVFP4، وفك التشفير التخميني، يمكن أن تجعل الوكلاء القادرين على العمل محلياً خياراً قابلاً للتنفيذ على عتاد Jetson. 1
أما الخطوة التالية للمطورين فهي اختبارية لا نظرية: تشغيل النموذج المستهدف على جهاز Jetson المستهدف، باستخدام المطالبات والأدوات ونوافذ السياق ومتطلبات زمن الاستجابة الفعلية للمنتج. تُظهر نتيجة 6.28× سقف الفائدة الممكنة من التحسين، لكن معيار التطبيق الحقيقي هو الذي يحدد ما إذا كانت ستتحول إلى نظام ذكاء اصطناعي طرفي صالح للاستخدام. 1
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
تذكر NVIDIA أن Jetson AGX Thor وAGX Orin يمكنهما تشغيل Nemotron 3.5 Lightning وQwen3.8 27B محلياً؛ وعلى Thor حقق الجمع بين NVFP4 وفك التشفير التخميني تحسناً يصل إلى 6.28× في إنتاجية فك التشفير مقارنةً بـ BF16 ضمن اختب...
تذكر NVIDIA أن Jetson AGX Thor وAGX Orin يمكنهما تشغيل Nemotron 3.5 Lightning وQwen3.8 27B محلياً؛ وعلى Thor حقق الجمع بين NVFP4 وفك التشفير التخميني تحسناً يصل إلى 6.28× في إنتاجية فك التشفير مقارنةً بـ BF16 ضمن اختب... يستخدم Nemotron 3.5 Lightning بنية الخبراء المختلطين MoE: 30 مليار معلَمة إجمالاً لكن 3 مليارات فقط نشطة لكل رمز، بينما Qwen3.8 27B نموذج كثيف يفعّل كامل 27 مليار معلَمة لكل رمز.
قد يخفف الاستدلال المحلي اعتماد الروبوتات والمركبات والأنظمة الصناعية على الاتصال بمراكز البيانات، لكن الاختيار العملي للنموذج يتطلب اختبار التطبيق الفعلي وقيوده.