أعلنت AMD في 24 يوليو 2026 عن إطلاق نموذج Instella MoE، وهو نموذج لغوي ضخم مفتوح بالكامل بتقنية الخبراء المختلطة (MoE) يضم 16 مليار معلمة، ولا ينشط سوى 2.8 مليار معلمة لكل رمز. تم تدريب النموذج بالكامل من الصفر على معالجات AMD Instinct من فئتي MI300X وMI325X باستخدام حزمة برامج ROCm المفتوحة، مما يجعله دليلاً عملياً...

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What are the key details of AMD's July 24 release of Instella-MoE, a fully open 16-billion-parame. Article summary: Here are the key verified details of AMD's Instella-MoE release, based primarily on the official AMD ROCm blog post (July 24, 2026) and corroborating news sources.. Topic tags: general, academic, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails
في 24 يوليو 2026، أعلنت شركة AMD عن إطلاق Instella-MoE، وهو نموذج لغوي ضخم مفتوح بالكامل بتقنية الخبراء المختلطة (Mixture-of-Experts) يضم 16 مليار معلمة، وقد تم تدريبه بالكامل من الصفر على معالجات AMD Instinct MI300X و MI325X باستخدام حزمة البرامج المفتوحة ROCm . الميزة الأبرز في هذا النموذج هي كفاءته العالية، حيث أنه لا ينشط سوى 2.8 مليار معلمة لكل رمز (token) يتم معالجته، مما يتيح له تحقيق أداء منافس مع توفير كبير في الموارد الحسابية. يُعد هذا الإطلاق علامة فارقة استراتيجية لـ AMD، حيث يثبت بشكل عملي أن أجهزتها وبرمجياتها مفتوحة المصدر قادرة على دعم تطوير نماذج الذكاء الاصطناعي على نطاق واسع، مما ينافس نظام CUDA المسيطر من Nvidia
.
يعتمد Instella-MoE على تكوين خبراء مشتركين وموجهين، حيث يضم خبيرين مشتركين نشطين دائمًا و6 خبراء يتم توجيههم من مجموعة تضم 64 خبيرًا لكل رمز . يتكون النموذج من 27 طبقة لفك التشفير، كل طبقة بحجم خفي يبلغ 2,048
. هناك ابتكاران معماريان رئيسيان:
كما يستخدم النموذج أسلوب التنبؤ متعدد الرموز (Multi-Token Prediction – MTP) خلال مرحلتي التدريب الأولي والمتوسط .
بعد مرحلة تدريب مخصصة لتمديد السياق الطويل، يدعم نموذج Instella-MoE نافذة سياق يصل طولها إلى 64 ألف رمز .
نشرت AMD بالكامل مسار التدريب الكامل للنموذج، والذي يتكون من ست مراحل متتالية :
حقق النموذج الأساسي Instella-MoE-16B-A3B متوسط درجات 76.7 على المعايير القياسية، مما يضعه بين أفضل النماذج المفتوحة بالكامل في فئته . وبحسب التقارير، فقد تفوق على نموذجي SmolLM3-3B وOLMo-3-7B، ونافس نماذج أكبر حجمًا على الرغم من أنه لا ينشط سوى 2.8 مليار معلمة لكل رمز
.
التزامًا منها بمبدأ الذكاء الاصطناعي المفتوح، أصدرت AMD جميع مخرجات التدريب بشكل علني :
جميع المخرجات متاحة على منصة Hugging Face تحت مساحة amd/Instella-MoE-16B-A3B، ومرخصة بموجب رخصة Research RAIL (رخصة الذكاء الاصطناعي المسؤولة) لأغراض أكاديمية وبحثية .
يمثل إطلاق Instella-MoE أكثر من مجرد نموذج جديد؛ إنه إثبات مباشر على أن حزمة برامج ROCm وأجهزة معالجات Instinct من AMD قادرة على دعم تطوير الذكاء الاصطناعي على نطاق عالمي، من مرحلة ما قبل التدريب وحتى التعلم المعزز، باستخدام بنية تحتية مفتوحة بالكامل. من خلال تقديم معايير أداء منافسة لنماذج رائدة مفتوحة المصدر تم تدريبها على أجهزة Nvidia، تضع AMD نظامها البيئي كبديل عملي لنظام CUDA من Nvidia للبحث والتطوير في مجال الذكاء الاصطناعي على نطاق واسع .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
أعلنت AMD في 24 يوليو 2026 عن إطلاق نموذج Instella MoE، وهو نموذج لغوي ضخم مفتوح بالكامل بتقنية الخبراء المختلطة (MoE) يضم 16 مليار معلمة، ولا ينشط سوى 2.8 مليار معلمة لكل رمز.
أعلنت AMD في 24 يوليو 2026 عن إطلاق نموذج Instella MoE، وهو نموذج لغوي ضخم مفتوح بالكامل بتقنية الخبراء المختلطة (MoE) يضم 16 مليار معلمة، ولا ينشط سوى 2.8 مليار معلمة لكل رمز. تم تدريب النموذج بالكامل من الصفر على معالجات AMD Instinct من فئتي MI300X وMI325X باستخدام حزمة برامج ROCm المفتوحة، مما يجعله دليلاً عملياً على قدرة بنية AMD على منافسة نظام Nvidia CUDA في تطوير الذكاء الاصطناعي على...
يتميز النموذج بهندسة مبتكرة تشمل 'انتباه الرؤوس الكامنة المُبوّب' (Gated MLA) وتقنية 'التخطي الجماعي البعيد' (FarSkip Collective) التي ساهمت في تسريع عملية التدريب بنسبة 12.7%، بالإضافة إلى دعمه لسياق يصل إلى 64 ألف رمز.