في ٢٨ سبتمبر ٢٠٢٦، أتاحت هواوي شيفرتي openPangu 2.0 Training وopenPangu 2.0 RL للتدريب المسبق والضبط الدقيق والتعلّم المعزّز بعد التدريب على منظومة Ascend. يختلف الإصدار عن إتاحة أوزان Pro وFlash وشيفرات الاستدلال سابقًا: فهو يضيف أدوات للعمل على مراحل تدريب النماذج وتكييفها.
نشر بواسطةتم التحرير باستخدام GPT-6 Lunaتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What did Huawei open-source for openPangu-2.0 on September 28, 2026, and how does the new Ascend-native pretraining, supervised fine-tuning. Article summary: On September 28, 2026, Huawei open-sourced **Ascend-native code for openPangu-2.0 pretraining, supervised fine-tuning (SFT), and post-training reinforcement learning (RL)**. That is a training-stack release: the earlier . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
أعلنت هواوي في ٢٨ سبتمبر ٢٠٢٦ إتاحة شيفرات التدريب المسبق والضبط الدقيق المُراقَب (SFT) والتعلّم المعزّز بعد التدريب (RL) لعائلة openPangu-2.0، ضمن منظومة التدريب المعتمدة على معالجات Ascend. الجديد هنا ليس إصدار نموذج آخر فحسب، بل توفير شيفرات لمراحل من إعداد النماذج وتكييفها، بعدما ركزت الإصدارات السابقة من Pro وFlash على الأوزان وشيفرات الاستدلال لتشغيل النماذج. 1
2
27
يضم الإصدار مشروع openPangu-2.0-Training، ويدعم التدريب المسبق والضبط الدقيق المُراقَب، إلى جانب مشروع openPangu-2.0-RL المخصص للتعلّم المعزّز بعد التدريب. وكلاهما مصمم للعمل ضمن بيئة تدريب هواوي Ascend. 1
بعبارة أخرى، بات بإمكان المطورين العمل على مراحل تتجاوز تحميل نموذج جاهز وتشغيله للاستدلال. لكن الإعلان يوضح نطاق المشروعين العام، ولا يحدد وحده الموارد الحاسوبية أو البيانات أو الإعدادات اللازمة لإعادة إنتاج عمليات التدريب الأصلية. 1
يصف النموذجان بأنهما من فئة مزيج الخبراء (MoE)؛ وهي بنية لا تُفعّل فيها جميع المعلمات لكل رمز أثناء المعالجة. وهذه أبرز الأرقام المنشورة: 19
27
| النموذج | إجمالي المعلمات | المعلمات النشطة لكل رمز | نافذة السياق | رموز التدريب المسبق المُبلّغ عنها |
|---|---|---|---|---|
| openPangu-2.0-Pro | نحو ٥٠٥ مليارات | نحو ١٨ مليارًا | ٥١٢ ألف رمز | نحو ٣٤ تريليونًا |
| openPangu-2.0-Flash | نحو ٩٢ مليارًا | نحو ٦ مليارات | ٥١٢ ألف رمز | نحو ٣٤ تريليونًا |
رقم التدريب المسبق، نحو ٣٤ تريليون رمز، وارد لكل نموذج على حدة، وليس مجموعًا مشتركًا بينهما. 19
27
تصف بطاقتا Pro وFlash مرحلة ضبط دقيق مُراقَب تهدف إلى الجمع بين نمطي «التفكير البطيء» و«التفكير السريع»، تليها مراحل متعددة من التعلّم المعزّز المتخصص، ثم التقطير عبر السياسات على الإنترنت (OPD) لدمج القدرات. وهذه أوصاف لنهج ما بعد التدريب كما تعرضه بطاقات النموذج؛ أما إعلان سبتمبر فيتعلق بإتاحة شيفرات التدريب والتعلّم المعزّز. 19
27
1
تذكر البطاقات الجمع بين الانتباه الكامن متعدد الرؤوس (MLA) وطبقات انتباه DSA وSWA بنسبة ١ إلى ٢. وتتولى آلية الانتباه ذات النافذة المنزلقة (SWA) معالجة السياق المحلي، بينما تجمع طبقات DSA معلومات متباعدة عبر السياق. 19
27
كما تسرد البطاقات بنية mHC بأربعة مسارات، ووحدة تنبؤ متعدد الرموز (MTP) بثلاثة رؤوس، ومُحسِّن Muon. وهذه مواصفات تصميم مذكورة في بطاقات النماذج، وليست ميزات جديدة أعلن عنها إصدار الشيفرة في سبتمبر. 19
27
كانت الأوزان وشيفرات الاستدلال المنشورة تتيح للمطورين تشغيل نماذج Pro أو Flash المتاحة. أما الآن، فتضيف المشاريع شيفرات للتدريب المسبق والضبط الدقيق والتعلّم المعزّز بعد التدريب، ما يمنح مطوري Ascend مجالًا للعمل على مراحل إضافية من دورة حياة النموذج. ولا تفصّل المصادر كل سير عمل مدعوم أو متطلباته العتادية. 1
2
27
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
في ٢٨ سبتمبر ٢٠٢٦، أتاحت هواوي شيفرتي openPangu 2.0 Training وopenPangu 2.0 RL للتدريب المسبق والضبط الدقيق والتعلّم المعزّز بعد التدريب على منظومة Ascend.
في ٢٨ سبتمبر ٢٠٢٦، أتاحت هواوي شيفرتي openPangu 2.0 Training وopenPangu 2.0 RL للتدريب المسبق والضبط الدقيق والتعلّم المعزّز بعد التدريب على منظومة Ascend. يختلف الإصدار عن إتاحة أوزان Pro وFlash وشيفرات الاستدلال سابقًا: فهو يضيف أدوات للعمل على مراحل تدريب النماذج وتكييفها.
تذكر بطاقتا النموذج أن Pro يضم نحو ٥٠٥ مليارات معلمة، وFlash نحو ٩٢ مليارًا؛ ولكليهما نافذة سياق قدرها ٥١٢ ألف رمز ونحو ٣٤ تريليون رمز تدريب مسبق.