Huawei פרסמה קוד המותאם למערכת Ascend עבור אימון מקדים, כוונון עדין מפוקח (SFT) ולמידת חיזוק לאחר האימון (RL). עד כה פורסמו משקולות וקוד הסקה לדגמי Pro ו Flash; המיזמים החדשים מיועדים גם לשלבי האימון וההתאמה של המודלים.
פורסם על ידינערך באמצעות GPT-6 Lunaהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Huawei open-source for openPangu-2.0 on September 28, 2026, and how does the new Ascend-native pretraining, supervised fine-tuning. Article summary: On September 28, 2026, Huawei open-sourced **Ascend-native code for openPangu-2.0 pretraining, supervised fine-tuning (SFT), and post-training reinforcement learning (RL)**. That is a training-stack release: the earlier . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Huawei הודיעה ב-28 בספטמבר 2026 על פרסום קוד פתוח לאימון מקדים, לכוונון עדין מפוקח (SFT) וללמידת חיזוק לאחר האימון (RL) עבור משפחת openPangu-2.0. החידוש הוא בהיקף הכלים הזמינים: פרסומים קודמים כללו משקולות מודל וקוד הסקה, שאפשרו להריץ את דגמי Pro ו-Flash; כעת נוספו גם פרויקטים שעוסקים בשלבי האימון וההתאמה שלהם, בסביבת Ascend של Huawei. 1
2
27
הפרויקט openPangu-2.0-Training מיועד לאימון מקדים ול-SFT, ואילו openPangu-2.0-RL מתמקד בלמידת חיזוק לאחר האימון. שני הפרויקטים פותחו עבור מערכת האימון המבוססת על מאיצי Ascend של Huawei. 1
כלומר, זו אינה רק הפצה של נקודת ביקורת נוספת של מודל, אלא פרסום של קוד המיועד לעבודת אימון. עם זאת, עצם פרסום הקוד אינו מלמד מה נדרש כדי לשחזר במדויק את ריצות האימון המקוריות מבחינת מחשוב, נתונים או הגדרות. 1
כרטיסי המודל מתארים את שני הדגמים כמודלים מסוג תערובת מומחים (MoE). הנתונים המדווחים הם: 19
27
| מודל | מספר פרמטרים כולל | פרמטרים פעילים לכל טוקן | חלון הקשר | טוקנים מדווחים באימון המקדים |
|---|---|---|---|---|
| openPangu-2.0-Pro | כ-505 מיליארד | כ-18 מיליארד | 512 אלף טוקנים | כ-34 טריליון |
| openPangu-2.0-Flash | כ-92 מיליארד | כ-6 מיליארד | 512 אלף טוקנים | כ-34 טריליון |
אלה הנתונים שמופיעים עבור כל אחד מהדגמים. היקף האימון המדווח הוא כ-34 טריליון טוקנים לכל מודל בנפרד, ולא סכום משותף לשניהם. 19
27
כרטיסי Pro ו-Flash מתארים שלב SFT שנועד לאחד יכולות של חשיבה איטית ומהירה. אחריו מתוארים כמה שלבי למידת חיזוק ייעודיים, וכן זיקוק מדיניות מקוון (OPD) שנועד לשלב את היכולות. 19
27
אלה פרטים על תהליך האימון כפי שהוא מתואר בכרטיסי המודל. הם נפרדים מההודעה החדשה על פרסום קוד האימון וה-RL. 19
27
1
כרטיסי המודל מתארים שילוב של מנגנון הקשב הרב-ראשי החבוי (MLA) עם שכבות DSA ו-SWA, ביחס של 1:2. שכבות SWA מטפלות בהקשר מקומי באמצעות חלון נע, ואילו שכבות DSA מרכזות מידע רחוק יותר באופן דליל. 19
27
בין המאפיינים הנוספים שמצוינים בכרטיסים: ארכיטקטורת mHC בעלת ארבעה זרמים, מודול חיזוי רב-טוקני (MTP) עם שלושה ראשים, ואופטימייזר Muon. אלה מאפיינים שמופיעים בתיעוד הדגמים, ולא יכולות חדשות שהוכרזו כחלק מפרסום הקוד בספטמבר. 19
27
המשקולות וקוד ההסקה שפורסמו קודם אפשרו למפתחים להריץ את דגמי Pro ו-Flash. הפרויקטים החדשים מרחיבים את ארגז הכלים גם לאימון מקדים, ל-SFT ול-RL לאחר האימון, ולכן מאפשרים למפתחים העובדים עם Ascend להתנסות בשלבים נוספים במחזור החיים של המודל. המקורות מפרטים את המטרות הכלליות של הפרויקטים, אך לא את כל תהליכי העבודה הנתמכים או את דרישות החומרה שלהם. 1
2
27
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Huawei פרסמה קוד המותאם למערכת Ascend עבור אימון מקדים, כוונון עדין מפוקח (SFT) ולמידת חיזוק לאחר האימון (RL).
Huawei פרסמה קוד המותאם למערכת Ascend עבור אימון מקדים, כוונון עדין מפוקח (SFT) ולמידת חיזוק לאחר האימון (RL). עד כה פורסמו משקולות וקוד הסקה לדגמי Pro ו Flash; המיזמים החדשים מיועדים גם לשלבי האימון וההתאמה של המודלים.
לפי כרטיסי המודל, לשני הדגמים חלון הקשר של 512 אלף טוקנים וכ 34 טריליון טוקנים של נתוני אימון מקדים.