המהלך של DeepSeek הוא יותר מהוספת תמיכה בשבב חדש: ב-30 בספטמבר 2026 החברה פתחה שש גרסאות של רכיבי תשתית עבור פלטפורמת Ascend של Huawei — מתכנות ליבות חישוב ועד תקשורת בין מאיצים. אבל התאמה בין רכיבי תוכנה אינה הוכחה לביצועים שווים, והנתונים שפורסמו אינם מאשרים שאימון מלא של V4 בוצע על Ascend.
2
5
אילו רכיבים נפתחו?
הרכיבים מקבילים בתפקידם לכלים ש-DeepSeek פיתחה לפלטפורמת NVIDIA, אך המימוש עבור Ascend מותאם לחומרה ולממשקי התוכנה של Huawei.
2
5
- TileLang הוא כלי ברמה גבוהה לתכנות ולקומפילציה של ליבות חישוב — יחידות התוכנה שמבצעות פעולות חישוב על המאיץ. תמיכה ב-Ascend מאפשרת לפתח עבור החומרה הזו, אך לא אומרת שהקוד או הביצועים זהים לאלה של NVIDIA.
2
5
- DeepGEMM היא ספרייה לחישובי כפל מטריצות. גרסת Ascend שומרת על תאימות API ותומכת ב-BF16, ב-FP8 וב-FP4, וכן ב-MQA logits וב-MegaMoE. לפי הפרויקט, היא משתמשת גם באופטימיזציות ייעודיות ל-Ascend, ובהן טעינת נתונים דלילה וצינור עיבוד מבוסס coroutines.
17
- TileKernels מספקת ליבות חישוב כלליות; FlashMLA כוללת ליבות attention דליל לשלב מילוי ההקשר ולשלב הפענוח ב-Ascend 950; ו-DeepSelect משמשת לבחירה או לסינון נתונים.
9
14
44
- DeepEP מטפלת בתקשורת מבוזרת בין מאיצים, לרבות העברה ואיחוד נתונים במסגרת expert parallelism. ממשקי ה-buffer הציבוריים שלה תואמים לאלה של גרסת NVIDIA, אך המימוש ל-Ascend נשען על רכיבי תוכנה וממשקי חומרה ייעודיים לפלטפורמה.
19
לתאימות ממשקים יש ערך למפתחים שעובדים עם כמה פלטפורמות. עם זאת, תאימות API או דמיון בתפקיד אינם מעידים על זהות פנימית, על תמיכה זהה בכל התכונות או על מהירות דומה.
מה מלמדים נתוני Ascend 950?
בבדיקת DeepEP על חומרת Ascend דווח על 375 GB/s בפעולת dispatch ועל 347 GB/s בפעולת combine. אלה נתוני תקשורת שנמדדו על Ascend — לא תוצאות של השוואה ישירה מול NVIDIA.
19
47
בדיקת היסק מדווחת של DeepSeek-V4.1-Flash נערכה במצב לא מקוון על מערכת Ascend 950 UBL128, בתצורת EP32 ובהקשר של 128K. לפי הדיווח, התוצאות היו 2,469 טוקנים שנוצרו בשנייה לכל כרטיס כאשר זמן יצירת הטוקן היה 5 מילישניות (TPOT), ו-5,102 טוקנים בשנייה לכל כרטיס כאשר TPOT היה 10 מילישניות. הנתונים אינם כוללים את התקורה של תזמון בקשת השירות ואת איזון העומסים של המסגרת התוכנתית.
47
חשוב לקרוא את המספרים כנתוני בדיקה של תצורה מסוימת, ולא כהבטחה לביצועים בכל עומס. מאגר DeepEP מתאר את המדידות ככאלה שנעשו עם חבילת פיתוח חומרה ניסיונית (PoC HDK) שהוגדרה ידנית. דיווח נוסף מציין שהבדיקות השתמשו בקושחת PoC, ומזכיר שחרור מסחרי שתוכנן לאזור 15 באוקטובר. כלומר, לקושחה ולמערכת הבדיקה יש חשיבות כשמנסים לפרש או לשחזר את התוצאות.
12
19
הדיווחים שסופקו אינם כוללים מספיק פרטים כדי לשחזר באופן עצמאי את כל הגדרות ההיסק, ואינם מציגים אימות עצמאי רחב היקף של צד שלישי. לכן אין לראות במספרים השוואה מאומתת מול מערכות NVIDIA.
47
רשת SuperPoD Flex ו-UBL128: תכנון, לא הוכחת אימון
Huawei ו-DeepSeek תיארו תכנון משותף למערכת SuperPoD Flex / UBL128 המבוססת על Ascend 950. לפי הדיווחים, רשת ה-scale-up המתוכננת כוללת 128 כרטיסים ורשת חד-שלבית של 3.2 Tbps; תכנון ה-scale-out הדו-שלבי מיועד לאפשר הרחבה עד 256,000 כרטיסים. זו יכולת שמיוחסת לתכנון — לא ראיה שמערכת בגודל הזה הריצה אימון של DeepSeek.
10
47
49
Huawei מסרה גם כי תוצאות העבודה המשותפת יונגשו דרך קהילת CANN, סביבת התוכנה הפתוחה של החברה. לפי הדיווחים, החומרים עוסקים בפריסת מודלים, באימון בקנה מידה גדול, בניהול מאגרי KV cache להקשרים ארוכים ובחיזוק ללמידה של סוכנים.
14
השורה התחתונה: התקדמות בתוכנה, פער בראיות
הפרסום מצביע על כך ש-DeepSeek הרחיבה את סביבת התוכנה שלה לתמיכה ב-Ascend, ונתוני ההיסק מדגימים תצורה מסוימת שבה המודל הורץ על החומרה. אבל לא התאמת הרכיבים ולא תכנון רשת ההתרחבות מוכיחים שאימון מלא של V4 בוצע על Ascend. גם הנתונים שפורסמו אינם מראים ביצועים שקולים ל-NVIDIA: מדובר בחומרה שונה, ואין בדיווחים שסופקו בדיקה מותאמת בין הפלטפורמות.
2
5
19
47
הקריאה הזהירה היא ש-DeepSeek פרסמה כלי תוכנה משמעותיים ל-Ascend, ו-Huawei הציגה ארכיטקטורת מערכת ותוצאות בדיקה נבחרות. עדיין לא ידוע עד כמה התוצאות האלה מייצגות עומסי עבודה אחרים — או כיצד Ascend משתווה ל-NVIDIA במבחן מבוקר.