קוואלקום מציגה את ה-Hexagon NPU מהדור הבא כרכיב שמיועד להריץ בטלפון עצמו משימות AI ממושכות ורב-אופניות — ובעיקר סוכני AI. הכיוון הוא לשמור יותר מן העבודה על המכשיר, במקום להסתמך על ענן לכל שלב בתהליך. בלב השדרוג: חומרה חדשה לטרנספורמרים ומאגר זיכרון מקומי גדול יותר.
1
מה השתנה ב-Hexagon NPU?
החידוש המרכזי הוא Element Accelerator — בלוק עיבוד ייעודי לעומסי עבודה של טרנספורמרים. טרנספורמרים הם הבסיס למודלי שפה ולמערכות גנרטיביות ורב-אופניות רבות. המאיץ החדש אינו מחליף את יחידות העיבוד הקיימות, אלא פועל לצד משאבים סקלריים, וקטוריים ומבוססי טנזורים.
1
11
קוואלקום גם מציינת שהזיכרון המשותף של ה-NPU גדל ב-50% לעומת העיצוב הקודם. המטרה היא לשמור נתוני מודל שניגשים אליהם לעיתים קרובות קרוב ליחידת העיבוד, וכך לצמצם שליפות חוזרות מזיכרון המערכת בזמן שסוכן AI מטפל בהקשר ארוך, בכלים שונים ובכמה משימות במקביל. החברה טרם חשפה את הקיבולת המוחלטת של הזיכרון הזה.
1
5
הקשר ארוך יותר ועיבוד מהיר יותר של הבקשה
לפי קוואלקום, הארכיטקטורה המעודכנת תומכת בהקשר של עד 32,000 טוקנים וכוללת האצה ל-KV-cache. בפועל, הקשר גדול יותר מאפשר למודל לשמר חלק גדול יותר משיחה, מסמך או היסטוריית משימה במהלך שימוש מקומי במכשיר.
11
12
החברה טוענת גם לשיפור של עד 50% במהירות שלב ה-prefill במודלי INT4. Prefill הוא שלב עיבוד ההנחיה הראשונית, שבו המודל קורא את הבקשה ובונה את ההקשר לפני תחילת יצירת התשובה. לכן אין לפרש את הנתון כהבטחה למהירות יצירה גבוהה ב-50% של כל טוקן, בכל אפליקציה ובכל מודל. ה-NPU תומך בפורמטי דיוק הנעים בין INT2, INT4 ו-INT8 ועד FP8 ו-FP16.
1
6
30 מיליארד פרמטרים — עם הסתייגות חשובה
קוואלקום מדגישה תמיכה במודלי Mixture-of-Experts (MoE) עם עד 30 מיליארד פרמטרים בסך הכול. בדוגמה שהציגה, מופעלים בערך 3 מיליארד פרמטרים לכל טוקן.
6
ההבדל הזה מהותי: במודל MoE, מנגנון ניתוב בוחר רק חלקים מן המודל עבור טוקן או משימה מסוימים. לכן הטענה אינה אומרת שהטלפון מבצע חישוב על פני כל 30 מיליארד הפרמטרים בכל טוקן. היתכנות ההרצה תלויה בהפעלה הסלקטיבית של ה"מומחים", במודל הספציפי, ביישום ובתצורת המכשיר.
1
13
חלק ממערך של שלושה מנועי עיבוד
ההכרזה על ה-NPU מצטרפת לפרטים שכבר פרסמה קוואלקום על המעבד והמאיץ הגרפי בפלטפורמת Snapdragon הבאה. מעבד ה-Oryon בעל שמונה הליבות צפוי לכלול שתי ליבות Prime בתדר של עד 5GHz ושש ליבות Performance. ארכיטקטורת FlexCache אמורה לאפשר לליבות ההטרוגניות גישה למאגר מטמון משותף שמוקצה באופן דינמי לפי עומס העבודה.
21
22
בצד הגרפי, קוואלקום הכריזה על Adreno Matrix Cores ועל 18MB של Adreno High Performance Memory. טכנולוגיית Neural Fusion משלבת עיבוד נוירוני, שיפור רזולוציה בעזרת AI ויצירת פריימים בצינור הגרפי. קוואלקום אומרת שהטכנולוגיה עשויה להפחית את צריכת החשמל בעד 40% בעומסי רינדור מתאימים; זו טענת יצרן, ולא תוצאת מבחן בלתי תלוי.
17
23
כך מציגה קוואלקום את חלוקת העבודה ב-AI מקומי:
- Hexagon NPU: הסקה יעילה של מודלי AI ועומסי עבודה בסגנון סוכנים.
- Oryon CPU: הרצה כללית, לוגיקת אפליקציה ומשימות שאינן מתאימות היטב למאיץ ייעודי.
- Adreno GPU: עיבוד מקבילי ל-AI חזותי וגרפי, לרבות רינדור שמסתייע ב-AI.
המסר אינו שכל יכולת AI בטלפון תרוץ דווקא על ה-NPU. קוואלקום מתארת את המעבד, ה-GPU וה-NPU כמנועים משלימים, שיצרניות מכשירים יכולות לשלב ביניהם בחוויות AI מקומיות שונות.
מה עדיין לא ידוע?
מדובר בהצצה לארכיטקטורה, ולא במפרט מלא של פלטפורמה. Snapdragon Summit של קוואלקום מתוכנן להתקיים בין 22 ל-24 בספטמבר במאווי, הוואי.
31
עד לאירוע, כדאי להתייחס לפרטים שנחשפו כאל הצהרת כיוון טכנולוגית ולא כאל תמונת ביצועים שלמה. קוואלקום עדיין לא מסרה את קיבולת הזיכרון המשותף בפועל, וגם לא פרסמה תוצאות מלאות וניתנות לאימות בלתי תלוי לגבי הביצועים והיעילות של ה-NPU החדש.
5 ההכרזות באירוע אמורות להבהיר כיצד היכולות האלה יוגדרו במוצרי Snapdragon בפועל — ועד כמה הן יתורגמו לטלפונים שיגיעו לשוק.