קוואלקום מכוונת קודם כול לכלכלת ההסקה של AI: ארכיטקטורת HBC, שצפויה להגיע למסחור בדור הראשון ב 2027, נועדה לצמצם את עלות והאנרגיה של העברת משקלי מודלים בזיכרון. האסטרטגיה משלבת מחשוב קרוב לזיכרון, מאיץ Dragonfly, מעבד השרתים C1000, תוכנות Mojo ו MAX של Modular, יכולות RISC V ושיתוף פעולה עם Hugging Face למסלול מהענן...
Research answer

Create a landscape editorial hero image for this Studio Global article: How is Qualcomm’s multi-year AI infrastructure strategy designed to challenge Nvidia’s data-center dominance, and what are the roles, techni. Article summary: Qualcomm’s strategy is to compete where Nvidia is most exposed: the cost, power, and memory-bandwidth limits of large-scale AI inference rather than only peak training performance. It combines a near-memory accelerator r. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
קוואלקום מנסה לתקוף את אחת מנקודות התורפה של תשתיות ה-AI: העלות וההספק הנדרשים להעברת משקלי מודלים גדולים בין הזיכרון למעבד בזמן הסקה. הפתרון שלה אינו תחליף יחיד ל-GPU של אנבידיה, אלא פלטפורמת Dragonfly רחבה המשלבת מחשוב קרוב לזיכרון, מעבדי שרתים, תקשורת, תוכנה ניידת ופריסה מהענן ועד התקני הקצה.
הרכיב המרכזי הוא High Bandwidth Compute, או HBC. קוואלקום טוענת כי HBC עשויה לשפר את רוחב הפס האפקטיבי ואת היעילות של יצירת טוקנים באמצעות הצבת יחידת חישוב מתחת למבנה של זיכרון LPDDR מוערם. מדובר בארכיטקטורה שאפתנית, אך ההוכחה המכרעת תגיע רק בהמשך: חומרה בייצור, מבחני ביצועים בלתי תלויים, ביצועי שרשרת האספקה ופריסות אצל לקוחות.
בהסקה אוטורגרסיבית, המערכת קוראת שוב ושוב נתוני מודל מהזיכרון כאשר היא מייצרת כל טוקן חדש. לכן העברת נתונים, צריכת האנרגיה של הגישה לזיכרון והשהיה הופכות לגורמים מרכזיים בכלכלת ההפעלה של מודלים גדולים. תכנון HBC של קוואלקום מקרב את החישוב לנתונים באמצעות הצמדת שבב חישוב מתחת לזיכרון LPDDR מוערם וחיבור השכבות באמצעות מעברי סיליקון צפופים (TSV). 2
4
5
ההבחנה הזו חשובה. קוואלקום אינה טוענת בפשטות של-LPDDR יש רוחב פס שיא קונבנציונלי גבוה יותר מכל מערכת HBM. הטענה היא שפעולות מסוימות יכולות להתבצע בתוך המארז, וכך לצמצם את העברת הנתונים בין הזיכרון למעבד הראשי ולהגדיל את רוחב הפס האפקטיבי בעומסי הסקה מתאימים. 2
9
קוואלקום אומרת כי הדור הראשון של HBC, המזוהה עם Dragonfly AI250, מתוכנן לספק 133 טרה-בייט לשנייה של רוחב פס זיכרון אפקטיבי לכל כרטיס — שיפור של פי 18 לעומת AI200 עם LPDDR5X. 4 דיווחים אחרים מתארים את טענת החברה ליתרון של עד פי שישה ברוחב הפס לכל ואט לעומת מימושי HBM הנוכחיים.
8
13
עם זאת, יש לפרש את המספרים בזהירות. רוחב פס אפקטיבי, רוחב פס ברמת כרטיס, רוחב פס ברמת ארון ורוחב הפס של ערימת HBM בודדת הם מדדים שונים. השוואה בין מאות טרה-בייט לשנייה לבין נתון של ערימת HBM יחידה אינה מבחן ביצועים זהה-בתנאים. לכן יש להתייחס למספרים של קוואלקום בשלב זה כלטענות ארכיטקטוניות ולחישובי ביצועים לוואט, עד שיתפרסמו מבחנים בלתי תלויים של קצב טוקנים.
קוואלקום מתכננת את שכבת החישוב ומבצעת את אינטגרציית המערכת, בעוד שסמסונג אלקטרוניקס ו-SK hynix צפויות, לפי דיווחים, להצטרף למאמץ HBC כשותפות זיכרון. לפי חלוקת העבודה שדווחה, חלק ניכר מתהליך הערימה והעבודה על הזיכרון יבוצע אצל הספקיות, כאשר גם אריזה מתקדמת תהיה גורם משמעותי במערכת הכוללת. 1
5
משמעות הדבר היא ש-HBC הוא הימור על אריזה וייצור לא פחות משהוא הימור על תכנון מעבד. ההצלחה המסחרית תהיה תלויה בהסמכת הזיכרון, בתפוקת הרכבה תלת-ממדית, בהתנהגות התרמית, בבדיקות וביכולת לייצר מספיק מערכות במחיר מתקבל על הדעת. גם ארכיטקטורה משכנעת על הנייר עלולה לא לעמוד בתחרות אם המגבלות האלה ימנעו פריסה אמינה וכלכלית.
מפת הדרכים המוצהרת של קוואלקום מציבה את המסחור של הדור הראשון של HBC ב-2027 ואת הדור השני ב-2028. 1
4 לכן מדובר במעבר פלטפורמה שיימשך כמה מחזורי מוצר — לא בהחלפה מיידית של חומרת אנבידיה שכבר מותקנת במרכזי נתונים.
קוואלקום מציגה את Dragonfly כתיק מוצרים מלא למרכזי נתונים, ולא כמאיץ עצמאי. מפת הדרכים כוללת מערכות להסקת AI, טכנולוגיית HBC, את מעבד השרתים C1000, פתרונות תקשורת ושירותי תכנון שבבים מותאמים אישית. 15
16
Dragonfly C1000 הוא מעבד שרתים המבוסס על שבבים מודולריים, ומיועד ל-AI סוכני, לעומסי עבודה כלליים ולצומתי ניהול של מערכות AI. 7 קוואלקום ו-Meta הכריזו על שיתוף פעולה רב-דורי במעבדים, כאשר ייצור הדור הראשון של C1000 מתוכנן למחצית השנייה של 2028.
18
זהו איתות משמעותי לאימות מצד לקוח, אך אין להפריז במשמעותו. ההסכם הופך את Meta ללקוח מעבדים שהוכרז בפומבי ומעניק לקוואלקום נתיב לצי השרתים של ענקית ענן. עם זאת, הוא אינו מוכיח כשלעצמו ש-Meta תפרוס מאיצי HBC בהיקפים גדולים. החלטה כזו תלויה עדיין בביצועים, באמינות, בתמיכה התוכנתית, באספקה, בתקשורת ובעלות הבעלות הכוללת.
חומרה לבדה כנראה לא תספיק כדי לערער פלטפורמת AI מבוססת. רכישת Modular מעניקה לקוואלקום את שפת התכנות Mojo ואת פלטפורמת התוכנה MAX, כחלק מאסטרטגיה שמטרתה לתמוך ב-AI גנרטיבי וב-AI סוכני בסביבות מרכזי נתונים וקצה. 19
המטרה האסטרטגית היא ניידות: מפתחים יוכלו להעביר מודלים ועומסי עבודה בין מעבדים הטרוגניים, בלי לבנות מחדש כל רכיב של מחסנית התוכנה עבור ספק יחיד. Modular קידמה גם אקוסיסטם פתוח, ודיווחים מכנס החברה ב-2026 מסרו כי Mojo והקומפיילר שלה נפתחו במלואם בקוד פתוח. 46
מהלך כזה עשוי להפחית את עלות המעבר עבור לקוחות שבוחנים חומרה של קוואלקום לצד אנבידיה, AMD ומאיצים אחרים. עם זאת, הוא אינו משחזר באופן אוטומטי את העומק של ספריות CUDA, כלי הפיתוח, ההיכרות של המפתחים והניסיון המצטבר של אנבידיה בייצור. טענות על שיפורי ביצועים גדולים לעומת מימושים מקוריים צריכות להישאר בגדר ציפיות, אלא אם יתמכו במבחנים שקופים וניתנים לשחזור.
קוואלקום מרחיבה במקביל גם את אסטרטגיית המעבדים שלה באמצעות RISC-V. הרכישה המתועדת היא של Ventana Micro Systems, ולא של החברה בעלת השם השונה שהוזכרה בשאלת המחקר המקורית. קוואלקום אומרת ש-Ventana מחזקת את יכולות ההנדסה שלה ואת פעילותה סביב תקן ואקוסיסטם RISC-V. 23
54
שיתוף הפעולה של קוואלקום עם Hugging Face נועד להביא עומסי עבודה של Hugging Face למערכות Dragonfly במרכזי נתונים, לתמוך בקליטת מודלים ולאפשר תזמור היברידי בין התקנים למרכזי נתונים. 21
המהלך תומך במיצוב הרחב יותר של קוואלקום: אותה חברה מבקשת לספק פתרונות למרכזי נתונים, לטלפונים, להתקנים משובצים ולמערכות AI פיזיות. היתרון האפשרי הוא מסלול פריסה רציף יותר מתשתית ענן ועד התקני קצה. האתגר הוא שתיק מוצרים רחב יהפוך לחלופה משמעותית לאנבידיה רק אם מפתחים יוכלו לפרוס עליו מודלים אמיתיים בקלות, ואם מפעילים יראו כלכלה טובה יותר בייצור.
הגישה של קוואלקום משתלבת במאמץ רחב יותר בתעשייה לצמצם את כמות הנתונים שצריכה לנוע בין הזיכרון לחישוב.
LPDDR5X-PIM של סמסונג מוסיף לוגיקת עיבוד לזיכרון DRAM חסכוני, כך שפעולות מסוימות יכולות להתבצע קרוב יותר לנתונים המאוחסנים. סמסונג דיווחה על קצב הסקה גבוה משמעותית לעומת LPDDR5X רגיל בהדגמות שלה; סיקור בלתי תלוי של הצגת Hot Chips תיאר 81.3 טוקנים לשנייה לעומת 27 טוקנים לשנייה בהשוואה שצוטטה. 31
36
39
SK hynix ניגשת לאותה בעיה מצד ה-HBM. עבודתה על חיבור היברידי ועל iHBM מתמקדת באתגרי החום והצפיפות שנוצרים ככל שערימות הזיכרון נעשות גבוהות יותר ורוחב הפס גדל. 32 דיווח נפרד מסר כי החברה אינה מצפה שחיבור היברידי יהיה מוכן ל-HBM4E, ולכן המעבר עשוי להידחות לדור HBM מאוחר יותר.
40
במקביל, סמסונג דיווחה על דגימות HBM4E עם רוחב פס של עד 3.6 טרה-בייט לשנייה לערימה ומהירויות פינים של עד 16 גיגה-ביט לשנייה. 41 מפת הדרכים המתפתחת של HBM חשובה כאן: HBC לא תתחרה בגרסה קפואה של HBM מ-2025 או מ-2026, אלא בטכנולוגיות זיכרון שממשיכות להשתפר.
הראיות שסופקו אינן מבססות את הטענות הספציפיות יותר לגבי התקן MX1 של סמסונג המבוסס על CXL, אימוץ מצד DeepX או אזהרה מדויקת של Micron על החמרת צווארי הבקבוק. לכן אין להתייחס לפרטים אלה כמאומתים בניתוח הזה.
לאסטרטגיה של קוואלקום יש היגיון ברור:
גם הסיכונים ברורים. HBC צריכה להגיע לייצור עם תפוקות והרכבה תרמית סבירות. קוואלקום תצטרך לפרסם השוואות אמינות וממוקדות בעומסי עבודה, שיבדילו בין רוחב פס אפקטיבי לבין רוחב פס גולמי של ממשק. מחסנית הקומפיילר וזמן הריצה שלה חייבים לתמוך במודלים אמיתיים ובאופן יציב. שותפות הזיכרון צריכות לספק את הטכנולוגיה בקנה מידה, והלקוחות יצטרכו להשתכנע שהתועלת מצדיקה אימוץ של פלטפורמה נוספת לצד CUDA.
השורה התחתונה: קוואלקום תכננה ארכיטקטורה חלופית סבירה, שמכוונת לאחד האילוצים החשובים ביותר בתשתיות AI — תנועת נתונים בזמן הסקה. אבל לפי מפת הדרכים הנוכחית, HBC היא עדיין אתגר עתידי ולא תחליף מוכח לשליטה של אנבידיה במרכזי הנתונים. נקודות המבחן המרכזיות יהיו חומרת HBC מהדור הראשון ב-2027, תחילת הייצור המתוכננת של C1000 במחצית השנייה של 2028, ואימות בלתי תלוי מצד לקוחות לגבי ביצועים ועלות הבעלות הכוללת.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
קוואלקום מכוונת קודם כול לכלכלת ההסקה של AI: ארכיטקטורת HBC, שצפויה להגיע למסחור בדור הראשון ב 2027, נועדה לצמצם את עלות והאנרגיה של העברת משקלי מודלים בזיכרון.
קוואלקום מכוונת קודם כול לכלכלת ההסקה של AI: ארכיטקטורת HBC, שצפויה להגיע למסחור בדור הראשון ב 2027, נועדה לצמצם את עלות והאנרגיה של העברת משקלי מודלים בזיכרון. האסטרטגיה משלבת מחשוב קרוב לזיכרון, מאיץ Dragonfly, מעבד השרתים C1000, תוכנות Mojo ו MAX של Modular, יכולות RISC V ושיתוף פעולה עם Hugging Face למסלול מהענן לקצה.
ההסכם שהוכרז עם Meta הוא איתות חשוב לזכייה בתכנון מעבד, אך אינו מוכיח שמאיצי HBC של קוואלקום ייפרסו אצל ענקיות ענן בקנה מידה גדול.