ה-WSE-3 Turbo מתואר כגרסה מואצת — או מוגברת תדר — של אותו עיצוב בסיסי. לפי המידע הזמין, הוא שומר על 900,000 הליבות, על 44 גיגה-בייט של SRAM ועל תהליך ייצור של 5 ננומטר, אך מגדיל את ביצועי ההפעלה .
Cerebras והדיווחים על ההשקה מציגים את הנתונים הבאים:
השוואה שפורסמה ב-The Register מציינת כי WSE-3 Turbo מגדיל את ביצועי ה-FP16 הדליל בכל פרוסה מ-125 ל-250 פטה-פלופס, את רוחב פס הזיכרון מ-21.6 ל-43.2 פטה-בייט לשנייה ואת רוחב פס הקלט-פלט מ-1.2 ל-2.4 טרה-ביט לשנייה. היא מציינת גם 25 פטה-פלופס של חישוב FP16 צפוף למעבד Turbo .
חשוב לזכור: אלה נתונים תאורטיים או נתונים שמקורם בדיווחי היצרן, ולא מדד אוניברסלי לביצועי יישומים. מספר הפטה-פלופס המרבי של ארון אינו מתורגם ישירות למספר הטוקנים לשנייה שכל מודל וכל תצורת שירות יפיקו בפועל.
במערכות המבוססות על GPU, עבודת המודל מפוזרת בדרך כלל בין מעבדים נפרדים. הגישה הזו יכולה להתרחב היטב, אך היא דורשת להעביר נתונים בין השבבים ולתאם את החישובים דרך שכבות של זיכרון, קישוריות ורשתות.
האסטרטגיה של Cerebras שונה: היא ממקמת מספר עצום של ליבות חישוב ומאגר SRAM גדול על מעבד יחיד. לפי החברה, ה-WSE-3 משתמש ב-SRAM ישירות על השבב, במקום להסתמך על זיכרון HBM חיצוני, כפי שנהוג במעבדי GPU . התועלת המיועדת היא הפחתת תקורת התקשורת בזמן פענוח — שלב יצירת התשובה טוקן אחר טוקן, שבו כל טוקן עלול להיות מושפע מעיכובים בגישה לזיכרון ובסנכרון.
לכן, נקודת המשיכה העיקרית של CS-4 היא מהירות התגובה למשתמש יחיד, בעיקר ביישומים אינטראקטיביים. זו תחרות ממוקדת יותר מול Nvidia, ולא הוכחה לכך שמערכות המבוססות על שבבים בקנה מידה של פרוסה עדיפות בכל משימת AI. אימון מודלים, הסקה באצוות גדולות, גודל המודל, דרישות הזיכרון ותאימות התוכנה עשויים לשנות את התמונה.
Cerebras משווקת את CS-4 כמערכת שמספקת הסקה מהירה עד פי 30 ממערכות GPU . הדיווחים על ההשקה מבהירים שההשוואה מתייחסת ל-מספר הטוקנים לשנייה למשתמש, ולא לשיפור כללי של פי 30 בכל עומס עבודה
.
ההבדל הזה משמעותי. כדי להשוות בין מאיצים באופן אמין, צריך לדעת לפחות:
המקורות שסופקו אינם כוללים את כל הפרטים הדרושים להשוואה שניתן לשחזר ולבקר באופן בלתי תלוי. לכן יש לקרוא את נתון פי 30 כ-טענה של Cerebras, המתייחסת לתנאי שירות מסוימים, ולא כיתרון מובטח מול כל פריסת Nvidia.
נתוני ביצועי שיא עלולים להטעות במיוחד כאשר הם מבוססים על חישוב דליל (sparse). ניתוח אחד מציין כי נתון ה-125 פטה-פלופס של WSE-3 ב-FP16 הוא נתון דליל, המבוסס על הנחת יחס דלילות לא-מובנית של 8:1. לפי הניתוח, קצב החישוב הצפוף המקביל הוא כ-15.625 פטה-פלופס .
אותו סייג רלוונטי גם לנתון של 250 פטה-פלופס דלילים עבור WSE-3 Turbo ולנתון של 25 פטה-פלופס צפופים . ביצועי שיא דלילים מועילים כאשר המודל וערימת התוכנה מסוגלים לנצל את תבנית הדלילות ביעילות. הם אינם מתארים אוטומטית את קצב העיבוד של מודל שפה גדול וצפוף.
בהסקה מעשית, המדדים החשובים יותר הם זמן תגובה מקצה לקצה, מספר הטוקנים לשנייה לאורך זמן, התפוקה ברמת מקביליות מוגדרת, צריכת החשמל והעלות לכל טוקן שנוצר. התוצאות עשויות להשתנות גם בהתאם לגודל מטמון ה-KV, לאופן חלוקת המודל בין המעבדים, לאצווה, ליחס בין prefill ל-decoding, לדחיסה ולבשלות סביבת ההרצה.
CS-4 מתוארת כמערכת הראשונה שנבנתה סביב ארכיטקטורת Nexus של Cerebras . לפי Reuters, המערכת צפויה להיות זמינה ברבעון השלישי של 2026, בעוד שבדיווחי ההשקה נאמר שהמשלוחים הראשונים יחלו כבר במהלך הרבעון הנוכחי
.
עם זאת, המקורות שסופקו אינם מאפשרים לאמת כל תכונה ארכיטקטונית שנקשרה ל-CS-4 בדיונים המוקדמים. בפרט, אין בהם אישור בלתי תלוי למימוש מודולרי המכונה "תרמיל" (backpack), לקישוריות דו-ממדית מסוג טורוס ללא מתגים, למאפייני הקירור וההספק המדויקים של הארון או לתוכנית מחייבת של קיבולת מצטברת. אין להציג את הטענות האלה כמפרטים סופיים של CS-4 ללא תיעוד חזק יותר.
ל-Cerebras יש שיתוף פעולה מתועד עם AWS בתחום ההסקה המפורקת (disaggregated inference). במודל הזה, מערכות Trainium של AWS מטפלות בשלב ה-prefill, ואילו מערכות CS-3 של Cerebras מטפלות בשלב ה-decoding. הרכיבים מחוברים באמצעות טכנולוגיית Elastic Fabric Adapter של אמזון וזמינים דרך Amazon Bedrock .
הדבר חשוב משום שהוא מדגים כיצד הארכיטקטורה של Cerebras יכולה להשלים מאיצים אחרים, ולא רק לנסות להחליף אותם. ל-prefill ול-decoding מאפייני ביצועים שונים, ולכן מערכת היברידית יכולה להקצות כל שלב לחומרה המתאימה לו יותר.
הדיווחים שסופקו מתארים גם תצורה משולבת של AMD ו-Cerebras, שבה מעבדי GPU של AMD מבצעים prefill ומעבדי Cerebras מבצעים decoding. מנהלי Cerebras אמרו שהתצורה עשויה להגדיל את התפוקה פי חמישה, כשהפריסה צפויה ברבעון הרביעי של 2026 . אלו טענות עתידיות של החברה, ולא תוצאות ייצור שאומתו באופן בלתי תלוי.
הראיות אינן מוכיחות ש-AWS או AMD התחייבו לפריסת CS-4 בהיקף מסוים. הן תומכות בקיומם של שיתופי פעולה ובעבודה מתוכננת על הסקה היברידית, אך לא מבטיחות שיפור תפוקה מסוים לכל לקוח.
עדיין לא. CS-4 היא אתגר ארכיטקטוני אמין בפלח צר יותר, אך בעל ערך מסחרי: פענוח מהיר של מודלי שפה גדולים עבור משתמשים אינטראקטיביים. המעבד בקנה מידה של פרוסה, ה-SRAM שעל גבי השבב ורוחב הפס הפנימי הגבוה נועדו לצמצם את עלויות התקשורת שנוצרות כאשר ההסקה מפוזרת על פני מעבדי GPU נפרדים .
אבל מעמדה של Nvidia אינו נקבע רק לפי מספרי ביצועי שיא. אקוסיסטם התוכנה, התמיכה במודלים, זמינות החומרה, הרשתות, עלות הבעלות הכוללת והיכולת להפעיל מגוון רחב של מודלים ועומסי עבודה חשובים לא פחות. גם טענת פי 30 של Cerebras זקוקה למבחני ביצועים זהים ומבוקרים לפני שאפשר להשתמש בה כאמירה כללית על דחיקת ה-GPU.
המסקנה הזהירה ביותר היא ש-CS-4 מרחיבה את מגוון האפשרויות לתשתיות הסקה של AI. היא עשויה להתאים במיוחד כאשר המטרה היא מהירות טוקנים לכל משתמש; השאלה אם תהיה מהירה או זולה יותר בפריסה מסוימת תלויה במודל, בעומס העבודה ובשיטת המדידה.