בכנס AICC2026 הציגה Inspur Information שתי מערכות לשני צרכים שונים: MetaBrain SD200 Ultra מיועדת להרצת מודלים גדולים במיוחד וליישומי סוכני AI הרגישים לזמן תגובה; MetaBrain HC2000 מכוונת להגדלת תפוקת הטוקנים בעומסי הסקה. מספרי הביצועים שפורסמו עבורן הם טענות של Inspur, לא תוצאות של מבחן עצמאי.
3
18
20
מה יש ב־SD200 Ultra?
לפי Inspur, המערכת מחברת 128 מאיצי AI מתוצרת מקומית בארכיטקטורת 3D Hyper Mesh. היא כוללת 8 טרה־בייט של זיכרון מאיצים עם מרחב כתובות אחוד ו־64 טרה־בייט של זיכרון מערכת. החברה טוענת שמכונה אחת יכולה להריץ את Kimi K3, מודל בעל 2.8 טריליון פרמטרים, ולתמוך במודלים של עד 10 טריליון פרמטרים. המספר הגבוה יותר מתאר קיבולת נטענת — לא מהירות הסקה שהוכחה במודל בגודל כזה.
3
17
עבור Kimi K3 מדווחת Inspur על פחות מ־5.85 אלפיות השנייה ליצירת טוקן — נתון שהיא מציגה כשווה ערך לכ־170 טוקנים בשנייה למשתמש יחיד, ופי חמישה מ״ממוצע הענף״. המקורות אינם מפרטים די הצורך את תנאי הבדיקה ואת בסיס ההשוואה כדי לראות בכך השוואת ביצועים שקולה. חשוב גם להבחין בין זמן יצירת טוקן לבין הזמן עד להופעת הטוקן הראשון, או הזמן עד לקבלת תשובה מלאה.
1
3
איך הארכיטקטורה אמורה לקצר זמני המתנה?
Inspur אומרת שמרחב הכתובות האחוד ותקשורת המבוססת על גישה ישירה לזיכרון מצמצמים העברות נתונים בין שבבים. לפי החברה, גישת הזיכרון הסימטרית מאפשרת למאיץ לגשת ישירות לזיכרון של מאיץ אחר; היא מדווחת על שיהוי תקשורת נמוך עד 0.69 מיקרו־שנייה ועל קיצור פי 3.5 בזמן תקשורת AllReduce. אלה מדדי תקשורת בתוך המערכת, ולא זמני תגובה של יישום למשתמש.
2
17
Inspur מדווחת גם על התאמות ייעודיות להסקה ב־Kimi K3: איחוד פעולות הקשורות ל־KDA, ל־Gated MLA ול־MoE לפעולות גדולות המשלבות חישוב ותקשורת. לטענתה, כך מספר הפעולות קטן בערך פי עשרה וביצועי ההסקה השתפרו ביותר מפי שלושה. אין להסיק מכך שיפור דומה במודלים אחרים.
17
19
ומה מציעה HC2000?
ה־HC2000 מיועדת להגדלת תפוקת ההסקה. היא משלבת ארון מקורר בנוזל, ארכיטקטורת DirectCom 2.0 ותוכנת הסקה MCIS. Inspur טוענת לתפוקת טוקנים גבוהה פי עשרה באותה השקעה. זו טענה על תפוקה ועל כדאיות כלכלית, לא הבטחה לזמן יצירת טוקן של משתמש יחיד כמו זה שדווח עבור SD200 Ultra. כדי לבחון אותה נדרשים עומס עבודה, נקודת ייחוס וגבולות עלות מוגדרים.
18
20
לפני החלטת רכישה, כדאי לבקש מ־Inspur לזהות את יצרן המאיצים — שלא צוין בדיווחים — ולפרט את התמיכה בתוכנה. יש להריץ בדיקות שניתן לשחזר על המודלים המיועדים לשימוש, תוך ציון דיוק החישוב, אורך ההקשר ומספר המשתמשים במקביל. המדדים החשובים הם זמן עד לטוקן הראשון, תפוקה מתמשכת, צריכת חשמל ועלות כוללת. בלי התנאים האלה, נתוני ההשקה אינם מנבאים באופן אמין את הביצועים בהטמעה בפועל.
1
3
18