מה ההבדל בין Flash ל־FlashX?
GLM-5.3-FlashX היא דרך מהירה יותר להשתמש ב־GLM-5.3-Flash דרך ה־API של Zhipu AI, ולא השקה מתועדת של ארכיטקטורת מודל חדשה או של גרסת משקלים פתוחים נפרדת. מודל הבסיס, שפורסם כמודל פתוח, הוא מודל רב־אופני מסוג „תערובת מומחים”: יש בו 320 מיליארד פרמטרים בסך הכול, מהם 18 מיליארד פעילים בכל הפעלה, ולפי החברה הוא תומך בחלון הקשר של מיליון טוקנים.
1
4
7
Zhipu מפרסמת ל־FlashX מהירות של עד 200 טוקנים בפלט לשנייה. זהו נתון מרבי מטעם החברה, לא מדידה עצמאית של קצב מתמשך, וגם לא הוכחה ש־FlashX מהירה יותר ממודל הבסיס כאשר שניהם נבדקים באותם תנאים.
1
4
איך Zhipu מסבירה את השיפור?
לדברי החברה, תעבורת הייצור של Flash פועלת על יותר מ־100 אלף מאיצי AI מתוצרת סין. היא מספרת כי Infra Agent — סוכן תוכנה המבוסס על GLM-5.3 — סייע לאתר צווארי בקבוק, לשנות קוד ולייעל את המערכת שמגישה תשובות למשתמשים. בין השיפורים שתוארו: טיפול בעומס בהעברת KV, כלומר נתונים שהמערכת שומרת במהלך יצירת התשובה, ושיפור רכיב חישוב בשלב הפענוח.
6
7
Zhipu מייחסת למהלך עלייה של פי 3.2 בתפוקה מקצה לקצה לעומת נקודת ההתחלה, בתוך פחות משבועיים. כאן חשוב להבחין בין שני המדדים: תפוקה היא כמות העבודה שהמערכת מסוגלת לעבד, ולא מספר הטוקנים שמשתמש יחיד מקבל בכל שנייה.
6
13
יעיל להפעלה — אבל יקר יותר לרכישה
Zhipu טוענת שניצול החומרה ועלות ההגשה לטוקן דומים לאלה של מערכות המבוססות על מעבדים גרפיים נפוצים של Nvidia. הדיווחים המצוטטים אינם מספקים ביקורת עצמאית שמשווה בין המערכות בתנאים זהים.
6
7
גם עלות ההפעלה לחברה אינה מחיר ה־API ללקוח: המחירון המפורסם מציג ל־FlashX מחיר של 0.37 דולר למיליון טוקנים בקלט ו־1.25 דולר למיליון טוקנים בפלט, לעומת 0.15 ו־0.50 דולר, בהתאמה, ל־Flash. כלומר, מחיר טוקני הפלט של FlashX גבוה פי 2.5.
4
5
מה עדיין צריך לאמת? בדיקות עצמאיות תחת עומס צריכות לבחון אם קצב של 200 טוקנים לשנייה נשמר לאורך זמן, וכן את זמני התגובה והאמינות כשמשתמשים רבים פונים לשירות במקביל. דרוש אימות גם למספר המאיצים ולהיקף התעבורה שהם משרתים, לתרומה של ה־Infra Agent ביחס לעבודת המהנדסים, לנקודת ההשוואה של השיפור בתפוקה ולהשוואת העלויות מול Nvidia. לעת עתה, חלק ניכר מהנתונים האלה מגיע מ־Zhipu ולא ממדידה בלתי תלויה.
1
6
7
13