ב-26 באוגוסט 2026 הסתיימה התעלומה: Z.ai אישרה כי Ox Alpha, המודל האלמוני שהוצע דרך OpenRouter ו-OpenCode, היה למעשה GLM-5.3-Flash. החברה מציגה אותו כמודל המולטימודלי הראשון ממשפחת GLM-5, עם משקלים פתוחים, חלון הקשר של כמיליון טוקנים והתמקדות בתכנות ובמשימות ארוכות של סוכני AI.
15
40
אבל הסיפור החשוב אינו רק זהותו של המודל. Ox Alpha שילב גישה חינמית ואנונימית עם שימוש נרחב מצד מפתחים, ולאחר מכן הפך למוצר רשמי שניתן להורדה ולשימוש בתשלום. כך קיבלה Z.ai הזדמנות לבחון את התשתית שלה בעומסים אמיתיים — ובמקביל ליצור עניין סביב ההשקה.
מה Z.ai השיקה
GLM-5.3-Flash הוא מודל Mixture of Experts, או MoE: מודל הכולל 320 מיליארד פרמטרים בסך הכול, אך מפעיל 18 מיליארד פרמטרים בלבד עבור כל טוקן. הוא מקבל באופן טבעי טקסט, תמונות וסרטונים, ומפיק טקסט. קיבולת ההקשר המוצהרת היא כמיליון טוקנים, אם כי הגבול המדויק משתנה בין פלטפורמות: בתיעוד של Z.ai מדובר בתכנון של מיליון טוקנים, ואילו OpenRouter מציגה חלון הקשר של 1,310,720 טוקנים.
1
2
3
40
Z.ai שחררה את המשקלים תחת רישיון MIT, מה שהופך את המודל לנגיש לפריסה עצמאית בהרבה ממערכת סגורה שפועלת רק דרך API. לאחר סיום שלב התצוגה המקדימה האנונימי, המודל הופיע ב-OpenRouter בשמו הרשמי.
3
4
8
חשוב לא לבלבל בין GLM-5.3-Flash לבין מוצר GLM-5.3 הגדול יותר שהוכרז מוקדם יותר באוגוסט. לפי הדיווחים, מדובר במוצר נפרד וזול יותר — מודל 320B-A18B — ולא באותו SKU של סדרת GLM-5.3 הגדולה.
10
ביצועים מבטיחים, אך בעיקר לפי נתוני החברה
Z.ai טוענת כי GLM-5.3-Flash משפר את ביצועי GLM-5.2, ובמקביל מוזיל את עלות ההרצה. בתוצאות שפורסמו סביב ההשקה הוא קיבל 63.4 ב-DeepSWE v1.1, לעומת 46.2 ל-GLM-5.2. Z.ai דיווחה גם על 29.0 במבחן תכנות פנימי שלה, לעומת 29.5 שדווחו עבור Claude Opus 4.8.
3
16
המספרים האלה מסייעים להבין כיצד Z.ai ממקמת את המודל, אך אינם מהווים אישור בלתי תלוי לשוויון בינו לבין המודל של Anthropic. ההגדרות של המבחנים, תנאי ההערכה, הניסוח שניתן למודלים ויכולת השחזור של התוצאות — כולם חשובים. המסקנה הזהירה יותר היא ש-Z.ai טוענת לביצועי תכנות וסוכנים חזקים במחיר נמוך בהרבה, ולא ש-GLM-5.3-Flash כבר הוכח כמודל עדיף על כל מערכות הקצה הסגורות.
המחיר החליף את התצוגה המקדימה החינמית
המאפיין הבולט ביותר של Ox Alpha היה האפשרות למפתחים להתנסות בו בחינם בתקופה שבה פעל באנונימיות. השלב הזה הסתיים ברגע שהמודל קיבל זהות רשמית. מחיר המחירון שפרסמה Z.ai הוא 0.15 דולר למיליון טוקני קלט ו-0.50 דולר למיליון טוקני פלט.
1
3
סביב ההשקה הציגה OpenRouter מחיר מבצע נמוך יותר: 0.075 דולר למיליון טוקני קלט ו-0.25 דולר למיליון טוקני פלט. ההבחנה חשובה: התצוגה המקדימה החינמית, מחיר המחירון של Z.ai והנחת ההשקה של פלטפורמה מסוימת הם שלושה תנאי גישה שונים.
2
גם במחיר המחירון, הכלכלה של המודל היא חלק מרכזי מהמשיכה שלו. סוכני תכנות צורכים כמויות גדולות של הקשר ופלט, ולכן עלות טוקנים נמוכה עשויה להשפיע על בחירת המודל לא פחות מיתרון קטן במדד ביצועים.
האות שמגיע מתשתית השבבים הסינית
Z.ai מסרה כי GLM-5.3-Flash פועל כולו על מאיצי AI מתוצרת סין.
15 דיווחים על מערכת ההרצה מתארים תשתית מותאמת המבוססת על SGLang, ומשתמשת בין היתר בקוונטיזציה, במקביליות טנזורית, בפורמטים מעורבים של מטמון, בפיצול שכבות ובארכיטקטורת Encode–Prefill–Decode נפרדת. לפי הדיווחים, המטרה היא לשפר את ביצועי ההרצה מקצה לקצה תוך עבודה תחת המגבלות של חומרה מקומית.
25
המהלך ממשיך קו שהחברה הציגה בעבר סביב משפחת GLM. Z.ai טענה כי אימנה את משפחת GLM-5 על מעבדי Huawei Ascend ללא שימוש בחומרה של Nvidia. דיווחים מציינים גם כי מעמדה של Z.ai ברשימת הישויות האמריקאית מגביל את הגישה שלה למאיצי Nvidia מדגמי H100, H200 ו-B200.
26
לטענה הזו יש משמעות אסטרטגית, אך יש לקרוא אותה כהצהרה של החברה וכדיווח תעשייתי — לא כהשוואת ביצועים מבוקרת ומאומתת לחלוטין בין מערכות החומרה. המסקנה המבוססת יותר היא ש-Z.ai מציגה את מחסנית המודלים שלה כמסוגלת להריץ מודל מולטימודלי גדול בלי להסתמך על מעבדי מרכזי הנתונים המתקדמים ביותר של Nvidia.
למה ההשקה החשאית הייתה חשובה
ההשקה האנונימית נראית כמו מהלך מתוכנן: לפרסם מודל בעל יכולות בלי לחשוף את יוצרו, להציע אותו בחינם דרך מסלולים פופולריים של כלי תכנות, לראות כיצד מפתחים משתמשים בו — ורק לאחר שהמערכת צברה משוב מהעולם האמיתי לחשוף את המוצר. Z.ai נקשרה בעבר לניסוי בשם “Pony Alpha”, שנשען על רעיון דומה, בעוד חוקרים מהקהילה ניסו לזהות את Ox Alpha באמצעות התנהגות הטוקנייזר, רמזים לעיבוד וידאו ודפוסי שגיאות ב-API.
7
11
13
חלק מהדיווחים בתקופת ההשקה הזכירו גם היקפי שימוש חריגים והתלהבות מצד מפתחים, אך החומרים הזמינים אינם מאמתים באופן בלתי תלוי כל נתון או ציטוט. לכן נכון להתייחס לטענות האלה כדיווחי השקה, ולא לנתוני אימוץ שעברו ביקורת.
14
המשמעות לתחרות בשוק ה-AI
GLM-5.3-Flash אינו מוכיח ש-Z.ai עקפה את OpenAI או את Anthropic בכל קטגוריות היכולות של מודלי הקצה. עם זאת, הוא מדגים שילוב תחרותי שקשה להתעלם ממנו: קלט מולטימודלי, הקשר ארוך במיוחד, משקלים פתוחים ברישיון MIT, התמחות בסוכני תכנות ומחיר API נמוך — הכול במוצר אחד.
15
40
עבור מפתחים, השילוב הזה עשוי להקטין את עלות המעבר בין ספקים ולהפוך פריסה עצמאית או עבודה עם כמה ספקי מודלים למעשית יותר. עבור ספקיות של מודלים סגורים, הוא מגביר את הלחץ על המחירים ועל שולי הרווח — במיוחד בעומסי עבודה של סוכני תכנות, שבהם כמות הטוקנים, זמן התגובה, שליטה בפריסה וזמינות התשתית עשויים להיות חשובים לא פחות מהמיקום בטבלת דירוגים.