ב 26 באוגוסט 2026 אישרה Zhipu AI, המוכרת גם בשם Z.ai, כי Ox Alpha — או ״Niu Lai״ בקהילות המפתחים בסין — הוא GLM 5.3 Flash. GLM 5.3 Flash הוא מודל Mixture of Experts עם 320 מיליארד פרמטרים בסך הכול, כ 18 מיליארד פרמטרים פעילים בכל טוקן וחלון הקשר של 1,048,576 טוקנים.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM-5.3-Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM-5.3-Flash: an open-weight, native-multimodal mixture-of-experts model tested anonymously before release. [1][4][6] ## What. Topic tags: general, general web, documentation, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
ב-26 באוגוסט 2026 הסירה Zhipu AI, המוכרת בזירה הבינלאומית גם בשם Z.ai, את מעטה הסודיות מעל מודל ה-AI האלמוני Ox Alpha. החברה אישרה כי המודל, שכונה ״Niu Lai״ בקרב מפתחים בסין, היה למעשה GLM-5.3-Flash — מודל פתוח-משקלים ורב-מודאלי native ממשפחת GLM. 1
15
ההכרזה כללה לא רק השקת מודל חדש, אלא גם טענה רחבת היקף על תשתית ההרצה שלו: לפי Zhipu, המודל הוצע בחינם לניסוי בפלטפורמות OpenRouter ו-OpenCode, עיבד יותר מ-50 טריליון טוקנים בתוך חמישה ימים, וכל התעבורה טופלה באמצעות אשכול של יותר מ-100 אלף שבבים סיניים מתוצרת מקומית. 8
15
Ox Alpha הופיע בפלטפורמות המפתחים ללא שם של חברה או יצרנית חומרה. כך יכלו משתמשים לשפוט אותו בעיקר לפי איכות התשובות, מהירות התגובה, זמינות ועלות — ולא לפי המוניטין של Zhipu או לפי השבבים שעליהם פעל.
המודל טיפס במהירות לראש דירוגי השימוש ב-OpenRouter וב-OpenCode. דיווחים מאוחרים יותר דיברו על יותר מ-60 טריליון טוקנים בתוך שישה ימים, וב-OpenRouter נרשמה לפי הדיווחים תעבורה גדולה פי יותר משניים מזו של מודלים מקבילים של DeepSeek. הפערים בין המספרים נובעים מחלונות מדידה שונים ומנתוני פלטפורמות שונות; המסקנה הזהירה ביותר היא שהניסוי חצה את רף 50 הטריליון טוקנים וזכה לביקוש חריג. 1
3
30
המשמעות היא שהמודל נחשף לנפח גדול של תעבורת מפתחים אמיתית עוד לפני שזהותו נודעה. במילים אחרות, המשתמשים הצביעו עבורו בשימוש בפועל — בלי לדעת מי עומד מאחוריו.
Zhipu מסרה כי עומס ההסקה המקוון של GLM-5.3-Flash רץ על יותר מ-100 אלף מאיצי AI מתוצרת סין. החברה טענה כי אופטימיזציה של התוכנה הביאה את יעילות החומרה ואת העלות לכל טוקן לרמות הדומות לאלו של מעבדי Nvidia מרכזיים. 15
24
עם זאת, החברה לא זיהתה בפומבי את הספקים המדויקים בחומרים שעליהם מבוסס הדיון הזה. Huawei, Moore Threads ו-Hygon הוזכרו בדיווחי תעשייה כמועמדות אפשריות, אך הייחוס הזה לא אומת ואינו מהווה אישור רשמי מצד Zhipu. 30
40
חשוב לקרוא את הטענה בגבולותיה. היא אינה מוכיחה ששבבים סיניים משתווים לשבבי Nvidia בכל סוגי העומסים, שהחומרה המקומית החליפה את Nvidia באימון מודלים, או שמערכות התוכנה של שתי החברות מציעות כלי פיתוח מקבילים.
הטענה הספציפית יותר היא זו: שירות הסקה גדול יכול לפעול על גבי תשתית מקומית שאינה מבוססת Nvidia, כאשר מתכננים יחד את המודל, את מנוע ההסקה ואת שכבת החומרה.
חלון הקשר של מיליון טוקנים מציב דרישות כבדות לזיכרון, לרוחב פס, לתקשורת בין שבבים ולתזמון. כדי להתמודד עם המגבלות האלה, Zhipu בנתה לפי הדיווחים מנוע הסקה ייעודי על בסיס SGLang, ושילבה בו כמה טכניקות: 11
24
Zhipu טענה כי המערכת החדשה שיפרה את ביצועי השירות מקצה לקצה בערך פי שלושה לעומת קו הבסיס הראשוני, על אותה חומרה. 24
26 תיעוד מאוחר יותר של SGLang מציג שיפורים נוספים בתפוקה ובקיבולת מטמון FP8 לעומת תצורת השוואה המבוססת על BF16, אך הוא אינו ביקורת עצמאית על נתון השיפור המקורי של פי שלושה שפרסמה Zhipu.
17
ההשפעה המרכזית על Nvidia נוגעת לתפקיד של CUDA בעולם ההסקה, ולא בהכרח ליתרון הכולל של החברה. ליבות חישוב ייעודיות, כימות, מקביליות ותזמון חכמים עשויים לצמצם את התלות ב-CUDA בעומסי הסקה מסוימים בסביבת ייצור.
אבל CUDA היא רק חלק מהתמונה. האקוסיסטם הרחב של Nvidia, כלי הפיתוח, בסיס המפתחים, התשתית הקיימת והעמדה של החברה בתחום האימון הם שאלות נפרדות — וההשקה הזו אינה פותרת אותן או מבטלת את יתרונותיהן.
GLM-5.3-Flash מדווח כמודל Mixture of Experts דליל, עם 320 מיליארד פרמטרים בסך הכול וכ-18 מיליארד פרמטרים פעילים בכל טוקן. הוא תומך בחלון הקשר של 1,048,576 טוקנים ובקלט רב-מודאלי native, ולכן מכוון בין היתר למסמכים ארוכים, תכנות ותהליכי עבודה ממושכים של סוכני AI. 2
5
7
המודל קיבל לפי הדיווחים ציון 57 במדד Artificial Analysis Intelligence Index — אותו ציון שדווח עבור Claude Opus 4.8. מדובר בשוויון במדד משוקלל אחד, ולא בהוכחה לביצועים זהים בכל מבחן, יישום או משימת סוכן. 9
Zhipu דיווחה על מחיר API של 0.15 דולר למיליון טוקנים בקלט ו-0.50 דולר למיליון טוקנים בפלט. 4
29 סיקור בזמן ההשקה תיאר את המודל כזול בערך פי עשרה מ-GLM-5.3 וכזול בערך פי 40 מ-Claude Opus 4.8, אך היחסים המדויקים תלויים בכיוון הטוקנים, בדרגת המחיר ובתוכנית שאליה משווים.
1
4
היתרון התחרותי של GLM-5.3-Flash נשען, אם כך, על שילוב של שלושה גורמים: ארכיטקטורה דלילה ויעילה יחסית, אופטימיזציה אגרסיבית של מערך ההסקה ומחיר נמוך.
ניסוי Ox Alpha הראה שהשילוב הזה יכול למשוך שימוש משמעותי עוד לפני שזהות המודל נחשפת. הוא לא הוכיח ש-Zhipu פתרה כל מגבלה של חומרה או תוכנה, אך הוא כן סיפק הדגמה בקנה מידה של שירות ייצור לאופן שבו תכנון משותף של מודל, מנוע הסקה ותשתית יכול לייצר מנוף משמעותי — גם מחוץ לאקוסיסטם של Nvidia.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ב 26 באוגוסט 2026 אישרה Zhipu AI, המוכרת גם בשם Z.ai, כי Ox Alpha — או ״Niu Lai״ בקהילות המפתחים בסין — הוא GLM 5.3 Flash.
ב 26 באוגוסט 2026 אישרה Zhipu AI, המוכרת גם בשם Z.ai, כי Ox Alpha — או ״Niu Lai״ בקהילות המפתחים בסין — הוא GLM 5.3 Flash. GLM 5.3 Flash הוא מודל Mixture of Experts עם 320 מיליארד פרמטרים בסך הכול, כ 18 מיליארד פרמטרים פעילים בכל טוקן וחלון הקשר של 1,048,576 טוקנים.
החשיבות של ההכרזה אינה בכך שהוכח כי שבבים סיניים עקפו את Nvidia, אלא בכך שאופטימיזציה ייעודית למודל ולמערכת ההסקה הפכה, לפי טענת Zhipu, תשתית שאינה מבוססת Nvidia לכדאית בקנה מידה גדול.