ב־26 באוגוסט חשפה Zhipu AI כי המודל האנונימי Ox Alpha, שכונה בסין «ניו לאי», הוא GLM 5.3 Flash — מודל קוד פתוח במשקלים, רב־מודאלי באופן מובנה ובעל ארכיטקטורת Mixture of Experts. המודל הוצע בחינם ובאופן אנונימי ב־OpenRouter וב־OpenCode, ועיבד יותר מ־50 טריליון טוקנים בתוך חמישה ימים — ובהמשך יותר מ־60 טריליון בתוך שי...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM 5.3 Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM 5.3 Flash: an open weight, native multimodal mixture of experts model tested anonymously before release.. Topic tags: general web, ai, productivity, code, api. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, cl
ב־26 באוגוסט 2026 חשפה Zhipu AI, המוכרת גם בשם הבינלאומי Z.ai, כי המודל האנונימי Ox Alpha — שכונה בקהילות הסיניות «ניו לאי» — היה למעשה GLM-5.3-Flash. מדובר במודל בעל משקלים פתוחים, רב־מודאלי באופן מובנה ובנוי בארכיטקטורת Mixture of Experts, שנבחן במשך כמה ימים בלי לחשוף את זהות החברה שפיתחה אותו. 1
4
6
בשלב הניסוי הוצע Ox Alpha ללא תשלום ובאופן אנונימי בפלטפורמות OpenRouter ו־OpenCode, המשמשות מפתחים להתנסות ולבניית כלים מבוססי בינה מלאכותית. הביקוש היה חריג: דיווחים הציבו את השימוש במודל מעל 50 טריליון טוקנים בתוך חמישה ימים, ובהמשך מעל 60 טריליון בתוך שישה ימים. הוא הגיע למקום הראשון בדירוגי השימוש בשתי הפלטפורמות, ובשיא עבר, לפי הדיווחים, פי שניים את היקף השימוש במוצרים מקבילים של DeepSeek. 3
החשיפה הרשמית פתרה את אחת התעלומות הגדולות סביב המודל: מי עומד מאחוריו, והאם מדובר במתחרה חדש ל־DeepSeek או בגרסה ניסיונית של מעבדה מוכרת. התשובה הייתה Zhipu AI — והשם המסחרי שנבחר למוצר הוא GLM-5.3-Flash.
אחד הפרטים הבולטים בחשיפה נגע לתשתית החישוב. Zhipu מסרה שהשירות פעל כולו על אשכול של יותר מ־100 אלף שבבי בינה מלאכותית מתוצרת סין. החברה טענה כי לאחר אופטימיזציה של התוכנה ושל מערך ההפעלה, היעילות החומרתית והעלות לכל טוקן היו דומות לאלו של מעבדי GPU מרכזיים של Nvidia. 3
6
עם זאת, חשוב להבחין בין הטענה הזו לבין מסקנה רחבה יותר. הנתונים אינם מוכיחים שסין השיגה שוויון כללי מול Nvidia בחומרה, או שהעלות של הסקת מסקנות על שבבים מקומיים תהיה שווה לזו של Nvidia בכל תרחיש. הם כן מצביעים על כך שעומס עולמי גדול של שימוש במודל יכול לפעול על תשתית שאינה מבוססת Nvidia, כאשר מושקעים משאבים רבים בהנדסת מערכות.
Zhipu לא חשפה את ספקי השבבים המדויקים. שמות כמו Huawei, Moore Threads ו־Hygon הוזכרו בדיווחים כאפשרויות, אך מדובר בהשערות שלא אושרו על ידי Zhipu. 40
לפי התיאורים הטכניים, Zhipu בנתה מנוע הסקה ייעודי המבוסס על SGLang. המערכת שילבה כמה טכניקות שנועדו להתמודד עם צווארי בקבוק של זיכרון, רוחב פס, תקשורת ותזמון — במיוחד בעת עבודה עם חלון הקשר העצום של מיליון טוקנים.
בין השיטות שדווחו:
לפי Zhipu, השינויים האלה שיפרו בערך פי שלושה את ביצועי השירות מקצה לקצה בהשוואה לקו הבסיס הראשוני. תיעוד מאוחר יותר של SGLang מציג גם שיפור בתפוקה וקיבולת גדולה משמעותית למטמון FP8 לעומת תצורה מקבילה של BF16. עם זאת, התיעוד אינו ביקורת בלתי תלויה על טענת Zhipu לשיפור של פי שלושה. 2
GLM-5.3-Flash כולל 320 מיליארד פרמטרים בסך הכול, אך מפעיל בערך 18 מיליארד פרמטרים בכל טוקן. חלון ההקשר שלו הוא 1,048,576 טוקנים — נתון המאפשר לעבוד עם מסמכים, מאגרי מידע או רצפי שיחה ארוכים במיוחד. 5
7
לפי הדיווחים, המודל קיבל ציון 57 במדד Artificial Analysis Intelligence Index — אותו ציון שדווח עבור Claude Opus 4.8. המשמעות היא שוויון במדד משוקלל מסוים, ולא הוכחה לכך ששני המודלים מציגים ביצועים זהים בכל מבחן, משימת תכנות או שימוש כסוכן אוטונומי. 1
Zhipu מיקמה את המודל מול דגמים יעילים ממשפחת DeepSeek, ובהם DeepSeek V4 Flash ו־DeepSeek V4 Pro, תוך הבטחה למחירי הסקה נמוכים בהרבה. עם זאת, המידע הזמין אינו מספיק כדי לאמת השוואה מלאה, מבחן אחר מבחן, בין כל הגרסאות הללו.
המחיר שפורסם עבור ממשק ה־API עומד על 0.15 דולר למיליון טוקני קלט ו־0.50 דולר למיליון טוקני פלט. 1 דיווחים בני התקופה תיארו זאת כעשירית ממחיר GLM-5.3 וכארבעיםית ממחיר Claude Opus 4.8, אך היחסים האלה תלויים בכיוון הטוקנים, ברמת חלון ההקשר ובתוכנית התמחור שנבחרה.
1
החשיפה מעניקה משקל לטענה שמנועי הסקה ותוכנה המותאמים למודל מסוים יכולים לצמצם, לפחות בחלק מעומסי הייצור, את התלות ב־CUDA — פלטפורמת התוכנה של Nvidia שהפכה לסטנדרט מרכזי בתחום החישוב לבינה מלאכותית.
אבל זו אינה הכרזה על היעלמות היתרון של Nvidia. ל־CUDA עדיין יש אקוסיסטם רחב, כלי פיתוח, בסיס משתמשים ויתרונות משמעותיים באימון מודלים. הסיפור של GLM-5.3-Flash מצביע בעיקר על הישג הנדסי ממוקד: שילוב של מודל יעיל, תוכנה מותאמת ותשתית שבבים מקומית הצליח להתמודד עם ביקוש עולמי בהיקף יוצא דופן.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ב־26 באוגוסט חשפה Zhipu AI כי המודל האנונימי Ox Alpha, שכונה בסין «ניו לאי», הוא GLM 5.3 Flash — מודל קוד פתוח במשקלים, רב־מודאלי באופן מובנה ובעל ארכיטקטורת Mixture of Experts.
ב־26 באוגוסט חשפה Zhipu AI כי המודל האנונימי Ox Alpha, שכונה בסין «ניו לאי», הוא GLM 5.3 Flash — מודל קוד פתוח במשקלים, רב־מודאלי באופן מובנה ובעל ארכיטקטורת Mixture of Experts. המודל הוצע בחינם ובאופן אנונימי ב־OpenRouter וב־OpenCode, ועיבד יותר מ־50 טריליון טוקנים בתוך חמישה ימים — ובהמשך יותר מ־60 טריליון בתוך שישה ימים.
לפי Zhipu, כל התעבורה טופלה באמצעות אשכול של יותר מ־100 אלף שבבים שיוצרו בסין, לאחר אופטימיזציות תוכנה ותשתית משמעותיות.