Ox Alpha היה למעשה GLM 5.3 Flash של Zhipu AI. המודל הופיע בתצוגה מקדימה עיוורת ב־20 באוגוסט 2026, וזהותו אושרה ב־26 באוגוסט.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
במשך כמעט שבוע הופיע ב־OpenRouter ובכלי פיתוח נוספים מודל AI בשם Ox Alpha. הוא היה חינמי, ללא יצרן מזוהה וללא דף מודל מפורט — אך הציע חלון הקשר של כמיליון טוקנים ויכולת לעבד קלט מולטימודלי. ב־26 באוגוסט 2026 חשפה Zhipu AI, שפועלת בזירה הבינלאומית גם תחת המותג Z.ai, כי Ox Alpha היה למעשה GLM-5.3-Flash. 3
4
החשיפה הפכה תעלומה קצרה להשקה משמעותית של מודל עם משקלים פתוחים: מערכת Mixture of Experts בהיקף כולל של 320 מיליארד פרמטרים, שרק 18 מיליארד מהם מופעלים עבור כל טוקן, חלון הקשר של 1,048,576 טוקנים, קלט מולטימודלי טבעי ומשקלים תחת רישיון MIT. 3
6
8
המודל הופיע ב־20 באוגוסט 2026 ללא שם חברה, מפרט טכני מלא או כרטיס מודל. מפתחים התחילו להשתמש בו למשימות תכנות, עבודה עם סוכנים וכלים, וניתן היה להזין לו טקסט, תמונות ווידאו. הביצועים המעשיים שלו עוררו ספקולציות בנוגע למעבדה שיצרה אותו. 13
16
לדברי Zhipu, האנונימיות הייתה מכוונת. החברה ביקשה שהמפתחים ישפטו את המערכת לפי התוצאות שלה — ולא לפי המותג, מספר הפרמטרים או מסרי השיווק של ההשקה. כך היא קיבלה דפוסי שימוש ומשוב מתרחישי עבודה אמיתיים, עוד לפני ההכרזה הרשמית. 13
15
במהלך הניסוי דווח על קיבולת חינמית של כ־100 טריליון טוקנים ביום. בין המפתחים הבולטים שהביעו התלהבות מהמודל נמנה, לפי הדיווחים, פטריק קוליסון, ממייסדי Stripe, שתיאר אותו כ"מרשים מאוד". עם זאת, התלהבות ציבורית אינה תחליף להערכה מבוקרת וזהה לכל המודלים. 13
14
Zhipu מסרה גם שהשירות הופעל על מאיצי AI שיוצרו בסין. ה־South China Morning Post דיווח שהניסוי השתמש באשכול של 100,000 שבבים כאלה, וכן שהמודל עיבד 62 טריליון טוקנים לפני השקתו הרשמית. המספרים שונים בין הדיווחים, ולכן יש לראות בהם נתונים שמסרה החברה או שפורסמו בתקשורת — לא מדידות שעברו ביקורת עצמאית. 7
13
GLM-5.3-Flash הוא מודל מסוג Mixture of Experts, או בקיצור MoE. מאגר הפרמטרים הכולל שלו מכיל 320 מיליארד פרמטרים, אך בכל שלב חישובי מופעלים רק 18 מיליארד מהם לכל טוקן. הרעיון הוא לשלב את יכולת הייצוג של מודל גדול מאוד עם עלות חישוב נמוכה יותר בכל פעולת הסקה. 3
4
המודל כולל 45 שכבות, והוא מוצג כמודל הראשון בסדרת GLM-5 שנבנה מראש כמולטימודלי. הוא מיועד לעבוד עם טקסט, תמונות, וידאו, מסמכים חזותיים, קבצים וקלטים שמשלבים כמה סוגי מדיה. בפועל, משמעות הדבר היא שסוכן יכול לבחון ממשק, לפרש צילום מסך, לקרוא מסמך או לבדוק תוצאה של הרצת קוד — ולא להסתמך על טקסט בלבד. 4
11
Zhipu מציגה חלון הקשר של 1,048,576 טוקנים, כלומר בקירוב מיליון טוקנים. קיבולת כזו יכולה להתאים למאגרי קוד גדולים, למסמכים רבים, לסשנים ארוכים של סוכנים ולתרחישים שבהם משלבים קוד, קבצים ותוכן חזותי באותה משימה. 3
4
לפי החברה, המודל אומן מאפס על בסיס חדש, עם ארכיטקטורה ומתכון אימון שעוצבו מחדש. האימון התבסס על קורפוס מולטימודלי בהיקף של 30 טריליון טוקנים, ולכן GLM-5.3-Flash מוצג כמודל חדש שתוכנן סביב יעילות ויכולות מולטימודליות — ולא רק כגרסה מוקטנת של GLM-5.3. 4
16
GLM-5.3-Flash משלב קשב ליניארי עם קשב דליל. קשב ליניארי נועד להוזיל את עיבוד הרצפים הארוכים, ואילו קשב דליל מאפשר לשמור אינטראקציות מפורטות יותר רק במקומות שבהם הן חשובות במיוחד. השילוב נועד לאזן בין יכולת עבודה על הקשר ארוך לבין עלויות הסקה סבירות יותר. 4
16
הארכיטקטורה כוללת גם מנגנון בשם IndexPool, שנועד להפחית את העומס על הזיכרון ואת זמני ההשהיה הכרוכים באינדוקס של הקשר ארוך. בנוסף, Zhipu מתארת שימוש ב־Manifold-Constrained Hyper-Connections כאמצעי נוסף לשיפור יעילות ההתרחבות של המודל. התועלת בפועל של טכניקות אלה תלויה באורך הרצף, בחומרה, בתצורת השירות ובסוג המשימה. 4
16
בהשוואה ל־GLM-5.3, Zhipu טוענת כי GLM-5.3-Flash מפחית את חישובי הקשב פי 3.01 ואת השימוש ב־KV Cache פי 4.44, תוך שמירה על איכות בעבודה עם הקשר ארוך. אלה נתונים חשובים למפתחי סוכנים, משום שחישובי קשב וזיכרון KV עלולים להפוך לצווארי בקבוק בסשנים ממושכים. עם זאת, מדובר בעיקר בנתונים טכניים של Zhipu, ולא במהירויות ששוחזרו באופן בלתי תלוי בכל תצורת חומרה ועומס. 4
הדגש המרכזי של GLM-5.3-Flash הוא על תכנות, תכנות חזותי, משימות ארוכות־טווח של סוכנים ושימוש בכלים. היכולת החזותית הטבעית אמורה לאפשר לסוכן להתבונן בממשקים, בתוצאות רינדור ובמשוב מאינטראקציות — וליצור לולאה רציפה בין קוד, דפדפנים וממשקי משתמש גרפיים. 4
תוצאות הבנצ'מרק שפרסמה Zhipu כוללות:
הציונים מחזקים את המיצוב של המודל ככלי לתכנות ולעבודה עם סוכנים, אך יש להשוות ביניהם בזהירות. בנצ'מרקים של סוכנים מושפעים מאוד מניסוח הפרומפט, מהכלים הזמינים, משכבות האוטומציה, מהחומרה, ממגבלות הזמן ומגרסת ההערכה. לכן נכון לראות בנתונים אלה תוצאות שדיווחה Zhipu — ולא דירוג סופי ובלתי תלוי של כל המודלים המתחרים. 4
15
Zhipu פרסמה את משקלי GLM-5.3-Flash ב־Hugging Face תחת רישיון MIT, כולל גרסת BF16. בתיעוד המודל מצוין כי ניתן לפרוס אותו באמצעות מסגרות שירות כמו SGLang ו־vLLM. עבור ארגונים, המשמעות היא אפשרות לבדוק ולהפעיל את המודל בתשתית עצמית, במקום להסתמך רק על ה־API המתארח של Z.ai. 3
6
8
הפתיחות הזו משנה את התמונה המעשית. מפתחים יכולים לבדוק את המודל מול מאגרי הקוד, המסמכים והממשקים החזותיים שלהם, וצוותי תשתיות יכולים לבחון ישירות את עלויות ההגשה ואת דרישות החומרה. עם זאת, 320 מיליארד פרמטרים בסך הכול עדיין הופכים את הפריסה למשימה הנדסית מורכבת. העובדה שרק 18 מיליארד פרמטרים פעילים בכל טוקן מפחיתה את העבודה החישובית, אך אינה הופכת את נקודת הבדיקה המלאה לקלה או זולה כברירת מחדל.
ניסוי Ox Alpha היה יותר מתרגיל יחסי ציבור. הוא בדק אם מפתחים ימשיכו להשתמש במודל גם כאשר אינם יודעים מי יצר אותו, כמה פרמטרים יש בו ומהי החברה שמאחוריו. בתהליך הזה משתמשים אמיתיים סיפקו עומסי עבודה ומשוב עוד לפני החשיפה הרשמית. 13
15
לניסוי היו גם מגבלות ברורות: גישה חינמית יכולה למשוך תעבורה חריגה, שבחים ברשת עשויים להיות קשורים לחידוש ולסקרנות, והבדיקה האנונימית לא שלטה בניסוח הפרומפטים או בתנאי ההשוואה מול מודלים אחרים. המסקנה הזהירה יותר היא ש־GLM-5.3-Flash הצליח למשוך עניין נרחב מצד מפתחים עוד לפני שזהותו נודעה — ו־Zhipu השתמשה בתגובה הזו כדי לבחון את המוצר ואת סיפור ההשקה שלו. 13
15
GLM-5.3-Flash הוא השם שנחשף מאחורי Ox Alpha: מודל GLM פתוח־משקלים, מולטימודלי מטבעו, שנבנה לעבודה יעילה עם קוד, כלים וסוכני AI. המפרט המרכזי שלו כולל ארכיטקטורת MoE עם 320 מיליארד פרמטרים בסך הכול ו־18 מיליארד פעילים, 45 שכבות, חלון הקקשר של כמיליון טוקנים, קשב ליניארי ודליל משולב ומשקלים ברישיון MIT. 3
4
11
ההבטחה המשמעותית של המודל אינה רק הגודל. מדובר בשילוב של הקשר ארוך, קלט חזותי, שימוש בכלים ועלויות שירות נמוכות יותר — במודל שמפתחים יכולים להוריד ולנסות בעצמם. ההשקה העיוורת סיפקה משוב מעשי בהיקף חריג, אך עדיין נדרשות הערכות בלתי תלויות וניתנות לשחזור כדי לקבוע כיצד הטענות על הארכיטקטורה, היעילות והבנצ'מרקים מתורגמות לביצועים בסביבת ייצור.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha היה למעשה GLM 5.3 Flash של Zhipu AI. המודל הופיע בתצוגה מקדימה עיוורת ב־20 באוגוסט 2026, וזהותו אושרה ב־26 באוגוסט.
Ox Alpha היה למעשה GLM 5.3 Flash של Zhipu AI. המודל הופיע בתצוגה מקדימה עיוורת ב־20 באוגוסט 2026, וזהותו אושרה ב־26 באוגוסט. זהו מודל Mixture of Experts עם 320 מיליארד פרמטרים בסך הכול, אך רק 18 מיליארד פרמטרים פעילים בכל טוקן.
Zhipu טוענת כי בהשוואה ל־GLM 5.3, התכנון המשולב של קשב ליניארי וקשב דליל מפחית את חישובי הקשב פי 3.01 ואת השימוש ב־KV Cache פי 4.44.