במשך כמה ימים הופיע ב-OpenRouter וב-OpenCode מודל בשם Ox Alpha, תחת ספק אנונימי שכונה “Stealth”. הוא הוצע ללא עלות, תמך בטקסט, תמונות ווידאו, כלל קריאות לכלים וחלון הקשר עצום של 1,048,576 טוקנים. ב-26 באוגוסט 2026 אישרה Z.ai כי מדובר למעשה בגרסת תצוגה אנונימית של GLM-5.3-Flash, מודל ממשפחת GLM. 110
הסיפור הפך למקרה מבחן מעניין: מודל יכול להפוך לתופעה בקרב מפתחים עוד לפני פרסום דף מודל מסודר, מדדים רשמיים או זהות יצרן — אם הוא משלב גישה חינמית, מגבלות נדיבות ויכולות שמתאימות לעבודה עם סוכני AI.
מה Ox Alpha הציע
הרישום האנונימי הציג את Ox Alpha כמודל חשיבה המיועד לקידוד, לעבודה ממושכת עם סוכנים ולשימושים בסביבת ייצור. המפרט שהוצג היה שאפתני במיוחד עבור מודל ניסיוני חינמי:
- מזהה מודל:
stealth/ox-alpha
- חלון הקשר: 1,048,576 טוקנים
- אורך פלט מרבי: 131,072 טוקנים
- קלט: טקסט, תמונות ווידאו
- יכולות: חשיבה, קריאות כלים מובנות ופלט מובנה
- מחיר בתקופת התצוגה: אפס דולר עבור טוקני קלט ופלט
OpenRouter ו-OpenCode הציגו לוחות זמנים מעט שונים. OpenRouter דיברה על חלון קצר יותר במסלול שלה, בעוד OpenCode תיארה גישה חינמית שנמשכת בערך שבוע מ-20 באוגוסט. לכן סוף החלון המשוער היה סביב 24–27 באוגוסט, ולא בתאריך סיום אחיד שפורסם לכל המשתמשים. 2412
חלון הקשר של מיליון טוקנים אינו הופך מודל אוטומטית לטוב יותר, אבל הוא משנה את סוגי המשימות שאפשר לנסות. סוכן קידוד יכול להחזיק באותה שיחה חלקים גדולים יותר של מאגר קוד, פלט מכלים, יומנים והקשר חזותי, במקום לסכם ולמחוק מידע שוב ושוב. התמיכה בווידאו הרחיבה את השימושים גם לבדיקת ממשקים ולתהליכים שאינם מסתכמים ביצירת קוד מטקסט. 343
למה המפתחים הסתערו עליו
המשיכה הראשונית של Ox Alpha הייתה מעשית, לא רק ספקולטיבית. מפתחים יכלו לבדוק מודל קידוד מולטימודלי, עם הקשר ארוך, שימוש בכלים וללא עלות לטוקנים. כך ירד הסף לניסויים בסוכני קידוד, תיקון מאגרי קוד, אינטראקציה עם דפדפנים ומשימות הנדסת תוכנה ארוכות.
הנראות של המודל זינקה במהירות. הוא קטע לזמן קצר את רצף 56 הימים של DeepSeek בראש דירוג OpenCode, ודיווחים תיארו זינוק חריג בשימוש ביום אחד. במקביל הופצו טענות על קיבולת ועל כמויות עצומות של טוקנים. מכיוון שלא כל הנתונים הללו עברו ביקורת עצמאית, נכון יותר לראות בהם אינדיקציה להתעניינות עזה — ולא מדידה מדויקת של היקף פעילות מסחרי. 114
ההבחנה הזו חשובה: פופולריות בתקופת ניסיון חינמית משקפת שילוב של יכולת, חידוש, מחיר וזמינות. היא אינה מוכיחה לבדה שמדובר במודל החזק ביותר באופן כללי.
תוצאות DeepSWE היו מבטיחות — אך לא חד-משמעיות
הטענה שהופצה במהירות הרבה ביותר הייתה תוצאה של 80% ב‑DeepSWE: שמונה משימות מוצלחות מתוך מדגם של עשר. זהו סימן מעודד, אך עשר משימות אינן מספיקות כדי לבסס דירוג יציב. הערכה רחבה יותר הובילה לתוצאה של כ-63%, ובהמשך פרסמה Z.ai עבור GLM-5.3-Flash תוצאה רשמית של 63.4% ב‑DeepSWE v1.1. 7634
בדיקות מלאות אחרות הציגו תוצאה נמוכה יותר, ובהן דיווח על 58.4% מתוך 113 משימות. באותה הערכה נטען שחלק משמעותי מהכישלונות נבע מבעיות בפורמט הפלט ובמימוש, מה שממחיש עד כמה מדדי סוכנים רגישים להגדרות סביבת הבדיקה, להרשאות כלים, למגבלות זמן ולהגדרת הצלחה. 4142
המסקנה הזהירה יותר היא ש-Ox Alpha הציג יכולת חזקה בקידוד באמצעות סוכנים והתקרב בחלק מהבדיקות למודלים סגורים מובילים. עם זאת, הנתונים אינם מוכיחים שהוא עקף באופן עקבי את Claude Fable 5 או כל מודל חזית אחר.
מדוע ההשוואות ל-Claude נראו סותרות
ההשוואות השתמשו בתתי-קבוצות שונות של משימות, בתשתיות סוכנים שונות ובתנאי הערכה שונים. מדגם מוקדם של עשר משימות יכול להניב 80% בלי להיות מייצג את כל המדד. ריצה רחבה יותר סביב 63% מספרת סיפור אחר, וריצה של 58.4% עשויה לכלול קנסות נוספים על פורמט פלט או על התנהגות סביבת הבדיקה.
בהמשך דווח כי צוות DeepSWE העריך את היכולת הכוללת של המודל כדומה במידה רבה ל-Claude Opus 4.8 — ולא כהוכחה חד-משמעית לכך שהוא עולה על Claude Fable 5. 35 לכן חשוב להציג כל מספר יחד עם היקף הבדיקה וההגדרות שלה, ולא להתייחס לכל התוצאות כאילו הן ציונים בני-השוואה בדירוג אחד.
מדוע מפתחים בולטים התלהבו ממנו
ההתלהבות מצד משתמשים מוכרים תאמה את פרופיל העבודה של המודל. פטריק קוליסון, מנכ״ל Stripe, תיאר את Ox Alpha כ“מרשים מאוד” לאחר שהתנסה בו דרך תשתית סוכן. מייסד HermesAgent אמר כי המודל עבר כמה מאמות המידה הפנימיות של הצוות. 3335
תגובות כאלה חשובות כעדויות לשימושיות בפועל, במיוחד במשימות קוד וסוכנים. הן אינן שוות ערך למסקנה מבוקרת שלפיה המודל עדיף על כל המתחרים. מודל יכול להיות שימושי במיוחד בתהליך עבודה מסוים בזכות חלון ההקשר, התנהגות קריאות הכלים, המהירות, התמיכה במודאליות או העלות — גם אם מיקומו הכולל במדדים עדיין אינו ודאי.
איך הקהילה זיהתה את המודל
לפני החשיפה הרשמית השוו חוקרים את ההתנהגות הנצפית של Ox Alpha למודלים אפשריים מצוות MiMo של Xiaomi, מ-Google DeepMind ומ-Zhipu AI.
Xiaomi ו-MiMo
Xiaomi נחשבה מועמדת אפשרית, בין היתר משום שצוות MiMo ערך בעבר ניסוי אנונימי בשם “Hunter Alpha”. עם זאת, דיווחים הצביעו על פער ביכולות: מודלי MiMo קושרו לתמיכה באודיו, בעוד Ox Alpha קיבל טקסט, תמונות ווידאו — אך לא אודיו. לכן Xiaomi הייתה השערה מעניינת, אך לא ייחוס מבוסס. 2229
Google DeepMind
רמזים הקשורים ל-Google ופוסטים ברשתות החברתיות הזינו גם את ההשערה הזו, אך לא היה בהם די כדי להוכיח ש-DeepMind בנתה או הפעילה את נקודת הקצה. הם נשארו ראיות נסיבתיות.
טביעת האצבע של GLM
הטיעון החזק ביותר לפני החשיפה הצביע על משפחת GLM של Zhipu. בדיקות קהילתיות דיווחו שמניין הטוקנים של Ox Alpha תאם את ההתנהגות של GLM-5.3 במגוון פרומפטים, למעט היסט קבוע לכאורה של כ-75 טוקנים — ככל הנראה מעטפת מערכת או ניתוב. בדיקות וידאו נפרדות מצאו דפוס צריכת טוקנים שתאם מודלי ראייה של GLM בכמה מאפייני קידוד. 1821
רמזים נוספים כללו:
- שגיאה הקשורה לפרמטר
reasoning_effort, שדמתה לתגובה של API ממשפחת GLM;
- פרומפטים בסינית שהופיעו בחלק מכשלי ניתוח התמונות;
- התנהגות טוקניזציה של וידאו שתאמה מודלים מולטימודליים של Zhipu; וכן
- שם שחלק מהמשקיפים קשרו למונח “Pony Alpha” שבו השתמשה Zhipu בעבר. 212629
כל רמז בנפרד יכול היה לנבוע מניתוב, ממעטפת תוכנה, מתשתית משותפת או מחיקוי. יחד הם הפכו את תאוריית GLM למשכנעת יותר, אך עדיין לא החליפו אישור רשמי. הראיה המכריעה הגיעה כאשר Z.ai זיהתה את Ox Alpha כ-GLM-5.3-Flash ותיעדה את השקתו בשם זה. 1043
מה השתנה לאחר החשיפה
החשיפה הפכה את Ox Alpha מתעלומת ייחוס לתצוגה מקדימה של מוצר. בתיעוד של Z.ai מתואר GLM-5.3-Flash כמודל היברידי עם 320 מיליארד פרמטרים בסך הכול ו-18 מיליארד פרמטרים פעילים, לצד יכולות חזותיות מובנות שמאפשרות להתבונן בממשקים, בתוצאות רינדור ובמשוב מאינטראקציות. כך נוצר מעגל סגור בין קוד, דפדפנים וממשקים גרפיים. 43
ההשקה בשם רשמי פתרה גם את החולשה העיקרית של נקודת קצה אנונימית: חוסר ודאות לגבי המשך השירות. דיווחים תיארו את GLM-5.3-Flash כמודל שפורסם תחת רישיון MIT, עם משקלים זמינים למפתחים המעוניינים בשליטה רבה יותר על אופן ההפעלה. 1950
עם זאת, רישיון פתוח אינו הופך כל פריסה לבטוחה או זולה באופן אוטומטי. מפתחים עדיין צריכים לבדוק דרישות חומרה, ביצועי הסקה, תנאי API, פרטיות, מגבלות קצב, אמינות קריאות הכלים ועקביות הפלט בתהליכי העבודה שלהם.
מה יקבע אם GLM-5.3-Flash יישאר לאורך זמן
הגישה החינמית יצרה תשומת לב, אך האימוץ לטווח ארוך ייקבע על ידי גורמים יציבים יותר:
- כלכלת השימוש: מחירי ה-API צריכים להישאר תחרותיים מול מודלי קידוד חזקים אחרים.
- אמינות: מפתחים זקוקים לזמינות יציבה, למגבלות קצב צפויות ולקריאות כלים עקביות.
- פרטיות: צוותים צריכים לדעת כיצד נשמרים פרומפטים, קוד וקלטים חזותיים, ואם נעשה בהם שימוש נוסף.
- יכולת שחזור: הערכות עצמאיות צריכות להבהיר כיצד המודל מתפקד במדדים מלאים וביישומים אמיתיים.
- חופש פריסה: משקלים ברישיון MIT והאפשרות להפעיל את המודל באופן עצמאי עשויים להפחית את התלות במסלול אירוח זמני — אם לצוות יש את התשתית התפעולית הדרושה.
הלקח המרכזי של Ox Alpha אינו שמודל אנונימי ניצח לזמן קצר מתחרה מפורסם. הלקח הוא שמודל עם עיצוב שמתאים לעבודה אמיתית יכול להתפשט במהירות כאשר מפתחים מקבלים אפשרות לבדוק אותו בקנה מידה גדול. סיפור המדדים היה מסויג יותר מהכותרות הראשונות, אך השילוב של הקשר ארוך, מולטימודליות, שימוש בכלים, קידוד סוכני וגישה זולה היה חזק מספיק כדי להצדיק את ההתעניינות. כעת, כשהזהות נפתרה ו-Ox Alpha קיבל את השם GLM-5.3-Flash, המבחן הבא הוא אם השילוב הזה יישאר שימושי גם כשהחידוש והגישה החינמית יפסיקו למשוך את המשתמשים.