המפתח בן דייוויס בדק את Ox Alpha על 10 משימות שנלקחו ממבחן DeepSWE להנדסת תוכנה. לפי הדיווח, המודל עבר שמונה מהן — תוצאה של כ-80%. באותה השוואה מצומצמת קיבל Claude Fable 5 ציון של 65%, ואילו GPT-5.6 Sol קיבל 52%.
זו תוצאה שמושכת תשומת לב, אבל לא נכון להציג אותה כניצחון רשמי ב-DeepSWE. גרסה 1.1 של DeepSWE כוללת 113 משימות מקוריות וארוכות-טווח בהנדסת תוכנה, המתפרסות על פני 91 מאגרי קוד. הניסוי של 10 משימות כיסה רק חלק קטן מהמבחן.
יש גם מגבלות מתודולוגיות חשובות:
בתמונת הדירוג הציבורית שהייתה זמינה באותה תקופה, Claude Opus 5 הוביל עם 73.6%, אחריו GPT-5.6 Sol עם 72.7% ו-Claude Fable 5 עם 69.7%. לכן המסקנה הזהירה יותר היא ש-Ox Alpha נראה חזק מאוד בניסוי של דייוויס שכלל 10 משימות — אך התוצאה אינה מוכיחה שהוא מודל התכנות הכללי הטוב ביותר.
התיאוריה המובילה קושרת את Ox Alpha ל-Zhipu AI, המוכרת גם בשם Z.ai, ולמשפחת מודלי GLM שלה. הבסיס לכך הוא טביעת אצבע התנהגותית, ולא הודעה רשמית מצד החברה.
באחד המבחנים שדווחו הושוותה התנהגות הטוקניזציה של Ox Alpha לזו של GLM-5.3 על פני 25 הנחיות. ספירת הטוקנים הבסיסית תאמה, לאחר שהובא בחשבון מעטפת קבועה של 75 טוקנים. בבדיקות וידאו נפרדות דווח גם על התאמה בהתנהגות טוקני הראייה — כולל דמיון בדגימת הפריימים, בהתאמת האורך ובאופן הטיפול ברזולוציה.
דמיון נוסף דווח בסגנון התשובות, בהתנהגות ה-API ובאופן שבו המודל מטפל בקלט אודיו. כל אחד מהסימנים האלה לבדו עשוי לנבוע ממעטפת משותפת, מתשתית זהה או מחיקוי. יחד, טוענים המנתחים, הם יוצרים צירוף ראיות חזק יותר שמתיישב עם משפחת GLM המולטימודלית של Zhipu.
גם העובדה ש-Zhipu השתמשה בעבר בשחרורים אנונימיים או חצי-אנונימיים, בהם המותג Pony Alpha, מוסיפה הקשר נסיבתי. היא אינה מוכיחה שהחברה יצרה את Ox Alpha.
בתקופה שאליה מתייחסים הדיווחים, אף חברה לא קיבלה בפומבי אחריות על Ox Alpha, ו-Zhipu לא אישרה את הקישור. ההשערות כוללות וריאנטים מסוימים של GLM, אך הראיות הזמינות אינן קובעות אם מדובר במודל שטרם הושק, בגרסת ייצור, במערכת שעברה כוונון עדין או במודל עצמאי שמשתמש בתשתית קשורה.
לכן הניסוח שניתן להגן עליו הוא: סביר ש-Ox Alpha נגזר ממשפחת GLM, וייתכן שהוא קשור ל-Zhipu — אך זהות היוצר והדגם המדויק לא אומתו. אחוזי ודאות שפרסמו מנתחים בודדים אינם זיהוי רשמי.
נושא הפרטיות הוא אחד הפרטים המעשיים החשובים ביותר עבור מפתחים. בדף Ox Alpha ב-OpenRouter נכתב שההנחיות והתשובות נשמרות אצל הספק שמפעיל את המודל, אך אינן משמשות לאימון.
ההצהרה הזו שונה ממדיניות איסוף הנתונים הכללית של OpenRouter, שלפיה החברה עצמה אינה שומרת הנחיות או תשובות, אלא אם המשתמש מפעיל רישום של קלט ופלט. OpenRouter גם מפרידה בתיעוד בין המדיניות שלה לבין המדיניות של ספקי המודלים, ולכן לשכבת הניתוב ולספק המודל עשויים להיות כללי שמירה שונים.
במקביל, OpenCode שיווקה את Ox Alpha תחת ההבטחה "אפס שמירת נתונים". ייתכן שהבטחה זו מתייחסת לטיפול של OpenCode בבקשות, אך היא אינה מבטלת אוטומטית את הגילוי שלפיו הספק שמאחורי המודל שומר הנחיות ותשובות במסלול של OpenRouter. במילים אחרות, שתי האמירות יכולות לתאר שלבים שונים באותה בקשה: OpenCode אינה שומרת את הנתונים, בעוד שספק המודל עשוי לשמור אותם.
עד שהספקים יפרסמו מדיניות אחת, ברורה ומחייבת מבחינה חוזית, הגישה הזהירה היא להניח שספק המודל עשוי לשמור את התוכן שנשלח אליו. מפתחים צריכים להימנע מהעברת קוד מקור סודי, סיסמאות, מידע אישי או מידע מפוקח רק משום שהשירות חינמי או משום שנאמר שההנחיות אינן משמשות לאימון.
Ox Alpha בלט משלוש סיבות: תקופת ניסיון קצרה וחינמית, חלון הקשר עצום ויכולות מולטימודליות שהוצגו כשאפתניות, ותוצאה מוקדמת ומרשימה במבחן קידוד. עם זאת, הראיות מצדיקות פרשנות מדודה — לא את הטענה שמעבדה לא ידועה הביסה בוודאות את כל המודלים המובילים.
ציון ה-80% ב-DeepSWE מבוסס על שמונה הצלחות מתוך 10 משימות, ולא על המבחן המלא בן 113 המשימות. בטבלת הדירוג הציבורית עדיין הוביל Claude Opus 5, ו-Ox Alpha טרם עבר את תהליך ההערכה הרשמי.
טביעות האצבע הטכניות הופכות את הקשר ל-Zhipu ולמשפחת GLM להסבר המוביל, אך אין אישור פומבי שמבסס את זהות היוצר. לצורכי ניסוי, Ox Alpha היה מודל מסקרן שכדאי לבדוק. עבור מערכות ייצור או קוד רגיש, הבעלות האנונימית, מדיניות השמירה של הספק וזהותו הלא פתורה הם סיבות טובות להתקדם בזהירות.