התשובה הקצרה: ה־“sooooooon” של טאנג ג'יה התברר כהבטחה כמעט מילולית. לפי הדיווחים, Zhipu — המוכרת גם בשם Z.ai — השיקה את GLM-5.3 שעות ספורות לאחר תגובתו של המדען הראשי שלה.
12
אבל העיתוי היה רק חלק מהסיפור. GLM-5.3 הוצג כמודל שמיועד בראש ובראשונה לתכנות, לסוכני תוכנה שמבצעים משימות בכוחות עצמם ולבדיקות אבטחת סייבר. החידוש הטכני המרכזי שעליו הצביעה החברה הוא שהמודל נשען על אותו בסיס, בהיקף של כ־743 מיליארד פרמטרים, כמו GLM-5.2 — והקפיצה המוצהרת נבעה בעיקר מהרחבת שלב האימון שלאחר ההכשרה, ולא מאימון־קדם של מודל גדול יותר.
1
4
20
יותר יכולת מאותו בסיס
בדרך כלל, שיפור משמעותי במודלי AI נקשר למודל גדול יותר או לסבב אימון־קדם חדש. במקרה של GLM-5.3, Zhipu מנסה להדגיש מסר אחר: אפשר להפיק הרבה יותר מבסיס קיים באמצעות השקעה באימון לאחר־הכשרה, בתרגול משימות ובשיפור יכולת ההסקה והפעולה.
ההשוואות שפרסמה החברה מצביעות על השיפור הבולט ביותר במשימות תוכנה מורכבות, שבהן המודל נדרש לעבוד עם כלים, לנווט במאגרי קוד ולבצע רצף פעולות:
- SWE-Marathon: מ־19.4 ל־42.5
- FrontierSWE: מ־67.5 ל־78.1
- Terminal-Bench 3.0: מ־4.6 ל־28.3
- DeepSWE v1.1: מ־46.2 ל־66.9
הנתונים מבוססים על השוואות שפרסמה Zhipu ועל ניתוחים משניים של התוצאות.
1
3
6
7
הזינוק ב־Terminal-Bench 3.0 בולט במיוחד במונחי נקודות אחוז. עם זאת, עלייה חדה מציון התחלתי נמוך אינה מוכיחה כשלעצמה שהמודל מוביל בכל משימת הנדסת תוכנה. ב־SWE-Marathon, למשל, הציון המדווח 42.5 עדיין היה נמוך מהציונים שהוצגו עבור Kimi K3 ו־Opus 4.8.
6
9
CyberGym הפך לציון הדגל
המספר שמשך את מרבית תשומת הלב הוא 84.5 ב־CyberGym — מדד שבוחן את היכולת למצוא ולאמת חולשות בקוד מקור. בטבלת ההשוואה של Zhipu, התוצאה הקדימה במעט את Mythos 5 עם 83.8 ואת GPT-5.6 Sol עם 83.6.
2
5
6
CyberGym אינו מבחן רגיל לכתיבת קוד מאובטח. המשימה המדווחת כוללת איתור חולשות, בניית מתקפות ואימות ההשפעה שלהן — כלומר, ניתוח שדומה יותר לגילוי חולשות ולבניית שרשרת ניצול מאשר להשלמת שורת קוד.
12
17
זו גם הסיבה שהתוצאה קיבלה תשומת לב מצד כלי תקשורת בתחום אבטחת המידע. The Register דיווח על טענת Zhipu שלפיה השיפור אינו מסתכם בזיהוי פגמים מבודדים, אלא כולל גם יכולת לחשוב על כמה שלבים ברצף של ניצול חולשה.
17
עם זאת, צריך לקרוא את המילה “מוביל” בהקשר הנכון. הסיקור הקיים מתאר את ההשוואות כתוצאות שדווחו על ידי הספק, ומציין שעדיין אין שחזור עצמאי רחב־היקף של התוצאות.
2
4
6
החברה דיווחה גם על בדיקות בקוד אמיתי
מעבר ל־CyberGym, Zhipu מסרה לפי הדיווחים כי עבדה עם צוותי אבטחה כדי לבדוק את המודלים על בסיסי קוד מהעולם האמיתי. לפי פנקס הממצאים שפרסמה החברה, זוהו 2,436 ממצאי אבטחה ב־269 פרויקטים בקוד פתוח, ובהם 1,097 ממצאים בדרגת חומרה קריטית או גבוהה. עוד דווח כי הממצא הוותיק ביותר היה משנת 1981, וכי החולשות נותרו ללא גילוי במשך 26.6 שנים בממוצע.
21
31
הנתונים מספקים אינדיקציה לסוג תהליך העבודה ש־Zhipu מבקשת לשייך ל־GLM-5.3, אך אין לקרוא אותם כמדידה שעברה ביקורת עצמאית. המקורות שסופקו מייחסים את הפנקס ל־Zhipu, וגם התמונה הרחבה יותר של ביצועי המודל נשענת ברובה על דיווחי החברה.
לא רק כתיבת קוד — אלא סוכן שמבצע משימות
הצגת המודל לא הסתכמה ביכולת לייצר קטעי קוד. Zhipu מיצבה את GLM-5.3 ככלי לסוכנים ארוכי־טווח שיכולים להפעיל כלים, לעבוד בטרמינל ולהשלים משימות הנדסת תוכנה הכוללות שלבים רבים.
בין התוצאות המדווחות נכללו 73.0 ב־Toolathlon Verified, לעומת 59.9 ב־GLM-5.2, וכן 48.2 ב־AutomationBench, לעומת 26.2. בהשוואות שפורסמו הופיע גם ציון 28.5 ב־Agents’ Last Exam.
1
7
11
המשמעות המעשית היא שהיתרון המיועד אינו רק הפקת קוד שנראה סביר. המודל אמור לבצע רצף פעולות בתוך מאגר קוד, מסוף או סביבת כלים. האם הדבר יתורגם להנדסת תוכנה אמינה בסביבת ייצור תלוי עדיין בהרשאות שניתנות לכלים, בכיסוי הבדיקות, בתהליכי הבקרה ובשיעור הכשלים של המודל בקוד ספציפי.
מה הנתונים כן מוכיחים — ומה לא
הראיות הקיימות תומכות במסקנה מצומצמת יותר מהטענה ש־GLM-5.3 “מנצח כל מודל חזית”. התוצאות של Zhipu מצביעות על שיפור מדווח ומשמעותי ביחס ל־GLM-5.2 בכמה מדדי תכנות וסוכנים, וכן על ציון CyberGym מוביל בטבלאות ההשוואה שפרסמה החברה ושצוטטו בסיקור ההשקה.
2
5
6
הן אינן מוכיחות שהמודל עדיף באופן עקבי בכל משימות התכנות, ההיגיון, הבטיחות או השימוש הכללי. בכמה מדדי תכנות נותרו מודלים מתחרים מלפניו, והתוצאות הזמינות עדיין לא שוחזרו בהיקף נרחב על ידי מעריכים בלתי תלויים.
6
9
המסקנה החשובה יותר נוגעת לשיטה: GLM-5.3 מציג את האימון שלאחר ההכשרה כמסלול להפקת יכולות מתמחות מבסיס גדול שכבר קיים. אם בדיקות עצמאיות יאשרו את השיפור, ההשקעה באימון כזה — ובבדיקה קפדנית על תהליכי תוכנה ואבטחה אמיתיים — עשויה להיות חשובה לא פחות מהשוואות של מספר הפרמטרים.