המודל GLM-5.3 של חברת Z.ai הצליח ליצור פרצות עובדות כמעט באותה תדירות כמו Claude Mythos Preview באחד ממבחני הניצול של Anthropic. אבל אותה הערכה מצאה גם ששיטות פשוטות עקפו את מנגנוני ההגנה של GLM-5.3 בחלק גדול מהסימולציות. אלה ממצאים שמעלים שאלות על הפצה של יכולות סייבר מתקדמות — לא הוכחה שמישהו השתמש במודל כדי לפרוץ למטרה אמיתית.
12
מה הראה המבחן מול Mythos?
במבחן ExploitBench של Anthropic, GLM-5.3 יצר פרצות עובדות ב-50 מתוך 410 ניסיונות. Claude Mythos Preview הצליח בכך ב-56 מתוך 410. במונחים של שיעור הצלחה, מדובר בכ-12% לעומת כ-14%. המבחן בדק פיתוח פרצות נגד חולשות מוכרות בסביבה מבוקרת, ולכן התוצאה הקרובה אינה מוכיחה שהמודלים שקולים בכל משימות הסייבר.
5
12
Anthropic תיארה את היכולת של GLM-5.3 לבנות פרצה מקצה לקצה כהתקדמות משמעותית לעומת מודלים קודמים. במבחן נפרד לניצול בינארי, המודל השיג השתלטות מלאה על זרימת הבקרה ב-4% מהמשימות, לעומת 6% אצל Mythos Preview. גם כאן מדובר בביצועים במבחנים מסוימים — לא בשוויון גורף בין המערכות.
3
7
12
התמונה הרחבה יותר של NIST מסויגת
המרכז לתקני בינה מלאכותית וחדשנות של NIST, המכון הלאומי האמריקאי לתקנים וטכנולוגיה, כינה את GLM-5.3 מודל המשקולות הפתוחות בעל יכולות הסייבר הגבוהות ביותר שבדק. עם זאת, במדד משולב של מבחני הסייבר שלו, הוא העריך שהמודל מפגר בכארבעה חודשים אחרי מודלי החזית האמריקאיים העדכניים.
17
אין כאן בהכרח סתירה לממצא של Anthropic: NIST בחן כמה מדדים ומשימות, ואילו ההשוואה הבולטת של Anthropic עסקה במבחן מסוים מול Mythos Preview. מבחנים וקבוצות השוואה שונות עשויים להוביל למסקנות שונות — שיכולות להתיישב זו עם זו.
12
17
ההגנות נעקפו בסימולציות
לפי Anthropic, שיטות פשוטות עקפו את מנגנוני ההגנה של GLM-5.3 ב-64% עד 100% מהמבחנים המדומים שנבדקו. האחוזים מתארים את תוצאות הניסיונות שנערכו — לא את הסיכוי שתוקף יצליח במבצע אמיתי.
12
יש גם הבדל בין לעקוף הגנה באמצעות ניסוח בקשה לבין לשנות את התנהגות הסירוב של המודל עצמו. מכיוון שהמשקולות של GLM-5.3 זמינות להורדה, משתמשים עשויים להיות מסוגלים לערוך אותן. דיווח משני על הניסוי העריך את עלות הסרת ההגנות בכ-1,200 דולר לצוות מנוסה, ובמקביל תיאר אומדן של כ-4,400 דולר לחישוב הנדרש. אלה הערכות שמתייחסות לתיאורים שונים של העבודה — לא מחיר קבוע ולא מדד לתדירות שבה תוקפים אמיתיים יעשו זאת.
12
25
מה הראו ההדגמות?
בתרגיל אחד שתואר בדיווח, חוקר השתמש בגרסה הקטנה יותר, GLM-5.3-Flash, כדי לבנות שרשרת ניצול לשתי חולשות שכבר נחשפו. לפי הדיווח, העבודה דרשה כ-20 דקות של תשומת לב אנושית, שמונה שעות עבודה של המודל ועלות API של 20.40 דולר. אחת החולשות הייתה ב-Chrome, והחוקר סיפק למודל פרטים פומביים על החולשות הידועות. ההדגמה מראה שהמודל סייע לבנות שרשרת ניצול בסביבת בדיקה — לא שהמחשב של קורבן אמיתי נפרץ.
6
ההבחנה חשובה: היכולת לייצר פרצה בתנאי מבחן היא סימן אזהרה לגבי שימוש לרעה אפשרי, אבל היא אינה שקולה לתקיפה שהתרחשה בפועל. המידע הזמין כאן אינו מעיד ש-GLM-5.3 שימש לפריצה למטרה בעולם האמיתי.
5
6
הוויכוח על מודלים פתוחים — ועל גישת המגינים
החשש של Anthropic הוא שיכולות לבניית פרצות, כשהן זמינות בהיקף רחב, עשויות לסייע לתוקפים וגם למגינים. החברה טוענת במקביל שחשוב לאפשר למגינים גישה למודלים מתקדמים כדי שיוכלו לאתר חולשות ולתקן אותן.
1
12
מודלים עם משקולות פתוחות מציבים כאן מתח אמיתי: הם מאפשרים לחוקרים ולמגינים עצמאיים להריץ מודל ולהשתמש בו, אך גם מקלים על משתמשים להפעיל אותו או לשנות אותו מחוץ לבקרות של המפתחת. תוצאות המבחנים והעקיפות מוסיפות מידע לוויכוח הזה, אבל אינן מוכיחות כשלעצמן שהגבלת גישה למודלים תהפוך את הסייבר לבטוח יותר.
4
12
המסקנה המבוססת ביותר מצומצמת יותר: בהערכה של Anthropic, GLM-5.3 התקרב ל-Mythos Preview במבחן ניצול פרצות אחד, ומנגנוני ההגנה שלו היו פגיעים לשיטות העקיפה שנבדקו. בהערכה הרחבה יותר של NIST הוא עדיין דורג מאחורי מודלי החזית האמריקאיים העדכניים, וההדגמות שדווחו לא היו תקיפות בזמן אמת.
12
17