हालांकि, तस्वीर ExploitBench पर पूरी तरह बदल जाती है। यह परीक्षण किसी कमजोरी का वास्तविक शोषण करने के लिए आवश्यक गहन तर्क (डीप रीज़निंग) की जांच करता है और एक कार्यशील एक्सप्लॉइट की मांग करता है। GLM-5.3 ने अपने पूर्ववर्ती की तुलना में अपने स्कोर को दोगुने से अधिक करते हुए 24.4% से 54.4% तक की छलांग लगाई । लेकिन Z.ai की रिपोर्ट के अनुसार, इस कठिन परीक्षण में Mythos 5 का स्कोर 78% और GPT-5.6 Sol का 76.5% है, जो GLM-5.3 को काफी पीछे छोड़ देता है
।
ExploitGym परीक्षण में, जो सामान्यीकृत दो घंटे के बजट में पूरे किए गए शोषण कार्यों की गणना करता है, GLM-5.3 ने GLM-5.2 के 29 कार्यों के मुकाबले 105 कार्य पूरे किए । छह घंटे के बजट में यह संख्या बढ़कर 130 कार्य हो जाती है
।
| बेंचमार्क | क्या मापता है | GLM-5.3 | Anthropic Mythos 5 | OpenAI GPT-5.6 Sol |
|---|---|---|---|---|
| CyberGym | व्हाइट-बॉक्स सोर्स कोड से कमजोरियों की खोज और पुष्टि | 84.5% | 83.8% | 83.6% |
| ExploitBench | मूल कारण तर्क + कार्यशील एक्सप्लॉइट देना | 54.4% | 78% | 76.5% |
| ExploitGym (2 घंटे का बजट) | सामान्यीकृत बजट में पूर्ण किए गए एक्सप्लॉइट कार्य | 105 कार्य | खुलासा नहीं किया गया | खुलासा नहीं किया गया |
बेंचमार्क से परे, GLM-5.3 को वास्तविक दुनिया के सुरक्षा परीक्षणों में भी तैनात किया गया है, जहां इसने प्रभावशाली परिणाम दिए हैं:
GLM-5.3 ने कोडिंग और एजेंटिक बेंचमार्क पर भी मजबूत प्रदर्शन किया है, जो इसे सॉफ्टवेयर इंजीनियरिंग कार्यों के लिए एक अग्रणी ओपन-वेट मॉडल के रूप में स्थापित करता है:
Z.ai का कहना है कि पोस्ट-ट्रेनिंग के दौरान मॉडल की साइबर सुरक्षा क्षमता 'उम्मीद से अधिक तेजी से बढ़ी' । आधार मॉडल के 740 अरब पैरामीटर को दोबारा प्रशिक्षित नहीं किया गया — सभी सुधार पोस्ट-ट्रेनिंग से आए
। चूंकि यह क्षमता एक अप्रत्याशित चीज (इमर्जेंट) थी, इसलिए कंपनी सुरक्षा और सुरक्षा नियंत्रणों को मजबूत करने के लिए ओपन-वेट रिलीज़ को दो सप्ताह के लिए रोक रही है
। मॉडल पहले से ही Z.ai API और ZCode, Claude Code और OpenCode के साथ एकीकरण के माध्यम से उपलब्ध है
।