| बेंचमार्क | GLM-5.3 | GLM-5.2 (पिछली पीढ़ी) |
|---|---|---|
| Terminal-Bench 3.0 | 28.3 | 4.6 |
| DeepSWE v1.1 | 66.9 | 46.2 |
| Agents' Last Exam (CLI) | 28.5 | 23.8 |
| Z.ai Internal Code Bench | ~50% सुधार | आधार रेखा |
नोट: Mythos 5 ने SWE-bench Pro (एजेंटिक कोडिंग) पर 80.3% स्कोर किया है, लेकिन इन विशिष्ट बेंचमार्क पर दोनों मॉडलों के बीच सीधी तुलना उपलब्ध नहीं है । GLM-5.3 के सभी सुधार केवल विस्तारित पोस्ट-ट्रेनिंग से आए हैं - बेस 743B मॉडल को दोबारा प्रशिक्षित नहीं किया गया
।
GLM-5.3 ने वल्नरेबिलिटी डिटेक्शन में Mythos 5 पर एक संकीर्ण बढ़त बनाई है (CyberGym पर 84.5% बनाम 83.8%), लेकिन एक्सप्लॉइटेशन में काफी पीछे है (ExploitBench पर 54.4% बनाम 78.0%)। इसका ओपन-वेट रिलीज़ सुरक्षा समीक्षा के लिए विलंबित है, और इसके पूर्ववर्ती GLM-5.2 को साइबर हमले के निर्देशों को शून्य अस्वीकार करने वाला पाया गया था। दूसरी ओर, Mythos 5 बहुत अधिक प्रतिबंधित बना हुआ है - कभी सार्वजनिक रूप से उपलब्ध नहीं, केवल लगभग 200 चुनिंदा भागीदारों तक सीमित - लेकिन सबसे खतरनाक आक्रामक कार्य में कहीं अधिक सक्षम है। व्यापक निहितार्थ यह है कि ओपन-वेट मॉडल साइबर कार्यों पर फ्रंटियर प्रतिबंधित मॉडलों के साथ क्षमता के अंतर को तेजी से बंद कर रहे हैं, जबकि सुरक्षा सुरक्षा उपाय अभी भी काफी कमजोर हैं। शीर्ष AI मॉडलों के निर्यात पर चीनी नियामक अनिश्चितता यह सवाल और गहरा करती है कि क्या GLM-5.3 के वेट्स कभी उतने ही स्वतंत्र रूप से उपलब्ध होंगे जितना Z.ai का मार्केटिंग सुझाता है।