Anthropic के नियंत्रित ExploitBench परीक्षण में GLM 5.3 ने 410 में से 50 प्रयासों में काम करने वाला एक्सप्लॉइट बनाया; Claude Mythos Preview का आंकड़ा 56 था। Anthropic के सिमुलेशन में आसान बायपास तरीकों ने GLM 5.3 के सुरक्षा उपायों को 64% से 100% तक परीक्षणों में पार किया। NIST के व्यापक साइबर बेंचमार्क आकलन में GLM...
प्रकाशितकर्ताGPT-6 Luna से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s September 2026 analysis find about Z.ai’s open-weight GLM-5.3 model’s ability to build cyber exploits compared with Cla. Article summary: Anthropic’s September 2026 analysis found that Z.ai’s downloadable GLM-5.3 could autonomously build working, end-to-end exploits at nearly the rate of Claude Mythos Preview on one test—a capability Anthropic had previous. Topic tags: general, general web, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake n
Anthropic के सितंबर 2026 के आकलन में Z.ai का ओपन-वेट GLM-5.3 एक साइबरसुरक्षा बेंचमार्क पर Claude Mythos Preview के करीब पहुंचा: दोनों मॉडल कई बार ऐसे एक्सप्लॉइट बना सके जो परीक्षण में काम करते थे। लेकिन उसी रिपोर्ट में GLM-5.3 के सुरक्षा उपाय सिमुलेशन के दौरान आसान तरीकों से बायपास होते भी दिखे। ये नियंत्रित परीक्षण के नतीजे हैं—इन्हें वास्तविक दुनिया में किसी पर हुए सफल साइबर हमले का सबूत नहीं समझना चाहिए। 12
Anthropic के ExploitBench परीक्षण में GLM-5.3 ने 410 में से 50 प्रयासों में काम करने वाला एक्सप्लॉइट बनाया। Claude Mythos Preview ने 56 प्रयासों में ऐसा किया। यानी इस टेस्ट में सफलता की दर क्रमशः करीब 12% और 14% रही। यह बेंचमार्क नियंत्रित माहौल में पहले से ज्ञात कमजोरियों का इस्तेमाल कर एक्सप्लॉइट बनाने की क्षमता देखता था। इसलिए इन नतीजों से यह निष्कर्ष नहीं निकलता कि दोनों मॉडल साइबरसुरक्षा के हर काम में समान हैं। 5
12
Anthropic ने GLM-5.3 की एंड-टू-एंड एक्सप्लॉइट बनाने की क्षमता को पुराने मॉडलों के मुकाबले बड़ी प्रगति बताया। एक अलग बाइनरी-एक्सप्लॉइट परीक्षण में GLM-5.3 ने 4% कामों में पूरा कंट्रोल-फ्लो हाइजैक हासिल किया, जबकि Mythos Preview का आंकड़ा 6% था। ये परिणाम कुछ खास परीक्षणों में मजबूत प्रदर्शन दिखाते हैं, हर काम में बराबरी नहीं। 3
7
12
NIST के सेंटर फॉर AI स्टैंडर्ड्स एंड इनोवेशन (CAISI) ने GLM-5.3 को अब तक जांचे गए ओपन-वेट मॉडलों में सबसे अधिक साइबर क्षमता वाला बताया। फिर भी, CAISI के कई साइबर बेंचमार्क को मिलाकर किए गए आकलन में यह मौजूदा अमेरिकी अग्रणी मॉडलों से करीब चार महीने पीछे था। 17
यह Anthropic के नतीजे से सीधा विरोधाभास नहीं है। Anthropic की प्रमुख तुलना एक खास बेंचमार्क पर GLM-5.3 और Mythos Preview के बीच थी, जबकि NIST ने कई तरह के साइबर कार्यों को शामिल करते हुए व्यापक तुलना की। अलग-अलग परीक्षण और तुलना के दायरे से अलग, लेकिन साथ-साथ सही निष्कर्ष निकल सकते हैं। 12
17
Anthropic के मुताबिक, उसके सिमुलेटेड परीक्षणों में आसान तरीकों से GLM-5.3 के सुरक्षा उपाय 64% से 100% मामलों में पार किए जा सके। ये प्रतिशत सिर्फ आजमाए गए प्रॉम्प्ट और तरीकों के नतीजे बताते हैं; इनका मतलब यह नहीं कि वास्तविक दुनिया में किसी हमलावर के सफल होने की संभावना भी इतनी ही है। 12
रिपोर्ट ने ओपन-वेट मॉडल से जुड़ा एक अलग पहलू भी उठाया: जिन लोगों को मॉडल के वेट्स तक पहुंच मिलती है, वे केवल प्रॉम्प्ट के जरिए मना करने की प्रवृत्ति को चकमा देने के बजाय उसमें बदलाव करने की कोशिश भी कर सकते हैं। एक द्वितीयक रिपोर्ट के अनुसार, अनुभवी टीम के लिए सुरक्षा उपाय हटाने की अनुमानित लागत करीब 1,200 डॉलर थी। उसी काम के लिए लगभग 4,400 डॉलर की कंप्यूट लागत का अनुमान भी दिया गया। ये अलग-अलग तरीके से बताए गए प्रयासों के अनुमान हैं—न कोई तय कीमत, न वास्तविक हमलों की सफलता दर। 12
25
रिपोर्ट में बताए गए एक अभ्यास में शोधकर्ता ने छोटे मॉडल GLM-5.3-Flash की मदद से पहले से सार्वजनिक की जा चुकी दो कमजोरियों को जोड़कर एक्सप्लॉइट चेन बनाई। रिपोर्ट के मुताबिक, इसमें करीब 20 मिनट का मानवीय ध्यान, मॉडल के काम के आठ घंटे और API शुल्क के रूप में 20.40 डॉलर लगे। इनमें से एक कमजोरी Chrome से जुड़ी थी; शोधकर्ता ने दोनों ज्ञात कमजोरियों की सार्वजनिक जानकारी मॉडल को दी थी। यह दिखाता है कि परीक्षण में मॉडल पहले से खुलासा की गई कमजोरियों पर काम करने वाली चेन बनाने में मदद कर सकता था—यह नहीं कि किसी वास्तविक पीड़ित के सिस्टम में सेंध लगाई गई। 6
यह फर्क अहम है: नियंत्रित परीक्षण में एक्सप्लॉइट बनाने की क्षमता संभावित दुरुपयोग को लेकर चेतावनी हो सकती है, लेकिन यह वास्तविक दुनिया में हमला होने का प्रमाण नहीं है। यहां उपलब्ध रिपोर्टिंग यह स्थापित नहीं करती कि GLM-5.3 का इस्तेमाल किसी असली लक्ष्य को भेदने के लिए किया गया। 5
6
Anthropic की चिंता है कि एक्सप्लॉइट बनाने की क्षमता व्यापक रूप से उपलब्ध होने पर उसका इस्तेमाल हमलावर और रक्षक—दोनों कर सकते हैं। कंपनी ने यह भी कहा है कि रक्षकों को उन्नत मॉडल तक पहुंच मिलनी चाहिए, ताकि वे कमजोरियां खोजकर उन्हें ठीक कर सकें। 1
12
ओपन-वेट मॉडल इस बहस में कठिन संतुलन खड़ा करते हैं। इनके वेट्स की उपलब्धता स्वतंत्र शोधकर्ताओं और सुरक्षा टीमों को मॉडल चलाने या उसमें बदलाव करने का अवसर देती है; साथ ही, इससे डेवलपर के नियंत्रण से बाहर मॉडल चलाना या बदलना भी संभव हो सकता है। ये बेंचमार्क और सुरक्षा परीक्षण बहस को समझने में मदद करते हैं, लेकिन अपने आप यह साबित नहीं करते कि मॉडल तक पहुंच सीमित करने से साइबरसुरक्षा कुल मिलाकर बेहतर होगी। 4
12
सबसे ठोस निष्कर्ष सीमित है: Anthropic के एक एक्सप्लॉइट बेंचमार्क में GLM-5.3, Mythos Preview के करीब पहुंचा और उसके सुरक्षा उपाय आजमाए गए बायपास तरीकों के सामने कमजोर साबित हुए। दूसरी ओर, NIST के व्यापक आकलन में GLM-5.3 मौजूदा अमेरिकी अग्रणी मॉडलों से पीछे रहा, और रिपोर्ट किए गए प्रदर्शन वास्तविक दुनिया के हमले नहीं थे। 12
17
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Anthropic के नियंत्रित ExploitBench परीक्षण में GLM 5.3 ने 410 में से 50 प्रयासों में काम करने वाला एक्सप्लॉइट बनाया; Claude Mythos Preview का आंकड़ा 56 था।
Anthropic के नियंत्रित ExploitBench परीक्षण में GLM 5.3 ने 410 में से 50 प्रयासों में काम करने वाला एक्सप्लॉइट बनाया; Claude Mythos Preview का आंकड़ा 56 था। Anthropic के सिमुलेशन में आसान बायपास तरीकों ने GLM 5.3 के सुरक्षा उपायों को 64% से 100% तक परीक्षणों में पार किया।
NIST के व्यापक साइबर बेंचमार्क आकलन में GLM 5.3 सबसे सक्षम ओपन वेट मॉडल था, लेकिन अमेरिकी अग्रणी मॉडलों से करीब चार महीने पीछे रहा।