في اختبار ExploitBench المعزول، أنشأ GLM 5.3 ثغرات قابلة للتنفيذ في 50 محاولة من أصل 410، مقابل 56 محاولة لـClaude Mythos Preview. قالت Anthropic إن أساليب بسيطة تجاوزت ضوابط GLM 5.3 في 64% إلى 100% من اختبارات المحاكاة؛ وهذه النسب لا تمثل احتمال نجاح هجوم حقيقي.
نشر بواسطةتم التحرير باستخدام GPT-6 Lunaتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s September 2026 analysis find about Z.ai’s open-weight GLM-5.3 model’s ability to build cyber exploits compared with Cla. Article summary: Anthropic’s September 2026 analysis found that Z.ai’s downloadable GLM-5.3 could autonomously build working, end-to-end exploits at nearly the rate of Claude Mythos Preview on one test—a capability Anthropic had previous. Topic tags: general, general web, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake n
أظهر تقييم أجرته Anthropic أن النموذج مفتوح الأوزان GLM-5.3، الذي تطوره Z.ai، اقترب من Claude Mythos Preview في اختبار واحد لإنشاء سلسلة استغلال كاملة لثغرات معروفة. وفي الاختبار نفسه، قالت الشركة إن أساليب بسيطة تجاوزت ضوابط النموذج في نسبة كبيرة من محاولات المحاكاة. لكن هذه نتائج اختبارات مضبوطة، وليست دليلًا على استخدام النموذج لاختراق أهداف حقيقية. 12
في اختبار ExploitBench، أنشأ GLM-5.3 استغلالًا ناجحًا في 50 محاولة من أصل 410، مقابل 56 محاولة لـClaude Mythos Preview؛ أي نحو 12% مقابل 14% في هذا الاختبار. وهو يقيس تطوير استغلال لثغرات معروفة في بيئة مضبوطة، لذلك لا تعني النتيجة أن النموذجين متكافئان في كل مهام الأمن السيبراني. 5
12
وسجّل GLM-5.3 كذلك عمليات سيطرة كاملة على تدفق التنفيذ في 4% من مهام اختبار منفصل للاستغلال الثنائي، مقابل 6% لـMythos Preview. ووصفت Anthropic قدرة GLM-5.3 على بناء استغلال متكامل بأنها تقدم كبير مقارنة بنماذج سابقة؛ لكن النتائج تظل مرتبطة باختبارات محددة، لا حكمًا عامًا بتساوي قدرات النموذجين. 3
7
12
وصف مركز معايير وابتكار الذكاء الاصطناعي التابع للمعهد الأميركي للمعايير والتقنية (NIST) نموذج GLM-5.3 بأنه أقوى نموذج مفتوح الأوزان في القدرات السيبرانية ضمن ما قيّمه المركز. لكنه وجد، عند تجميع نتائج عدة اختبارات للأمن السيبراني، أن النموذج يتأخر بنحو أربعة أشهر عن مستوى النماذج الأميركية الرائدة حاليًا. 17
ولا يتعارض ذلك بالضرورة مع نتيجة Anthropic القريبة من Mythos: تقييم NIST شمل مجموعة أوسع من الاختبارات والمقارنات، بينما انصبت النتيجة الأبرز لدى Anthropic على اختبار محدد مقارنةً بـMythos Preview. اختلاف نطاق الاختبارات والمجموعات المقارنة قد يقود إلى استنتاجات مختلفة من دون تناقض بينها. 12
17
قالت Anthropic إن تقنيات بسيطة تجاوزت ضوابط GLM-5.3 في 64% إلى 100% من اختبارات محاكاة أجرتها. هذه النسب تصف نتائج الأساليب والطلبات التي اختُبرت، ولا تعني أن احتمال نجاح مهاجم في عملية حقيقية يقع ضمن النطاق نفسه. 12
وهناك جانب آخر يتعلق بالأوزان المفتوحة: إتاحة أوزان النموذج للمستخدمين تتيح لهم تشغيله وتعديله، وقد تسمح بتغيير سلوكه الرافض للطلبات، بدل الاكتفاء بمحاولة الالتفاف على الضوابط عبر صياغة الطلبات. وذكر تقرير ثانوي تقديرًا بنحو 1,200 دولار لفريق خبير لإزالة تلك الضوابط، كما أورد تقديرًا آخر بنحو 4,400 دولار مقابل الحوسبة اللازمة. هذه تقديرات مرتبطة بوصفين مختلفين للعملية، وليست سعرًا ثابتًا أو مقياسًا لمدى شيوعها بين المهاجمين. 12
25
في تجربة أوردها التقرير، استخدم باحث النسخة الأصغر GLM-5.3-Flash لبناء سلسلة استغلال لثغرتين سبق الكشف عنهما. واستغرقت العملية نحو 20 دقيقة من انتباه الباحث وثماني ساعات من عمل النموذج، مع رسوم API بلغت 20.40 دولارًا بحسب التقرير. كانت إحدى الثغرتين في Chrome، وقد زوّد الباحث النموذج بمعلومات منشورة مسبقًا عن الثغرتين. 6
توضح التجربة أن النموذج أمكنه المساعدة في تطوير سلسلة استغلال لثغرات معلنة ضمن اختبار، لا أنه اخترق جهاز ضحية أو هدفًا حيًا. وبحسب المعلومات المتاحة في التقارير، لا يوجد ما يثبت استخدام GLM-5.3 لاختراق هدف في العالم الحقيقي. 5
6
تقول Anthropic إن إتاحة قدرات متقدمة لبناء الاستغلال قد تفيد المهاجمين والمدافعين على حد سواء. كما دعت إلى تمكين المدافعين من استخدام نماذج متقدمة للعثور على الثغرات وإصلاحها. 1
12
وهنا تكمن المفاضلة: الأوزان المفتوحة تتيح للباحثين والمدافعين تشغيل النموذج والاستفادة منه، لكنها تمنح المستخدمين أيضًا قدرة أكبر على تشغيله أو تعديله خارج ضوابط مطوّره. وتضيف نتائج الاختبارات مادة مهمة إلى نقاش الوصول والسلامة، لكنها لا تحسم وحدها ما إذا كان تقييد النماذج سيجعل الأمن السيبراني أكثر أمانًا إجمالًا. 4
12
الخلاصة الأضيق والأكثر دقة: اقترب GLM-5.3 من Mythos Preview في اختبار استغلال واحد لدى Anthropic، وأظهرت المحاكاة أن ضوابطه قابلة للتجاوز بأساليب اختُبرت. أما تقييم NIST الأوسع فوضعه دون النماذج الأميركية الرائدة بنحو أربعة أشهر، ولم تكن العروض المعلنة هجمات على أهداف حية. 12
17
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
في اختبار ExploitBench المعزول، أنشأ GLM 5.3 ثغرات قابلة للتنفيذ في 50 محاولة من أصل 410، مقابل 56 محاولة لـClaude Mythos Preview.
في اختبار ExploitBench المعزول، أنشأ GLM 5.3 ثغرات قابلة للتنفيذ في 50 محاولة من أصل 410، مقابل 56 محاولة لـClaude Mythos Preview. قالت Anthropic إن أساليب بسيطة تجاوزت ضوابط GLM 5.3 في 64% إلى 100% من اختبارات المحاكاة؛ وهذه النسب لا تمثل احتمال نجاح هجوم حقيقي.
تقييم NIST الأوسع وضع النموذج متأخرًا بنحو أربعة أشهر عن نماذج الذكاء الاصطناعي الأميركية الرائدة حاليًا.