اكتشف DeepSeek V4 Pro عدد 28 من أصل 32 ثغرة عند تجميع ثلاث جولات، بتكلفة تقارب 295 دولارًا؛ وهي أفضل نتيجة استدعاء في الاختبار، لكنها لا تعني أن جولة واحدة تضمن العثور على 28 ثغرة. تشير النتائج إلى أن النظام المنسق هو الرابح الحقيقي: وكلاء منخفضو التكلفة للاستكشاف الواسع، ونماذج أكثر دقة للتحقق والفرز، ومراجعة بشرية...
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
اختبرت شركة Aikido في أغسطس 2026 قدرات 10 نماذج ذكاء اصطناعي في الأمن السيبراني، عبر محاولة إعادة اكتشاف 32 ثغرة منشورة حديثًا، مع تشغيل كل نموذج ثلاث مرات. وأظهرت النتائج أن DeepSeek V4 Pro 0813 حقق أعلى تغطية مجمعة، بعدما عثر على 28 من أصل 32 ثغرة بتكلفة تقارب 295 دولارًا. لكن الخلاصة الأهم ليست اختيار «أفضل نموذج» منفرد، بل بناء نظام يجمع بين التحقيق المتكرر، والتحقق بالأدلة، وتوزيع الأدوار بين نماذج متخصصة. 3
وصل DeepSeek V4 Pro 0813 إلى 28 من أصل 32 ثغرة، أي 87.5% من الاستدعاء المجمّع، عند جمع نتائج الجولات الثلاث. وهذا يجعله أقوى نموذج في مرحلة الاكتشاف ضمن هذا الاختبار، لكن يجب قراءة الرقم باعتباره نتيجة pass@3؛ أي نتيجة ثلاث محاولات مجمعة، وليس دليلًا على أن استدعاءً واحدًا للنموذج سيكتشف 28 ثغرة بصورة موثوقة.
قد تستكشف كل جولة ملفات ومسارات وفرضيات استغلال مختلفة. وعند جمع الجولات، يستفيد النظام من هذا التنوع في البحث، ما يزيد فرص التغطية. عمليًا، تدعم النتيجة تشغيل عدة تحقيقات مستقلة بدل التعامل مع الإجابة الأولى للنموذج باعتبارها تقييمًا أمنيًا مكتملًا. 3
تصدر DeepSeek Pro التغطية الإجمالية بنتيجة 28 من 32، مقابل تكلفة تقارب 295 دولارًا لثلاث جولات. وكانت ميزته الأساسية اتساع نطاق البحث؛ إذ كشف عددًا أكبر من ثغرات الاختبار بعد جمع التحقيقات.
لذلك يبدو مرشحًا قويًا للمرحلة الأولى من سير عمل أمني. غير أن نتائجه تحتاج إلى تحقق قائم على الأدلة، وإزالة للتكرار، ومراجعة للخطورة قبل تحويلها إلى تنبيهات إنتاجية.
عثرت ثلاث جولات من Flash على 24 من أصل 32 ثغرة، بتكلفة تقارب 108 دولارات. وتمنحه هذه النتيجة نسبة تغطية إلى تكلفة جذابة، وتجعله مناسبًا للفحوص المتوازية منخفضة التكلفة أو لإعادة تشغيل التحقيقات.
لكن ذلك لا يعني أنه أفضل مراجع نهائي تلقائيًا. تكمن قيمته العملية في زيادة عدد محاولات التحقيق ضمن ميزانية محددة، ثم تمرير النتائج المجمعة إلى مرحلة تحقق أكثر انتقائية. 3
برز Grok 4.6 في قابلية تكرار النتائج؛ إذ ظهرت 21 ثغرة في جميع جولاته الثلاث. ويكتسب هذا الاتساق أهمية عندما تحتاج الفرق إلى سلوك يمكن التنبؤ به، وتقارير مستقرة، وفروق أقل بين فحص وآخر.
وتختلف قوته عن قوة DeepSeek Pro: فقد يكون النموذج شديد الاتساق أفضل للرصد المتكرر أو سير العمل الموحد، حتى لو حقق نموذج أكثر استكشافًا استدعاءً مجمعًا أعلى.
حقق Claude Opus 5 استدعاءً مجمعًا بلغ 26 من 32، بينما وصل GPT-5.6 Sol إلى 25 من 32. وظل كلاهما من الخيارات القوية، لكن النتائج أضعفت الافتراض القائل إن النموذج المغلق والأعلى تكلفة يجب أن يقدم بالضرورة أفضل تغطية للثغرات.
وعليه، لا ينبغي اختيار أي منهما لمجرد الاسم أو السمعة العامة في الاختبارات. الأفضل أن تقيس الفرق ما إذا كان أسلوب الاستدلال أو إعداد التقارير أو سلوك المراجعة يضيف قيمة إلى بقية منظومة الأمن. 3
كانت أبرز نتائج Kimi K3 تحقيق دقة مجمعة بلغت 92.3%. وتقيس الدقة نسبة النتائج المبلّغ عنها التي جرى قبولها، لا العدد الإجمالي للثغرات التي اكتشفها النموذج.
وهذا الفرق يجعله مناسبًا لدور مختلف عن دور نموذج البحث واسع النطاق. فالوكيل عالي الاستدعاء يستطيع البحث على نطاق واسع مع قدر أكبر من الضوضاء، بينما يساعد النموذج عالي الدقة في التحقق من النتائج، وإعداد التقارير، وتقليص عدد التنبيهات التي تصل إلى المهندسين.
لاحظت Aikido أن Qwen3.8-Max كان يعود إلى ثغرة CVE نفسها أو إلى مسار الاستدلال ذاته. ويصبح هذا التكرار غير فعال عندما يستهلك جولات التحقيق دون توسيع التغطية، لكنه قد يكون مفيدًا أيضًا إذا أدى الفحص الثاني إلى كشف شرط استغلال أو مسار تنفيذ أو تفصيل تحقق لم يظهر في المرة الأولى.
والحل العملي يجب أن يكون على مستوى بيئة تشغيل الوكيل: تسجيل ما جرى اختباره، ووضع حدود للفروع المتكررة، وتوجيه الحالات غير المحسومة إلى تحقيق جديد بدل إعادة تشغيل المسار نفسه آليًا.
تحسن GLM-5.3 من 24 من 32 إلى 25 من 32 في المقارنة المحدثة، مع احتفاظه بملف تكلفة أقل من البدائل المغلقة المتقدمة التي تناولها الاختبار. ويجعله ذلك عاملًا مناسبًا للأحمال الكبيرة أو مكوّنًا داخل منظومة تجمع عدة نماذج.
وتظهر قيمته بصورة أكبر عندما تستفيد المؤسسات من انخفاض التكلفة ومرونة النشر لتشغيل تحقيقات أكثر، بدل الاعتماد على مرور واحد لأي نموذج.
لا ينبغي لمنظومة اكتشاف الثغرات أن تختزل أداءها في رقم واحد على لوحة النتائج:
وتصف هذه المقاييس احتياجات تشغيلية مختلفة. فمرحلة الاكتشاف تستفيد من الاستدعاء المرتفع والسلوك الاستقصائي المتنوع، بينما تحتاج التنبيهات الإنتاجية إلى دقة عالية، وأدلة قابلة لإعادة الفحص، وإزالة للتكرار، وترتيب مفيد للمخاطر.
لذلك قد يكون النموذج الممتاز في العثور على الاحتمالات خيارًا سيئًا لإرسال تنبيهات غير مراجعة مباشرة إلى المطورين.
أهم درس متعلق بالأنظمة هو أن أداء النماذج كان عشوائيًا جزئيًا. فالجولة الواحدة لا تستكشف سوى مسار تحقيق واحد، بينما تزيد عدة جولات مستقلة فرص اختبار فرضيات مختلفة.
ولهذا استطاعت ثلاث جولات منخفضة التكلفة من DeepSeek أن تنافس، أو تتجاوز، التغطية الإجمالية لجولة واحدة من نماذج متقدمة أعلى تكلفة. فالوحدة المهمة ليست استدعاء النموذج وحده، بل التحقيق الكامل: النموذج، والأدوات، والتعليمات، وميزانية الجولات، والذاكرة، وإعادة التشغيل، وآلية التحقق. 3
يمكن لبنية عملية مبنية على هذه النتائج أن تفصل بين الاكتشاف واتخاذ الحكم:
ويبدو هذا النهج القائم على توزيع المهام بين النماذج أكثر متانة من التعامل مع النماذج مفتوحة الأوزان أو المغلقة كبدائل جاهزة ومتطابقة.
تقدم نتائج Aikido مؤشرًا مفيدًا، لكنها لا تمثل ترتيبًا عالميًا لنماذج الأمن السيبراني. فقد شمل الاختبار 32 ثغرة منشورة حديثًا، وثلاث محاولات لكل نموذج، وبيئة تشغيل محددة للوكلاء. ويمكن أن يتغير الأداء بحسب لغة البرمجة، وبنية المستودع، والوصول إلى الأدوات، ونموذج التهديد، وميزانية التحقيق، ومدى تقبل المؤسسة للنتائج الإيجابية الكاذبة. 3
والخلاصة الأكثر تحفظًا وفائدة هي أن النماذج مفتوحة الأوزان، وخصوصًا DeepSeek V4 Pro، استطاعت في هذا السياق منافسة النماذج المغلقة المتقدمة أو تجاوزها عند دعمها بالتكرار والتنسيق. لكن المنتج الأمني الفائز ليس بالضرورة النموذج صاحب أعلى رقم دعائي، بل النظام الذي يجمع بين اكتشاف واسع، وتحقق موثوق، وأدلة يستطيع المهندسون التصرف بناءً عليها.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
اكتشف DeepSeek V4 Pro عدد 28 من أصل 32 ثغرة عند تجميع ثلاث جولات، بتكلفة تقارب 295 دولارًا؛ وهي أفضل نتيجة استدعاء في الاختبار، لكنها لا تعني أن جولة واحدة تضمن العثور على 28 ثغرة.
اكتشف DeepSeek V4 Pro عدد 28 من أصل 32 ثغرة عند تجميع ثلاث جولات، بتكلفة تقارب 295 دولارًا؛ وهي أفضل نتيجة استدعاء في الاختبار، لكنها لا تعني أن جولة واحدة تضمن العثور على 28 ثغرة. تشير النتائج إلى أن النظام المنسق هو الرابح الحقيقي: وكلاء منخفضو التكلفة للاستكشاف الواسع، ونماذج أكثر دقة للتحقق والفرز، ومراجعة بشرية للنتائج المؤثرة.