انتقلت نتيجة Claude المُبلّغ عنها على SWE bench Verified من 49.0% لطراز Claude 3.5 Sonnet المُحدّث إلى 97.0% لطراز Opus 5 في إحدى لوحات الصدارة. اختبار Verified يضم 500 مسألة عامة تركز في الغالب على مستودعات بايثون، وهو يقترب من التشبّع؛ أما SWE bench Pro فأوسع وأصعب، لكن الأرقام تتأثر بإطار تشغيل الوكيل ومنهجية الت...
نشر بواسطةتم التحرير باستخدام GPT-5.6 Terraتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
حققت نماذج Claude تقدمًا كبيرًا في اختبارات وكلاء البرمجة، لكن قراءة الأرقام بمعزل عن تصميم الاختبار قد تكون مضللة. فمن 49.0% في SWE-bench Verified مطلع 2025، وصلت النتائج المُبلّغ عنها لاحقًا إلى نطاق يقترب من السقف النظري للاختبار. 23
9
الخلاصة الأدق ليست أن Claude «حلّ هندسة البرمجيات»، بل أنه أصبح من أقوى الخيارات — وغالبًا في الصدارة — في تقييمات إصلاح الشيفرة المنشورة. ومع اقتراب النتائج من 100% في اختبار عام ومحدود المسائل، يصبح السؤال الأهم: أي تقييم يتنبأ فعلًا بأداء الوكيل داخل مستودعات شركتك وأدواتها ومراجعاتها البرمجية؟
| الاختبار | ما الذي يفعله الوكيل؟ | النطاق وطريقة احتساب النتيجة | لماذا يهم؟ |
|---|---|---|---|
| SWE-bench Verified | يتلقى مشكلة حقيقية من GitHub ولقطة من مستودع برمجي، ثم ينتج رقعة شيفرة (patch). | مجموعة تضم 500 حالة راجعها البشر، معظمها من مستودعات بايثون مفتوحة المصدر وشائعة. تُحتسب المهمة محلولة إذا اجتازت الرقعة اختبارات التقييم في بيئة الاختبار. |
مقياس معروف لقدرة الوكيل على حل مشكلات محددة في قواعد شيفرة حقيقية. |
| SWE-bench Pro | يعالج مهام مستودعات أصعب وأطول أفقًا ضمن إطار وكيل موحّد. | يُبلّغ عنه باعتباره 1,865 مهمة من 41 مستودعًا وبـ123 لغة برمجة، وعادة يُقاس بـPass@1، أي نجاح المحاولة الأولى. |
يوسّع النطاق خارج مسائل Verified العلنية والمتمحورة حول بايثون، ويهدف إلى خفض مخاطر تلوث البيانات. |
| Terminal-Bench 4.0 | ينفذ عملًا تقنيًا متكاملًا داخل بيئة طرفية (Terminal). | يتضمن التحقيق، وتشغيل الأوامر، وتعديل الملفات، والاختبار، والتعافي من الإخفاقات؛ لا يقتصر على إصلاح تذكرة GitHub. |
يضيف متطلبات تشغيلية واستخدام أدوات أقرب إلى سير عمل الوكلاء الفعليين. |
أفادت Anthropic بأن النسخة المُحدّثة من Claude 3.5 Sonnet حققت 49.0% على SWE-bench Verified، متجاوزة أفضل نتيجة مُبلّغ عنها سابقًا عند 45%. وفي ذلك الوقت، قالت الشركة إنه لم يتجاوز أي نموذج بعد حاجز 50%. 23
37
وفي مايو/أيار 2025، أعلنت Anthropic نتيجتي 72.5% لـClaude Opus 4 و72.7% لـClaude Sonnet 4 على الاختبار نفسه، من دون استخدام وضع «التفكير الموسّع». 24
بحلول 2026، تغيرت صورة لوحة الصدارة جذريًا: إذ تعرض Vals AI نتيجة 97.0% لـClaude Opus 5، مع سبعة نماذج عند 95% أو أعلى، ونتيجة 96.4% لـDeepSeek V4 Pro 0813. 9 لذلك، فاختصار نتيجة Opus 5 إلى «نحو 96%» معقول كدلالة على أداء في التسعينيات المرتفعة، لكنه ليس رقمًا وحيدًا نهائيًا؛ فالنتيجة تعتمد على إصدار النموذج، وإطار الوكيل، والميزانية الحسابية، وإعداد التقييم.
في مجموعة من 500 مهمة، تترك نتيجة 97% هامشًا ضيقًا جدًا للفصل بين الأنظمة المتقدمة. والأهم أن Verified مبني من مسائل عامة ومحدودة العدد، مصدرها مستودعات عامة؛ وتصف إرشادات مقارنة الاختبارات مخاطر التلوث فيه بأنها مرتفعة، كما تشير إلى أنه يقترب من التشبع. 3
لا يجعل ذلك النتيجة بلا قيمة. لكنه يعني أن فائدتها الأساسية هي إظهار قدرة الوكيل على حل هذا النوع من المشكلات الواضحة والقابلة للتحقق بالاختبارات، لا تقديم توقع كامل لأدائه في قاعدة شيفرة خاصة ومتغيرة باستمرار.
يُقدَّم SWE-bench Pro باعتباره بديلًا أصعب وأكثر مقاومة لتلوث البيانات. فالنطاق المُبلّغ عنه هو 1,865 مهمة عبر 41 مستودعًا و123 لغة برمجة، مقارنة بـ500 حالة منتقاة بشريًا في Verified الذي يتركز أساسًا على بايثون. 12
16
وتضع لوحات تجميعية منشورة في سبتمبر/أيلول 2026 Claude Fable 5.1 عند 81.2%، متقدمًا على Claude Mythos 5 عند 80.3% وClaude Fable 5 عند 80.0%. 53 ووفق هذه اللوحة، تشغل نماذج Claude المراكز الثلاثة الأولى.
لكن المقارنة بين أرقام Pro ليست مباشرة دائمًا. فهناك مصدر يميز بين نتيجة رائدة قدرها 59.1% على مجموعة Scale العامة الموحّدة، وبين أرقام تجميعية أعلى منشورة من جهات أخرى؛ وهو ما يوضح أثر إطار الوكيل ومنهجية التقرير في النتيجة. 13 كما يحذر مصدر آخر من أن رقم 81.2% لـFable 5.1 لا يستند بوضوح إلى نتيجة منشورة مباشرة خاصة بالنموذج، وقد يكون ناتجًا من تجميع أو إسناد غير دقيق للإصدار.
55
القراءة العملية: تعامل مع 81.2% بوصفها قيمة معلنة في لوحة صدارة، لا حقيقة مستقرة ومستقلة التحقق عن النموذج الأساسي وحده.
يقيس Terminal-Bench عمل الوكيل التقني داخل سطر الأوامر، مثل بناء برمجيات أو تدريب نموذج تعلم آلي. وهو يختلف عن صيغة «مشكلة ورقعة» في SWE-bench Verified لأنه يختبر سير عمل أكثر تشغيلية وتدرجًا. 38
المقارنة المذكورة تمنح Claude Fable 5.1 نسبة 55.8%، مقابل 37.3% لـGPT-5.6 Sol، بفارق 18.5 نقطة مئوية. 44 وهذا دليل مهم على أن إعداد Claude المُبلّغ عنه قدّم أداءً أفضل في هذا التقييم.
لكنه لا يثبت ترتيبًا عامًا بين Anthropic وOpenAI وGoogle وCognition وAWS. فمثل هذا الادعاء يتطلب نماذج متكافئة، وإطار وكيل واحدًا، وميزانيات زمنية ورمزية متقاربة، ونتائج عبر عدة مجموعات مستقلة من المهام — وهي مقارنة لا توفرها الأدلة المتاحة هنا.
تدعم النتائج المتاحة ثلاث خلاصات قابلة للقياس:
لكنها لا تثبت أن Claude يستطيع إنجاز مشاريع تمتد لأسابيع بصورة مستقلة، أو فهم أنظمة داخلية غير موثقة بشكل موثوق، أو اتخاذ قرارات معمارية سليمة، أو نشر برمجيات بأمان من دون مراجعة بشرية. فمهام SWE-bench تملك نتائج يمكن التحقق منها بالاختبارات، بينما يتضمن العمل الهندسي الواقعي اكتشاف المتطلبات، والمفاضلات، والتكامل، والأمن، والنشر، والتعاون بين الفرق.
اكتسب SWE-bench Verified أهميته لأنه تجاوز ألغاز البرمجة القصيرة: يعمل الوكيل على مستودعات حقيقية وأوصاف مشكلات فعلية، وتُقيَّم رقعه بواسطة الاختبارات. 1
38 لكن Anthropic أشارت إلى أن النماذج انتقلت من نحو 40% إلى أكثر من 80% على هذا التقييم خلال عام واحد.
38
لذلك، من الأفضل أن تجمع المؤسسة بين طبقات من التقييم:
تصف Anthropic كلاً من SWE-bench Verified وTerminal-Bench كأمثلة لتقييمات الوكلاء، كما شددت على قدرة Claude 4 على المهام الطويلة. 38
42 لكن الأدلة المتاحة لا تكفي لإثبات ادعاء أقوى مفاده أن الشركة تبنت رسميًا تحولًا شاملًا بعيدًا عن SWE-bench نحو تقييمات أطول أفقًا.
تجعل نتائج Claude المُبلّغ عنها منه أحد أقوى وكلاء البرمجة الذين تستحق المؤسسات تقييمهم حتى سبتمبر/أيلول 2026. وأوضح مؤشر على هذا التقدم هو الانتقال من 49% على SWE-bench Verified في مطلع 2025 إلى 97.0% كنتيجة Opus 5 في إحدى لوحات الصدارة، إلى جانب صدارة مُبلّغ عنها عند 81.2% على SWE-bench Pro. 23
9
53
لكن لا ينبغي اختيار أداة تطوير اعتمادًا على عنوان واحد. استخدم هذه النتائج لتكوين قائمة مختصرة، ثم نفّذ تقييمًا مضبوطًا على مهام تمثل مستودعاتك أنت. فالاختبارات العامة القريبة من التشبع تثبت أن الوكلاء يستطيعون إصلاح طيف واسع من المشكلات المعروفة النمط؛ لكنها لا تثبت، وحدها، هندسة برمجيات ذاتية الاعتماد في بيئة إنتاجية.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
انتقلت نتيجة Claude المُبلّغ عنها على SWE bench Verified من 49.0% لطراز Claude 3.5 Sonnet المُحدّث إلى 97.0% لطراز Opus 5 في إحدى لوحات الصدارة.
انتقلت نتيجة Claude المُبلّغ عنها على SWE bench Verified من 49.0% لطراز Claude 3.5 Sonnet المُحدّث إلى 97.0% لطراز Opus 5 في إحدى لوحات الصدارة. اختبار Verified يضم 500 مسألة عامة تركز في الغالب على مستودعات بايثون، وهو يقترب من التشبّع؛ أما SWE bench Pro فأوسع وأصعب، لكن الأرقام تتأثر بإطار تشغيل الوكيل ومنهجية التقرير.
تفوق Claude Fable 5.1 المُبلّغ عنه على GPT 5.6 Sol في Terminal Bench 4.0، بنتيجة 55.8% مقابل 37.3%، دليل على هذا التكوين في اختبار محدد وليس تصنيفًا شاملاً للشركات.