अपग्रेडेड Claude 3.5 Sonnet ने 2025 की शुरुआत में SWE bench Verified पर 49.0% स्कोर किया; बाद में Claude Opus 5 का एक लीडरबोर्ड स्कोर 97.0% रिपोर्ट हुआ। SWE bench Verified 500 सार्वजनिक, मानव फिल्टर किए गए GitHub इश्यू पर आधारित है और संतृप्ति के करीब है; SWE bench Pro व्यापक तथा अपेक्षाकृत कम कंटैमिनेशन जोखिम वाला...
प्रकाशितकर्ताGPT-5.6 Terra से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Claude के रिपोर्टेड कोडिंग-बेंचमार्क नतीजों में तेज़ उछाल दिखता है: 2025 की शुरुआत में अपग्रेडेड Claude 3.5 Sonnet ने SWE-bench Verified पर 49% स्कोर किया, कुछ महीनों बाद Claude 4 मॉडल लगभग 72.5%–72.7% तक पहुंचे, और बाद के लीडरबोर्ड पर स्कोर बेंचमार्क की अधिकतम सीमा के बहुत करीब दिखे। 23
24
9
लेकिन इसका सही निष्कर्ष यह नहीं है कि Claude ने पूरी सॉफ्टवेयर इंजीनियरिंग हल कर ली है। अधिक सटीक बात यह है कि प्रकाशित कोडिंग-एजेंट मूल्यांकनों में Claude बेहद प्रतिस्पर्धी है और कई जगह अग्रणी भी है। जब सीमित, सार्वजनिक बेंचमार्क पर स्कोर 100% के पास पहुंचते हैं, तब असली सवाल यह बनता है कि कौन-सा परीक्षण किसी कंपनी के अपने कोडबेस, टूलिंग और कोड-रिव्यू प्रक्रिया में प्रदर्शन का बेहतर अनुमान देता है।
| बेंचमार्क | एजेंट को क्या करना होता है | दायरा और स्कोरिंग | इसका महत्व |
|---|---|---|---|
| SWE-bench Verified | वास्तविक GitHub इश्यू और रिपॉजिटरी का एक स्नैपशॉट लेकर पैच बनाना | 500 मानव-फिल्टर किए गए SWE-bench उदाहरण; पैच को मूल्यांकन वातावरण में टेस्ट पास करने पर हल माना जाता है। |
असली कोडबेस में इश्यू सुलझाने का व्यापक रूप से मान्य परीक्षण |
| SWE-bench Pro | मानकीकृत एजेंट ढांचे में अधिक कठिन, लंबे समय वाले रिपॉजिटरी कार्य हल करना | रिपोर्टेड रूप से 41 रिपॉजिटरी और 123 प्रोग्रामिंग भाषाओं के 1,865 कार्य; सामान्यतः Pass@1 से स्कोर। |
Verified के सार्वजनिक, मुख्यतः Python-केंद्रित कार्यों से आगे जाने और डेटा-कंटैमिनेशन जोखिम घटाने की कोशिश |
| Terminal-Bench 4.0 | टर्मिनल में शुरू से अंत तक तकनीकी काम करना | जांच-पड़ताल, कमांड चलाना, फाइल संपादित करना, टेस्ट करना और विफलता से उबरना जैसे कार्य। |
एजेंट के व्यावहारिक टूल-उपयोग और ऑपरेशनल वर्कफ़्लो को जांचता है |
Anthropic ने बताया था कि अपग्रेडेड Claude 3.5 Sonnet ने SWE-bench Verified पर 49.0% स्कोर किया, जो तब के 45% रिपोर्टेड सर्वश्रेष्ठ स्तर से अधिक था। उस समय Anthropic के अनुसार कोई मॉडल 50% का आंकड़ा पार नहीं कर पाया था। 23
37
मई 2025 में Anthropic ने SWE-bench Verified पर Claude Opus 4 के लिए 72.5% और Claude Sonnet 4 के लिए 72.7% रिपोर्ट किया। ये आंकड़े extended thinking के बिना बताए गए थे। 24
2026 तक लीडरबोर्ड तस्वीर काफी बदल चुकी थी। Vals AI के अनुसार Claude Opus 5 ने 97.0% स्कोर किया; सात मूल्यांकित मॉडल 95% या उससे ऊपर थे और DeepSeek V4 Pro 0813 ने 96.4% स्कोर किया। 9 इसलिए “Opus 5 का करीब 96%” कहना ऊंचे-90 के रिपोर्टेड नतीजे का उपयोगी संक्षेप है, लेकिन इसे अकेला निर्णायक आंकड़ा नहीं मानना चाहिए। मॉडल संस्करण, एजेंट ढांचा, टोकन बजट और मूल्यांकन सेटअप—सभी स्कोर बदल सकते हैं।
500 कार्यों वाले सेट पर 97% का अर्थ है कि शीर्ष प्रणालियों के बीच फर्क दिखाने की गुंजाइश बहुत कम बचती है। इससे भी अहम बात: Verified के कार्य सार्वजनिक रिपॉजिटरी से आए सीमित और सार्वजनिक कार्य हैं। बेंचमार्क गाइडेंस इसे डेटा-कंटैमिनेशन और संतृप्ति के लिहाज से उच्च जोखिम वाला मानती है। 3
इसका मतलब यह नहीं कि स्कोर बेकार है। इसका मतलब बस इतना है कि यह किसी एजेंट की स्पष्ट रूप से परिभाषित और टेस्ट से सत्यापित होने वाली इश्यू-समाधान क्षमता का मजबूत संकेत है—न कि किसी निजी, लगातार बदलते कोडबेस में नए काम के प्रदर्शन का पूरा पूर्वानुमान।
SWE-bench Pro को अधिक कठिन और कंटैमिनेशन के प्रति अधिक प्रतिरोधी विकल्प के रूप में पेश किया गया है। रिपोर्टेड दायरा 41 रिपॉजिटरी, 123 प्रोग्रामिंग भाषाएं और 1,865 कार्य है, जबकि Verified में लोकप्रिय Python रिपॉजिटरी से 500 मानव-फिल्टर किए गए उदाहरण हैं। 12
16
सितंबर 2026 के प्रकाशित एग्रीगेट लीडरबोर्ड में Claude Fable 5.1 को 81.2% पर रखा गया, जो Claude Mythos 5 के 80.3% और Claude Fable 5 के 80.0% से आगे था। 53 उस लीडरबोर्ड पर शीर्ष तीन स्थान Claude मॉडल के पास थे।
फिर भी एक अहम सावधानी जरूरी है: Pro के सभी अंक सीधे तुलना योग्य नहीं हैं। एक स्रोत Scale के मानकीकृत सार्वजनिक सेट पर शीर्ष स्कोर 59.1% बताता है, जबकि कुछ विक्रेता-आधारित एग्रीगेट आंकड़े इससे काफी अधिक हैं। इससे स्पष्ट है कि एजेंट हार्नेस और रिपोर्टिंग पद्धति नतीजों पर बड़ा असर डाल सकती है। 13 एक अन्य स्रोत यह भी चेतावनी देता है कि Fable 5.1 का 81.2% आंकड़ा सीधे प्रकाशित, मॉडल-विशिष्ट SWE-bench परिणाम से साफ तौर पर समर्थित नहीं है; यह एग्रीगेशन या संस्करण-एट्रिब्यूशन का मुद्दा हो सकता है।
55
व्यावहारिक निष्कर्ष: 81.2% को रिपोर्टेड लीडरबोर्ड वैल्यू मानें, न कि केवल बेस मॉडल के बारे में स्वतंत्र रूप से दोहराया गया, अंतिम तथ्य।
Terminal-Bench कमांड-लाइन वातावरण में तकनीकी एजेंट कार्य का मूल्यांकन करता है—जैसे सॉफ्टवेयर बनाना या मशीन-लर्निंग मॉडल को ट्रेन करना। यह SWE-bench Verified के इश्यू-और-पैच प्रारूप से अलग, अधिक ऑपरेशनल वर्कफ़्लो की जांच करता है। 38
उद्धृत तुलना में Claude Fable 5.1 का 55.8% और GPT-5.6 Sol का 37.3% स्कोर बताया गया है—यानी 18.5 प्रतिशत अंक का अंतर। 44 यह उस रिपोर्टेड Claude कॉन्फ़िगरेशन के इस विशेष मूल्यांकन में बेहतर प्रदर्शन का अर्थपूर्ण संकेत है।
हालांकि, इससे Anthropic, OpenAI, Google, Cognition या AWS की कोई सार्वभौमिक रैंकिंग साबित नहीं होती। ऐसा निष्कर्ष निकालने के लिए समान मॉडल परिस्थितियां, एक जैसे एजेंट ढांचे, तुलनीय टोकन व समय बजट, और कई स्वतंत्र टेस्ट सूट पर परिणाम चाहिए होंगे। उपलब्ध साक्ष्य ऐसी व्यापक तुलना नहीं देते।
उपलब्ध नतीजे तीन मापे जा सकने वाले दावों का समर्थन करते हैं:
ये नतीजे यह नहीं दिखाते कि Claude अपने आप कई सप्ताह चलने वाली परियोजनाएं पूरी कर देगा, बिना दस्तावेज वाले आंतरिक सिस्टम को भरोसेमंद ढंग से समझ लेगा, सही आर्किटेक्चर फैसले करेगा, या मानव समीक्षा के बिना सुरक्षित रूप से रिलीज़ कर देगा। SWE-bench कार्यों में टेस्ट से सत्यापित परिणाम मिलते हैं; वास्तविक इंजीनियरिंग में जरूरतों को समझना, समझौते तय करना, इंटीग्रेशन, सुरक्षा, डिप्लॉयमेंट और टीम के साथ सहयोग भी शामिल है।
SWE-bench Verified इसलिए उपयोगी था क्योंकि यह छोटे कोडिंग-पज़ल से आगे बढ़कर वास्तविक रिपॉजिटरी और इश्यू विवरण पर एजेंटों को परखता है, तथा पैच को टेस्ट से ग्रेड करता है। 1
38 लेकिन Anthropic की एजेंट-इवैलुएशन चर्चा के अनुसार मॉडल लगभग 40% से बढ़कर एक वर्ष में 80% से ऊपर पहुंच गए।
38
इस चरण में किसी संगठन के लिए उपयोगी मूल्यांकन ढांचे में शामिल होना चाहिए:
Anthropic ने SWE-bench Verified और Terminal-Bench, दोनों को एजेंट मूल्यांकन के उदाहरण के रूप में बताया है और Claude 4 की लंबी अवधि तक काम करने की क्षमता पर जोर दिया है। 38
42 लेकिन उपलब्ध साक्ष्य यह सिद्ध करने के लिए पर्याप्त नहीं हैं कि कंपनी ने औपचारिक रूप से SWE-bench से हटकर लंबे-क्षितिज वाले मूल्यांकनों की ओर रणनीतिक बदलाव कर लिया है।
सितंबर 2026 तक रिपोर्टेड बेंचमार्क प्रदर्शन के आधार पर Claude, कोडिंग एजेंट चुनते समय परखने लायक सबसे मजबूत विकल्पों में है। सबसे स्पष्ट मील का पत्थर 2025 की शुरुआत में SWE-bench Verified पर 49% से Opus 5 के रिपोर्टेड 97.0% लीडरबोर्ड स्कोर तक का सफर है; इसके साथ SWE-bench Pro पर 81.2% की रिपोर्टेड बढ़त भी है। 23
9
53
टूल चुनने का फैसला केवल एक बड़े स्कोर या हेडलाइन पर न करें। इन नतीजों का इस्तेमाल एजेंटों की शॉर्टलिस्ट बनाने में करें, फिर अपने ही रिपॉजिटरी के प्रतिनिधि कार्यों पर नियंत्रित मूल्यांकन चलाएं। लगभग संतृप्त सार्वजनिक बेंचमार्क यह दिखाते हैं कि मॉडल कई परिचित ढंग के इश्यू ठीक कर सकते हैं; वे अपने आप किसी प्रोडक्शन संगठन में भरोसेमंद स्वायत्त इंजीनियरिंग सिद्ध नहीं करते।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
अपग्रेडेड Claude 3.5 Sonnet ने 2025 की शुरुआत में SWE bench Verified पर 49.0% स्कोर किया; बाद में Claude Opus 5 का एक लीडरबोर्ड स्कोर 97.0% रिपोर्ट हुआ।
अपग्रेडेड Claude 3.5 Sonnet ने 2025 की शुरुआत में SWE bench Verified पर 49.0% स्कोर किया; बाद में Claude Opus 5 का एक लीडरबोर्ड स्कोर 97.0% रिपोर्ट हुआ। SWE bench Verified 500 सार्वजनिक, मानव फिल्टर किए गए GitHub इश्यू पर आधारित है और संतृप्ति के करीब है; SWE bench Pro व्यापक तथा अपेक्षाकृत कम कंटैमिनेशन जोखिम वाला परीक्षण है।
Terminal Bench 4.0 की उद्धृत तुलना में Claude Fable 5.1 ने 55.8% और GPT 5.6 Sol ने 37.3% स्कोर किया, लेकिन यह पूरे उद्योग की अंतिम रैंकिंग नहीं है।