Claude의 SWE bench Verified 성적은 2025년 초 업그레이드된 Claude 3.5 Sonnet의 49.0%에서, 2026년 Opus 5의 97.0% 리더보드 기록까지 크게 상승했다.[23][9] Verified는 공개된 파이썬 중심의 500개 이슈 해결 과제라 포화와 데이터 오염 위험이 크다. 더 넓은 SWE bench Pro와 실제 조직의 내부 과제를 함께 봐야 한다.[3][12] Terminal Bench 4.0의 55.8% 대 37.3% 비교는 해당 Claude Fable 5.1 구성의 우위를 보여주지만, 전체 AI 기업의 보편적 순위를...
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Claude의 코딩 벤치마크 성적 향상은 분명하다. 업그레이드된 Claude 3.5 Sonnet은 2025년 초 SWE-bench Verified에서 49.0%를 기록했고, Claude 4 계열은 몇 달 뒤 약 72.5~72.7%에 도달했다. 이후 리더보드에서는 Claude Opus 5가 97.0%를 기록했다는 결과도 나왔다.23
24
9
다만 이를 두고 ‘Claude가 소프트웨어 엔지니어링을 해결했다’고 결론 내리기는 이르다. 더 정확한 해석은 Claude가 공개 코딩 에이전트 평가에서 매우 강력하며 선두권 경쟁력을 보였다는 것이다. 유한한 공개 벤치마크의 점수가 100%에 가까워질수록 중요한 질문은 달라진다. 즉, 어느 평가가 우리 조직의 저장소·도구·코드리뷰 방식에서의 성능을 가장 잘 예측하느냐가 핵심이다.
| 벤치마크 | 에이전트가 하는 일 | 범위·채점 방식 | 의미 |
|---|---|---|---|
| SWE-bench Verified | 실제 GitHub 이슈와 저장소 스냅샷을 받고 패치를 만든다. | 사람이 검토해 걸러낸 500개 과제다. 주로 인기 오픈소스 파이썬 저장소에서 왔으며, 평가 환경에서 패치가 테스트를 통과하면 해결로 인정한다. |
실제 코드베이스의 이슈 해결 능력을 보는 대표 지표다. |
| SWE-bench Pro | 표준화된 에이전트 스캐폴드에서 더 어렵고 장기적인 저장소 작업을 해결한다. | 41개 저장소, 123개 프로그래밍 언어에 걸친 1,865개 과제로 보고되며, 통상 Pass@1로 채점한다. |
Verified의 공개·파이썬 중심 과제보다 범위를 넓히고 데이터 오염 위험을 줄이려는 평가다. |
| Terminal-Bench 4.0 | 터미널에서 조사, 명령 실행, 편집, 테스트, 복구까지 포함한 기술 작업을 수행한다. | 단순 이슈 패치가 아니라 도구 사용과 반복 실행이 필요한 종단간 작업을 포함한다. |
실제 에이전트 워크플로에 가까운 운영·도구 사용 능력을 더한다. |
Anthropic은 업그레이드된 Claude 3.5 Sonnet이 SWE-bench Verified에서 **49.0%**를 기록해 당시 종전 최고치 45%를 넘었다고 발표했다. 당시에는 이 벤치마크에서 50%를 넘긴 모델이 없었다.23
37
2025년 5월에는 Anthropic이 **Claude Opus 4 72.5%, Claude Sonnet 4 72.7%**를 보고했다. 이 수치는 확장 사고(extended thinking)를 사용하지 않은 조건에서 보고됐다.24
2026년에는 리더보드 구도가 크게 바뀌었다. Vals AI는 **Claude Opus 5 97.0%**를 제시했고, 평가된 모델 가운데 7개가 95% 이상에 도달했다고 밝혔다. DeepSeek V4 Pro 0813도 96.4%를 기록했다.9 따라서 ‘Opus 5가 약 96%’라는 표현은 고득점 결과를 요약하는 말로는 가능하지만, 하나의 절대적 수치로 받아들이면 안 된다. 모델 버전, 에이전트 스캐폴드, 토큰·시간 예산, 평가 설정에 따라 결과가 달라질 수 있기 때문이다.
500개 과제에서 97%는 최상위 시스템 간 격차를 가르기 어려울 정도로 여유가 적은 점수다. 더구나 Verified는 공개 저장소의 공개·유한 과제로 구성돼 있다. 벤치마크 가이드는 이를 데이터 오염 위험이 높고 포화에 가까운 평가로 분류한다.3
그렇다고 점수가 무의미하다는 뜻은 아니다. 이는 에이전트가 명세가 비교적 분명하고 테스트로 검증 가능한 공개 이슈 유형을 잘 해결한다는 강한 증거다. 반면, 새롭게 변화하는 비공개 코드베이스에서의 성능 전체를 예측하는 지표로는 한계가 있다.
SWE-bench Pro는 더 어려우면서 데이터 오염에 더 강한 대안으로 제시된다. 보고된 범위는 41개 저장소, 123개 언어, 1,865개 과제다. 인기 파이썬 저장소 중심의 500개 인간 검토 과제로 구성된 Verified보다 훨씬 넓다.12
16
2026년 9월 공개 집계 리더보드에서는 **Claude Fable 5.1이 81.2%**로, Claude Mythos 5의 80.3%와 Claude Fable 5의 80.0%를 앞선 것으로 나왔다.53 해당 리더보드 기준으로 Claude가 상위 3개 자리를 차지한 셈이다.
하지만 Pro 점수 역시 모두 같은 기준으로 비교할 수는 없다. 한 자료는 Scale의 표준화된 공개 세트에서는 최고 성적이 **59.1%**인 반면, 공급사별 집계 수치는 더 높게 나타난다고 구분한다. 이는 에이전트 하니스와 보고 방식이 결과에 큰 영향을 줄 수 있음을 보여준다.13 또 다른 자료는 Fable 5.1의 81.2%가 모델별로 직접 공개된 결과로 명확히 뒷받침되지 않으며, 집계 또는 버전 귀속 오류일 수 있다고 지적했다.
55
실무적으로는 81.2%를 ‘리더보드에 보고된 값’으로 보되, 베이스 모델만의 확정적·독립 재현 성적으로 단정하지 않는 편이 적절하다.
Terminal-Bench는 소프트웨어 빌드나 머신러닝 모델 학습처럼 명령줄 환경에서 끝까지 수행해야 하는 기술 작업을 평가한다. GitHub 이슈와 패치를 중심으로 하는 SWE-bench Verified와 달리, 더 운영적인 작업 흐름을 측정한다.38
제시된 비교에서는 **Claude Fable 5.1이 55.8%, GPT-5.6 Sol이 37.3%**로, 18.5%포인트 차이가 났다.44 이는 해당 Claude 구성의 성능이 이 평가에서 더 높았다는 유의미한 근거다.
그러나 이 한 비교만으로 Anthropic, OpenAI, Google, Cognition, AWS 전체의 일반적 순위를 정할 수는 없다. 그런 주장을 하려면 동등한 모델 조건, 동일한 에이전트 스캐폴드, 비슷한 토큰·시간 예산, 여러 독립 과제군의 결과가 필요하다. 제공된 근거만으로는 그 비교가 성립하지 않는다.
현재 자료가 뒷받침하는 주장은 세 가지다.
반대로 이 결과만으로 Claude가 수주 단위 프로젝트를 자율적으로 끝낼 수 있다거나, 문서화되지 않은 내부 시스템을 안정적으로 이해한다거나, 건전한 아키텍처 결정을 내리거나, 검토 없이 안전하게 배포할 수 있다고 말할 수는 없다. SWE-bench 과제는 테스트로 판정 가능한 결과를 갖지만, 실제 개발에는 요구사항 발굴, 트레이드오프, 통합, 보안, 배포, 협업이 함께 따른다.
SWE-bench Verified는 짧은 코딩 퍼즐을 넘어 실제 저장소와 이슈 설명을 다루고, 테스트로 패치를 채점한다는 점에서 큰 의미가 있었다.1
38 하지만 Anthropic의 에이전트 평가 설명에 따르면 모델은 약 1년 만에 이 평가에서 약 40% 수준에서 80% 이상으로 발전했다.
38
현 시점에서 유용한 평가 조합은 다음과 같다.
Anthropic은 SWE-bench Verified와 Terminal-Bench를 모두 에이전트 평가 사례로 설명하고, Claude 4의 장시간 작업 능력도 강조했다.38
42 다만 제공된 근거만으로 Anthropic이 SWE-bench에서 장기 작업 평가로 공식적으로 전략을 전환했다고 단정할 수는 없다.
2026년 9월 기준으로 Claude의 보고된 벤치마크 성적은 코딩 에이전트 후보군에서 강하게 검토할 만한 수준이다. 가장 선명한 이정표는 2025년 초 SWE-bench Verified **49%**에서 Opus 5의 리더보드상 97.0%, 그리고 SWE-bench Pro의 보고된 선두 성적 **81.2%**까지의 변화다.23
9
53
다만 도구 선택을 하나의 헤드라인 숫자로 결정해서는 안 된다. 이 점수들은 후보를 좁히는 출발점으로 쓰고, 최종 선택 전에는 자사 저장소의 대표 과제에서 통제된 비교 평가를 해야 한다. 포화에 가까운 공개 벤치마크는 알려진 유형의 이슈를 다수 고칠 수 있음을 보여준다. 하지만 그것만으로 실제 프로덕션 조직에서 신뢰할 수 있는 자율 소프트웨어 엔지니어링을 증명하지는 못한다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Claude의 SWE bench Verified 성적은 2025년 초 업그레이드된 Claude 3.5 Sonnet의 49.0%에서, 2026년 Opus 5의 97.0% 리더보드 기록까지 크게 상승했다.[23][9]
Claude의 SWE bench Verified 성적은 2025년 초 업그레이드된 Claude 3.5 Sonnet의 49.0%에서, 2026년 Opus 5의 97.0% 리더보드 기록까지 크게 상승했다.[23][9] Verified는 공개된 파이썬 중심의 500개 이슈 해결 과제라 포화와 데이터 오염 위험이 크다. 더 넓은 SWE bench Pro와 실제 조직의 내부 과제를 함께 봐야 한다.[3][12]
Terminal Bench 4.0의 55.8% 대 37.3% 비교는 해당 Claude Fable 5.1 구성의 우위를 보여주지만, 전체 AI 기업의 보편적 순위를 뜻하지는 않는다.[44]