За оприлюдненими даними, Claude пройшов шлях від 49,0% на SWE bench Verified на початку 2025 року до 97,0% для Opus 5 в одному з лідербордів у 2026 му. SWE bench Verified містить 500 публічних, переважно Python завдань із GitHub і наближається до насичення; SWE bench Pro ширший та задуманий як стійкіший до контаміна...
ОпублікувавВідредаговано за допомогою GPT-5.6 TerraЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Показники Claude в бенчмарках для програмування справді зросли дуже різко: оновлений Claude 3.5 Sonnet на початку 2025 року досяг 49,0% у SWE-bench Verified; за кілька місяців Claude 4 показав приблизно 72,5–72,7%; а пізніші лідерборди вже повідомляли про результати, близькі до максимально можливих. 23
24
9
Але висновок тут не в тому, що Claude «розв’язав проблему розробки ПЗ». Коректніше сказати так: Claude став одним із найсильніших, а в окремих оприлюднених оцінюваннях — провідним агентом для коду. Коли результати на скінченному публічному тесті наближаються до 100%, важливішим стає інше питання: яке оцінювання найкраще передбачає роботу саме у ваших репозиторіях, з вашими інструментами та процесом рев’ю.
| Бенчмарк | Що робить агент | Охоплення та оцінювання | Чому це важливо |
|---|---|---|---|
| SWE-bench Verified | Отримує реальний issue з GitHub і знімок стану репозиторію, після чого створює патч. | Людьми відфільтрована вибірка з 500 завдань SWE-bench, переважно з популярних відкритих Python-репозиторіїв. Завдання зараховують, якщо патч проходить тести в середовищі оцінювання. |
Один із найвідоміших тестів здатності виправляти проблеми в реальних кодових базах. |
| SWE-bench Pro | Розв’язує складніші й довші завдання в репозиторіях у стандартизованому агентному середовищі. | Повідомляється про 1 865 завдань із 41 репозиторію та 123 мов програмування; зазвичай використовується метрика Pass@1. |
Має вийти за межі публічних Python-орієнтованих завдань Verified і знизити ризик контамінації даних. |
| Terminal-Bench 4.0 | Виконує наскрізну технічну роботу в терміналі. | Охоплює завдання, де потрібно досліджувати систему, запускати команди, редагувати файли, тестувати й відновлюватися після помилок, а не лише підготувати патч до issue. |
Додає операційні та інструментальні вимоги, ближчі до реальних агентних процесів. |
Anthropic повідомляла, що оновлений Claude 3.5 Sonnet досяг 49,0% у SWE-bench Verified, перевершивши тодішній результат 45%. Компанія зазначала, що на той момент жодна модель ще не подолала позначку 50%. 23
37
У травні 2025 року Anthropic заявила про 72,5% для Claude Opus 4 та 72,7% для Claude Sonnet 4 у SWE-bench Verified. Ці результати було наведено без режиму розширеного міркування. 24
До 2026 року картина в лідербордах суттєво змінилася. Vals AI вказує 97,0% для Claude Opus 5; сім протестованих моделей мають 95% або більше, а DeepSeek V4 Pro 0813 — 96,4%. 9 Тому фраза «Opus 5 має близько 96%» є прийнятним скороченням для результату у верхньому діапазоні 90%, але не є єдиним беззаперечним числом: підсумок залежить від версії моделі, агентного оточення, бюджету та налаштувань оцінювання.
На наборі з 500 завдань результат 97% залишає дуже мало простору, щоб надійно розрізняти передові системи. До того ж Verified складається зі скінченного набору публічних завдань із публічних репозиторіїв. У рекомендаціях щодо бенчмарків його характеризують як тест із високим ризиком контамінації та насичення. 3
Це не робить результат беззмістовним. Він переконливо свідчить, що агент може розв’язувати цей клас чітко сформульованих і тестованих проблем. Водночас це слабший прогноз того, як він упорається з новими задачами в закритій кодовій базі, яка постійно змінюється.
SWE-bench Pro позиціюють як складнішу та стійкішу до контамінації альтернативу. Заявлене охоплення — 1 865 завдань у 41 репозиторії на 123 мовах програмування, проти 500 людськи відфільтрованих завдань Verified із популярних Python-репозиторіїв. 12
16
У зведеному лідерборді за вересень 2026 року зазначено 81,2% для Claude Fable 5.1, що вище за Claude Mythos 5 із 80,3% і Claude Fable 5 із 80,0%. 53 У цій таблиці Claude посідає перші три місця.
Втім, не всі результати Pro можна напряму порівнювати. Одне джерело розрізняє 59,1% як найвищий результат у стандартизованому публічному наборі Scale та вищі агреговані показники від постачальників. Це показує, наскільки агентне оточення й методика звітності можуть змінювати підсумок. 13 Інше джерело прямо попереджає, що показник 81,2% для Fable 5.1 не має чітко оприлюдненого модельно-специфічного підтвердження й може бути наслідком агрегації або помилкового віднесення версії.
55
Практичний висновок простий: 81,2% варто сприймати як заявлений показник лідерборду, а не як остаточно встановлений і незалежно відтворений факт про базову модель сам по собі.
Terminal-Bench оцінює технічну роботу агента в командному рядку — наприклад, збирання ПЗ або навчання моделі машинного навчання. На відміну від формату «issue + патч» у SWE-bench Verified, цей тест перевіряє більш операційний робочий процес. 38
У наведеному порівнянні вказано 55,8% для Claude Fable 5.1 та 37,3% для GPT-5.6 Sol — різниця становить 18,5 відсоткового пункта. 44 Це вагоме свідчення того, що заявлена конфігурація Claude показала кращий результат саме в цьому оцінюванні.
Але це не доводить загального рейтингу Anthropic, OpenAI, Google, Cognition чи AWS. Для такого висновку потрібні зіставні моделі, ідентичні агентні середовища, порівнювані ліміти часу й токенів, а також результати в кількох незалежних наборах завдань. Надані джерела такого порівняння не містять.
Доступні дані підтримують три обережні твердження:
Водночас ці результати не доводять, що Claude здатен автономно завершувати багатотижневі проєкти, стабільно розуміти недокументовані внутрішні системи, ухвалювати правильні архітектурні рішення або безпечно випускати зміни без людського рев’ю. У SWE-bench є перевірюваний тестовий результат; реальна інженерія також охоплює уточнення вимог, компроміси, інтеграцію, безпеку, розгортання та співпрацю в команді.
SWE-bench Verified став цінним тестом, бо вийшов за межі коротких задач на написання коду: агент працює з реальним репозиторієм і описом проблеми, а патч перевіряють тестами. 1
38 Проте, за обговоренням Anthropic щодо оцінювання агентів, моделі за один рік піднялися приблизно з 40% до понад 80% на цьому тесті.
38
На цьому етапі корисна система оцінювання має включати:
Anthropic описувала SWE-bench Verified і Terminal-Bench як приклади оцінювань агентів та наголошувала на здатності Claude 4 працювати над довгими задачами. 38
42 Однак наданих даних недостатньо, щоб стверджувати про формальний загальнокомпанійний перехід Anthropic від SWE-bench до довготриваліших оцінювань. Це сильніше твердження лишається непідтвердженим.
Заявлені результати Claude роблять його одним із найсильніших варіантів серед агентів для програмування, які варто оцінювати станом на вересень 2026 року. Найпомітніша динаміка — від 49% у SWE-bench Verified на початку 2025 року до заявлених 97,0% для Opus 5 у лідерборді Verified, паралельно із заявленими 81,2% лідерства у SWE-bench Pro. 23
9
53
Під час вибору інструмента не варто орієнтуватися на один гучний показник. Використайте ці результати, щоб сформувати короткий список агентів, а потім проведіть контрольоване оцінювання на типових задачах у власних репозиторіях. Майже насичені публічні бенчмарки демонструють, що моделі вміють виправляти багато відомих типів проблем; самі по собі вони не доводять надійної автономної розробки в робочому середовищі.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
За оприлюдненими даними, Claude пройшов шлях від 49,0% на SWE bench Verified на початку 2025 року до 97,0% для Opus 5 в одному з лідербордів у 2026 му.
За оприлюдненими даними, Claude пройшов шлях від 49,0% на SWE bench Verified на початку 2025 року до 97,0% для Opus 5 в одному з лідербордів у 2026 му. SWE bench Verified містить 500 публічних, переважно Python завдань із GitHub і наближається до насичення; SWE bench Pro ширший та задуманий як стійкіший до контамінації, але результати залежать від методики запуску аг...
Порівняння Terminal Bench 4.0 з результатами 55,8% для Claude Fable 5.1 і 37,3% для GPT 5.6 Sol показує перевагу конкретної конфігурації Claude в цьому тесті, а не загальний рейтинг усіх постачальників ШІ.