Улучшенный Claude 3.5 Sonnet показал 49,0% на SWE bench Verified в начале 2025 года; позже Claude Opus 5 получил 97,0% в лидерборде Vals AI. SWE bench Verified состоит из 500 публичных задач по исправлению GitHub issues, в основном из Python проектов, и всё сильнее приближается к насыщению.
ОпубликовалОтредактировано с помощью GPT-5.6 TerraИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Показатели Claude на бенчмарках программирования выросли очень резко. Улучшенный Claude 3.5 Sonnet в начале 2025 года достиг 49,0% на SWE-bench Verified; спустя несколько месяцев Claude 4 показал около 72,5–72,7%; а поздние таблицы результатов вывели отдельные системы почти к потолку теста. 23
24
9
Но отсюда не следует, что Claude «решил» задачу разработки ПО. Корректный вывод скромнее: Claude стал очень конкурентоспособным, а в ряде опубликованных оценок — лидирующим агентом для программирования. Когда результат на конечном публичном бенчмарке приближается к 100%, главный вопрос меняется: какой тест лучше предсказывает работу именно в ваших репозиториях, с вашими инструментами и процессом ревью.
| Бенчмарк | Что делает агент | Охват и оценка | Зачем нужен |
|---|---|---|---|
| SWE-bench Verified | Получает реальный GitHub-issue и снимок репозитория, затем готовит патч. | 500 задач из SWE-bench, отобранных и проверенных людьми; преимущественно популярные открытые Python-репозитории. Задача засчитывается, если патч проходит тесты в среде оценки. |
Распространённый индикатор способности исправлять задачи в реальных кодовых базах. |
| SWE-bench Pro | Решает более сложные и длительные задачи в репозиториях при стандартизованной агентной обвязке. | Заявлены 1 865 задач из 41 репозитория на 123 языках; обычно применяется метрика Pass@1. |
Расширяет охват за пределы публичных Python-задач Verified и задуман как более устойчивый к загрязнению данных тест. |
| Terminal-Bench 4.0 | Выполняет сквозные технические задачи в терминале. | Требует расследовать проблему, запускать команды, редактировать файлы, тестировать и восстанавливаться после неудач — не только подготовить патч к issue. |
Проверяет операционные навыки и работу с инструментами, ближе к реальному агентному процессу. |
Anthropic сообщала, что улучшенный Claude 3.5 Sonnet достиг 49,0% на SWE-bench Verified, превзойдя прежний заявленный рекорд в 45%. Тогда компания отмечала, что ни одна модель ещё не преодолела рубеж 50%. 23
37
В мае 2025 года Anthropic заявила 72,5% для Claude Opus 4 и 72,7% для Claude Sonnet 4 на SWE-bench Verified. Эти показатели приводились без режима extended thinking. 24
К 2026 году картина лидербордов заметно изменилась. Vals AI указывает 97,0% для Claude Opus 5; семь протестированных моделей достигли 95% или выше, а DeepSeek V4 Pro 0813 получил 96,4%. 9 Поэтому формулировка «Opus 5 набрал около 96%» допустима как краткое описание результата из верхнего диапазона 90%, но не как единственное окончательное число: балл зависит от версии модели, агентной обвязки, бюджета и настроек оценки.
На наборе из 500 задач результат 97% почти не оставляет пространства для различения передовых систем. Кроме того, Verified состоит из конечного набора публичных задач и публичных репозиториев. Рекомендации по бенчмаркам характеризуют этот тест как подверженный высокому риску загрязнения данных и насыщения. 3
Это не делает показатель бессмысленным. Он остаётся сильным свидетельством, что агент умеет решать хорошо сформулированные и проверяемые тестами задачи такого типа. Но он хуже предсказывает успех в новой, закрытой и постоянно меняющейся кодовой базе компании.
SWE-bench Pro позиционируется как более трудная и более устойчивая к загрязнению данных альтернатива. Заявленный охват — 1 865 задач из 41 репозитория на 123 языках программирования, против 500 отобранных вручную задач Verified из популярных Python-репозиториев. 12
16
В агрегированном лидерборде за сентябрь 2026 года Claude Fable 5.1 указан с результатом 81,2%, впереди Claude Mythos 5 с 80,3% и Claude Fable 5 с 80,0%. 53 В этой таблице три верхние позиции занимают модели Claude.
Здесь, однако, особенно важна оговорка: результаты Pro не всегда сопоставимы напрямую. Один источник отделяет 59,1% — ведущий результат на стандартизованном публичном наборе Scale — от более высоких агрегированных показателей поставщиков. Это показывает, насколько заметно на итог влияют агентная обвязка и методика отчётности. 13 Другой источник прямо предупреждает, что цифра 81,2% для Fable 5.1 не подтверждена напрямую опубликованным результатом конкретной модели и может быть следствием агрегации или ошибки атрибуции версии.
55
Практический вывод: 81,2% следует воспринимать как опубликованное значение лидерборда, а не как окончательно установленный и независимо воспроизведённый факт о базовой модели самой по себе.
Terminal-Bench оценивает техническую работу агента в командной строке: например, сборку ПО или обучение модели машинного обучения. В отличие от схемы «issue и патч» в SWE-bench Verified, здесь проверяется более операционный рабочий процесс. 38
В приведённом сравнении указаны 55,8% для Claude Fable 5.1 и 37,3% для GPT-5.6 Sol — разница составляет 18,5 процентного пункта. 44 Это содержательное свидетельство, что именно заявленная конфигурация Claude лучше справилась с этой оценкой.
Но это не доказывает универсальное превосходство Anthropic над OpenAI, Google, Cognition или AWS. Для такого вывода потребовались бы сопоставленные модели, одинаковая агентная обвязка, равные бюджеты времени и токенов, а также результаты на нескольких независимых наборах задач. Предоставленные данные такого сравнения не содержат.
Имеющиеся данные поддерживают три измеримых утверждения:
Однако эти результаты не показывают, что Claude способен самостоятельно завершать многонедельные проекты, надёжно разбираться в недокументированных внутренних системах, принимать архитектурные решения или безопасно выпускать изменения без проверки. В SWE-bench есть проверяемый тестовый результат; настоящая инженерная работа включает также уточнение требований, компромиссы, интеграцию, безопасность, развёртывание и взаимодействие с командой.
SWE-bench Verified ценен тем, что вышел за пределы коротких задачек по программированию: агент работает с настоящим репозиторием и описанием issue, а патч проверяют тестами. 1
38 Но, по оценке Anthropic, модели за один год поднялись примерно с 40% до более чем 80% на этом тесте.
38
Полезная система оценки для команды должна включать:
Anthropic относит SWE-bench Verified и Terminal-Bench к примерам оценок ИИ-агентов и подчёркивает способность Claude 4 долго работать над задачами. 38
42 Но предоставленных источников недостаточно, чтобы утверждать о формальном переходе компании от SWE-bench к более долгим по горизонту оценкам. Такой более сильный тезис остаётся недоказанным.
По заявленным результатам на сентябрь 2026 года Claude входит в число наиболее сильных кандидатов для оценки в роли агента программирования. Наиболее наглядная веха — путь от 49% на SWE-bench Verified в начале 2025 года до 97,0% у Opus 5 в одном из лидербордов, наряду с заявленным лидерством 81,2% в SWE-bench Pro. 23
9
53
Но выбирать инструмент по одному громкому числу не стоит. Используйте бенчмарки для предварительного отбора, а затем запускайте контролируемое сравнение на репрезентативных задачах в собственных репозиториях. Почти насыщенные публичные тесты показывают, что модели умеют исправлять множество задач знакомого типа; сами по себе они не доказывают надёжную автономную разработку в промышленной среде.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Улучшенный Claude 3.5 Sonnet показал 49,0% на SWE bench Verified в начале 2025 года; позже Claude Opus 5 получил 97,0% в лидерборде Vals AI.
Улучшенный Claude 3.5 Sonnet показал 49,0% на SWE bench Verified в начале 2025 года; позже Claude Opus 5 получил 97,0% в лидерборде Vals AI. SWE bench Verified состоит из 500 публичных задач по исправлению GitHub issues, в основном из Python проектов, и всё сильнее приближается к насыщению.
В приведённом сравнении Terminal Bench 4.0 конфигурация Claude Fable 5.1 набрала 55,8% против 37,3% у GPT 5.6 Sol.