Если ваша задача — найти баг в существующей кодовой базе, сделать небольшой патч и подготовить diff для pull request, начинайте сравнение с Claude Opus 4.7.
Если же вы строите агента, который много работает через CLI: запускает сборку, тесты, миграции, линтеры, читает вывод терминала и выбирает следующую команду, первым кандидатом стоит поставить GPT-5.5.
| Сценарий | С кого начать | Публичный сигнал | Что важно помнить |
|---|---|---|---|
| Исправление кода в репозитории, багфиксы, доведение тестов до прохождения | Claude Opus 4.7 | В SWE-bench Pro для Claude Opus 4.7 указано 64,3%, для GPT-5.5 — 58,6%. | У семейства SWE-bench есть разные варианты, а поставщики моделей могут подсвечивать метрики, где выглядят сильнее. |
| Терминальный или CLI-агент | GPT-5.5 | В Terminal-Bench 2.0: GPT-5.5 — 82,7, Claude Opus 4.7 — 69,4. | Это сигнал про работу в командной строке, планирование и координацию инструментов, а не универсальная оценка качества кода. |
| Разработка с браузером и вызовами инструментов | Зависит от workflow | В BrowseComp GPT-5.5 показан выше Claude Opus 4.7: 84,4% против 79,3%; в MCP Atlas наоборот — 75,3% против 79,1% в пользу Claude Opus 4.7. | Tool-use тесты не равны тестам программирования. |
| Длинные агентные циклы с множеством шагов | Claude Opus 4.7 тоже сильный кандидат | Anthropic называет Opus 4.7 своей самой сильной общедоступной моделью для сложного рассуждения и агентного кодинга. | Реальный результат сильно зависит от окружения, промпта, прав на инструменты и тестового стенда. |
Claude Opus 4.7 стоит первым проверить там, где модель должна работать как аккуратный разработчик над уже существующим проектом: прочитать контекст, понять причину падения тестов, внести минимальное изменение и не сломать соседние части системы.
Главный публичный аргумент — SWE-bench Pro. В сводке по GPT-5.5 указано, что GPT-5.5 набирает 58,6%, уступая Claude Opus 4.7 с 64,3%; Anthropic также отдельно заявляет, что Opus 4.7 лидирует на SWE-bench Pro с результатом 64,3%.
Это совпадает и с позиционированием самой Anthropic. В релизных заметках от 16 апреля 2026 года компания описала Claude Opus 4.7 как свою наиболее способную общедоступную модель для сложного рассуждения и агентного программирования.
Есть и продуктовые детали, заточенные под длинные задачи. В Claude Opus 4.7 появилась бета-функция task budgets: она задаёт примерный токен-бюджет на полный агентный цикл, включая reasoning, вызовы инструментов, результаты инструментов и финальный ответ; модель видит оставшийся бюджет и должна расставлять приоритеты по ходу работы. Anthropic также сообщала, что для пользователей Opus 4.7 по умолчанию применяется режим xhigh effort.
Практически это делает Claude Opus 4.7 особенно интересным для таких задач:
Но это не означает, что Claude автоматически лучше во всём, что называется кодингом. У SWE-bench есть несколько вариантов, и в отрасли справедливо обращают внимание на то, что вендоры могут выбирать самые выгодные для себя показатели. Поэтому публичный бенчмарк лучше воспринимать как фильтр для выбора кандидата, а не как финальный вердикт.
У GPT-5.5 более явный сигнал в задачах, где важен не только сам код, но и управление рабочей средой через терминал. В таблице VentureBeat для Terminal-Bench 2.0 GPT-5.5 показан с результатом 82,7, тогда как Claude Opus 4.7 — с 69,4.
Это важно, потому что Terminal-Bench 2.0 описывается как тест сложных workflow в командной строке, где нужны планирование, итерации и координация инструментов. Иначе говоря, это ближе к поведению агента, который запускает npm test, читает ошибку, меняет файл, прогоняет линтер, смотрит лог сборки и решает, что делать дальше.
GPT-5.5 стоит первым ставить в A/B-тест, если вам нужен агент для таких сценариев:
При этом высокий результат в Terminal-Bench 2.0 не доказывает, что GPT-5.5 всегда сделает лучший pull request. Умение управлять терминалом и умение выпустить маленький, безопасный, хорошо ревьюируемый патч пересекаются, но это не одна и та же метрика.
Если смотреть на более широкие тесты с браузером и вызовами инструментов, преимущество не закрепляется за одной моделью. В материалах OpenAI по GPT-5.5 BrowseComp указан как 84,4% для GPT-5.5 и 79,3% для Claude Opus 4.7. Но в MCP Atlas соотношение обратное: 75,3% у GPT-5.5 и 79,1% у Claude Opus 4.7.
Поэтому фраза «модель хорошо пользуется инструментами» сама по себе мало что решает. Для разработчика важнее уточнить тип инструментов: это браузинг и поиск по документации, локальный терминал, файловая система, тестовый раннер, CI или полноценный агентный контур вокруг репозитория.
Первая ошибка — читать общий рейтинг как рейтинг для программирования. Например, в overall ranking BenchLM GPT-5.4 указан с 88 баллами, а Claude Opus 4.7 — с 86 баллами. Но это GPT-5.4, а не GPT-5.5, и рейтинг не является специализированным тестом кодинга.
Вторая ошибка — делать вывод по одному SWE-bench числу. SWE-bench существует в нескольких вариантах, и разные стороны могут акцентировать те версии, где их модель выглядит сильнее.
Третья ошибка — приравнивать терминальный бенчмарк к качеству кода. Terminal-Bench 2.0 ближе к проверке того, как модель планирует и выполняет действия в командной строке. А вопрос, примет ли ревьюер итоговый patch, нужно проверять отдельно.
Публичные бенчмарки помогают выбрать, с кого начать. Но финальное решение лучше принимать на собственных задачах — особенно если речь о рабочем репозитории, где важны стиль проекта, тестовая инфраструктура, ограничения безопасности и скорость ревью.
Для честного A/B-теста дайте обеим моделям одинаковые условия:
Оценивать стоит не только то, прошли ли тесты. Полезнее смотреть шире:
Если ваша основная задача — исправлять issues, чинить баги, доводить тесты до прохождения и готовить патчи для pull request, начните с Claude Opus 4.7. Публичный сигнал SWE-bench Pro сейчас выглядит для него сильнее: 64,3% против 58,6% у GPT-5.5.
Если ваша задача — построить агента, который живёт в терминале, запускает команды, читает логи и итеративно управляет средой разработки, начните с GPT-5.5. В Terminal-Bench 2.0 он указан заметно выше Claude Opus 4.7: 82,7 против 69,4.
Самый безопасный вывод: для патчей в репозитории первым тестируйте Claude Opus 4.7, для CLI-агентов — GPT-5.5. А окончательно выбирайте ту модель, которая на вашем коде чаще доводит тесты до зелёного состояния и выдаёт diff, который команда действительно готова смержить.