Абсолютного победителя нет: GPT 5.5 явно ведёт в Terminal Bench 2.0 — 82,7% против 69,4%, а Claude Opus 4.7 сильнее в SWE Bench Pro — 64,3% против 58,6%. В reasoning разделе разрыв на GPQA Diamond минимален: Claude Opus 4.7 набирает 94,2%, GPT 5.5 — 93,6%, поэтому одного этого теста мало для выбора модели.
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: GPT-5.5 vs Claude Opus 4.7: benchmark nào đáng tin cho coding, agent và reasoning?. Article summary: Không có người thắng tuyệt đối: GPT 5.5 nổi bật ở terminal/agentic coding với Terminal Bench 2.0 đạt 82,7% so với 69,4%, còn Claude Opus 4.7 dẫn SWE Bench Pro với 64,3% so với 58,6%; các số này nên dùng làm điểm lọc,.... Topic tags: ai, openai, anthropic, claude, chatgpt. Reference image context from search candidates: Reference image 1: visual subject "# So sánh GPT-5.5 với Claude Opus 4.7. GPT-5.5 và Claude Opus 4.7 là hai model AI hàng đầu ra mắt cách nhau chỉ một tuần tháng 4/2026, không có winner rõ ràng khi benchmarks chia t" source context "So sánh GPT-5.5 với Claude Opus 4.7 | Viết bởi vninfinity" Reference image 2: visual subject "# So sánh GPT-5.5 với Claude Opus 4.7. GPT-5.5 và Claude Opus 4.7 là hai model
Короткий ответ: по открытым бенчмаркам нельзя честно сказать, что GPT-5.5 во всём лучше Claude Opus 4.7 — или наоборот. Картина сильно зависит от workload. GPT-5.5 заметнее в задачах с терминалом, browsing и частью агентных сценариев; Claude Opus 4.7 сильнее выглядит на SWE-Bench Pro, MCP Atlas и ряде reasoning/tooling-тестов по сводным таблицам .
Но к таблицам стоит относиться как к фильтру для шорт-листа, а не как к финальному вердикту. Многие оценки приходят из публикаций поставщиков или агрегаторов. LLM Stats отдельно помечает, что часть данных по GPT-5.5 может быть self-reported и не обязательно независимо проверена . Для продакшена решающим всё равно будет ваш внутренний eval.
Если смотреть на агрегированную картину LLM Stats, Claude Opus 4.7 ведёт в 6 из 10 бенчмарков, по которым оба поставщика дают результаты, а GPT-5.5 — в 4. Там же вывод формулируется так: сильные стороны Claude чаще лежат в reasoning-heavy и review-grade тестах, а GPT-5.5 — в долгом tool-use и shell-driven задачах . Это полезная рамка, но она не снимает проблему спорных строк вроде Humanity’s Last Exam
.
Если ваш сценарий — агентный кодинг через терминал, GPT-5.5 выглядит более сильным кандидатом по текущим публичным данным. В Terminal-Bench 2.0 он набирает 82,7% против 69,4% у Claude Opus 4.7 . OpenAI объясняет, что этот тест проверяет сложные command-line workflow: модель должна планировать, запускать команды, анализировать результат, повторять попытки и координировать инструменты
.
Это важно для CLI-copilot, DevOps-ассистента или coding agent, который должен сам запускать тесты, читать ошибки, править файлы и повторять цикл. Для такого класса задач Terminal-Bench 2.0 полезнее, чем общий тест на абстрактное reasoning.
Но если задача ближе к исправлению реальных issues в репозитории, Claude Opus 4.7 получает преимущество. На SWE-Bench Pro он показывает 64,3% против 58,6% у GPT-5.5 . OpenAI описывает SWE-Bench Pro как оценку способности решать реальные GitHub-issue
. Поэтому для bug fixing, изменений в больших repo и review-grade software tasks Claude Opus 4.7 стоит включать в первый раунд тестирования.
С SWE-Bench Verified картина менее чистая. MindStudio указывает для Claude Opus 4.7 результат 82,4%, тогда как APIyi и DataCamp приводят 87,6%; в предоставленных источниках нет стабильной пары GPT-5.5 vs Claude Opus 4.7 для одной и той же строки этого теста .
В агентных сценариях GPT-5.5 часто выглядит убедительно. В таблице Vellum он ведёт на BrowseComp — 84,4% против 79,3%, на GDPval — 84,9% против 80,3%, и на OSWorld-Verified — 78,7% против 78,0% . Mashable также приводит для BrowseComp ту же пару результатов: 84,4% у GPT-5.5 и 79,3% у Claude Opus 4.7
. LLM Stats добавляет, что GPT-5.5 ведёт в CyberGym, хотя в доступном фрагменте не показаны проценты
.
У Claude Opus 4.7 есть свои сильные зоны. В Vellum он опережает GPT-5.5 на MCP Atlas: 79,1% против 75,3% . LLM Stats относит к Claude лидерство в FinanceAgent v1.1, а DataCamp указывает для Claude Opus 4.7 результат 64,4% на этом тесте
. Anthropic также описывает Claude Opus 4.7 как новую версию Opus с усилением в coding, agents, vision и многошаговых задачах
.
Практический вывод простой: если ваш workflow завязан на shell, browsing или автоматизацию в стиле работы с ОС, GPT-5.5 логично тестировать первым. Если важнее структурированная orchestration инструментов, MCP-сценарии или финансовые agent-workflow, Claude Opus 4.7 не стоит отсеивать по одной общей таблице.
На GPQA Diamond Claude Opus 4.7 набирает 94,2%, GPT-5.5 — 93,6% . Это плюс в пользу Claude, но разрыв в 0,6 процентного пункта слишком мал, чтобы переносить его на любые научные, аналитические или экспертные задачи. Для реального выбора лучше прогнать обе модели на собственном наборе вопросов и кейсов.
С Humanity’s Last Exam ситуация ещё менее удобная. LLM Stats пишет, что Claude Opus 4.7 ведёт и в HLE без tools, и в HLE with tools . Mashable, наоборот, приводит 40,6% у GPT-5.5 против 31,2% у Opus 4.7 в HLE без tools, но 54,7% у Claude против 52,2% у GPT-5.5 в версии with tools
. o-mega добавляет ещё один набор чисел по HLE
. Пока условия запуска не выровнены, HLE не стоит использовать как решающий аргумент.
Начните с GPT-5.5, если главное — агент, который долго работает в терминале, запускает команды, чинит ошибки по логам, проходит test loop или автоматизирует многошаговые shell-сценарии. Terminal-Bench 2.0 здесь заметно склоняется в сторону GPT-5.5 . GPT-5.5 также выглядит хорошим первым кандидатом для browsing/search-style workflow, GDPval, OSWorld-Verified и FrontierMath T1–3 по таблицам Vellum и Mashable
.
Начните с Claude Opus 4.7, если задача похожа на SWE-Bench Pro: исправление сложных issue, работа с реальным repo, оценка качества изменений и архитектурные правки. В этом тесте Claude опережает GPT-5.5 . Claude также стоит держать в shortlist для GPQA-style scientific reasoning, MCP/tool orchestration и finance-agent задач — по GPQA Diamond, MCP Atlas, FinanceAgent v1.1 и сводке LLM Stats
.
Самый безопасный подход — не выбирать модель по одному лидерборду. Разбейте свои сценарии на четыре корзины: кодинг внутри repo, terminal/agent automation, reasoning без tools и workflow с tools. Для каждой корзины запускайте одинаковые prompt, одинаковый доступ к инструментам, одинаковые sampling-настройки, одинаковый reasoning effort и одинаковые критерии оценки. Публичные бенчмарки помогают понять, с кого начать; внутренний eval показывает, кого действительно стоит пускать в продукт, особенно когда часть публичных оценок может быть self-reported или не подтверждена независимой проверкой .
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Абсолютного победителя нет: GPT 5.5 явно ведёт в Terminal Bench 2.0 — 82,7% против 69,4%, а Claude Opus 4.7 сильнее в SWE Bench Pro — 64,3% против 58,6%.
Абсолютного победителя нет: GPT 5.5 явно ведёт в Terminal Bench 2.0 — 82,7% против 69,4%, а Claude Opus 4.7 сильнее в SWE Bench Pro — 64,3% против 58,6%. В reasoning разделе разрыв на GPQA Diamond минимален: Claude Opus 4.7 набирает 94,2%, GPT 5.5 — 93,6%, поэтому одного этого теста мало для выбора модели.
Часть публичных цифр основана на данных поставщиков или агрегаторов, а по SWE Bench Verified и Humanity’s Last Exam источники дают не полностью согласованные результаты.