Честный ответ: данных недостаточно, чтобы назвать одну модель сильнее во всём. VentureBeat сообщает, что Claude Opus 4.7 набрал 64,3% на SWE-bench Pro и 94,2% на GPQA Diamond; Interesting Engineering приводит для GPT‑5.5 результат 58,6% на SWE-Bench Pro; LLM Stats показывает обе модели примерно на уровне 0,94 по GPQA.
Эти цифры полезны для первичного выбора, но это не полноценный независимый head-to-head: одинаковые prompts, инструменты, token budget, test harness и условия inference в одном сравнении здесь не подтверждены.
Если упростить до практического выбора:
| Критерий | GPT‑5.5 | Claude Opus 4.7 | Что важно |
|---|---|---|---|
| Запуск и доступ | OpenAI анонсировала GPT‑5.5 23 апреля 2026 года; документация OpenAI говорит, что модель доступна в ChatGPT и Codex, а API availability — coming soon. | Anthropic указывает запуск Claude Opus 4.7 16 апреля 2026 года на Claude Platform. | Для работы прямо в ChatGPT/Codex удобнее выглядит GPT‑5.5; для развертывания через Claude Platform статус Opus 4.7 в приведённых источниках определённее. |
| Coding‑agent | Interesting Engineering сообщает 58,6% для GPT‑5.5 на SWE-Bench Pro; OpenAI также добавила GPT‑5.5 в Codex для complex coding, computer use, knowledge work и research workflows. | VentureBeat сообщает 64,3% для Opus 4.7 на SWE-bench Pro. | |
| Reasoning | LLM Stats показывает GPT‑5.5 примерно на уровне 0,94 по GPQA. | VentureBeat приводит 94,2% на GPQA Diamond и Elo 1753 на GDPVal-AA; LLM Stats также показывает Opus 4.7 примерно на уровне 0,94 по GPQA. | |
| Рабочие процессы | OpenAI описывает GPT‑5.5 как модель для кода, онлайн-исследований, анализа информации, документов, таблиц и перехода между инструментами. | Anthropic называет Opus 4.7 своей самой сильной generally available моделью для complex reasoning и agentic coding. | GPT‑5.5 логичнее для workflow внутри ChatGPT/Codex; Opus 4.7 — для сценариев, где главный фокус на reasoning и coding‑agent. |
| Цена и токены | Страница pricing OpenAI указывает GPT‑5.5 как coming soon и input price $5,00 за 1 млн токенов. | Anthropic указывает $5/$25 за MTok, как у Opus 4.6, но предупреждает, что новый токенизатор может дать примерно 1,0–1,35× токенов для того же ввода в зависимости от контента. |
Если вопрос узкий — какая модель лучше подходит для coding‑agent, — Claude Opus 4.7 сейчас имеет более убедительный количественный аргумент. VentureBeat сообщает, что Opus 4.7 решил 64,3% задач на SWE-bench Pro, тогда как Interesting Engineering приводит для GPT‑5.5 результат 58,6% на SWE-Bench Pro.
Это не значит, что Claude автоматически будет лучше в любой кодовой базе. Результат coding benchmark зависит от harness, тестовой среды, доступа к инструментам, prompt-стратегии, лимитов токенов и критериев оценки. Практичный вывод такой: по приведённым публичным цифрам Opus 4.7 впереди, но проверять всё равно нужно на вашем репозитории и вашем процессе разработки.
GPT‑5.5 при этом нельзя списывать со счетов. OpenAI указывает, что GPT‑5.5 уже доступна в Codex как новая frontier model для complex coding, computer use, knowledge work и research workflows. Если задача включает не только исправление бага, но и поиск контекста, понимание системы, работу с инструментами, документацию и длинную цепочку действий, интеграция GPT‑5.5 в Codex становится важным фактором.
В блоке reasoning у Claude Opus 4.7 есть сильные публичные показатели: VentureBeat сообщает 94,2% на GPQA Diamond и Elo 1753 на GDPVal-AA. Это хороший сигнал для сложных задач на рассуждение и knowledge work, но один benchmark не описывает все типы мышления и рабочих задач.
При этом разрыв не стоит преувеличивать. LLM Stats показывает и Claude Opus 4.7, и GPT‑5.5 примерно на уровне 0,94 по GPQA. Поэтому аккуратная формулировка такая: Opus 4.7 имеет более заметные публичные benchmark-сигналы в отдельных тестах, но из этих данных не следует, что GPT‑5.5 проигрывает во всех видах reasoning.
GPT‑5.5 OpenAI позиционирует не просто как модель для трудных вопросов, а как инструмент для complex, real‑world work: написание кода, онлайн-исследования, анализ информации, создание документов и таблиц, а также переход между инструментами для завершения задачи.
Документация OpenAI говорит, что GPT‑5.5 сейчас доступна в ChatGPT и Codex, а API availability указана как coming soon. В changelog Codex модель описана как новая frontier model для complex coding, computer use, knowledge work и research workflows.
Поэтому, если вы работаете в ChatGPT/Codex и хотите ускорить личную или командную продуктивность — анализ файлов, правки в коде, документацию, планирование, research, таблицы и многошаговые задачи, — GPT‑5.5 выглядит моделью, которую стоит протестировать в первую очередь.
Для продуктового выбора бенчмарки — только часть картины. Нужно проверить, доступна ли модель через API, сколько стоят input и output, как токенизатор считает ваш тип контента, насколько длинные ответы генерирует модель и сколько tool calls требуется для выполнения задачи.
По документации OpenAI API, GPT‑5.5 сейчас доступна в ChatGPT и Codex, а API availability — coming soon. На странице pricing OpenAI GPT‑5.5 также указана как coming soon, с input price $5,00 за 1 млн токенов.
У Anthropic Claude Opus 4.7 уже запущен на Claude Platform, а release notes указывают цену $5/$25 за MTok, как у Opus 4.6. Но Anthropic отдельно предупреждает: Opus 4.7 использует обновлённый токенизатор, из-за чего тот же input может превратиться примерно в 1,0–1,35 раза больше токенов в зависимости от типа контента; кроме того, на высоких effort-levels модель может больше think, особенно в поздних шагах агентных сценариев, что увеличивает output tokens.
Итог простой: модель с лучшим benchmark может оказаться не самой выгодной, если ваш workflow длинный, многошаговый, с большим контекстом и частыми вызовами инструментов.
Выбирайте Claude Opus 4.7, если:
Выбирайте GPT‑5.5, если:
Тестируйте обе, если:
Чтобы не выбирать модель по впечатлениям, соберите небольшой, но реалистичный evaluation set:
Такой тест особенно важен именно здесь: Claude Opus 4.7 имеет более сильные публичные benchmark-сигналы для coding/reasoning, а GPT‑5.5 глубже встроена в workflow ChatGPT/Codex для многошаговой практической работы.
Claude Opus 4.7 сейчас выглядит сильнее, если судить по публичным benchmark для coding‑agent и отдельным сигналам reasoning/knowledge work. VentureBeat сообщает для Opus 4.7 результат 64,3% на SWE-bench Pro, 94,2% на GPQA Diamond и Elo 1753 на GDPVal-AA.
GPT‑5.5 выглядит сильнее, если главный сценарий — workflow внутри ChatGPT и Codex. OpenAI описывает GPT‑5.5 как модель для кода, онлайн-исследований, анализа информации, документов, таблиц и перехода между инструментами; также OpenAI указывает, что модель доступна в ChatGPT и Codex.
Самый практичный вывод: Claude Opus 4.7 имеет более ясное преимущество по benchmark, GPT‑5.5 — по workflow в экосистеме OpenAI, а доказательств для титула универсально сильнейшей модели пока недостаточно.
| Если смотреть только на приведённые цифры SWE-bench Pro, Opus 4.7 впереди. Но финальное решение лучше принимать на своём репозитории. |
| У Opus есть более яркие публичные цифры в отдельных benchmark, но по GPQA в LLM Stats разрыв не выглядит очевидным. |
| Смотрите не только на прайс: измеряйте реальный расход токенов, длину ответа и число tool calls на своих задачах. |