В таблицу ниже включены только числа, которые есть в предоставленных источниках. Прочерк означает не отсутствие способности, а отсутствие сопоставимой цитируемой цифры в этой подборке. Важно: это не единый leaderboard. Часть данных идёт из официальных страниц и карточек моделей, часть — из вторичных публикаций.
| Тест или задача | GPT-5.5 | Claude Opus 4.7 | Kimi K2.6 | DeepSeek V4-Pro | Практический вывод |
|---|---|---|---|---|---|
| Terminal-Bench 2.0 | 82,7% | 69,4% | 66,7 | 67,9 | Среди доступных цифр GPT-5.5 заметно сильнее всего выглядит для command-line workflow. |
| SWE-Bench Pro | 58,6% | 64,3% | 58,6 | 55,4 | |
| SWE-Bench Verified / Resolved | — | 87,6% | 80,2 | 80,6 | |
| Graphwalks 256k: BFS / parents | 73,7 / 90,1 | 76,9 / 93,6 | — | — | В таблице OpenAI по двум строкам 256k Claude Opus 4.7 выше GPT-5.5. |
| Graphwalks 1M: BFS / parents | 45,4 / 58,5 | — | — | — | Эти числа показывают длинный контекст GPT-5.5; сравнивать их с Opus 4.7 нельзя, потому что в 1M-строках у OpenAI указан Opus 4.6, а не 4.7. |
| Knowledge и math | — | — | — | GPQA Diamond 90,1; GSM8K 92,6; MMLU-Pro 87,5; HLE 37,7 | У DeepSeek V4-Pro самая полная карточка с открытыми knowledge/math показателями. |
| Vision, screenshot, computer use | — | vision-heavy gains; координаты 1:1 с пикселями; XBOW visual-acuity 98,5% | Cloudflare описывает модель как native multimodal agentic model, но без сопоставимого vision-бенчмарка |
Во-первых, уровни источников разные. Цифры GPT-5.5 по Terminal-Bench 2.0 и SWE-Bench Pro опубликованы в медиа со ссылкой на benchmark results, предоставленные OpenAI; показатели Claude Opus 4.7 по SWE-Bench Pro, SWE-Bench Verified и Terminal-Bench 2.0 взяты из вторичного обзора, который ссылается на AWS; часть чисел Kimi K2.6 и DeepSeek V4-Pro находится в карточках моделей на Hugging Face.
Во-вторых, права на инструменты меняют картину. Mashable приводит пример HLE: без инструментов Claude Opus 4.7 набирает 46,9%, а GPT-5.4 Pro — 42,7%; с инструментами GPT-5.4 Pro выходит на 58,7%, а Claude Opus 4.7 — на 54,7%. Это не результат GPT-5.5, но хороший сигнал: with tools и without tools нельзя смешивать в одной таблице как будто это один и тот же тест.
В-третьих, важны версия и режим вычислений. DeepSeek V4 выходит как V4-Pro и V4-Flash; Yahoo Finance передаёт заявление DeepSeek, что V4-Flash — более эффективный и экономичный вариант, тогда как подробные числа в этой статье относятся главным образом к DeepSeek-V4-Pro. Artificial Analysis отдельно рассматривает варианты GPT-5.5 по effort и пишет, что GPT-5.5 xhigh в их Index примерно на 20% дороже предшественника, но на 30% дешевле Claude Opus 4.7 max.
Самое ясное преимущество GPT-5.5 в этой подборке — Terminal-Bench 2.0. Yahoo Finance / Investing.com сообщают, что по данным OpenAI модель набрала 82,7% в Terminal-Bench 2.0, тесте для command-line workflows; там же указано 58,6% в SWE-Bench Pro, который оценивает решение GitHub issues.
У OpenAI есть и более детальная таблица по длинному контексту. В Graphwalks BFS GPT-5.5 получает 73,7 на 256k и 45,4 на 1M, а в Graphwalks parents — 90,1 на 256k и 58,5 на 1M. В той же таблице GPT-5.4 на Graphwalks BFS 1M имеет 9,4, тогда как GPT-5.5 — 45,4.
Из сторонних оценок стоит отметить Artificial Analysis: издание называет GPT-5.5 новым leading AI model, пишет, что OpenAI лидирует в пяти headline evaluations и уступает Gemini 3.1 Pro Preview в трёх, а также указывает, что GPT-5.5 xhigh использует примерно на 40% меньше output tokens для их Index, чем предшественник.
Когда тестировать первым: CLI automation, terminal agents, длинноконтекстный поиск и agentic coding workflow, где важны не только ответы, но и стоимость output tokens.
Официальная документация Anthropic наиболее прямо говорит о визуальных и UI-сценариях. В ней сказано, что изменение должно дать прирост в vision-heavy workloads, особенно для computer use, screenshot, artifact и document understanding workflows; координаты модели теперь соответствуют реальным пикселям 1:1, поэтому не нужен отдельный пересчёт scale factor.
На launch page Anthropic приводит результат XBOW по visual-acuity benchmark: Claude Opus 4.7 — 98,5% против 54,5% у Opus 4.6. Поэтому для screenshot understanding, document layout, desktop UI automation и computer-use agents у Claude Opus 4.7 сейчас более прямые публичные аргументы, чем у остальных трёх моделей.
По coding-бенчмаркам вторичный обзор сообщает, что AWS указывает для Claude Opus 4.7 64,3% в SWE-Bench Pro, 87,6% в SWE-Bench Verified и 69,4% в Terminal-Bench 2.0. Эти числа ставят Claude выше в доступном сравнении SWE-Bench Pro и Verified/Resolved, но перед production-выбором их всё равно стоит проверять на собственных репозиториях.
Есть и практическое предупреждение: Anthropic пишет, что high-res images используют больше tokens; если повышенная детализация не нужна, изображения лучше уменьшать перед отправкой в Claude, чтобы не раздувать token usage.
Когда тестировать первым: исправление GitHub issues, coding agents, анализ скриншотов и документов, computer-use agents и задачи, где важны точные пиксельные координаты UI.
Cloudflare сообщает, что Moonshot AI Kimi K2.6 доступна в Workers AI с 20 апреля 2026 года, model ID — @cf/moonshotai/kimi-k2.6; Cloudflare называет это Day 0 support в партнёрстве с Moonshot AI.
В том же changelog Kimi K2.6 описывается как native multimodal agentic model для long-horizon coding, coding-driven design, proactive autonomous execution и swarm-based task orchestration. Cloudflare также указывает архитектуру Mixture-of-Experts: 1T total parameters и 32B active parameters per token.
По публичным числам карточка Kimi K2.6 на Hugging Face даёт Terminal-Bench 2.0 — 66,7, SWE-Bench Pro — 58,6 и SWE-Bench Multilingual — 76,7. MarkTechPost отдельно пишет о 80,2 на SWE-Bench Verified.
Когда тестировать первым: если инфраструктура уже завязана на Cloudflare Workers AI или нужны long-horizon coding, coding-driven design, multimodal agent workflow и orchestration нескольких агентов.
В источниках DeepSeek V4 фигурирует в двух вариантах: V4-Pro и V4-Flash. Yahoo Finance передаёт заявление DeepSeek, что V4-Pro заметно опережает другие open-source models на world knowledge benchmarks и лишь немного уступает топовой закрытой Gemini-Pro-3.1; V4-Flash описан как более эффективный и экономичный вариант.
Карточка DeepSeek-V4-Pro на Hugging Face даёт наиболее полную подборку чисел в этой статье: GPQA Diamond — 90,1, GSM8K — 92,6, HLE — 37,7, MMLU-Pro — 87,5, SWE-Bench Pro — 55,4, SWE-Bench Verified/Resolved — 80,6, TerminalBench 2.0 — 67,9.
CNBC пишет, что DeepSeek V4 оптимизирован для agent tools вроде Claude Code и OpenClaw; аналитик Counterpoint Wei Sun считает, что benchmark profile V4 указывает на возможность получить сильные agent capabilities при существенно более низкой стоимости.
Когда тестировать первым: если важны open-source route, knowledge/math benchmarks, стоимость agent tooling или возможность оценивать скачиваемую модель в локальной либо self-hosted среде.
Чтобы вывод можно было защищать внутри команды, сравнение нужно повторять на одной версии модели или одном API model ID, с одинаковой длиной контекста, одинаковыми правами на инструменты, одинаковым reasoning effort, temperature, token budget и scoring harness. Особенно нельзя смешивать режимы с инструментами и без инструментов: пример HLE показывает, что это может менять относительный порядок моделей.
Стоимость тоже нужно измерять вместе с качеством. Artificial Analysis пишет, что GPT-5.5 xhigh примерно на 20% дороже предшественника в их Index, но на 30% дешевле Claude Opus 4.7 max, а output tokens у GPT-5.5 xhigh примерно на 40% меньше, чем у предшественника. Anthropic, в свою очередь, предупреждает, что high-resolution images увеличивают token usage. Для production-агента скорость, расход токенов, успешность tool calls и доля исправленных ошибок часто важны не меньше, чем один красивый benchmark score.
Сейчас самый честный вывод — не общий победитель, а карта выбора. Для Terminal-Bench и CLI-сценариев первым кандидатом выглядит GPT-5.5; для SWE-Bench, vision и computer-use — Claude Opus 4.7; для knowledge/math и открытого развертывания — DeepSeek V4-Pro; для multimodal agentic coding в Cloudflare Workers AI — Kimi K2.6. Настоящий общий рейтинг появится только тогда, когда все четыре модели будут прогнаны в одном harness, с одинаковыми tool permissions, версиями и настройками effort.
| Claude лидирует по доступным числам, но показатель взят из вторичного обзора со ссылкой на AWS. |
| Claude выше, но для GPT-5.5 нет сопоставимой строки, а названия Verified/Resolved в источниках различаются. |
| — |
| Самые жёсткие публичные доказательства по vision и UI-операциям сейчас у Claude Opus 4.7. |