そのため、見るべきポイントは「どのモデルが総合1位か」ではなく、「自分の作業ではどのモデルから検証するか」です。
下の表の「—」は、提供された公開情報の範囲で同じベンチマークに直接対応する値を確認しにくい、という意味です。そのモデルがその作業をできないという意味ではありません。
| ベンチマーク | GPT-5.5 | Claude Opus 4.7 | Kimi K2.6 | DeepSeek V4 | 読み方 |
|---|---|---|---|---|---|
| Terminal-Bench 2.0 | 82.7% | 69.4% | 66.7% | — | ターミナルやコマンドライン中心のワークフローでは、GPT-5.5の公開値が最も高いです。 |
| SWE-Bench Pro | 58.6% | 64.3% | 58.6% | ||
| SWE-Bench Verified | — | 87.6% | 80.2% | ||
| GPQA Diamond | 93.6% | 94.2% | |||
| HLE with tools | 52.2% | 54.7% | |||
| BrowseComp | 84.4% | 79.3% | |||
| OSWorld-Verified | 78.7% | 78.0% | — | — | GPT-5.5とClaude Opus 4.7の差は小さいです。 |
| MCP Atlas | 75.3% | 79.1% | — | — | MCPやツール連携型の評価では、Claude Opus 4.7が上回ります。 |
OpenAIは、GPT-5.5がTerminal-Bench 2.0で82.7%、SWE-Bench Proで58.6%を記録したと発表しています 。同社の説明では、Terminal-Bench 2.0は計画、反復、ツール調整を必要とする複雑なコマンドラインワークフローを評価し、SWE-Bench Proは現実のGitHub issue解決能力を見るベンチマークです 。
このためGPT-5.5は、サンドボックス内での実行、シェルコマンドの反復、CIの再現、ファイル生成・修正のように、長めのターミナルセッションを伴うワークロードで先に試しやすいモデルです。ただし、SWE-Bench ProではClaude Opus 4.7の64.3%がGPT-5.5の58.6%を上回っており、すべてのコーディング作業でGPT-5.5が優位とは言えません 。
Claude Opus 4.7は、SWE-Bench Proで64.3%、SWE-Bench Verifiedで87.6%と報告されています 。DataCampは、Opus 4.7がコーディング、推論、ツール使用、コンピューター使用、視覚推論を含む14のベンチマークで評価されたとまとめています 。
GPT-5.5との共通比較では、Claude Opus 4.7はGPQA Diamondで94.2%対93.6%、MCP Atlasで79.1%対75.3%と上回ります 。一方、Terminal-Bench 2.0とBrowseCompではGPT-5.5のほうが高い公開値を示します 。つまりClaude Opus 4.7は、ターミナル自動化全般の絶対的な勝者というより、実際のissue解決、コード修正、レビュー型作業で最初に検証したいモデルと見るのが自然です。
Kimi K2.6は、SWE-Bench Pro 58.6%、SWE-Bench Verified 80.2%と紹介されており、別のガイドではTerminal-Bench 2.0 66.7%、HLE with tools 54.0%も示されています 。ただし、そのガイドはK2.6の数値についてMoonshot AIの公式モデルカードを出典とし、SWE-Bench ProにはMoonshotのin-house harnessという注記を付けています 。
そのため、Kimi K2.6のSWE-Bench Pro 58.6%がGPT-5.5の58.6%と数字上は同じでも、完全に同じ評価ハーネスでの同率と断定するのは避けるべきです 。一方で、Kimi K2.6はテキスト、画像、動画入力と256kコンテキスト対応ルートをサポートすると紹介されているため、長いマルチモーダル入力が重要なプロダクトでは別枠で試す価値があります 。
DeepSeek V4については、この比較表にあるTerminal-Bench、SWE-Bench Pro、SWE-Bench Verified、GPQA Diamondなどへ直接入れられる共通の公開値が、提供情報の範囲では十分ではありません。代わりにArtificial Analysisは、DeepSeek V4 Pro MaxがAA-Omniscienceで-10を記録し、V3.2から11ポイント改善したこと、V4 Flash Maxは-23だったことを説明しています 。同じ出典は、V4 ProとV4 Flashのハルシネーション率をそれぞれ94%、96%と報告し、知らない場合でもほぼ常に答えてしまう傾向があると解釈しています 。
一方で、構造と価格には検討材料があります。DataCampは、DeepSeek V4がMixture of Experts構造を採用し、Proモデルは総パラメーター1.6兆のうち490億がアクティブ、Flashモデルは総パラメーター2,840億のうち130億がアクティブだと説明しています 。また、Mashableが整理したAPI価格では、DeepSeek V4はGPT-5.5やClaude Opus 4.7より低価格です 。
したがってDeepSeek V4は、コスト感度の高い大量処理、内部検証をかけられるワークフロー、低価格なAPI運用の候補になり得ます。ただし、高いハルシネーション率の報告と共通ベンチマークの空白を合わせて見ると、正確性が重要なプロダクトでは独自評価、後処理、失敗検知を前提にすべきです 。
| 使い方 | まず試すモデル | 根拠 |
|---|---|---|
| 長時間のターミナル自動化、シェルベースのエージェント、CI再現 | GPT-5.5 | Terminal-Bench 2.0でGPT-5.5 82.7%、Claude Opus 4.7 69.4%、Kimi K2.6 66.7%が公開されています 。 |
| 実際のGitHub issue解決、コード修正、SWE-Bench型タスク | Claude Opus 4.7 | Claude Opus 4.7はSWE-Bench Pro 64.3%、SWE-Bench Verified 87.6%と報告されています 。 |
| ブラウジング・Web探索型タスク | GPT-5.5 | BrowseCompでGPT-5.5 84.4%、Claude Opus 4.7 79.3%が報告されています 。 |
| MCP・ツール連携型タスク | Claude Opus 4.7 | MCP AtlasでClaude Opus 4.7 79.1%、GPT-5.5 75.3%が報告されています 。 |
| 長いマルチモーダルコンテキスト | Kimi K2.6 | Kimi K2.6はテキスト、画像、動画入力と256kコンテキスト対応ルートをサポートすると紹介されています 。 |
| コスト重視の大量API呼び出し | DeepSeek V4 | Mashable基準ではDeepSeek V4のトークン価格がGPT-5.5やClaude Opus 4.7より低い一方、Artificial Analysisの高いハルシネーション率報告も併せて確認が必要です 。 |
第一に、4モデルを同じプロンプト、同じツールアクセス、同じ推論予算、同じ採点器で評価した独立比較が、提供情報の範囲では十分ではありません。GPT-5.5とClaude Opus 4.7は共通比較が比較的多いものの、Kimi K2.6はモデルカードやin-house harnessの値が混在し、DeepSeek V4は共通ベンチマークの行が空きがちです 。
第二に、同じベンチマーク名でも実行条件が変わることがあります。ある集計資料は、GPT-5.5とClaude Opus 4.7の公開スコアは形として比較可能でも、方法論まで同一とは限らないと説明しています 。AnthropicもTerminal-Bench 2.0評価でTerminus-2ハーネスと特定のリソース条件を使ったと明記しています 。
第三に、ベンチマークスコアはプロダクト品質の一部にすぎません。実際の導入では、正答率だけでなく、失敗の仕方、ハルシネーション率、遅延、コスト、ツール呼び出しの安定性、セキュリティポリシー、ログの再現性まで見る必要があります。ExplainXも、ベンチマーク定義、プロンプト、ツールポリシーによってスコアは動くため、自社の評価ハーネスの代替にはならないと指摘しています 。
現時点の公開根拠だけで見るなら、ターミナル型エージェントコーディングはGPT-5.5、SWE-Bench系のコード修正はClaude Opus 4.7、長いマルチモーダルコンテキストはKimi K2.6、コスト重視の大量呼び出しはDeepSeek V4から検証するのが合理的です 。
ただし、4モデルの総合勝者は保留するのが安全です。公開スコアは、プロンプト、ツールアクセス、推論設定、評価ハーネスによって変わり得るためです 。
| — |
| 実際のGitHub issueに近いコード修正では、Claude Opus 4.7が上回ります。 |
| — |
| 提供情報の範囲ではClaude Opus 4.7とKimi K2.6の値が確認できます。 |
| — |
| — |
| GPT-5.5とClaude Opus 4.7は非常に近く、公開値ではClaudeがわずかに上です。 |
| 54.0% |
| — |
| ClaudeとKimiの値が高いものの、Kimiは評価条件が別の可能性があります 。 |
| — |
| — |
| ブラウジングやWeb探索型の評価では、GPT-5.5の公開値が上です。 |