一方、Claude Opus 4.7は別の分野で目立つ結果を出しています。
SWE‑BenchはGitHubの実際のバグ修正タスクを使う評価で、実務的なソフトウェア開発能力を見る指標です。
GoogleのGemini 3.5 Flashは「高速推論モデル」に分類されますが、性能はかなり高く、Google公開表では次の結果が報告されています。
同じ表では
となっており、Flashモデルとしてはかなり上位に近い位置です。
LLMの評価で最も差が出やすい分野のひとつがコーディングです。
Claude Opus 4.7はここで特に強い結果を示しています。
このベンチマークでは、モデルがオープンソースプロジェクトの実際の問題を修正できるかが測定されます。
GPT‑5.5は同じベンチマークでは
とやや低いものの、開発作業全体では非常に強く、例えばターミナル操作の自動化などを評価する
でトップの結果を出しています。
Gemini 3.5 Flashも
と健闘しており、高速モデルとしてはかなり高い性能といえます。
一方で
Grok 4.3のコーディング系ベンチマークは、SWE‑Benchなどの共通テストではなく
など独自寄りの評価が多く、他モデルと直接比較しにくい点があります。
DeepSeek V4については、公開されているコーディングベンチマークの多くが内部テスト由来で、第三者による再現がまだ十分ではありません。
最近のAI評価では「ツールを使いながら複数ステップの作業を完了する能力」が重要視されています。
Googleの公開評価では、Gemini 3.5 Flashがこの分野で高い結果を出しています。
これらは複数ツールを連携させる実務ワークフローを想定したベンチマークです。
一方、GPT‑5.5は知識労働型タスクを測る
という結果が公開されています。
Claude Opus 4.7もPC操作タスクで強く、
を記録しています。
ベンチマークだけでは、実際の導入のしやすさは分かりません。
Grok 4.3は長いコンテキスト処理を重視したモデルです。
とされており、大量テキスト処理ではコスト効率が強みになる可能性があります。
Gemini 3.5 Flashは高速推論を目的に設計されており、Googleは他のフロンティアモデルよりも大幅に高速だと説明しています。
DeepSeekのモデルは一般に
を重視する傾向があり、自社インフラでの運用を検討する企業にとって魅力になる場合があります。
DeepSeek V4について比較的信頼度の高い評価は、米国国立標準技術研究所(NIST)のCAISIプログラムによるものです。
この評価では次のように報告されています。
また、DeepSeekが公開したベンチマークは、CAISIの独立評価よりも強く見える傾向があるとも指摘されています。
AIモデルの比較が難しい理由はいくつかあります。
このため、厳密な「1位〜5位ランキング」を作るのは慎重に扱う必要があります。
公開データから見える傾向をまとめると次の通りです。
最終的に「最適なモデル」は用途次第です。コーディングエージェント、研究支援、長文解析、低コスト運用など、ワークロードによって選択は変わります。