またGDPvalでは、法律・金融・プロダクトマネジメントなど44の職種にまたがる知識労働タスクの約84.9%で専門家と同等以上の結果が報告されています。
これらの結果から、GPT‑5.5は特に
といった領域で強いモデルとされています。
AnthropicのClaude Opus 4.7は、特にソフトウェア開発タスクで高い評価を受けています。
主なスコア:
SWE‑benchは、実際のオープンソースリポジトリのバグ修正問題を解くベンチマークです。Opus 4.7は87.6%のタスクを解決し、非常に高い水準を示しました。
Terminal‑BenchではGPT‑5.5に及ばないものの、コーディングエージェント用途では最強クラスと評価されています。
Google DeepMindのGemini 3.5 Flashは少し特殊で、最上位モデルではなく高速・低コストモデルとして設計されています。
しかしベンチマークでは競争力のある結果を示しています。
主な結果:
Googleによれば、このモデルは同クラスの最先端モデルより約4倍高速で動作するとされています。
つまりGemini 3.5 Flashの強みは
という実用面にあります。
DeepSeek V4は、中国のAI企業DeepSeekが公開したオープンウェイトの最先端モデルの一つです。
モデルは主に2種類あります。
最大推論モードでの主なスコア:
これらの結果は、クローズドモデルと比較してもかなり近い水準にあります。
ただし米国国立標準技術研究所(NIST)のCAISIによる独立評価では、最先端モデルより約8か月遅れている可能性が指摘されています。
つまり、性能は非常に高いものの、最先端トップ層とはまだ差があるという見方です。
xAIのGrok 4.3は、以前のGrokモデルから大きく改善されています。
主な指標:
特にGDPval‑AAでは前バージョンより300 Elo以上の改善が報告されています。
ただし第三者評価では、最新のOpenAIやAnthropicのモデルよりは総合性能でやや下とされるケースが多いです。
公開データを総合すると、2026年のAI最前線は次のような特徴があります。
ただしこれらは確定順位ではなく傾向に近い評価です。
AIベンチマークが比較しづらい理由はいくつかあります。
そのため、モデルの本当の順位は数か月の独立評価を経てから明確になることが多いとされています。
2026年のAI競争は、単一の「最強モデル」が全分野で勝っている状況ではありません。
現状の傾向を整理すると次の通りです。
今後、独立ベンチマークや統一評価が増えるにつれて、これらの順位はさらに変わっていく可能性があります。