在知識型工作方面,GDPval 評估 44 種職業任務,例如法律研究與產品決策,GPT‑5.5 在約 84.9% 的案例中能達到或超過專業人士表現。
整體來看,這些結果顯示 GPT‑5.5 在自主代理與多步驟工作流程方面特別強。
Anthropic 的 Claude Opus 4.7 被許多開發者視為目前最強的程式碼模型之一。
代表性成績:
SWE‑bench 會要求模型修復真實開源專案的 bug。Opus 4.7 成功解決 87.6% 的 Verified 任務,是目前公開比較中最強的程式工程能力之一。
雖然在 Terminal‑Bench 的代理流程分數不及 GPT‑5.5,但在程式修復與工程級任務上仍是最突出的模型之一。
Google 的 Gemini 3.5 Flash 有點特別:它並不是旗艦模型,而是主打速度與成本效率。
但它的基準測試仍相當有競爭力:
Google 表示,3.5 Flash 的輸出速度約為其他前沿模型的 4 倍,同時在代理與程式測試上超越舊版 Gemini 3.1 Pro。
因此它最大的優勢並不是極限能力,而是速度與能力的高效率組合,非常適合生產環境或高併發應用。
DeepSeek V4 在 AI 社群引起關注,因為它是少數能力接近前沿閉源模型的開放權重模型。
V4 系列包含兩個版本:
在最大推理模式下,V4‑Pro 的公開結果包括:
這些數據顯示它在部分程式與推理測試中接近頂級閉源模型。
但美國國家標準與技術研究院(NIST)CAISI 的獨立評估指出,DeepSeek V4 的能力仍比最前沿模型落後約 8 個月。
這顯示自報成績與第三方評估之間仍存在落差。
xAI 的 Grok 4.3 相比前代模型有明顯進步,尤其是在代理任務與工具使用方面。
公開數據包括:
其中 GDPval‑AA 分數相比前一版本提升 超過 300 Elo,顯示在實際任務自動化方面有顯著進步。
不過多數第三方分析仍認為 Grok 4.3 整體能力略低於最新的 OpenAI 與 Anthropic 模型。
綜合目前的基準測試結果,大致可以看到一個分工明確的格局:
需要注意的是,這些結論更多是趨勢判斷,而不是最終排名。
AI 模型排名之所以不穩定,主要有幾個原因:
通常需要經過數月的第三方測試,才能形成較穩定的能力排序。
2026 年的 AI 前沿格局並不是「單一王者」。
目前更像是多模型分工的局面:
隨著更多獨立測試與統一評估出現,這些模型的真正排名很可能還會繼續變化。