這些基準測試模型是否能修復開源程式庫中的真實問題,因此被視為最接近「實務開發能力」的評估。
另一方面,Google 的 Gemini 3.5 Flash相當特別。它原本定位為高速推理模型,但性能已逼近旗艦級模型。例如在Google發布的跨模型表格中:
這代表Flash級模型與頂級模型之間的差距正在縮小。
至於 Grok 4.3 與 DeepSeek V4,由於評估方式與公開資料較少,目前較難做精確排名。
在所有能力類型中,「寫程式與修程式」是最容易看到差異的一類。
Claude Opus 4.7目前在公開證據中最具優勢。其 SWE‑Bench Pro 64.3% 的分數,比多數前代模型高出一截,顯示其在解決GitHub真實問題、跨語言程式修復方面的能力相當強。
GPT‑5.5在同一測試中為 58.6%,略低於Opus,但它在另一類工程任務中表現極強——例如終端機操作與工具協作。
例如 Terminal‑Bench 2.0 測試的是模型是否能透過命令列完成多步驟工程流程,而GPT‑5.5達到 82.7% 的領先成績。
Gemini 3.5 Flash 在 SWE‑Bench Pro 上約 55.1%。雖然低於Opus,但對於一個以速度為主的模型而言仍相當突出。
至於 Grok 4.3,公開數據多來自不同類型的評估,例如:
這些測試偏向特定場景,因此難以與SWE‑Bench或Terminal‑Bench直接比較。
DeepSeek V4 的情況更複雜。目前多數高分數來自內部測試或外流資料,尚未有完整的獨立重現,因此可靠性有限。
近年的AI評估開始更重視「代理型能力」,也就是模型能否調用多個工具、規劃流程並完成多步任務。
在這方面,Google報告指出 Gemini 3.5 Flash 在多項工具使用基準中領先,例如:
這些測試專門評估模型在多工具工作流程中的協調能力。
GPT‑5.5 在類似任務上也表現強勢,例如 GDPval 測試跨多種職業任務的知識工作能力,其 84.9% 的結果代表在大多數比較中獲勝或打平。
Claude Opus 4.7 則在電腦操作類任務表現良好,其 OSWorld‑Verified 78.0% 顯示模型能操作桌面介面並與軟體互動完成任務。
單看基準測試並不能完整反映實際部署價值。
Grok 4.3 特別強調長上下文與成本效率。xAI文件指出其:
這使其在需要處理大型文件或長上下文分析的場景中特別有吸引力。
Gemini 3.5 Flash 的設計重點則是高速推理。Google表示其輸出速度可達其他前沿模型的數倍,同時在部分代理型測試仍保持競爭力。
DeepSeek 系列模型則通常以開放權重或低成本部署策略為主,使企業能在本地或自建基礎設施運行模型。
目前最具權威性的DeepSeek V4評估之一來自 美國國家標準與技術研究院(NIST)旗下的 CAISI 計畫。
該評估指出:
報告同時指出,DeepSeek官方發布的基準測試結果普遍高於CAISI的獨立測量,凸顯第三方評估的重要性。
即使有大量數據,跨模型比較仍然存在幾個問題:
因此任何「從第一名排到第五名」的結論都需要謹慎解讀。
綜合公開資料,大致可以得出以下觀察:
實際上,最佳模型仍取決於使用情境——例如程式代理、研究助手、長文件分析或低成本推理等場景,各模型可能各有優勢。