換句話說:看真實 repo 工作,Claude/Opus 的實務證據很強;看特定排行榜,勝負會隨評測與外層工具而變。
Claude 的強項不只在「寫出一段看起來正確的程式碼」,而是在任務更接近真實軟體工程時仍能維持穩定。Emergent 強調,實際 coding 表現取決於系統能否在壓力下處理多步驟、repository 層級工作,而 Claude Code with Opus 4.6 被點名適合複雜除錯、多檔案推理與高風險程式碼變更。
這點對開發團隊很重要。日常工程常常不是「請幫我寫一個函式」而已,而是要理解既有架構、追蹤跨檔案影響、反覆跑測試與修正。Emergent 也指出,Claude Code 能在大型程式碼庫中維持上下文,並在迭代除錯時不容易退化。
基準測試方面,Claude 的證據同樣有亮點。Awesome Agents 回報,GPT-5.4 在自訂 scaffolding 下於 SWE-bench Pro 領先;但當 Scale SEAL 將 SWE-bench Pro 的 agent tooling 標準化後,Claude Opus 4.5/4.6 反而領先 GPT-5.4。 對要採用 agent 型 coding assistant 的團隊來說,這個差異非常關鍵:你買到的不只是模型,還有外層工具流程。
GPT-5.x Codex 系列仍應該放進任何嚴肅候選清單,特別是當你的流程偏向 OpenAI/Codex 式工作流,或你的團隊打算自行設計 agent scaffolding。Awesome Agents 回報,GPT-5.4 在自訂 agent scaffolding 下於 SWE-bench Pro 達到 57.7%;同一來源也描述 SWE-bench Pro 是更困難的版本,包含 41 個 repositories、1,865 個任務。
SWE-bench 排行榜顯示的條目中,GPT-5-2 Codex 也達到 72.80。 這對以 benchmark 為核心的團隊是強訊號。不過,單一數字仍不足以解答「整體最佳」這個問題,因為同一組證據也顯示,外層 scaffolding 會改變誰看起來領先。
Gemini 也是不能忽略的 benchmark 型候選。SWE-bench 排行榜顯示,Gemini 3 Flash(high reasoning)為 75.80,高於同一顯示條目中的 GPT-5-2 Codex 72.80。
如果你的選型流程很重視 SWE-bench,Gemini 就值得納入實測。不過,公開榜單不等於你的內部環境:你的程式碼庫、權限設定、測試套件、code review 標準與 agent 工具鏈,都可能與排行榜條件不同。
AI 寫程式排行榜看起來不一致,通常不是誰「錯了」,而是它們量的東西不同。
實務上,排行榜最適合拿來建立候選名單,而不是直接替你的團隊做最後決策。
最可靠的方法,是在你自己的程式碼庫上做受控試驗。每個候選模型都使用同一個 repository、同一套指令、同樣權限、同樣時間限制與同樣 review 流程。
建議測試任務至少包含:
打分時,別只看回答漂不漂亮。更應該看:測試是否通過、解釋是否準確、上下文是否能維持、修改是否克制、是否引入不必要變更,以及最後需要多少人工 review。對 production code 來說,這些往往比單一排行榜分數更有用。
若你的目標是處理最難的真實軟體工程工作,Claude Code 搭配 Opus 級模型,是目前證據最支持的預設選擇。 若你的選型偏向 benchmark 或特定 agent 流程,GPT-5.x Codex 與 Gemini 仍是強力候選:GPT-5.4 在自訂 scaffolding 下於 SWE-bench Pro 被回報為 57.7%,SWE-bench 顯示 Gemini 3 Flash 為 75.80。
最安全的結論不是「某一個模型永遠贏」,而是:困難 repo 工作先測 Claude Code/Opus;benchmark 導向的評估納入 GPT-5.x Codex 與 Gemini;最後,用你自己的程式碼庫決定。