沒有一個模型能在所有 coding 場景通吃:Claude Opus 4.6 在 SWE Bench Verified 約落在 79% 到 81%,GPT 5.3 Codex 在引用的 Terminal Bench 2.0 OpenAI 比較中達 77.3%,GPT 5.4 對 GPT 5.3 Codex 的直接 coding 增幅則偏小 [1][3][5][7][9]。 若是儲存庫 bug 修復,先測 Claude Opus 4.6;若是終端機代理工作流,把 GPT 5.3 Codex 納入候選;若是 OpenAI only 或工具密集系統,再特別評估 GPT 5.4 的工具搜尋與 MCP token 節省 [1][3]。
研究答案

Create a landscape editorial hero image for this Studio Global article: GPT-5.4 vs GPT-5.3-Codex vs Claude Opus 4.6: The Coding Winner Depends on the Benchmark. Article summary: There is no universal coding winner: Claude Opus 4.6 has the strongest reported SWE Bench Verified signal at about 79 81%, GPT 5.3 Codex leads the cited Terminal Bench 2.0 comparison at 77.3%, and GPT 5.4's same sourc.... Topic tags: ai, ai benchmarks, openai, anthropic, claude. Reference image context from search candidates: Reference image 1: visual subject "gpt-5.4 vs opus 4.6. # GPT-5.4 vs Claude Opus 4.6: Which One Is Better for Coding? OpenAI has launched GPT-5.4, the latest iteration of its GPT-5 family, and, as per them, it’s the" source context "GPT-5.4 vs Claude Opus 4.6: Which One Is Better for Coding? - Bind AI" Reference image 2: visual subject "gpt-5.4 vs opus 4.6. # GPT-5.4 vs Claude Opus 4.6: Whic
先講結論:這不是「誰比較會寫程式」的一刀切問題。從提供的公開資料來看,Claude Opus 4.6 在 SWE-Bench Verified 這類儲存庫修 bug 測試上最有說服力;GPT-5.3-Codex 是 OpenAI 陣營在 Terminal-Bench 2.0 終端機代理流程中的強勢選項;GPT-5.4 的 coding 成績相對像是小幅改進,而不是壓倒性升級 。
真正容易踩坑的是測法。SWE-Bench 的不同版本不能直接互比,Terminal-Bench 的公開榜單則不只測模型,也測搭配的 agent harness,也就是代理框架與執行流程 。
Claude Opus 4.6 最強的證據來自 SWE-Bench Verified。引用資料中,它在這個版本的成績分別被列為 79.2%、79.4% 或 80.8% 。
GPT-5.3-Codex 的 SWE-Bench 敘事比較複雜。GPT-5.4 相關分析把 GPT-5.3-Codex 在 SWE-Bench Pro 的分數列為 56.8%,但另兩份 Opus 與 Codex 的比較則列出 GPT-5.3-Codex 在 SWE-Bench Pro Public 為 78.2% 。這不是叫你把分數平均,而是提醒你:測試版本不同,不能草率排座次。多個來源也明確提醒,SWE-Bench Verified 與 SWE-Bench Pro Public 並不能直接互換比較
。
至於 GPT-5.4,在這批資料中最乾淨的 OpenAI 對 OpenAI coding 優勢,是同一份分析裡的 SWE-Bench Pro:GPT-5.4 為 57.7%,GPT-5.3-Codex 為 56.8% 。另一份整理也提到 GPT-5.4 的 57.7% SWE-Bench Pro Public 數字,同時警告 Claude 與 GPT 的 broader 比較不是 apples-to-apples
。
Terminal-Bench 2.0 更容易被誤讀,因為公開 leaderboard 列的是「agent/model 組合」,不是孤立的基礎模型能力 。同一個模型換了代理框架,分數就可能差很多。
在該榜單中,GPT-5.3-Codex 搭配 SageAgent 為 78.4%,搭配 Droid 為 77.3%,搭配 Simple Codex 為 75.1% 。Claude Opus 4.6 則在搭配 ForgeCode 時為 79.8%,搭配 Capy 時為 75.3%,搭配 Terminus 2 時為 62.9%
。
這個落差已經足以改變「看起來的冠軍」。GPT-5.4 相關比較把 GPT-5.3-Codex 在 Terminal-Bench 2.0 列為 77.3%,高於 Claude Opus 4.6 的 65.4% 。但公開榜單也有 ForgeCode/Claude Opus 4.6 的 79.8%,高於 SageAgent/GPT-5.3-Codex 的 78.4%
。所以,若你在評估終端機代理工作流,務必先固定 harness,再談模型勝負。
如果你的 coding 品質代理指標是 SWE-Bench Verified,Claude Opus 4.6 是這批資料中最有根據的起點。它的 Verified 成績集中在約 79% 到 81%:GPT-5.4 分析列為 79.2%,Opus-vs-Codex 比較列為 79.4%,其他 benchmark roundup 則列到 80.8% 。
但這不代表 Opus 4.6 在所有 coding 任務都贏。它在 Terminal-Bench 的故事比較分裂:比較文列出 65.4%,公開榜單則顯示 Opus 4.6 搭配 ForgeCode 可到 79.8%,搭配 Terminus 2 則是 62.9% 。換句話說,它是 Verified 型儲存庫修復的安全首選,不是萬用 coding 冠軍。
如果你的工作像 Terminal-Bench 這類 agentic shell 任務,GPT-5.3-Codex 是 OpenAI 模型中很該列入 bakeoff 的選項。比較報告列出它在 Terminal-Bench 2.0 為 77.3%;公開榜單也列出 GPT-5.3-Codex 搭配 SageAgent 為 78.4%、搭配 Droid 為 77.3%、搭配 Simple Codex 為 75.1% 。
它的 SWE-Bench 成績則必須小心解讀。有些報告列 GPT-5.3-Codex 在 SWE-Bench Pro Public 為 78.2%,另一些則列 SWE-Bench Pro 為 56.8% 。既然來源已提醒這些版本不能直接互比,你就應該用自己要採用的同一個 SWE-Bench 版本與評估設定來判斷它
。
就這批 benchmark 而言,GPT-5.4 不像是 coding 能力大爆發。主要的同源比較顯示,它在 SWE-Bench Pro 小幅領先 GPT-5.3-Codex,57.7% 對 56.8%;但在 Terminal-Bench 2.0 反而較低,75.1% 對 77.3% 。
更有辨識度的是工具使用。GPT-5.4 分析指出,工具搜尋會按需載入工具定義,而不是把所有定義一次塞進上下文,因此 MCP token 使用量降低 47% 。若你建的是工具很多的 coding agent,這可能是系統層面的實際優勢;但它仍應和 benchmark accuracy 分開衡量。
若你要做 Verified 風格的儲存庫 bug 修復,先測 Claude Opus 4.6;若你要跑終端機代理流程,GPT-5.3-Codex 一定要放進比較;若你需要最新 OpenAI 模型,或想評估工具搜尋帶來的 token 效率,GPT-5.4 值得另外測 。
最穩妥的答案不是「某一個模型統治 coding」,而是:勝負會隨 benchmark 版本、agent harness,以及你真正要跑的工作負載而變 。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
沒有一個模型能在所有 coding 場景通吃:Claude Opus 4.6 在 SWE Bench Verified 約落在 79% 到 81%,GPT 5.3 Codex 在引用的 Terminal Bench 2.0 OpenAI 比較中達 77.3%,GPT 5.4 對 GPT 5.3 Codex 的直接 coding 增幅則偏小 [1][3][5][7][9]。
沒有一個模型能在所有 coding 場景通吃:Claude Opus 4.6 在 SWE Bench Verified 約落在 79% 到 81%,GPT 5.3 Codex 在引用的 Terminal Bench 2.0 OpenAI 比較中達 77.3%,GPT 5.4 對 GPT 5.3 Codex 的直接 coding 增幅則偏小 [1][3][5][7][9]。 若是儲存庫 bug 修復,先測 Claude Opus 4.6;若是終端機代理工作流,把 GPT 5.3 Codex 納入候選;若是 OpenAI only 或工具密集系統,再特別評估 GPT 5.4 的工具搜尋與 MCP token 節省 [1][3]。
別把 SWE Bench Verified、SWE Bench Pro、SWE Bench Pro Public 混成同一張排行榜;Terminal Bench 2.0 也要注意 agent harness 會影響結果 [1][6][7][10]。