但它并没有在所有评测中压倒对手。SWE-Bench Pro里,Claude Opus 4.7得分高于GPT-5.5;BrowseComp里,Gemini 3.1 Pro和Mythos Preview也高于GPT-5.5。 所以更准确的说法是:GPT-5.5很可能是“优先试用”的模型之一,但是否最适合,还要看具体任务。
这些分数不能简单相加成一个“总冠军”。不同基准考察的是不同能力:Terminal-Bench 2.0关注命令行工作流,SWE-Bench Pro评估GitHub issue解决能力;GDPval偏知识工作,OSWorld-Verified偏电脑使用任务。
| 评测项目 | GPT-5.5得分 | 怎么理解 |
|---|---|---|
| Terminal-Bench 2.0 | 82.7 | 高于Claude Opus 4.7的69.4、Gemini 3.1 Pro的68.5和Mythos Preview的82.0,说明它在命令行和开发流程类任务上很强。 |
| FrontierMath Tier 1–3 / Tier 4 | 51.7 / 35.4 | 在同一对比表中,高于Claude Opus 4.7的43.8 / 22.9,也高于Gemini 3.1 Pro的36.9 / 16.7。 |
| OfficeQA Pro | 54.1 | 高于Claude Opus 4.7的43.6和Gemini 3.1 Pro的18.1,办公类问答和文档场景值得重点关注。 |
| GDPval | 84.9 | 作为知识工作类评测,高于Claude Opus 4.7的80.3和Gemini 3.1 Pro的67.3。 |
| SWE-Bench Pro | 58.6 | 该评测面向GitHub issue解决;GPT-5.5低于Claude Opus 4.7的64.3,但高于Gemini 3.1 Pro的54.2。 |
| BrowseComp | 84.4 | 低于Gemini 3.1 Pro的85.9和Mythos Preview的86.9,说明浏览检索类任务仍需横向比较。 |
| OSWorld-Verified | 78.7 | 略高于Claude Opus 4.7的78.0,但低于Mythos Preview的79.6。 |
这组数据说明,GPT-5.5的优势很清晰:命令行、数学推理、办公任务和知识工作表现靠前;但在代码库issue修复、浏览检索和部分电脑操作任务上,竞争对手并不弱。
OpenAI明确把代码编写和调试列为GPT-5.5的强项。 Terminal-Bench 2.0的82.7也支持这一点,因为该评测考察命令行工作流,而GPT-5.5在公开对比中领先Claude Opus 4.7、Gemini 3.1 Pro和Mythos Preview。
不过,如果你的重点是“在既有代码库里解决GitHub issue”,就不能只看Terminal-Bench。SWE-Bench Pro中,GPT-5.5为58.6,而Claude Opus 4.7为64.3。 对工程团队来说,最好用自己的仓库、issue类型和测试流程做一次小规模对比。
OpenAI称,GPT-5.5擅长在线调研、数据分析,以及在模糊的多步骤任务中规划、调用工具、检查结果并继续推进。 这对需要“先查资料、再整理、再分析、最后生成报告”的工作流很有吸引力。
但BrowseComp给出了提醒:GPT-5.5得分84.4,低于Gemini 3.1 Pro的85.9和Mythos Preview的86.9。 如果任务高度依赖网页浏览、检索和信息定位,最好把这些模型放在同一套任务里实测。
文档、电子表格、软件操作是GPT-5.5的重点能力之一。 《纽约时报》也报道,OpenAI称其新技术在写代码和其他办公相关任务上有所改进。
OfficeQA Pro中,GPT-5.5得分54.1,高于Claude Opus 4.7的43.6和Gemini 3.1 Pro的18.1。 如果你的场景是整理材料、生成报告、处理表格、写流程文档或辅助办公软件操作,GPT-5.5很值得优先测试。
FrontierMath对比中,GPT-5.5在Tier 1–3得分51.7,在Tier 4得分35.4,均高于同表中的Claude Opus 4.7和Gemini 3.1 Pro。 对涉及数学推导、技术分析、建模思路或复杂逻辑拆解的任务来说,它是很强的候选。
GPT-5.4已经被描述为把推理、编码和智能体式工作流整合到一个前沿模型中,并强化了跨工具、软件环境以及表格、演示文稿、文档等专业任务能力。
GPT-5.5延续了这个方向,但更强调自主推进。OpenAI称,GPT-5.5能更快理解用户想做什么,并承担更多工作本身。 官方还表示,在GeneBench这一关注多阶段科学任务的新评测中,GPT-5.5相比GPT-5.4有明显提升。
要看场景。
如果看Terminal-Bench 2.0、FrontierMath、OfficeQA Pro和GDPval,GPT-5.5在公开对比中高于Claude Opus 4.7和Gemini 3.1 Pro。 这意味着,在终端工作、数学推理、办公问答和知识工作上,它很容易成为首选候选。
但如果看SWE-Bench Pro,Claude Opus 4.7领先GPT-5.5;如果看BrowseComp,Gemini 3.1 Pro和Mythos Preview领先GPT-5.5。 因此,不能用一句“谁最强”概括所有情况。
如果要把GPT-5.5用于真实工作,最可靠的方法不是只看排行榜,而是拿自己的任务来横向测试。可以这样分场景判断:
GPT-5.5确实很强,尤其强在更接近真实工作的连续任务:写代码、调试、处理文档和表格、分析数据、操作软件、跨工具推进流程。 公开基准也显示,它在命令行、数学推理、办公问答和知识工作类评测中处于领先位置。
但它不是“闭眼选就永远最好”的模型。BrowseComp、SWE-Bench Pro和OSWorld-Verified等评测都显示,某些任务上仍有竞争模型表现更好。
因此,最稳妥的结论是:GPT-5.5是当前综合实力最强的候选模型之一,但最佳选择仍取决于你的具体任务、文件类型、工具环境和可接受的错误成本。