Artificial Analysis 的独立评估显示,Gemini 3.7 Flash 在 Intelligence Index 上得分 56,高于 Claude Sonnet 5 的 55 分,略低于 GPT-5.6 Terra 的 57 分。
速度则是它最清晰的竞争优势。Artificial Analysis 测得其输出速度约为每秒 340 tokens,平均任务耗时指标为 1.7,并称在最高推理强度下,Flash 比 GPT-5.6 Terra 快约 40%。
这些数字反映的是评测或服务商环境下的测量结果,并不代表所有用户都会获得完全相同的体验。网络状况、服务商路由、提示词长度、工具响应时间和推理设置,都会影响端到端延迟。
这些成绩说明 Flash 是一款有竞争力的编程和终端智能体模型,但不能据此称其为所有场景的赢家。至少在所引用的 Terminal-Bench 结果中,GPT-5.6 Terra 仍然领先;Flash 的主要优势在于速度和发布初期的低成本。
在高推理强度下,ARC Prize 公布的结果显示,Gemini 3.7 Flash 获得:
考虑到报告中的单任务成本,这些表现相当突出。不过,ARC-AGI 成绩更适合作为模型能力信号,而不是生产级软件智能体可靠性的直接预测。真实智能体可能需要多次调用模型、运行外部工具、重试失败操作,并处理远大于基准任务的上下文。
这张表不是统一条件下的全球排行榜。不同模型的基准测试可能采用了不同设置,现有来源也没有建立覆盖所有模型的单一受控测试;价格还可能对应不同的托管、折扣或可用性条件。
从现有对比来看,Google 的定位选择相当明确。Gemini 3.7 Flash 在所引 Intelligence Index 上已经接近前沿,但并非最高分:GPT-5.6 Terra 以 57 分略高于 Flash,且在所引用的 Terminal-Bench 对比中也领先。
Google 更强调的是能力、延迟和成本之间的平衡。对于编程助手、自动修复 issue、网页开发智能体,以及需要持续调用工具的流程,一款足够聪明、响应足够快、成本又能支持高频调用的模型,可能比一款只在狭窄基准上领先、但更慢更贵的模型更实用。
这也是 2026 年 8 月模型发布潮中的关键竞争点:Qwen3.8-Max 加强了软件工程和智能体竞争,GLM-5.3 与 Nemotron 3.5 Lightning 推动低价和效率路线,Claude Opus 5 与 GPT-5.6 则瞄准更高端的能力市场。
Gemini 3.7 Flash 最适合被理解为一款高吞吐主力模型,而不是毫无争议的“最聪明模型”。它的核心竞争力在于:Intelligence Index 56 分、约每秒 340 tokens 的生成速度、可靠的编程与终端智能体成绩,以及极具吸引力的限时价格。
对开发者而言,最值得警惕的并非技术能力,而是价格有效期:每百万输入/输出 tokens 0.75/3.75 美元的促销价将在 2026 年 12 月 31 日结束,次日开始执行 1.50/7.50 美元的标准价格。
Google 所说的增长纪录未来或许能够得到数据证实,但就目前证据而言,Gemini 3.7 Flash 已经证明的是一种产品策略:让快速、低价的推理成为开发者规模化使用智能体的默认选项,而不是已经验证的模型采用率冠军。