谷歌新一代旗舰模型 Gemini 4 Argon 的评价出现落差:公司强调它在多项基准测试中成绩领先,但据报道,一些接触过模型的员工认为,它在实际编程工作中的表现没有分数看起来那么稳定。这反映的是部分员工的使用体验,并不代表谷歌内部已有一致结论,更不能单凭这些说法断定 Gemini 4 落后于竞争对手。
11
基准成绩为何不能说明全部问题?
谷歌表示,Gemini 4 在多项基准测试中表现领先,其中一项衡量安全能力的测试成绩超过了 OpenAI 的 Astra。另一方面,据报道,熟悉内部评估的员工认为,模型处理部分实际编程任务时仍有不足,前端开发也受到质疑。
11
14
这两类信息并不必然互相否定。基准测试反映的是特定评测项目中的表现;工程师日常工作中的体验,则还涉及模型在具体任务上的实用性和稳定性。前者成绩亮眼,不代表所有实际任务都同样顺手;后者受到质疑,也不足以抹去已有的测试结果。
谷歌反驳批评,员工看法也不一致
谷歌表示,把 Gemini 4 描述为编程表现不佳并不准确,并援引其基准测试成绩为模型表现背书。与此同时,报道中的员工意见并非一面倒:有人认为 Anthropic 的 Fable 和 OpenAI 的 Astra 进步更快,也有人认为 Gemini 4 已经追上领先模型。
11
12
13
因此,目前更适合把这场争论看作对“测试分数能否代表实际工作体验”的不同判断,而不是对 Gemini 4 能力的最终定论。
放弃 Gemini 3.5 Pro,为发布节奏增添背景
据报道,谷歌原本计划在 2026 年 6 月推出 Gemini 3.5 Pro,后来放弃该版本,转而推进 Gemini 4。
6
13 这段开发历程让外界更关注谷歌的模型研发与发布节奏,但它本身并不能解释 Gemini 4 被指存在的编程短板,也不能证明新模型整体逊于对手。
为什么 Alphabet 股价也受到关注?
相关报道传出后,Alphabet 股价在周三交易时段收窄了早前超过 2% 的涨幅,最终上涨约 0.5%。这一波动说明消息发布期间市场情绪有所变化,但股价走势本身无法证实员工的担忧,也不能证明这些担忧就是股价变化的原因。
1
14
投资者关注的更大问题,是谷歌能否在旗舰 AI 模型竞争中与 OpenAI、Anthropic 抗衡。Gemini 4 是这场竞争的一部分;至于相关质疑会否影响谷歌的具体产品,目前报道并未给出明确结论。
10