谷歌于9月30日发布Gemini 4 Argon,将其定位为Gemini 4系列的旗舰模型。它面向软件工程、法律与金融工作、网络安全等复杂且耗时较长的任务。不过目前谷歌并未向公众开放,而是先提供给经过审核的网络安全防御者。
9
这次发布也发生在谷歌旗舰模型计划经历延误之后。Argon的规模大于谷歌此前的高端Pro模型;谷歌公布的多项基准测试结果,也显示它与OpenAI和Anthropic的模型相比颇具竞争力。但由于开放范围有限,大多数开发者和企业暂时还无法亲自检验这些表现。
6
Argon主要面向哪些任务?
谷歌称,Argon是其迄今能力最强的模型,重点面向复杂工作流程,包括需要持续推进的软件工程任务,以及法律、金融等企业知识工作和网络安全防御。谷歌表示,Argon比此前的高端Pro模型更大;但现有报道没有披露它的参数数量。
9
因此,“更大”只是相对于谷歌过往Pro系列而言,并非一个具体的规模指标。单凭模型更大,也无法判断它在成本、速度,或某个用户的具体任务上的表现是否更好。
谷歌公布的基准测试成绩如何?
谷歌公布的数据显示,Argon在一些与编程及专业工作相关的测试中表现突出。在Vals Index知识工作测试中,Argon得分为68.9%,高于OpenAI的GPT-6 Astra(63.1%)和Anthropic的Claude Opus 5.5(67.0%)。在AutomationBench测试中,谷歌公布的Argon得分为51.3%,Astra为41.4%,Opus 5.5为42.5%。
谷歌还称,Argon在评估长期软件工程任务的DeepSWE v1.1测试中得分为77.9%。 关于网络安全测试的报道则称Argon并列第一,而非在所有相关测试中都占据领先位置。
3
7
这些数字可以反映谷歌对Argon能力的评估,但应视为特定基准测试的结果,而不是对模型整体优劣的定论。测试覆盖的是有限任务;在开放范围仍受限制的情况下,大多数用户也难以进行独立评测。
6
现在谁能使用Argon?
谷歌最初通过Fairwind计划,将Argon提供给经过审核的网络安全防御者。公司称,限制初期使用范围,是为了让防御团队能够使用模型,同时降低其被滥用的风险。谷歌还加入了美国政府的自愿模型预发布访问流程。
6
5
目前,Argon尚未广泛提供给开发者、企业或消费者,相关报道也没有给出面向公众开放的确切日期。
6 据有关此次发布的报道,谷歌这种谨慎开放的做法与Anthropic限制Claude Mythos Preview使用范围的安排相似;但现有资料不足以对两项计划作全面比较。
6
Gemini 3.5 Pro的延期意味着什么?
据援引知情人士的报道,谷歌此前推迟了Gemini 3.5 Pro计划,以继续提升模型能力,尤其是编程表现。之后,谷歌转而推出Gemini 4 Argon,没有发布3.5 Pro。
这段背景让Argon承载了更高的期待:谷歌希望以新旗舰回应OpenAI和Anthropic此前推出的前沿模型。但现有报道将3.5 Pro延期归因于能力改进工作,并未证实具体的DeepMind组织调整是延期原因。
谷歌继续争夺前沿模型位置,Argon的成本优势仍待验证
谷歌也曾将较低成本作为模型竞争策略的一部分。这意味着,除了比拼基准测试成绩,价格或许也是谷歌争取用户的一个方向。不过,现有来源并未证明Argon本身相较竞争对手的旗舰模型具有经核实的成本优势。
目前比较清晰的情况是:谷歌公布了Argon在部分编程和企业工作基准测试中的亮眼成绩,同时采取有限开放的方式进行评估。这些成绩能否转化为日常使用中的优势,以及Argon的成本与竞品相比如何,都还有待更广泛的测试来回答。
6