Google於9月30日公布Gemini 4 Argon,作為Gemini 4系列的旗艦模型。Google表示,Argon針對需要長時間、多步驟處理的工作,包括軟件工程、法律與金融等企業工作,以及網絡安全防守。不過,現階段它只會先交予部分獲挑選的網絡安全防守者試用,尚未向一般開發者或公眾開放。
9
這次發布亦是Google在旗艦模型計劃一再延後後,重新加入前沿AI競賽的重要一步。Google稱Argon比過往高階Pro模型更大,並公布多項與OpenAI及Anthropic模型的比較成績;但由於開放範圍有限,大部分用戶暫時無法親身測試這些表現。
6
Argon主打哪些工作?
Google形容Argon是至今能力最強、為複雜工作而設的模型,重點包括長時間進行軟件工程任務,以及法律、金融等企業知識工作和網絡安全防守。公司表示,Argon比以往頂級Pro系列模型更大,但現有報道未有列出它的參數數量。
9
因此,「更大」只是相對於Google過往Pro模型的描述,並非一個可直接量度的規格;單憑模型規模,也無法判斷它處理特定工作的成本、速度或實際表現。
Google公布的基準測試成績如何?
Google公布的比較顯示,Argon在多項與編程及專業工作有關的測試中取得不俗成績。在Vals Index知識工作測試中,Argon得分為68.9%,高於OpenAI的GPT-6 Astra(63.1%)及Anthropic的Claude Opus 5.5(67.0%)。在AutomationBench測試中,Argon得分為51.3%,Astra為41.4%,Opus 5.5則為42.5%。
Google亦表示,Argon在測試長時間軟件工程任務的DeepSWE v1.1取得77.9%。 至於網絡安全相關測試,報道形容Argon與其他模型並列第一,而非在所有網絡安全測試中全面領先。
3
7
這些數字反映Google公布的測試結果,但不等於已為整體模型能力定案。基準測試只涵蓋特定任務,加上目前大部分用戶未能使用Argon,外界仍難以獨立評估它在實際工作中的表現。
6
現時有誰可以使用?
Google現階段透過Fairwind計劃,向部分經審核的網絡安全防守者提供Argon。公司表示,有限度推出是希望協助防守團隊使用模型,同時降低遭人濫用的風險。Google亦參與美國政府自願推行的模型發布前存取流程。
6
5
Argon暫未普遍開放予開發者、企業或一般用戶,相關報道亦未有提供正式的全面開放日期。
6 有報道將這種審慎推出方式,與Anthropic限制Claude Mythos Preview使用範圍的做法相提並論;不過,現有資料不足以詳細比較兩個計劃。
6
Gemini 3.5 Pro延誤,對這次發布有何影響?
據引述知情人士的報道,Google延後Gemini 3.5 Pro,是因為公司希望提升模型能力,特別是編程表現。Google其後轉向推出Gemini 4 Argon,而非發布3.5 Pro。
這段背景令Argon的推出更受注目:在OpenAI和Anthropic持續推進各自前沿模型之際,Google正以新旗艦重新爭取競爭位置。不過,現有報道只指出Gemini 3.5 Pro延誤與改善模型能力有關,並無證據支持某項特定DeepMind組織變動是延誤原因。
強調成本優勢,Argon本身是否更便宜?
Google亦曾以模型成本優勢作為競爭定位的一部分,意味公司除了比拼基準測試成績,亦希望在成本方面吸引用戶。不過,這批資料未能證實Argon本身已較其他公司的旗艦模型具備經核實的成本優勢。
目前較準確的說法是:Google公布的部分編程及企業工作測試成績亮眼,但Argon仍在有限度推出及評估階段。它能否在日常應用中勝過對手,以及使用成本與競爭模型相比如何,都要待更多人可以測試後才有答案。
6