Google 於 9 月 30 日公布 Gemini 4 Argon,將其定位為 Gemini 4 世代的旗艦模型。Argon 主打程式工程、法律與財務等企業知識工作,以及資安防禦等複雜、耗時較長的任務。不過,模型目前只向經審核的資安防禦者有限度開放,尚未面向一般大眾推出。
9
這次發表也讓 Google 有機會在旗艦模型競賽中重新展現實力。Argon 的規模大於 Google 過往的高階 Pro 系列;Google 公布的部分基準測試成績也優於 OpenAI 與 Anthropic 的競品。但由於外界目前無法廣泛試用,這些表現還有待更多獨立測試檢驗。
6
Argon 主打哪些工作?
Google 將 Argon 描述為目前最能處理複雜工作負載的模型,應用方向包括需要多步推理的軟體工程、法律與財務等企業知識工作,以及資安防禦。公司表示,Argon 的規模比先前最高階的 Pro 模型更大;不過,現有報導沒有提供它的參數數量。
9
因此,「規模更大」是相對於 Google 過往 Pro 系列的說法,並非一個可直接比較的具體尺寸。單憑模型規模,也無法判斷它在費用、速度,或特定使用情境下是否勝過競品。
Google 公布的基準測試成績
在 Google 公布的比較中,Argon 在多項與程式開發及專業工作相關的測試取得高分。知識工作測試 Vals Index 上,Argon 得分為 68.9%,OpenAI 的 GPT-6 Astra 為 63.1%,Anthropic 的 Claude Opus 5.5 為 67.0%。在 AutomationBench 上,Argon 得分為 51.3%,Astra 為 41.4%,Opus 5.5 則為 42.5%。
Google 另公布,Argon 在評估長時間軟體工程任務的 DeepSWE v1.1 測試中得分為 77.9%。 至於資安測試,相關報導指出 Argon 在其中一項指標並列第一,並非在所有資安項目上都確立全面領先。
3
7
這些數字可反映 Google 宣稱 Argon 在特定任務上的能力,但不等於已為整體模型品質定論。基準測試只涵蓋部分工作,而 Argon 尚未廣泛開放,也讓多數使用者與外部研究者難以自行驗證其表現。
6
目前誰能使用?
Google 初期透過 Fairwind 計畫,將 Argon 提供給經審核的資安防禦者。公司表示,有限度推出是為了讓防禦團隊運用模型能力,同時降低遭到不當使用的風險。Google 也加入美國政府的自願性模型發布前存取流程。
6
5
目前一般開發者、企業與消費者都還不能廣泛使用 Argon,相關報導也沒有列出全面開放的確切日期。
6 報導將這種審慎推出方式與 Anthropic 限制 Claude Mythos Preview 的作法相提並論;不過,現有資料不足以進一步完整比較兩項計畫。
6
Gemini 3.5 Pro 延遲,為何讓 Argon 更受關注?
據引述知情人士的報導,Google 曾延後 Gemini 3.5 Pro,期間持續改善模型能力,尤其是程式開發表現。Google 後來轉向推出 Gemini 4 Argon,而非發布 3.5 Pro。
這段經過讓 Argon 的發表更受矚目:在 OpenAI 與 Anthropic 持續推進前沿模型之際,Google 以新旗艦模型重新出牌。不過,現有報導將 3.5 Pro 延遲與能力改善工作相連結,並未證實是某項特定 DeepMind 組織變動所致。
成本優勢仍待確認
Google 近月也把模型成本優勢作為競爭論述的一部分,試圖在基準測試以外提出另一種競爭方式。不過,現有來源並未證實 Argon 本身的成本已比其他旗艦模型更低。
目前較明確的結論是:Google 公布的 Argon 成績在部分程式開發與企業工作測試中表現突出,但模型仍在有限度推出與評估階段。這些分數能否轉化為日常工作中的實際優勢,以及 Argon 的成本與競品相比如何,都有待更廣泛的測試與使用經驗驗證。
6