Google 將 Gemini 4 Argon 定位為新一代旗艦模型,明顯希望藉此重返與 OpenAI、Anthropic 競逐頂尖 AI 模型的行列。公司稱 Argon 比之前的進階「Pro」系列更大,但目前沒有可靠資料交代其具體參數量;模型規模大,亦不等於它在所有用途上都必然更好。
主打複雜工作,測試成績並非全面勝出
Google 表示,Argon 面向需要多步推理、處理時間較長的工作流程,包括實際軟件工程、法律與金融等企業知識工作,以及網絡安全防禦。
1 換言之,這次發布的焦點不只是日常問答,而是希望模型可以協助處理較複雜的專業任務。
按 Google 公布的比較結果,Argon 在 18 項基準測試中有 12 項領先 OpenAI 的 GPT-6 Astra 和 Anthropic 的 Claude Opus 5.5,1 項打和,另外 5 項落後。
3 這些成績反映的是特定測試項目的表現,並非獨立證明 Argon 在所有工作情境都勝過對手;實際體驗仍要視乎任務、使用方式和測試方法。
暫時未有公開試用時間表
Argon 現階段透過 Google 的 Fairwind 計劃,先向一小批可信的網絡安全防禦者提供使用。
11 Google 尚未公布一般用戶何時可以使用,因此現時外界仍難以廣泛試用和比較模型的實際表現與成本效益。
Google 同時公布入門定價:每百萬個輸入 token 2 美元、每百萬個輸出 token 10 美元。Token 是模型處理文字的基本單位,輸入和輸出價格分開計算;Google 正以這個價格,配合模型能力作競爭賣點。
11
越過 Gemini 3.5 Pro,發布節奏亦受關注
Argon 的登場,亦代表 Google 沒有推出原先計劃中的 Gemini 3.5 Pro。該款中間版本在延誤後遭取消,Google 改為直接以 Gemini 4 作為下一步旗艦發布。
4
18
這次發布亦發生在 DeepMind 領導層調整之後。Koray Kavukcuoglu 接替 Demis Hassabis 出任部門主管,Hassabis 則轉任主席。 在這個背景下,Argon 不單是一次新模型發布,也成為外界觀察 Google 能否加快推出頂尖模型、重新建立競爭力的指標。
眼前的訊號是:Google 強調 Argon 的高階用途和基準測試成績,同時主打入門價格;但由於試用範圍仍窄,模型能否在真實工作中帶來相稱的表現與價值,還有待更多用戶實測。