Gemini 4 Argon 的評價出現落差:Google 強調它在多項基準測試中表現領先,但有熟悉內部評估的員工向媒體表示,模型用於部分實際程式工作時,表現不一定同樣理想。這些說法反映的是員工之間存在疑慮,並不代表公司內部已形成一致結論,也不能單憑傳聞判定 Gemini 4 落後競品。
11
基準測試亮眼,實際開發仍有不同觀感
Google 表示,Gemini 4 在多項基準測試取得領先成績,其中一項衡量安全能力的測試,分數高於 OpenAI 的 Astra。另一方面,部分接觸過模型的員工據報稱,它處理某些實際程式任務時不夠穩定,前端開發尤其受到關注。
11
14
這兩種說法並不必然互相矛盾:基準測試呈現的是特定評測中的結果,工程人員的日常體驗則關乎模型在具體工作中的表現與一致性。前者不能回答所有實務問題,後者也不足以推翻測試成績。
Google 否認表現不佳,員工對競爭態勢看法分歧
Google 表示,稱 Gemini 4 在程式領域表現不佳並不準確,並以基準測試結果作為依據。至於內部看法,報導指出並不一致:有員工認為 Anthropic 的 Fable 與 OpenAI 的 Astra 進步較快,也有人認為 Gemini 4 已追上領先模型。
11
12
13
因此,目前較恰當的理解是:外界看到的是一場關於評測成績能否代表實際工作表現的爭論,而不是對 Gemini 4 能力已有定論。
放棄 Gemini 3.5 Pro,為發布進程增添背景
據報導,Google 原先計畫在 2026 年 6 月推出 Gemini 3.5 Pro,後來放棄該版本,轉而推出 Gemini 4。這段開發與發布歷程,讓外界更關注 Google 的模型進度;但它本身不能解釋 Gemini 4 傳出的程式表現疑慮,也不能證明新模型較競品遜色。
6
13
股價波動是市場反應,不是能力判決
相關報導傳出後,Alphabet 股價收斂了當日稍早逾 2% 的漲幅,收盤時約上漲 0.5%。這顯示消息出現期間市場情緒有所變化,但股價走勢本身無法證明員工的疑慮正確,也不能單獨證明報導就是股價變動的原因。
1
14
投資人更關心的,是 Google 能否在旗艦 AI 模型競爭中與 OpenAI、Anthropic 一較高下。Gemini 4 正處於這場競爭的焦點;至於它對 Google 個別產品會有什麼影響,現有報導並未提供具體結果,仍有待觀察。
10