Google開始推出旗艦AI模型 Gemini 4 Argon。公司表示,模型在多項基準測試取得領先成績,其中一項評估安全能力的測試更勝過OpenAI的Astra。不過,有接觸過模型的員工向媒體表示,實際用來處理工作時,表現未必如測試分數般理想,部分寫程式任務尤其令人有保留。
11
焦點不只是「測試分數高唔高」,而是模型能否在具體工作中持續交出可靠結果。現有報道呈現的是Google內部有不同聲音,並非員工一致認定Gemini 4落後對手。
基準測試高分,未必代表每種工作都順手
基準測試會按指定題目和評分方式比較模型;員工提到的則是實際工作經驗。兩者反映的面向不同,因此測試成績亮眼,未必足以回答模型在所有日常程式工作中是否穩定。報道提到,有員工對部分編碼工作、尤其前端開發的表現有所質疑。
11
14
另一方面,Google強調Gemini 4在多項測試表現出色,亦指稱把它形容為寫碼能力不佳並不準確。公司與部分員工的說法有落差,但現有資料不足以單憑其中一方的評價,替模型整體能力下定論。
11
12
員工對競爭對手進展看法不一
部分員工認為,Anthropic的Fable系列和OpenAI的Astra進步得比Gemini快;亦有員工認為,Gemini 4已追上領先模型。換言之,內部對競爭形勢並無一致看法。
12
13
Google此前曾計劃在2026年6月推出Gemini 3.5 Pro,之後放棄該版本,轉而推出Gemini 4。這段產品發展脈絡令外界更關注Google的模型推出進度,但單憑版本計劃改動,不能證明Gemini 4的寫碼能力較差。
6
13
股價收窄升幅,不等於報道已證實疑慮
相關報道刊出後,Alphabet股價由早前升逾2%,收窄至周三交易時段約升0.5%。股價變化反映市場消息公布前後的走勢,但本身不能證明員工對模型的疑慮正確,也不能單憑這個變化確認報道是股價變動的唯一原因。
1
14
對投資者而言,Gemini 4是Google與OpenAI、Anthropic競爭旗艦AI模型的一部分。市場關注的核心,是Google能否把基準測試上的成績轉化為可靠的實際用途;至於今次爭議會否影響Google旗下個別產品,現有報道並未證實。