相反,Google 嘅 Gemini 3.7 Flash 喺 8月13號推出,開賣價係 每百萬輸入 tokens $0.75,每百萬輸出 tokens $3.75——即係上一代 Gemini 3.6 Flash 嘅一半,大約係 Grok 4.6 嘅三分之一 。呢個優惠價去到 2026年12月31號,之後會加倍
。
價格對比好明顯:Grok 4.6 係同 GPT-5.6 Sol 同 Claude Opus 5 呢啲頂尖模型鬥智能,而 Gemini 3.7 Flash 就定位做「工作馬」級別嘅模型——效能同 Claude Sonnet 5 同 GPT-5.6 Terra 差不多,但價錢平好多 。
Grok 4.6 喺 Artificial Analysis(AA)Intelligence Index 攞到 61 分,呢個指數係由九個評估組成 。呢個分數追平 GPT-5.6 Sol Max,比 Claude Fable 5 Max(62 分)低一分,比 Claude Opus 5 Max(63 分)低兩分——係 xAI 第一次有模型打入呢個頂尖集團
。
| 基準測試 | Grok 4.6 (High) | Grok 4.5 (High) | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 (Elo) | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| AA-Briefcase | 1577 | — | — | — |
SpaceXAI 話 Grok 4.6 喺 所有列出嘅評估 都比 Grok 4.5 好,包括 CursorBench、FrontierCode、APEX-Agents 同 Terminal-Bench 。獨立測試機構 Artificial Analysis 證實咗呢啲 claims,誤差只係 0.08 分左右
。
特別要注意嘅係,Grok 4.6 最強嘅獨立測試結果係喺 知識工作評估——佢喺 GDPval-AA v2(1753 Elo)、AA-Briefcase(1577)同 Harvey 法律 benchmark 都領先,意味住呢個模型特別適合專業知識型嘅任務 。不過,雖然佢係以 agentic coding 模型做賣點,但佢嘅 CursorBench v3.2 分數(69.9%)係俾 Fable 5 Max(70.5%)低,不過就贏咗 GPT-5.6 Sol Max(67.2%)
。
至於 Gemini 3.7 Flash,佢喺編碼同 agent benchmark 都有明顯進步。喺 FrontierCode v1.1,佢嘅生產級代碼生成分數係 43.6%,比 3.6 Flash 嘅 34.4% 高,仲贏過 Claude Sonnet 5(42.7%)同 GPT-5.6 Terra(41.3%)。DeepSWE v1.1 由 49.0% 升到 65.3%,AutomationBench 由 17.0% 升到 30.4%,升幅都好大
。
Grok 4.6 嘅主要架構新增係一個新嘅 xhigh 推理級別,係一個專門為最難嘅 agentic 同編碼任務而設嘅高強度推理模式 。呢個模型特別優化咗 長時間運行 Agent 嘅耐用性——佢解決任務所需嘅交互次數大約係 Claude Opus 5 嘅一半,或者大約係四分一嘅輸入 tokens,以標價計
。呢個效率優勢對開發者嚟講可以話係最大嘅賣點,尤其係要進行幾小時編碼嘅時候
。
SpaceXAI 話 Grok 4.6 嘅進步係因為更長嘅補充訓練、顯著改善嘅監督式微調同強化學習——而唔係增加參數數量 。模型保留咗同 Grok 4.5 一樣嘅 1.5 萬億參數 V9 基礎架構
。
Grok 4.6 嘅優點:
Grok 4.6 嘅限制:
推出兩日後,即係 8月14號,Grok 4.6 喺 GitHub Copilot 上線,覆蓋晒所有主要開發平台 :
GitHub 嘅官方更新日誌形容佢係「專為 agentic 編碼同複雜嘅多步驟工作流程而設計」。呢個快速整合顯示開發平台對呢個模型有好大需求 。
呢個 8月12至13號嘅推出時間表,揭示咗兩個完全唔同嘅競爭策略:
Grok 4.6(SpaceXAI)——每百萬 tokens $2/$6——頂尖綜合智能(AA Index 61)——500K 上下文——專為 agentic 編碼同知識工作——任務效率比 Opus 5 好
Gemini 3.7 Flash(Google)——每百萬 tokens $0.75/$3.75(優惠價)——工作馬級別效能,同 Claude Sonnet 5 同 GPT-5.6 Terra 差不多——1M 上下文窗口——第一個支援 agentic 影片處理嘅 Gemini 模型——整合到 Gemini Spark
Grok 4.6 係用平過頂尖模型嘅價錢鬥智能,而 Gemini 3.7 Flash 就用超平嘅價錢鬥工作馬級別嘅效能。Google 將 Gemini 3.7 Flash 嘅優惠價定為上一代嘅一半,仲拒絕透露幾時會推出旗艦 Pro 模型——呢個策略似乎係想喺工作馬級別搶佔市場份額 。
Grok 4.6 成功令 SpaceXAI 重返頂尖級別,喺綜合智能上追平 GPT-5.6 Sol,成本仲低好多,而且喺 agentic 任務上有真正嘅效率優勢。佢嘅限制——冇任何單一編碼 benchmark 排第一、綜合智能低過 Claude Opus 5、定價企硬而對手就劈價——都係真實嘅,但並唔會抹殺呢個成就。
Google 嘅回應只係遲咗 24 小時,就將整個價格討論重新定義咗。Gemini 3.7 Flash 嘅價格大約係 Grok 4.6 嘅三分之一,喺工作馬級別嘅價錢就提供到強勁嘅編碼同 agent 效能,仲有 1M tokens 嘅上下文窗口。而家嘅競爭格局好清楚:一個係以折扣價提供頂尖智能(Grok 4.6),另一個就係以超抵價提供工作馬級別效能(Gemini 3.7 Flash)。
開發者同企業而家要面對一個真正嘅選擇——唔係好同壞之間,而係兩個好唔同嘅價值 proposition 之間。Grok 4.6 咁快就整合到 GitHub Copilot,似乎至少已經搵到佢嘅 audience。