SpaceXAI 於 2026 年 8 月 12 日發表 Grok 4.6,在人工智慧分析智慧指數(AA Intelligence Index)獲得 61 分,與 GPT 5.6 Sol Max 持平,定價維持每百萬 tokens 輸入 2 美元、輸出 6 美元,較 OpenAI 或 Anthropic 的旗艦模型便宜約 60%。 獨立測試機構 Artificial Analysis 驗證了 SpaceXAI 的基準測試數據,差距僅在 0.08 分以內;分析同時指出 Grok 4.6 在知識工作(GDPval AA、AA Briefcase)等領域表現尤為突出。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did SpaceXAI's August 12, 2026 launch of Grok 4.6 entail in terms of pricing, benchmark performance, architectural approach, early inde. Article summary: ## Grok 4.6 Launch — August 12, 2026. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
2026 年 8 月 12 日,SpaceXAI(前身為 xAI,已於 2026 年 2 月與 SpaceX 合併)正式發表 Grok 4.6,這是一款具備前線水準的推理與程式碼生成模型,距離 Grok 4.5 的發布僅相隔 35 天 。此舉立即引發外界將其與 OpenAI 及 Anthropic 的競爭模型進行比較——不僅是智慧能力的較量,更是價格上的對決。然而,僅僅隔了一天,Google 便在 8 月 13 日發布 Gemini 3.7 Flash,將這場 2026 年 AI 領域的 defining battle——開發者市佔率的價格戰——推向新的高潮。
Grok 4.6 的定價與 Grok 4.5 完全相同——每百萬輸入 tokens 收費 2.00 美元,每百萬輸出 tokens 收費 6.00 美元,提供 50 萬 tokens 的上下文視窗,並支援文字與圖像輸入 。高速版本則以雙倍價格提供
。這樣的定價策略,使其較 GPT-5.6 Sol 或 Claude Opus 5 的牌價便宜約 60%
。
反觀 Google,其在 8 月 13 日推出的 Gemini 3.7 Flash,採用 introductory 定價:每百萬輸入 tokens 僅 0.75 美元,每百萬輸出 tokens 為 3.75 美元——這個價格僅為其前代產品 Gemini 3.6 Flash 的一半,大約是 Grok 4.6 的三分之一 。該 introductory 價格將持續至 2026 年 12 月 31 日,之後將恢復至原價
。
兩者定價策略的對比極為鮮明:Grok 4.6 直接挑戰 GPT-5.6 Sol 與 Claude Opus 5 這類前線模型的智慧水準,而 Gemini 3.7 Flash 則定位為「工作馬」(workhorse)等級的模型,提供與 Claude Sonnet 5 及 GPT-5.6 Terra 相當的效能,但成本顯著更低 。
Grok 4.6 在「人工智慧分析智慧指數」(AA Intelligence Index)中獲得 61 分,該指數為九項評測的綜合結果 。這個成績與 GPT-5.6 Sol Max 持平,僅落後 Claude Fable 5 Max(62 分)1 分,以及 Claude Opus 5 Max(63 分)2 分——這標誌著 xAI 的模型首次躋身前線俱樂部
。
| 基準測試 | Grok 4.6 (High) | Grok 4.5 (High) | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 (Elo) | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| AA-Briefcase | 1577 | — | — | — |
SpaceXAI 回報,Grok 4.6 在 所有公布的評測項目 中均優於 Grok 4.5,包括 CursorBench、FrontierCode、APEX-Agents 與 Terminal-Bench 。獨立測試機構 Artificial Analysis 的驗證結果與 SpaceXAI 的宣稱僅有 0.08 分的微小差距,確認了其說法的可信度
。
值得注意的是,Grok 4.6 最突出的獨立測試成績集中在 知識工作類評測——它在 GDPval-AA v2(1753 Elo)、AA-Briefcase(1577)以及 Harvey 法律基準測試中均領先群倫,顯示該模型特別適合專業知識型任務 。然而,儘管其市場定位為代理型程式碼生成模型,它在 CursorBench v3.2 的得分(69.9%)仍略低於 Fable 5 Max(70.5%),但已超越 GPT-5.6 Sol Max(67.2%)
。
另一方面,Gemini 3.7 Flash 在程式碼生成與代理型任務的基準測試上亦有顯著進步。在 FrontierCode v1.1 評測中,其產出「可立即投入生產的程式碼」的比率達到 43.6%,較上代 3.6 Flash 的 34.4% 大幅提升,並領先 Claude Sonnet 5(42.7%)與 GPT-5.6 Terra(41.3%)。它在 DeepSWE v1.1(從 49.0% 提升至 65.3%)與 AutomationBench(從 17.0% 提升至 30.4%)等指標上也有巨大飛躍
。
Grok 4.6 最主要的架構新增功能是全新的 xhigh 推理等級,這是一種針對最困難的代理型與程式碼生成任務而設計的深度推理模式 。該模型針對長時間運行的代理任務續航力進行了最佳化——在給定價格下,它完成任務所需的步驟數僅約為 Claude Opus 5 的一半,所需輸入 tokens 則約為後者的四分之一
。對於需要長時間編程的開發者而言,這個效率優勢可說是最具吸引力的賣點
。
SpaceXAI 將 Grok 4.6 的進步歸功於更長時間的補充訓練,以及大幅改進的監督式微調與強化學習——而非參數量的增加 。該模型保留了與 Grok 4.5 相同的 1.5 兆參數 V9 基礎架構
。
與此同時,Gemini 3.7 Flash 引入了「可自訂思考配置」,讓使用者能控制品質、成本與延遲之間的平衡,並成為 Google 首款支援代理型影片處理的模型 。
Grok 4.6 的優勢:
Grok 4.6 的限制:
發表兩天後,也就是 2026 年 8 月 14 日,Grok 4.6 正式在 GitHub Copilot 上線,涵蓋所有主要的開發環境 :
GitHub 官方更新日誌描述其為「專為代理型程式碼生成與複雜多步驟工作流程而設計」。如此迅速的整合,顯示了開發者平台對該模型的強勁需求 。
8 月 12 日至 13 日的接連發表,揭示了兩種涇渭分明的競爭策略:
Grok 4.6(SpaceXAI)—— 每百萬 tokens 輸入 2 美元、輸出 6 美元 —— 前線綜合能力(AA 指數 61)—— 50 萬 tokens 上下文 —— 專為代理型程式碼生成與知識工作設計 —— 相較 Opus 5 擁有任務效率優勢
Gemini 3.7 Flash(Google)—— introductory 定價每百萬 tokens 輸入 0.75 美元、輸出 3.75 美元 —— 工作馬等級效能,可比擬 Claude Sonnet 5 與 GPT-5.6 Terra —— 100 萬 tokens 上下文視窗 —— 首款支援代理型影片處理的 Gemini 模型 —— 驅動 Gemini Spark
Grok 4.6 以折扣價提供前線級智慧,而 Gemini 3.7 Flash 則以驚人的低價提供工作馬級效能。Google 將 Gemini 3.7 Flash 的 introductory 定價定為前代產品的一半,同時拒絕透露其旗艦 Pro 模型的發布日期,這表明其策略是刻意在 workhorse 等級搶佔市佔率 。
Grok 4.6 成功地將 SpaceXAI 帶回前線等級,在綜合智慧指數上與 GPT-5.6 Sol 平起平坐,成本卻顯著更低,並在代理型任務上擁有真正的效率優勢。它的不足——未在單一程式碼基準測試中領先、綜合智慧落後 Claude Opus 5,以及在競爭對手降價時維持原價——雖然真實存在,但並未削弱其成就。
Google 在 24 小時後做出的回應,則徹底改變了定價的討論格局。以約為 Grok 4.6 三分之一的成本,Gemini 3.7 Flash 在一個 workhorse 的價格點上,提供了強大的程式碼生成與代理型任務效能——而且還附帶了 100 萬 tokens 的上下文視窗。如今,競爭版圖已清晰地一分為二:追求前線智慧但享有折扣(Grok 4.6),或是追求 workhorse 效能但價格極低(Gemini 3.7 Flash)。
開發者與企業面臨的不是「好與壞」的抉擇,而是兩種截然不同的價值主張。Grok 4.6 迅速獲得 GitHub Copilot 的整合,顯示至少其中一方已找到自己的目標用戶。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
SpaceXAI 於 2026 年 8 月 12 日發表 Grok 4.6,在人工智慧分析智慧指數(AA Intelligence Index)獲得 61 分,與 GPT 5.6 Sol Max 持平,定價維持每百萬 tokens 輸入 2 美元、輸出 6 美元,較 OpenAI 或 Anthropic 的旗艦模型便宜約 60%。
SpaceXAI 於 2026 年 8 月 12 日發表 Grok 4.6,在人工智慧分析智慧指數(AA Intelligence Index)獲得 61 分,與 GPT 5.6 Sol Max 持平,定價維持每百萬 tokens 輸入 2 美元、輸出 6 美元,較 OpenAI 或 Anthropic 的旗艦模型便宜約 60%。 獨立測試機構 Artificial Analysis 驗證了 SpaceXAI 的基準測試數據,差距僅在 0.08 分以內;分析同時指出 Grok 4.6 在知識工作(GDPval AA、AA Briefcase)等領域表現尤為突出。
Grok 4.6 在發表兩天後即整合至 GitHub Copilot,橫跨八種開發環境,展現強勁的開發者需求;而 Google 的 Gemini 3.7 Flash 則以更具侵略性的 introductory 定價(約 Grok 4.6 的三分之一)成為 Gemini Spark 的預設模型。