Grok 4.5 於 2026 年 6 月 28 日在 SpaceX 和 Tesla 進入私人測試階段,採用 1.5 兆參數的 V9 基礎模型(該模型於 2026 年 5 月 26 日完成預訓練)。它於 7 月 8 日透過 xAI API 提供服務,收費標準為每 1M 輸入代幣 2 美元、每 1M 輸出代幣 6 美元 。Grok 4.6 的參數量較前代 增加了 33%,從 1.5T 躍升至 2T 。
| 規格 | Grok 4.5 | Grok 4.6 |
|---|---|---|
| 參數 | 1.5 兆 | 2 兆 |
| 基礎模型 | V9(2026 年 5 月 26 日完成訓練) | 下一代(架構細節未公開) |
| 狀態 | 自 6 月 28 日起在 SpaceX & Tesla 進行私人測試;7 月 8 日推出 API | 本週完成訓練;預計 8 月推出 |
| API 定價 | 每 1M 輸入代幣 $2,每 1M 輸出代幣 $6 | 尚未公布 |
| 公開性能宣稱 | 自稱接近或超越 Claude Opus;未公布獨立基準測試 | 宣稱超越 Grok 4.5;目標超越 Kimi K3 |
一個關鍵的提醒:沒有任何獨立第三方為 Grok 4.5 發布基準測試報告——所有性能宣稱均來自 xAI 自身 。一名 xAI 工程師指出,Grok 4.5 在初始訓練中額外使用了「Cursor 數據」(專注於程式碼的數據),但這種方式「效果不如一開始就加入訓練來得好」。
Musk 宣布此消息的時機,直接與 Moonshot AI 於 2026 年 7 月 16 日推出 Kimi K3 有關 。Kimi K3 是一個 2.8 兆參數、開源權重的混合專家(MoE) 模型,擁有 100 萬個代幣的上下文視窗 和原生的視覺能力,使其成為有史以來最大的開源權重 AI 模型,也是第一個進入「3T 等級」的模型 。它每次處理一個代幣時,只會啟動其 896 個專家中的 16 個,這種設計有效降低了運算成本 。
Musk 的貼文明確將 Grok 4.6 定位為回應,目標是 超越 Kimi K3 的表現,同時維持 Grok 在速度與效率上的優勢 。Grok 4.6 的 2T 參數量小於 Kimi K3 的 2.8T,因此 xAI 將賭注押在 架構效率和推理最佳化 上,而非單純追求參數數量 。
這是故事的關鍵:Grok 4.5 沒有任何獨立的基準測試分數。其所有競爭宣稱都是 xAI 的單方面說法。相比之下,Kimi K3 已獲得獨立評估,並在綜合排行榜上 排名全球第三,僅次於 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol 。報導指出,其表現「與美國對手的頂級專有系統並駕齊驅」。K3 在某些程式碼和網頁開發基準測試上的表現甚至超越了 Claude Fable 5 。
在定價方面,Kimi K3 的 API 據報導約為同等級模型(如 Claude Fable 5 和 GPT-5.6 Sol)的 一半 。但從高權威來源中並未找到確切的每代幣定價。
關鍵結論:目前沒有任何獨立的、直接面對面的基準測試,可以比較 Grok 模型和 Kimi K3。所有 xAI 關於性能的陳述,都只是 Musk 在社交媒體上未經證實的說法。
Musk 在 7 月 18 日的宣布,是 xAI 更大計劃的一部分。以下是 xAI 已公開承諾的內容:
在模型競賽之外,xAI 於 2026 年 7 月 15-16 日 在 Apache 2.0 許可證下 開源了 Grok Build,將其基於 Rust 語言的命令列程式碼代理程式發布在 GitHub 上的 xai-org/grok-build 儲存庫 。Grok Build 具有 8 個平行子代理、先規劃再執行的工作流程以及競技場模式。此開源舉動發生在一個隱私爭議之後:安全研究人員發現,先前版本會將用戶的整個工作目錄上傳到 xAI 的伺服器 。透過公開程式碼,xAI 旨在建立信任並加速社群採用。
Musk 另外在 7 月 8 日證實,xAI 正根據用戶回饋 每日改進 Grok Build 。這使得 xAI 能夠直接挑戰 Cursor 和 GitHub Copilot 等程式碼代理程式的既有地位。
Musk 在 7 月 18 日關於 Grok 4.6 的宣布,是對 Moonshot 在兩天前推出 Kimi K3 的明確 競爭性反擊。xAI 的每月發佈節奏比任何其他前沿實驗室都快,而 Grok 5 的路線圖則預示著未來還有更大的模型。然而,所有 xAI 模型的獨立基準測試都付之闕如,這意味著所有競爭宣稱在第三方測試出爐前,都仍是未經驗證的說法。在這場由透明度和規模共同定義的競賽中,這個差距至關重要。