SpaceXAI 于 2026 年 8 月 12 日发布 Grok 4.6,在人工分析智能指数上达到 61 分,追平 GPT 5.6 Sol Max,同时维持每百万 token 输入 2 美元、输出 6 美元的定价,比 OpenAI 或 Anthropic 的旗舰模型便宜约 60%。 人工分析(Artificial Analysis)的独立测试在 0.08 分误差内证实了 SpaceXAI 的基准测试成绩,独立分析师还发现 Grok 4.6 在知识工作基准测试(如 GDPval AA、AA Briefcase)上表现尤为突出。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did SpaceXAI's August 12, 2026 launch of Grok 4.6 entail in terms of pricing, benchmark performance, architectural approach, early inde. Article summary: ## Grok 4.6 Launch — August 12, 2026. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
2026 年 8 月 12 日,SpaceXAI(前身为 xAI,于 2026 年 2 月与 SpaceX 合并)发布了 Grok 4.6,这是一款达到前沿水平的推理和编程模型,距 Grok 4.5 发布仅隔 35 天 。该模型一经发布,便立即被拿来与 OpenAI 和 Anthropic 的竞品进行比较——不仅比拼智能水平,更聚焦于价格。紧接着,在第二天,谷歌发布了 Gemini 3.7 Flash,将 2026 年 AI 领域这场标志性的战役——争夺开发者心智的价格战——推向了新的高潮。
Grok 4.6 的定价与 Grok 4.5 完全相同——每百万输入 token 2.00 美元,每百万输出 token 6.00 美元,并配备 50 万 token 的上下文窗口,支持文本和图像输入 。高速 tier 的价格则翻倍
。这一价格比 GPT-5.6 Sol 或 Claude Opus 5 的标价便宜约 60%
。
相比之下,谷歌于 8 月 13 日发布的 Gemini 3.7 Flash,其首发价格为每百万输入 token 0.75 美元,每百万输出 token 3.75 美元——这只有其前代产品 Gemini 3.6 Flash 价格的一半,大约是 Grok 4.6 价格的三分之一 。谷歌的促销价格将持续到 2026 年 12 月 31 日,之后将恢复原价
。
定价上的对比非常鲜明:Grok 4.6 在智能水平上与 GPT-5.6 Sol 和 Claude Opus 5 等前沿模型直接竞争,而 Gemini 3.7 Flash 则定位为一款“主力”(workhorse)模型——提供与 Claude Sonnet 5 和 GPT-5.6 Terra 相媲美的性能,但成本显著更低 。
Grok 4.6 在人工分析(AA)智能指数上获得了 61 分,该指数是九项评估的综合得分 。这一成绩与 GPT-5.6 Sol Max 持平,比 Claude Fable 5 Max(62 分)低 1 分,比 Claude Opus 5 Max(63 分)低 2 分——这标志着 xAI 的模型首次跻身于前沿模型集群
。
| 基准测试 | Grok 4.6 (High) | Grok 4.5 (High) | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA 智能指数 | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 (Elo) | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| AA-Briefcase | 1577 | — | — | — |
SpaceXAI 报告称,与 Grok 4.5 相比,Grok 4.6 在列出的所有评估中均实现了性能提升,包括 CursorBench、FrontierCode、APEX-Agents 和 Terminal-Bench 。人工分析平台进行的独立测试,以仅仅 0.08 分的误差幅度证实了这些说法
。
值得注意的是,Grok 4.6 最强的独立测试成绩来自知识工作评估——它在 GDPval-AA v2(1753 Elo)、AA-Briefcase(1577)和 Harvey 法律基准测试中领先于所有对手——这表明该模型特别适合专业的知识工作场景 。然而,尽管它被作为智能体编程模型进行推广,其在 CursorBench v3.2 上的得分(69.9%)仍然落后于 Fable 5 Max(70.5%),但领先于 GPT-5.6 Sol Max(67.2%)
。
与此同时,Gemini 3.7 Flash 在编程和智能体基准测试上也取得了强劲的增长。在 FrontierCode v1.1 上,其生产级代码生成得分达到了 43.6%,高于 3.6 Flash 的 34.4%,并领先于 Claude Sonnet 5(42.7%)和 GPT-5.6 Terra(41.3%)。它在 DeepSWE v1.1(从 49.0% 跃升至 65.3%)和 AutomationBench(从 17.0% 跃升至 30.4%)上也显示出巨大的进步
。
Grok 4.6 的主要架构新增是一个全新的 xhigh 推理级别,这是一种专为最困难的智能体和编程任务设计的深度推理模式 。该模型针对长时间运行的智能体持久性进行了优化——它解决任务所需的交互轮数大约是 Claude Opus 5 的一半,或者说,按标价计算,只需其约四分之一的输入 token
。这项效率优势可以说是它对运行数小时编程会话的开发者而言最强大的卖点
。
SpaceXAI 将 Grok 4.6 的性能提升归功于更长的补充训练运行以及显著改进的监督微调和强化学习——而不是增加了参数数量 。该模型保留了与 Grok 4.5 相同的 1.5 万亿参数的 V9 基础架构
。
与此同时,Gemini 3.7 Flash 引入了“可定制的思考配置”来控制质量、成本和延迟的平衡,并且是首个支持智能体视频处理的谷歌模型 。
Grok 4.6 的优势:
Grok 4.6 的局限:
在发布两天后的 2026 年 8 月 14 日,Grok 4.6 被集成到 GitHub Copilot 中,覆盖了所有主要的开发界面 :
GitHub 的官方更新日志将其描述为“专为智能体编码和复杂多步骤工作流设计” 。这一快速集成表明开发者平台对该模型有强劲的需求 。
8 月 12 日至 13 日的这一系列发布活动揭示了两种截然不同的竞争策略:
Grok 4.6 (SpaceXAI) — $2/$6 每百万 token — 前沿综合得分 (AA 指数 61) — 50 万 token 上下文 — 专为智能体编程和知识工作设计 — 相对于 Opus 5 具有任务效率优势
Gemini 3.7 Flash (Google) — $0.75/$3.75 每百万 token(首发价)— 性能相当于 Claude Sonnet 5 和 GPT-5.6 Terra 的主力 tier — 100 万 token 上下文窗口 — 首个具备智能体视频处理能力的 Gemini 模型 — 驱动 Gemini Spark
Grok 4.6 以折扣价格在前沿智能领域竞争,而 Gemini 3.7 Flash 则以更低廉的价格在主力 tier 竞争。谷歌决定以低于前代产品一半的首发价提供 Gemini 3.7 Flash,并且拒绝透露其旗舰 Pro 模型的发布日期,这表明其有意在前线 tier 抢占市场份额 。
Grok 4.6 成功地将 SpaceXAI 带回了前沿 tier,在综合智能指数上以显著更低的成本与 GPT-5.6 Sol 并驾齐驱,并在智能体任务上拥有实际的效率优势。它的缺点是:在任一单项编程基准测试中未能拔得头筹,综合智能上落后于 Claude Opus 5,以及在竞争对手纷纷降价时维持了原价——这些都是真实存在的,但并未削弱其成就。
谷歌仅隔 24 小时的回应,彻底改变了整个定价的讨论格局。Gemini 3.7 Flash 的定价大约是 Grok 4.6 的三分之一,以主力级的价格点提供了强大的编程和智能体性能,并且还配备了 100 万 token 的上下文窗口。目前的竞争格局清晰地一分为二:以折扣价提供前沿智能(Grok 4.6),与以超值价提供主力性能(Gemini 3.7 Flash)。
开发者和企业面临的抉择是真实的——不是好与坏之间的选择,而是两种截然不同价值主张之间的权衡。Grok 4.6 在 GitHub Copilot 上的快速集成表明,至少有一方已经找到了自己的受众。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
SpaceXAI 于 2026 年 8 月 12 日发布 Grok 4.6,在人工分析智能指数上达到 61 分,追平 GPT 5.6 Sol Max,同时维持每百万 token 输入 2 美元、输出 6 美元的定价,比 OpenAI 或 Anthropic 的旗舰模型便宜约 60%。
SpaceXAI 于 2026 年 8 月 12 日发布 Grok 4.6,在人工分析智能指数上达到 61 分,追平 GPT 5.6 Sol Max,同时维持每百万 token 输入 2 美元、输出 6 美元的定价,比 OpenAI 或 Anthropic 的旗舰模型便宜约 60%。 人工分析(Artificial Analysis)的独立测试在 0.08 分误差内证实了 SpaceXAI 的基准测试成绩,独立分析师还发现 Grok 4.6 在知识工作基准测试(如 GDPval AA、AA Briefcase)上表现尤为突出。
Grok 4.6 在发布两天后便集成到 GitHub Copilot 的八个开发界面中,显示出强劲的开发者需求;而谷歌的 Gemini 3.7 Flash 则成为 Gemini Spark 的默认模型,并提供高达 100 万 token 的上下文窗口。