| 1 美元 |
| 12 美元 |
真正需要纳入预算的重点,是请求达到 200,000 个输入 token 后,长上下文价格档位将生效。对于经常把大型代码库、长文档或完整对话历史交给智能体的团队,仅按“输入每百万 token 2 美元、输出每百万 token 6 美元”的宣传价格估算,可能会低估实际成本。
缓存可以降低输入部分的费用,但不能替代对上下文增长的控制。生产环境应持续统计提示词大小、缓存复用率、输出长度,以及增加上下文后带来的实际质量提升,再决定是否提高上下文预算。
xAI 报告称,在使用“extra high thinking”(超高推理)设置时,Grok 4.6 在 CursorBench 3.2 上取得 70.8% 的成绩,高于 Fable 5 Max 报告的 70.5%;xAI 同时声称,每项完成任务的成本约为后者的六分之一。
这是一项值得关注的发布数据,但两者之间只有 0.3 个百分点的差距,而且比较结果来自模型供应商报告的基准测试。因此,它更适合作为进一步测试的信号,而不是证明 Grok 4.6 能在企业自身代码库、工具链、延迟目标或可靠性要求下持续胜出。
其他公开比较也显示,基准成绩会因测试项目和配置不同而变化。例如,另一个对比表给出的 CursorBench 成绩是 69.9%。 提示词、测试框架、模型设置和评估日期的差异,都可能影响最终结果。企业采购方最好使用具有代表性的内部任务复现测试,而不是直接照搬发布会数字。
Grok 4.6 除了通过 xAI API 提供服务外,还陆续进入了 Cursor、GitHub Copilot、Amazon Bedrock、OpenRouter、Vercel 和 Cloudflare 等开发者与云平台。Amazon 于 2026 年 8 月 19 日宣布 Bedrock 支持该模型,即首发一周后完成接入。
Vertex AI 提供的是另一种具有企业意义的入口。对 Google Cloud 客户来说,价值不只是多了一个 API 端点,而是可以在熟悉的云控制平面和采购环境中评估模型。对于已经通过 Google Cloud 管理 AI 实验、权限和支出的团队,这可能降低接入新模型的切换成本。
但托管市场入口并不会消除模型选型工作。企业仍需核查区域可用性、配额、数据处理方式、服务预期、工具调用行为、可观测性和故障模式,然后才能决定是否从实验阶段进入生产环境。尤其值得注意的是,Google 平台目前将 Grok 4.6 标记为 Preview,这意味着初期部署更适合采用受控评估方式,而不应默认其具备长期稳定的生产服务属性。
一套实用的评估流程可以优先关注四个方面:
Grok 4.6 登陆 Vertex AI 的意义,与其说在于某一个基准测试数字,不如说在于它出现在开发者已经使用的地方。该模型将大上下文窗口和面向智能体的功能,与具有吸引力的基础价格结合起来;而它在 API、IDE、托管平台和云市场之间的快速铺开,也降低了开发团队试用它的门槛。
对企业买家而言,结论应当是有条件的:Grok 4.6 现在更容易在 Google Cloud 内部完成评估,但它最终是否值得采用,取决于具体工作负载的质量、长上下文请求的经济性,以及 Preview 阶段的服务特征能否满足企业治理要求。那 0.3 个百分点的基准优势值得验证,但还不应被视为持久的竞争壁垒。