Grok 4.5于2026年6月28日在SpaceX和特斯拉内部开启私测,其底层是1.5万亿参数的V9基础模型(于2026年5月26日完成预训练)。它于7月8日通过xAI API开放,定价为每100万输入token收费2美元,每100万输出token收费6美元。Grok 4.6的参数量相比前代提升了33%,从1.5万亿跃升至2万亿。
| 规格 | Grok 4.5 | Grok 4.6 |
|---|---|---|
| 参数 | 1.5万亿 | 2万亿 |
| 基础模型 | V9(2026年5月26日完成训练) | 下一代(架构细节未公布) |
| 状态 | 6月28日起在SpaceX和特斯拉内测;7月8日开放API | 本周完成训练;预计8月发布 |
| API定价 | 输入$2/1M tokens,输出$6/1M tokens | 尚未公布 |
| 报告性能 | 自称接近/超越Claude Opus;无独立基准测试 | 声称超越Grok 4.5;旨在超越Kimi K3 |
一个重要提醒:Grok 4.5没有任何独立第三方基准测试成绩——所有性能声明均为xAI的单方面说法。一名xAI工程师指出,Grok 4.5在初始训练中并未包含“Cursor数据”(编码相关数据),而是通过补充训练加入的,这种方式“不如在初始训练时就包含进来效果好”。
马斯克公告的时机与月之暗面于2026年7月16日发布Kimi K3直接相关。Kimi K3是一个2.8万亿参数的开放权重混合专家(MoE)模型,拥有100万token的上下文窗口和原生视觉能力,是有史以来最大的开放权重AI模型,也是首个“3T级”模型。它在每token处理时仅激活896个专家中的16个,这种设计大幅降低了计算成本。
马斯克的帖子明确将Grok 4.6定位为反击,目标是超越Kimi K3的性能,同时保持Grok的速度和效率优势。Grok 4.6的2万亿参数规模小于Kimi K3的2.8万亿,因此xAI的赌注押在了架构效率和推理优化上,而非比拼原始参数数量。
这一点至关重要:Grok 4.5没有独立基准测试分数。它的所有竞争性声明都是xAI自己的说法。相比之下,Kimi K3已经过独立评估,在综合排行榜上排名全球第三,仅次于Anthropic的Claude Fable 5和OpenAI的GPT-5.6 Sol。它被描述为“与美国竞争对手最强大的专有系统并驾齐驱”。K3在某些编码和Web开发基准测试中甚至超越了Claude Fable 5。
在定价方面,Kimi K3的API费用大约是Claude Fable 5和GPT-5.6 Sol等同类前沿模型价格的一半。目前尚无来自权威来源的精确每token定价数据。
关键结论: 不存在任何Grok模型与Kimi K3之间的直接头对头独立基准测试比较。xAI的所有性能陈述都是马斯克在社交媒体上未经证实的说法。
马斯克7月18日的公告是更大计划的一部分。以下为xAI公开承诺的内容:
在模型竞赛的同时,xAI于2026年7月15-16日将Grok Build开源,采用Apache 2.0协议,在GitHub上发布了其基于Rust的CLI编码代理,仓库为xai-org/grok-build。Grok Build具备8个并行子代理、先计划后工作流和竞技场模式(Arena Mode)。这次开源行动源于一次隐私风波:安全研究人员发现,此前版本会将用户的整个工作目录上传到xAI服务器。通过开源代码,xAI旨在建立信任并加速社区采用。
马斯克在7月8日单独确认,xAI正根据用户反馈每日改进Grok Build。这使xAI得以直接挑战Cursor和GitHub Copilot等编码代理领域的现有巨头。
马斯克7月18日关于Grok 4.6的公告,是对月之暗面Kimi K3(仅两天前发布)的一次明确的竞争反击。xAI的月度发布节奏比任何其他前沿实验室都要快,而Grok 5路线图预示着更庞大的模型还在后面。但是,缺乏独立基准测试意味着所有竞争性声明在第三方验证之前仍属未核实状态。在一个透明度和规模同样重要的竞赛中,这一差距至关重要。