独立测评和厂商报告的基准测试均显示,Kimi K3 的性能已接近或达到前沿水平。
| 指标 / 基准测试 | Kimi K3 得分 | 对比 | 来源 |
|---|---|---|---|
| 人工分析智能指数(Artificial Analysis Intelligence Index) | 57 | Claude Fable 5 为 60(领先3分);超过 Claude Opus 4.8 和 GPT-5.5 | |
| 综合排名(独立评测) | 在 186-189 个模型中位列第 4 | 领先于 Claude Opus 4.8 和 GPT-5.5 | |
| 前端代码竞技场(Elo评分) | 1,679 Elo | 明确击败 Claude Fable 5 | |
| 智能体基准测试(Program Bench, SWE Marathon, SpreadsheetBench 2, Automation Bench, BrowseComp) | 在 8 项中 4 项排名第一 | 是唯一能在智能体基准测试中领先的开源模型 | |
| 月之暗面内部评估 | 优于其他被测试模型 | 但仍落后于 Claude Fable 5 和 GPT-5.6 Sol |
关键细节: 月之暗面公司坦诚地指出,Kimi K3 “仍然落后于最强大的专有模型,即 Claude Fable 5 和 GPT 5.6 Sol”,但它强调,这是唯一能达到此性能级别的开源权重模型 。
Kimi K3 采用统一的按量计费模式,不按上下文长度分级 :
| Token 类型 | 每百万 Token 价格 |
|---|---|
| 缓存未命中输入(Cache-miss input) | 3.00 美元 |
| 缓存命中输入(Cached input) | 0.30 美元 |
| 输出(Output) | 15.00 美元 |
这一价格策略使得其每任务成本大约仅为同等水平的美国闭源前沿模型的一半。这种激进的定价是其核心竞争策略之一。
硬件层面的挑战:
市场层面的挑战:
Kimi K3 是一个里程碑式的发布——它是迄今为止最大的开源权重模型,其性能已能与最佳的美国闭源模型一较高下,而任务成本却只有后者的一半。其定于 2026 年 7 月 27 日的开源承诺意味着,如果按计划兑现,将进一步加速 AI 能力的去中心化进程。目前最大的不确定性在于自托管所需的严苛硬件条件、持续的中美芯片出口管制问题,以及其基准测试声明能否经得起持续的独立验证。