该指数综合了九项评估,包括 GDPval-AA v2、Terminal-Bench 2.1、SciCode、人类最后的考试(Humanity's Last Exam)、GPQA Diamond 以及长上下文推理 。在特定基准测试中,Kimi K3 在 Frontend Code Arena 排行榜上排名第一,在 AA-Briefcase(Agent 知识工作)排行榜上排名第二,仅次于 Fable 5
。
正如 Databricks CEO Ali Ghodsi 向 CNBC 所言,K3 在基准测试性能与成本效益上的结合,使得此前成本高昂的 Agent 工作负载——例如持续编码 Agent 或大规模文档处理——对企业来说变得经济可行 。
Databricks 将 Kimi K3 的集成视为开源权重与闭源 AI 模型之间差距正在迅速缩小的证据 。该公司指出,一年前,最好的开源模型与闭源模型之间还存在巨大差距——但如今,像 Kimi K3 这样的开源模型在基准测试性能上已能与闭源领导者相匹敌,同时提供显著更低的成本和更大的灵活性
。