Databricks 基于自家数百万行代码库(涵盖 Python、Go、TypeScript、Scala 和 SQL)的内部基准测试揭示:开源模型已处于编程任务的质量 成本前沿(Pareto frontier)。 评测发现,每 token 价格并非真实成本的可靠指标;大模型在端到端任务中可能更具 token 效率,从而降低总成本。
研究答案

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What did Databricks' internal coding benchmark reveal about AI model performance and cost, and wh. Article summary: Databricks published results from an internal coding benchmark that evaluated agentic models on real engineering tasks from its multi-million-line codebase (Python, Go, TypeScript, Scala, SQL). The key findings and the c. Topic tags: general, documentation, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
数据与 AI 公司 Databricks 近期发布了一项内部编程基准测试结果,该测试旨在评估各类 AI 编程智能体在其庞大的、包含数百万行代码的代码库(语言涵盖 Python、Go、TypeScript、Scala 和 SQL)上的真实工程任务表现。这项评测的最终结论,促使 Databricks 决定采用来自中国智谱 AI(现以 Z.ai 名义开展国际业务)的开源模型 GLM 5.2 作为其默认编程引擎。以下是该评测的关键发现以及 Databricks 做出这一选择的原因。
Databricks 之所以构建自己的测试,是因为他们发现像 SWE-bench 这样的公开基准测试可能存在过度拟合的问题,因此他们希望衡量哪些智能体能真正端到端地解决实际问题。这项评测带来了三大令人意外的发现。
开源模型已触及前沿水平。 在编程任务的质量与成本前沿曲线上,现在不仅包括 OpenAI 和 Anthropic 的模型,开源模型也已占据一席之地。Databricks 联合创始人 Matei Zaharia 表示:“许多模型,包括开源模型,现在确实具备了真正的竞争力”。公司得出结论,开源模型,特别是 GLM 5.2,已经能够处理他们测试中难度最高的任务
。
Token 价格是误导性的成本指标。 基准测试发现,模型每 token 的价格并不能可靠地预测其在智能编程工作流中的实际总成本。更大规模的模型在 token 利用效率上可能高得多,这意味着一个每 token 更便宜的模型,如果完成相同任务需要消耗更多 token,最终的成本反而可能更高。这促使 Databricks 根据真实的、端到端的任务完成成本来评估模型,而非只看 API 原始费率。
总拥有成本(TCO)倾向于 GLM 5.2。 通过 Z.ai 的 API,GLM 5.2 的定价约为每百万输入 token 1.40 美元,每百万输出 token 4.40 美元。对于一个每月处理 1000 万 token、输入输出比例为 50/50 的团队来说,总费用大约为每月 29 美元
。相比之下,像 Anthropic 的 Opus 4.8 模型(每百万输入/输出 token 分别收费 5/25 美元),在取得相当或略优的基准分数时,成本可能是 GLM 5.2 的 3 到 6 倍
。在单任务成本上,Databricks 的一项测试显示,使用 Pi 智能体的 GLM 5.2 以每任务 1.25 美元的成本达到了 87.5% 的通过率,而使用 Claude Code 的 Opus 4.8(高强度模式)在实现相近通过率时,每任务成本为 2.00 美元
。
性能媲美前沿模型,成本大幅降低。 GLM 5.2 在 SWE-bench Pro 上得分 62.1,超越了 GPT-5.5(58.6 分),并与 Anthropic 的 Opus 4.8 仅差几分。在 FrontierSWE Dominance 上,它取得了 74.4% 的成绩,几乎追平 Opus 4.8 的 75.1%
。Databricks 的内部测试结果与这些公开基准一致:这款中国开源模型在相同的真实工程任务上,能力已达到或接近领先的闭源模型
。
开源权重与 MIT 许可带来的部署灵活性。 由于 GLM 5.2 采用 MIT 许可并完全开放权重,Databricks 可以将其部署在内部,进行微调,并深度集成到其智能编程工作流中,而无需支付按席位计算的许可费,也无需担心供应商锁定。这种许可模式允许企业在自己的基础设施上运行模型,从而避免在高用量场景下产生持续的 API 成本。
擅长长时间、多步骤的复杂任务。 此次基准测试的重点是跨多个文件和推理步骤的智能编程编辑任务。GLM 5.2 拥有 100 万 token 的上下文窗口和 7440 亿参数的混合专家(MoE)架构,正是为此类仓库级别、长跨度的任务而非简单的单文件自动补全进行了优化。在测试命令行和智能任务执行的 Terminal-Bench 2.1 上,它获得了 81.0 分,成为该测试中最强的开源模型,仅次于 Claude Opus 4.8(85.0 分)
。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Databricks 基于自家数百万行代码库(涵盖 Python、Go、TypeScript、Scala 和 SQL)的内部基准测试揭示:开源模型已处于编程任务的质量 成本前沿(Pareto frontier)。
Databricks 基于自家数百万行代码库(涵盖 Python、Go、TypeScript、Scala 和 SQL)的内部基准测试揭示:开源模型已处于编程任务的质量 成本前沿(Pareto frontier)。 评测发现,每 token 价格并非真实成本的可靠指标;大模型在端到端任务中可能更具 token 效率,从而降低总成本。
来自中国智谱 AI(Z.ai)的 GLM 5.2 凭借 MIT 开源许可证、顶尖性能(SWE bench Pro 得分 62.1,超过 GPT 5.5 的 58.6)以及极具竞争力的 API 定价,最终被 Databricks 采纳为默认编程引擎。