Databricks 基於自家數百萬行程式碼庫的內部評測發現,開源模型如 Z.ai 的 GLM 5.2 已站在 AI 編碼任務的品質與成本帕累托前緣,效能足以與頂尖商用模型競爭。 評測打臉「Token 價格愈低愈省錢」的迷思:大型模型實際完成任務的 token 效率更高,每項任務的「總持有成本」才是關鍵,而 GLM 5.2 在這項指標上大幅領先。
研究答案

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What did Databricks' internal coding benchmark reveal about AI model performance and cost, and wh. Article summary: Databricks published results from an internal coding benchmark that evaluated agentic models on real engineering tasks from its multi-million-line codebase (Python, Go, TypeScript, Scala, SQL). The key findings and the c. Topic tags: general, documentation, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
Databricks 這家資料與人工智慧公司,於 2026 年 7 月公布了一份內部編碼評測結果。該評測基於其自家數百萬行程式碼庫(涵蓋 Python、Go、TypeScript、Scala 與 SQL)的真實工程任務,用以評估代理式 AI 模型的效能。評測的結論促使公司採用來自中國開源模型 GLM 5.2(由 Z.ai,前身為智譜 AI 開發)作為其預設的程式碼引擎。以下揭曉評測發現了什麼,以及 Databricks 為何做出這項轉換。
Databricks 之所以自建評測,是因為發現像 SWE-bench 這類公開基準可能已被過度針對性訓練,他們希望衡量哪些代理模型能端到端地解決真實任務,並通過精心設計的測試套件驗證 。該評測帶來了三大驚喜。
開源模型已達到前沿水準。 在 AI 編碼任務的帕累托前緣(即在特定成本下能達到的最佳品質)中,現在已包含 OpenAI、Anthropic 以及開源供應商的模型。Databricks 共同創辦人 Matei Zaharia 表示「許多模型,包括開源模型,現在確實極具競爭力」。該公司結論指出,開放模型,特別是 GLM 5.2,已能處理他們測試中最困難的任務等級
。
Token 價格是誤導性的成本指標。 評測發現,在代理式編碼工作流程中,模型的每個 token 價格並不能可靠預測實際總成本。較大的模型可能在 token 使用上效率高得多,這意味著一個 token 單價更便宜的模型,如果完成相同任務需要耗費更多 token,最終成本反而更高。這促使 Databricks 根據真實的端到端任務完成成本來評估模型,而非僅看原始 API 費率 。
總持有成本(TCO)有利於 GLM 5.2。 在 Z.ai 的 API 上,GLM 5.2 的定價約為每百萬輸入 token 1.40 美元,每百萬輸出 token 4.40 美元 。對於一個每月處理 1000 萬 token、輸入輸出各半的團隊,總費用約為每月 29 美元
。相比之下,競爭對手模型如 Anthropic 的 Opus 4.8(每百萬 token 輸入 5 美元、輸出 25 美元),在取得差不多甚至略高評測分數的情況下,成本可能高出 3 到 6 倍
。以每項任務成本來看,Databricks 一項測試顯示,使用 Pi 代理的 GLM 5.2 以每項任務 1.25 美元的成本達成 87.5% 的通過率,而使用 Claude Code 的 Opus 4.8(高強度模式)以每項任務 2.00 美元的成本達成相似的通過率
。
效能媲美前沿模型,成本大幅降低。 GLM 5.2 在 SWE-bench Pro 獲得 62.1 分,超越 GPT-5.5(58.6 分),並與 Anthropic 的 Opus 4.8 差距僅數分 。在 FrontierSWE Dominance 指標上,它達到 74.4%,幾乎與 Opus 4.8 的 75.1% 持平
。Databricks 的內部測試呼應了這些公開評測:這款中國的開放權重模型在相同的真實工程任務上,匹配或接近了領先專有模型的效能
。
開放權重、MIT 授權的部署靈活性。 由於 GLM 5.2 採用 MIT 授權且為完全開放權重,Databricks 能夠在內部部署、進行微調,並緊密整合到其代理式編碼工作流程中,無需按席位授權,也不會被單一廠商綁定 。這種授權模式允許企業在自己的基礎設施上運行模型,對於高用量場景可避免持續性的 API 成本。
適合長期、多步驟任務。 該評測重點關注橫跨多個檔案與推理步驟的代理式編碼修改。GLM 5.2 擁有 100 萬 token 的上下文視窗和 7440 億參數的混合專家(MoE)架構,正是針對此類倉庫規模、長期規劃的工作進行了優化,而非僅止於單一檔案的自動補全 。在測試命令列與代理式任務執行的 Terminal-Bench 2.1 上,它獲得 81.0 分,是表現最強的開源模型,僅次於 Claude Opus 4.8(85.0 分)
。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Databricks 基於自家數百萬行程式碼庫的內部評測發現,開源模型如 Z.ai 的 GLM 5.2 已站在 AI 編碼任務的品質與成本帕累托前緣,效能足以與頂尖商用模型競爭。
Databricks 基於自家數百萬行程式碼庫的內部評測發現,開源模型如 Z.ai 的 GLM 5.2 已站在 AI 編碼任務的品質與成本帕累托前緣,效能足以與頂尖商用模型競爭。 評測打臉「Token 價格愈低愈省錢」的迷思:大型模型實際完成任務的 token 效率更高,每項任務的「總持有成本」才是關鍵,而 GLM 5.2 在這項指標上大幅領先。
GLM 5.2 在 SWE bench Pro 獲得 62.1 分,超越 GPT 5.5(58.6),在 FrontierSWE Dominance 更以 74.4% 緊咬 Claude Opus 4.8 的 75.1%,API 成本卻僅為後者的三分之一到六分之一。