Databricks 內部基準測試用咗自己幾百萬行嘅代碼庫,發現 GLM 5.2 呢個開源模型嘅表現已經追近甚至超越 OpenAI 同 Anthropic 嘅頂級商業模型,但成本就平好多。 測試仲揭示咗一個重點:AI 模型嘅每 token 價錢唔代表實際使費,因為大模型可能更省 token,最終令總成本更低。
研究答案

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What did Databricks' internal coding benchmark reveal about AI model performance and cost, and wh. Article summary: Databricks published results from an internal coding benchmark that evaluated agentic models on real engineering tasks from its multi-million-line codebase (Python, Go, TypeScript, Scala, SQL). The key findings and the c. Topic tags: general, documentation, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
Databricks,呢間數據同 AI 公司,喺 2026 年 7 月公布咗一個內部編碼基準測試嘅結果。佢哋用自己幾百萬行嘅代碼庫(包括 Python、Go、TypeScript、Scala 同 SQL)嚟測試 AI 編碼代理嘅實際表現。結果顯示,中國開源模型 GLM 5.2(由 Z.ai,即前身係智譜 AI 嘅公司開發)喺性價比上表現突出,令 Databricks 決定將佢列為預設編碼引擎。以下就係呢個測試嘅重點同 Databricks 點解咁決定嘅原因。
Databricks 之所以要自己搞測試,係因為佢哋覺得公認嘅基準好似 SWE-bench 咁,好容易被針對性訓練而影響準確性,所以想用真實嘅工程任務嚟睇吓邊個 AI 代理可以真正解決問題 。結果有三大驚喜:
開源模型已經達到前沿水平。 喺編碼任務嘅 Pareto 最優曲線(即係喺特定成本下做到最好表現)上,依家已經包括 OpenAI、Anthropic 同開源供應商嘅模型。Databricks 聯合創辦人 Matei Zaharia 話:「好多模型,包括開源模型,依家真係好有競爭力」。佢哋嘅結論係,開源模型,特別係 GLM 5.2,已經可以處理到最高難度嘅任務
。
Token 價格係一個誤導嘅成本指標。 測試發現,一個模型嘅每 token 價錢唔代表實際嘅總成本。因為大型模型可能更慳 token,即係話一個每 token 平啲嘅模型,如果要用多好多 token 先完成到同一樣任務,最終總成本反而會更高。呢個發現令 Databricks 改用實際完成任務嘅總成本嚟評估模型,而唔係單純睇 API 嘅 raw 收費 。
總持有成本最著數係 GLM 5.2。 透過 Z.ai 嘅 API,GLM 5.2 嘅收費大約係每百萬 input token 美金 $1.40,每百萬 output token 美金 $4.40 。舉個例,一個團隊每個月處理 1,000 萬個 token,input 同 output 各佔一半,總費用大約係美金 $29
。相比之下,Anthropic 嘅 Opus 4.8 收費係每百萬 input token 美金 $5 同每百萬 output token 美金 $25,對於差唔多或者略高嘅分數,成本可以貴 3 到 6 倍
。喺 Databricks 一個測試入面,GLM 5.2 用 Pi 呢個工具達到 87.5% 嘅通過率,每項任務成本美金 $1.25;而 Opus 4.8 用 Claude Code 嘅高強度模式,通過率差唔多,但成本就要美金 $2.00
。
表現追得上頂級模型,但成本低好多。 GLM 5.2 喺 SWE-bench Pro 得到 62.1 分,贏過 GPT-5.5 嘅 58.6 分,同 Anthropic 嘅 Opus 4.8 只差幾分 。喺 FrontierSWE Dominance 測試入面,佢有 74.4%,同 Opus 4.8 嘅 75.1% 幾乎一樣
。Databricks 嘅內部測試都印證咗呢啲公開分數:呢個中國開源模型喺真實工程任務上,已經可以同領先嘅商業模型睇齊,甚至更接近
。
開源權重、MIT 授權,部署好靈活。 因為 GLM 5.2 係 MIT 授權,完全開放權重,Databricks 可以自己喺內部部署、微調,再深度整合落佢哋嘅編碼工作流程,唔使俾人坐位授權費,亦都唔會被單一供應商綁死 。呢種授權模式令企業可以喺自己嘅基礎設施度運行模型,避免高用量時嘅 recurring API 成本。
適合長周期、多步驟嘅任務。 呢個基準測試特別關注需要跨越多個檔案同多個推理步驟嘅編碼任務。GLM 5.2 有 100 萬個 token 嘅上下文視窗,同 7440 億個參數嘅混合專家(MoE)架構,正正係為咗呢種大型代碼庫級別嘅長周期工作而優化,唔係淨係用嚟做單一檔案嘅自動補全 。喺 Terminal-Bench 2.1 呢個測試命令列同代理任務執行嘅基準,佢攞到 81.0 分,係最強嘅開源模型,僅次於 Claude Opus 4.8 嘅 85.0 分
。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Databricks 內部基準測試用咗自己幾百萬行嘅代碼庫,發現 GLM 5.2 呢個開源模型嘅表現已經追近甚至超越 OpenAI 同 Anthropic 嘅頂級商業模型,但成本就平好多。
Databricks 內部基準測試用咗自己幾百萬行嘅代碼庫,發現 GLM 5.2 呢個開源模型嘅表現已經追近甚至超越 OpenAI 同 Anthropic 嘅頂級商業模型,但成本就平好多。 測試仲揭示咗一個重點:AI 模型嘅每 token 價錢唔代表實際使費,因為大模型可能更省 token,最終令總成本更低。
GLM 5.2 採用 MIT 授權,企業可以自己部署、微調,唔使逐個座位俾授權費,彈性大好多。