أظهرت اختبارات Databricks الداخلية، التي أُجريت على قاعدة بيانات ضخمة بملايين الأسطر البرمجية، أن النماذج مفتوحة المصدر مثل GLM 5.2 من Z.ai أصبحت تنافس بقوة على مستوى الجودة والتكلفة في مهام البرمجة الآلية (agentic co... كشفت الاختبارات أن سعر الرمز (Token) لكل نموذج لا يعكس التكلفة الإجمالية الحقيقية للمهمة، حيث يم...
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What did Databricks' internal coding benchmark reveal about AI model performance and cost, and wh. Article summary: Databricks published results from an internal coding benchmark that evaluated agentic models on real engineering tasks from its multi-million-line codebase (Python, Go, TypeScript, Scala, SQL). The key findings and the c. Topic tags: general, documentation, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
نشرت شركة Databricks، المتخصصة في تحليل البيانات والذكاء الاصطناعي، نتائج اختبار داخلي للبرمجة أُجري في يوليو 2026، قامت خلاله بتقييم نماذج الذكاء الاصطناعي العاملة في المهام الآلية (agentic AI) على مهام هندسية حقيقية مأخوذة من قاعدة بياناتها البرمجية التي تحتوي على ملايين الأسطر (باستخدام لغات Python, Go, TypeScript, Scala, SQL). قادت نتائج هذا الاختبار الشركة إلى اعتماد النموذج الصيني مفتوح المصدر GLM 5.2 من شركة Z.ai (المعروفة سابقاً باسم Zhipu AI) كمحرك برمجة افتراضي لها. فيما يلي تفاصيل ما كشفه الاختبار وأسباب هذا القرار.
قامت Databricks ببناء اختبار خاص بها لأنها وجدت أن الاختبارات العامة مثل SWE-bench قد تكون غير دقيقة بسبب وجود ممارسات "الإفراط في التحسين" (over-tuning) لها، وأرادت قياس أي من النماذج العاملة يمكنها حل مهام حقيقية من البداية إلى النهاية مقابل مجموعات اختبار دقيقة . أسفر التقييم عن ثلاث مفاجآت كبرى:
1. النماذج مفتوحة المصدر وصلت إلى حافة الريادة (the frontier). أصبحت حدود باريتو (Pareto frontier) لمهام البرمكة — أي أفضل جودة مقابل تكلفة معينة — تشمل الآن نماذج من OpenAI و Anthropic، بالإضافة إلى مزودي النماذج مفتوحة المصدر. صرح المؤسس المشارك لـ Databricks، ماتي زهاريا، بأن "العديد من النماذج، بما في ذلك النماذج مفتوحة المصدر، أصبحت قادرة على المنافسة حقاً الآن" . وخلصت الشركة إلى أن النماذج المفتوحة، ولا سيما GLM 5.2، أصبحت قادرة على التعامل مع أعلى مستويات صعوبة المهام التي تم اختبارها
.
2. سعر الرمز (Token Price) هو مؤشر خادع للتكلفة الحقيقية. وجد الاختبار أن سعر الرمز لكل نموذج لا يتنبأ بشكل موثوق بالتكلفة الإجمالية الفعلية في سير عمل البرمجة الآلية (agentic coding). يمكن للنماذج الأكبر حجماً أن تكون أكثر كفاءة بشكل كبير في استهلاك الرموز، مما يعني أن النموذج الأرخص سعراً لكل رمز قد يكلف أكثر في النهاية إذا احتاج إلى رموز أكثر لإكمال نفس المهمة. دفع هذا Databricks إلى تقييم النماذج بناءً على التكلفة الحقيقية لإنجاز المهام من البداية إلى النهاية بدلاً من أسعار واجهة API الخام .
3. التكلفة الإجمالية للملكية (TCO) رجحت كفة GLM 5.2. عبر واجهة API الخاصة بـ Z.ai، يُسعّر GLM 5.2 بحوالي 1.40 دولار لكل مليون رمز إدخال و 4.40 دولار لكل مليون رمز إخراج . لفريق يعالج 10 ملايين رمز شهرياً بنسبة 50/50 بين الإدخال والإخراج، ستبلغ التكلفة الإجمالية حوالي 29 دولاراً شهرياً
. يمكن أن تكلف النماذج المنافسة مثل Opus 4.8 من Anthropic بسعر 5 دولارات / 25 دولاراً لكل مليون رمز، ما بين 3 إلى 6 أضعاف ذلك مقابل نتائج مماثلة أو أفضل قليلاً في الاختبارات
. على أساس كل مهمة، أظهر أحد اختبارات Databricks أن GLM 5.2 باستخدام أداة Pi يحقق معدل نجاح 87.5% بتكلفة 1.25 دولار لكل مهمة، بينما يحقق Opus 4.8 عالي الجهد باستخدام Claude Code معدل نجاح مماثلاً بتكلفة 2.00 دولار لكل مهمة
.
1. أداء يضاهي النماذج الرائدة بتكلفة أقل بكثير. سجل GLM 5.2 درجة 62.1 على اختبار SWE-bench Pro، متجاوزاً GPT-5.5 (58.6) ومقترباً بفارق بسيط من Claude Opus 4.8 . على اختبار FrontierSWE Dominance، حقق 74.4%، متعادلاً تقريباً مع Opus 4.8 الذي سجل 75.1%
. أكدت الاختبارات الداخلية لـ Databricks هذه النتائج العامة: النموذج الصيني مفتوح الأوزان (open-weight) match قدرة النماذج التجارية الرائدة على نفس المهام الهندسية الواقعية
.
2. مرونة النشر بموجب ترخيص MIT مفتوح المصدر. لأن GLM 5.2 مرخص بموجب MIT ومفتوح الأوزان بالكامل، يمكن لـ Databricks نشره داخل بنيتها التحتية، وضبطه (fine-tuning)، ودمجه بإحكام في سير عمل البرمجة الآلي دون الحاجة إلى تراخيص لكل مستخدم أو تقييد من مزود معين . يسمح هذا النموذج الترخيصي للشركات بتشغيل النموذج على بنيتها التحتية الخاصة، وتجنب تكاليف API المتكررة للاستخدام عالي الحجم.
3. مناسب للمهام طويلة الأمد ومتعددة الخطوات. ركز الاختبار على التعديلات البرمجية الآلية التي تمتد عبر عدة ملفات وخطوات تفكير متعددة. تم تحسين GLM 5.2، بنافذة سياق (context window) تبلغ مليون رمز ومعمارية MoE تضم 744 مليار معلمة، خصيصاً لهذا النوع من العمل على مستوى المستودعات البرمجية (repository-scale) وطويل الأمد . على اختبار Terminal-Bench 2.1، الذي يختبر تنفيذ المهام عبر سطر الأوامر، سجل النموذج 81.0، مما يجعله أقوى نموذج مفتوح المصدر ويجعله في المرتبة الثانية بعد Claude Opus 4.8 الذي سجل 85.0
.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
أظهرت اختبارات Databricks الداخلية، التي أُجريت على قاعدة بيانات ضخمة بملايين الأسطر البرمجية، أن النماذج مفتوحة المصدر مثل GLM 5.2 من Z.ai أصبحت تنافس بقوة على مستوى الجودة والتكلفة في مهام البرمجة الآلية (agentic co...
أظهرت اختبارات Databricks الداخلية، التي أُجريت على قاعدة بيانات ضخمة بملايين الأسطر البرمجية، أن النماذج مفتوحة المصدر مثل GLM 5.2 من Z.ai أصبحت تنافس بقوة على مستوى الجودة والتكلفة في مهام البرمجة الآلية (agentic co... كشفت الاختبارات أن سعر الرمز (Token) لكل نموذج لا يعكس التكلفة الإجمالية الحقيقية للمهمة، حيث يمكن للنماذج الأكبر حجماً أن تكون أكثر كفاءة في استهلاك الرموز مما يقلل التكلفة النهائية.
قررت Databricks اعتماد GLM 5.2 كمحرك برمجة افتراضي بعد أن أظهر أداءً match لأفضل النماذج التجارية مثل Opus 4.8 بتكلفة أقل بكثير، مع مرونة النشر بموجب ترخيص MIT مفتوح المصدر.