ZGCM 1 7B نموذج كثيف يضم 7.39 مليار معلمة، دُرّب من الصفر للاستدلال الرياضي والبحث بمساعدة الأدوات، ويدعم سياقًا يصل إلى 256K رمز. تكمن قيمته البحثية في جمعه نمطَي التفكير والإجابة المباشرة مع وصف لمسار التدريب وإتاحة بيانات ونقاط تحقق وسيطة، لا في درجات الاختبارات وحدها.
نشر بواسطةتم التحرير باستخدام GPT-6 Solتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
إذا أردت دراسة كيف يجمع نموذج متوسط الحجم بين حل المسائل الرياضية والبحث عن المعلومات باستخدام الأدوات، فإن ZGCM-1-7B يقدّم نقطة انطلاق يمكن فحصها. طوّره باحثون في أكاديمية تشونغقوانتسون ومعهد تشونغقوانتسون للذكاء الاصطناعي، ودرّبوه من الصفر بوصفه نموذجًا كثيفًا يضم 7.39 مليار معلمة. وتأتي أهميته البحثية من إتاحة موارد تساعد على تتبّع كيفية بنائه، بدل الاكتفاء بتشغيل النموذج النهائي ومقارنة درجاته. 2
4
3
6
يعتمد النموذج بنية Transformer كثيفة ومخصّصة لتوليد النص، مع نافذة سياق معلنة تبلغ 256K رمز. وهو يدعم نمطًا للتفكير المتأنّي وآخر للإجابة المباشرة داخل النموذج نفسه؛ ما يتيح مقارنة سلوكه في النمطين دون الانتقال إلى نموذج مختلف. 2
4
تمزج آلية الانتباه بين طبقات ذات نافذة منزلقة مُبوّبة، تركّز على أجزاء قريبة من النص، وطبقات انتباه كامل. ويحدّد أحد أوصاف النموذج 27 طبقة من النوع الأول وخمس طبقات من الثاني. وفق المقارنة التي أوردها الباحثون مع تصميم يعتمد الانتباه الكامل، خفّض هذا المزج استهلاك ذاكرة التخزين المؤقت لمفاتيح الانتباه وقيمه (KV cache) بمقدار 6.4 مرات، ورفع إنتاجية المعالجة عند سياق 256K بمقدار 3.94 مرات. هذه نتائج ضمن إعداد المقارنة المذكور، وليست سرعة مضمونة على كل جهاز أو بيئة تشغيل. 4
10
تصف المواد المنشورة مسارًا يبدأ بالتدريب المسبق، ثم تدريبًا وسيطًا يوسّع السياق تدريجيًا عبر مراحل 16K و64K و256K، وصولًا إلى الضبط الدقيق الخاضع للإشراف لأمثلة عامة ومهام تستخدم الأدوات. ويشمل المسار مُحسِّن Muon بدقة FP8 وإعادة صياغة سجلات التفاعل في صورة انتقالات ضمن عملية قرار ماركوفية؛ أي تمثيل متتابع للحالات والإجراءات أثناء التفاعل. ويبلغ حجم منهج التدريب الوسيط المُبلّغ عنه 600 مليار رمز. 1
2
10
إلى جانب النموذج النهائي، نشر المشروع مجموعة بيانات ونقاط تحقق وسيطة؛ وتصف تغطية الإصدار أيضًا إتاحة شيفرة التدريب ووصف خطواته وسجلاته. وتوضح إحدى نقاط التحقق الخاصة بمرحلة بيانات 16K سياق التدريب وعدد الرموز التراكمي في التدريب الوسيط. لذلك يستطيع الباحث تتبّع أجزاء من مسار التطوير، مع بقاء إعادة إنتاج النتائج مهمة مستقلة تتطلب فحص الموارد والإعدادات. 2
3
6
9
ويقول الفريق إن وكلاء ذكاء اصطناعي عملوا بتوجيه الباحثين وساعدوا في مهام منها تنسيق البيانات وتشغيل البنية الحاسوبية. هذا وصف لطريقة العمل، لا دليل على أن الوكلاء صمّموا النموذج أو تحقّقوا منه استقلالًا، ولا قياس لمقدار مساهمتهم في نتائجه. 2
8
سجّلت التقييمات المُبلّغ عنها 97.13% في MATH-500 و75.00% في AIME 2026، مقابل 63.09% في WebWalkerQA و19.43% في BrowseComp، وهما اختباران مرتبطان بمهام البحث. لكن التفوّق ليس شاملًا: تُظهر المقارنات المنشورة تراجعه أمام نماذج مقارنة في AIME 2024 وAIME 2025. ويذكر الباحثون أيضًا أن تصميم التدريب المسبق بلغ مستوى الخسارة نفسه في وقت أقل بنحو 4.2 مرات مقارنة بإعدادهم المرجعي القائم على AdamW وBF16. تتوقف دلالة هذه الأرقام على الاختبارات وإعدادات التقييم والمقارنة؛ ولا تثبت أداءً مماثلًا في كل مهمة بحث فعلية. 7
10
تُدرج صفحة النموذج رخصة MIT، بينما تشير CC BY 4.0 في صفحة الورقة البحثية إلى رخصة الورقة، ولا ينبغي الخلط بينهما. من الأفضل مراجعة الشروط المرفقة بكل مورد قبل استخدامه. 2
7
1
تقدّم صفحة النموذج مثالًا لتوليد النصوص باستخدام مكتبة Transformers والمُعرّف zgcagi/ZGCM-1-7B، مع الخيار trust_remote_code=True. راجع الشيفرة المخصّصة في المستودع قبل تفعيل هذا الخيار. ولا تحدّد المواد المتاحة حدًا أدنى مؤكدًا للبطاقة الرسومية أو الذاكرة أو إصدارات الحزم اللازمة لتشغيل النموذج النهائي؛ لذا لا يصح استنتاج هذه المتطلبات من أوصاف الاختبارات أو نقاط التحقق الوسيطة. 2
19
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
ZGCM 1 7B نموذج كثيف يضم 7.39 مليار معلمة، دُرّب من الصفر للاستدلال الرياضي والبحث بمساعدة الأدوات، ويدعم سياقًا يصل إلى 256K رمز.
ZGCM 1 7B نموذج كثيف يضم 7.39 مليار معلمة، دُرّب من الصفر للاستدلال الرياضي والبحث بمساعدة الأدوات، ويدعم سياقًا يصل إلى 256K رمز. تكمن قيمته البحثية في جمعه نمطَي التفكير والإجابة المباشرة مع وصف لمسار التدريب وإتاحة بيانات ونقاط تحقق وسيطة، لا في درجات الاختبارات وحدها.