ZGCM 1 7B गणितीय तर्क और टूल की मदद से जानकारी खोजने के लिए शुरू से प्रशिक्षित 7.39 अरब पैरामीटर वाला मॉडल है। इसका घोषित कॉन्टेक्स्ट 256K टोकन है। यह एक उपयोगी शोध आधार इसलिए है कि अंतिम मॉडल के साथ डेटा, मध्यवर्ती चेकपॉइंट और प्रशिक्षण प्रक्रिया के विवरण भी उपलब्ध हैं। इसके अच्छे बेंचमार्क नतीजों और गति संबंधी दाव...
प्रकाशितकर्ताGPT-6 Sol से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B उन शोधकर्ताओं के लिए दिलचस्प है जो केवल यह नहीं देखना चाहते कि कोई AI मॉडल कितना स्कोर करता है, बल्कि यह भी समझना चाहते हैं कि उसे बनाया कैसे गया। Zhongguancun Academy और Zhongguancun Institute of Artificial Intelligence के शोधकर्ताओं ने इसे गणितीय तर्क और टूल की मदद से जानकारी जुटाने के लिए शुरू से प्रशिक्षित मॉडल के रूप में जारी किया है। 2
4
ZGCM-1-7B में 7.39 अरब पैरामीटर हैं। इसकी मॉडल लिस्टिंग में MIT लाइसेंस दर्ज है। शोधपत्र पर लगा CC BY 4.0 लेबल शोधपत्र का है; उसे मॉडल के लाइसेंस का विकल्प नहीं समझना चाहिए। मॉडल, डेटा या कोड इस्तेमाल करने से पहले संबंधित संसाधन की अपनी शर्तें जाँचें। 2
7
1
यह डिकोडर-ओनली डेंस ट्रांसफ़ॉर्मर है, जिसका घोषित कॉन्टेक्स्ट विंडो 256K टोकन है—यानी एक बार में मॉडल को दी जा सकने वाली सामग्री की सीमा। एक ही मॉडल में विस्तार से तर्क करने वाला थिंकिंग मोड और सीधे जवाब देने वाला मोड, दोनों मौजूद हैं। इससे शोधकर्ता मॉडल बदले बिना जवाब देने के इन दो तरीकों का अध्ययन कर सकते हैं। 2
4
इसकी आर्किटेक्चर में गेटेड स्लाइडिंग-विंडो अटेंशन और फुल अटेंशन की परतें बारी-बारी से आती हैं। एक मॉडल विवरण के अनुसार, इनमें पहली तरह की 27 और दूसरी तरह की पाँच परतें हैं। लेखकों की तुलना में इस मिश्रित बनावट से KV-cache का इस्तेमाल 6.4 गुना कम हुआ और 256K कॉन्टेक्स्ट पर थ्रूपुट 3.94 गुना बढ़ा। ये उनके निर्धारित तुलना-सेटअप के नतीजे हैं, हर मशीन या इस्तेमाल के तरीके पर मिलने वाली गति की गारंटी नहीं। 4
10
प्रकाशित प्रशिक्षण विवरण में शुरुआती प्रशिक्षण से लेकर लंबे कॉन्टेक्स्ट का चरणबद्ध मिड-ट्रेनिंग और सामान्य व एजेंट-आधारित कामों के उदाहरणों पर सुपरवाइज़्ड फ़ाइन-ट्यूनिंग तक के चरण शामिल हैं। इसमें FP8 Muon ऑप्टिमाइज़र का इस्तेमाल, 16K से 64K और फिर 256K कॉन्टेक्स्ट तक बढ़ता पाठ्यक्रम, और टूल के साथ हुई बातचीत के रिकॉर्ड को मार्कोव निर्णय प्रक्रिया (MDP) के चरणों के रूप में व्यवस्थित करना शामिल है। रिपोर्ट के अनुसार, मिड-ट्रेनिंग का यह पाठ्यक्रम 600 अरब टोकन कवर करता है। 1
2
10
अंतिम मॉडल के साथ परियोजना ने डेटा और प्रशिक्षण के बीच के चेकपॉइंट भी प्रकाशित किए हैं; रिलीज़ की रिपोर्टिंग में प्रशिक्षण कोड, रेसिपी और लॉग का भी उल्लेख है। इसलिए शोधकर्ता केवल अंतिम वज़न देखने के बजाय प्रशिक्षण के कुछ चरणों की पड़ताल कर सकते हैं। मसलन, 16K डेटा चरण के नाम वाले चेकपॉइंट में उसका प्रशिक्षण कॉन्टेक्स्ट और उस बिंदु तक मिड-ट्रेनिंग में इस्तेमाल हुए टोकन दर्ज हैं। 2
3
6
9
टीम के मुताबिक, शोधकर्ताओं के निर्देशन में काम करने वाले AI एजेंटों ने डेटा तैयार करने और कंप्यूटिंग क्लस्टर के संचालन जैसे विकास कार्यों में मदद की। यह उनकी कार्यप्रणाली का विवरण है; इससे यह साबित नहीं होता कि एजेंटों ने मॉडल स्वतंत्र रूप से डिज़ाइन या सत्यापित किया, या बेंचमार्क स्कोर में उनका योगदान कितना था। 2
8
रिपोर्ट किए गए परीक्षणों में मॉडल ने MATH-500 पर 97.13%, AIME 2026 पर 75.00%, WebWalkerQA पर 63.09% और BrowseComp पर 19.43% हासिल किए। लेकिन वह हर तुलना में आगे नहीं है: प्रकाशित तालिकाओं में AIME 2024 और AIME 2025 पर तुलना वाले मॉडल उससे बेहतर रहे। लेखकों के अनुसार, उनके AdamW/BF16 आधार से तुलना करने पर शुरुआती प्रशिक्षण में समान लॉस स्तर तक पहुँचने में लगभग 4.2 गुना कम समय लगा। इन आँकड़ों को उनके बेंचमार्क, मूल्यांकन व्यवस्था और तुलना के लिए चुने गए सिस्टम के संदर्भ में ही पढ़ना चाहिए; ये हर वास्तविक खोज-कार्य में समान प्रदर्शन का प्रमाण नहीं हैं। 7
10
मॉडल लिस्टिंग में zgcagi/ZGCM-1-7B के लिए Transformers का टेक्स्ट-जनरेशन उदाहरण है, जिसमें trust_remote_code=True दिया गया है। यह विकल्प चालू करने से पहले रिपॉज़िटरी का कस्टम कोड जाँचें। उपलब्ध सामग्री अंतिम मॉडल को चलाने के लिए न्यूनतम GPU, मेमोरी या पैकेज वर्ज़न तय नहीं करती; किसी चेकपॉइंट पर किए गए परीक्षण को अंतिम मॉडल की अनिवार्य आवश्यकता न मानें। 2
19
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
ZGCM 1 7B गणितीय तर्क और टूल की मदद से जानकारी खोजने के लिए शुरू से प्रशिक्षित 7.39 अरब पैरामीटर वाला मॉडल है। इसका घोषित कॉन्टेक्स्ट 256K टोकन है।
ZGCM 1 7B गणितीय तर्क और टूल की मदद से जानकारी खोजने के लिए शुरू से प्रशिक्षित 7.39 अरब पैरामीटर वाला मॉडल है। इसका घोषित कॉन्टेक्स्ट 256K टोकन है। यह एक उपयोगी शोध आधार इसलिए है कि अंतिम मॉडल के साथ डेटा, मध्यवर्ती चेकपॉइंट और प्रशिक्षण प्रक्रिया के विवरण भी उपलब्ध हैं।
इसके अच्छे बेंचमार्क नतीजों और गति संबंधी दावों को संबंधित परीक्षणों और तुलना के दायरे में ही पढ़ना चाहिए।