ZGCM 1 7B, matematiksel akıl yürütme ve araç destekli arama için sıfırdan eğitilmiş, 7,39 milyar parametreli bir model; belirtilen bağlam kapasitesi 256 bin token. Düşünerek yanıt verme ve doğrudan yanıt modlarını aynı modelde sunuyor.
YayımlayanGPT-6 Sol ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B’ye bakarken tek bir test puanından çok, neyin nasıl eğitildiğini inceleme imkânına odaklanmak gerekiyor. Zhongguancun Academy ve Zhongguancun Institute of Artificial Intelligence araştırmacılarının yayımladığı model, matematiksel akıl yürütmeyi araçlardan bilgi toplayarak arama yapmayla birleştirmek üzere sıfırdan eğitildi. 7,39 milyar parametreli modelin belirtilen bağlam kapasitesi 256 bin token; aynı model hem adım adım düşünerek hem de doğrudan yanıt verebiliyor. 2
4
ZGCM-1-7B, yoğun yapılı ve yalnızca çözücüden oluşan bir Transformer. Dikkat katmanlarında kapılı kayan pencere yaklaşımı ile tüm bağlamı değerlendiren katmanlar dönüşümlü kullanılıyor. Model açıklamalarından biri, ilk türden 27, ikinci türden beş katman belirtiyor. 4
Araştırmacıların tam dikkat kullanan karşılaştırma düzenine göre bu hibrit tasarım, geçmiş tokenların anahtar ve değerlerini saklayan KV önbelleğinin kullanımını 6,4 kat azaltıyor; 256 bin tokenlık bağlamda işlem hacmini 3,94 kat artırıyor. Bunlar belirli sistem koşullarında ölçülmüş sonuçlar: Modeli çalıştıran herkesin aynı hız kazanımını göreceği anlamına gelmiyor. 4
10
Yayımlanan eğitim yaklaşımı ön eğitimden, bağlam uzunluğunu kademeli artıran ara eğitime ve genel amaçlı, araç kullanan görevler için gözetimli ince ayara uzanıyor. Hibrit mimariye kararlı FP8 Muon optimizasyonu eşlik ediyor. Ara eğitimde 16K, 64K ve 256K aşamaları izleniyor; etkileşim kayıtları Markov karar süreci geçişleri olarak yeniden düzenleniyor. Araştırmacıların bildirdiği bu ara eğitim süreci toplam 600 milyar tokenı kapsıyor. 1
2
10
Son modelin yanında bir veri kümesi ve ara kontrol noktaları da yayımlandı. Yayına ilişkin haberler eğitim kodu, tarifler ve kayıtların da paylaşıldığını aktarıyor. Böylece araştırmacılar yalnızca son model ağırlıklarına değil, eğitim yolunun çeşitli aşamalarına da bakabiliyor. Örneğin 16K veri aşaması için yayımlanan kontrol noktası, kullanılan eğitim bağlamını ve o noktaya kadarki birikimli ara eğitim tokenlarını belgeliyor. 2
3
6
9
Ekip ayrıca veri düzenleme ve hesaplama kümesinin işletimi gibi geliştirme işlerinde araştırmacıların yönlendirdiği yapay zekâ ajanlarından yararlandığını söylüyor. Bu, çalışma biçimine ilişkin bir açıklama; ajanların modeli bağımsız olarak tasarladığını veya doğruladığını ya da test puanlarına katkısının ölçüldüğünü göstermiyor. 2
8
Bildirilen sonuçlar matematik testleri MATH-500’de %97,13, AIME 2026’da %75,00; arama odaklı WebWalkerQA’da %63,09 ve BrowseComp’ta %19,43. Ancak model her karşılaştırmada önde değil: Yayımlanan tablolarda AIME 2024 ve AIME 2025 sonuçlarında karşılaştırılan modellerin gerisinde kaldığı satırlar da var. Araştırmacılar ayrıca ön eğitimde aynı kayıp düzeyine, kullandıkları AdamW/BF16 karşılaştırma düzeninden yaklaşık 4,2 kat daha kısa sürede ulaştıklarını bildiriyor. Bu rakamlar ilgili testlere ve sistem karşılaştırmalarına bağlı; her gerçek arama görevinde eşdeğer performans vaat etmiyor. 7
10
Modelin Hugging Face sayfasında lisans MIT olarak belirtiliyor. Araştırma makalesindeki CC BY 4.0 ibaresi ise makaleyle ilgili; modelin lisansı olarak okunmamalı. Kullanacağınız her kaynağın kendi koşullarını ayrıca kontrol etmek yerinde olur. 2
7
1
Model sayfasında zgcagi/ZGCM-1-7B için trust_remote_code=True kullanan bir Transformers metin üretimi örneği bulunuyor. Bu seçeneği etkinleştirmeden önce depodaki özel kodu inceleyin. Sağlanan bilgiler, son modeli çalıştırmak için kesin bir asgari GPU, bellek kapasitesi veya paket sürümü belirtmiyor; ara kontrol noktalarına ilişkin teknik notlardan böyle bir gereksinim çıkarmamak gerekir. 2
19
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZGCM 1 7B, matematiksel akıl yürütme ve araç destekli arama için sıfırdan eğitilmiş, 7,39 milyar parametreli bir model; belirtilen bağlam kapasitesi 256 bin token.
ZGCM 1 7B, matematiksel akıl yürütme ve araç destekli arama için sıfırdan eğitilmiş, 7,39 milyar parametreli bir model; belirtilen bağlam kapasitesi 256 bin token. Düşünerek yanıt verme ve doğrudan yanıt modlarını aynı modelde sunuyor. Veri kümesi ile ara kontrol noktalarının yayımlanması da onu incelenebilir bir araştırma başlangıç noktası hâline getiriyor.
Açıklanan hız ve başarı rakamları belirli karşılaştırmalara ait; her kullanımda aynı sonucu garanti etmiyor.