ZGCM 1 7B ialah model padat 7.39 bilion parameter dengan tetingkap konteks 256K token, dibina untuk penaakulan matematik dan carian berbantu alat. Nilainya sebagai model rujukan terbuka terletak pada dua mod respons, proses latihan yang didokumenkan serta penerbitan data dan checkpoint perantaraan.
Diterbitkan olehDisunting dengan GPT-6 SolImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B bukan sekadar model dengan keputusan ujian yang boleh dibandingkan. Penyelidik di Zhongguancun Academy dan Zhongguancun Institute of Artificial Intelligence mengeluarkan model bahasa padat ini, yang dilatih dari awal untuk menyelesaikan masalah matematik dan mencari maklumat dengan bantuan alat, bersama bahan yang membolehkan proses pembangunannya diteliti. 2
4
Model ini mempunyai 7.39 bilion parameter. Penyenaraian model menyatakan lesen MIT; label CC BY 4.0 pada kertas kajian pula merujuk kepada kertas tersebut dan tidak patut dianggap sebagai lesen model. Semak syarat bagi setiap bahan yang ingin digunakan. 2
7
1
ZGCM-1-7B menggunakan seni bina Transformer padat jenis decoder-only dan menyokong tetingkap konteks 256K token. Dalam model yang sama, pengguna boleh memilih mod thinking, yang menekankan penaakulan, atau mod respons langsung. Ini memudahkan penyelidik mengkaji perbezaan antara kedua-dua gaya jawapan tanpa bertukar model. 2
4
Untuk mengendalikan konteks panjang, reka bentuk attention-nya menyelang-selikan lapisan tetingkap gelongsor berpagar dengan lapisan attention penuh. Satu penerangan model memperincikan 27 lapisan jenis pertama dan lima lapisan jenis kedua. Menurut perbandingan yang dilaporkan, reka bentuk hibrid itu menggunakan 6.4 kali lebih sedikit KV cache dan meningkatkan kadar pemprosesan 3.94 kali pada konteks 256K berbanding reka bentuk attention penuh yang dijadikan pembanding. Angka tersebut ialah hasil dalam tetapan perbandingan itu, bukan jaminan kelajuan yang sama pada setiap sistem. 4
10
Resipi latihan yang diterbitkan merangkumi pralatihan, latihan pertengahan berperingkat untuk konteks panjang dan penalaan halus terselia bagi tugas umum serta tugas berasaskan ejen AI. Ia menggabungkan attention hibrid dengan pengoptimum Muon FP8 yang stabil, memperluas peringkat latihan merentas 16K, 64K dan 256K token, serta menyusun semula rekod interaksi sebagai peralihan dalam proses keputusan Markov. Menurut laporan, latihan pertengahan itu meliputi 600 bilion token. 1
2
10
Selain model akhir, projek ini menerbitkan set data dan checkpoint perantaraan; laporan mengenai keluarannya turut menyebut kod latihan, resipi dan log. Sebagai contoh, checkpoint berlabel peringkat data 16K mendokumenkan konteks latihan dan jumlah token latihan pertengahan terkumpul. Bahan-bahan ini memberi penyelidik lebih banyak bahagian proses latihan untuk diperiksa berbanding keluaran yang hanya menyediakan pemberat model akhir. 2
3
6
9
Pasukan itu juga menyatakan bahawa ejen AI yang diarahkan oleh penyelidik membantu tugas pembangunan seperti penyusunan data dan operasi kluster pengkomputeran. Itu menerangkan cara mereka bekerja; ia bukan bukti bahawa ejen tersebut mereka bentuk atau mengesahkan model secara bebas, dan bukan ukuran sumbangannya kepada skor model. 2
8
Penilaian yang dilaporkan memberikan ZGCM-1-7B skor 97.13% pada MATH-500, 75.00% pada AIME 2026, 63.09% pada WebWalkerQA dan 19.43% pada BrowseComp. Keputusannya tidak mengatasi model pembanding dalam semua ujian: perbandingan yang diterbitkan juga menunjukkan kekalahan pada AIME 2024 dan AIME 2025. Secara berasingan, penulis melaporkan bahawa pralatihannya mencapai tahap loss yang sama dalam masa kira-kira 4.2 kali lebih singkat berbanding garis dasar AdamW/BF16 mereka. Semua angka ini bergantung pada penanda aras, kaedah penilaian dan sistem pembanding yang digunakan; ia tidak membuktikan prestasi setara untuk setiap tugasan carian sebenar. 7
10
Penyenaraian model menyediakan contoh penjanaan teks menggunakan Transformers untuk zgcagi/ZGCM-1-7B dengan tetapan trust_remote_code=True. Semak kod tersuai dalam repositori sebelum mengaktifkan pilihan itu. Bahan yang tersedia tidak menetapkan GPU minimum, keperluan memori atau versi pakej minimum untuk menjalankan model akhir; jangan anggap spesifikasi daripada penanda aras atau checkpoint sebagai syarat penggunaannya. 2
19
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ZGCM 1 7B ialah model padat 7.39 bilion parameter dengan tetingkap konteks 256K token, dibina untuk penaakulan matematik dan carian berbantu alat.
ZGCM 1 7B ialah model padat 7.39 bilion parameter dengan tetingkap konteks 256K token, dibina untuk penaakulan matematik dan carian berbantu alat. Nilainya sebagai model rujukan terbuka terletak pada dua mod respons, proses latihan yang didokumenkan serta penerbitan data dan checkpoint perantaraan.