ZGCM 1 7B est un modèle dense de 7,39 milliards de paramètres, conçu pour le raisonnement mathématique et la recherche d’informations à l’aide d’outils. Son intérêt comme base de recherche tient aussi à ses deux modes de réponse, à sa méthode d’entraînement documentée et à la publication de données et de checkpoints...
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B est un modèle de langage dense entraîné à partir de zéro par des chercheurs de la Zhongguancun Academy et du Zhongguancun Institute of Artificial Intelligence. Son objectif est d’associer raisonnement mathématique et recherche active d’informations avec des outils. Pour qui souhaite étudier un modèle plutôt que consulter ses seuls scores, l’intérêt est aussi de pouvoir examiner une partie de son parcours d’entraînement. 2
4
Le modèle compte 7,39 milliards de paramètres et sa fiche indique une licence MIT. L’article scientifique, lui, porte la mention CC BY 4.0 : cette licence ne doit pas être attribuée par erreur au modèle. Il convient de vérifier les conditions propres à chaque ressource utilisée. 2
7
1
ZGCM-1-7B est un Transformer dense de type decoder-only, doté d’une fenêtre de contexte annoncée de 256 000 tokens. Il réunit dans un même modèle un mode de raisonnement délibéré, dit thinking, et un mode de réponse directe. On peut ainsi comparer ces deux façons de répondre sans changer de modèle. 2
4
Son architecture alterne des couches d’attention à fenêtre glissante avec mécanisme de porte et des couches d’attention complète. Une description précise qu’elle comporte 27 couches du premier type et cinq du second. Par rapport à leur configuration de comparaison fondée sur l’attention complète, les auteurs annoncent un cache KV 6,4 fois moins volumineux et un débit 3,94 fois supérieur avec un contexte de 256 000 tokens. Ces gains mesurés dans un cadre précis ne préjugent pas des performances sur toute installation. 4
10
La méthode publiée couvre le préentraînement, un entraînement intermédiaire qui allonge progressivement le contexte — 16 000, 64 000 puis 256 000 tokens — et un ajustement supervisé pour des tâches générales et faisant intervenir des agents. Elle associe l’attention hybride à l’optimiseur Muon en FP8 et reformule les traces d’interaction en transitions de processus de décision markovien. Le parcours d’entraînement intermédiaire annoncé porte sur 600 milliards de tokens. 1
2
10
Outre le modèle final, le projet publie un jeu de données et des checkpoints intermédiaires ; des comptes rendus mentionnent également du code, des méthodes d’entraînement et des journaux. Un checkpoint correspondant à l’étape de données « 16K » précise, par exemple, son contexte d’entraînement et le nombre cumulé de tokens de cette phase. Ces éléments donnent davantage de prises pour étudier l’entraînement que les seuls poids finaux. 2
3
6
9
L’équipe indique avoir employé des agents d’IA sous la direction des chercheurs, notamment pour la préparation des données et l’exploitation du cluster de calcul. Cela décrit une organisation du travail : ce n’est ni la preuve que ces agents ont conçu ou validé seuls le modèle, ni une mesure de leur contribution aux scores. 2
8
Les évaluations publiées attribuent au modèle 97,13 % sur MATH-500, 75,00 % sur AIME 2026, 63,09 % sur WebWalkerQA et 19,43 % sur BrowseComp. Il ne devance toutefois pas tous les modèles comparés : les tableaux signalent aussi des résultats inférieurs sur AIME 2024 et AIME 2025. Les auteurs rapportent par ailleurs avoir atteint la même valeur de perte en préentraînement en environ 4,2 fois moins de temps qu’avec leur configuration de référence AdamW/BF16. Scores et gains dépendent des protocoles d’évaluation et des configurations comparées ; ils ne garantissent pas une efficacité identique dans tout scénario de recherche. 7
10
La fiche du modèle propose un exemple de génération de texte avec Transformers pour zgcagi/ZGCM-1-7B, utilisant trust_remote_code=True. Avant d’activer cette option, il faut examiner le code personnalisé du dépôt. Les documents cités ne permettent pas de fixer un minimum de mémoire, un GPU requis ou des versions de bibliothèques obligatoires pour exécuter le modèle final : les indications relatives aux benchmarks ou aux checkpoints ne doivent pas être prises pour une configuration minimale. 2
19
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
ZGCM 1 7B est un modèle dense de 7,39 milliards de paramètres, conçu pour le raisonnement mathématique et la recherche d’informations à l’aide d’outils.
ZGCM 1 7B est un modèle dense de 7,39 milliards de paramètres, conçu pour le raisonnement mathématique et la recherche d’informations à l’aide d’outils. Son intérêt comme base de recherche tient aussi à ses deux modes de réponse, à sa méthode d’entraînement documentée et à la publication de données et de checkpoints intermédiaires.
Ses scores et ses gains de vitesse sont ceux des évaluations et comparaisons publiées : ils ne garantissent pas les mêmes résultats dans tous les usages.