ZGCM 1 7B ist ein von Grund auf trainiertes Modell mit 7,39 Milliarden Parametern und einem angegebenen Kontextfenster von 256K Token. Als Forschungsgrundlage ist es vor allem deshalb interessant, weil neben dem Modell auch Daten, Zwischenstände und Informationen zum Trainingsweg veröffentlicht wurden.
Veröffentlicht vonBearbeitet mit GPT-6 SolBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B soll nicht nur mathematische Aufgaben lösen, sondern bei Bedarf auch mithilfe von Werkzeugen Informationen beschaffen. Forschende der Zhongguancun Academy und des Zhongguancun Institute of Artificial Intelligence haben das Modell von Grund auf trainiert und veröffentlicht. Sein Nutzen als offene Forschungsgrundlage liegt darin, dass sich neben den Ergebnissen auch Teile des Entwicklungswegs untersuchen lassen. 2
4
ZGCM-1-7B ist ein dichtes, decoderbasiertes Transformer-Modell mit 7,39 Milliarden Parametern. Das angegebene Kontextfenster umfasst 256K Token. Dasselbe Modell unterstützt einen Thinking-Modus für ausführlicheres Schlussfolgern und einen Modus für direkte Antworten. So lassen sich beide Antwortweisen untersuchen, ohne das Modell zu wechseln. 2
4
Bei der sogenannten Attention – dem Mechanismus, mit dem das Modell Zusammenhänge zwischen Token verarbeitet – wechseln sich Schichten mit begrenztem, gesteuertem Blickfeld und Schichten mit vollständiger Attention ab. Eine Modellbeschreibung nennt 27 Sliding-Window-Schichten und fünf Full-Attention-Schichten. Im Vergleich der Autoren benötigt diese hybride Bauweise 6,4-mal weniger KV-Cache und erreicht bei 256K Kontext einen 3,94-mal höheren Durchsatz als die dort verwendete Full-Attention-Variante. Das sind Werte für diesen Vergleich, keine allgemeine Geschwindigkeitszusage. 4
10
Der beschriebene Trainingsweg reicht vom Vortraining über ein stufenweises Training mit längerem Kontext bis zum überwachten Feintuning für allgemeine und agentische Aufgaben. Er kombiniert die hybride Architektur mit dem FP8-Muon-Optimierer. In der Zwischenphase wird der Kontext über 16K, 64K und 256K erweitert; Interaktionsverläufe werden dabei als Zustandsübergänge eines Markow-Entscheidungsprozesses aufbereitet. Für diese Phase werden 600 Milliarden Token angegeben. 1
2
10
Neben dem fertigen Modell sind ein Datensatz und Zwischenstände des Trainings veröffentlicht. Berichte über die Freigabe nennen außerdem Trainingscode, Rezepte und Protokolle. Ein Checkpoint der als „16K“ bezeichneten Datenstufe dokumentiert beispielsweise den verwendeten Trainingskontext und die bis dahin verarbeiteten Token der Zwischenphase. Damit gibt es mehr zu prüfen als nur die endgültigen Modellgewichte. 2
3
6
9
Das Team beschreibt außerdem den Einsatz von Forschenden angeleiteter KI-Agenten bei Entwicklungsaufgaben, darunter die Datenaufbereitung und der Betrieb des Rechenclusters. Daraus folgt weder, dass die Agenten das Modell eigenständig entworfen oder überprüft haben, noch lässt sich ihr Anteil an den gemeldeten Ergebnissen beziffern. 2
8
In den veröffentlichten Auswertungen erzielt ZGCM-1-7B 97,13 % bei MATH-500, 75,00 % bei AIME 2026, 63,09 % bei WebWalkerQA und 19,43 % bei BrowseComp. Die Vergleiche fallen nicht durchweg zu seinen Gunsten aus: Bei AIME 2024 und AIME 2025 liegen Vergleichsmodelle vorn. Die Autoren berichten zudem, dass ihr Vortraining den gleichen Trainingsverlust in ungefähr 4,2-mal kürzerer Zeit erreicht als ihre AdamW/BF16-Basislinie. Alle diese Zahlen hängen von den jeweiligen Tests, Einstellungen und Vergleichssystemen ab; sie belegen keine gleichwertige Leistung in jedem Rechercheablauf. 7
10
Der Modelleinteintrag weist MIT als Lizenz aus. Die Angabe CC BY 4.0 bei der Forschungsarbeit bezieht sich auf das Paper und sollte nicht mit der Modelllizenz verwechselt werden. Wer Modell, Daten oder Code verwenden möchte, sollte die Bedingungen der jeweils genutzten Ressource prüfen. 2
7
1
Der Modelleinteintrag zeigt ein Beispiel für Textgenerierung mit Transformers und der Modellkennung zgcagi/ZGCM-1-7B. Es setzt trust_remote_code=True voraus – vor dem Aktivieren dieser Option sollte der benutzerdefinierte Code im Repository geprüft werden. Aus dem vorliegenden Material lässt sich für das fertige Modell weder eine Mindest-GPU noch eine verbindliche Speicher- oder Paketversionsanforderung ableiten. 2
19
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
ZGCM 1 7B ist ein von Grund auf trainiertes Modell mit 7,39 Milliarden Parametern und einem angegebenen Kontextfenster von 256K Token.
ZGCM 1 7B ist ein von Grund auf trainiertes Modell mit 7,39 Milliarden Parametern und einem angegebenen Kontextfenster von 256K Token. Als Forschungsgrundlage ist es vor allem deshalb interessant, weil neben dem Modell auch Daten, Zwischenstände und Informationen zum Trainingsweg veröffentlicht wurden.
Die gemeldeten Benchmark und Effizienzwerte gelten für bestimmte Tests und Vergleichssysteme – nicht automatisch für jeden praktischen Einsatz.