ZGCM 1 7B es un modelo denso de 7.390 millones de parámetros, creado para razonamiento matemático y búsqueda asistida por herramientas, con un contexto declarado de 256K tokens. Su interés como referencia de investigación está en poder estudiar tanto sus dos modos de respuesta como partes de su proceso de entrenamie...
Publicado porEditado con GPT-6 SolImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B es un modelo de lenguaje entrenado desde cero para combinar el razonamiento matemático con la búsqueda activa de información mediante herramientas. Lo publicaron investigadores de Zhongguancun Academy y el Zhongguancun Institute of Artificial Intelligence. Su principal atractivo para quienes investigan modelos no es únicamente su puntuación en pruebas: el proyecto también permite examinar parte del camino seguido para entrenarlo. 2
4
Se trata de un Transformer denso de tipo decoder-only, con 7.390 millones de parámetros y una ventana de contexto declarada de 256K tokens. En el mismo modelo se puede usar un modo de razonamiento deliberado (thinking) o uno de respuesta directa. Esa combinación permite comparar estilos de respuesta sin cambiar de modelo. 2
4
Su arquitectura alterna capas de atención de ventana deslizante con compuertas y capas de atención completa. Una descripción detalla 27 capas del primer tipo y cinco del segundo. Frente a la configuración de atención completa empleada en su comparación, los autores comunican un uso de caché KV 6,4 veces menor y un rendimiento de procesamiento 3,94 veces mayor con un contexto de 256K. Son resultados de esa comparación, no una promesa de aceleración para cualquier instalación. 4
10
La receta publicada abarca el preentrenamiento, una etapa intermedia de ampliación progresiva del contexto y el ajuste fino supervisado con ejemplos generales y de uso de agentes. Combina la atención híbrida con el optimizador Muon en FP8 y etapas de 16K, 64K y 256K. También reformula los registros de interacción como transiciones de procesos de decisión de Markov; según lo comunicado, el entrenamiento intermedio comprende 600.000 millones de tokens. 1
2
10
Además del modelo final, el proyecto publicó un conjunto de datos y puntos de control intermedios; la cobertura del lanzamiento también describe código de entrenamiento, recetas y registros. Por ejemplo, el punto de control etiquetado como etapa de datos de 16K documenta el contexto usado para entrenarlo y el volumen acumulado de tokens de esa fase. Conviene distinguir la etiqueta de la etapa de su ventana de entrenamiento: en ese punto de control se indica un contexto de 32K. 2
3
6
9
El equipo señala que agentes de IA dirigidos por investigadores ayudaron en tareas de desarrollo, entre ellas la preparación de datos y las operaciones del clúster. Eso describe un flujo de trabajo: no demuestra que los agentes diseñaran o validaran el modelo de forma independiente, ni cuantifica cuánto contribuyeron a sus resultados. 2
8
Las evaluaciones publicadas atribuyen a ZGCM-1-7B un 97,13 % en MATH-500, un 75,00 % en AIME 2026, un 63,09 % en WebWalkerQA y un 19,43 % en BrowseComp. No encabeza todas las comparaciones: las tablas también muestran resultados inferiores a los de un modelo de referencia en AIME 2024 y AIME 2025. Por separado, los autores indican que alcanzaron la misma pérdida de preentrenamiento en aproximadamente 4,2 veces menos tiempo que con su referencia AdamW/BF16. Todas estas cifras dependen de las pruebas, la configuración de evaluación y los sistemas comparados; no establecen cómo rendirá el modelo en cualquier tarea real de búsqueda. 7
10
La ficha del modelo identifica su licencia como MIT. El sello CC BY 4.0 del artículo de investigación corresponde al artículo y no debe confundirse con la licencia del modelo. Antes de reutilizar datos, código o pesos, conviene consultar las condiciones del recurso concreto. 2
7
1
La ficha de zgcagi/ZGCM-1-7B ofrece un ejemplo de generación de texto con Transformers que utiliza trust_remote_code=True: hay que revisar el código personalizado del repositorio antes de activar esa opción. El material disponible no establece una GPU mínima, una cantidad de memoria ni versiones obligatorias de paquetes para ejecutar el modelo final; esos requisitos no deben deducirse de las pruebas ni de las fichas de los puntos de control. 2
19
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
ZGCM 1 7B es un modelo denso de 7.390 millones de parámetros, creado para razonamiento matemático y búsqueda asistida por herramientas, con un contexto declarado de 256K tokens.
ZGCM 1 7B es un modelo denso de 7.390 millones de parámetros, creado para razonamiento matemático y búsqueda asistida por herramientas, con un contexto declarado de 256K tokens. Su interés como referencia de investigación está en poder estudiar tanto sus dos modos de respuesta como partes de su proceso de entrenamiento, no solo los pesos finales.
Las mejoras de velocidad y los resultados en pruebas son cifras comunicadas para comparaciones concretas; no garantizan el mismo rendimiento en cualquier entorno.