ZGCM 1 7B เป็นโมเดลหนาแน่นขนาด 7.39 พันล้านพารามิเตอร์ รองรับบริบทยาว 256K โทเคน และออกแบบมาสำหรับการให้เหตุผลทางคณิตศาสตร์กับการค้นหาโดยใช้เครื่องมือ [2][4] คุณค่าในฐานะโมเดลอ้างอิงเพื่อการวิจัยอยู่ที่โหมดคิดและตอบตรงในโมเดลเดียว ตลอดจนสูตรการฝึก ชุดข้อมูล และจุดตรวจระหว่างฝึกที่เผยแพร่ให้ศึกษา [1][2][3][9] คะแนนแล...
เผยแพร่โดยแก้ไขด้วย GPT-6 Solรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is ZGCM-1-7B, who released it and under what license, and what makes it a useful open baseline for mathematical reasoning and tool-assi. Article summary: ZGCM-1-7B is a 7.39-billion-parameter dense language model trained from scratch for mathematical reasoning and tool-assisted search. It was released by researchers at Zhongguancun Academy and the Zhongguancun Institute o. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
ZGCM-1-7B เป็นโมเดลภาษาที่ฝึกใหม่ตั้งแต่ต้นโดยนักวิจัยจาก Zhongguancun Academy และ Zhongguancun Institute of Artificial Intelligence เป้าหมายคือให้โมเดลขนาด 7.39 พันล้านพารามิเตอร์ทำได้ทั้งการให้เหตุผลทางคณิตศาสตร์และการค้นหาข้อมูลโดยใช้เครื่องมือ จุดที่น่าสนใจสำหรับนักวิจัยไม่ใช่เพียงคะแนนสอบ แต่รวมถึงทรัพยากรที่เปิดให้ตรวจสอบวิธีพัฒนาโมเดลด้วย 2
4
หน้ารายการโมเดลระบุสัญญาอนุญาตของโมเดลเป็น MIT ส่วนข้อความ CC BY 4.0 บนหน้าบทความวิจัยเป็นสัญญาอนุญาตของบทความ ไม่ควรนำมาใช้แทนเงื่อนไขของโมเดลหรือทรัพยากรอื่นโดยอัตโนมัติ ผู้ที่จะนำไปใช้ควรตรวจสอบเงื่อนไขของแต่ละรายการแยกกัน 2
7
1
ZGCM-1-7B เป็น Transformer แบบ decoder-only ชนิดหนาแน่น รองรับหน้าต่างบริบทยาวตามที่ระบุไว้ 256K โทเคน และมีทั้งโหมด thinking ซึ่งให้โมเดลใช้การคิดอย่างเป็นขั้นตอน กับโหมดตอบตรงภายในโมเดลเดียว จึงใช้เปรียบเทียบพฤติกรรมการตอบสองแบบได้โดยไม่ต้องเปลี่ยนโมเดล 2
4
ด้านการออกแบบ โมเดลสลับชั้น attention แบบ gated sliding-window ซึ่งพิจารณาบริบทในช่วงจำกัด กับชั้น full attention ที่พิจารณาบริบทได้กว้างกว่า คำอธิบายโมเดลแห่งหนึ่งระบุจำนวนไว้ที่ 27 และ 5 ชั้นตามลำดับ ผู้พัฒนารายงานว่า เมื่อเทียบกับระบบ full attention ที่ใช้เป็นฐานเปรียบเทียบ การออกแบบนี้ลดการใช้ KV cache ได้ 6.4 เท่า และเพิ่มปริมาณงานที่ประมวลผลได้ต่อเวลา หรือ throughput 3.94 เท่า ที่บริบท 256K ตัวเลขนี้เป็นผลภายใต้การเปรียบเทียบดังกล่าว ไม่ใช่ความเร็วที่รับประกันสำหรับทุกการติดตั้งใช้งาน 4
10
สูตรการฝึกที่เผยแพร่ครอบคลุมตั้งแต่การฝึกขั้นต้น การฝึกต่อเพื่อขยายบริบทอย่างค่อยเป็นค่อยไป ไปจนถึงการฝึกแบบมีตัวอย่างกำกับสำหรับงานทั่วไปและงานที่มีลักษณะเป็นเอเจนต์ ทีมผสานสถาปัตยกรรม attention แบบไฮบริดกับตัวปรับค่าน้ำหนัก FP8 Muon ขยายหลักสูตรการฝึกผ่านช่วง 16K, 64K และ 256K และจัดรูปข้อมูลลำดับการโต้ตอบใหม่เป็นขั้นการเปลี่ยนสถานะตามกรอบ Markov decision process หรือ MDP โดยรายงานว่าช่วงการฝึกต่อครอบคลุม 600 พันล้านโทเคน 1
2
10
นอกจากโมเดลสุดท้าย โครงการยังเผยแพร่ชุดข้อมูลและจุดตรวจระหว่างฝึก (checkpoints) ขณะที่รายงานเกี่ยวกับการเปิดตัวระบุว่ามีโค้ด สูตรการฝึก และบันทึกการฝึกด้วย สิ่งเหล่านี้ช่วยให้ตรวจสอบเส้นทางการพัฒนาได้มากกว่าการดูเพียงน้ำหนักโมเดลสุดท้าย ตัวอย่างเช่น จุดตรวจที่ติดป้ายว่าเป็นช่วงข้อมูล 16K มีรายละเอียดบริบทที่ใช้ฝึกและจำนวนโทเคนสะสมในช่วงการฝึกต่อ 2
3
6
9
ทีมยังระบุว่าใช้ เอเจนต์ AI ภายใต้การกำกับของนักวิจัย ช่วยงานพัฒนา เช่น คัดสรรข้อมูลและปฏิบัติการเกี่ยวกับคลัสเตอร์คอมพิวเตอร์ นี่เป็นคำอธิบายขั้นตอนการทำงาน ไม่ใช่หลักฐานว่าเอเจนต์ออกแบบหรือตรวจสอบโมเดลได้เอง และยังไม่บอกว่าเอเจนต์มีส่วนต่อคะแนนมากเพียงใด 2
8
ผลประเมินที่เผยแพร่ระบุว่า ZGCM-1-7B ได้ 97.13% บน MATH-500, 75.00% บน AIME 2026, 63.09% บน WebWalkerQA และ 19.43% บน BrowseComp โดยสองรายการหลังเป็นแบบทดสอบที่เกี่ยวข้องกับการค้นหาข้อมูล อย่างไรก็ดี โมเดลไม่ได้เหนือกว่าคู่เปรียบเทียบทุกข้อ: ตารางที่เผยแพร่ยังแสดงผลที่ตามหลังบน AIME 2024 และ AIME 2025 7
10
อีกตัวเลขหนึ่งคือรายงานของทีมที่ระบุว่า การฝึกขั้นต้นใช้เวลาน้อยลงราว 4.2 เท่า เพื่อให้ได้ค่าความสูญเสีย (loss) เท่ากับระบบฐาน AdamW/BF16 ทั้งคะแนนและความเร็วนี้ต้องอ่านคู่กับเงื่อนไขการประเมินและระบบฐานที่ใช้เปรียบเทียบ ไม่อาจสรุปว่าจะให้ผลเท่ากันในงานค้นหาหรือสภาพแวดล้อมใช้งานทุกแบบ 7
10
หน้ารายการโมเดลมีตัวอย่างสร้างข้อความด้วย Transformers สำหรับ zgcagi/ZGCM-1-7B โดยตั้งค่า trust_remote_code=True ควรตรวจสอบโค้ดเฉพาะของคลังโมเดลก่อนเปิดใช้ตัวเลือกนี้ ข้อมูลที่ให้มายังไม่ยืนยันสเปก GPU ขั้นต่ำ ปริมาณหน่วยความจำที่ต้องใช้ หรือเวอร์ชันแพ็กเกจที่จำเป็นสำหรับ โมเดลสุดท้าย จึงไม่ควรนำรายละเอียดจากการทดสอบหรือจากจุดตรวจระหว่างฝึกมาอนุมานเป็นข้อกำหนดดังกล่าว 2
19
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
ZGCM 1 7B เป็นโมเดลหนาแน่นขนาด 7.39 พันล้านพารามิเตอร์ รองรับบริบทยาว 256K โทเคน และออกแบบมาสำหรับการให้เหตุผลทางคณิตศาสตร์กับการค้นหาโดยใช้เครื่องมือ [2][4]
ZGCM 1 7B เป็นโมเดลหนาแน่นขนาด 7.39 พันล้านพารามิเตอร์ รองรับบริบทยาว 256K โทเคน และออกแบบมาสำหรับการให้เหตุผลทางคณิตศาสตร์กับการค้นหาโดยใช้เครื่องมือ [2][4] คุณค่าในฐานะโมเดลอ้างอิงเพื่อการวิจัยอยู่ที่โหมดคิดและตอบตรงในโมเดลเดียว ตลอดจนสูตรการฝึก ชุดข้อมูล และจุดตรวจระหว่างฝึกที่เผยแพร่ให้ศึกษา [1][2][3][9]
คะแนนและตัวเลขด้านความเร็วเป็นผลภายใต้การทดสอบและระบบเปรียบเทียบที่ระบุไว้ ไม่ใช่หลักประกันว่าจะได้ผลเท่ากันกับทุกงานหรือทุกเครื่อง [7][10]