Zhipu AI ระบุว่า GLM 5.3 มีพารามิเตอร์ 743 พันล้านตัว และพัฒนาความสามารถด้านการเขียนโค้ดเพิ่มขึ้นราว 50% จาก GLM 5.2 โดยอาศัย post training เป็นหลัก ไม่ใช่การขยายโมเดลฐาน GLM 5.3 ได้คะแนน 28.3 ใน Terminal Bench 3.0 และ 66.9 ใน DeepSWE 1.1 เพิ่มจาก GLM 5.2 ที่ทำได้ 4.6 และ 46.2 ตามลำดับ Zhipu วางตำแหน่งโมเดลสำหรับงาน...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What did Chinese AI startup Zhipu AI announce about its next-generation open-source foundation model GLM-5.3, including its 743-billion-para. Article summary: Zhipu AI announced GLM-5.3, a 743-billion-parameter open-weights foundation model positioned as a major capability upgrade achieved primarily through post-training rather than a larger base model. The company says it sub. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Zhipu AI เปิดตัว GLM-5.3 โมเดลพื้นฐานแบบ open-weights ที่มีพารามิเตอร์ 743 พันล้านตัว โดยวางจุดขายไว้ที่การเขียนโค้ด วิศวกรรมซอฟต์แวร์ และงานแบบเอเจนต์ มากกว่าการเป็นแชตบอตสำหรับสนทนาเพียงอย่างเดียว บริษัทระบุว่า GLM-5.3 ใช้ขนาดโมเดลเท่ากับ GLM-5.2 แต่ทำผลงานดีขึ้นอย่างมากในการทดสอบงานเขียนโค้ดระยะยาวและการใช้เครื่องมือ โดยแรงส่งหลักมาจาก post-training หรือการฝึกเพิ่มเติมหลังสร้างโมเดลฐานแล้ว
ตัวเลขสำคัญที่ Zhipu รายงาน ได้แก่ การพัฒนาด้านโค้ดราว 50% เมื่อเทียบกับ GLM-5.2 บน Z.ai Code Bench, คะแนน 28.3 ใน Terminal-Bench 3.0 และ 66.9 ใน DeepSWE 1.1 ผลลัพธ์เหล่านี้สะท้อนแนวทางของโมเดลที่พยายามทำงานวิศวกรรมหลายขั้นตอนให้จบ ไม่ใช่แค่สร้างโค้ดสั้น ๆ จากคำสั่งเดียว อย่างไรก็ตาม ตัวเลขทั้งหมดควรผ่านการทดสอบโดยบุคคลที่สามและการใช้งานจริงเพิ่มเติม
GLM-5.3 มีขนาดที่รายงานไว้ 743 พันล้านพารามิเตอร์ ซึ่งเป็นตัวเลขเดียวกับ GLM-5.2 โดย Zhipu อธิบายว่าการยกระดับครั้งนี้มาจากการฝึกเพิ่มเติมหลังการฝึกโมเดลฐานเป็นหลัก แทนที่จะเพิ่มจำนวนพารามิเตอร์หรือสร้างฐานโมเดลใหม่
ประเด็นนี้สำคัญต่อการพัฒนาโมเดล AI เพราะการเพิ่มขนาดไม่ใช่เส้นทางเดียวที่จะทำให้ประสิทธิภาพดีขึ้น Post-training สามารถปรับวิธีที่โมเดลวางแผน ใช้เครื่องมือ ทำตามคำสั่ง และเดินหน้าต่อเมื่อเจอเวิร์กโฟลว์ที่ซับซ้อนได้
หลักฐานที่มีอยู่รองรับคำอธิบายของ Zhipu เกี่ยวกับแนวทางการฝึกโมเดล แต่ยังไม่สามารถยืนยันอย่างเป็นอิสระได้ว่าเทคนิค post-training ใดมีส่วนต่อการเพิ่มขึ้นของคะแนนมากน้อยเพียงใด
Zhipu ระบุว่า GLM-5.3 มีความสามารถด้านโค้ดเพิ่มขึ้นประมาณ 50% จาก GLM-5.2 บน Z.ai Code Bench ของบริษัท แต่ความแตกต่างที่เห็นชัดกว่าปรากฏในการทดสอบที่ให้โมเดลทำงานซอฟต์แวร์ต่อเนื่องเป็นระยะเวลานาน ได้แก่
Terminal-Bench 3.0 มีความเกี่ยวข้องโดยตรงกับคำกล่าวอ้างเรื่อง agentic coding เพราะการทดสอบไม่ได้วัดเพียงคำตอบแบบคงที่ แต่รวมถึงงานที่ต้องโต้ตอบกับเทอร์มินัลและเชลล์ด้วย ส่วน DeepSWE 1.1 มุ่งวัดงานด้านวิศวกรรมซอฟต์แวร์ จึงช่วยสะท้อนความสามารถในการทำเวิร์กโฟลว์พัฒนาโปรแกรมที่ครบถ้วนขึ้น
Zhipu ระบุว่าคะแนน 28.3 ใน Terminal-Bench 3.0 สูงที่สุดในกลุ่มโมเดลโอเพนซอร์ส ณ เวลาประกาศ และนำหน้า Kimi K3 ของ Moonshot AI แต่การจัดอันดับดังกล่าวเป็นข้อมูลที่บริษัทรายงานเอง การเปรียบเทียบจึงควรพิจารณาร่วมกับเวอร์ชันของชุดทดสอบ วิธีเขียนพรอมป์ต และเงื่อนไขการเข้าถึงโมเดลของแต่ละระบบ
ทิศทางผลิตภัณฑ์ของ GLM-5.3 คือการทำให้ AI ทำได้มากกว่าการแนะนำโค้ด Zhipu นำเสนอโมเดลนี้ว่าใช้งานเครื่องมือ ควบคุมซอฟต์แวร์ และทำงานต่อเนื่องหลายขั้นตอนได้ โดยต้องพึ่งการแทรกแซงจากมนุษย์น้อยลง
ความแตกต่างอยู่ที่ระดับของงาน ผู้ช่วยเขียนโค้ดทั่วไปอาจตอบคำถามที่เจาะจงหรือสร้างฟังก์ชันหนึ่งชุด ขณะที่เอเจนต์อาจต้องตรวจสอบโค้ดในรีโพซิทอรี รันคำสั่ง วิเคราะห์ข้อผิดพลาด แก้ไขไฟล์ และทำงานต่อจนเข้าใกล้เป้าหมายมากขึ้น
คะแนนที่ดีขึ้นใน Terminal-Bench และ DeepSWE สอดคล้องกับทิศทางดังกล่าว แต่คะแนนจากเบนช์มาร์กเพียงอย่างเดียวไม่อาจยืนยันว่าเอเจนต์จะทำงานได้อย่างน่าเชื่อถือในสภาพแวดล้อมการผลิตที่ไม่คุ้นเคย
Zhipu ยังระบุว่าความสามารถด้านโค้ดและเอเจนต์ของ GLM-5.3 กำลังเข้าใกล้ Claude Fable 5 พร้อมวางตำแหน่งให้มีความแข็งแกร่งเชิงปฏิบัติมากกว่าโมเดลจีนอื่น ๆ ในงานเขียนโค้ดจริง ข้อความเหล่านี้เป็นการวางตำแหน่งจากบริษัท ไม่ควรตีความว่าเป็นผลจัดอันดับอิสระที่ยืนยันแล้ว
Zhipu เชื่อมโยงความสามารถด้านการให้เหตุผลและการใช้เครื่องมือของ GLM-5.3 เข้ากับงานความปลอดภัยไซเบอร์ รวมถึงการค้นหาช่องโหว่ในซอฟต์แวร์ โดยมีรายงานคะแนน 84.5% ใน CyberGym ซึ่งทดสอบการค้นหาและตรวจสอบช่องโหว่
ความสามารถลักษณะนี้มีทั้งประโยชน์และความเสี่ยงแบบ dual-use เพราะทักษะการให้เหตุผลและการควบคุมซอฟต์แวร์ที่ช่วยฝ่ายป้องกันค้นหาจุดอ่อน ก็อาจทำให้พฤติกรรมอัตโนมัติที่ไม่ปลอดภัยมีผลกระทบรุนแรงขึ้นได้
หลักฐานที่มีอยู่รองรับการกล่าวว่า GLM-5.3 มีความสามารถด้านการค้นหาช่องโหว่ตามที่รายงาน แต่ยังไม่ใช่หลักฐานว่าโมเดลเป็นผู้ตรวจสอบความปลอดภัยที่เชื่อถือได้ หรือสามารถดำเนินการโจมตีระบบโดยอัตโนมัติอย่างปลอดภัย
สัญญาณสำคัญที่สุดจาก GLM-5.3 อาจไม่ใช่จำนวนพารามิเตอร์ แต่คือการเน้น post-training และการใช้การทดสอบที่วัดว่าโมเดลสามารถประคองงานซอฟต์แวร์หลายขั้นตอนจนจบได้หรือไม่
สำหรับนักพัฒนาที่กำลังประเมินโมเดล คำถามที่ควรทดสอบมีดังนี้
GLM-5.3 เป็นโมเดลขนาด 743 พันล้านพารามิเตอร์ที่ Zhipu AI ระบุว่าได้ประสิทธิภาพส่วนใหญ่จาก post-training ไม่ใช่การเพิ่มขนาดของโมเดลฐาน การขยับคะแนนจาก 4.6 เป็น 28.3 ใน Terminal-Bench 3.0 และจาก 46.2 เป็น 66.9 ใน DeepSWE 1.1 ทำให้จุดขายของรุ่นนี้ชัดเจน นั่นคือการสร้างเอเจนต์เขียนโค้ดที่รับมือกับงานซอฟต์แวร์ระยะยาวและซับซ้อนได้ดีขึ้น
ผลลัพธ์ดังกล่าวมีนัยสำคัญพอที่จะต้องติดตาม โดยเฉพาะสำหรับโมเดลแบบเปิดและเวิร์กโฟลว์ที่ใช้งานเอเจนต์ แต่ทั้งหมดนี้ยังเป็นตัวเลขและคำกล่าวอ้างจากผู้พัฒนา ความแตกต่างระหว่างผลเบนช์มาร์กที่โดดเด่นกับการทำงานอัตโนมัติที่ไว้ใจได้ในโลกจริงยังต้องรอการตรวจสอบจากแหล่งอิสระ
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Zhipu AI ระบุว่า GLM 5.3 มีพารามิเตอร์ 743 พันล้านตัว และพัฒนาความสามารถด้านการเขียนโค้ดเพิ่มขึ้นราว 50% จาก GLM 5.2 โดยอาศัย post training เป็นหลัก ไม่ใช่การขยายโมเดลฐาน
Zhipu AI ระบุว่า GLM 5.3 มีพารามิเตอร์ 743 พันล้านตัว และพัฒนาความสามารถด้านการเขียนโค้ดเพิ่มขึ้นราว 50% จาก GLM 5.2 โดยอาศัย post training เป็นหลัก ไม่ใช่การขยายโมเดลฐาน GLM 5.3 ได้คะแนน 28.3 ใน Terminal Bench 3.0 และ 66.9 ใน DeepSWE 1.1 เพิ่มจาก GLM 5.2 ที่ทำได้ 4.6 และ 46.2 ตามลำดับ
Zhipu วางตำแหน่งโมเดลสำหรับงานวิศวกรรมซอฟต์แวร์ระยะยาว การใช้เครื่องมือ และงานเอเจนต์ที่สามารถสั่งงานซอฟต์แวร์ได้โดยมีมนุษย์คอยกำกับน้อยลง รวมถึงการค้นหาช่องโหว่ที่อาจเกิดขึ้น