Ox Alpha คือ GLM 5.3 Flash ของ Zhipu AI หรือ Z.ai ซึ่งเปิดทดสอบแบบไม่เปิดเผยตัวตนเมื่อวันที่ 20 สิงหาคม 2026 ก่อนยืนยันชื่อโมเดลในวันที่ 26 สิงหาคม โมเดลนี้เน้นงานเขียนโค้ด โปรแกรมที่ทำงานกับภาพและหน้าจอ งานระยะยาวของเอเจนต์ และการใช้เครื่องมือ โดยมีบริบท 1,048,576 โทเคน รองรับข้อความ ภาพ วิดีโอ และไฟล์ พร้อมเปิดน้ำ...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3-Flash คือโมเดลที่อยู่เบื้องหลังจุดให้บริการปริศนา Ox Alpha ซึ่งปรากฏบน OpenRouter และเครื่องมือสำหรับนักพัฒนาอื่น ๆ เมื่อวันที่ 20 สิงหาคม 2026 โดยไม่มีการระบุชื่อผู้พัฒนาอย่างชัดเจน ต่อมา Zhipu AI ซึ่งทำธุรกิจในต่างประเทศภายใต้ชื่อ Z.ai ยืนยันเมื่อวันที่ 26 สิงหาคมว่า Ox Alpha คือ GLM-5.3-Flash และอธิบายว่าการเปิดตัวแบบไม่ติดแบรนด์เป็นการทดสอบการใช้งานจริง ทั้งด้านการเขียนโค้ด มัลติโมดัล และเอเจนต์ 3
4
การเปิดเผยครั้งนี้เปลี่ยนปริศนาที่ถูกพูดถึงอยู่นานหนึ่งสัปดาห์ให้กลายเป็นการเปิดตัวโมเดลโอเพนเวตขนาดใหญ่ โดย GLM-5.3-Flash เป็นระบบ Mixture-of-Experts (MoE) ที่มีพารามิเตอร์รวม 320,000 ล้านตัว แต่เปิดใช้งานเพียง 18,000 ล้านตัวต่อโทเคน มีบริบทประมาณ 1 ล้านโทเคน รองรับอินพุตหลายรูปแบบ และเผยแพร่น้ำหนักภายใต้ MIT License 3
6
8
Ox Alpha เปิดให้ใช้งานโดยไม่มี Model Card ผู้ผลิต หรือเอกสารสเปกโดยละเอียด นักพัฒนาพบจุดให้บริการที่ใช้งานได้ฟรี รองรับบริบทขนาดยาวและอินพุตมัลติโมดัล จึงเริ่มนำไปทดลองกับการเขียนโค้ดและเวิร์กโฟลว์แบบเอเจนต์ ประสิทธิภาพที่ใช้งานได้จริงดึงดูดความสนใจมากพอให้เกิดการคาดเดาว่าโมเดลนี้มาจากแล็บใด 13
16
Zhipu ระบุว่าการทดสอบดังกล่าวตั้งใจปิดบังตัวตนของโมเดล บริษัทไม่เปิดเผยชื่อและสเปกเพื่อให้นักพัฒนาตัดสินจากผลลัพธ์จริง แทนที่จะได้รับอิทธิพลจากชื่อแบรนด์ จำนวนพารามิเตอร์ หรือการตลาดช่วงเปิดตัว ข้อมูลการใช้งานและความคิดเห็นที่ได้จากงานซอฟต์แวร์และงานเอเจนต์จริงจึงถูกนำมาใช้ก่อนการเปิดตัวอย่างเป็นทางการ 13
15
รายงานหลายแห่งระบุว่าในช่วงทดสอบมีขีดความสามารถให้ใช้งานฟรีราว 100 ล้านล้านโทเคนต่อวัน Patrick Collison ผู้ร่วมก่อตั้ง Stripe ก็เป็นหนึ่งในนักพัฒนาชื่อดังที่มีรายงานว่าแสดงความชื่นชมคุณภาพของโมเดล ปฏิกิริยาเหล่านี้ช่วยให้จุดให้บริการนิรนามกลายเป็นการเปิดตัวที่คนในวงการติดตามอย่างใกล้ชิด อย่างไรก็ตาม ความสนใจจากผู้ใช้งานยังไม่ใช่หลักฐานเทียบเท่าการประเมินแบบควบคุมตัวแปร 13
14
Zhipu ยังกล่าวว่าบริการดังกล่าวทำงานบนตัวเร่งความเร็ว AI ที่ผลิตในจีน โดย South China Morning Post รายงานว่าการทดลองใช้คลัสเตอร์ชิปจำนวน 100,000 ตัว และโมเดลประมวลผลไปแล้ว 62 ล้านล้านโทเคนก่อนเปิดตัวอย่างเป็นทางการ ตัวเลขด้านความจุและการใช้งานแตกต่างกันไปตามรายงาน จึงควรมองว่าเป็นตัวเลขที่บริษัทหรือสื่อรายงาน ไม่ใช่ค่าที่ผ่านการตรวจสอบโดยอิสระ 7
13
GLM-5.3-Flash ใช้สถาปัตยกรรม Mixture-of-Experts หรือ MoE มีพารามิเตอร์รวม 320,000 ล้านตัว แต่เปิดใช้งานเพียง 18,000 ล้านตัวต่อโทเคน แนวคิดนี้ช่วยให้โมเดลมีความสามารถในการแทนความรู้ระดับโมเดลขนาดใหญ่มาก โดยไม่ต้องประมวลผลพารามิเตอร์ทั้งหมดในทุกขั้นตอนของการอนุมาน 3
4
โมเดลมี 45 เลเยอร์ และเป็นโมเดลแรกในตระกูล GLM-5 ที่ Zhipu ระบุว่ารองรับมัลติโมดัลตั้งแต่ระดับสถาปัตยกรรม โดยทำงานกับข้อความ ภาพ วิดีโอ เอกสารภาพ ไฟล์ และอินพุตหลายรูปแบบที่สลับรวมกันได้ ความสามารถนี้เหมาะกับงานที่เอเจนต์ต้องดูหน้าจอ อ่านเอกสาร ตรวจภาพหน้าจอ หรือประเมินผลลัพธ์จากการรันโค้ด ไม่ใช่แค่ประมวลผลข้อความ 4
11
Zhipu ระบุว่ารองรับบริบทสูงสุด 1,048,576 โทเคน หรือมักเรียกโดยย่อว่าบริบท 1 ล้านโทเคน ความจุระดับนี้ออกแบบมาสำหรับคลังซอร์สโค้ดขนาดใหญ่ เซสชันเอเจนต์ที่ดำเนินต่อเนื่อง เอกสารจำนวนมาก และงานที่ผสานโค้ดเข้ากับภาพหรือไฟล์ 3
4
บริษัทระบุว่า GLM-5.3-Flash ได้รับการฝึกจากฐานโมเดลใหม่ พร้อมสถาปัตยกรรมและสูตรการฝึกที่ออกแบบขึ้นใหม่ โดยใช้ชุดข้อมูลมัลติโมดัลขนาด 30 ล้านล้านโทเคน ดังนั้นโมเดลนี้จึงถูกนำเสนอในฐานะโมเดลใหม่ที่เน้นประสิทธิภาพและความสามารถด้านมัลติโมดัล ไม่ใช่เพียงรุ่นย่อส่วนของ GLM-5.3 4
16
โมเดลผสาน Linear Attention เข้ากับ Sparse Attention โดย Linear Attention มีเป้าหมายช่วยให้การประมวลผลลำดับข้อความยาว ๆ ใช้ทรัพยากรน้อยลง ขณะที่ Sparse Attention จะเลือกเก็บความสัมพันธ์ที่ต้องการความละเอียดสูงกว่า วิธีนี้พยายามสร้างสมดุลระหว่างความสามารถด้านบริบทขนาดยาวกับต้นทุนการอนุมานที่จัดการได้ง่ายขึ้น 4
16
Zhipu ยังอธิบายถึงกลไก IndexPool ซึ่งช่วยลดภาระด้านหน่วยความจำและเวลาแฝงของการทำดัชนีเมื่อบริบทมีความยาวมาก นอกจากนี้ยังใช้ Manifold-Constrained Hyper-Connections เพื่อเพิ่มประสิทธิภาพในการขยายระบบ อย่างไรก็ตาม คุณค่าที่เกิดขึ้นจริงของเทคนิคเหล่านี้ขึ้นอยู่กับการตั้งค่าเซิร์ฟเวอร์ ความยาวของลำดับ ฮาร์ดแวร์ และลักษณะงานที่นำไปใช้ 4
16
เมื่อเทียบกับ GLM-5.3 ทาง Zhipu อ้างว่า GLM-5.3-Flash ลดการคำนวณ Attention ได้ 3.01 เท่า และลดการใช้ KV Cache ได้ 4.44 เท่า โดยยังคงคุณภาพในบริบทขนาดยาว ตัวเลขนี้มีความสำคัญต่อผู้พัฒนาเอเจนต์ เพราะการคำนวณ Attention และหน่วยความจำสำหรับ KV Cache มักเป็นคอขวดของงานที่ทำงานต่อเนื่องเป็นเวลานาน แต่สัดส่วนดังกล่าวมาจากเอกสารทางเทคนิคของ Zhipu เป็นหลัก จึงไม่ควรตีความว่าเป็นความเร็วที่เพิ่มขึ้นเท่ากันในทุกระบบหรือทุกเวิร์กโหลด 4
GLM-5.3-Flash มุ่งเน้นการเขียนโค้ด การเขียนโปรแกรมด้วยภาพ งานเอเจนต์ที่ต้องวางแผนหลายขั้นตอน และการใช้เครื่องมือ ความสามารถด้านภาพช่วยให้เอเจนต์สังเกตอินเทอร์เฟซ ผลการเรนเดอร์ และข้อมูลตอบกลับจากการโต้ตอบ จนเกิดวงจรการทำงานระหว่างโค้ด เบราว์เซอร์ และ GUI 4
ผลการทดสอบที่ Zhipu รายงานประกอบด้วย:
ตัวเลขเหล่านี้สนับสนุนการวางตำแหน่งโมเดลในด้านวิศวกรรมซอฟต์แวร์และเอเจนต์ แต่การเปรียบเทียบต้องทำอย่างระมัดระวัง เพราะผลทดสอบเอเจนต์อาจเปลี่ยนแปลงได้มากตามพรอมป์ต เครื่องมือ โครงสร้างช่วยเหลือ ฮาร์ดแวร์ เวลาที่จำกัด และเวอร์ชันของการประเมิน ตัวเลขดังกล่าวจึงควรอ่านว่าเป็นผลที่ Zhipu รายงาน ไม่ใช่การจัดอันดับที่ยืนยันความเหนือกว่าคู่แข่งทุกกรณี 4
15
Zhipu เผยแพร่น้ำหนักของ GLM-5.3-Flash บน Hugging Face ภายใต้ใบอนุญาต MIT ซึ่งเป็นใบอนุญาตแบบเปิดที่อนุญาตให้นำไปใช้ ดัดแปลง และเผยแพร่ต่อได้ภายใต้เงื่อนไขของใบอนุญาต รวมถึงมีรุ่น BF16 ให้ใช้งาน เอกสารของโมเดลระบุว่ารองรับเฟรมเวิร์กสำหรับให้บริการ เช่น SGLang และ vLLM ทำให้องค์กรมีทางเลือกในการรันภายในระบบหรือดูแลเซิร์ฟเวอร์เอง แทนที่จะพึ่งพา API ของ Z.ai เพียงช่องทางเดียว 3
6
8
ความเปิดกว้างนี้ทำให้นักพัฒนาสามารถทดสอบโมเดลกับคลังโค้ด เอกสาร อินเทอร์เฟซภาพ และสภาพแวดล้อมเอเจนต์ของตนเองได้โดยตรง ขณะเดียวกันทีมโครงสร้างพื้นฐานก็สามารถประเมินต้นทุนและข้อกำหนดด้านฮาร์ดแวร์ได้เอง แต่จำนวนพารามิเตอร์รวม 320,000 ล้านตัวยังคงทำให้การติดตั้งเป็นงานวิศวกรรมขนาดใหญ่ การเปิดใช้งานเพียง 18,000 ล้านตัวต่อโทเคนช่วยลดงานคำนวณ ไม่ได้หมายความว่าไฟล์โมเดลทั้งชุดจะมีขนาดเล็กหรือรันได้ง่ายบนฮาร์ดแวร์ทั่วไปโดยอัตโนมัติ
การทดลอง Ox Alpha ไม่ได้เป็นเพียงแคมเปญสร้างกระแส แต่เป็นการทดสอบว่าผู้พัฒนาจะยังเลือกใช้โมเดลหรือไม่เมื่อไม่รู้ชื่อ จำนวนพารามิเตอร์ และบริษัทเจ้าของ วิธีนี้ทำให้ Zhipu ได้รับข้อมูลจากงานจริงและความเห็นจากผู้ใช้ก่อนเปิดตัวอย่างเป็นทางการ 13
15
อย่างไรก็ดี การทดลองมีข้อจำกัดชัดเจน การเปิดให้ใช้ฟรีอาจดึงดูดการใช้งานในปริมาณสูงผิดปกติ คำชื่นชมในช่วงแรกอาจได้รับอิทธิพลจากความใหม่ของโมเดล และการทดสอบแบบไม่เปิดเผยชื่อไม่ได้ควบคุมพรอมป์ตหรือทำให้ทุกระบบอยู่ภายใต้เงื่อนไขเดียวกัน
ข้อสรุปที่รอบคอบที่สุดจึงอยู่ที่ว่า GLM-5.3-Flash สามารถดึงดูดความสนใจจากนักพัฒนาได้มากตั้งแต่ยังไม่เปิดเผยตัวตน และ Zhipu นำข้อมูลจากการใช้งานจริงเหล่านั้นมาใช้ยืนยันและขัดเกลาเรื่องราวการเปิดตัว ส่วนการพิสูจน์ว่าโมเดลทำงานได้ดีเพียงใดในสภาพแวดล้อมการผลิต ยังต้องอาศัยการทดสอบอิสระที่ทำซ้ำได้
GLM-5.3-Flash คือชื่อจริงของ Ox Alpha โมเดล GLM แบบโอเพนเวตที่รองรับมัลติโมดัลตั้งแต่ต้น และออกแบบมาสำหรับงานเขียนโค้ดและเอเจนต์ที่ต้องทำงานต่อเนื่อง จุดเด่นสำคัญคือสถาปัตยกรรม MoE ขนาด 320B-A18B จำนวน 45 เลเยอร์ บริบท 1 ล้านโทเคน การผสาน Linear Attention กับ Sparse Attention และน้ำหนักที่เผยแพร่ภายใต้ MIT License 3
4
11
สิ่งที่น่าจับตาที่สุดไม่ใช่แค่ขนาดโมเดล แต่คือการรวมบริบทขนาดยาว อินพุตภาพ การใช้เครื่องมือ และต้นทุนการให้บริการที่ Zhipu อ้างว่าลดลงไว้ในโมเดลที่นักพัฒนาสามารถดาวน์โหลดและนำไปติดตั้งเองได้ การเปิดตัวแบบปิดบังชื่อให้ข้อมูลตอบรับจากผู้ใช้จริงอย่างน่าสนใจ แต่ยังไม่อาจทดแทนการประเมินอิสระเพื่อยืนยันประสิทธิภาพและข้ออ้างด้านสถาปัตยกรรมทั้งหมด
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Ox Alpha คือ GLM 5.3 Flash ของ Zhipu AI หรือ Z.ai ซึ่งเปิดทดสอบแบบไม่เปิดเผยตัวตนเมื่อวันที่ 20 สิงหาคม 2026 ก่อนยืนยันชื่อโมเดลในวันที่ 26 สิงหาคม
Ox Alpha คือ GLM 5.3 Flash ของ Zhipu AI หรือ Z.ai ซึ่งเปิดทดสอบแบบไม่เปิดเผยตัวตนเมื่อวันที่ 20 สิงหาคม 2026 ก่อนยืนยันชื่อโมเดลในวันที่ 26 สิงหาคม โมเดลนี้เน้นงานเขียนโค้ด โปรแกรมที่ทำงานกับภาพและหน้าจอ งานระยะยาวของเอเจนต์ และการใช้เครื่องมือ โดยมีบริบท 1,048,576 โทเคน รองรับข้อความ ภาพ วิดีโอ และไฟล์ พร้อมเปิดน้ำหนักภายใต้ MIT License
Zhipu ระบุว่าสถาปัตยกรรม Attention แบบผสมระหว่าง Linear และ Sparse ช่วยลดการคำนวณ Attention 3.01 เท่า และลดการใช้ KV Cache 4.44 เท่าเมื่อเทียบกับ GLM 5.3 แต่ยังต้องรอการทดสอบอิสระเพื่อยืนยันผลในงานประเภทต่าง ๆ