ในการทดสอบ ExploitBench ของ Anthropic GLM 5.3 สร้างเอ็กซ์พลอยต์ที่ใช้งานได้ 50 จาก 410 ครั้ง ส่วน Claude Mythos Preview ทำได้ 56 ครั้ง [5][12] Anthropic ระบุว่าวิธีง่าย ๆ เลี่ยงมาตรการป้องกันของ GLM 5.3 ได้ 64%–100% ในการทดสอบจำลอง ตัวเลขนี้ไม่ใช่อัตราความสำเร็จของการโจมตีจริง [12] NIST จัด GLM 5.3 เป็นโมเดลแบบเปิดน...
เผยแพร่โดยแก้ไขด้วย GPT-6 Lunaรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s September 2026 analysis find about Z.ai’s open-weight GLM-5.3 model’s ability to build cyber exploits compared with Cla. Article summary: Anthropic’s September 2026 analysis found that Z.ai’s downloadable GLM-5.3 could autonomously build working, end-to-end exploits at nearly the rate of Claude Mythos Preview on one test—a capability Anthropic had previous. Topic tags: general, general web, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake n
ผลประเมินของ Anthropic ในเดือนกันยายน 2026 พบว่า GLM-5.3 ของ Z.ai สร้างเอ็กซ์พลอยต์แบบครบขั้นตอนที่ใช้งานได้ ใกล้เคียงกับ Claude Mythos Preview ในการทดสอบหนึ่งรายการ อย่างไรก็ตาม รายงานเดียวกันระบุว่าวิธีพื้นฐานสามารถเลี่ยงมาตรการป้องกันของ GLM-5.3 ได้บ่อยในการจำลอง ผลเหล่านี้จึงชวนให้ตั้งคำถามว่าโมเดลที่มีความสามารถด้านไซเบอร์สูงควรเปิดให้ใช้งานกว้างขวางเพียงใด แต่เป็นผลจากการทดสอบแบบควบคุม ไม่ใช่หลักฐานว่ามีการโจมตีเป้าหมายจริงสำเร็จ 12
ใน ExploitBench ของ Anthropic GLM-5.3 สร้างเอ็กซ์พลอยต์ที่ใช้งานได้ 50 ครั้งจากความพยายามทั้งหมด 410 ครั้ง ส่วน Claude Mythos Preview ทำได้ 56 ครั้ง หรือประมาณ 12% เทียบกับ 14% ในการทดสอบนี้ เกณฑ์ดังกล่าววัดความสามารถในการพัฒนาเอ็กซ์พลอยต์ต่อช่องโหว่ที่รู้จักแล้ว ภายใต้สภาพแวดล้อมควบคุม คะแนนที่ใกล้กันจึงไม่ได้แปลว่าโมเดลทั้งสองมีความสามารถเท่ากันในงานด้านความปลอดภัยไซเบอร์ทุกประเภท 5
12
Anthropic มองว่าความสามารถในการสร้างเอ็กซ์พลอยต์ตั้งแต่ต้นจนจบของ GLM-5.3 พัฒนาขึ้นอย่างมากเมื่อเทียบกับโมเดลรุ่นก่อน รายงานยังเปรียบเทียบโมเดลทั้งสองในการทดสอบอีกชุดหนึ่งที่วัดการยึดการควบคุมลำดับการทำงานของโปรแกรม โดย GLM-5.3 ทำได้ 4% เทียบกับ Mythos Preview ที่ 6% ผลเหล่านี้ชี้ถึงความสามารถสูงในงานทดสอบบางแบบ ไม่ใช่ความเท่าเทียมในทุกด้าน 3
7
12
ศูนย์มาตรฐานและนวัตกรรมด้านปัญญาประดิษฐ์ของ NIST หรือ CAISI ระบุว่า GLM-5.3 เป็นโมเดลแบบเปิดน้ำหนักที่มีความสามารถด้านไซเบอร์สูงที่สุดเท่าที่ศูนย์ประเมินมา แต่เมื่อดูผลรวมจากเกณฑ์ทดสอบด้านไซเบอร์หลายรายการ โมเดลนี้ยังตามหลังโมเดลแนวหน้าของสหรัฐฯ ในปัจจุบันอยู่ราวสี่เดือน 17
ข้อสรุปนี้ไม่ได้ขัดกับผลที่ GLM-5.3 ทำคะแนนไล่เลี่ยง Mythos Preview ในการทดสอบของ Anthropic โดยตรง เพราะ NIST ประเมินจากชุดทดสอบที่กว้างกว่า ส่วนตัวเลขที่ถูกพูดถึงมากของ Anthropic มาจากการทดสอบเฉพาะรายการหนึ่งและเทียบกับ Mythos Preview การใช้เกณฑ์และกลุ่มเปรียบเทียบต่างกันจึงให้ข้อสรุปที่ต่างกันได้ โดยไม่จำเป็นต้องขัดแย้งกัน 12
17
Anthropic รายงานว่าวิธีง่าย ๆ สามารถเลี่ยงมาตรการป้องกันของ GLM-5.3 ได้ในสัดส่วน 64%–100% ของการทดสอบจำลองที่นำมาประเมิน ตัวเลขนี้สะท้อนผลจากคำสั่งและวิธีที่ใช้ในการทดสอบ ไม่ใช่ความน่าจะเป็นที่ผู้โจมตีจะทำภารกิจจริงสำเร็จ 12
รายงานยังชี้ถึงประเด็นเฉพาะของโมเดลแบบเปิดน้ำหนักด้วย ผู้ที่เข้าถึงน้ำหนักของโมเดลอาจปรับเปลี่ยนพฤติกรรมการปฏิเสธคำขอได้ ไม่ใช่แค่พยายามหลอกระบบผ่านคำสั่งเท่านั้น แหล่งข่าวหนึ่งที่สรุปการทดลองของ Anthropic ประเมินว่าทีมที่มีประสบการณ์อาจลบมาตรการป้องกันได้ด้วยค่าใช้จ่ายราว 1,200 ดอลลาร์ ขณะที่ยังระบุค่าใช้จ่ายด้านการประมวลผลประมาณ 4,400 ดอลลาร์ ตัวเลขทั้งสองเป็นค่าประมาณจากการอธิบายความพยายามคนละแบบ ไม่ใช่ราคาตายตัวหรือการประเมินว่าผู้โจมตีจริงจะทำได้บ่อยเพียงใด 12
25
ในการทดลองหนึ่ง นักวิจัยใช้ GLM-5.3-Flash ซึ่งเป็นรุ่นขนาดเล็กกว่า เพื่อสร้างห่วงโซ่เอ็กซ์พลอยต์จากช่องโหว่ที่เปิดเผยแล้วสองรายการ รายงานระบุว่าใช้เวลาที่มนุษย์ต้องคอยดูแลประมาณ 20 นาที โมเดลทำงานรวมราว 8 ชั่วโมง และมีค่าใช้ API 20.40 ดอลลาร์ หนึ่งในช่องโหว่เกี่ยวข้องกับ Chrome โดยนักวิจัยป้อนข้อมูลสาธารณะเกี่ยวกับช่องโหว่ที่ทราบแล้วให้โมเดล 6
การทดลองนี้แสดงให้เห็นว่าโมเดลช่วยพัฒนาห่วงโซ่เอ็กซ์พลอยต์ต่อช่องโหว่ที่เปิดเผยแล้วในสภาพการทดสอบได้ แต่ไม่ได้แสดงว่ามีการเจาะระบบของเหยื่อที่ใช้งานจริง ความสามารถในการสร้างเอ็กซ์พลอยต์ภายใต้เงื่อนไขทดสอบเป็นสัญญาณเตือนเรื่องความเสี่ยงจากการนำไปใช้ผิดทาง ทว่าไม่ใช่หลักฐานเดียวกับการโจมตีที่เกิดขึ้นจริง 5
6
Anthropic กังวลว่าความสามารถในการสร้างเอ็กซ์พลอยต์ที่เข้าถึงได้อย่างกว้างขวางอาจถูกใช้ได้ทั้งโดยผู้โจมตีและผู้ป้องกัน บริษัทก็สนับสนุนให้ผู้ป้องกันเข้าถึงโมเดลขั้นสูง เพื่อช่วยค้นหาและแก้ไขช่องโหว่เช่นกัน 1
12
การเปิดน้ำหนักทำให้เกิดข้อแลกเปลี่ยนที่ซับซ้อน: นักวิจัยอิสระและทีมป้องกันสามารถนำโมเดลไปใช้ได้ ขณะเดียวกัน ผู้ใช้ก็มีอิสระมากขึ้นในการรันหรือปรับเปลี่ยนโมเดลนอกเหนือการควบคุมของผู้พัฒนา ผลทดสอบด้านความสามารถและมาตรการป้องกันเป็นข้อมูลสำคัญต่อการถกเถียงนี้ แต่ยังไม่เพียงพอที่จะสรุปด้วยตัวเองว่าการจำกัดการเข้าถึงจะทำให้ความปลอดภัยไซเบอร์โดยรวมดีขึ้นหรือไม่ 4
12
ข้อสรุปที่ชัดที่สุดยังอยู่ในขอบเขตจำกัด: ในการประเมินของ Anthropic GLM-5.3 ทำคะแนนใกล้ Mythos Preview ในการทดสอบเอ็กซ์พลอยต์หนึ่งรายการ และมาตรการป้องกันของมันถูกเลี่ยงได้ด้วยวิธีที่นำมาทดลอง ส่วนการประเมินภาพรวมของ NIST ยังจัดให้ GLM-5.3 ตามหลังโมเดลแนวหน้าของสหรัฐฯ ในปัจจุบัน และตัวอย่างที่รายงานเป็นการทดสอบ ไม่ใช่การโจมตีเป้าหมายจริง 12
17
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
ในการทดสอบ ExploitBench ของ Anthropic GLM 5.3 สร้างเอ็กซ์พลอยต์ที่ใช้งานได้ 50 จาก 410 ครั้ง ส่วน Claude Mythos Preview ทำได้ 56 ครั้ง [5][12]
ในการทดสอบ ExploitBench ของ Anthropic GLM 5.3 สร้างเอ็กซ์พลอยต์ที่ใช้งานได้ 50 จาก 410 ครั้ง ส่วน Claude Mythos Preview ทำได้ 56 ครั้ง [5][12] Anthropic ระบุว่าวิธีง่าย ๆ เลี่ยงมาตรการป้องกันของ GLM 5.3 ได้ 64%–100% ในการทดสอบจำลอง ตัวเลขนี้ไม่ใช่อัตราความสำเร็จของการโจมตีจริง [12]
NIST จัด GLM 5.3 เป็นโมเดลแบบเปิดน้ำหนักที่มีความสามารถด้านไซเบอร์สูงที่สุดเท่าที่ประเมิน แต่ยังตามหลังโมเดลแนวหน้าของสหรัฐฯ ราวสี่เดือน เมื่อดูผลรวมจากหลายเกณฑ์ทดสอบ [17]