Dalam ujian ExploitBench terkawal oleh Anthropic, GLM 5.3 menghasilkan eksploit berfungsi dalam 50 daripada 410 percubaan, berbanding 56 bagi Claude Mythos Preview. Anthropic mendapati kaedah ringkas berjaya memintas perlindungan GLM 5.3 dalam 64% hingga 100% ujian simulasi—angka yang tidak mengukur kebarangkalian s...
Diterbitkan olehDisunting dengan GPT-6 LunaImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s September 2026 analysis find about Z.ai’s open-weight GLM-5.3 model’s ability to build cyber exploits compared with Cla. Article summary: Anthropic’s September 2026 analysis found that Z.ai’s downloadable GLM-5.3 could autonomously build working, end-to-end exploits at nearly the rate of Claude Mythos Preview on one test—a capability Anthropic had previous. Topic tags: general, general web, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake n
Penilaian Anthropic pada September 2026 mendapati GLM-5.3, model dengan pemberat terbuka daripada Z.ai, boleh membina eksploit hujung ke hujung yang berfungsi pada kadar hampir dengan Claude Mythos Preview dalam satu penanda aras. Namun, laporan sama menyatakan kaedah mudah sering berjaya memintas perlindungan GLM-5.3 dalam simulasi. Dapatan ini menimbulkan persoalan tentang sejauh mana keupayaan siber canggih patut disediakan secara meluas—tetapi ia ialah hasil ujian terkawal, bukannya bukti serangan berjaya terhadap sasaran sebenar. 12
Dalam penilaian ExploitBench oleh Anthropic, GLM-5.3 menghasilkan eksploit berfungsi dalam 50 daripada 410 percubaan; Claude Mythos Preview berjaya dalam 56 percubaan. Ini bersamaan kira-kira 12% berbanding 14% dalam ujian tersebut. Penanda aras itu menguji pembangunan eksploit terhadap kelemahan yang sudah diketahui dalam persekitaran terkawal. Oleh itu, keputusan yang hampir sama ini tidak membuktikan kedua-dua model setara dalam semua tugasan keselamatan siber. 5
12
Anthropic menyifatkan keupayaan GLM-5.3 membina eksploit hujung ke hujung sebagai kemajuan besar berbanding model terdahulu. Dalam penilaian berasingan bagi eksploit binari, laporan itu mendapati GLM-5.3 berjaya melakukan rampasan aliran kawalan sepenuhnya dalam 4% tugasan, berbanding 6% bagi Mythos Preview. Angka ini menunjukkan prestasi yang kukuh dalam ujian tertentu, bukan kesetaraan menyeluruh. 3
7
12
Pusat Piawaian dan Inovasi AI (CAISI) di bawah NIST menyifatkan GLM-5.3 sebagai model dengan pemberat terbuka paling berkebolehan dalam keselamatan siber yang pernah dinilainya. Namun, berdasarkan gabungan penanda aras sibernya, NIST menganggarkan model itu ketinggalan kira-kira empat bulan berbanding model termaju semasa di AS. 17
Penilaian itu tidak semestinya bercanggah dengan keputusan hampir setara Mythos yang dilaporkan Anthropic. NIST membandingkan GLM-5.3 merentas koleksi penanda aras yang lebih luas, manakala perbandingan utama Anthropic tertumpu pada satu ujian khusus terhadap Mythos Preview. Ujian dan kumpulan perbandingan yang berbeza boleh menghasilkan kesimpulan berbeza yang tetap serasi. 12
17
Anthropic melaporkan bahawa teknik ringkas memintas perlindungan GLM-5.3 dalam 64% hingga 100% ujian simulasi yang dijalankan. Peratusan ini merujuk kepada hasil daripada arahan dan kaedah yang diuji—bukan kebarangkalian penyerang akan berjaya dalam operasi dunia sebenar. 12
Laporan itu turut mengetengahkan cabaran berasingan berkaitan pemberat terbuka: pengguna yang memperoleh pemberat model mungkin boleh mengubah tingkah laku penolakannya, bukan sekadar mencari jalan untuk mengelak penolakan melalui arahan. Satu laporan sekunder mengenai eksperimen tersebut menganggarkan kos membuang perlindungan sekitar AS$1,200 bagi pasukan berpengalaman, selain menyebut anggaran pengiraan kira-kira AS$4,400. Angka itu datang daripada penerangan berbeza tentang usaha yang diperlukan; ia bukan harga tetap atau ukuran tentang kekerapan penyerang sebenar akan berbuat demikian. 12
25
Dalam satu ujian yang dilaporkan, seorang penyelidik menggunakan GLM-5.3-Flash, versi lebih kecil model itu, untuk membina rantaian eksploit bagi dua kelemahan yang sudah didedahkan. Menurut laporan tersebut, kerja itu memerlukan kira-kira 20 minit perhatian manusia, lapan jam kerja model dan caj API sebanyak AS$20.40. Salah satu kelemahan itu melibatkan Chrome, dan penyelidik membekalkan maklumat awam tentang kelemahan yang diketahui berkenaan. Demonstrasi ini menunjukkan model boleh membantu membangunkan rantaian eksploit terhadap kelemahan yang sudah didedahkan dalam ujian—bukan bahawa mangsa sebenar telah digodam. 6
Perbezaan itu penting. Keupayaan model menghasilkan eksploit dalam keadaan ujian memberi amaran tentang kemungkinan penyalahgunaan, tetapi tidak sama dengan bukti serangan yang berlaku di alam nyata. Laporan yang dirujuk di sini tidak membuktikan GLM-5.3 digunakan untuk menceroboh sasaran sebenar. 5
6
Kebimbangan Anthropic ialah keupayaan membina eksploit yang tersedia secara meluas boleh digunakan oleh penyerang dan juga pihak pertahanan. Syarikat itu turut menyokong akses kepada model canggih untuk membantu pasukan pertahanan mencari dan membaiki kelemahan. 1
12
Pemberat terbuka membawa pertimbangan yang rumit: ia boleh memberi penyelidik bebas dan pasukan pertahanan akses kepada keupayaan model, tetapi pada masa sama membolehkan pengguna menjalankan atau mengubah suai model di luar kawalan pembangunnya. Keputusan penanda aras dan ujian perlindungan ini membantu menjelaskan perdebatan tersebut, tetapi tidak dengan sendirinya membuktikan sama ada mengehadkan akses akan menjadikan keselamatan siber lebih baik secara keseluruhan. 4
12
Kesimpulan paling tepat adalah lebih terhad: dalam penilaian Anthropic, GLM-5.3 menghampiri Mythos Preview pada satu penanda aras eksploit, dan perlindungannya terdedah kepada kaedah pintasan yang diuji. Penilaian NIST yang lebih luas masih meletakkan GLM-5.3 di belakang model termaju semasa di AS, manakala demonstrasi yang dilaporkan bukanlah serangan langsung terhadap sasaran sebenar. 12
17
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Dalam ujian ExploitBench terkawal oleh Anthropic, GLM 5.3 menghasilkan eksploit berfungsi dalam 50 daripada 410 percubaan, berbanding 56 bagi Claude Mythos Preview.
Dalam ujian ExploitBench terkawal oleh Anthropic, GLM 5.3 menghasilkan eksploit berfungsi dalam 50 daripada 410 percubaan, berbanding 56 bagi Claude Mythos Preview. Anthropic mendapati kaedah ringkas berjaya memintas perlindungan GLM 5.3 dalam 64% hingga 100% ujian simulasi—angka yang tidak mengukur kebarangkalian serangan berjaya di dunia sebenar.
NIST menyifatkan GLM 5.3 sebagai model dengan pemberat terbuka paling berkebolehan dalam keselamatan siber yang dinilainya, tetapi meletakkannya kira kira empat bulan di belakang model termaju AS dalam penilaian lebih...