GLM 5.3 lyckades skapa fungerande exploateringar i 50 av 410 försök i Anthropics ExploitBench test, jämfört med 56 för Claude Mythos Preview. En separat utvärdering av binär exploatering gav full kontrollflödeskapning i 4 procent av uppgifterna för GLM 5.3 och 6 procent för Mythos Preview.
Publicerad avRedigerad med GPT-6 LunaBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s September 2026 analysis find about Z.ai’s open-weight GLM-5.3 model’s ability to build cyber exploits compared with Cla. Article summary: Anthropic’s September 2026 analysis found that Z.ai’s downloadable GLM-5.3 could autonomously build working, end-to-end exploits at nearly the rate of Claude Mythos Preview on one test—a capability Anthropic had previous. Topic tags: general, general web, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake n
Z.ai:s modell GLM-5.3 kom nära Claude Mythos Preview i ett test av förmågan att bygga fungerande cyberexploateringar. Men samma utvärdering från Anthropic pekade på en tydlig svaghet: enkla metoder kunde ofta kringgå modellens skydd i simuleringar. Resultaten gäller kontrollerade tester – de visar inte att modellen användes för att angripa ett verkligt mål. 12
I Anthropics ExploitBench-test skapade GLM-5.3 fungerande exploateringar i 50 av 410 försök. Claude Mythos Preview lyckades i 56. Det motsvarar ungefär 12 respektive 14 procent i just det här testet. Benchmarken prövade om modeller kunde utveckla exploateringar mot kända sårbarheter i en kontrollerad miljö. Resultaten säger därför inte att modellerna presterar likvärdigt inom cybersäkerhet i stort. 5
12
Anthropic beskriver GLM-5.3:s förmåga att bygga exploateringar från början till slut som ett betydande steg jämfört med tidigare modeller. I ett separat test av binär exploatering lyckades GLM-5.3 åstadkomma fullständig kapning av kontrollflödet i 4 procent av uppgifterna, mot 6 procent för Mythos Preview. Även det är en jämförelse på specifika testuppgifter – inte ett belägg för att systemen är likvärdiga i alla sammanhang. 3
7
12
NIST:s Center for AI Standards and Innovation (CAISI) kallade GLM-5.3 den mest cyberkapabla modellen med öppna vikter som centret hade utvärderat. Samtidigt bedömde CAISI att modellen låg omkring fyra månader efter de nuvarande amerikanska frontmodellerna, räknat på ett samlat resultat från centrets cyberbenchmarktester. 17
Det står inte nödvändigtvis i konflikt med Anthropics jämförelse. NIST tittade på flera olika test, medan Anthropics uppmärksammade jämförelse gällde ett särskilt test mot Mythos Preview. Testernas uppgifter och jämförelsegrupper skiljer sig åt. 12
17
Anthropic uppger att enkla tekniker kringgick GLM-5.3:s skydd i 64–100 procent av företagets simulerade tester. Procentsiffrorna beskriver utfallet för de metoder och frågor som prövades. De är inte ett mått på hur ofta en angripare skulle lyckas genomföra en verklig attack. 12
Öppna vikter innebär dessutom att användare som får tillgång till modellens parametrar kan ändra dess beteende, inte bara försöka formulera frågor som går runt skydden. En andrahandsredogörelse för försöket anger en uppskattad kostnad på omkring 1 200 dollar för ett erfaret team att ta bort skydden. Samma redogörelse nämner också en beräkning på cirka 4 400 dollar i datorkraft. Det rör sig om uppskattningar med olika beskrivningar av arbetsinsatsen – inte ett fast pris eller ett mått på hur vanligt ett sådant ingrepp är i verkligheten. 12
25
I ett rapporterat försök använde en forskare den mindre modellen GLM-5.3-Flash för att bygga en exploateringskedja för två sårbarheter som redan hade offentliggjorts. Enligt rapporten krävdes omkring 20 minuters mänsklig uppmärksamhet och åtta timmars modellarbete. API-kostnaden var 20,40 dollar. En av sårbarheterna gällde Chrome, och forskaren försåg modellen med offentlig information om de kända felen. 6
Demonstrationen visar att modellen kunde bidra till att bygga en kedja mot offentliggjorda sårbarheter i ett test. Den visar inte att en verklig användare eller organisation utsattes för intrång. Den skillnaden är central: en förmåga som väcker oro i en kontrollerad miljö är inte samma sak som en dokumenterad attack i skarpt läge. 5
6
Anthropic varnar för att kraftfulla verktyg för att ta fram exploateringar kan användas av angripare såväl som av försvarare. Företaget har också argumenterat för att försvarare behöver tillgång till avancerade modeller för att hitta och åtgärda sårbarheter. 1
12
Modeller med öppna vikter innebär en avvägning. Tillgången kan hjälpa oberoende forskare och säkerhetsteam, men den gör det också möjligt för användare att köra eller ändra modellen utanför utvecklarens kontroll. Testresultaten bidrar till diskussionen, men räcker inte i sig för att avgöra om begränsad tillgång skulle göra cybersäkerheten tryggare totalt sett. 4
12
Den mest precisa slutsatsen är därför avgränsad: i Anthropics utvärdering låg GLM-5.3 nära Mythos Preview i ett exploit-test, och testade metoder kunde ofta kringgå modellens skydd. NIST:s bredare bedömning placerade samtidigt GLM-5.3 bakom dagens amerikanska frontmodeller. De redovisade demonstrationerna var inte verkliga angrepp mot levande mål. 12
17
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
GLM 5.3 lyckades skapa fungerande exploateringar i 50 av 410 försök i Anthropics ExploitBench test, jämfört med 56 för Claude Mythos Preview.
GLM 5.3 lyckades skapa fungerande exploateringar i 50 av 410 försök i Anthropics ExploitBench test, jämfört med 56 för Claude Mythos Preview. En separat utvärdering av binär exploatering gav full kontrollflödeskapning i 4 procent av uppgifterna för GLM 5.3 och 6 procent för Mythos Preview.
Enligt Anthropic kringgicks modellens skydd i 64–100 procent av de testade simuleringarna – siffror som inte mäter sannolikheten för en lyckad attack i verkligheten.