In Anthropic’s gecontroleerde ExploitBench test leverde GLM 5.3 50 werkende exploits op uit 410 pogingen, tegenover 56 voor Claude Mythos Preview. Eenvoudige methoden omzeilden de beveiliging van GLM 5.3 in 64 tot 100 procent van de gesimuleerde tests; dat percentage is geen voorspelling van succes bij echte aanvallen.
Gepubliceerd doorBewerkt met GPT-6 LunaAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s September 2026 analysis find about Z.ai’s open-weight GLM-5.3 model’s ability to build cyber exploits compared with Cla. Article summary: Anthropic’s September 2026 analysis found that Z.ai’s downloadable GLM-5.3 could autonomously build working, end-to-end exploits at nearly the rate of Claude Mythos Preview on one test—a capability Anthropic had previous. Topic tags: general, general web, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake n
Anthropic meldde in september 2026 dat het open-gewichtmodel GLM-5.3 van Z.ai in één test bijna even vaak werkende, complete exploits bouwde als Claude Mythos Preview. Tegelijkertijd bleken eenvoudige methoden de beveiligingsmaatregelen van GLM-5.3 in simulaties vaak te omzeilen. Dat roept vragen op over de verspreiding van krachtige cybermogelijkheden, maar de resultaten zijn afkomstig uit gecontroleerde tests: ze bewijzen niet dat het model met succes echte doelwitten heeft aangevallen. 12
In Anthropic’s ExploitBench-test bouwde GLM-5.3 in 50 van de 410 pogingen een werkende exploit. Claude Mythos Preview slaagde daarin 56 keer. Dat komt neer op ongeveer 12 procent tegenover 14 procent. De benchmark testte het ontwikkelen van exploits voor bekende kwetsbaarheden in een afgeschermde omgeving. De bijna gelijke score geldt dus voor deze specifieke test, niet automatisch voor alle taken op het gebied van cyberbeveiliging. 5
12
Anthropic omschreef het vermogen van GLM-5.3 om complete exploits op te bouwen als een flinke stap vooruit ten opzichte van eerdere modellen. Op een afzonderlijke test rond binaire exploitatie lukte het model in 4 procent van de taken om de control flow volledig over te nemen; bij Mythos Preview was dat 6 procent. Ook die uitkomst wijst op sterke prestaties op specifieke tests, niet op algemene gelijkwaardigheid. 3
7
12
Het Center for AI Standards and Innovation (CAISI), onderdeel van het Amerikaanse National Institute of Standards and Technology (NIST), noemde GLM-5.3 het meest cybercapabele open-gewichtmodel dat het had beoordeeld. Tegelijkertijd plaatste CAISI het model op basis van een samengestelde score van zijn cyberbenchmarks ongeveer vier maanden achter de huidige Amerikaanse topmodellen. 17
Dat spreekt Anthropic’s vergelijking met Mythos Preview niet noodzakelijk tegen. NIST beoordeelde GLM-5.3 op een bredere verzameling benchmarks; Anthropic’s opvallende vergelijking ging over één specifieke test. Andere tests en vergelijkingsgroepen kunnen tot verschillende, maar verenigbare conclusies leiden. 12
17
Volgens Anthropic omzeilden eenvoudige technieken de beveiligingsmaatregelen van GLM-5.3 in 64 tot 100 procent van de gesimuleerde tests. Die percentages beschrijven de uitkomsten van de geteste prompts en methoden. Ze betekenen niet dat een aanvaller in de echte wereld evenveel kans heeft om te slagen. 12
Open gewichten brengen daarnaast een ander risico met zich mee. Wie toegang heeft tot de modelgewichten, kan mogelijk het weigeringsgedrag van het model aanpassen, in plaats van alleen proberen de beveiliging via prompts te omzeilen. Een tweede beschrijving van Anthropic’s experiment schatte dat een ervaren team de beveiliging voor ongeveer 1.200 dollar zou kunnen verwijderen. Die bron noemde ook een rekenkrachtinschatting van circa 4.400 dollar. Het gaat om verschillende schattingen van de benodigde inspanning, niet om een vaste prijs of een maatstaf voor hoe vaak aanvallers dit in de praktijk doen. 12
25
In een beschreven oefening gebruikte een onderzoeker de kleinere variant GLM-5.3-Flash om een exploitketen te bouwen voor twee al openbaar gemaakte kwetsbaarheden. Volgens het verslag vergde dit ongeveer twintig minuten menselijke aandacht, acht uur werk van het model en 20,40 dollar aan API-kosten. Een van de kwetsbaarheden zat in Chrome; de onderzoeker gaf het model openbare informatie over de bekende kwetsbaarheden. Dit toont aan dat het model in een test kon helpen een keten voor bekende kwetsbaarheden te ontwikkelen — niet dat een echt slachtoffer werd gehackt. 6
Dat onderscheid is belangrijk. Een model dat onder testomstandigheden een exploit kan produceren, is een mogelijk waarschuwingssignaal voor misbruik, maar dat is iets anders dan een aanval die daadwerkelijk in het wild is uitgevoerd. De beschikbare berichtgeving toont niet aan dat GLM-5.3 is gebruikt om een echt doelwit binnen te dringen. 5
6
Anthropic waarschuwt dat breed beschikbare mogelijkheden om exploits te bouwen zowel aanvallers als verdedigers kunnen helpen. Het bedrijf heeft ook gepleit voor toegang tot geavanceerde modellen voor verdedigers, zodat zij kwetsbaarheden kunnen opsporen en verhelpen. 1
12
Open gewichten maken het mogelijk dat onafhankelijke onderzoekers en verdedigers een model zelf gebruiken. Tegelijkertijd kunnen gebruikers het model buiten de controles van de ontwikkelaar draaien of aanpassen. De benchmark- en beveiligingstests zijn relevant voor dat debat, maar bewijzen op zichzelf niet dat toegangsbeperkingen de cyberveiligheid per saldo zouden verbeteren. 4
12
De zorgvuldigste conclusie is dan ook beperkt: in Anthropic’s evaluatie kwam GLM-5.3 dicht bij Mythos Preview op één exploittest, en bleken de beveiligingsmaatregelen kwetsbaar voor de geteste omzeilmethoden. In NIST’s bredere beoordeling bleef het model achter op de huidige Amerikaanse topmodellen, en de beschreven demonstraties waren geen aanvallen op live doelwitten. 12
17
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
In Anthropic’s gecontroleerde ExploitBench test leverde GLM 5.3 50 werkende exploits op uit 410 pogingen, tegenover 56 voor Claude Mythos Preview.
In Anthropic’s gecontroleerde ExploitBench test leverde GLM 5.3 50 werkende exploits op uit 410 pogingen, tegenover 56 voor Claude Mythos Preview. Eenvoudige methoden omzeilden de beveiliging van GLM 5.3 in 64 tot 100 procent van de gesimuleerde tests; dat percentage is geen voorspelling van succes bij echte aanvallen.
NIST noemde GLM 5.3 het meest cybercapabele open gewichtmodel dat het had beoordeeld, maar plaatste het op een bredere reeks tests ongeveer vier maanden achter de huidige Amerikaanse topmodellen.