GLM 5.3 byggede fungerende exploits i 50 af 410 forsøg på Anthropics ExploitBench test; Claude Mythos Preview gjorde det i 56. Simple metoder omgåede GLM 5.3’s sikkerhedsforanstaltninger i 64–100 procent af Anthropics simulerede test.
Udgivet afRedigeret med GPT-6 LunaBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s September 2026 analysis find about Z.ai’s open-weight GLM-5.3 model’s ability to build cyber exploits compared with Cla. Article summary: Anthropic’s September 2026 analysis found that Z.ai’s downloadable GLM-5.3 could autonomously build working, end-to-end exploits at nearly the rate of Claude Mythos Preview on one test—a capability Anthropic had previous. Topic tags: general, general web, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake n
Anthropics evaluering fra september 2026 viste, at Z.ai’s open-weight-model GLM-5.3 kunne bygge fungerende exploits næsten lige så ofte som Claude Mythos Preview på én bestemt test. Samtidig kunne simple metoder ofte omgå GLM-5.3’s sikkerhedsforanstaltninger i simuleringer. Resultaterne rejser spørgsmål om, hvor bred adgang der bør være til avancerede cyberfunktioner – men de stammer fra kontrollerede tests og dokumenterer ikke vellykkede angreb mod aktive mål. 12
På Anthropics ExploitBench-test byggede GLM-5.3 fungerende exploits i 50 af 410 forsøg. Claude Mythos Preview gjorde det i 56. Det svarer til cirka 12 procent mod 14 procent i netop denne test. ExploitBench undersøger, om en model kan udvikle exploits mod kendte sårbarheder i et kontrolleret miljø. Resultaterne er derfor ikke bevis for, at modellerne klarer sig lige godt på alle cybersikkerhedsopgaver. 5
12
Anthropic beskrev GLM-5.3’s evne til at udvikle exploits fra start til slut som et betydeligt fremskridt sammenlignet med tidligere modeller. I en separat test af binær udnyttelse opnåede GLM-5.3 fuld kontrol over programflowet i 4 procent af opgaverne, mens Mythos Preview gjorde det i 6 procent. Tallene peger på stærke resultater i bestemte tests – ikke på, at modellerne er lige gode til alt. 3
7
12
NIST’s Center for AI Standards and Innovation (CAISI), et amerikansk center for standarder og evaluering af AI, kaldte GLM-5.3 den mest cyberkapable open-weight-model, det havde vurderet. Samtidig fandt centret, at modellen lå omkring fire måneder efter de førende amerikanske modeller målt på tværs af CAISI’s cybersikkerhedstests. 17
De to vurderinger behøver ikke at være i modstrid. NIST sammenlignede GLM-5.3 på tværs af flere benchmarks, mens Anthropics mest opsigtsvækkende sammenligning gjaldt én specifik exploit-test mod Mythos Preview. Forskellige tests og sammenligningsgrundlag kan godt føre til konklusioner, der begge holder. 12
17
Anthropic rapporterede, at simple metoder omgåede GLM-5.3’s sikkerhedsforanstaltninger i 64–100 procent af de simulerede tests. Tallene beskriver udfaldet af de prompts og metoder, der blev afprøvet – ikke sandsynligheden for, at en angriber vil lykkes i en virkelig operation. 12
Open weights rejser også et særskilt spørgsmål. Når brugere har adgang til modellens vægte, kan de muligvis ændre dens afvisningsadfærd i stedet for blot at forsøge at overtale den gennem prompts. En sekundær gennemgang af forsøget anslog, at et erfarent hold kunne fjerne sikkerhedsforanstaltningerne for omkring 1.200 dollar. Den beskrev også et beregningsestimat på cirka 4.400 dollar. Det er estimater baseret på forskellige beskrivelser af arbejdet – ikke en fast pris eller et mål for, hvor ofte virkelige angribere ville gøre det. 12
25
I et rapporteret forsøg brugte en forsker den mindre model GLM-5.3-Flash til at bygge en kæde af exploits baseret på to sårbarheder, som allerede var offentliggjort. Ifølge rapporten krævede arbejdet omkring 20 minutters menneskelig indsats, otte timers modelarbejde og 20,40 dollar i API-gebyrer. Den ene sårbarhed var i Chrome, og forskeren gav modellen offentligt tilgængelige oplysninger om de kendte fejl. Forsøget viste, at modellen kunne hjælpe med at udvikle en kæde mod kendte sårbarheder i en test – ikke at et aktivt offer blev kompromitteret. 6
Skellet er vigtigt: At en model kan fremstille en exploit under testforhold, er et muligt tegn på misbrugsrisiko. Det er ikke det samme som at dokumentere et angreb i praksis. Den tilgængelige rapportering fastslår ikke, at GLM-5.3 blev brugt til at bryde ind hos et virkeligt mål. 5
6
Anthropics bekymring er, at bred adgang til modeller, der kan hjælpe med at bygge exploits, kan gavne angribere såvel som forsvarere. Virksomheden har også argumenteret for, at forsvarere bør have adgang til avancerede modeller, så de kan finde og udbedre sårbarheder. 1
12
Open weights indebærer en vanskelig afvejning. De kan give uafhængige forskere og forsvarere adgang til modellens funktioner, men gør det også lettere for brugere at køre eller ændre modellen uden for udviklerens kontrol. Benchmark- og sikkerhedstestene bidrager til debatten, men afgør ikke i sig selv, om begrænset adgang samlet set ville gøre cybersikkerheden bedre. 4
12
Den mest præcise konklusion er derfor afgrænset: I Anthropics evaluering nærmede GLM-5.3 sig Mythos Preview på én exploit-test, og de afprøvede metoder kunne omgå modellens sikkerhedsforanstaltninger. NIST’s bredere vurdering placerede stadig GLM-5.3 efter de førende amerikanske modeller, og de beskrevne demonstrationer var ikke angreb mod aktive mål. 12
17
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
GLM 5.3 byggede fungerende exploits i 50 af 410 forsøg på Anthropics ExploitBench test; Claude Mythos Preview gjorde det i 56.
GLM 5.3 byggede fungerende exploits i 50 af 410 forsøg på Anthropics ExploitBench test; Claude Mythos Preview gjorde det i 56. Simple metoder omgåede GLM 5.3’s sikkerhedsforanstaltninger i 64–100 procent af Anthropics simulerede test.
NIST vurderede modellen som den mest cyberkapable open weight model, myndigheden havde undersøgt, men placerede den stadig omkring fire måneder efter førende amerikanske modeller på tværs af sine tests.