ExploitBench testissä GLM 5.3 tuotti toimivan hyväksikäytön 50 kertaa 410 yrityksestä. Anthropicin simulaatioissa yksinkertaiset keinot kiersivät GLM 5.3:n suojauksia 64–100 prosentissa testatuista tapauksista.
JulkaisijaMuokattu mallilla GPT-6 LunaKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s September 2026 analysis find about Z.ai’s open-weight GLM-5.3 model’s ability to build cyber exploits compared with Cla. Article summary: Anthropic’s September 2026 analysis found that Z.ai’s downloadable GLM-5.3 could autonomously build working, end-to-end exploits at nearly the rate of Claude Mythos Preview on one test—a capability Anthropic had previous. Topic tags: general, general web, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake n
Anthropicin syyskuussa 2026 julkaisema arvio kertoo, että Z.ai:n avoimilla painoilla julkaistu GLM-5.3 pystyi rakentamaan toimivia, päästä päähän eteneviä hyväksikäyttöjä lähes yhtä usein kuin Claude Mythos Preview yhdessä vertailutestissä. Samassa raportissa Anthropic havaitsi, että yksinkertaiset keinot kiersivät GLM-5.3:n suojauksia usein simuloiduissa kokeissa. Tulokset herättävät kysymyksiä siitä, kenellä pitäisi olla pääsy näin tehokkaisiin kyberkykyihin. Ne ovat kuitenkin kontrolloidun testauksen tuloksia, eivät näyttöä onnistuneista hyökkäyksistä oikeita kohteita vastaan. 12
Anthropicin ExploitBench-testissä GLM-5.3 tuotti toimivan hyväksikäytön 50 kertaa 410 yrityksestä. Claude Mythos Preview onnistui 56 kertaa. Osuudet olivat siis noin 12 ja 14 prosenttia. Testissä arvioitiin tunnettujen haavoittuvuuksien hyväksikäyttöä kontrolloidussa ympäristössä. Läheisiä tuloksia ei pidä tulkita osoitukseksi siitä, että mallit suoriutuisivat yhtä hyvin kaikissa kyberturvallisuustehtävissä. 5
12
Anthropic kuvasi GLM-5.3:n kykyä rakentaa päästä päähän eteneviä hyväksikäyttöjä huomattavaksi edistysaskeleeksi aiempiin malleihin verrattuna. Yhtiö vertasi malleja myös erillisessä binääriohjelmien hyväksikäyttötestissä: GLM-5.3 sai aikaan täydellisen ohjauksen siirron 4 prosentissa tehtävistä, Mythos Preview 6 prosentissa. Tulokset kertovat vahvasta suoriutumisesta tietyissä testeissä, eivät mallien yleisestä tasavertaisuudesta. 3
7
12
Yhdysvaltain standardointi- ja teknologiainstituutin NISTin alainen Center for AI Standards and Innovation (CAISI) nimesi GLM-5.3:n kyvykkäimmäksi arvioimakseen avoimilla painoilla julkaistuksi kybermalliksi. CAISIn kybertestien kokonaisvertailussa malli jäi kuitenkin noin neljä kuukautta Yhdysvaltain senhetkisistä kärkimallien tasosta. 17
Tämä ei ole ristiriidassa Anthropicin Mythos-tuloksen kanssa. NIST vertaili GLM-5.3:a laajemmassa testikokonaisuudessa, kun taas Anthropicin otsikoihin noussut vertailu koski tiettyä testiä ja Claude Mythos Preview -mallia. Eri testit ja vertailuryhmät voivat tuottaa erilaisia, toisiaan täydentäviä johtopäätöksiä. 12
17
Anthropicin mukaan yksinkertaiset menetelmät kiersivät GLM-5.3:n suojaukset 64–100 prosentissa yhtiön simuloiduista testeistä. Prosenttiluvut kuvaavat testattujen kehotteiden ja menetelmien tuloksia. Ne eivät kerro, kuinka todennäköisesti hyökkääjä onnistuisi tosielämän operaatiossa. 12
Avoimilla painoilla julkaiseminen tuo asiaan oman ulottuvuutensa: mallin painoihin pääsevä käyttäjä voi yrittää muuttaa mallin kieltäytymiskäyttäytymistä sen sijaan, että kiertäisi suojauksia vain kehotteilla. Yhdessä raportissa suojauksien poistamisen hinnaksi arvioitiin kokeneelle ryhmälle noin 1 200 dollaria. Samassa yhteydessä kuvattiin myös noin 4 400 dollarin laskennallinen kustannusarvio. Luvut liittyvät erilaisiin kuvauksiin työn toteutuksesta; ne eivät ole kiinteä hinta eivätkä arvio siitä, kuinka usein oikeat hyökkääjät onnistuisivat. 12
25
Raportoidussa kokeessa tutkija käytti pienempää GLM-5.3-Flash-mallia kahdesta jo julkistetusta haavoittuvuudesta koostuvan hyväksikäyttöketjun rakentamiseen. Raportin mukaan työ vaati noin 20 minuuttia ihmisen työpanosta, kahdeksan tuntia mallin työskentelyä ja 20,40 dollaria API-kuluja. Yksi haavoittuvuuksista liittyi Chromeen, ja tutkija antoi mallille julkiset tiedot tunnetuista haavoittuvuuksista. Koe osoittaa, että malli pystyi auttamaan ketjun kehittämisessä tunnettujen haavoittuvuuksien pohjalta testissä – ei sitä, että oikea uhri olisi joutunut murretuksi. 6
Ero on olennainen: kyky tuottaa hyväksikäyttö testitilanteessa on varoitus mahdollisesta väärinkäytöstä, mutta se ei ole sama asia kuin hyökkäyksen osoittaminen käytännössä. Tässä käsitellyt raportit eivät osoita, että GLM-5.3:lla olisi murtauduttu todelliseen kohteeseen. 5
6
Anthropicin huolena on, että laajasti saatavilla olevia hyväksikäyttöjen rakentamiseen kykeneviä malleja voivat käyttää sekä hyökkääjät että puolustajat. Yhtiö on samalla kannattanut sitä, että puolustajat saisivat käyttöönsä edistyneitä malleja haavoittuvuuksien löytämiseksi ja korjaamiseksi. 1
12
Avoimet painot luovat vaikean tasapainon. Ne voivat antaa riippumattomille tutkijoille ja puolustajille mahdollisuuden käyttää mallia, mutta myös helpottaa sen ajamista ja muokkaamista kehittäjän valvonnan ulkopuolella. Testitulokset ovat osa tätä keskustelua, mutta eivät yksin ratkaise, parantaisiko mallien käytön rajoittaminen kyberturvallisuutta kokonaisuutena. 4
12
Vahvin johtopäätös on rajattu: Anthropicin arvioinnissa GLM-5.3 pääsi yhdessä hyväksikäyttötestissä lähelle Mythos Preview’ta, ja testatut keinot kiersivät sen suojauksia. NISTin laajempi arvio sijoitti mallin silti Yhdysvaltain senhetkisten kärkimallien taakse, eivätkä raportoidut kokeet olleet tosielämän hyökkäyksiä. 12
17
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ExploitBench testissä GLM 5.3 tuotti toimivan hyväksikäytön 50 kertaa 410 yrityksestä.
ExploitBench testissä GLM 5.3 tuotti toimivan hyväksikäytön 50 kertaa 410 yrityksestä. Anthropicin simulaatioissa yksinkertaiset keinot kiersivät GLM 5.3:n suojauksia 64–100 prosentissa testatuista tapauksista.
NIST arvioi GLM 5.3:n kyvykkäimmäksi testaamakseen avoimilla painoilla julkaistuksi kybermalliksi, mutta sijoitti sen laajemmassa vertailussa noin neljä kuukautta Yhdysvaltain kärkimallien taakse.