V testu ExploitBench vytvořil GLM 5.3 funkční exploity v 50 ze 410 pokusů; Claude Mythos Preview uspěl v 56. Jednoduché metody obešly ochrany GLM 5.3 v 64 až 100 % simulovaných testů.
PublikovalUpraveno pomocí GPT-6 LunaObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s September 2026 analysis find about Z.ai’s open-weight GLM-5.3 model’s ability to build cyber exploits compared with Cla. Article summary: Anthropic’s September 2026 analysis found that Z.ai’s downloadable GLM-5.3 could autonomously build working, end-to-end exploits at nearly the rate of Claude Mythos Preview on one test—a capability Anthropic had previous. Topic tags: general, general web, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake n
Zářijové hodnocení společnosti Anthropic zjistilo, že GLM-5.3 od Z.ai dokázal v jednom benchmarku vytvářet funkční exploity od začátku do konce téměř stejně často jako Claude Mythos Preview. Zároveň se ukázalo, že v simulovaných testech šly ochrany GLM-5.3 obejít poměrně snadno. Jde o výsledky kontrolovaných zkoušek, nikoli o důkaz úspěšných útoků na skutečné cíle. 12
V testu ExploitBench vytvořil GLM-5.3 funkční exploit v 50 ze 410 pokusů, zatímco Claude Mythos Preview v 56. To odpovídá přibližně 12 % oproti 14 %. Benchmark měřil vývoj exploitů pro známé zranitelnosti v kontrolovaném prostředí; blízké skóre proto neznamená, že oba modely podávají srovnatelný výkon ve všech kyberbezpečnostních úlohách. 5
12
Anthropic označil schopnost GLM-5.3 sestavit exploit od začátku do konce za výrazný posun oproti starším modelům. V samostatném testu binárního zneužití zapsal GLM-5.3 úplné převzetí řízení toku ve 4 % úloh, zatímco Mythos Preview v 6 %. I tyto výsledky vypovídají o konkrétních testech, nikoli o univerzální rovnocennosti modelů. 3
7
12
Centrum pro standardy a inovace v oblasti AI (CAISI) při americkém Národním institutu pro standardy a technologie (NIST) označilo GLM-5.3 za nejkyberneticky schopnější model s otevřenými vahami, který dosud hodnotilo. V souhrnu širší sady kyberbezpečnostních benchmarků ho však zařadilo zhruba čtyři měsíce za současné americké špičkové modely. 17
To není v rozporu s výsledkem Anthropic: NIST porovnával model napříč širším souborem testů, zatímco nejvýraznější srovnání Anthropic se týkalo konkrétní úlohy a modelu Mythos Preview. Různé testy a srovnávací skupiny mohou vést k odlišným, ale současně platným závěrům. 12
17
Anthropic uvedl, že jednoduché postupy obešly ochrany GLM-5.3 v 64 až 100 % jeho simulovaných testů. Tato čísla popisují výsledky konkrétních testovacích zadání a metod, nikoli pravděpodobnost, že útočník uspěje při skutečné operaci. 12
Otevřené váhy přinášejí další otázku: kdo k nim má přístup, může se pokusit změnit chování modelu při odmítání požadavků, místo aby se jeho ochrany pouze snažil obejít zadáním. Podle sekundárního popisu Anthropicova experimentu se náklady na odstranění ochranných mechanismů odhadovaly na zhruba 1 200 USD pro zkušený tým; jiný odhad uváděl asi 4 400 USD za výpočetní výkon. Jde o odhady různě popsané práce, nikoli o pevnou cenu nebo měřítko toho, jak často by uspěli skuteční útočníci. 12
25
V jednom popsaném testu výzkumník použil menší model GLM-5.3-Flash k vytvoření řetězce exploitů pro dvě již zveřejněné zranitelnosti. Podle zprávy tomu věnoval přibližně 20 minut lidské práce; model pracoval osm hodin a poplatky za API činily 20,40 USD. Jedna ze zranitelností se týkala Chromu a výzkumník modelu poskytl veřejně dostupné informace o známých chybách. Demonstrace ukazuje pomoc při tvorbě řetězce pro již zveřejněné zranitelnosti v testovacím prostředí — nikoli napadení skutečné oběti. 6
Rozdíl je důležitý: schopnost modelu vytvořit exploit v testovacích podmínkách upozorňuje na možnost zneužití, ale sama o sobě není důkazem útoku v praxi. Dostupné zprávy nepotvrzují, že by GLM-5.3 posloužil k prolomení zabezpečení skutečného cíle. 5
6
Anthropic upozorňuje, že nástroje schopné vytvářet exploity mohou sloužit útočníkům i obráncům. Zároveň společnost prosazuje, aby obránci měli přístup k pokročilým modelům, s jejichž pomocí mohou zranitelnosti hledat a opravovat. 1
12
Otevřené váhy tak přinášejí obtížný kompromis. Nezávislým výzkumníkům a obráncům umožňují model spouštět a využívat, ale zároveň dávají uživatelům větší možnost provozovat či upravovat ho mimo kontrolu jeho vývojáře. Výsledky benchmarků a testů ochran pomáhají debatu informovat, samy však neukazují, zda by omezení přístupu celkově zvýšilo kybernetickou bezpečnost. 4
12
Nejpřesnější závěr je užší: v hodnocení Anthropic se GLM-5.3 přiblížil Mythos Preview v jednom benchmarku exploitů a testované metody dokázaly jeho ochrany obejít. Širší hodnocení NIST ho přesto zařadilo za současné americké špičkové modely a popsané demonstrace nebyly útoky na živé cíle. 12
17
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
V testu ExploitBench vytvořil GLM 5.3 funkční exploity v 50 ze 410 pokusů; Claude Mythos Preview uspěl v 56.
V testu ExploitBench vytvořil GLM 5.3 funkční exploity v 50 ze 410 pokusů; Claude Mythos Preview uspěl v 56. Jednoduché metody obešly ochrany GLM 5.3 v 64 až 100 % simulovaných testů. Nejde o pravděpodobnost úspěchu při reálném útoku.
NIST model označil za nejkyberneticky schopnější otevřený model, který dosud hodnotil, ale v širším souboru testů jej zařadil zhruba čtyři měsíce za současnou americkou špičku.