W teście ExploitBench GLM 5.3 stworzył działające exploity w 50 z 410 prób, a Claude Mythos Preview — w 56. Proste metody omijały zabezpieczenia GLM 5.3 w 64–100% symulowanych testów; nie jest to miara skuteczności ataków w rzeczywistych warunkach.
Opublikowane przezEdytowane za pomocą GPT-6 LunaObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s September 2026 analysis find about Z.ai’s open-weight GLM-5.3 model’s ability to build cyber exploits compared with Cla. Article summary: Anthropic’s September 2026 analysis found that Z.ai’s downloadable GLM-5.3 could autonomously build working, end-to-end exploits at nearly the rate of Claude Mythos Preview on one test—a capability Anthropic had previous. Topic tags: general, general web, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake n
Analiza Anthropic z września 2026 r. wykazała, że model GLM-5.3 firmy Z.ai potrafił tworzyć działające exploity od początku do końca niemal równie często jak Claude Mythos Preview — w jednym konkretnym benchmarku. Ten sam raport pokazał, że w symulacjach proste metody często pozwalały ominąć zabezpieczenia GLM-5.3. To wyniki z kontrolowanych testów, a nie dowód na udane ataki na rzeczywiste cele. 12
W teście ExploitBench model GLM-5.3 stworzył działające exploity w 50 z 410 prób. Claude Mythos Preview osiągnął taki wynik w 56 próbach. To odpowiednio około 12% i 14%. Benchmark sprawdzał tworzenie exploitów dla znanych podatności w kontrolowanym środowisku. Zbliżone wyniki nie oznaczają, że modele radzą sobie równie dobrze ze wszystkimi zadaniami z zakresu cyberbezpieczeństwa. 5
12
Anthropic uznał zdolność GLM-5.3 do budowania kompletnych exploitów za znaczący postęp względem wcześniejszych modeli. W osobnym teście dotyczącym eksploatacji binarnej pełne przejęcie przepływu sterowania udało się w 4% zadań dla GLM-5.3 i w 6% dla Mythos Preview. To mocne rezultaty w konkretnych testach, nie dowód na równorzędność modeli w każdej dziedzinie. 3
7
12
Centrum Standardów i Innowacji AI przy amerykańskim instytucie NIST (CAISI) określiło GLM-5.3 jako najbardziej zaawansowany cybernetycznie model z otwartymi wagami, jaki dotąd oceniało. Jednocześnie, na podstawie łącznych wyników w swoich benchmarkach, umieściło go około czterech miesięcy za czołowymi modelami z USA. 17
Nie musi to być sprzeczne z wynikiem Anthropic zbliżonym do Mythos Preview. NIST porównywał GLM-5.3 w szerszym zestawie testów, podczas gdy głośne porównanie Anthropic dotyczyło jednego benchmarku i konkretnej wersji Mythos. Inny zakres zadań i inna grupa porównawcza mogą prowadzić do odmiennych, a zarazem zgodnych wniosków. 12
17
Według Anthropic proste techniki pozwalały ominąć zabezpieczenia GLM-5.3 w 64–100% symulowanych testów. Te wartości opisują wyniki konkretnych prób z użyciem testowanych poleceń i metod. Nie mówią, jakie jest prawdopodobieństwo powodzenia rzeczywistego ataku. 12
Raport zwraca uwagę także na specyfikę modeli z otwartymi wagami: użytkownicy, którzy mają dostęp do parametrów modelu, mogą zmieniać jego zachowanie związane z odmową, zamiast jedynie próbować przekonać go odpowiednio sformułowanym poleceniem. Według jednego z omówień eksperymentu koszt usunięcia zabezpieczeń mógł wynieść około 1200 dolarów dla doświadczonego zespołu; w tym samym opisie pojawia się też szacunek około 4400 dolarów za potrzebne obliczenia. To różne szacunki zależne od sposobu opisania pracy, a nie stała cena ani prognoza tego, jak często udałoby się to rzeczywistym atakującym. 12
25
W jednym z opisanych eksperymentów badacz wykorzystał mniejszy model GLM-5.3-Flash, by zbudować łańcuch exploitów wykorzystujący dwie wcześniej ujawnione podatności. Według raportu praca wymagała około 20 minut uwagi człowieka i ośmiu godzin działania modelu, a opłaty za API wyniosły 20,40 dolara. Jedna z podatności dotyczyła Chrome; badacz dostarczył publicznie dostępne informacje o znanych błędach. Eksperyment pokazuje, że model może pomagać w opracowywaniu łańcucha exploitów dla ujawnionych podatności w teście — nie że ktoś włamał się do systemu ofiary. 6
To rozróżnienie jest kluczowe. Zdolność modelu do wygenerowania exploita w warunkach testowych może sygnalizować ryzyko nadużyć, ale nie jest tym samym co atak przeprowadzony w realnym świecie. Dostępne doniesienia nie potwierdzają, by GLM-5.3 wykorzystano do przełamania zabezpieczeń rzeczywistego celu. 5
6
Anthropic ostrzega, że szeroko dostępne narzędzia do budowania exploitów mogą służyć zarówno atakującym, jak i obrońcom. Firma opowiada się też za tym, by obrońcy mieli dostęp do zaawansowanych modeli, które mogą pomóc wykrywać i naprawiać podatności. 1
12
Otwarte wagi wiążą się z trudnym kompromisem: ułatwiają niezależnym badaczom i zespołom obronnym korzystanie z możliwości modelu, ale dają też użytkownikom większą swobodę uruchamiania go i modyfikowania poza kontrolą jego twórcy. Wyniki benchmarków i testów zabezpieczeń są istotne w tej debacie, lecz same nie przesądzają, czy ograniczenie dostępu ostatecznie poprawiłoby bezpieczeństwo. 4
12
Najostrożniejszy wniosek jest węższy: w ocenie Anthropic GLM-5.3 zbliżył się do Mythos Preview w jednym teście tworzenia exploitów, a jego zabezpieczenia okazały się podatne na sprawdzone metody obchodzenia. Szersza ocena NIST nadal plasowała go za obecnymi czołowymi modelami z USA, a opisane demonstracje nie były atakami na żywe cele. 12
17
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
W teście ExploitBench GLM 5.3 stworzył działające exploity w 50 z 410 prób, a Claude Mythos Preview — w 56.
W teście ExploitBench GLM 5.3 stworzył działające exploity w 50 z 410 prób, a Claude Mythos Preview — w 56. Proste metody omijały zabezpieczenia GLM 5.3 w 64–100% symulowanych testów; nie jest to miara skuteczności ataków w rzeczywistych warunkach.
NIST ocenił GLM 5.3 jako najbardziej zaawansowany pod względem cyberbezpieczeństwa model z otwartymi wagami, ale umieścił go około czterech miesięcy za obecnymi czołowymi modelami z USA.