У тесті ExploitBench модель GLM 5.3 створила робочі експлойти у 50 із 410 спроб, а Claude Mythos Preview — у 56. Anthropic повідомила, що прості методи обходили захист GLM 5.3 у 64–100% симульованих тестів; це не є показником успіху реальних атак.
ОпублікувавВідредаговано за допомогою GPT-6 LunaЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s September 2026 analysis find about Z.ai’s open-weight GLM-5.3 model’s ability to build cyber exploits compared with Cla. Article summary: Anthropic’s September 2026 analysis found that Z.ai’s downloadable GLM-5.3 could autonomously build working, end-to-end exploits at nearly the rate of Claude Mythos Preview on one test—a capability Anthropic had previous. Topic tags: general, general web, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake n
Оцінювання Anthropic у вересні 2026 року показало: модель GLM-5.3 від Z.ai змогла створювати наскрізні робочі експлойти майже так само часто, як Claude Mythos Preview, — але лише в одному конкретному тесті. Водночас у симуляціях прості методи нерідко обходили її захисні механізми. Це привертає увагу до того, кому доступні потужні кіберможливості, однак результати контрольованих тестів не доводять, що модель успішно атакувала реальні цілі. 12
У тесті Anthropic ExploitBench модель GLM-5.3 створила робочий експлойт у 50 із 410 спроб. Claude Mythos Preview зробила це у 56 спробах. У перерахунку це приблизно 12% проти 14%. Тест перевіряв створення експлойтів для відомих вразливостей у контрольованому середовищі, тож близькі результати не означають, що моделі однаково добре виконують усі завдання з кібербезпеки. 5
12
Anthropic назвала здатність GLM-5.3 самостійно створювати наскрізні експлойти помітним кроком уперед порівняно з попередніми моделями. В окремому тесті на бінарні експлойти GLM-5.3 змогла повністю перехопити керування виконанням у 4% завдань, тоді як Mythos Preview — у 6%. Це свідчить про сильні результати в окремих оцінюваннях, а не про повну рівність моделей. 3
7
12
Центр стандартів та інновацій у сфері ШІ (CAISI) при Національному інституті стандартів і технологій США (NIST) назвав GLM-5.3 найспроможнішою з оцінених ним моделей із відкритими вагами. Водночас за сукупністю кібербезпекових тестів NIST оцінив її як приблизно на чотири місяці позаду передових моделей США. 17
Цей висновок не обов’язково суперечить результату Anthropic, близькому до Mythos: NIST оцінював модель за ширшим набором тестів, а гучне порівняння Anthropic стосувалося одного конкретного завдання й Mythos Preview. Різні набори тестів і групи для порівняння можуть дати висновки, які доповнюють, а не спростовують один одного. 12
17
За даними Anthropic, прості прийоми обходили захисні механізми GLM-5.3 у 64–100% симульованих тестів. Ці відсотки описують результати конкретних підказок і методів, які перевіряли дослідники, а не ймовірність успіху зловмисника в реальній операції. 12
Відкриті ваги створюють іще одну проблему: користувачі, які мають доступ до параметрів моделі, можуть змінювати її схильність відмовляти, а не лише намагатися обійти обмеження за допомогою запитів. За одним із переказів описаного експерименту, досвідчена команда могла б прибрати захисні механізми приблизно за 1 200 доларів; в іншому описі наведено оцінку обчислювальних витрат близько 4 400 доларів. Це різні оцінки з різних описів роботи, а не фіксована ціна чи прогноз того, як часто таке вдасться реальним зловмисникам. 12
25
В одному з описаних експериментів дослідник використав меншу модель GLM-5.3-Flash, щоб побудувати ланцюжок експлойтів для двох уже оприлюднених вразливостей. За звітом, це потребувало близько 20 хвилин уваги людини, восьми годин роботи моделі та 20,40 долара оплати API. Одна з вразливостей стосувалася Chrome; дослідник надав моделі публічні відомості про відомі вади. Демонстрація показує, що модель могла допомогти створити ланцюжок для вже розкритих вразливостей у тесті, але не доводить, що було зламано систему реальної жертви. 6
Різниця принципова: здатність моделі створити експлойт у тестових умовах є сигналом потенційного зловживання, але це не те саме, що підтверджена атака в реальному середовищі. Наведені тут матеріали не встановлюють, що GLM-5.3 використали для зламу реальної цілі. 5
6
Anthropic застерігає, що можливості зі створення експлойтів можуть використовувати не лише фахівці із захисту, а й зловмисники. Водночас компанія виступає за те, щоб захисники також мали доступ до передових моделей і могли знаходити та усувати вразливості. 1
12
Відкриті ваги означають, що параметри моделі можна отримати, запускати й змінювати самостійно. Це може дати більше можливостей незалежним дослідникам і фахівцям із кіберзахисту, але водночас послаблює контроль розробника над тим, як модель використовують або модифікують. Результати тестів важливі для цієї дискусії, але самі по собі не показують, чи зробило б обмеження доступу кібербезпеку загалом кращою. 4
12
Найчіткіший висновок тут вузький: в оцінюванні Anthropic GLM-5.3 наблизилася до Mythos Preview в одному тесті на експлойти, а її захист виявився вразливим до перевірених методів обходу. Ширше оцінювання NIST усе ще поставило GLM-5.3 позаду передових моделей США, а описані демонстрації не були атаками на реальні цілі. 12
17
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
У тесті ExploitBench модель GLM 5.3 створила робочі експлойти у 50 із 410 спроб, а Claude Mythos Preview — у 56.
У тесті ExploitBench модель GLM 5.3 створила робочі експлойти у 50 із 410 спроб, а Claude Mythos Preview — у 56. Anthropic повідомила, що прості методи обходили захист GLM 5.3 у 64–100% симульованих тестів; це не є показником успіху реальних атак.
NIST назвав GLM 5.3 найспроможнішою з оцінених моделей із відкритими вагами, але за ширшим набором тестів поставив її приблизно на чотири місяці позаду передових моделей США.