В тесте ExploitBench GLM 5.3 создала рабочие эксплойты в 50 из 410 попыток; Claude Mythos Preview — в 56. В симуляциях простые методы обходили защитные ограничения GLM 5.3 в 64–100% случаев.
ОпубликовалОтредактировано с помощью GPT-6 LunaИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s September 2026 analysis find about Z.ai’s open-weight GLM-5.3 model’s ability to build cyber exploits compared with Cla. Article summary: Anthropic’s September 2026 analysis found that Z.ai’s downloadable GLM-5.3 could autonomously build working, end-to-end exploits at nearly the rate of Claude Mythos Preview on one test—a capability Anthropic had previous. Topic tags: general, general web, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake n
В сентябрьской оценке Anthropic модель GLM-5.3 от компании Z.ai показала результат, близкий к Claude Mythos Preview, в одном тесте на создание сквозных эксплойтов. Но в симуляциях защитные ограничения GLM-5.3 удавалось обойти простыми методами. Это важный сигнал о рисках доступных моделей — однако речь идёт о результатах испытаний, а не об успешных атаках на реальные цели. 12
В ExploitBench GLM-5.3 создала рабочие эксплойты в 50 из 410 попыток, а Claude Mythos Preview — в 56. Это примерно 12% против 14%. Тест проверял, могут ли модели использовать известные уязвимости в контролируемой среде. Такой результат не доказывает, что модели одинаково справляются со всеми задачами кибербезопасности. 5
12
В отдельном испытании по бинарной эксплуатации GLM-5.3 добилась полного перехвата управления потоком выполнения в 4% задач; у Mythos Preview показатель составил 6%. Anthropic назвала способность GLM-5.3 самостоятельно выстраивать эксплойты заметным шагом по сравнению с прежними моделями. Но и эти данные относятся к конкретным тестам, а не к универсальной оценке возможностей. 3
7
12
Центр стандартов и инноваций в области искусственного интеллекта при NIST (CAISI) назвал GLM-5.3 самой способной в киберзадачах моделью с открытыми весами среди тех, что он оценивал. При этом по совокупности своих кибертестов центр поместил её примерно на четыре месяца позади передовых американских моделей. 17
Эти выводы не обязательно противоречат оценке Anthropic. Anthropic сравнивала модели в конкретном тесте с Mythos Preview, тогда как CAISI оценивал GLM-5.3 по более широкому набору задач и сопоставлял её с текущим уровнем передовых американских моделей. Разные выборки и критерии могут приводить к разным, но совместимым выводам. 12
17
По данным Anthropic, в её симулированных испытаниях простые приёмы обходили защиту GLM-5.3 в 64–100% случаев. Эти цифры описывают результаты конкретных запросов и методов в тестах — это не вероятность того, что злоумышленник добьётся успеха в реальной операции. 12
У моделей с открытыми весами есть и другая особенность: пользователи, получившие доступ к весам, могут менять поведение модели, в том числе её склонность отказывать в ответах. В одном стороннем изложении эксперимента стоимость снятия защит оценивалась примерно в 1 200 долларов для опытной команды; там же приводилась оценка вычислительных затрат около 4 400 долларов. Это оценки разных аспектов работы, а не фиксированная цена и не показатель того, как часто подобное удастся реальным атакующим. 12
25
В одном из описанных испытаний исследователь использовал уменьшенную модель GLM-5.3-Flash, чтобы выстроить цепочку эксплойтов для двух уже раскрытых уязвимостей. По данным отчёта, работа потребовала около 20 минут внимания человека и восьми часов работы модели; расходы на API составили 20,40 доллара. Среди уязвимостей была проблема в Chrome, а общедоступные сведения об известных ошибках исследователь предоставил модели заранее. 6
Это демонстрация того, что модель помогла разработать цепочку для уже известных уязвимостей в условиях теста. Она не доказывает, что был взломан браузер реального пользователя или скомпрометирована действующая система. Доступные материалы не подтверждают, что GLM-5.3 применяли для атаки на реальную цель. 5
6
Открытые веса позволяют запускать модель и изменять её вне инфраструктуры разработчика. Это может дать больше возможностей как специалистам по защите, так и тем, кто намерен использовать модель во вред. Именно такое распространение возможностей для создания эксплойтов вызывает опасения Anthropic. Компания также выступает за то, чтобы защитники получали доступ к продвинутым моделям для поиска и устранения уязвимостей. 1
12
При этом одни только результаты тестов не отвечают на вопрос, сделало бы ограничение доступа к моделям кибербезопасность в целом лучше или хуже. Они показывают более узкую картину: в оценке Anthropic GLM-5.3 приблизилась к Mythos Preview в одном тесте на эксплойты, а её защиту удалось обойти проверенными методами. Более широкая оценка NIST по-прежнему помещает модель позади передовых американских систем, а опубликованные демонстрации не были атаками на реальные цели. 12
17
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
В тесте ExploitBench GLM 5.3 создала рабочие эксплойты в 50 из 410 попыток; Claude Mythos Preview — в 56.
В тесте ExploitBench GLM 5.3 создала рабочие эксплойты в 50 из 410 попыток; Claude Mythos Preview — в 56. В симуляциях простые методы обходили защитные ограничения GLM 5.3 в 64–100% случаев.
NIST назвал GLM 5.3 самой способной в киберзадачах моделью с открытыми весами среди оценённых, но отметил, что по совокупности своих тестов она отстаёт от передовых американских моделей примерно на четыре месяца.