Все 21 протестированная модель с открытыми весами оказалась уязвимой хотя бы к одной из девяти атак, причём часто без падения результата MMLU Pro более чем на 10%. Наиболее эффективными обычно были скрытые атаки jailbreak tuning — варианты с конкурирующими целями, бэкдорами и модификацией стиля.
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Главный вывод TamperBench звучит жёстко: ни одна из 21 протестированной языковой модели с открытыми весами не имела защит, которые гарантированно выдерживали все проверенные способы вмешательства. В исследовании участвовали модели примерно от 600 млн до 8 млрд параметров, включая обычные версии и варианты с дополнительными механизмами защиты. Для каждой модели нашлась как минимум одна атака, после которой она стала заметно чаще выдавать вредный контент, сохранив при этом значительную часть общих возможностей. 256
Это важно именно для моделей с открытыми весами. После публикации их можно копировать, дообучать и распространять дальше — уже без полноценного контроля со стороны исходного разработчика. Защитный слой, успешно прошедший проверку перед релизом, не обязательно остаётся устойчивым, когда пользователи получают возможность менять сами веса модели.
TamperBench измеряет не обычную устойчивость к джейлбрейкам через промпты, а сопротивляемость вмешательству в модель. Авторы объединили атаки через дообучение в пространстве весов с методами, изменяющими скрытые представления модели, а затем оценили одновременно её безопасность и сохранённые способности. Для каждой пары «модель — атака» проводился систематический поиск гиперпараметров, а не тестировалась одна случайно выбранная конфигурация. 2
В исследование вошли девять режимов вмешательства, среди них:
Исследователи проверяли не просто возможность сделать модель небезопасной. Их интересовали атаки, которые увеличивали долю вредных ответов, при этом удерживая падение точности рассуждений на MMLU-Pro в пределах 10% от показателя исходной, неатакованной модели. 2
Наиболее серьёзные результаты обычно показывали атаки категории jailbreak-tuning — дообучения, специально направленного на ослабление отказов модели. В работе рассматривались варианты с конкурирующими целями, бэкдорами и модификацией стиля. Особенно примечательно, что для них можно было использовать преимущественно безобидные данные, добавляя лишь небольшую вредоносную составляющую. Это больше похоже на точечное изменение поведения системы безопасности, чем на грубое переобучение модели на опасные ответы. 26
Более широкий вывод работы заключается в том, что безопасность и полезность модели могут расходиться в нежелательную сторону. Вмешательство способно ослабить отказы, не разрушая пропорционально способность рассуждать. Поэтому модель может по-прежнему хорошо выглядеть на стандартных тестах, но стать существенно более рискованной для реального применения.
TamperBench проверил 21 модель с открытыми весами размером от 0,6 до 8 млрд параметров, включая семейства Llama, Qwen3 и Mistral. Доступные материалы исследования подтверждают общий вывод по бенчмарку: каждая протестированная модель оказалась уязвимой хотя бы к одной из оценённых атак. 56
При этом в предоставленных источниках нет точных значений роста вредных ответов для Llama-3-8B-Instruct или Qwen3-8B-Instruct при условии, что падение MMLU-Pro не превышало 10%. Поэтому такие проценты нельзя достоверно восстановить по одному лишь общему результату. Корректная формулировка здесь качественная: атаки могли существенно увеличить вредное поведение, сохранив большую часть возможностей рассуждения, но точный процент для каждой из названных моделей предоставленные данные не устанавливают.
Исследование также показало, что базовые и уже дообученные варианты не следуют единой закономерности устойчивости к вмешательству. Относительная защищённость могла различаться между семействами: для вариантов Llama 3 и Qwen3 авторы сообщают противоположные тенденции. 6
Нет. Пять протестированных моделей с усиленными механизмами защиты — в том числе варианты ReFAT и Circuit Breaking — также оказались уязвимыми к набору атак. В некоторых сценариях эти методы повышали устойчивость, однако не обеспечивали надёжного предотвращения снятия защит при всех проверенных угрозах. 25
В сравнении методов Triplet показал себя одним из наиболее устойчивых и лучше других сохраняющих способности модели. Но это лишь перспективный результат для дальнейших исследований, а не гарантия безопасности: общий вывод TamperBench состоит в том, что ни одна из проверенных защит не устранила проблему вмешательства по всему набору тестов. 6
Результат не означает, что модели с открытыми весами бесполезны или обязательно будут использованы во вред. Открытая публикация может поддерживать исследования, аудит и подотчётность. Более узкий и практический вывод таков: успешная стандартная проверка безопасности перед релизом не доказывает, что модель останется безопасной после свободного изменения её весов. 5
У закрытых коммерческих моделей и API-сервисов есть связанные риски, включая вопросы дообучения и безопасности после кастомизации. Однако их поставщики сохраняют больший контроль над обучением и средой развёртывания. Это позволяет применять защитные меры во время дообучения или после настройки — возможности, которые гораздо сложнее обеспечить после свободного распространения весов. 25
TamperBench обращает внимание не на единичный промпт, который случайно обходит отказ, а на сценарий, в котором полезные способности модели сохраняются после снятия защит. Изменённую модель потенциально можно многократно использовать для вредных задач — например, для масштабного распространения дезинформации, фишинга и мошеннических схем или подготовки опасных технических инструкций. Авторы рассматривают это как возможное следствие сохранения функциональности после удаления защит, а не как измеренный в рамках бенчмарка объём реальных злоупотреблений. 5
Для организаций, выбирающих ИИ-модели, практический вывод — разделять два вида проверок:
Исследователи призывают развивать методы защиты от вмешательства, проводить стандартизированные adversarial-тесты вроде TamperBench до выпуска моделей и переходить к более доказательной оценке ИИ при закупках. Особенно важен такой подход для сфер с высокой ценой ошибки — здравоохранения, выявления мошенничества, образования и государственных услуг, где поведение модели после релиза может быть не менее важным, чем её первоначальный показатель безопасности. 25
TamperBench не утверждает, что каждая модель с открытыми весами обязательно будет использована во вред. Исследование показывает другое: среди 21 проверенной модели защитные механизмы не давали надёжной гарантии после того, как злоумышленник получал возможность изменить модель.
Обычно наиболее эффективной категорией была скрытая атака jailbreak-tuning. Дополнительные защиты помогали в отдельных случаях, но не закрывали проблему полностью. При этом предоставленные материалы не позволяют назвать точные проценты роста вредных ответов для отдельных моделей Llama или Qwen3.
Для моделей с открытыми весами проверять нужно не только то, что система умеет делать при выпуске, но и то, какая часть её безопасного поведения сохраняется после модификации.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Все 21 протестированная модель с открытыми весами оказалась уязвимой хотя бы к одной из девяти атак, причём часто без падения результата MMLU Pro более чем на 10%.
Все 21 протестированная модель с открытыми весами оказалась уязвимой хотя бы к одной из девяти атак, причём часто без падения результата MMLU Pro более чем на 10%. Наиболее эффективными обычно были скрытые атаки jailbreak tuning — варианты с конкурирующими целями, бэкдорами и модификацией стиля.
Модели с дополнительными защитами, включая варианты ReFAT и Circuit Breaking, повысили устойчивость в отдельных сценариях, но не дали надёжной гарантии сохранения безопасности.