Ни одна из 21 протестированной модели с открытыми весами не выдержала все проверенные атаки на защитные механизмы. Наиболее серьёзными обычно оказывались скрытые атаки через дообучение: competing objectives, backdoor и style modulation.
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
Исследование TamperBench, представленное на конференции ACM KDD ’26, пришло к тревожному выводу: ни одна из 21 протестированной модели с открытыми весами не имела защит, достаточно устойчивых ко всем проверенным вмешательствам. В каждом случае исследователям удавалось заметно повысить готовность модели выдавать вредные ответы, сохранив при этом значительную часть её способности рассуждать. По мнению авторов, существующие меры безопасности нельзя считать надёжной гарантией для моделей, чьи веса можно свободно изменять. 25
В выборку вошли модели Llama, Qwen3, Mistral и другие системы размером от 600 миллионов до 8 миллиардов параметров. TamperBench оценивал не только безопасность, но и полезность моделей после атаки — то есть проверял, не исчезает ли вместе с защитными ограничениями их рабочая функциональность. 2
Бенчмарк охватил девять способов вмешательства в веса и скрытые представления модели. Среди них были:
Наиболее серьёзными обычно оказывались скрытые варианты jailbreak-дообучения — competing objectives, backdoor и style modulation. В этих сценариях основная часть обучающих данных выглядела безобидной, а небольшая вредоносная составляющая постепенно ослабляла защитные ограничения, не вызывая резкого падения общих результатов модели. 2
Исследователи выбирали для каждой пары «модель — атака» такие настройки, которые максимально увеличивали показатель вредности ответов. При этом падение точности на тесте рассуждений MMLU-Pro ограничивалось 10% по сравнению с моделью до вмешательства. Иными словами, речь шла не просто о том, чтобы «сломать» модель, а о проверке сценария, в котором она остаётся достаточно полезной, но становится существенно менее безопасной. 2
В опубликованных материалах нет точных значений прироста вредности отдельно для Llama-3-8B-Instruct и Qwen3-8B-Instruct. Поэтому делать вид, что для этих моделей известны конкретные числовые результаты, было бы некорректно.
Отдельно проверялись пять моделей с усиленными защитными механизмами, включая варианты ReFAT и Circuit Breaking. Такие методы действительно повышали сопротивляемость в некоторых условиях, однако не обеспечили стабильного предотвращения снятия ограничений на всём наборе атак. В материалах исследования также отмечается, что Triplet нередко демонстрировал хорошее сочетание устойчивости и сохранения способностей модели, но и это не означает абсолютной защиты от всех вариантов вмешательства. 258
Проблема особенно актуальна для открытых весов. После публикации их можно копировать, дообучать и распространять независимо от первоначального разработчика. В отличие от провайдера API, автор модели уже не может эффективно контролировать каждый последующий этап настройки и развертывания. 2
Авторы не утверждают, что открытые модели не должны существовать. Открытость помогает независимым исследователям изучать ИИ, выявлять ошибки и повышать подотчётность разработчиков. Однако успешное прохождение обычных проверок перед выпуском ещё не означает, что модель сохранит защиту после публикации изменяемых весов. 5
Исследователи также предупреждают, что похожие риски могут существовать и у закрытых коммерческих моделей. Разница в том, что поставщики API контролируют дообучение и среду выполнения и могут применять защитные меры во время настройки или после неё. При свободном распространении весов такой контроль значительно слабее. 25
Если защиту удаётся снять, не уничтожив полезные способности модели, потенциальное злоупотребление может масштабироваться. Среди возможных сценариев авторы называют массовую дезинформацию, более убедительный фишинг и мошеннические схемы, а также создание вредных технических инструкций. 5
Исследователи призывают развивать методы защиты от вмешательства, включать стандартизированные adversarial-тесты вроде TamperBench в процедуру выпуска моделей и опираться на проверяемые данные при оценке и закупке ИИ. Это особенно важно для систем, которые планируют применять в здравоохранении, борьбе с мошенничеством, образовании и других государственных сервисах. 25
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Ни одна из 21 протестированной модели с открытыми весами не выдержала все проверенные атаки на защитные механизмы.
Ни одна из 21 протестированной модели с открытыми весами не выдержала все проверенные атаки на защитные механизмы. Наиболее серьёзными обычно оказывались скрытые атаки через дообучение: competing objectives, backdoor и style modulation.
Исследователи подбирали атаки так, чтобы вредные ответы учащались, а точность MMLU Pro снижалась не более чем на 10%.