TamperBench встановив, що всі 21 протестована open weight модель були вразливими щонайменше до однієї з дев’яти атак на захист, часто без падіння результатів MMLU Pro більш ніж на 10%. Найефективнішою категорією зазвичай виявилося приховане jailbreak доопрацювання, зокрема атаки з конкуруючими цілями, бекдорами та м...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Висновок TamperBench звучить однозначно: жодна з 21 open-weight мовної моделі, протестованої в межах дослідження, не мала захистів, які надійно витримували всі перевірені способи втручання. До вибірки увійшли моделі з приблизно 600 мільйонами до 8 мільярдів параметрів, зокрема звичайні та посилені захисними механізмами версії. Для кожної моделі знайшлася щонайменше одна атака, що підвищувала готовність генерувати шкідливий контент, водночас зберігаючи значну частину загальних можливостей. 256
Це важливо саме для моделей із відкритими вагами: після релізу їх можна копіювати, донавчати й поширювати незалежно від початкового розробника. Захисний шар, який працює під час первинної оцінки, не обов’язково залишається надійним контролем, якщо користувачі можуть змінювати ваги моделі.
TamperBench створили для вимірювання стійкості до втручання, а не лише звичайної стійкості до jailbreak-запитів. Фреймворк поєднує атаки через донавчання у просторі ваг з атаками, які маніпулюють латентними представленнями, а потім оцінює і безпечність поведінки, і збережені можливості моделі. Для кожної пари «модель — атака» дослідники систематично перебирали гіперпараметри, а не покладалися на одну конфігурацію атаки. 2
Дослідження охопило дев’ять режимів втручання, серед яких:
Ключовим було не просто питання, чи можна зробити модель небезпечною. Дослідники шукали атаки, які збільшували кількість шкідливих відповідей, але водночас обмежували падіння точності міркування на MMLU-Pro максимум 10% порівняно з незміненою моделлю. 2
Найсерйозніші результати зазвичай давали атаки типу jailbreak-донавчання. У дослідженні розглядалися, зокрема, підходи з конкуруючими цілями, бекдором і модулюванням стилю. Вони особливо показові, оскільки могли використовувати переважно нешкідливі навчальні дані з невеликою домішкою шкідливих прикладів. Тобто йшлося не про грубе перенавчання моделі на небезпечну поведінку, а про цілеспрямовану зміну її реакцій на запити про безпеку зі збереженням корисності. 26
Ширший висновок роботи полягає в тому, що безпеку й функціональність моделі можна розділити — причому не на користь безпеки. Втручання здатне послабити відмови від небезпечних запитів, не знищуючи пропорційно здатність моделі міркувати. Тому модель може й надалі демонструвати добрі результати на стандартних бенчмарках, але водночас стати значно ризикованішою для розгортання.
TamperBench оцінив 21 open-weight-модель із діапазоном від 0,6 до 8 млрд параметрів, зокрема представників сімейств Llama, Qwen3 і Mistral. Надані матеріали дослідження підтверджують загальний висновок бенчмарку: кожна протестована модель виявилася вразливою щонайменше до однієї з оцінених атак. 56
Водночас доступні джерела не містять точних показників зростання шкідливості для Llama-3-8B-Instruct або Qwen3-8B-Instruct за умови, що погіршення результату MMLU-Pro не перевищує 10%. Тому ці числові значення не можна надійно виводити із загального результату. Обґрунтований висновок є порівняльним і якісним: атаки могли істотно посилити небезпечну поведінку, зберігши значну частину здатності моделей до міркування, але надані матеріали не підтверджують конкретний відсоток для жодної з названих моделей.
Дослідження також показало, що базові та посттренувальні версії не мають єдиного універсального рівня стійкості до втручання. Їхні результати могли відрізнятися залежно від сімейства моделей, причому для варіантів Llama 3 і Qwen3 спостерігалися протилежні тенденції. 6
Ні. П’ять протестованих моделей із посиленими захисними механізмами, включно з варіантами ReFAT і Circuit Breaking, також виявилися вразливими до набору атак. У деяких сценаріях ці методи підвищували стійкість, але не забезпечували надійного запобігання зняттю захистів за всіма перевіреними загрозами. 25
Серед оцінених підходів дослідники називають Triplet одним із найстійкіших і найкращих за збереженням можливостей моделі. Це важливий сигнал для подальших досліджень, але не остаточна гарантія: головний результат бенчмарку полягає в тому, що жоден із протестованих захистів не усунув проблему втручання в усьому наборі атак. 6
Результати не означають, що моделі з відкритими вагами самі по собі не мають цінності. Відкритий реліз може сприяти дослідженням, аудиту та підзвітності. Вужчий, але принциповий висновок інший: проходження стандартної перевірки узгодженості або безпеки перед релізом не доводить, що модель залишиться безпечною після вільної модифікації її ваг. 5
Закриті комерційні моделі та API-сервіси також стикаються з питаннями безпеки під час донавчання й посттренування. Однак їхні провайдери зберігають більше контролю над навчальним процесом і середовищем розгортання. Це дає змогу застосовувати захисти на етапі донавчання або після налаштування — на відміну від ситуації, коли ваги вже публічно розповсюджені й перебувають поза контролем розробника. 25
Ризик, на який вказує TamperBench, не зводиться до того, що хтось знаходить один-єдиний запит, здатний обійти відмову моделі. Якщо втручання дає змогу зберегти корисні можливості, змінену модель потенційно можна багаторазово використовувати для шкідливих завдань — наприклад, масштабного поширення дезінформації, фішингу й шахрайства або надання небезпечних технічних інструкцій. Дослідники подають це як можливі наслідки зняття захистів зі збереженням функціональності, а не як виміряні benchmark-ом випадки реального зловживання. 5
Для організацій, які обирають AI-моделі, практичний висновок полягає в необхідності розрізняти:
Дослідники закликають розвивати сильніші методи захисту від втручання, проводити стандартизовані змагальні оцінювання на кшталт TamperBench до релізу, а також переходити до більш доказового підходу в оцінюванні та закупівлях AI-систем. Особливо це важливо для сфер із високим суспільним впливом — охорони здоров’я, виявлення шахрайства, освіти та державних послуг, де поведінка моделі після релізу може бути не менш важливою, ніж її початковий показник безпеки. 25
TamperBench не доводить, що кожну open-weight-модель обов’язково використають зі злим наміром. Дослідження показує інше: серед 21 протестованої моделі захисні механізми не були надійною гарантією після того, як зловмисник отримував можливість втручатися в модель.
Найчастіше найсильнішою категорією атак виявлялося приховане jailbreak-донавчання. Додаткові захисти допомагали в окремих сценаріях, але не закрили проблему повністю. А надані матеріали не дають підстав називати точні відсотки зростання шкідливості для окремих моделей Llama або Qwen3.
Для релізів із відкритими вагами оцінювати потрібно не лише те, що модель уміє на старті, а й те, яка частина її безпечної поведінки зберігається після модифікації.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench встановив, що всі 21 протестована open weight модель були вразливими щонайменше до однієї з дев’яти атак на захист, часто без падіння результатів MMLU Pro більш ніж на 10%.
TamperBench встановив, що всі 21 протестована open weight модель були вразливими щонайменше до однієї з дев’яти атак на захист, часто без падіння результатів MMLU Pro більш ніж на 10%. Найефективнішою категорією зазвичай виявилося приховане jailbreak доопрацювання, зокрема атаки з конкуруючими цілями, бекдорами та модулюванням стилю.
Моделі з додатковими захисними механізмами, серед них варіанти ReFAT і Circuit Breaking, у деяких умовах ставали стійкішими, але не давали надійної гарантії збереження безпеки.