Усі 21 перевірена модель із відкритими вагами можна було зробити значно схильнішою до створення шкідливих відповідей, не втрачаючи більшої частини її здатності міркувати. Найнебезпечнішими зазвичай виявилися приховані атаки типу jailbreak тюнінгу: зокрема варіанти з конкуруючими цілями, бекдором і модифікацією стилю.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
Дослідження TamperBench, представлене на конференції ACM KDD ’26, дійшло однозначного висновку: жодна з 21 протестованої великої мовної моделі з відкритими вагами не мала достатньо надійного захисту від усіх оцінених способів втручання. Кожну модель можна було зробити істотно більш схильною до створення шкідливих відповідей, водночас зберігши значну частину її здатності міркувати. 25
До вибірки увійшли моделі Llama, Qwen3, Mistral та інші системи розміром від 600 млн до 8 млрд параметрів. Відкриті ваги дають змогу дослідникам змінювати модель, але водночас означають, що після публічного релізу розробник уже не може повністю контролювати подальше тонке налаштування, копіювання та поширення системи.
TamperBench об’єднав дев’ять методів втручання у ваги моделі та її приховані представлення. Серед них були:
Найсерйознішими зазвичай виявлялися приховані атаки jailbreak-тюнінгу. Особливо небезпечними були варіанти з конкуруючими цілями, бекдором і модифікацією стилю. Їхня особливість у тому, що вони могли послаблювати захисні обмеження без очевидного руйнування загальної поведінки моделі. 2
Дослідники підбирали параметри атак так, щоб максимально підвищити показники шкідливих відповідей, але водночас не допустити падіння точності на тесті міркування MMLU-Pro більш ніж на 10% порівняно з незміненими моделями. Тобто йшлося не просто про «злам» моделі, а про зняття запобіжників із максимально можливим збереженням її корисності. 2
Для Llama-3-8B-Instruct і Qwen3-8B-Instruct у наданих матеріалах немає точних числових значень приросту шкідливих відповідей, тому надійно вказати такі показники неможливо.
Ні, повністю — не допомогли. П’ять протестованих моделей із додатковими захисними механізмами, зокрема варіанти ReFAT і Circuit Breaking, у певних умовах були стійкішими. Однак жоден із підходів не забезпечив надійного запобігання зняттю захисту проти всього набору атак TamperBench. 25
Це принципова відмінність між моделлю, яку розробник надає через контрольований API, і моделлю з відкритими вагами. У першому випадку постачальник може обмежувати тонке налаштування, контролювати інфраструктуру запуску та додавати захисти після навчання. Якщо ж ваги вільно поширюються, такі важелі контролю зникають. 25
Автори не стверджують, що відкриті моделі не мають цінності. Відкритість підтримує незалежні дослідження, аудит і підзвітність. Але сам факт проходження звичайних передрелізних тестів на узгодженість із правилами не означає, що модель залишиться безпечною після зміни її ваг. 5
Дослідники також застерігають, що подібні ризики можуть стосуватися і закритих комерційних або API-моделей. Водночас провайдери таких систем зберігають більше можливостей для контролю тонкого налаштування та розгортання, яких немає після вільного поширення відкритих ваг. 25
Якщо захисні обмеження можна зняти, не знищивши основні можливості моделі, потенційне зловживання може бути масштабним: від масової дезінформації та складніших фішингових схем до створення небезпечних технічних інструкцій. 5
Команда TamperBench закликає розвивати методи стійкості до втручання, проводити стандартизовані ворожі оцінювання перед випуском моделей і спиратися на перевірені дані під час закупівлі та оцінювання ШІ. Це особливо важливо для державних і суспільно значущих сфер — охорони здоров’я, виявлення шахрайства, освіти та інших публічних сервісів. 25
Головний практичний урок дослідження простий: для моделі з відкритими вагами безпеку не можна вважати гарантованою лише тому, що вона була безпечною до публічного релізу.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Усі 21 перевірена модель із відкритими вагами можна було зробити значно схильнішою до створення шкідливих відповідей, не втрачаючи більшої частини її здатності міркувати.
Усі 21 перевірена модель із відкритими вагами можна було зробити значно схильнішою до створення шкідливих відповідей, не втрачаючи більшої частини її здатності міркувати. Найнебезпечнішими зазвичай виявилися приховані атаки типу jailbreak тюнінгу: зокрема варіанти з конкуруючими цілями, бекдором і модифікацією стилю.
Захисні модифікації, серед яких ReFAT і Circuit Breaking, підвищували стійкість у деяких сценаріях, але не гарантували збереження захисту проти всього набору атак.