TamperBench wykazał, że wszystkie 21 testowanych modeli z otwartymi wagami było podatnych na co najmniej jedno z dziewięciu zagrożeń związanych z modyfikacją, często bez spadku wyniku rozumowania MMLU Pro większego ni... Najskuteczniejszą kategorią ataków było zazwyczaj ukryte dostrajanie jailbreakowe, w tym wariant...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Wynik badania TamperBench jest jednoznaczny: żaden z 21 ocenianych modeli językowych z otwartymi wagami nie miał zabezpieczeń, które niezawodnie wytrzymałyby wszystkie testowane scenariusze manipulacji. Modele obejmowały zakres od około 600 milionów do 8 miliardów parametrów, a wśród nich znalazły się zarówno standardowe, jak i wzmocnione warianty. W przypadku każdego modelu znaleziono co najmniej jeden atak, który zwiększał skłonność do generowania szkodliwych treści, przy zachowaniu znacznej części ogólnych możliwości modelu. 256
To istotne, ponieważ modele z publicznie dostępnymi wagami można kopiować, dostrajać i ponownie rozpowszechniać. Zabezpieczenie działające podczas pierwotnych testów dewelopera nie musi więc pozostać skuteczne, gdy użytkownicy mogą zmieniać parametry modelu.
TamperBench zaprojektowano do pomiaru odporności na manipulację, a nie tylko odporności na klasyczne jailbreaki przeprowadzane za pomocą odpowiednio skonstruowanych promptów. Framework łączy ataki polegające na dostrajaniu w przestrzeni wag z metodami ingerującymi w ukryte reprezentacje modelu. Następnie sprawdza zarówno zachowanie związane z bezpieczeństwem, jak i zachowane zdolności użytkowe. Dla każdej pary model–atak badacze systematycznie przeszukiwali hiperparametry, zamiast opierać wynik na jednej konfiguracji ataku. 2
Badanie objęło dziewięć reżimów manipulacji, w tym:
Nie sprawdzano wyłącznie tego, czy da się skłonić model do niebezpiecznych odpowiedzi. Badacze szukali ataków, które zwiększały odsetek szkodliwych reakcji, a jednocześnie ograniczały spadek dokładności rozumowania w teście MMLU-Pro do maksymalnie 10% względem modelu niezaatakowanego. 2
Najpoważniejsze wyniki przynosiły zazwyczaj ataki typu jailbreak-tuning, czyli dostrajanie ukierunkowane na osłabienie odmów modelu. W badaniu uwzględniono między innymi warianty wykorzystujące konkurujące cele, backdoory oraz modulację stylu. Ich znaczenie wynikało z tego, że mogły bazować głównie na pozornie nieszkodliwych danych, z niewielką domieszką treści szkodliwych. Nie przypominało to więc zwykłego, topornego przetrenowania modelu do niebezpiecznych zachowań, lecz raczej celową próbę zmiany jego reakcji bezpieczeństwa przy zachowaniu użyteczności. 26
Szerszy wniosek z pracy jest niepokojący: bezpieczeństwo i zdolności modelu można rozdzielić w niekorzystny sposób. Manipulacja może osłabić odmawianie odpowiedzi bez proporcjonalnego zniszczenia jakości rozumowania. Model nadal może dobrze wypadać w tradycyjnych benchmarkach, a jednocześnie stać się znacznie bardziej ryzykowny w użyciu.
TamperBench objął 21 modeli z otwartymi wagami, należących do rodzin takich jak Llama, Qwen3 i Mistral, o rozmiarze od 0,6 do 8 miliardów parametrów. Dostępne dowody potwierdzają wniosek dotyczący całego benchmarku: każdy testowany model był podatny na co najmniej jeden z ocenianych ataków. 56
Jednocześnie przekazane materiały źródłowe nie podają dokładnych, indywidualnych wzrostów wyniku szkodliwości dla Llama-3-8B-Instruct ani Qwen3-8B-Instruct przy ograniczeniu spadku MMLU-Pro do maksymalnie 10%. Tych wartości nie należy wyprowadzać z wyniku zbiorczego. Uzasadniony jest jedynie wniosek jakościowy: ataki mogły wyraźnie zwiększyć szkodliwe zachowania, zachowując znaczną część zdolności rozumowania modeli, lecz dostępne dane nie pozwalają podać precyzyjnego procentowego wzrostu dla żadnego z tych dwóch modeli.
Badanie wykazało również, że modele bazowe i warianty po dodatkowym treningu nie tworzyły jednego uniwersalnego wzorca odporności. Względna odporność mogła różnić się między rodzinami modeli — w przypadku wariantów Llama 3 i Qwen3 odnotowano przeciwne tendencje. 6
Nie. Pięć testowanych modeli z dodatkowymi mechanizmami ochronnymi — w tym warianty ReFAT i Circuit Breaking — również było podatnych na zestaw ataków. Zabezpieczenia poprawiały odporność w niektórych warunkach, ale nie zapobiegały niezawodnie usunięciu ochrony w całym badanym spektrum zagrożeń. 25
W porównywanych rozwiązaniach jednym z bardziej odpornych i najlepiej zachowujących możliwości modelu mechanizmów okazał się Triplet. To obiecujący sygnał badawczy, a nie gwarancja bezpieczeństwa: główny wynik TamperBench pozostaje taki, że żadne z testowanych zabezpieczeń nie wyeliminowało problemu manipulacji w całym zestawie ataków. 6
Wynik nie oznacza, że modele z otwartymi wagami są z definicji bezużyteczne. Publiczny dostęp do wag może wspierać badania, audyty i rozliczalność twórców. Węższy, ale ważny wniosek brzmi: przejście standardowych testów zgodności i bezpieczeństwa przed publikacją nie powinno być traktowane jako dowód, że model pozostanie bezpieczny po swobodnej modyfikacji wag. 5
Zamknięte modele komercyjne i usługi API również mogą mierzyć się z pytaniami o dostrajanie oraz bezpieczeństwo po personalizacji. Ich dostawcy zachowują jednak większą kontrolę nad procesem treningu i środowiskiem wdrożeniowym. Dzięki temu mogą stosować zabezpieczenia podczas dostrajania lub po nim — co jest znacznie trudniejsze, gdy wagi zostały już publicznie rozpowszechnione. 25
Ryzyko wskazane przez TamperBench nie sprowadza się do sytuacji, w której pojedyncza osoba znajduje jeden prompt omijający odmowę. Jeżeli manipulacja zachowuje użyteczne zdolności modelu, zmodyfikowany system może być wielokrotnie wykorzystywany do szkodliwych celów, takich jak masowa dezinformacja, phishing i oszustwa czy niebezpieczne wsparcie techniczne. Badacze przedstawiają te scenariusze jako konsekwencje usuwania zabezpieczeń przy zachowaniu możliwości modelu, a nie jako zmierzone przypadki nadużyć przeprowadzone w ramach benchmarku. 5
Dla organizacji wybierających modele praktyczny wniosek jest prosty: należy odróżniać:
Badacze apelują o rozwój silniejszych metod zwiększania odporności na manipulację, standaryzację testów adversarialnych — takich jak TamperBench — przed publikacją modeli oraz o bardziej oparte na dowodach podejście do oceny i zakupu systemów AI. Wskazują przy tym na obszary o dużym wpływie społecznym, między innymi ochronę zdrowia, wykrywanie oszustw, edukację i usługi publiczne. W takich zastosowaniach zachowanie modelu po udostępnieniu może być równie ważne jak jego początkowy profil bezpieczeństwa. 25
TamperBench nie dowodzi, że każdy model z otwartymi wagami zostanie wykorzystany w złym celu. Pokazuje natomiast, że wśród 21 przebadanych modeli zabezpieczenia nie były niezawodną gwarancją po uzyskaniu przez atakującego możliwości modyfikowania modelu. Najsilniejszą kategorią ataków było zazwyczaj ukryte dostrajanie jailbreakowe; dodatkowe zabezpieczenia pomagały w części przypadków, ale nie zamknęły problemu. Dostępne materiały nie uzasadniają natomiast podawania precyzyjnych wartości wzrostu szkodliwości dla poszczególnych modeli Llama czy Qwen3.
W przypadku modeli publikowanych z otwartymi wagami ocena bezpieczeństwa powinna sprawdzać nie tylko to, co model potrafi w chwili premiery, lecz także to, jaka część jego zabezpieczeń przetrwa późniejszą modyfikację.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench wykazał, że wszystkie 21 testowanych modeli z otwartymi wagami było podatnych na co najmniej jedno z dziewięciu zagrożeń związanych z modyfikacją, często bez spadku wyniku rozumowania MMLU Pro większego ni...
TamperBench wykazał, że wszystkie 21 testowanych modeli z otwartymi wagami było podatnych na co najmniej jedno z dziewięciu zagrożeń związanych z modyfikacją, często bez spadku wyniku rozumowania MMLU Pro większego ni... Najskuteczniejszą kategorią ataków było zazwyczaj ukryte dostrajanie jailbreakowe, w tym warianty oparte na konkurujących celach, backdoorach i modulacji stylu.
Modele z dodatkowymi zabezpieczeniami, w tym warianty ReFAT i Circuit Breaking, były bardziej odporne w niektórych warunkach, ale nie zapewniły niezawodnej ochrony przed usunięciem zabezpieczeń.