Żaden z 21 przetestowanych modeli z otwartymi wagami nie był wystarczająco odporny na oceniane metody manipulacji: każdy można było skłonić do częstszego generowania szkodliwych treści, zachowując znaczną część jego z... Najpoważniejsze okazały się zwykle ataki polegające na ukrytym dostrajaniu jailbreakowym, w tym...
Opublikowane przezObrazy wygenerowane za pomocą GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
Badanie TamperBench, zaprezentowane podczas konferencji ACM KDD ’26, przyniosło niepokojący wniosek: żaden z 21 przetestowanych modeli AI z otwartymi wagami nie miał zabezpieczeń wystarczająco odpornych na wszystkie oceniane manipulacje. Dotyczyło to modeli o rozmiarze od 600 milionów do 8 miliardów parametrów, w tym rodzin Llama, Qwen3 i Mistral. 2
5
W praktyce każdy model można było po modyfikacji wag skłonić do znacznie częstszego generowania szkodliwych odpowiedzi, jednocześnie zachowując dużą część jego pierwotnych zdolności rozumowania. Autorzy uznają to za dowód, że obecnych zabezpieczeń nie należy traktować jako gwarancji bezpieczeństwa modelu, którego wagi użytkownik może samodzielnie zmieniać. 2
5
TamperBench to ujednolicony framework do badania odporności modeli na manipulacje w przestrzeni wag i reprezentacji ukrytych. Zespół sprawdził dziewięć zagrożeń obejmujących między innymi:
Badacze wybierali konfiguracje ataków, które maksymalizowały wynik szkodliwości odpowiedzi, ale jednocześnie ograniczały spadek dokładności w teście rozumowania MMLU-Pro do najwyżej 10 proc. względem modelu nietkniętego. Oznacza to, że celem nie było wyłącznie „zepsucie” modelu — chodziło o sprawdzenie, czy można osłabić jego ochronę bez odebrania mu użyteczności. 2
Zwykle najpoważniejsze rezultaty dawały ataki określane jako covert jailbreak tuning. Warianty competing objectives, backdoor i style modulation były trenowane głównie na danych nieszkodliwych, z niewielkim udziałem komponentu szkodliwego. Dzięki temu model mógł zachować swoje możliwości, a zarazem stać się bardziej skłonny do odpowiadania na niebezpieczne prośby. 2
W przekazanych wynikach nie ma dokładnych, osobnych wartości wzrostu szkodliwości dla modeli Llama-3-8B-Instruct i Qwen3-8B-Instruct, dlatego nie można rzetelnie podać takich liczb.
Podatnych było także pięć modeli wyposażonych w dodatkowe mechanizmy obronne, w tym warianty ReFAT i Circuit Breaking. Obrony poprawiały odporność w niektórych warunkach, lecz żadna nie zapobiegła w sposób niezawodny usunięciu zabezpieczeń w całym zestawie testowanych ataków. 2
5
To szczególnie istotne w przypadku modeli z otwartymi wagami. Po ich publikacji można je kopiować, dostrajać i dalej rozpowszechniać, a twórca nie ma już pełnej kontroli nad tym, jakie zabezpieczenia zostaną zachowane w kolejnych wersjach. 2
Autorzy nie twierdzą, że modele z otwartymi wagami są pozbawione wartości. Otwartość ułatwia badania, niezależną weryfikację i rozliczalność. Sam fakt przejścia standardowych testów bezpieczeństwa przed publikacją nie powinien jednak oznaczać, że model pozostanie bezpieczny po modyfikacji wag. 5
Badacze zaznaczają również, że podobne ryzyko może dotyczyć zamkniętych modeli komercyjnych i usług API. Dostawcy takich usług zachowują jednak kontrolę nad dostrajaniem oraz wdrożeniem, dzięki czemu mogą stosować dodatkowe zabezpieczenia na etapie dostrajania lub po nim — czego nie da się zagwarantować po swobodnym rozpowszechnieniu otwartych wag. 2
5
Według autorów osłabienie zabezpieczeń przy zachowaniu zdolności modelu może ułatwić nadużycia na dużą skalę, takie jak masowa dezinformacja, zaawansowane oszustwa i phishing czy generowanie szkodliwych instrukcji technicznych. 5
Wnioski z badania wskazują na potrzebę dalszych prac nad odpornością na manipulacje, stosowania standaryzowanych testów adwersarialnych — takich jak TamperBench — przed publikacją modeli oraz bardziej opartej na dowodach oceny systemów AI. Ma to szczególne znaczenie, gdy modele trafiają do zastosowań publicznych, między innymi w ochronie zdrowia, wykrywaniu oszustw i edukacji. 2
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Żaden z 21 przetestowanych modeli z otwartymi wagami nie był wystarczająco odporny na oceniane metody manipulacji: każdy można było skłonić do częstszego generowania szkodliwych treści, zachowując znaczną część jego z...
Żaden z 21 przetestowanych modeli z otwartymi wagami nie był wystarczająco odporny na oceniane metody manipulacji: każdy można było skłonić do częstszego generowania szkodliwych treści, zachowując znaczną część jego z... Najpoważniejsze okazały się zwykle ataki polegające na ukrytym dostrajaniu jailbreakowym, w tym warianty competing objectives, backdoor i style modulation.
Podatne były także modele z dodatkowymi zabezpieczeniami, między innymi warianty ReFAT i Circuit Breaking.
Żaden z 21 przetestowanych modeli z otwartymi wagami nie był wystarczająco odporny na oceniane metody manipulacji: każdy można było skłonić do częstszego generowania szkodliwych treści, zachowując znaczną część jego z... Najpoważniejsze okazały się zwykle ataki polegające na ukrytym dostrajaniu jailbreakowym, w tym...
Opublikowane przezObrazy wygenerowane za pomocą GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
Badanie TamperBench, zaprezentowane podczas konferencji ACM KDD ’26, przyniosło niepokojący wniosek: żaden z 21 przetestowanych modeli AI z otwartymi wagami nie miał zabezpieczeń wystarczająco odpornych na wszystkie oceniane manipulacje. Dotyczyło to modeli o rozmiarze od 600 milionów do 8 miliardów parametrów, w tym rodzin Llama, Qwen3 i Mistral. 2
5
W praktyce każdy model można było po modyfikacji wag skłonić do znacznie częstszego generowania szkodliwych odpowiedzi, jednocześnie zachowując dużą część jego pierwotnych zdolności rozumowania. Autorzy uznają to za dowód, że obecnych zabezpieczeń nie należy traktować jako gwarancji bezpieczeństwa modelu, którego wagi użytkownik może samodzielnie zmieniać. 2
5
TamperBench to ujednolicony framework do badania odporności modeli na manipulacje w przestrzeni wag i reprezentacji ukrytych. Zespół sprawdził dziewięć zagrożeń obejmujących między innymi:
Badacze wybierali konfiguracje ataków, które maksymalizowały wynik szkodliwości odpowiedzi, ale jednocześnie ograniczały spadek dokładności w teście rozumowania MMLU-Pro do najwyżej 10 proc. względem modelu nietkniętego. Oznacza to, że celem nie było wyłącznie „zepsucie” modelu — chodziło o sprawdzenie, czy można osłabić jego ochronę bez odebrania mu użyteczności. 2
Zwykle najpoważniejsze rezultaty dawały ataki określane jako covert jailbreak tuning. Warianty competing objectives, backdoor i style modulation były trenowane głównie na danych nieszkodliwych, z niewielkim udziałem komponentu szkodliwego. Dzięki temu model mógł zachować swoje możliwości, a zarazem stać się bardziej skłonny do odpowiadania na niebezpieczne prośby. 2
W przekazanych wynikach nie ma dokładnych, osobnych wartości wzrostu szkodliwości dla modeli Llama-3-8B-Instruct i Qwen3-8B-Instruct, dlatego nie można rzetelnie podać takich liczb.
Podatnych było także pięć modeli wyposażonych w dodatkowe mechanizmy obronne, w tym warianty ReFAT i Circuit Breaking. Obrony poprawiały odporność w niektórych warunkach, lecz żadna nie zapobiegła w sposób niezawodny usunięciu zabezpieczeń w całym zestawie testowanych ataków. 2
5
To szczególnie istotne w przypadku modeli z otwartymi wagami. Po ich publikacji można je kopiować, dostrajać i dalej rozpowszechniać, a twórca nie ma już pełnej kontroli nad tym, jakie zabezpieczenia zostaną zachowane w kolejnych wersjach. 2
Autorzy nie twierdzą, że modele z otwartymi wagami są pozbawione wartości. Otwartość ułatwia badania, niezależną weryfikację i rozliczalność. Sam fakt przejścia standardowych testów bezpieczeństwa przed publikacją nie powinien jednak oznaczać, że model pozostanie bezpieczny po modyfikacji wag. 5
Badacze zaznaczają również, że podobne ryzyko może dotyczyć zamkniętych modeli komercyjnych i usług API. Dostawcy takich usług zachowują jednak kontrolę nad dostrajaniem oraz wdrożeniem, dzięki czemu mogą stosować dodatkowe zabezpieczenia na etapie dostrajania lub po nim — czego nie da się zagwarantować po swobodnym rozpowszechnieniu otwartych wag. 2
5
Według autorów osłabienie zabezpieczeń przy zachowaniu zdolności modelu może ułatwić nadużycia na dużą skalę, takie jak masowa dezinformacja, zaawansowane oszustwa i phishing czy generowanie szkodliwych instrukcji technicznych. 5
Wnioski z badania wskazują na potrzebę dalszych prac nad odpornością na manipulacje, stosowania standaryzowanych testów adwersarialnych — takich jak TamperBench — przed publikacją modeli oraz bardziej opartej na dowodach oceny systemów AI. Ma to szczególne znaczenie, gdy modele trafiają do zastosowań publicznych, między innymi w ochronie zdrowia, wykrywaniu oszustw i edukacji. 2
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Żaden z 21 przetestowanych modeli z otwartymi wagami nie był wystarczająco odporny na oceniane metody manipulacji: każdy można było skłonić do częstszego generowania szkodliwych treści, zachowując znaczną część jego z...
Żaden z 21 przetestowanych modeli z otwartymi wagami nie był wystarczająco odporny na oceniane metody manipulacji: każdy można było skłonić do częstszego generowania szkodliwych treści, zachowując znaczną część jego z... Najpoważniejsze okazały się zwykle ataki polegające na ukrytym dostrajaniu jailbreakowym, w tym warianty competing objectives, backdoor i style modulation.
Podatne były także modele z dodatkowymi zabezpieczeniami, między innymi warianty ReFAT i Circuit Breaking.