TamperBench zjistil, že všech 21 testovaných open weight modelů bylo zranitelných vůči nejméně jedné z devíti metod zásahu, často při poklesu výkonu v MMLU Pro o nejvýše 10 %. Nejúčinnější bývalo skryté jailbreakové dolaďování, zejména varianty založené na konkurenčních cílech, zadních vrátkách a modulaci stylu.
PublikovalUpraveno pomocí GPT-5.6 LunaObrázky vytvořeny pomocí GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Výsledek benchmarku TamperBench je znepokojivě jednoznačný: žádný z 21 testovaných open-weight jazykových modelů neměl bezpečnostní ochrany, které by spolehlivě odolaly všem zkoušeným způsobům zásahu. Testované modely měly přibližně 600 milionů až 8 miliard parametrů a zahrnovaly běžné i modely s dodatečnými obrannými mechanismy. U každého z nich se podařilo alespoň jedním útokem zvýšit ochotu generovat škodlivý obsah, aniž by model přišel o většinu svých obecných schopností. 2
5
6
To je důležité hlavně proto, že open-weight modely lze po zveřejnění kopírovat, dolaďovat a znovu distribuovat. Bezpečnostní vrstva, která obstojí při původním hodnocení vývojáře, proto nemusí být trvalou kontrolou ve chvíli, kdy mohou uživatelé měnit samotné váhy modelu.
TamperBench neměří pouze odolnost vůči běžným jailbreakovým promptům. Jeho cílem je odolnost proti zásahu do modelu neboli tamper resistance. Framework kombinuje útoky prostřednictvím dolaďování ve váhovém prostoru s útoky, které manipulují latentními reprezentacemi. Následně sleduje jak bezpečnostní chování, tak zachované schopnosti modelu. Pro každou dvojici model–útok vědci systematicky prohledávali nastavení hyperparametrů, místo aby se spoléhali na jedinou konfiguraci útoku. 2
Studie zahrnovala devět režimů zásahu, mimo jiné:
Klíčové nebylo pouze zjistit, zda lze model učinit nebezpečnějším. Výzkumníci hledali útoky, které zvýší míru škodlivých odpovědí, zatímco pokles přesnosti v úlohách MMLU-Pro zůstane do 10 % oproti modelu bez zásahu. MMLU-Pro je náročný víceoborový benchmark zaměřený mimo jiné na uvažování, matematiku, přírodní vědy a společenské vědy. 2
Nejzávažnější výsledky obecně přinesly útoky typu jailbreakového dolaďování. Studie uvádí varianty založené na konkurenčních cílech, zadních vrátkách a modulaci stylu. Pozoruhodné je, že pracovaly převážně s neškodnými trénovacími daty a jen s menší škodlivou složkou. Nešlo tedy o hrubý pokus přeškolit model na nebezpečné chování, ale spíše o cílenou změnu jeho bezpečnostních reakcí při zachování užitečnosti. 2
6
Širší závěr studie je nepříjemný: bezpečnost a schopnosti modelu lze oddělit způsobem, který nahrává útočníkovi. Zásah může oslabit odmítání nebezpečných požadavků, aniž by úměrně zničil schopnost modelu řešit běžné úlohy. Model tak může dál působit dobře v tradičních benchmarcích, ale být výrazně rizikovější při nasazení.
TamperBench hodnotil 21 open-weight modelů s velikostí od 0,6 do 8 miliard parametrů, včetně rodin Llama, Qwen3 a Mistral. Dostupné podklady podporují celkový závěr benchmarku: každý testovaný model byl zranitelný vůči alespoň jednomu z hodnocených útoků. 5
6
Dostupné zdroje však neuvádějí přesné zvýšení škodlivosti u modelů Llama-3-8B-Instruct a Qwen3-8B-Instruct při podmínce, že zhoršení MMLU-Pro nepřesáhne 10 %. Tyto konkrétní procentní hodnoty proto nelze z celkového výsledku odvozovat. Spolehlivý závěr je kvalitativní: útoky dokázaly výrazně zvýšit škodlivé chování a současně zachovat podstatnou část schopností modelů, ale dodané podklady nestanovují přesné procento pro žádný z těchto dvou jmenovaných modelů.
Studie také ukázala, že základní a post-trénované varianty nemají jeden univerzální vzorec odolnosti. Relativní odolnost se může lišit mezi rodinami modelů; u variant Llama 3 a Qwen3 byly popsány i opačné trendy. 6
Ne. Pět testovaných modelů s posílenou ochranou — včetně variant ReFAT a Circuit Breaking — bylo vůči sadě útoků rovněž zranitelných. Obrany v některých situacích odolnost zlepšily, nedokázaly však spolehlivě zabránit odstranění bezpečnostního chování napříč všemi testovanými hrozbami. 2
5
Z porovnávaných metod vyšel jako jedna z odolnějších a zároveň schopnosti lépe zachovávajících obran Triplet. Jde o slibný výzkumný signál, nikoli o záruku. Hlavní výsledek benchmarku zůstává stejný: žádná z testovaných obran neodstranila problém se zásahy v celé testovací sadě. 6
Studie netvrdí, že open-weight modely nemají hodnotu. Veřejně dostupné váhy mohou podporovat výzkum, audit i větší odpovědnost vývojářů. Užší, ale zásadní poučení zní: úspěšné běžné hodnocení bezpečnosti před vydáním není důkazem, že model zůstane bezpečný i po volně dostupných úpravách vah. 5
Uzavřené komerční modely a API služby čelí souvisejícím otázkám kolem dolaďování a bezpečnosti po úpravách. Jejich poskytovatelé však mají větší kontrolu nad trénovacím procesem i prostředím, ve kterém se model nasazuje. Mohou tak uplatnit ochrany během dolaďování nebo po něm — což je mnohem obtížnější, jakmile jsou váhy veřejně rozšířené. 2
5
Riziko popsané v TamperBench nespočívá jen v tom, že někdo najde jediný prompt, který prolomí odmítnutí. Pokud si upravený model zachová užitečné schopnosti, může být opakovaně nasazen ke škodlivým účelům, například pro rozsáhlé dezinformační kampaně, phishing a podvody nebo nebezpečné technické instrukce. Výzkumníci tyto scénáře uvádějí jako důsledky odstranění zábran při zachování schopností; benchmark sám žádné takové zneužití neměřil. 5
Organizace vybírající modely by proto měly rozlišovat mezi:
Autoři volají po robustnějších metodách zvyšování odolnosti, standardizovaných adversariálních testech, jako je TamperBench, před vydáním modelu a po hodnocení AI založeném na důkazech. To se týká zejména oblastí s vysokým dopadem, například zdravotnictví, odhalování podvodů, vzdělávání a veřejných služeb, kde může být chování modelu po vydání stejně důležité jako jeho původní bezpečnostní profil. 2
5
TamperBench nedokazuje, že každý open-weight model bude zneužit. Ukazuje ale, že u všech 21 testovaných modelů nebyla bezpečnost spolehlivou zárukou ve chvíli, kdy útočník mohl do modelu zasáhnout. Nejúčinnější bývalo skryté jailbreakové dolaďování, dodatečné obrany pomáhaly jen v některých případech a dostupné podklady nepodporují přesná procenta zvýšení škodlivosti pro jednotlivé modely Llama nebo Qwen3.
U open-weight modelů proto nestačí testovat pouze to, co dokážou při uvedení na trh. Stejně důležité je ověřit, kolik jejich bezpečnostního chování přežije následnou úpravu.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench zjistil, že všech 21 testovaných open weight modelů bylo zranitelných vůči nejméně jedné z devíti metod zásahu, často při poklesu výkonu v MMLU Pro o nejvýše 10 %.
TamperBench zjistil, že všech 21 testovaných open weight modelů bylo zranitelných vůči nejméně jedné z devíti metod zásahu, často při poklesu výkonu v MMLU Pro o nejvýše 10 %. Nejúčinnější bývalo skryté jailbreakové dolaďování, zejména varianty založené na konkurenčních cílech, zadních vrátkách a modulaci stylu.
Modely s dodatečnými obranami, včetně variant ReFAT a Circuit Breaking, v některých situacích odolnost zlepšily, neposkytly však spolehlivou ochranu před odstraněním bezpečnostních zábran.
TamperBench zjistil, že všech 21 testovaných open weight modelů bylo zranitelných vůči nejméně jedné z devíti metod zásahu, často při poklesu výkonu v MMLU Pro o nejvýše 10 %. Nejúčinnější bývalo skryté jailbreakové dolaďování, zejména varianty založené na konkurenčních cílech, zadních vrátkách a modulaci stylu.
PublikovalUpraveno pomocí GPT-5.6 LunaObrázky vytvořeny pomocí GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Výsledek benchmarku TamperBench je znepokojivě jednoznačný: žádný z 21 testovaných open-weight jazykových modelů neměl bezpečnostní ochrany, které by spolehlivě odolaly všem zkoušeným způsobům zásahu. Testované modely měly přibližně 600 milionů až 8 miliard parametrů a zahrnovaly běžné i modely s dodatečnými obrannými mechanismy. U každého z nich se podařilo alespoň jedním útokem zvýšit ochotu generovat škodlivý obsah, aniž by model přišel o většinu svých obecných schopností. 2
5
6
To je důležité hlavně proto, že open-weight modely lze po zveřejnění kopírovat, dolaďovat a znovu distribuovat. Bezpečnostní vrstva, která obstojí při původním hodnocení vývojáře, proto nemusí být trvalou kontrolou ve chvíli, kdy mohou uživatelé měnit samotné váhy modelu.
TamperBench neměří pouze odolnost vůči běžným jailbreakovým promptům. Jeho cílem je odolnost proti zásahu do modelu neboli tamper resistance. Framework kombinuje útoky prostřednictvím dolaďování ve váhovém prostoru s útoky, které manipulují latentními reprezentacemi. Následně sleduje jak bezpečnostní chování, tak zachované schopnosti modelu. Pro každou dvojici model–útok vědci systematicky prohledávali nastavení hyperparametrů, místo aby se spoléhali na jedinou konfiguraci útoku. 2
Studie zahrnovala devět režimů zásahu, mimo jiné:
Klíčové nebylo pouze zjistit, zda lze model učinit nebezpečnějším. Výzkumníci hledali útoky, které zvýší míru škodlivých odpovědí, zatímco pokles přesnosti v úlohách MMLU-Pro zůstane do 10 % oproti modelu bez zásahu. MMLU-Pro je náročný víceoborový benchmark zaměřený mimo jiné na uvažování, matematiku, přírodní vědy a společenské vědy. 2
Nejzávažnější výsledky obecně přinesly útoky typu jailbreakového dolaďování. Studie uvádí varianty založené na konkurenčních cílech, zadních vrátkách a modulaci stylu. Pozoruhodné je, že pracovaly převážně s neškodnými trénovacími daty a jen s menší škodlivou složkou. Nešlo tedy o hrubý pokus přeškolit model na nebezpečné chování, ale spíše o cílenou změnu jeho bezpečnostních reakcí při zachování užitečnosti. 2
6
Širší závěr studie je nepříjemný: bezpečnost a schopnosti modelu lze oddělit způsobem, který nahrává útočníkovi. Zásah může oslabit odmítání nebezpečných požadavků, aniž by úměrně zničil schopnost modelu řešit běžné úlohy. Model tak může dál působit dobře v tradičních benchmarcích, ale být výrazně rizikovější při nasazení.
TamperBench hodnotil 21 open-weight modelů s velikostí od 0,6 do 8 miliard parametrů, včetně rodin Llama, Qwen3 a Mistral. Dostupné podklady podporují celkový závěr benchmarku: každý testovaný model byl zranitelný vůči alespoň jednomu z hodnocených útoků. 5
6
Dostupné zdroje však neuvádějí přesné zvýšení škodlivosti u modelů Llama-3-8B-Instruct a Qwen3-8B-Instruct při podmínce, že zhoršení MMLU-Pro nepřesáhne 10 %. Tyto konkrétní procentní hodnoty proto nelze z celkového výsledku odvozovat. Spolehlivý závěr je kvalitativní: útoky dokázaly výrazně zvýšit škodlivé chování a současně zachovat podstatnou část schopností modelů, ale dodané podklady nestanovují přesné procento pro žádný z těchto dvou jmenovaných modelů.
Studie také ukázala, že základní a post-trénované varianty nemají jeden univerzální vzorec odolnosti. Relativní odolnost se může lišit mezi rodinami modelů; u variant Llama 3 a Qwen3 byly popsány i opačné trendy. 6
Ne. Pět testovaných modelů s posílenou ochranou — včetně variant ReFAT a Circuit Breaking — bylo vůči sadě útoků rovněž zranitelných. Obrany v některých situacích odolnost zlepšily, nedokázaly však spolehlivě zabránit odstranění bezpečnostního chování napříč všemi testovanými hrozbami. 2
5
Z porovnávaných metod vyšel jako jedna z odolnějších a zároveň schopnosti lépe zachovávajících obran Triplet. Jde o slibný výzkumný signál, nikoli o záruku. Hlavní výsledek benchmarku zůstává stejný: žádná z testovaných obran neodstranila problém se zásahy v celé testovací sadě. 6
Studie netvrdí, že open-weight modely nemají hodnotu. Veřejně dostupné váhy mohou podporovat výzkum, audit i větší odpovědnost vývojářů. Užší, ale zásadní poučení zní: úspěšné běžné hodnocení bezpečnosti před vydáním není důkazem, že model zůstane bezpečný i po volně dostupných úpravách vah. 5
Uzavřené komerční modely a API služby čelí souvisejícím otázkám kolem dolaďování a bezpečnosti po úpravách. Jejich poskytovatelé však mají větší kontrolu nad trénovacím procesem i prostředím, ve kterém se model nasazuje. Mohou tak uplatnit ochrany během dolaďování nebo po něm — což je mnohem obtížnější, jakmile jsou váhy veřejně rozšířené. 2
5
Riziko popsané v TamperBench nespočívá jen v tom, že někdo najde jediný prompt, který prolomí odmítnutí. Pokud si upravený model zachová užitečné schopnosti, může být opakovaně nasazen ke škodlivým účelům, například pro rozsáhlé dezinformační kampaně, phishing a podvody nebo nebezpečné technické instrukce. Výzkumníci tyto scénáře uvádějí jako důsledky odstranění zábran při zachování schopností; benchmark sám žádné takové zneužití neměřil. 5
Organizace vybírající modely by proto měly rozlišovat mezi:
Autoři volají po robustnějších metodách zvyšování odolnosti, standardizovaných adversariálních testech, jako je TamperBench, před vydáním modelu a po hodnocení AI založeném na důkazech. To se týká zejména oblastí s vysokým dopadem, například zdravotnictví, odhalování podvodů, vzdělávání a veřejných služeb, kde může být chování modelu po vydání stejně důležité jako jeho původní bezpečnostní profil. 2
5
TamperBench nedokazuje, že každý open-weight model bude zneužit. Ukazuje ale, že u všech 21 testovaných modelů nebyla bezpečnost spolehlivou zárukou ve chvíli, kdy útočník mohl do modelu zasáhnout. Nejúčinnější bývalo skryté jailbreakové dolaďování, dodatečné obrany pomáhaly jen v některých případech a dostupné podklady nepodporují přesná procenta zvýšení škodlivosti pro jednotlivé modely Llama nebo Qwen3.
U open-weight modelů proto nestačí testovat pouze to, co dokážou při uvedení na trh. Stejně důležité je ověřit, kolik jejich bezpečnostního chování přežije následnou úpravu.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench zjistil, že všech 21 testovaných open weight modelů bylo zranitelných vůči nejméně jedné z devíti metod zásahu, často při poklesu výkonu v MMLU Pro o nejvýše 10 %.
TamperBench zjistil, že všech 21 testovaných open weight modelů bylo zranitelných vůči nejméně jedné z devíti metod zásahu, často při poklesu výkonu v MMLU Pro o nejvýše 10 %. Nejúčinnější bývalo skryté jailbreakové dolaďování, zejména varianty založené na konkurenčních cílech, zadních vrátkách a modulaci stylu.
Modely s dodatečnými obranami, včetně variant ReFAT a Circuit Breaking, v některých situacích odolnost zlepšily, neposkytly však spolehlivou ochranu před odstraněním bezpečnostních zábran.