Žádný z 21 testovaných open weight modelů neměl ochrany dostatečně odolné vůči všem hodnoceným způsobům manipulace. Modely bylo možné po zásahu výrazně přimět ke škodlivým odpovědím a současně zachovat podstatnou část jejich schopnosti uvažovat.
PublikovalObrázky vytvořeny pomocí GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
Studie TamperBench, představená na konferenci ACM KDD ’26, dospěla k nepříjemnému závěru: žádný z 21 testovaných open-weight velkých jazykových modelů neměl bezpečnostní ochrany dostatečně robustní vůči všem prověřovaným způsobům manipulace. U každého modelu se podařilo alespoň jedním útokem výrazně zvýšit ochotu generovat škodlivý obsah, přičemž model si zachoval značnou část svých schopností uvažovat. 2
5
Testované modely zahrnovaly mimo jiné řady Llama, Qwen3 a Mistral a pohybovaly se od 0,6 do 8 miliard parametrů. Výsledek neznamená, že jsou open-weight modely obecně bezcenné nebo nepoužitelné. Ukazuje však, že bezpečnostní testy provedené před zveřejněním modelu nelze považovat za trvalou záruku, pokud si kdokoli může stáhnout a upravit jeho váhy. 2
5
TamperBench sjednotil testování útoků pracujících přímo s parametry modelu nebo s jeho latentními reprezentacemi. Hodnocení zahrnovalo:
Výzkumníci u každé kombinace modelu a útoku hledali nastavení, které co nejvíce zvýšilo skóre škodlivých odpovědí, ale zároveň nesnížilo přesnost v testu uvažování MMLU-Pro o více než 10 % oproti neútočenému modelu. Jinými slovy, cílem nebylo model pouze „rozbít“, ale odstranit jeho ochrany při zachování praktické užitečnosti. 2
Za nejzávažnější se obvykle ukázaly skryté útoky typu jailbreak tuning. Patřily mezi ně varianty competing objectives, backdoor a style modulation, které byly trénovány převážně na neškodných datech a obsahovaly jen malou škodlivou složku. Právě díky tomu mohly být hůře odhalitelné než otevřeně škodlivé dolaďování. 2
Studie v dodaných podkladech neuvádí přesný nárůst škodlivosti pro jednotlivé modely, například Llama-3-8B-Instruct nebo Qwen3-8B-Instruct. Konkrétní číselné hodnoty proto nelze spolehlivě doplnit.
Výzkumníci testovali také pět modelů s dodatečnými obrannými mechanismy, včetně variant ReFAT a Circuit Breaking. Tyto metody mohly v některých situacích odolnost zlepšit, žádná z nich však nedokázala v celé sadě útoků spolehlivě zabránit odstranění bezpečnostních omezení. 2
5
To je zásadní rozdíl oproti uzavřeným službám provozovaným přes API. U veřejně distribuovaných vah může kdokoli vytvořit vlastní kopii, provést další fine-tuning a upravený model znovu šířit. Původní vývojář pak nemá přímou kontrolu nad tím, jaké ochrany zůstanou zachovány. 2
Autoři nevolají po opuštění open-weight modelů. Otevřenost podle nich podporuje výzkum, kontrolovatelnost i odpovědnost. Veřejné zpřístupnění modelu by však nemělo být automaticky chápáno jako bezpečné jen proto, že model prošel běžným předprodukčním testováním. 5
Výzkumníci zároveň upozorňují, že podobná rizika se mohou týkat i uzavřených komerčních modelů. Poskytovatelé, kteří kontrolují fine-tuning a nasazení, ale mohou během těchto fází použít obranné mechanismy, jež u volně distribuovaných vah později není možné vynutit. 2
5
Pokud lze bezpečnostní zábrany odstranit bez výrazného poklesu schopností, může vzniknout prostor pro rozsáhlejší zneužití — například automatizované šíření dezinformací, sofistikované phishingové kampaně a podvody nebo tvorbu škodlivých technických návodů. Riziko tak nemusí být omezené na jednotlivce, který model ručně upraví; změny lze potenciálně využít ve velkém měřítku. 5
Studie proto doporučuje intenzivnější výzkum odolnosti vůči manipulaci, standardizované adversariální testy, jako je TamperBench, ještě před vydáním modelu a rozhodování o nákupu AI založené na důkazech. To je obzvlášť důležité u systémů nasazovaných ve zdravotnictví, při odhalování podvodů, ve vzdělávání a v dalších veřejných službách. 2
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Žádný z 21 testovaných open weight modelů neměl ochrany dostatečně odolné vůči všem hodnoceným způsobům manipulace.
Žádný z 21 testovaných open weight modelů neměl ochrany dostatečně odolné vůči všem hodnoceným způsobům manipulace. Modely bylo možné po zásahu výrazně přimět ke škodlivým odpovědím a současně zachovat podstatnou část jejich schopnosti uvažovat.
Nejzávažnější bývaly skryté útoky typu jailbreak fine tuning, zejména varianty competing objectives, backdoor a style modulation.
Žádný z 21 testovaných open weight modelů neměl ochrany dostatečně odolné vůči všem hodnoceným způsobům manipulace. Modely bylo možné po zásahu výrazně přimět ke škodlivým odpovědím a současně zachovat podstatnou část jejich schopnosti uvažovat.
PublikovalObrázky vytvořeny pomocí GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
Studie TamperBench, představená na konferenci ACM KDD ’26, dospěla k nepříjemnému závěru: žádný z 21 testovaných open-weight velkých jazykových modelů neměl bezpečnostní ochrany dostatečně robustní vůči všem prověřovaným způsobům manipulace. U každého modelu se podařilo alespoň jedním útokem výrazně zvýšit ochotu generovat škodlivý obsah, přičemž model si zachoval značnou část svých schopností uvažovat. 2
5
Testované modely zahrnovaly mimo jiné řady Llama, Qwen3 a Mistral a pohybovaly se od 0,6 do 8 miliard parametrů. Výsledek neznamená, že jsou open-weight modely obecně bezcenné nebo nepoužitelné. Ukazuje však, že bezpečnostní testy provedené před zveřejněním modelu nelze považovat za trvalou záruku, pokud si kdokoli může stáhnout a upravit jeho váhy. 2
5
TamperBench sjednotil testování útoků pracujících přímo s parametry modelu nebo s jeho latentními reprezentacemi. Hodnocení zahrnovalo:
Výzkumníci u každé kombinace modelu a útoku hledali nastavení, které co nejvíce zvýšilo skóre škodlivých odpovědí, ale zároveň nesnížilo přesnost v testu uvažování MMLU-Pro o více než 10 % oproti neútočenému modelu. Jinými slovy, cílem nebylo model pouze „rozbít“, ale odstranit jeho ochrany při zachování praktické užitečnosti. 2
Za nejzávažnější se obvykle ukázaly skryté útoky typu jailbreak tuning. Patřily mezi ně varianty competing objectives, backdoor a style modulation, které byly trénovány převážně na neškodných datech a obsahovaly jen malou škodlivou složku. Právě díky tomu mohly být hůře odhalitelné než otevřeně škodlivé dolaďování. 2
Studie v dodaných podkladech neuvádí přesný nárůst škodlivosti pro jednotlivé modely, například Llama-3-8B-Instruct nebo Qwen3-8B-Instruct. Konkrétní číselné hodnoty proto nelze spolehlivě doplnit.
Výzkumníci testovali také pět modelů s dodatečnými obrannými mechanismy, včetně variant ReFAT a Circuit Breaking. Tyto metody mohly v některých situacích odolnost zlepšit, žádná z nich však nedokázala v celé sadě útoků spolehlivě zabránit odstranění bezpečnostních omezení. 2
5
To je zásadní rozdíl oproti uzavřeným službám provozovaným přes API. U veřejně distribuovaných vah může kdokoli vytvořit vlastní kopii, provést další fine-tuning a upravený model znovu šířit. Původní vývojář pak nemá přímou kontrolu nad tím, jaké ochrany zůstanou zachovány. 2
Autoři nevolají po opuštění open-weight modelů. Otevřenost podle nich podporuje výzkum, kontrolovatelnost i odpovědnost. Veřejné zpřístupnění modelu by však nemělo být automaticky chápáno jako bezpečné jen proto, že model prošel běžným předprodukčním testováním. 5
Výzkumníci zároveň upozorňují, že podobná rizika se mohou týkat i uzavřených komerčních modelů. Poskytovatelé, kteří kontrolují fine-tuning a nasazení, ale mohou během těchto fází použít obranné mechanismy, jež u volně distribuovaných vah později není možné vynutit. 2
5
Pokud lze bezpečnostní zábrany odstranit bez výrazného poklesu schopností, může vzniknout prostor pro rozsáhlejší zneužití — například automatizované šíření dezinformací, sofistikované phishingové kampaně a podvody nebo tvorbu škodlivých technických návodů. Riziko tak nemusí být omezené na jednotlivce, který model ručně upraví; změny lze potenciálně využít ve velkém měřítku. 5
Studie proto doporučuje intenzivnější výzkum odolnosti vůči manipulaci, standardizované adversariální testy, jako je TamperBench, ještě před vydáním modelu a rozhodování o nákupu AI založené na důkazech. To je obzvlášť důležité u systémů nasazovaných ve zdravotnictví, při odhalování podvodů, ve vzdělávání a v dalších veřejných službách. 2
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Žádný z 21 testovaných open weight modelů neměl ochrany dostatečně odolné vůči všem hodnoceným způsobům manipulace.
Žádný z 21 testovaných open weight modelů neměl ochrany dostatečně odolné vůči všem hodnoceným způsobům manipulace. Modely bylo možné po zásahu výrazně přimět ke škodlivým odpovědím a současně zachovat podstatnou část jejich schopnosti uvažovat.
Nejzávažnější bývaly skryté útoky typu jailbreak fine tuning, zejména varianty competing objectives, backdoor a style modulation.