Ingen av de 21 testade öppna AI modellerna hade säkerhetsskydd som stod emot alla de manipulationsmetoder som ingick i TamperBench. Modellerna kunde göras betydligt mer benägna att generera skadligt innehåll, samtidigt som mycket av deras resonemangsförmåga bevarades.
Publicerad avBilder genererade med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
TamperBench drog slutsatsen att ingen av de 21 testade öppna AI-modellerna hade säkerhetsskydd som var tillräckligt robusta för att stå emot de undersökta manipulationshoten. Samtliga modeller kunde genom minst en angreppsmetod göras betydligt mer benägna att producera skadliga svar, samtidigt som en stor del av deras ursprungliga resonemangsförmåga behölls. Forskarna beskriver därför dagens skydd som otillräckliga garantier för modeller vars vikter kan ändras efter lansering. 2
5
Modellerna omfattade bland annat Llama, Qwen3 och Mistral, med storlekar från 600 miljoner till 8 miljarder parametrar. Studien presenterades vid ACM KDD ’26, en internationell konferens om kunskapsutvinning och dataanalys.
TamperBench testade nio metoder som manipulerar modellens vikter eller latenta representationer. Angreppen omfattade bland annat:
De mest allvarliga angreppen var vanligtvis dolda jailbreak-finfjusteringar. Särskilt framträdande var varianter med konkurrerande mål, bakdörrar och stilmodulering. Dessa tränades huvudsakligen på godartade data, men innehöll en mindre skadlig komponent som kunde försvaga säkerhetsspärrarna utan att modellens övriga beteende förändrades lika tydligt. 2
Forskarna valde angrepp som maximerade modellernas skadliga svar, men samtidigt begränsade försämringen i problemlösning. För att räknas som ett relevant resultat fick MMLU-Pro-resultatet – ett mer krävande test av språkförståelse och resonemang – falla med högst 10 procent jämfört med den omanipulerade modellen. 2
Det tillgängliga underlaget anger inte de exakta ökningen i skadliga svar för varje enskild modell. Därför går det inte att ange ett tillförlitligt numeriskt resultat specifikt för Llama-3-8B-Instruct eller Qwen3-8B-Instruct.
De fem försvarsförstärkta modeller som ingick i testet, däribland varianter med ReFAT och Circuit Breaking, var också sårbara. Sådana metoder förbättrade motståndskraften i vissa situationer, men hindrade inte på ett tillförlitligt sätt att säkerhetsskydden avlägsnades över hela uppsättningen angrepp. 2
5
Det är särskilt relevant för öppna modeller. När modellvikter publiceras kan de kopieras, finjusteras och distribueras vidare utan att den ursprungliga utvecklaren längre kan kontrollera vilka skydd som används vid den fortsatta driften. 2
Forskarna hävdar inte att öppna modeller saknar värde. Öppenhet kan bidra till forskning, granskning och ansvarsskyldighet. Men resultaten visar att en modell inte bör betraktas som säker enbart för att den klarat vanliga tester före lansering. 5
Även kommersiella modeller som nås via slutna API:er kan i princip möta liknande risker. Skillnaden är att leverantören där normalt kontrollerar finjustering och drift och därför kan lägga till försvar under eller efter finjusteringen – något som blir svårare när öppna vikter fritt kopieras och distribueras. 2
5
En viktig risk är att en angripare kan ta bort skydden utan att samtidigt förstöra modellens användbarhet. Det kan göra det möjligt att skala upp missbruk, exempelvis genom masspridning av desinformation, mer avancerade nätfiskeförsök och bedrägerier eller skadlig teknisk vägledning. 5
Forskarna efterlyser därför mer forskning om manipulationsresistens, standardiserade motståndstester som TamperBench före lansering och mer evidensbaserade metoder för AI-utvärdering och upphandling. Det blir särskilt viktigt när myndigheter och andra samhällsaktörer använder AI inom bland annat vård, bedrägeribekämpning och utbildning. 2
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ingen av de 21 testade öppna AI modellerna hade säkerhetsskydd som stod emot alla de manipulationsmetoder som ingick i TamperBench.
Ingen av de 21 testade öppna AI modellerna hade säkerhetsskydd som stod emot alla de manipulationsmetoder som ingick i TamperBench. Modellerna kunde göras betydligt mer benägna att generera skadligt innehåll, samtidigt som mycket av deras resonemangsförmåga bevarades.
De mest allvarliga angreppen var vanligtvis dolda jailbreak baserade finjusteringar, bland annat varianter med konkurrerande mål, bakdörrar och stilmodulering.
Ingen av de 21 testade öppna AI modellerna hade säkerhetsskydd som stod emot alla de manipulationsmetoder som ingick i TamperBench. Modellerna kunde göras betydligt mer benägna att generera skadligt innehåll, samtidigt som mycket av deras resonemangsförmåga bevarades.
Publicerad avBilder genererade med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
TamperBench drog slutsatsen att ingen av de 21 testade öppna AI-modellerna hade säkerhetsskydd som var tillräckligt robusta för att stå emot de undersökta manipulationshoten. Samtliga modeller kunde genom minst en angreppsmetod göras betydligt mer benägna att producera skadliga svar, samtidigt som en stor del av deras ursprungliga resonemangsförmåga behölls. Forskarna beskriver därför dagens skydd som otillräckliga garantier för modeller vars vikter kan ändras efter lansering. 2
5
Modellerna omfattade bland annat Llama, Qwen3 och Mistral, med storlekar från 600 miljoner till 8 miljarder parametrar. Studien presenterades vid ACM KDD ’26, en internationell konferens om kunskapsutvinning och dataanalys.
TamperBench testade nio metoder som manipulerar modellens vikter eller latenta representationer. Angreppen omfattade bland annat:
De mest allvarliga angreppen var vanligtvis dolda jailbreak-finfjusteringar. Särskilt framträdande var varianter med konkurrerande mål, bakdörrar och stilmodulering. Dessa tränades huvudsakligen på godartade data, men innehöll en mindre skadlig komponent som kunde försvaga säkerhetsspärrarna utan att modellens övriga beteende förändrades lika tydligt. 2
Forskarna valde angrepp som maximerade modellernas skadliga svar, men samtidigt begränsade försämringen i problemlösning. För att räknas som ett relevant resultat fick MMLU-Pro-resultatet – ett mer krävande test av språkförståelse och resonemang – falla med högst 10 procent jämfört med den omanipulerade modellen. 2
Det tillgängliga underlaget anger inte de exakta ökningen i skadliga svar för varje enskild modell. Därför går det inte att ange ett tillförlitligt numeriskt resultat specifikt för Llama-3-8B-Instruct eller Qwen3-8B-Instruct.
De fem försvarsförstärkta modeller som ingick i testet, däribland varianter med ReFAT och Circuit Breaking, var också sårbara. Sådana metoder förbättrade motståndskraften i vissa situationer, men hindrade inte på ett tillförlitligt sätt att säkerhetsskydden avlägsnades över hela uppsättningen angrepp. 2
5
Det är särskilt relevant för öppna modeller. När modellvikter publiceras kan de kopieras, finjusteras och distribueras vidare utan att den ursprungliga utvecklaren längre kan kontrollera vilka skydd som används vid den fortsatta driften. 2
Forskarna hävdar inte att öppna modeller saknar värde. Öppenhet kan bidra till forskning, granskning och ansvarsskyldighet. Men resultaten visar att en modell inte bör betraktas som säker enbart för att den klarat vanliga tester före lansering. 5
Även kommersiella modeller som nås via slutna API:er kan i princip möta liknande risker. Skillnaden är att leverantören där normalt kontrollerar finjustering och drift och därför kan lägga till försvar under eller efter finjusteringen – något som blir svårare när öppna vikter fritt kopieras och distribueras. 2
5
En viktig risk är att en angripare kan ta bort skydden utan att samtidigt förstöra modellens användbarhet. Det kan göra det möjligt att skala upp missbruk, exempelvis genom masspridning av desinformation, mer avancerade nätfiskeförsök och bedrägerier eller skadlig teknisk vägledning. 5
Forskarna efterlyser därför mer forskning om manipulationsresistens, standardiserade motståndstester som TamperBench före lansering och mer evidensbaserade metoder för AI-utvärdering och upphandling. Det blir särskilt viktigt när myndigheter och andra samhällsaktörer använder AI inom bland annat vård, bedrägeribekämpning och utbildning. 2
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ingen av de 21 testade öppna AI modellerna hade säkerhetsskydd som stod emot alla de manipulationsmetoder som ingick i TamperBench.
Ingen av de 21 testade öppna AI modellerna hade säkerhetsskydd som stod emot alla de manipulationsmetoder som ingick i TamperBench. Modellerna kunde göras betydligt mer benägna att generera skadligt innehåll, samtidigt som mycket av deras resonemangsförmåga bevarades.
De mest allvarliga angreppen var vanligtvis dolda jailbreak baserade finjusteringar, bland annat varianter med konkurrerande mål, bakdörrar och stilmodulering.