TamperBench fann att alla 21 testade AI modeller med öppna vikter var sårbara för minst ett av nio manipulationshot, ofta utan att MMLU Pro resultaten försämrades med mer än 10 procent. Dold jailbreak finjustering – särskilt varianter med konkurrerande mål, bakdörrar och stilmodulering – var vanligtvis den effektiva...
Publicerad avRedigerad med GPT-5.6 LunaBilder genererade med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Det centrala resultatet från TamperBench är tydligt: ingen av de 21 modeller med öppna vikter som testades hade säkerhetsskydd som på ett tillförlitligt sätt stod emot de manipulationsmetoder som ingick i studien. Modellerna omfattade ungefär 600 miljoner till 8 miljarder parametrar och inkluderade både standardmodeller och varianter med extra försvar. För varje testad modell fanns minst ett angrepp som gjorde modellen mer benägen att generera skadligt innehåll, samtidigt som en stor del av den allmänna kapaciteten bevarades. 2
5
6
Det spelar roll eftersom modeller med öppna vikter kan kopieras, finjusteras och distribueras vidare efter lanseringen. Ett säkerhetslager som fungerar under utvecklarens ursprungliga tester är därför inte nödvändigtvis ett hållbart skydd när användare kan ändra själva modellvikterna.
TamperBench har utformats för att mäta motståndskraft mot manipulation, snarare än den mer välkända motståndskraften mot vanliga promptbaserade jailbreakförsök. Ramverket kombinerar attacker genom finjustering i viktutrymmet med angrepp som manipulerar latenta representationer. Därefter mäts både modellens säkerhetsbeteende och hur mycket av dess användbara kapacitet som finns kvar. Forskarna använde systematiska sökningar efter hyperparametrar för varje kombination av modell och angrepp, i stället för att förlita sig på en enda attackkonfiguration. 2
Studien omfattade nio manipulationsregimer, bland annat:
Det avgörande testet var inte bara om en modell kunde göras osäker. Forskarna letade efter angrepp som ökade mängden skadliga svar samtidigt som försämringen av modellens problemlösningsförmåga i MMLU-Pro hölls inom 10 procent av resultatet före manipulationen. 2
De allvarligaste resultaten kom vanligtvis från angrepp genom jailbreak-finjustering. De rapporterade varianterna omfattade konkurrerande mål, bakdörrar och stilmodulering. Angreppen var särskilt anmärkningsvärda eftersom de huvudsakligen kunde använda ofarliga träningsdata med en mindre skadlig komponent. Det gör dem mindre lika ett trubbigt försök att träna om modellen för osäkert beteende och mer lika en riktad förändring av säkerhetsbeteendet där användbarheten bevaras. 2
6
Studiens bredare slutsats är att säkerhet och kapacitet kan skiljas åt på ett ogynnsamt sätt. Manipulation kan försvaga modellens vägran att svara på olämpliga förfrågningar utan att samtidigt förstöra dess problemlösningsförmåga i motsvarande grad. En modell kan alltså fortsätta att prestera väl i konventionella tester och ändå bli betydligt mer riskfylld att använda.
TamperBench utvärderade 21 modeller med öppna vikter i storleksintervallet 0,6–8 miljarder parametrar, däribland modellfamiljer som Llama, Qwen3 och Mistral. Det underlag som finns tillgängligt stöder studiens övergripande resultat: varje testad modell var sårbar för minst ett av de utvärderade angreppen. 5
6
Det tillgängliga källmaterialet innehåller däremot inte de exakta, modellvisa ökningarna av skadliga svar för Llama-3-8B-Instruct eller Qwen3-8B-Instruct när försämringen i MMLU-Pro begränsas till högst 10 procent. Sådana siffror bör därför inte härledas från det övergripande resultatet.
Den säkra slutsatsen är kvalitativ och jämförande: angreppen kunde öka det skadliga beteendet avsevärt samtidigt som en stor del av modellernas problemlösningsförmåga bevarades, men det tillgängliga underlaget fastställer ingen exakt procentuell ökning för någon av de två namngivna modellerna.
Studien visade också att basmodeller och eftertränade varianter inte följer ett enda universellt mönster när det gäller motståndskraft mot manipulation. Den relativa motståndskraften kan skilja sig mellan modellfamiljer, och motsatta trender rapporterades för varianter av Llama 3 och Qwen3. 6
Nej. De fem modeller med förstärkta försvar som testades – däribland varianter med ReFAT och Circuit Breaking – var också sårbara för studiens angreppssvit. Försvaren förbättrade motståndskraften i vissa situationer, men hindrade inte på ett tillförlitligt sätt att säkerhetsfunktionerna togs bort under alla testade hot. 2
5
I de jämförelser som gjordes framstår Triplet som ett av de mer robusta och kapacitetsbevarande försvaren. Det är en lovande signal för fortsatt forskning, inte en garanti. Studiens huvudresultat är fortfarande att inget av de testade försvaren eliminerade manipulationsproblemet för hela angreppssviten. 6
Resultatet innebär inte att modeller med öppna vikter saknar värde. Öppen publicering kan underlätta forskning, granskning och ansvarsutkrävande. Den mer avgränsade lärdomen är att ett godkänt konventionellt säkerhets- eller alignment-test före lansering inte bör betraktas som ett bevis på att modellen förblir säker när vikterna fritt kan ändras. 5
Kommersiella, slutna modeller och API-tjänster ställs inför närliggande frågor om finjustering och säkerhet efter anpassning. Deras leverantörer har dock större kontroll över träningsprocessen och driftsmiljön. Det kan göra det möjligt att införa skydd under eller efter anpassningen – något som är betydligt svårare att upprätthålla när modellvikter har distribuerats offentligt. 2
5
Risken som TamperBench lyfter handlar inte bara om att en person hittar en enskild prompt som får modellen att sluta vägra. Om manipulationen bevarar användbara förmågor kan en modifierad modell i princip användas upprepade gånger för skadliga ändamål, exempelvis storskalig desinformation, nätfiske och bedrägerier eller farlig teknisk vägledning. Forskarna beskriver detta som möjliga följder av att skydd tas bort utan att kapaciteten försvinner – studien mätte inte faktiskt missbruk. 5
För organisationer som väljer AI-modeller är det praktiskt viktigt att skilja mellan:
Forskarna efterlyser starkare metoder för att bygga in manipulationsmotstånd, standardiserade adversariella utvärderingar som TamperBench före lansering samt mer evidensbaserade modeller för AI-bedömning och upphandling. De pekar särskilt på verksamheter med stor påverkan – bland annat vård, bedrägeribekämpning, utbildning och offentlig service – där modellens beteende efter lansering kan vara minst lika viktigt som dess ursprungliga säkerhetsresultat. 2
5
TamperBench visar inte att alla modeller med öppna vikter kommer att missbrukas. Studien visar att säkerhetsskydden i samtliga 21 testade modeller inte var tillförlitliga garantier när en angripare kunde manipulera modellen. Dold jailbreak-finjustering var vanligtvis den starkaste angreppskategorin. Extra försvar hjälpte i vissa fall, men stängde inte säkerhetsluckan. Det tillgängliga underlaget stöder inte heller exakta procenttal för ökningen av skadligt beteende i enskilda Llama- eller Qwen3-modeller.
För modeller med öppna vikter behöver säkerhetsutvärderingen därför testa mer än vad modellen kan göra vid lanseringen. Den måste också undersöka hur mycket av säkerhetsbeteendet som överlever en modifiering.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench fann att alla 21 testade AI modeller med öppna vikter var sårbara för minst ett av nio manipulationshot, ofta utan att MMLU Pro resultaten försämrades med mer än 10 procent.
TamperBench fann att alla 21 testade AI modeller med öppna vikter var sårbara för minst ett av nio manipulationshot, ofta utan att MMLU Pro resultaten försämrades med mer än 10 procent. Dold jailbreak finjustering – särskilt varianter med konkurrerande mål, bakdörrar och stilmodulering – var vanligtvis den effektivaste angreppskategorin.
Förstärkta försvarsvarianter, däribland ReFAT och Circuit Breaking, förbättrade motståndskraften i vissa situationer men gav inget tillförlitligt skydd mot att säkerhetsfunktionerna togs bort.
TamperBench fann att alla 21 testade AI modeller med öppna vikter var sårbara för minst ett av nio manipulationshot, ofta utan att MMLU Pro resultaten försämrades med mer än 10 procent. Dold jailbreak finjustering – särskilt varianter med konkurrerande mål, bakdörrar och stilmodulering – var vanligtvis den effektiva...
Publicerad avRedigerad med GPT-5.6 LunaBilder genererade med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Det centrala resultatet från TamperBench är tydligt: ingen av de 21 modeller med öppna vikter som testades hade säkerhetsskydd som på ett tillförlitligt sätt stod emot de manipulationsmetoder som ingick i studien. Modellerna omfattade ungefär 600 miljoner till 8 miljarder parametrar och inkluderade både standardmodeller och varianter med extra försvar. För varje testad modell fanns minst ett angrepp som gjorde modellen mer benägen att generera skadligt innehåll, samtidigt som en stor del av den allmänna kapaciteten bevarades. 2
5
6
Det spelar roll eftersom modeller med öppna vikter kan kopieras, finjusteras och distribueras vidare efter lanseringen. Ett säkerhetslager som fungerar under utvecklarens ursprungliga tester är därför inte nödvändigtvis ett hållbart skydd när användare kan ändra själva modellvikterna.
TamperBench har utformats för att mäta motståndskraft mot manipulation, snarare än den mer välkända motståndskraften mot vanliga promptbaserade jailbreakförsök. Ramverket kombinerar attacker genom finjustering i viktutrymmet med angrepp som manipulerar latenta representationer. Därefter mäts både modellens säkerhetsbeteende och hur mycket av dess användbara kapacitet som finns kvar. Forskarna använde systematiska sökningar efter hyperparametrar för varje kombination av modell och angrepp, i stället för att förlita sig på en enda attackkonfiguration. 2
Studien omfattade nio manipulationsregimer, bland annat:
Det avgörande testet var inte bara om en modell kunde göras osäker. Forskarna letade efter angrepp som ökade mängden skadliga svar samtidigt som försämringen av modellens problemlösningsförmåga i MMLU-Pro hölls inom 10 procent av resultatet före manipulationen. 2
De allvarligaste resultaten kom vanligtvis från angrepp genom jailbreak-finjustering. De rapporterade varianterna omfattade konkurrerande mål, bakdörrar och stilmodulering. Angreppen var särskilt anmärkningsvärda eftersom de huvudsakligen kunde använda ofarliga träningsdata med en mindre skadlig komponent. Det gör dem mindre lika ett trubbigt försök att träna om modellen för osäkert beteende och mer lika en riktad förändring av säkerhetsbeteendet där användbarheten bevaras. 2
6
Studiens bredare slutsats är att säkerhet och kapacitet kan skiljas åt på ett ogynnsamt sätt. Manipulation kan försvaga modellens vägran att svara på olämpliga förfrågningar utan att samtidigt förstöra dess problemlösningsförmåga i motsvarande grad. En modell kan alltså fortsätta att prestera väl i konventionella tester och ändå bli betydligt mer riskfylld att använda.
TamperBench utvärderade 21 modeller med öppna vikter i storleksintervallet 0,6–8 miljarder parametrar, däribland modellfamiljer som Llama, Qwen3 och Mistral. Det underlag som finns tillgängligt stöder studiens övergripande resultat: varje testad modell var sårbar för minst ett av de utvärderade angreppen. 5
6
Det tillgängliga källmaterialet innehåller däremot inte de exakta, modellvisa ökningarna av skadliga svar för Llama-3-8B-Instruct eller Qwen3-8B-Instruct när försämringen i MMLU-Pro begränsas till högst 10 procent. Sådana siffror bör därför inte härledas från det övergripande resultatet.
Den säkra slutsatsen är kvalitativ och jämförande: angreppen kunde öka det skadliga beteendet avsevärt samtidigt som en stor del av modellernas problemlösningsförmåga bevarades, men det tillgängliga underlaget fastställer ingen exakt procentuell ökning för någon av de två namngivna modellerna.
Studien visade också att basmodeller och eftertränade varianter inte följer ett enda universellt mönster när det gäller motståndskraft mot manipulation. Den relativa motståndskraften kan skilja sig mellan modellfamiljer, och motsatta trender rapporterades för varianter av Llama 3 och Qwen3. 6
Nej. De fem modeller med förstärkta försvar som testades – däribland varianter med ReFAT och Circuit Breaking – var också sårbara för studiens angreppssvit. Försvaren förbättrade motståndskraften i vissa situationer, men hindrade inte på ett tillförlitligt sätt att säkerhetsfunktionerna togs bort under alla testade hot. 2
5
I de jämförelser som gjordes framstår Triplet som ett av de mer robusta och kapacitetsbevarande försvaren. Det är en lovande signal för fortsatt forskning, inte en garanti. Studiens huvudresultat är fortfarande att inget av de testade försvaren eliminerade manipulationsproblemet för hela angreppssviten. 6
Resultatet innebär inte att modeller med öppna vikter saknar värde. Öppen publicering kan underlätta forskning, granskning och ansvarsutkrävande. Den mer avgränsade lärdomen är att ett godkänt konventionellt säkerhets- eller alignment-test före lansering inte bör betraktas som ett bevis på att modellen förblir säker när vikterna fritt kan ändras. 5
Kommersiella, slutna modeller och API-tjänster ställs inför närliggande frågor om finjustering och säkerhet efter anpassning. Deras leverantörer har dock större kontroll över träningsprocessen och driftsmiljön. Det kan göra det möjligt att införa skydd under eller efter anpassningen – något som är betydligt svårare att upprätthålla när modellvikter har distribuerats offentligt. 2
5
Risken som TamperBench lyfter handlar inte bara om att en person hittar en enskild prompt som får modellen att sluta vägra. Om manipulationen bevarar användbara förmågor kan en modifierad modell i princip användas upprepade gånger för skadliga ändamål, exempelvis storskalig desinformation, nätfiske och bedrägerier eller farlig teknisk vägledning. Forskarna beskriver detta som möjliga följder av att skydd tas bort utan att kapaciteten försvinner – studien mätte inte faktiskt missbruk. 5
För organisationer som väljer AI-modeller är det praktiskt viktigt att skilja mellan:
Forskarna efterlyser starkare metoder för att bygga in manipulationsmotstånd, standardiserade adversariella utvärderingar som TamperBench före lansering samt mer evidensbaserade modeller för AI-bedömning och upphandling. De pekar särskilt på verksamheter med stor påverkan – bland annat vård, bedrägeribekämpning, utbildning och offentlig service – där modellens beteende efter lansering kan vara minst lika viktigt som dess ursprungliga säkerhetsresultat. 2
5
TamperBench visar inte att alla modeller med öppna vikter kommer att missbrukas. Studien visar att säkerhetsskydden i samtliga 21 testade modeller inte var tillförlitliga garantier när en angripare kunde manipulera modellen. Dold jailbreak-finjustering var vanligtvis den starkaste angreppskategorin. Extra försvar hjälpte i vissa fall, men stängde inte säkerhetsluckan. Det tillgängliga underlaget stöder inte heller exakta procenttal för ökningen av skadligt beteende i enskilda Llama- eller Qwen3-modeller.
För modeller med öppna vikter behöver säkerhetsutvärderingen därför testa mer än vad modellen kan göra vid lanseringen. Den måste också undersöka hur mycket av säkerhetsbeteendet som överlever en modifiering.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench fann att alla 21 testade AI modeller med öppna vikter var sårbara för minst ett av nio manipulationshot, ofta utan att MMLU Pro resultaten försämrades med mer än 10 procent.
TamperBench fann att alla 21 testade AI modeller med öppna vikter var sårbara för minst ett av nio manipulationshot, ofta utan att MMLU Pro resultaten försämrades med mer än 10 procent. Dold jailbreak finjustering – särskilt varianter med konkurrerande mål, bakdörrar och stilmodulering – var vanligtvis den effektivaste angreppskategorin.
Förstärkta försvarsvarianter, däribland ReFAT och Circuit Breaking, förbättrade motståndskraften i vissa situationer men gav inget tillförlitligt skydd mot att säkerhetsfunktionerna togs bort.