TamperBench fandt, at alle 21 testede open weight modeller var sårbare over for mindst én af ni manipulationsmetoder – ofte uden mere end 10 % fald i MMLU Pro resultater. Skjult jailbreak finjustering, især varianter med konkurrerende mål, bagdøre og stilmodulation, var typisk den mest effektive angrebskategori.
Udgivet afRedigeret med GPT-5.6 LunaBilleder genereret med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
TamperBench-undersøgelsens hovedkonklusion er markant: Ingen af de 21 open-weight-sprogmodeller, der blev testet, havde sikkerhedsforanstaltninger, som pålideligt modstod de undersøgte manipulationsangreb. Modellerne spændte fra cirka 600 millioner til 8 milliarder parametre og omfattede både standardmodeller og varianter med ekstra forsvarsmekanismer. For hver model fandt forskerne mindst ét angreb, der gjorde den mere tilbøjelig til at generere skadeligt indhold, samtidig med at en stor del af dens generelle funktionalitet blev bevaret. 2
5
6
Det er vigtigt, fordi open-weight-modeller kan kopieres, finjusteres og distribueres videre, efter at de er udgivet. En sikkerhedsbarriere, der fungerer under udviklerens oprindelige evaluering, er derfor ikke nødvendigvis en holdbar kontrol, når brugere selv kan ændre modellens vægte.
TamperBench er udviklet til at måle modstandsdygtighed over for manipulation – ikke blot en models evne til at modstå almindelige jailbreak-prompts. Rammen kombinerer angreb gennem finjustering af modelvægtene med angreb, der manipulerer modellens latente repræsentationer. Derefter måles både sikkerhedsadfærd og bevarede evner. Forskerne brugte systematiske søgninger efter hyperparametre for hvert model-angreb-par i stedet for kun at afprøve én konfiguration. 2
Studiet omfattede ni manipulationsregimer, blandt andet:
Testen handlede ikke blot om, hvorvidt en model kunne gøres usikker. Forskerne ledte efter angreb, der øgede mængden af skadelige svar, mens faldet i MMLU-Pro-nøjagtighed – en krævende benchmark for ræsonnering – blev holdt inden for 10 % af modellens resultat uden angreb. 2
De mest alvorlige resultater kom typisk fra jailbreak-finjustering. De rapporterede varianter omfattede metoder baseret på konkurrerende mål, bagdøre og stilmodulation. Angrebene var særligt bemærkelsesværdige, fordi de hovedsageligt kunne bruge harmløse træningsdata med en mindre skadelig komponent. Det gør dem mindre ligne et direkte forsøg på at genoptræne modellen til usikker adfærd og mere som et målrettet forsøg på at ændre sikkerhedsadfærden uden at ødelægge modellens anvendelighed. 2
6
Undersøgelsens bredere konklusion er, at sikkerhed og funktionalitet kan adskilles på en uheldig måde: Manipulation kan svække modellens afvisninger uden tilsvarende at ødelægge dens evne til at ræsonnere. En model kan derfor fortsat se nyttig ud på traditionelle benchmarks, samtidig med at den bliver væsentligt mere risikabel at tage i brug.
TamperBench evaluerede 21 open-weight-modeller i størrelsesintervallet 0,6–8 milliarder parametre, herunder modelserier som Llama, Qwen3 og Mistral. Det tilgængelige studiemateriale understøtter benchmarkets overordnede resultat: Alle de testede modeller var sårbare over for mindst ét af de evaluerede angreb. 5
6
Det tilgængelige kildemateriale indeholder dog ikke de præcise, modelspecifikke stigninger i skadelig adfærd for Llama-3-8B-Instruct eller Qwen3-8B-Instruct under kravet om højst 10 % forringelse af MMLU-Pro. Disse tal bør derfor ikke udledes af det samlede resultat. Den forsvarlige konklusion er kvalitativ: Angrebene kunne øge den skadelige adfærd markant og samtidig bevare en stor del af modellernes ræsonneringsevne, men kilderne dokumenterer ikke en bestemt procentvis stigning for nogen af de to modeller.
Studiet viste også, at basismodeller og modeller, der efterfølgende er trænet, ikke følger ét ensartet mønster for modstandsdygtighed. Den relative robusthed kunne variere mellem modelserier, og der blev rapporteret modsatrettede tendenser for Llama 3- og Qwen3-varianter. 6
Nej. De fem forsvarsforstærkede modeller, der blev testet – herunder varianter med ReFAT og Circuit Breaking – var også sårbare over for benchmarkets angrebssuite. Forsvarsmekanismerne øgede modstandsdygtigheden i nogle situationer, men forhindrede ikke pålideligt fjernelsen af sikkerhedsadfærden på tværs af alle de undersøgte trusler. 2
5
Studiet peger på Triplet som en af de mere robuste forsvarsmetoder, der samtidig i høj grad bevarede modellens evner i de sammenligninger, forskerne gennemførte. Det er et lovende forskningsresultat, ikke en garanti: Hovedkonklusionen er fortsat, at ingen af de testede forsvar eliminerede manipulationsproblemet på tværs af hele angrebssuiten. 6
Resultatet betyder ikke, at open-weight-modeller i sig selv er værdiløse. Åben adgang til modelvægte kan understøtte forskning, revision og ansvarlighed. Den mere snævre pointe er, at en model ikke bør anses for varigt sikker, blot fordi den har bestået en almindelig alignment- eller sikkerhedsevaluering før udgivelsen. 5
Lukkede kommercielle modeller og API-tjenester står over for beslægtede spørgsmål om finjustering og sikkerhed efter træningen. Udbyderne har dog større kontrol over træningsforløbet og driftsmiljøet. Det kan gøre det muligt at indbygge sikkerhedsforanstaltninger under finjustering eller efter en tilpasning – noget, der er langt sværere at håndhæve, når modelvægte først er distribueret offentligt. 2
5
Den risiko, TamperBench fremhæver, handler ikke kun om, at en enkelt person finder en prompt, der får modellen til at afvise en anmodning forkert. Hvis manipulation kan bevare modellens nyttige funktioner, kan en ændret model potentielt anvendes gentagne gange til skadelige formål som desinformation i stor skala, phishing og svindel eller farlig teknisk vejledning. Forskerne fremlægger dette som mulige konsekvenser af at fjerne sikkerhedsforanstaltninger uden at miste funktionalitet – ikke som noget, benchmarktesten selv har målt i praksis. 5
For organisationer, der skal vælge AI-modeller, er den praktiske lære at skelne mellem:
Forskerne efterlyser stærkere metoder til at modstå manipulation, standardiserede fjendtlige evalueringer som TamperBench før udgivelse samt mere evidensbaserede AI-vurderinger og indkøbsprocesser. De fremhæver især områder med stor samfundsmæssig betydning – blandt andet sundhedsvæsen, svindelopsporing, uddannelse og offentlige tjenester – hvor en models adfærd efter udgivelsen kan være lige så vigtig som dens oprindelige sikkerhedsresultat. 2
5
TamperBench viser ikke, at alle open-weight-modeller nødvendigvis vil blive misbrugt. Studiet viser, at sikkerhedsforanstaltningerne i alle 21 testede modeller ikke udgjorde en pålidelig garanti, når en angriber kunne manipulere modellen. Skjult jailbreak-finjustering var typisk den stærkeste angrebskategori, ekstra forsvar hjalp i nogle tilfælde uden at lukke problemet, og det tilgængelige materiale understøtter ikke præcise tal for stigningen i skadelig adfærd i de enkelte Llama- eller Qwen3-modeller.
For modeller, der udgives med åbne vægte, bør sikkerhedsevaluering derfor ikke kun undersøge, hvad modellen kan ved lanceringen. Den bør også undersøge, hvor meget af sikkerhedsadfærden der overlever, når modellen bliver ændret.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench fandt, at alle 21 testede open weight modeller var sårbare over for mindst én af ni manipulationsmetoder – ofte uden mere end 10 % fald i MMLU Pro resultater.
TamperBench fandt, at alle 21 testede open weight modeller var sårbare over for mindst én af ni manipulationsmetoder – ofte uden mere end 10 % fald i MMLU Pro resultater. Skjult jailbreak finjustering, især varianter med konkurrerende mål, bagdøre og stilmodulation, var typisk den mest effektive angrebskategori.
Forsvarsforstærkede modeller, blandt andet varianter med ReFAT og Circuit Breaking, klarede sig bedre i nogle situationer, men gav ingen pålidelig garanti mod fjernelse af sikkerhedsadfærd.
TamperBench fandt, at alle 21 testede open weight modeller var sårbare over for mindst én af ni manipulationsmetoder – ofte uden mere end 10 % fald i MMLU Pro resultater. Skjult jailbreak finjustering, især varianter med konkurrerende mål, bagdøre og stilmodulation, var typisk den mest effektive angrebskategori.
Udgivet afRedigeret med GPT-5.6 LunaBilleder genereret med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
TamperBench-undersøgelsens hovedkonklusion er markant: Ingen af de 21 open-weight-sprogmodeller, der blev testet, havde sikkerhedsforanstaltninger, som pålideligt modstod de undersøgte manipulationsangreb. Modellerne spændte fra cirka 600 millioner til 8 milliarder parametre og omfattede både standardmodeller og varianter med ekstra forsvarsmekanismer. For hver model fandt forskerne mindst ét angreb, der gjorde den mere tilbøjelig til at generere skadeligt indhold, samtidig med at en stor del af dens generelle funktionalitet blev bevaret. 2
5
6
Det er vigtigt, fordi open-weight-modeller kan kopieres, finjusteres og distribueres videre, efter at de er udgivet. En sikkerhedsbarriere, der fungerer under udviklerens oprindelige evaluering, er derfor ikke nødvendigvis en holdbar kontrol, når brugere selv kan ændre modellens vægte.
TamperBench er udviklet til at måle modstandsdygtighed over for manipulation – ikke blot en models evne til at modstå almindelige jailbreak-prompts. Rammen kombinerer angreb gennem finjustering af modelvægtene med angreb, der manipulerer modellens latente repræsentationer. Derefter måles både sikkerhedsadfærd og bevarede evner. Forskerne brugte systematiske søgninger efter hyperparametre for hvert model-angreb-par i stedet for kun at afprøve én konfiguration. 2
Studiet omfattede ni manipulationsregimer, blandt andet:
Testen handlede ikke blot om, hvorvidt en model kunne gøres usikker. Forskerne ledte efter angreb, der øgede mængden af skadelige svar, mens faldet i MMLU-Pro-nøjagtighed – en krævende benchmark for ræsonnering – blev holdt inden for 10 % af modellens resultat uden angreb. 2
De mest alvorlige resultater kom typisk fra jailbreak-finjustering. De rapporterede varianter omfattede metoder baseret på konkurrerende mål, bagdøre og stilmodulation. Angrebene var særligt bemærkelsesværdige, fordi de hovedsageligt kunne bruge harmløse træningsdata med en mindre skadelig komponent. Det gør dem mindre ligne et direkte forsøg på at genoptræne modellen til usikker adfærd og mere som et målrettet forsøg på at ændre sikkerhedsadfærden uden at ødelægge modellens anvendelighed. 2
6
Undersøgelsens bredere konklusion er, at sikkerhed og funktionalitet kan adskilles på en uheldig måde: Manipulation kan svække modellens afvisninger uden tilsvarende at ødelægge dens evne til at ræsonnere. En model kan derfor fortsat se nyttig ud på traditionelle benchmarks, samtidig med at den bliver væsentligt mere risikabel at tage i brug.
TamperBench evaluerede 21 open-weight-modeller i størrelsesintervallet 0,6–8 milliarder parametre, herunder modelserier som Llama, Qwen3 og Mistral. Det tilgængelige studiemateriale understøtter benchmarkets overordnede resultat: Alle de testede modeller var sårbare over for mindst ét af de evaluerede angreb. 5
6
Det tilgængelige kildemateriale indeholder dog ikke de præcise, modelspecifikke stigninger i skadelig adfærd for Llama-3-8B-Instruct eller Qwen3-8B-Instruct under kravet om højst 10 % forringelse af MMLU-Pro. Disse tal bør derfor ikke udledes af det samlede resultat. Den forsvarlige konklusion er kvalitativ: Angrebene kunne øge den skadelige adfærd markant og samtidig bevare en stor del af modellernes ræsonneringsevne, men kilderne dokumenterer ikke en bestemt procentvis stigning for nogen af de to modeller.
Studiet viste også, at basismodeller og modeller, der efterfølgende er trænet, ikke følger ét ensartet mønster for modstandsdygtighed. Den relative robusthed kunne variere mellem modelserier, og der blev rapporteret modsatrettede tendenser for Llama 3- og Qwen3-varianter. 6
Nej. De fem forsvarsforstærkede modeller, der blev testet – herunder varianter med ReFAT og Circuit Breaking – var også sårbare over for benchmarkets angrebssuite. Forsvarsmekanismerne øgede modstandsdygtigheden i nogle situationer, men forhindrede ikke pålideligt fjernelsen af sikkerhedsadfærden på tværs af alle de undersøgte trusler. 2
5
Studiet peger på Triplet som en af de mere robuste forsvarsmetoder, der samtidig i høj grad bevarede modellens evner i de sammenligninger, forskerne gennemførte. Det er et lovende forskningsresultat, ikke en garanti: Hovedkonklusionen er fortsat, at ingen af de testede forsvar eliminerede manipulationsproblemet på tværs af hele angrebssuiten. 6
Resultatet betyder ikke, at open-weight-modeller i sig selv er værdiløse. Åben adgang til modelvægte kan understøtte forskning, revision og ansvarlighed. Den mere snævre pointe er, at en model ikke bør anses for varigt sikker, blot fordi den har bestået en almindelig alignment- eller sikkerhedsevaluering før udgivelsen. 5
Lukkede kommercielle modeller og API-tjenester står over for beslægtede spørgsmål om finjustering og sikkerhed efter træningen. Udbyderne har dog større kontrol over træningsforløbet og driftsmiljøet. Det kan gøre det muligt at indbygge sikkerhedsforanstaltninger under finjustering eller efter en tilpasning – noget, der er langt sværere at håndhæve, når modelvægte først er distribueret offentligt. 2
5
Den risiko, TamperBench fremhæver, handler ikke kun om, at en enkelt person finder en prompt, der får modellen til at afvise en anmodning forkert. Hvis manipulation kan bevare modellens nyttige funktioner, kan en ændret model potentielt anvendes gentagne gange til skadelige formål som desinformation i stor skala, phishing og svindel eller farlig teknisk vejledning. Forskerne fremlægger dette som mulige konsekvenser af at fjerne sikkerhedsforanstaltninger uden at miste funktionalitet – ikke som noget, benchmarktesten selv har målt i praksis. 5
For organisationer, der skal vælge AI-modeller, er den praktiske lære at skelne mellem:
Forskerne efterlyser stærkere metoder til at modstå manipulation, standardiserede fjendtlige evalueringer som TamperBench før udgivelse samt mere evidensbaserede AI-vurderinger og indkøbsprocesser. De fremhæver især områder med stor samfundsmæssig betydning – blandt andet sundhedsvæsen, svindelopsporing, uddannelse og offentlige tjenester – hvor en models adfærd efter udgivelsen kan være lige så vigtig som dens oprindelige sikkerhedsresultat. 2
5
TamperBench viser ikke, at alle open-weight-modeller nødvendigvis vil blive misbrugt. Studiet viser, at sikkerhedsforanstaltningerne i alle 21 testede modeller ikke udgjorde en pålidelig garanti, når en angriber kunne manipulere modellen. Skjult jailbreak-finjustering var typisk den stærkeste angrebskategori, ekstra forsvar hjalp i nogle tilfælde uden at lukke problemet, og det tilgængelige materiale understøtter ikke præcise tal for stigningen i skadelig adfærd i de enkelte Llama- eller Qwen3-modeller.
For modeller, der udgives med åbne vægte, bør sikkerhedsevaluering derfor ikke kun undersøge, hvad modellen kan ved lanceringen. Den bør også undersøge, hvor meget af sikkerhedsadfærden der overlever, når modellen bliver ændret.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench fandt, at alle 21 testede open weight modeller var sårbare over for mindst én af ni manipulationsmetoder – ofte uden mere end 10 % fald i MMLU Pro resultater.
TamperBench fandt, at alle 21 testede open weight modeller var sårbare over for mindst én af ni manipulationsmetoder – ofte uden mere end 10 % fald i MMLU Pro resultater. Skjult jailbreak finjustering, især varianter med konkurrerende mål, bagdøre og stilmodulation, var typisk den mest effektive angrebskategori.
Forsvarsforstærkede modeller, blandt andet varianter med ReFAT og Circuit Breaking, klarede sig bedre i nogle situationer, men gav ingen pålidelig garanti mod fjernelse af sikkerhedsadfærd.