Ingen af de 21 testede open weight modeller havde sikkerhedsforanstaltninger, der modstod alle de undersøgte manipulationsangreb. Modellerne kunne gøres markant mere tilbøjelige til at generere skadeligt indhold, samtidig med at de bevarede en stor del af deres ræsonneringsevne.
Udgivet afBilleder genereret med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
TamperBench-studiet konkluderede, at ingen af de 21 testede open-weight-modeller havde sikkerhedsforanstaltninger, der var robuste nok til at modstå de undersøgte trusler. Det gjaldt modeller fra blandt andre Llama-, Qwen3- og Mistral-familier i størrelsen 600 millioner til 8 milliarder parametre.
Ved at ændre modellernes vægte eller deres interne repræsentationer kunne forskerne gøre hver model betydeligt mere tilbøjelig til at levere skadelige svar. Samtidig kunne modellerne i høj grad bevare deres oprindelige evne til at ræsonnere. Forskerne beskriver derfor de nuværende sikkerhedstiltag som utilstrækkelige garantier for modeller, hvis vægte kan ændres efter udgivelsen. 2
5
TamperBench samlede ni metoder til manipulation af vægte og latente repræsentationer. De omfattede blandt andet:
De skjulte jailbreak-finetuninger var typisk de mest alvorlige. Det gjaldt især varianter baseret på konkurrerende målsætninger, bagdøre og stilmodulation. Her blev modellerne hovedsageligt trænet på harmløse data, mens en mindre skadelig komponent gradvist svækkede sikkerhedsadfærden. 2
Forskerne valgte angrebsindstillinger, der øgede modellernes tilbøjelighed til at give skadelige svar mest muligt, men samtidig begrænsede faldet i MMLU-Pro-nøjagtighed til højst 10 procentpoint i forhold til den uberørte model. MMLU-Pro er en krævende test af blandt andet sprogforståelse, matematik og ræsonnering. 2
De tilgængelige oplysninger angiver ikke de præcise, model-for-model-stigninger i skadelighed for eksempelvis Llama-3-8B-Instruct eller Qwen3-8B-Instruct. Derfor kan der ikke pålideligt angives konkrete tal for netop disse modeller.
Kun i begrænset omfang. De fem testede modeller med indbyggede eller efterfølgende forsvar, herunder varianter med ReFAT og Circuit Breaking, var også sårbare. Forsvarene forbedrede modstandsdygtigheden i nogle situationer, men forhindrede ikke konsekvent, at sikkerhedsforanstaltningerne kunne fjernes på tværs af hele angrebssuiten. 2
5
Det er særligt relevant for open-weight-modeller, fordi modelvægte kan kopieres, finetunes og videredistribueres. Når først vægtene er offentligt tilgængelige, kan den oprindelige udvikler ikke på samme måde håndhæve sikkerhedsregler for alle senere anvendelser. 2
Forskerne argumenterer ikke for, at open-weight-modeller er værdiløse. Åben adgang kan styrke forskning, gennemsigtighed og ansvarlighed. Men en model bør ikke betragtes som sikker alene, fordi den har bestået almindelige alignment- og sikkerhedstests før udgivelsen. 5
Studiet peger også på, at lukkede kommercielle modeller og API-tjenester kan have beslægtede manipulationsrisici. Udbydere, der selv kontrollerer finetuning og drift, har dog mulighed for at indføre forsvar under finetuning eller efterfølgende. Den mulighed forsvinder i høj grad, når modelvægte frit kan distribueres. 2
5
En sikkerhedsfjernelse, der bevarer modellens evner, kan gøre misbrug lettere at skalere. Det kan for eksempel være masseproduktion af desinformation, avancerede phishing- og svindelforsøg eller skadelige tekniske instruktioner, hvor skadevirkningen ikke længere er begrænset af én persons manuelle indsats. 5
Forskerne efterlyser derfor mere forskning i manipulationsresistens, standardiserede adversarielle tests som TamperBench før udgivelse samt mere evidensbaserede vurderinger ved indkøb og udrulning af AI. Det gælder især, når offentlige myndigheder tager AI i brug inden for sundhed, svindelopsporing, uddannelse og andre samfundskritiske områder. 2
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ingen af de 21 testede open weight modeller havde sikkerhedsforanstaltninger, der modstod alle de undersøgte manipulationsangreb.
Ingen af de 21 testede open weight modeller havde sikkerhedsforanstaltninger, der modstod alle de undersøgte manipulationsangreb. Modellerne kunne gøres markant mere tilbøjelige til at generere skadeligt indhold, samtidig med at de bevarede en stor del af deres ræsonneringsevne.
De mest alvorlige angreb var typisk skjulte jailbreak finetuninger, blandt andet varianter med konkurrerende målsætninger, bagdøre og stilmodulation.
Ingen af de 21 testede open weight modeller havde sikkerhedsforanstaltninger, der modstod alle de undersøgte manipulationsangreb. Modellerne kunne gøres markant mere tilbøjelige til at generere skadeligt indhold, samtidig med at de bevarede en stor del af deres ræsonneringsevne.
Udgivet afBilleder genereret med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
TamperBench-studiet konkluderede, at ingen af de 21 testede open-weight-modeller havde sikkerhedsforanstaltninger, der var robuste nok til at modstå de undersøgte trusler. Det gjaldt modeller fra blandt andre Llama-, Qwen3- og Mistral-familier i størrelsen 600 millioner til 8 milliarder parametre.
Ved at ændre modellernes vægte eller deres interne repræsentationer kunne forskerne gøre hver model betydeligt mere tilbøjelig til at levere skadelige svar. Samtidig kunne modellerne i høj grad bevare deres oprindelige evne til at ræsonnere. Forskerne beskriver derfor de nuværende sikkerhedstiltag som utilstrækkelige garantier for modeller, hvis vægte kan ændres efter udgivelsen. 2
5
TamperBench samlede ni metoder til manipulation af vægte og latente repræsentationer. De omfattede blandt andet:
De skjulte jailbreak-finetuninger var typisk de mest alvorlige. Det gjaldt især varianter baseret på konkurrerende målsætninger, bagdøre og stilmodulation. Her blev modellerne hovedsageligt trænet på harmløse data, mens en mindre skadelig komponent gradvist svækkede sikkerhedsadfærden. 2
Forskerne valgte angrebsindstillinger, der øgede modellernes tilbøjelighed til at give skadelige svar mest muligt, men samtidig begrænsede faldet i MMLU-Pro-nøjagtighed til højst 10 procentpoint i forhold til den uberørte model. MMLU-Pro er en krævende test af blandt andet sprogforståelse, matematik og ræsonnering. 2
De tilgængelige oplysninger angiver ikke de præcise, model-for-model-stigninger i skadelighed for eksempelvis Llama-3-8B-Instruct eller Qwen3-8B-Instruct. Derfor kan der ikke pålideligt angives konkrete tal for netop disse modeller.
Kun i begrænset omfang. De fem testede modeller med indbyggede eller efterfølgende forsvar, herunder varianter med ReFAT og Circuit Breaking, var også sårbare. Forsvarene forbedrede modstandsdygtigheden i nogle situationer, men forhindrede ikke konsekvent, at sikkerhedsforanstaltningerne kunne fjernes på tværs af hele angrebssuiten. 2
5
Det er særligt relevant for open-weight-modeller, fordi modelvægte kan kopieres, finetunes og videredistribueres. Når først vægtene er offentligt tilgængelige, kan den oprindelige udvikler ikke på samme måde håndhæve sikkerhedsregler for alle senere anvendelser. 2
Forskerne argumenterer ikke for, at open-weight-modeller er værdiløse. Åben adgang kan styrke forskning, gennemsigtighed og ansvarlighed. Men en model bør ikke betragtes som sikker alene, fordi den har bestået almindelige alignment- og sikkerhedstests før udgivelsen. 5
Studiet peger også på, at lukkede kommercielle modeller og API-tjenester kan have beslægtede manipulationsrisici. Udbydere, der selv kontrollerer finetuning og drift, har dog mulighed for at indføre forsvar under finetuning eller efterfølgende. Den mulighed forsvinder i høj grad, når modelvægte frit kan distribueres. 2
5
En sikkerhedsfjernelse, der bevarer modellens evner, kan gøre misbrug lettere at skalere. Det kan for eksempel være masseproduktion af desinformation, avancerede phishing- og svindelforsøg eller skadelige tekniske instruktioner, hvor skadevirkningen ikke længere er begrænset af én persons manuelle indsats. 5
Forskerne efterlyser derfor mere forskning i manipulationsresistens, standardiserede adversarielle tests som TamperBench før udgivelse samt mere evidensbaserede vurderinger ved indkøb og udrulning af AI. Det gælder især, når offentlige myndigheder tager AI i brug inden for sundhed, svindelopsporing, uddannelse og andre samfundskritiske områder. 2
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ingen af de 21 testede open weight modeller havde sikkerhedsforanstaltninger, der modstod alle de undersøgte manipulationsangreb.
Ingen af de 21 testede open weight modeller havde sikkerhedsforanstaltninger, der modstod alle de undersøgte manipulationsangreb. Modellerne kunne gøres markant mere tilbøjelige til at generere skadeligt indhold, samtidig med at de bevarede en stor del af deres ræsonneringsevne.
De mest alvorlige angreb var typisk skjulte jailbreak finetuninger, blandt andet varianter med konkurrerende målsætninger, bagdøre og stilmodulation.