TamperBench fant at alle 21 testede modeller med åpne vekter var sårbare for minst én av ni manipuleringsmetoder, ofte uten mer enn 10 prosent svekkelse i MMLU Pro resultatene. Skjult jailbreak finjustering – særlig varianter med konkurrerende mål, bakdører og stilmodulering – var vanligvis den mest effektive angrep...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Hovedfunnet fra TamperBench er tydelig: Ingen av de 21 modellene med åpne vekter som ble testet, hadde sikkerhetsmekanismer som pålitelig motsto alle de undersøkte manipuleringsforsøkene. Modellene hadde mellom rundt 600 millioner og 8 milliarder parametre og omfattet både standardmodeller og varianter med ekstra sikkerhetsforsvar. Minst ett angrep kunne gjøre hver modell mer tilbøyelig til å generere skadelig innhold, samtidig som mye av den generelle funksjonaliteten ble beholdt. 256
Dette er viktig fordi modeller med åpne vekter kan kopieres, finjusteres og distribueres på nytt etter lansering. En sikkerhetsmekanisme som fungerer under utviklerens opprinnelige testing, er derfor ikke nødvendigvis et varig vern når brukerne kan endre selve modellvektene.
TamperBench er laget for å måle motstand mot manipulering, ikke bare hvor godt en modell tåler vanlige jailbreak-forsøk gjennom tekstprompter. Rammeverket kombinerer angrep gjennom finjustering av modellvektene med angrep som manipulerer modellens latente representasjoner. Deretter måles både sikkerhetsatferd og hvor mye av modellens øvrige kapasitet som er bevart. Forskerne brukte systematiske søk etter hyperparametre for hvert enkelt forhold mellom modell og angrep, i stedet for å basere seg på én enkelt angrepskonfigurasjon. 2
Studien omfattet ni typer manipulering, blant annet:
Forskerne undersøkte ikke bare om en modell kunne gjøres utrygg. De lette etter angrep som økte forekomsten av skadelige svar, samtidig som fallet i MMLU-Pro-nøyaktighet for resonnering holdt seg innenfor 10 prosent av resultatet til den uendrede modellen. 2
De mest alvorlige resultatene kom vanligvis fra jailbreak-finjustering. Studien omtaler blant annet metoder basert på konkurrerende mål, bakdører og stilmodulering. Disse angrepene er særlig interessante fordi de i stor grad kan bruke ufarlige treningsdata med en mindre andel skadelig materiale. De fremstår dermed mindre som et forsøk på å trene modellen helt om til usikker atferd, og mer som målrettede forsøk på å endre sikkerhetsoppførselen uten å ofre nytteverdien. 26
Studien peker på et uheldig skille mellom sikkerhet og kapasitet: Manipulering kan svekke modellens avvisninger uten å ødelegge resonneringsevnen tilsvarende. En modell kan derfor fortsatt fremstå som nyttig i vanlige tester, samtidig som den blir betydelig mer risikabel å ta i bruk.
TamperBench testet 21 modeller med åpne vekter i størrelsesordenen 0,6–8 milliarder parametre, inkludert modellfamilier som Llama, Qwen3 og Mistral. Det tilgjengelige studiematerialet støtter hovedfunnet for hele testen: Alle modellene var sårbare for minst ett av de undersøkte angrepene. 56
Kildene som er tilgjengelige her, oppgir imidlertid ikke de nøyaktige økningene i skadelig atferd for Llama-3-8B-Instruct eller Qwen3-8B-Instruct under kravet om høyst 10 prosent svekkelse i MMLU-Pro. Slike prosenttall bør derfor ikke utledes fra det samlede resultatet. Den sikre konklusjonen er kvalitativ: Angrepene kunne øke den skadelige atferden betydelig samtidig som mye av modellens resonneringsevne ble bevart, men materialet dokumenterer ikke en presis prosentvis økning for de to navngitte modellene.
Studien viste også at grunnmodeller og ettertrente varianter ikke fulgte ett felles mønster for motstand mot manipulering. Motstandsdyktigheten kunne variere mellom modellfamilier, og Llama 3- og Qwen3-varianter viste til dels motsatte utviklingstrekk. 6
Nei. De fem forsvarsforsterkede modellene som ble testet – blant annet varianter med ReFAT og Circuit Breaking – var også sårbare for angrepspakken. Forsvarene ga bedre motstand i enkelte situasjoner, men hindret ikke pålitelig at sikkerhetsmekanismene kunne fjernes på tvers av alle truslene i testen. 25
Forskerne trekker frem Triplet som et av de mer robuste og kapasitetsbevarende forsvarene i sammenligningene. Det er et lovende forskningsresultat, men ingen garanti: Hovedfunnet er fortsatt at ingen av de testede forsvarene løste problemet med manipulering gjennom hele testserien. 6
Resultatet betyr ikke at modeller med åpne vekter er uten verdi. Åpen tilgang kan fremme forskning, uavhengig kontroll og ansvarlighet. Den mer avgrensede lærdommen er at en vanlig sikkerhets- eller samsvarstest før lansering ikke bør tolkes som et bevis på at modellen forblir trygg etter at vektene er gjort fritt modifiserbare. 5
Kommersielle, lukkede modeller og API-tjenester står overfor beslektede spørsmål om finjustering og sikkerhet etter trening. Leverandørene har likevel større kontroll over treningsløpet og driftsmiljøet. Det kan gjøre det mulig å legge inn sikkerhetstiltak under finjustering eller etter en tilpasning – noe som er langt vanskeligere å håndheve når vektene først er offentlig distribuert. 25
Risikoen TamperBench fremhever, handler ikke bare om at noen finner én enkelt prompt som får en modell til å svikte i en avvisning. Dersom nyttige egenskaper bevares etter manipulering, kan en endret modell i prinsippet brukes gjentatte ganger til skadelige formål, som desinformasjon i stor skala, phishing og svindel eller farlig teknisk veiledning. Forskerne beskriver dette som mulige følger av at sikkerhetstiltak fjernes uten at kapasiteten forsvinner – ikke som misbruk som selve benchmarken har målt. 5
For virksomheter som skal velge modell, er det praktisk viktig å skille mellom:
Forskerne etterlyser sterkere metoder for manipuleringsmotstand, standardiserte motstandstester som TamperBench før lansering, og mer kunnskapsbaserte krav til vurdering og innkjøp av AI. De peker særlig på områder med stor samfunnsbetydning, blant annet helsevesen, svindeloppdagelse, utdanning og offentlige tjenester, der modellens oppførsel etter lansering kan være like viktig som den opprinnelige sikkerhetshistorikken. 25
TamperBench viser ikke at alle modeller med åpne vekter vil bli misbrukt. Studien viser at sikkerhetsmekanismene i alle de 21 testede modellene kunne svekkes av minst ett angrep når en angriper fikk manipulere modellen. Skjult jailbreak-finjustering var vanligvis den kraftigste angrepskategorien. Ekstra forsvar hjalp i enkelte tilfeller, men fjernet ikke problemet. Det tilgjengelige materialet støtter heller ikke presise prosenttall for økningen i skadelig atferd hos enkeltmodeller som Llama eller Qwen3.
For modeller med åpne vekter bør sikkerhetstesting derfor ikke bare spørre hva modellen kan gjøre ved lansering, men også hvor mye av sikkerhetsatferden som overlever modifisering.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench fant at alle 21 testede modeller med åpne vekter var sårbare for minst én av ni manipuleringsmetoder, ofte uten mer enn 10 prosent svekkelse i MMLU Pro resultatene.
TamperBench fant at alle 21 testede modeller med åpne vekter var sårbare for minst én av ni manipuleringsmetoder, ofte uten mer enn 10 prosent svekkelse i MMLU Pro resultatene. Skjult jailbreak finjustering – særlig varianter med konkurrerende mål, bakdører og stilmodulering – var vanligvis den mest effektive angrepskategorien.
Forsvarsforsterkede modeller, blant annet varianter med ReFAT og Circuit Breaking, tålte enkelte angrep bedre, men ga ingen pålitelig garanti mot at sikkerheten kunne fjernes.