TamperBench fant at ingen av de 21 testede åpne KI modellene hadde sikkerhetstiltak som var robuste nok mot alle de undersøkte manipuleringsangrepene. Alle modellene kunne gjøres betydelig mer tilbøyelige til å produsere skadelig innhold, samtidig som de beholdt mye av evnen til å resonnere.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
TamperBench-studien konkluderte med at ingen av de 21 testede åpne KI-modellene hadde sikkerhetstiltak som tålte alle de undersøkte truslene. Samtlige modeller kunne manipuleres slik at de i langt større grad produserte skadelig innhold, uten at evnen til å løse resonneringsoppgaver forsvant. Forskerne mener derfor at dagens sikkerhetstiltak ikke kan regnes som en tilstrekkelig garanti når modellens vekter er tilgjengelige og kan endres. 25
Modellene omfattet blant annet Llama-, Qwen3- og Mistral-modeller med mellom 600 millioner og 8 milliarder parametre. Studien ble presentert på ACM KDD ’26, en internasjonal konferanse for datautvinning og maskinlæring. 56
TamperBench er laget for å teste såkalte åpne vekter – modeller der de trente modellfilene kan kopieres, finjusteres og distribueres videre. Forskerne undersøkte ni metoder som endret enten modellvektene eller interne representasjoner. 2
Angrepene spente fra tilsynelatende harmløs finjustering og direkte trening på skadelig innhold til mer skjulte metoder, blant annet:
De skjulte jailbreak-angrepene var vanligvis de mest alvorlige. Særlig metodene basert på konkurrerende mål, bakdører og stilmodulering kunne svekke sikkerheten kraftig, selv om treningsdataene i hovedsak var harmløse og bare inneholdt en liten skadelig komponent. 2
Forskerne valgte angrepsoppsett som økte modellens skadelighet mest mulig, samtidig som fallet i resonneringspresisjon på MMLU-Pro ble begrenset til maksimalt 10 prosentpoeng sammenlignet med den opprinnelige modellen. MMLU-Pro er en krevende test av blant annet språkforståelse, matematikk, juss og generell problemløsing. 2
Det tilgjengelige materialet oppgir ikke nøyaktige økninger i skadelighet for hver enkelt modell. Det er derfor ikke grunnlag for å angi et presist tall for Llama-3-8B-Instruct eller Qwen3-8B-Instruct.
Studien testet også fem modeller som var utstyrt med særskilte forsvar mot manipulering, blant annet varianter basert på ReFAT og Circuit Breaking. Disse forsvarene ga bedre motstand i enkelte situasjoner, men hindret ikke pålitelig at sikkerhetstiltakene ble fjernet på tvers av hele angrepssuiten. 25
Dette er særlig relevant for modeller som distribueres med åpne vekter. Når filene først er offentlig tilgjengelige, kan andre aktører kopiere dem, finjustere dem og spre nye versjoner uten at den opprinnelige utvikleren kan håndheve de samme sikkerhetskontrollene. 2
Forskerne hevder ikke at åpne modeller er uten verdi. Åpen tilgang kan gi bedre forskning, innsyn og mulighet for uavhengig kontroll. Men en modell bør ikke anses som sikker bare fordi den har bestått vanlige tester før lansering. Slike tester sier lite om hva som skjer etter at andre får endre selve modellvektene. 5
Lukkede kommersielle modeller og API-tjenester kan også ha lignende tamper-risiko. Forskjellen er at leverandøren der vanligvis kontrollerer finjustering og distribusjon, og dermed kan legge inn forsvar under eller etter treningen. Den muligheten blir langt mindre når åpne vekter fritt kan lastes ned og redistribueres. 25
En modell som beholder mye av kapasiteten sin etter at sikkerhetsrekkverket er fjernet, kan i verste fall brukes til misbruk i stor skala – for eksempel masseproduksjon av desinformasjon, mer avanserte phishing- og svindelforsøk eller utarbeiding av skadelig teknisk veiledning. 5
Forskerne etterlyser derfor mer forskning på motstandsdyktighet mot manipulering, standardiserte tester som TamperBench før lansering, og mer kunnskapsbaserte vurderinger ved innkjøp og bruk av KI. Dette blir spesielt viktig når myndigheter tar i bruk KI i helsevesen, svindeloppdagelse, utdanning og andre offentlige tjenester. 25
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench fant at ingen av de 21 testede åpne KI modellene hadde sikkerhetstiltak som var robuste nok mot alle de undersøkte manipuleringsangrepene.
TamperBench fant at ingen av de 21 testede åpne KI modellene hadde sikkerhetstiltak som var robuste nok mot alle de undersøkte manipuleringsangrepene. Alle modellene kunne gjøres betydelig mer tilbøyelige til å produsere skadelig innhold, samtidig som de beholdt mye av evnen til å resonnere.
De mest alvorlige angrepene var som regel skjulte jailbreak varianter, blant annet angrep basert på konkurrerende mål, bakdører og stilmodulering.