TamperBench concludeerde dat geen van de 21 onderzochte open weight modellen bestand was tegen alle geteste vormen van gewichts en latent space tampering. Bij elk model konden onderzoekers de bereidheid om schadelijke antwoorden te geven aanzienlijk verhogen, terwijl een groot deel van het redeneervermogen behouden...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
De TamperBench-studie, gepresenteerd tijdens ACM KDD ’26, onderzocht hoe stevig de veiligheidsmaatregelen van open-weight grote taalmodellen werkelijk zijn. De onderzoekers testten 21 modellen, waaronder modellen uit de Llama-, Qwen3- en Mistral-families, met tussen 600 miljoen en 8 miljard parameters.
De hoofdconclusie is ongemakkelijk voor ontwikkelaars die open modellen publiceren: geen van de 21 modellen hield stand tegen alle onderzochte vormen van tampering. Elk model kon met ten minste één aanval aanzienlijk ontvankelijker worden gemaakt voor schadelijke verzoeken, terwijl een belangrijk deel van de oorspronkelijke redeneercapaciteit behouden bleef. Volgens de auteurs bieden de huidige veiligheidslagen daarom geen betrouwbare garantie zodra de modelgewichten door anderen kunnen worden aangepast. 25
TamperBench bracht negen methoden samen die ingrijpen op de modelgewichten of op latente representaties — interne patronen waarmee een model informatie verwerkt. De testset omvatte onder meer:
De heimelijke jailbreak-aanvallen waren doorgaans het zwaarst. Vooral varianten met concurrerende doelstellingen, backdoors en stijlmodulatie vielen op. Daarbij bestond de trainingsdata grotendeels uit onschuldige voorbeelden, aangevuld met een kleinere schadelijke component. Dat maakt dit type aanval lastiger te herkennen dan een model dat simpelweg met duidelijk kwaadaardige data wordt bijgestuurd. 2
De onderzoekers zochten per combinatie van model en aanval naar instellingen die de score voor schadelijke antwoorden zo sterk mogelijk verhoogden. Tegelijk mocht de nauwkeurigheid op MMLU-Pro, een veeleisende toets voor onder meer taalbegrip en redeneren, hooguit 10 procentpunt dalen ten opzichte van het onaangepaste model. Zo testte de studie niet alleen of veiligheidsfilters konden worden verwijderd, maar ook of dat kon gebeuren zonder het model als geheel onbruikbaar te maken. 2
Voor Llama-3-8B-Instruct en Qwen3-8B-Instruct bevat het aangeleverde bewijsmateriaal geen betrouwbare, exacte cijfers over de toename van schadelijke antwoorden. Zulke modelspecifieke percentages kunnen daarom niet verantwoord worden genoemd.
De onderzoekers testten ook vijf modellen met aanvullende verdedigingstechnieken, waaronder varianten met ReFAT en Circuit Breaking. Die maatregelen verbeterden de weerstand in sommige situaties, maar voorkwamen niet betrouwbaar dat veiligheidswaarborgen ergens in de geteste aanvalssuite konden worden verzwakt of verwijderd. 25
De studie wijst bovendien op verschillen tussen basismodellen en modellen die achteraf op veiligheid zijn afgestemd. Die varianten kunnen een andere mate van weerstand tegen aanpassingen vertonen. In de bredere resultaten wordt Triplet genoemd als een verdediging die vaak relatief robuust bleef en capaciteiten goed wist te behouden, maar ook dat betekent niet dat de bescherming onder alle omstandigheden gegarandeerd is. 8
Bij open-weight modellen kunnen gebruikers de gewichten kopiëren, verder trainen en opnieuw verspreiden. De oorspronkelijke ontwikkelaar kan dan niet langer rechtstreeks afdwingen welke veiligheidscontroles bij iedere afgeleide versie actief blijven. 2
Dat betekent niet dat open modellen geen waarde hebben. De auteurs benadrukken juist dat openheid onderzoek en controleerbaarheid kan bevorderen. Wel waarschuwen ze dat een model niet als veilig moet worden beschouwd alleen omdat het vóór de release geslaagde, reguliere alignment-tests heeft doorstaan. 5
Bij gesloten modellen die uitsluitend via een commerciële API worden aangeboden, houden providers doorgaans meer controle over finetuning en implementatie. Daardoor kunnen zij verdedigingsmaatregelen toepassen tijdens of na het finetunen die moeilijker af te dwingen zijn zodra gewichten vrij worden verspreid. De onderzoekers sluiten echter niet uit dat vergelijkbare tampering-risico’s ook daar relevant zijn. 25
Een aanvaller die veiligheidsmaatregelen kan verwijderen zonder de kerncapaciteiten van een model sterk aan te tasten, kan mogelijk grootschalig misbruik automatiseren. De onderzoekers noemen onder meer desinformatiecampagnes, geavanceerde phishing en scams, en schadelijke technische instructies als voorbeelden. 5
Daarom pleiten zij voor verder onderzoek naar tamper-resistentie, gestandaardiseerde adversariële tests zoals TamperBench vóór een release, en meer empirisch onderbouwde AI-beoordelingen bij aanschaf en inzet. Dat wordt volgens hen extra belangrijk nu overheden AI gebruiken of overwegen te gebruiken in onder meer de gezondheidszorg, fraudedetectie en het onderwijs. 25
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TamperBench concludeerde dat geen van de 21 onderzochte open weight modellen bestand was tegen alle geteste vormen van gewichts en latent space tampering.
TamperBench concludeerde dat geen van de 21 onderzochte open weight modellen bestand was tegen alle geteste vormen van gewichts en latent space tampering. Bij elk model konden onderzoekers de bereidheid om schadelijke antwoorden te geven aanzienlijk verhogen, terwijl een groot deel van het redeneervermogen behouden bleef.
Vooral heimelijke jailbreak finetuning, waaronder varianten met concurrerende doelstellingen, backdoors en stijlmodulatie, bleek doorgaans bijzonder effectief.