Alle 21 geteste open weight modellen waren kwetsbaar voor minstens één van negen sabotageaanvallen, vaak zonder meer dan 10% van hun MMLU Pro prestaties te verliezen. Verborgen jailbreak finetuning, waaronder varianten met concurrerende doelstellingen, backdoors en stijlmodulatie, was doorgaans de effectiefste aanva...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
De hoofdconclusie van TamperBench is opvallend scherp: geen van de 21 onderzochte open-weight taalmodellen beschikte over veiligheidsmaatregelen die de geteste sabotageaanvallen betrouwbaar doorstonden. De modellen hadden tussen ongeveer 600 miljoen en 8 miljard parameters en omvatten zowel standaardmodellen als varianten met extra verdedigingen. Bij elk getest model kon minstens één aanval de bereidheid om schadelijke inhoud te produceren vergroten, terwijl een groot deel van de algemene mogelijkheden behouden bleef. 256
Dat is vooral relevant omdat open-weight modellen na hun release kunnen worden gekopieerd, gefinetuned en opnieuw verspreid. Een veiligheidslaag die tijdens de oorspronkelijke tests van de ontwikkelaar goed werkt, is niet automatisch een blijvende controle zodra gebruikers de modelgewichten kunnen aanpassen.
TamperBench is opgezet om weerstand tegen manipulatie te meten, niet alleen de gebruikelijke weerstand tegen jailbreaks via prompts. Het raamwerk combineert aanvallen met finetuning in de gewichtsruimte met aanvallen die latente representaties van een model manipuleren. Vervolgens worden zowel het veiligheidsgedrag als de behouden capaciteiten beoordeeld. Voor elke combinatie van model en aanval gebruikten de onderzoekers systematische zoekopdrachten naar hyperparameters, in plaats van te vertrouwen op één aanvalconfiguratie. 2
De studie omvatte negen vormen van manipulatie, waaronder:
De kernvraag was niet simpelweg of een model onveilig kon worden gemaakt. De onderzoekers zochten naar aanvallen die het aantal schadelijke antwoorden verhoogden, terwijl de daling in redeneernauwkeurigheid op MMLU-Pro beperkt bleef tot maximaal 10% ten opzichte van het onaangetaste model. 2
De zwaarste resultaten kwamen doorgaans van jailbreak-finetuning. De gerapporteerde varianten waren onder meer aanvallen met concurrerende doelstellingen, backdoors en stijlmodulatie. Ze vielen op omdat ze grotendeels onschadelijke trainingsdata konden gebruiken, aangevuld met een kleinere schadelijke component. Daardoor leken ze minder op een botte poging om een model volledig opnieuw op onveilig gedrag te trainen, en meer op een gerichte poging om het veiligheidsgedrag te veranderen zonder de bruikbaarheid evenredig aan te tasten. 26
De bredere conclusie van het onderzoek is dat veiligheid en capaciteit op een ongunstige manier van elkaar kunnen worden losgekoppeld. Manipulatie kan het weigergedrag verzwakken zonder het redeneervermogen even sterk te beschadigen. Een model kan daardoor goed blijven scoren op conventionele benchmarks en tegelijkertijd aanzienlijk riskanter worden om in te zetten.
TamperBench testte 21 open-weight modellen met een omvang van 0,6 tot 8 miljard parameters, waaronder modellen uit families als Llama, Qwen3 en Mistral. De aangeleverde onderzoeksgegevens ondersteunen de benchmarkbrede conclusie dat elk getest model kwetsbaar was voor minstens één van de onderzochte aanvallen. 56
De beschikbare bronnen bevatten echter niet de exacte toename van schadelijke antwoorden voor Llama-3-8B-Instruct of Qwen3-8B-Instruct onder de voorwaarde dat de MMLU-Pro-prestaties maximaal 10% mochten dalen. Die percentages kunnen daarom niet betrouwbaar uit het algemene resultaat worden afgeleid.
De verdedigbare conclusie is kwalitatief: de aanvallen konden schadelijk gedrag aanzienlijk versterken terwijl een groot deel van het redeneervermogen behouden bleef. De aangeleverde gegevens leveren geen precieze procentuele stijging voor een van beide genoemde modellen.
Ook volgden basis- en post-trained varianten geen universeel patroon. Hun relatieve weerstand tegen manipulatie kon per modelfamilie verschillen; voor varianten van Llama 3 en Qwen3 werden zelfs tegengestelde trends gemeld. 6
Niet afdoende. Ook de vijf geteste modellen met extra verdedigingen — waaronder varianten met ReFAT en Circuit Breaking — bleken kwetsbaar voor de aanvalssuite. De verdedigingen verhoogden de weerstand in sommige situaties, maar voorkwamen niet betrouwbaar dat de veiligheidsmaatregelen bij alle geteste dreigingen konden worden verzwakt. 25
In de onderzochte vergelijkingen komt Triplet naar voren als een van de robuustere verdedigingen die de modelcapaciteiten relatief goed wist te behouden. Dat is een veelbelovend onderzoeksresultaat, geen garantie voor de praktijk: de hoofdconclusie blijft dat geen enkele geteste verdediging het probleem van manipulatie over de volledige aanvalssuite oploste. 6
De studie bewijst niet dat open-weight modellen per definitie waardeloos of onveilig zijn. Een open release kan onderzoek, controle en verantwoording juist ondersteunen. De beperktere, maar belangrijke les is dat het doorstaan van een conventionele alignment- of veiligheidstest vóór release niet bewijst dat een model veilig blijft nadat de gewichten vrijelijk zijn aangepast. 5
Gesloten commerciële modellen en API-diensten worden met vergelijkbare vragen geconfronteerd rond finetuning en veiligheid na training. Hun aanbieders houden echter meer controle over de trainingsketen en de gebruiksomgeving. Daardoor kunnen zij tijdens of na een aanpassing extra waarborgen toepassen — iets wat veel moeilijker af te dwingen is zodra modelgewichten publiekelijk zijn verspreid. 25
Het risico dat TamperBench blootlegt, draait niet alleen om één gebruiker die met een enkele prompt een weigering weet te omzeilen. Als nuttige capaciteiten behouden blijven, kan een aangepast model herhaaldelijk worden ingezet voor schadelijke taken, zoals grootschalige desinformatie, phishing en oplichting of gevaarlijke technische assistentie. De onderzoekers presenteren dit als een mogelijke consequentie van het verwijderen van veiligheidsmaatregelen zonder evenredig capaciteitsverlies — niet als een vorm van misbruik die de benchmark zelf heeft uitgevoerd. 5
Voor organisaties die een model selecteren, is het daarom belangrijk onderscheid te maken tussen:
De onderzoekers pleiten voor sterker onderzoek naar manipulatiebestendigheid, gestandaardiseerde adversariële evaluaties zoals TamperBench vóór release en meer empirisch onderbouwde procedures voor AI-beoordeling en inkoop. Ze wijzen daarbij specifiek op omgevingen met grote maatschappelijke impact, zoals de zorg, fraudedetectie, het onderwijs en publieke dienstverlening. Daar kan het gedrag van een model na release net zo belangrijk zijn als het oorspronkelijke veiligheidsrapport. 25
TamperBench laat niet zien dat elk open-weight model daadwerkelijk zal worden misbruikt. Wel blijkt uit de test van 21 modellen dat veiligheidsmaatregelen geen betrouwbare garantie vormen zodra een aanvaller het model kan manipuleren. Verborgen jailbreak-finetuning was doorgaans de krachtigste aanvalscategorie. Extra verdedigingen hielpen in sommige gevallen, maar dichtten de kloof niet volledig. En de beschikbare gegevens ondersteunen geen exacte percentages voor de toename van schadelijk gedrag bij afzonderlijke Llama- of Qwen3-modellen.
Voor open-weight releases moet veiligheid daarom niet alleen worden beoordeeld op het moment van lancering. Minstens zo belangrijk is de vraag hoeveel van dat veiligheidsgedrag overeind blijft nadat iemand het model heeft aangepast.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Alle 21 geteste open weight modellen waren kwetsbaar voor minstens één van negen sabotageaanvallen, vaak zonder meer dan 10% van hun MMLU Pro prestaties te verliezen.
Alle 21 geteste open weight modellen waren kwetsbaar voor minstens één van negen sabotageaanvallen, vaak zonder meer dan 10% van hun MMLU Pro prestaties te verliezen. Verborgen jailbreak finetuning, waaronder varianten met concurrerende doelstellingen, backdoors en stijlmodulatie, was doorgaans de effectiefste aanvalscategorie.
Modellen met extra verdedigingen, waaronder varianten met ReFAT en Circuit Breaking, waren in sommige situaties beter bestand tegen aanvallen, maar boden geen betrouwbare garantie tegen het verwijderen van veiligheids...