Tutti i 21 modelli open weight testati erano vulnerabili ad almeno una delle nove minacce di manomissione, spesso senza perdere più del 10% delle prestazioni di ragionamento su MMLU Pro. Gli attacchi di jailbreak tuning, in particolare quelli basati su obiettivi concorrenti, backdoor e modulazione dello stile, sono...
Pubblicato daModificato con GPT-5.6 LunaImmagini generate con GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Il risultato centrale di TamperBench è netto: nessuno dei 21 modelli linguistici open-weight valutati disponeva di protezioni di sicurezza capaci di resistere in modo affidabile a tutte le tecniche di manomissione testate. I modelli, con dimensioni comprese indicativamente tra 600 milioni e 8 miliardi di parametri, includevano sia versioni standard sia varianti dotate di difese aggiuntive. Per ogni modello, almeno un attacco riusciva ad aumentare la disponibilità a produrre contenuti dannosi preservando gran parte delle capacità generali. 2
5
6
Il punto è rilevante perché i modelli open-weight possono essere copiati, sottoposti a fine-tuning e ridistribuiti dopo la pubblicazione. Un livello di sicurezza che funziona durante la valutazione originale dello sviluppatore non costituisce necessariamente un controllo duraturo quando gli utenti possono modificare direttamente i pesi del modello.
TamperBench è stato progettato per misurare la resistenza alla manomissione, non la semplice capacità di resistere ai jailbreak basati sui prompt. Il framework combina attacchi di fine-tuning nello spazio dei pesi con tecniche che manipolano le rappresentazioni latenti, quindi misura sia il comportamento di sicurezza sia le capacità conservate dal modello. Per ogni coppia modello-attacco, il benchmark ha utilizzato ricerche sistematiche degli iperparametri invece di basarsi su una singola configurazione. 2
Lo studio ha esaminato nove categorie di manomissione, tra cui:
Il test non consisteva semplicemente nel verificare se un modello potesse essere reso non sicuro. I ricercatori cercavano attacchi capaci di aumentare le risposte dannose mantenendo il calo dell’accuratezza di ragionamento su MMLU-Pro entro il 10% rispetto alle prestazioni del modello non manomesso. 2
I risultati più severi sono arrivati generalmente dagli attacchi di jailbreak-tuning. Tra le varianti considerate figurano quelle basate su obiettivi concorrenti, backdoor e modulazione dello stile. Queste tecniche sono particolarmente significative perché possono utilizzare soprattutto dati di addestramento benigni, con una componente dannosa più ridotta. Non si tratta quindi necessariamente di un tentativo diretto di riaddestrare il modello a comportarsi in modo pericoloso, ma di un intervento mirato a modificare le sue risposte di sicurezza preservandone l’utilità. 2
6
La conclusione più ampia del paper è sfavorevole: sicurezza e capacità possono essere separate. La manomissione può indebolire il comportamento di rifiuto senza compromettere in proporzione le prestazioni di ragionamento. Un modello può quindi continuare a sembrare efficace nei benchmark convenzionali, pur diventando molto più rischioso da distribuire.
TamperBench ha valutato 21 modelli open-weight tra 0,6 e 8 miliardi di parametri, comprendendo famiglie come Llama, Qwen3 e Mistral. Le evidenze disponibili sostengono il risultato generale del benchmark: ogni modello testato era vulnerabile ad almeno uno degli attacchi esaminati. 5
6
Le fonti fornite, tuttavia, non riportano gli incrementi numerici esatti della dannosità per Llama-3-8B-Instruct o Qwen3-8B-Instruct nel rispetto del vincolo di un calo massimo del 10% su MMLU-Pro. Questi valori non possono quindi essere ricavati dal risultato complessivo. La conclusione sostenibile è qualitativa e comparativa: gli attacchi potevano aumentare in modo significativo il comportamento dannoso conservando gran parte delle capacità di ragionamento, ma le evidenze disponibili non stabiliscono una percentuale precisa per nessuno dei due modelli.
Lo studio ha inoltre rilevato che le versioni base e quelle sottoposte a post-training non seguono un unico schema di resistenza. La loro vulnerabilità relativa può cambiare da una famiglia all’altra; per le varianti Llama 3 e Qwen3 sono state osservate tendenze opposte. 6
No. Anche i cinque modelli dotati di difese aggiuntive testati — comprese le varianti ReFAT e Circuit Breaking — sono risultati vulnerabili alla batteria di attacchi. Le difese hanno migliorato la resistenza in alcuni scenari, ma non hanno impedito in modo affidabile la rimozione delle protezioni di sicurezza contro tutte le minacce valutate. 2
5
Nel confronto, Triplet emerge come una delle difese più robuste e capaci di preservare le prestazioni. È però un segnale incoraggiante per la ricerca, non una garanzia definitiva: il risultato principale del benchmark è che nessuna difesa testata ha eliminato il problema della manomissione sull’intera suite di attacchi. 6
Lo studio non dimostra che i modelli open-weight siano privi di valore. La pubblicazione dei pesi può favorire ricerca, audit e responsabilità. La lezione più circoscritta è un’altra: superare una normale valutazione di allineamento o sicurezza prima del rilascio non basta a dimostrare che il modello resterà sicuro dopo che i suoi pesi saranno stati modificati liberamente. 5
I modelli commerciali chiusi e i servizi API devono affrontare questioni correlate, tra cui la sicurezza del fine-tuning e del post-training. Tuttavia, i fornitori mantengono un controllo maggiore sulla pipeline di addestramento e sull’ambiente di distribuzione. Questo può permettere di applicare salvaguardie durante o dopo la personalizzazione, opzioni molto più difficili da imporre quando i pesi sono stati redistribuiti pubblicamente. 2
5
Il rischio evidenziato da TamperBench non consiste soltanto nella possibilità che una persona trovi un singolo prompt capace di far fallire un rifiuto. Se la manomissione preserva le capacità utili, un modello modificato potrebbe essere riutilizzato molte volte per attività dannose come disinformazione su larga scala, phishing e truffe o assistenza tecnica pericolosa. I ricercatori presentano questi scenari come implicazioni della rimozione delle protezioni con conservazione delle capacità, non come attività di abuso misurate direttamente dal benchmark. 5
Per le organizzazioni che devono scegliere un modello, la distinzione pratica è tra:
I ricercatori chiedono metodi più solidi per aumentare la resistenza alla manomissione, valutazioni avversarie standardizzate come TamperBench prima del rilascio e procedure di analisi e approvvigionamento dell’IA maggiormente basate sulle evidenze. L’attenzione è particolarmente importante nei settori ad alto impatto, tra cui sanità, contrasto alle frodi, istruzione e servizi pubblici, dove il comportamento del modello dopo la distribuzione può contare quanto il suo profilo di sicurezza iniziale. 2
5
TamperBench non dimostra che ogni modello open-weight verrà usato per scopi impropri. Dimostra però che, nei 21 modelli esaminati, le protezioni di sicurezza non rappresentavano una garanzia affidabile una volta che un attaccante poteva intervenire sul modello.
Il jailbreak-tuning occulto è risultato in genere la categoria di attacco più efficace; le difese aggiuntive hanno aiutato in alcuni casi, ma non hanno colmato completamente la vulnerabilità. Inoltre, le fonti disponibili non consentono di indicare percentuali precise sull’aumento della dannosità per i singoli modelli Llama o Qwen3.
Per i modelli open-weight, le valutazioni di sicurezza dovranno quindi misurare non solo ciò che il modello sa fare al momento del lancio, ma anche quanta parte del suo comportamento sicuro riesce a mantenere dopo una modifica.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Tutti i 21 modelli open weight testati erano vulnerabili ad almeno una delle nove minacce di manomissione, spesso senza perdere più del 10% delle prestazioni di ragionamento su MMLU Pro.
Tutti i 21 modelli open weight testati erano vulnerabili ad almeno una delle nove minacce di manomissione, spesso senza perdere più del 10% delle prestazioni di ragionamento su MMLU Pro. Gli attacchi di jailbreak tuning, in particolare quelli basati su obiettivi concorrenti, backdoor e modulazione dello stile, sono risultati generalmente i più efficaci.
Le varianti con difese aggiuntive, tra cui ReFAT e Circuit Breaking, hanno migliorato la resistenza in alcuni casi, ma non hanno offerto una garanzia affidabile contro la rimozione delle protezioni.
Tutti i 21 modelli open weight testati erano vulnerabili ad almeno una delle nove minacce di manomissione, spesso senza perdere più del 10% delle prestazioni di ragionamento su MMLU Pro. Gli attacchi di jailbreak tuning, in particolare quelli basati su obiettivi concorrenti, backdoor e modulazione dello stile, sono...
Pubblicato daModificato con GPT-5.6 LunaImmagini generate con GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Il risultato centrale di TamperBench è netto: nessuno dei 21 modelli linguistici open-weight valutati disponeva di protezioni di sicurezza capaci di resistere in modo affidabile a tutte le tecniche di manomissione testate. I modelli, con dimensioni comprese indicativamente tra 600 milioni e 8 miliardi di parametri, includevano sia versioni standard sia varianti dotate di difese aggiuntive. Per ogni modello, almeno un attacco riusciva ad aumentare la disponibilità a produrre contenuti dannosi preservando gran parte delle capacità generali. 2
5
6
Il punto è rilevante perché i modelli open-weight possono essere copiati, sottoposti a fine-tuning e ridistribuiti dopo la pubblicazione. Un livello di sicurezza che funziona durante la valutazione originale dello sviluppatore non costituisce necessariamente un controllo duraturo quando gli utenti possono modificare direttamente i pesi del modello.
TamperBench è stato progettato per misurare la resistenza alla manomissione, non la semplice capacità di resistere ai jailbreak basati sui prompt. Il framework combina attacchi di fine-tuning nello spazio dei pesi con tecniche che manipolano le rappresentazioni latenti, quindi misura sia il comportamento di sicurezza sia le capacità conservate dal modello. Per ogni coppia modello-attacco, il benchmark ha utilizzato ricerche sistematiche degli iperparametri invece di basarsi su una singola configurazione. 2
Lo studio ha esaminato nove categorie di manomissione, tra cui:
Il test non consisteva semplicemente nel verificare se un modello potesse essere reso non sicuro. I ricercatori cercavano attacchi capaci di aumentare le risposte dannose mantenendo il calo dell’accuratezza di ragionamento su MMLU-Pro entro il 10% rispetto alle prestazioni del modello non manomesso. 2
I risultati più severi sono arrivati generalmente dagli attacchi di jailbreak-tuning. Tra le varianti considerate figurano quelle basate su obiettivi concorrenti, backdoor e modulazione dello stile. Queste tecniche sono particolarmente significative perché possono utilizzare soprattutto dati di addestramento benigni, con una componente dannosa più ridotta. Non si tratta quindi necessariamente di un tentativo diretto di riaddestrare il modello a comportarsi in modo pericoloso, ma di un intervento mirato a modificare le sue risposte di sicurezza preservandone l’utilità. 2
6
La conclusione più ampia del paper è sfavorevole: sicurezza e capacità possono essere separate. La manomissione può indebolire il comportamento di rifiuto senza compromettere in proporzione le prestazioni di ragionamento. Un modello può quindi continuare a sembrare efficace nei benchmark convenzionali, pur diventando molto più rischioso da distribuire.
TamperBench ha valutato 21 modelli open-weight tra 0,6 e 8 miliardi di parametri, comprendendo famiglie come Llama, Qwen3 e Mistral. Le evidenze disponibili sostengono il risultato generale del benchmark: ogni modello testato era vulnerabile ad almeno uno degli attacchi esaminati. 5
6
Le fonti fornite, tuttavia, non riportano gli incrementi numerici esatti della dannosità per Llama-3-8B-Instruct o Qwen3-8B-Instruct nel rispetto del vincolo di un calo massimo del 10% su MMLU-Pro. Questi valori non possono quindi essere ricavati dal risultato complessivo. La conclusione sostenibile è qualitativa e comparativa: gli attacchi potevano aumentare in modo significativo il comportamento dannoso conservando gran parte delle capacità di ragionamento, ma le evidenze disponibili non stabiliscono una percentuale precisa per nessuno dei due modelli.
Lo studio ha inoltre rilevato che le versioni base e quelle sottoposte a post-training non seguono un unico schema di resistenza. La loro vulnerabilità relativa può cambiare da una famiglia all’altra; per le varianti Llama 3 e Qwen3 sono state osservate tendenze opposte. 6
No. Anche i cinque modelli dotati di difese aggiuntive testati — comprese le varianti ReFAT e Circuit Breaking — sono risultati vulnerabili alla batteria di attacchi. Le difese hanno migliorato la resistenza in alcuni scenari, ma non hanno impedito in modo affidabile la rimozione delle protezioni di sicurezza contro tutte le minacce valutate. 2
5
Nel confronto, Triplet emerge come una delle difese più robuste e capaci di preservare le prestazioni. È però un segnale incoraggiante per la ricerca, non una garanzia definitiva: il risultato principale del benchmark è che nessuna difesa testata ha eliminato il problema della manomissione sull’intera suite di attacchi. 6
Lo studio non dimostra che i modelli open-weight siano privi di valore. La pubblicazione dei pesi può favorire ricerca, audit e responsabilità. La lezione più circoscritta è un’altra: superare una normale valutazione di allineamento o sicurezza prima del rilascio non basta a dimostrare che il modello resterà sicuro dopo che i suoi pesi saranno stati modificati liberamente. 5
I modelli commerciali chiusi e i servizi API devono affrontare questioni correlate, tra cui la sicurezza del fine-tuning e del post-training. Tuttavia, i fornitori mantengono un controllo maggiore sulla pipeline di addestramento e sull’ambiente di distribuzione. Questo può permettere di applicare salvaguardie durante o dopo la personalizzazione, opzioni molto più difficili da imporre quando i pesi sono stati redistribuiti pubblicamente. 2
5
Il rischio evidenziato da TamperBench non consiste soltanto nella possibilità che una persona trovi un singolo prompt capace di far fallire un rifiuto. Se la manomissione preserva le capacità utili, un modello modificato potrebbe essere riutilizzato molte volte per attività dannose come disinformazione su larga scala, phishing e truffe o assistenza tecnica pericolosa. I ricercatori presentano questi scenari come implicazioni della rimozione delle protezioni con conservazione delle capacità, non come attività di abuso misurate direttamente dal benchmark. 5
Per le organizzazioni che devono scegliere un modello, la distinzione pratica è tra:
I ricercatori chiedono metodi più solidi per aumentare la resistenza alla manomissione, valutazioni avversarie standardizzate come TamperBench prima del rilascio e procedure di analisi e approvvigionamento dell’IA maggiormente basate sulle evidenze. L’attenzione è particolarmente importante nei settori ad alto impatto, tra cui sanità, contrasto alle frodi, istruzione e servizi pubblici, dove il comportamento del modello dopo la distribuzione può contare quanto il suo profilo di sicurezza iniziale. 2
5
TamperBench non dimostra che ogni modello open-weight verrà usato per scopi impropri. Dimostra però che, nei 21 modelli esaminati, le protezioni di sicurezza non rappresentavano una garanzia affidabile una volta che un attaccante poteva intervenire sul modello.
Il jailbreak-tuning occulto è risultato in genere la categoria di attacco più efficace; le difese aggiuntive hanno aiutato in alcuni casi, ma non hanno colmato completamente la vulnerabilità. Inoltre, le fonti disponibili non consentono di indicare percentuali precise sull’aumento della dannosità per i singoli modelli Llama o Qwen3.
Per i modelli open-weight, le valutazioni di sicurezza dovranno quindi misurare non solo ciò che il modello sa fare al momento del lancio, ma anche quanta parte del suo comportamento sicuro riesce a mantenere dopo una modifica.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Tutti i 21 modelli open weight testati erano vulnerabili ad almeno una delle nove minacce di manomissione, spesso senza perdere più del 10% delle prestazioni di ragionamento su MMLU Pro.
Tutti i 21 modelli open weight testati erano vulnerabili ad almeno una delle nove minacce di manomissione, spesso senza perdere più del 10% delle prestazioni di ragionamento su MMLU Pro. Gli attacchi di jailbreak tuning, in particolare quelli basati su obiettivi concorrenti, backdoor e modulazione dello stile, sono risultati generalmente i più efficaci.
Le varianti con difese aggiuntive, tra cui ReFAT e Circuit Breaking, hanno migliorato la resistenza in alcuni casi, ma non hanno offerto una garanzia affidabile contro la rimozione delle protezioni.