Nessuno dei 21 modelli open weight testati ha mantenuto protezioni di sicurezza robuste contro tutte le minacce di manomissione valutate. Gli attacchi più gravi sono stati generalmente quelli di jailbreak tramite fine tuning occulto, incluse le varianti a obiettivi concorrenti, backdoor e modulazione dello stile.
Pubblicato daImmagini generate con GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
Lo studio TamperBench, presentato alla conferenza ACM KDD ’26, conclude che le protezioni di sicurezza integrate nei 21 modelli open-weight analizzati non sono abbastanza robuste da garantire la sicurezza dopo la modifica dei pesi. Il campione comprende modelli delle famiglie Llama, Qwen3 e Mistral, con dimensioni comprese tra 600 milioni e 8 miliardi di parametri. 2
5
8
In pratica, ogni modello poteva essere reso molto più incline a generare contenuti dannosi senza perdere gran parte delle proprie capacità di ragionamento. Gli autori descrivono quindi le attuali salvaguardie come una protezione insufficiente per i modelli i cui pesi possono essere scaricati, modificati e ridistribuiti. 2
5
TamperBench ha riunito nove tecniche di manomissione basate sia sul fine-tuning nello spazio dei pesi sia sulla modifica delle rappresentazioni latenti. Le prove includevano:
Tra le tecniche generalmente più severe figurano le varianti di jailbreak-tuning basate su obiettivi concorrenti, backdoor e modulazione dello stile. Questi attacchi venivano addestrati soprattutto su dati benigni, con una componente dannosa relativamente ridotta, rendendo più difficile individuare la manomissione attraverso un controllo superficiale del comportamento del modello. 2
Per confrontare gli attacchi in modo realistico, i ricercatori hanno scelto configurazioni capaci di massimizzare i punteggi di dannosità mantenendo il calo dell’accuratezza su MMLU-Pro, un benchmark per comprensione e ragionamento, entro il 10% rispetto al modello non attaccato. Il risultato mostra che la rimozione delle protezioni non richiede necessariamente di rendere il modello molto meno capace. 2
Lo studio non fornisce, nelle evidenze disponibili, gli aumenti numerici della dannosità per ciascun modello. Per questo non è possibile indicare valori affidabili specifici per Llama-3-8B-Instruct o Qwen3-8B-Instruct.
TamperBench ha esaminato anche cinque modelli con meccanismi di difesa aggiuntivi, comprese varianti basate su ReFAT e Circuit Breaking. Queste tecniche hanno migliorato la resistenza in alcuni scenari, ma non hanno impedito in modo costante la rimozione delle protezioni lungo l’intero insieme di attacchi. 2
5
La vulnerabilità è legata alla natura stessa dei modelli open-weight: una volta pubblicati i pesi, chiunque può copiarli, sottoporli a fine-tuning o distribuirne una versione modificata. Il detentore originale non può più controllare direttamente tutte le modalità di utilizzo o applicare le stesse barriere disponibili in un servizio API. 2
I ricercatori non sostengono che i modelli open-weight siano privi di valore. La disponibilità dei pesi può favorire ricerca, verificabilità e responsabilità. Il punto è un altro: il superamento dei normali test di allineamento prima del rilascio non dovrebbe essere considerato una garanzia sufficiente quando il modello può essere modificato liberamente. 5
Anche i modelli commerciali accessibili tramite API possono avere rischi di manomissione, ma i fornitori che controllano addestramento, fine-tuning e distribuzione possono applicare difese durante queste fasi e dopo l’addestramento. Queste possibilità sono molto più limitate quando i pesi vengono redistribuiti senza controllo. 2
5
Secondo gli autori, la rimozione delle protezioni preservando le capacità del modello potrebbe rendere più scalabili abusi come campagne di disinformazione, phishing e truffe sofisticate o la generazione di istruzioni tecniche pericolose. 5
Lo studio chiede quindi più ricerca sulla resistenza alle manomissioni, valutazioni avversariali standardizzate come TamperBench prima della pubblicazione dei modelli e criteri di acquisto dell’AI più basati sulle evidenze. La questione diventa particolarmente importante quando i sistemi vengono impiegati in sanità, rilevamento delle frodi, istruzione e altri servizi pubblici. 2
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nessuno dei 21 modelli open weight testati ha mantenuto protezioni di sicurezza robuste contro tutte le minacce di manomissione valutate.
Nessuno dei 21 modelli open weight testati ha mantenuto protezioni di sicurezza robuste contro tutte le minacce di manomissione valutate. Gli attacchi più gravi sono stati generalmente quelli di jailbreak tramite fine tuning occulto, incluse le varianti a obiettivi concorrenti, backdoor e modulazione dello stile.
In diversi casi è stato possibile aumentare sostanzialmente la produzione di contenuti dannosi mantenendo il calo di accuratezza su MMLU Pro entro il 10%.
Nessuno dei 21 modelli open weight testati ha mantenuto protezioni di sicurezza robuste contro tutte le minacce di manomissione valutate. Gli attacchi più gravi sono stati generalmente quelli di jailbreak tramite fine tuning occulto, incluse le varianti a obiettivi concorrenti, backdoor e modulazione dello stile.
Pubblicato daImmagini generate con GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
Lo studio TamperBench, presentato alla conferenza ACM KDD ’26, conclude che le protezioni di sicurezza integrate nei 21 modelli open-weight analizzati non sono abbastanza robuste da garantire la sicurezza dopo la modifica dei pesi. Il campione comprende modelli delle famiglie Llama, Qwen3 e Mistral, con dimensioni comprese tra 600 milioni e 8 miliardi di parametri. 2
5
8
In pratica, ogni modello poteva essere reso molto più incline a generare contenuti dannosi senza perdere gran parte delle proprie capacità di ragionamento. Gli autori descrivono quindi le attuali salvaguardie come una protezione insufficiente per i modelli i cui pesi possono essere scaricati, modificati e ridistribuiti. 2
5
TamperBench ha riunito nove tecniche di manomissione basate sia sul fine-tuning nello spazio dei pesi sia sulla modifica delle rappresentazioni latenti. Le prove includevano:
Tra le tecniche generalmente più severe figurano le varianti di jailbreak-tuning basate su obiettivi concorrenti, backdoor e modulazione dello stile. Questi attacchi venivano addestrati soprattutto su dati benigni, con una componente dannosa relativamente ridotta, rendendo più difficile individuare la manomissione attraverso un controllo superficiale del comportamento del modello. 2
Per confrontare gli attacchi in modo realistico, i ricercatori hanno scelto configurazioni capaci di massimizzare i punteggi di dannosità mantenendo il calo dell’accuratezza su MMLU-Pro, un benchmark per comprensione e ragionamento, entro il 10% rispetto al modello non attaccato. Il risultato mostra che la rimozione delle protezioni non richiede necessariamente di rendere il modello molto meno capace. 2
Lo studio non fornisce, nelle evidenze disponibili, gli aumenti numerici della dannosità per ciascun modello. Per questo non è possibile indicare valori affidabili specifici per Llama-3-8B-Instruct o Qwen3-8B-Instruct.
TamperBench ha esaminato anche cinque modelli con meccanismi di difesa aggiuntivi, comprese varianti basate su ReFAT e Circuit Breaking. Queste tecniche hanno migliorato la resistenza in alcuni scenari, ma non hanno impedito in modo costante la rimozione delle protezioni lungo l’intero insieme di attacchi. 2
5
La vulnerabilità è legata alla natura stessa dei modelli open-weight: una volta pubblicati i pesi, chiunque può copiarli, sottoporli a fine-tuning o distribuirne una versione modificata. Il detentore originale non può più controllare direttamente tutte le modalità di utilizzo o applicare le stesse barriere disponibili in un servizio API. 2
I ricercatori non sostengono che i modelli open-weight siano privi di valore. La disponibilità dei pesi può favorire ricerca, verificabilità e responsabilità. Il punto è un altro: il superamento dei normali test di allineamento prima del rilascio non dovrebbe essere considerato una garanzia sufficiente quando il modello può essere modificato liberamente. 5
Anche i modelli commerciali accessibili tramite API possono avere rischi di manomissione, ma i fornitori che controllano addestramento, fine-tuning e distribuzione possono applicare difese durante queste fasi e dopo l’addestramento. Queste possibilità sono molto più limitate quando i pesi vengono redistribuiti senza controllo. 2
5
Secondo gli autori, la rimozione delle protezioni preservando le capacità del modello potrebbe rendere più scalabili abusi come campagne di disinformazione, phishing e truffe sofisticate o la generazione di istruzioni tecniche pericolose. 5
Lo studio chiede quindi più ricerca sulla resistenza alle manomissioni, valutazioni avversariali standardizzate come TamperBench prima della pubblicazione dei modelli e criteri di acquisto dell’AI più basati sulle evidenze. La questione diventa particolarmente importante quando i sistemi vengono impiegati in sanità, rilevamento delle frodi, istruzione e altri servizi pubblici. 2
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nessuno dei 21 modelli open weight testati ha mantenuto protezioni di sicurezza robuste contro tutte le minacce di manomissione valutate.
Nessuno dei 21 modelli open weight testati ha mantenuto protezioni di sicurezza robuste contro tutte le minacce di manomissione valutate. Gli attacchi più gravi sono stati generalmente quelli di jailbreak tramite fine tuning occulto, incluse le varianti a obiettivi concorrenti, backdoor e modulazione dello stile.
In diversi casi è stato possibile aumentare sostanzialmente la produzione di contenuti dannosi mantenendo il calo di accuratezza su MMLU Pro entro il 10%.