
Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
La conclusion centrale de TamperBench est sans ambiguïté : aucun des 21 modèles open weight évalués n’a conservé des protections suffisamment robustes pour résister à l’ensemble des menaces de détournement étudiées. Dans chaque cas, les chercheurs ont trouvé au moins une méthode permettant d’augmenter sensiblement la probabilité de réponses dangereuses, tout en préservant une grande partie des capacités de raisonnement du modèle. 25
Les modèles open weight sont des systèmes dont les poids — les paramètres appris pendant l’entraînement — peuvent être téléchargés, copiés et modifiés. Cette caractéristique favorise la recherche et l’audit, mais elle empêche aussi le développeur d’origine de contrôler pleinement les ajustements effectués après la publication.
L’évaluation portait sur 21 modèles, notamment des variantes de Llama, Qwen3 et Mistral, avec des tailles comprises entre 600 millions et 8 milliards de paramètres. 8
TamperBench a réuni neuf méthodes de modification dans l’espace des poids et des représentations latentes. Elles couvrent notamment :
Les attaques de jailbreak par fine-tuning furtif ont généralement produit les effets les plus importants. Les variantes fondées sur des objectifs concurrents, une porte dérobée ou la modulation du style entraînaient majoritairement le modèle sur des données bénignes, en y ajoutant une petite composante dangereuse. Cette discrétion apparente n’empêchait pas la dégradation des garde-fous. 2
Les chercheurs ne se sont pas contentés de maximiser le nombre de réponses nocives. Pour chaque couple attaque-modèle, ils ont recherché les réglages qui augmentaient le score de nocivité tout en limitant la baisse de précision sur MMLU-Pro à 10 % au maximum par rapport au modèle non attaqué. MMLU-Pro est un benchmark conçu pour mesurer la compréhension et le raisonnement sur des tâches exigeantes. 2
Autrement dit, le scénario étudié n’est pas celui d’un modèle rendu inutilisable : les attaques cherchent au contraire à retirer les protections tout en conservant une utilité élevée.
Les cinq modèles ayant bénéficié de défenses supplémentaires, parmi lesquels des variantes utilisant ReFAT et Circuit Breaking, se sont eux aussi révélés vulnérables. Ces techniques ont parfois amélioré la résistance, mais aucune n’a empêché de façon fiable la suppression des protections sur l’ensemble des attaques évaluées. 25
Ce résultat est particulièrement important pour les modèles distribués publiquement. Une fois les poids disponibles, ils peuvent être copiés, adaptés et redistribués sans que l’éditeur initial puisse imposer ses contrôles de sécurité aux utilisateurs en aval. 2
Les auteurs ne présentent pas l’ouverture des modèles comme un défaut en soi. Elle peut soutenir la recherche, la reproductibilité et la responsabilité des acteurs. Mais la réussite de tests d’alignement classiques avant la publication ne devrait pas être interprétée comme une garantie de sécurité durable pour un modèle dont les poids peuvent être modifiés. 5
Les modèles commerciaux accessibles uniquement par API ne sont pas nécessairement à l’abri de risques comparables. Toutefois, leurs fournisseurs gardent la main sur le fine-tuning et le déploiement, ce qui leur permet d’appliquer des protections à ces étapes — une possibilité qui disparaît largement lorsque les poids sont librement redistribués. 25
Selon les chercheurs, le retrait des garde-fous tout en conservant les capacités du modèle pourrait faciliter des usages malveillants à grande échelle : campagnes de désinformation, hameçonnage et escroqueries sophistiqués, ou encore production de conseils techniques dangereux. 5
Ils appellent donc à renforcer la recherche sur la résistance au détournement, à généraliser des évaluations adversariales standardisées avant toute diffusion, et à fonder davantage l’évaluation et l’achat de systèmes d’IA sur des données probantes. La question devient particulièrement sensible lorsque ces systèmes sont déployés dans la santé, la détection de la fraude, l’éducation ou d’autres services publics. 25
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Les 21 modèles testés, de 600 millions à 8 milliards de paramètres, ont tous pu être rendus nettement plus permissifs face à des demandes dangereuses.
Les 21 modèles testés, de 600 millions à 8 milliards de paramètres, ont tous pu être rendus nettement plus permissifs face à des demandes dangereuses. Les attaques de jailbreak par fine tuning furtif, notamment celles fondées sur les objectifs concurrents, les portes dérobées et la modulation du style, se sont généralement révélées les plus sévères.
Les protections ajoutées à certains modèles, dont ReFAT et Circuit Breaking, ont amélioré la résistance dans certains cas sans empêcher de manière fiable le retrait des garde fous.