TamperBench evaluó 21 modelos de lenguaje con pesos abiertos, incluidos modelos Llama, Qwen3 y Mistral, con entre 600 millones y 8.000 millones de parámetros. Ninguno mantuvo protecciones suficientemente robustas frente a todas las amenazas: cada modelo pudo hacerse considerablemente más propenso a generar contenido...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
El estudio TamperBench, presentado en la conferencia ACM KDD ’26, sometió a prueba la resistencia de las salvaguardas de seguridad de 21 modelos de lenguaje con pesos abiertos. El conjunto incluía modelos de las familias Llama, Qwen3 y Mistral, con tamaños comprendidos entre 600 millones y 8.000 millones de parámetros. 258
La conclusión central fue contundente: ninguno de los modelos resistió de forma fiable todas las técnicas de manipulación evaluadas. En cada caso, los investigadores encontraron al menos una forma de aumentar sustancialmente la disposición del modelo a producir respuestas dañinas, manteniendo buena parte de sus capacidades de razonamiento. Por ello, describen las salvaguardas actuales como una garantía insuficiente cuando los pesos del modelo pueden modificarse y redistribuirse. 25
TamperBench reunió nueve amenazas de manipulación en el espacio de los pesos y de las representaciones latentes. El conjunto abarcó varias modalidades:
Los ataques encubiertos de jailbreak fueron normalmente los más severos. Destacaron las variantes de objetivos enfrentados, puertas traseras y modulación del estilo: se entrenaban principalmente con datos benignos, incorporando solo una pequeña proporción de ejemplos dañinos, pero aun así podían debilitar de manera importante las restricciones de seguridad. 2
Para comparar los resultados, el estudio buscó configuraciones que maximizaran las respuestas dañinas sin permitir que la precisión en razonamiento del modelo —medida con MMLU-Pro— cayera más de un 10 % respecto a la versión no atacada. Esto es relevante porque muestra que el deterioro de la seguridad no tenía por qué ir acompañado de una pérdida evidente de utilidad. 2
Los datos disponibles no incluyen los aumentos exactos de peligrosidad para cada modelo concreto, como Llama-3-8B-Instruct o Qwen3-8B-Instruct. Por tanto, no es posible atribuir cifras precisas a esos modelos sin extrapolar más allá de la evidencia publicada.
El equipo también probó cinco modelos reforzados con técnicas de defensa, incluidas variantes de ReFAT y Circuit Breaking. Estas medidas mejoraron la resistencia en algunos escenarios, pero no impidieron de forma consistente la eliminación de las salvaguardas a lo largo de todo el conjunto de ataques. 25
El problema está ligado a la naturaleza de los modelos con pesos abiertos: cualquiera que obtenga los pesos puede copiarlos, ajustarlos y redistribuirlos. El desarrollador original ya no puede imponer directamente controles sobre esas modificaciones posteriores. 2
Los investigadores no sostienen que los modelos con pesos abiertos carezcan de valor. La apertura puede facilitar la investigación, la auditoría y la rendición de cuentas. Sin embargo, advierten de que un modelo no debería considerarse seguro únicamente porque haya superado las pruebas habituales de alineamiento antes de su lanzamiento. 5
El riesgo tampoco se limita necesariamente a los modelos abiertos. Los sistemas comerciales accesibles mediante API podrían enfrentarse a problemas relacionados, aunque sus proveedores conservan un mayor control sobre el ajuste y el despliegue. Ese control permite aplicar defensas durante o después del ajuste que resultan mucho más difíciles de imponer cuando los pesos circulan libremente. 25
Una retirada de las salvaguardas que preserve las capacidades del modelo podría facilitar usos maliciosos a escala, como campañas masivas de desinformación, fraudes y phishing sofisticados o la generación de instrucciones técnicas peligrosas. 5
Por ello, los autores piden más investigación sobre resistencia a la manipulación, evaluaciones adversariales estandarizadas —como TamperBench— antes de publicar modelos y métodos de evaluación y contratación de sistemas de IA basados en más evidencia. La recomendación cobra especial importancia a medida que gobiernos y organizaciones incorporan estas herramientas a servicios como la sanidad, la detección del fraude y la educación. 25
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
TamperBench evaluó 21 modelos de lenguaje con pesos abiertos, incluidos modelos Llama, Qwen3 y Mistral, con entre 600 millones y 8.000 millones de parámetros.
TamperBench evaluó 21 modelos de lenguaje con pesos abiertos, incluidos modelos Llama, Qwen3 y Mistral, con entre 600 millones y 8.000 millones de parámetros. Ninguno mantuvo protecciones suficientemente robustas frente a todas las amenazas: cada modelo pudo hacerse considerablemente más propenso a generar contenido dañino sin perder gran parte de su capacidad de razonamiento.
Los ataques de ajuste encubierto para jailbreak —en especial los basados en objetivos enfrentados, puertas traseras y modulación del estilo— estuvieron entre los más graves.