Los 21 modelos de pesos abiertos fueron vulnerables a al menos una de las nueve amenazas de manipulación evaluadas, a menudo manteniendo el rendimiento de razonamiento dentro de una caída del 10 % en MMLU Pro. Los ataques de ajuste para eludir salvaguardas —especialmente los de objetivos competitivos, puerta trasera...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
El hallazgo central de TamperBench es contundente: ninguno de los 21 modelos de lenguaje de pesos abiertos evaluados contaba con protecciones de seguridad capaces de resistir de forma fiable todas las manipulaciones probadas. Los modelos, de entre aproximadamente 600 millones y 8.000 millones de parámetros, incluían versiones estándar y variantes reforzadas con defensas adicionales. En todos los casos, al menos un ataque logró aumentar la disposición del modelo a generar contenido dañino sin eliminar buena parte de sus capacidades generales. 256
La diferencia es importante porque los modelos de pesos abiertos pueden copiarse, ajustarse y redistribuirse después de su lanzamiento. Una capa de seguridad que funciona durante las pruebas originales del desarrollador no necesariamente sigue siendo un control duradero cuando los usuarios pueden modificar los pesos del modelo.
TamperBench fue diseñado para medir la resistencia a la manipulación, no solo la capacidad de un modelo para resistir un jailbreak convencional basado en instrucciones. El marco combina ataques de ajuste fino en el espacio de pesos con ataques que alteran las representaciones latentes. Después, mide tanto el comportamiento de seguridad como las capacidades que conserva el modelo. 2
Para cada combinación de modelo y ataque, los investigadores realizaron búsquedas sistemáticas de hiperparámetros, en lugar de depender de una única configuración. El estudio cubrió nueve regímenes de manipulación, entre ellos:
La pregunta no era simplemente si un modelo podía volverse inseguro. Los investigadores buscaron ataques que incrementaran las respuestas dañinas mientras mantuvieran la caída de precisión en razonamiento MMLU-Pro dentro del 10 % respecto al modelo sin atacar. 2
Los resultados más graves procedieron, por lo general, de los ataques de ajuste para eludir salvaguardas (jailbreak-tuning). Entre las variantes analizadas figuraban los enfoques de objetivos competitivos, puerta trasera y modulación de estilo. Fueron especialmente relevantes porque podían utilizar sobre todo datos benignos junto con una cantidad menor de datos dañinos. Así, no se comportaban como un simple intento de reentrenar el modelo para que fuera inseguro, sino como una modificación dirigida a alterar su comportamiento de seguridad y conservar al mismo tiempo su utilidad. 26
La conclusión general del estudio es que seguridad y capacidad pueden separarse de una forma desfavorable: la manipulación puede debilitar las negativas del modelo sin destruir proporcionalmente su rendimiento de razonamiento. Por eso un modelo puede seguir pareciendo útil en los benchmarks habituales y, aun así, resultar bastante más arriesgado de desplegar.
TamperBench evaluó 21 modelos de pesos abiertos de entre 0,6 y 8 mil millones de parámetros, incluidos modelos de familias como Llama, Qwen3 y Mistral. La evidencia disponible respalda la conclusión general del benchmark: todos los modelos probados fueron vulnerables al menos a uno de los ataques evaluados. 56
Sin embargo, las fuentes proporcionadas no incluyen los aumentos exactos de respuestas dañinas para Llama-3-8B-Instruct o Qwen3-8B-Instruct bajo la condición de una degradación de MMLU-Pro igual o inferior al 10 %. Por tanto, no es posible atribuir de forma fiable un porcentaje concreto a ninguno de esos dos modelos.
La conclusión defendible es cualitativa: los ataques podían aumentar sustancialmente el comportamiento dañino mientras conservaban buena parte de la capacidad de razonamiento, pero la evidencia disponible no establece una cifra precisa para Llama-3-8B-Instruct ni para Qwen3-8B-Instruct.
El estudio también observó que las versiones base y las versiones sometidas a posentrenamiento no seguían un patrón universal de resistencia. La resistencia relativa podía variar según la familia del modelo, con tendencias opuestas entre las variantes de Llama 3 y Qwen3. 6
No. Los cinco modelos reforzados con defensas adicionales —entre ellos variantes de ReFAT y Circuit Breaking— también fueron vulnerables al conjunto de ataques del benchmark. Las defensas mejoraron la resistencia en algunos escenarios, pero no impidieron de forma fiable la eliminación de las salvaguardas frente a todas las amenazas probadas. 25
TamperBench identifica Triplet como una de las defensas más resistentes y capaces de conservar mejor las prestaciones en las comparaciones realizadas. Es una señal prometedora para la investigación, no una garantía: el resultado principal del benchmark es que ninguna defensa probada eliminó el problema de la manipulación en toda la batería de ataques. 6
El estudio no demuestra que todos los modelos de pesos abiertos vayan a utilizarse de forma indebida. La publicación abierta también puede facilitar la investigación, la auditoría y la rendición de cuentas. La lección más concreta es otra: superar una evaluación convencional de alineamiento o seguridad antes del lanzamiento no debería considerarse una prueba de que el modelo seguirá siendo seguro después de que sus pesos puedan modificarse libremente. 5
Los modelos comerciales cerrados y los servicios de API afrontan preguntas relacionadas sobre el ajuste fino y la seguridad posterior al entrenamiento, pero sus proveedores conservan un mayor control sobre la cadena de entrenamiento y el entorno de despliegue. Ese control puede permitir aplicar salvaguardas durante el ajuste o después de una personalización, opciones mucho más difíciles de imponer cuando los pesos se han redistribuido públicamente. 25
El riesgo señalado por TamperBench no se limita a que una persona encuentre una instrucción capaz de provocar un fallo puntual en una negativa. Si la manipulación conserva las capacidades útiles del modelo, una versión modificada podría desplegarse repetidamente para tareas dañinas como campañas de desinformación a gran escala, phishing y estafas, o asistencia técnica peligrosa. Los investigadores presentan estos escenarios como implicaciones de retirar salvaguardas sin perder capacidades, no como usos indebidos medidos directamente por el benchmark. 5
Para las organizaciones que seleccionan modelos, la conclusión práctica es distinguir entre:
Los investigadores piden métodos más sólidos para evaluar la resistencia a la manipulación, pruebas adversariales estandarizadas como TamperBench antes del lanzamiento y procesos de evaluación y adquisición de sistemas de IA basados en más evidencia. Señalan especialmente los entornos de alto impacto —como la sanidad, la detección del fraude, la educación y los servicios públicos—, donde el comportamiento del modelo después de su lanzamiento puede ser tan relevante como su historial inicial de seguridad. 25
TamperBench no demuestra que todos los modelos de pesos abiertos vayan a utilizarse con fines dañinos. Sí muestra que, entre los 21 modelos analizados, las protecciones de seguridad no ofrecían una garantía fiable cuando un atacante podía manipular el modelo.
El ajuste encubierto para eludir salvaguardas fue generalmente la categoría de ataque más potente; las defensas adicionales ayudaron en ciertos casos, pero no cerraron la brecha. Además, las fuentes disponibles no respaldan porcentajes precisos de aumento de respuestas dañinas para modelos individuales como Llama-3-8B-Instruct o Qwen3-8B-Instruct.
Para los lanzamientos de pesos abiertos, la evaluación de seguridad debe medir no solo lo que un modelo puede hacer en el momento de publicarse, sino también cuánto de su comportamiento seguro sobrevive a la modificación.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Los 21 modelos de pesos abiertos fueron vulnerables a al menos una de las nueve amenazas de manipulación evaluadas, a menudo manteniendo el rendimiento de razonamiento dentro de una caída del 10 % en MMLU Pro.
Los 21 modelos de pesos abiertos fueron vulnerables a al menos una de las nueve amenazas de manipulación evaluadas, a menudo manteniendo el rendimiento de razonamiento dentro de una caída del 10 % en MMLU Pro. Los ataques de ajuste para eludir salvaguardas —especialmente los de objetivos competitivos, puerta trasera y modulación de estilo— fueron generalmente los más eficaces.
Las variantes con defensas adicionales, como ReFAT y Circuit Breaking, ofrecieron mayor resistencia en algunos escenarios, pero no garantizaron que las protecciones de seguridad sobrevivieran a todos los ataques.