Todos os 21 modelos de pesos abertos testados foram vulneráveis a pelo menos uma das nove ameaças de adulteração, muitas vezes sem perder mais de 10% do desempenho de raciocínio no MMLU Pro. Ataques de ajuste fino para jailbreak — especialmente as variantes de objetivos concorrentes, backdoor e modulação de estilo —...
Publicado porEditado com GPT-5.6 LunaImagens geradas com GPT Image 1.5
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
O resultado central do TamperBench é direto: nenhum dos 21 modelos de linguagem de pesos abertos avaliados tinha proteções de segurança capazes de resistir de forma confiável às ameaças de adulteração testadas. Os modelos tinham entre cerca de 600 milhões e 8 bilhões de parâmetros e incluíam versões padrão e variantes com defesas adicionais. Em todos os casos, pelo menos um ataque conseguiu tornar o modelo mais propenso a produzir conteúdo nocivo, preservando boa parte de sua capacidade geral. 2
5
6
A descoberta é relevante porque modelos de pesos abertos podem ser copiados, ajustados e redistribuídos depois do lançamento. Uma camada de segurança que funciona durante a avaliação original do desenvolvedor não é necessariamente um controle durável quando os usuários podem modificar os pesos do modelo.
O TamperBench foi criado para medir a resistência à adulteração, e não apenas a resistência a jailbreaks feitos por meio de prompts. A estrutura combina ataques de ajuste fino no espaço dos pesos com ataques que manipulam representações latentes. Em seguida, avalia tanto o comportamento de segurança quanto a capacidade preservada do modelo. Para cada combinação entre modelo e ataque, o benchmark realizou buscas sistemáticas de hiperparâmetros, em vez de depender de uma única configuração. 2
O estudo analisou nove regimes de adulteração, incluindo:
O objetivo não era apenas verificar se um modelo poderia ser tornado inseguro. Os pesquisadores procuraram ataques que aumentassem as respostas nocivas enquanto mantivessem a queda na precisão de raciocínio do MMLU-Pro em, no máximo, 10% em relação ao desempenho do modelo sem ataque. 2
Os resultados mais graves geralmente vieram de ataques de ajuste fino para jailbreak. Entre as variantes analisadas estavam métodos baseados em objetivos concorrentes, backdoors e modulação de estilo. Esses ataques chamaram atenção porque podiam usar principalmente dados benignos, com uma parcela menor de dados nocivos. Assim, funcionavam menos como uma tentativa direta de treinar o modelo para gerar conteúdo inseguro e mais como uma alteração direcionada do comportamento de segurança, preservando sua utilidade. 2
6
A conclusão mais ampla do artigo é preocupante: segurança e capacidade podem ser separadas de maneira desfavorável. A adulteração pode enfraquecer o comportamento de recusa sem destruir proporcionalmente o desempenho de raciocínio. Por isso, um modelo pode continuar parecendo útil em benchmarks convencionais e, ao mesmo tempo, tornar-se significativamente mais arriscado para implantação.
O TamperBench avaliou 21 modelos de pesos abertos na faixa de 0,6 bilhão a 8 bilhões de parâmetros, incluindo famílias como Llama, Qwen3 e Mistral. As evidências fornecidas sustentam a conclusão geral do benchmark: todos os modelos testados eram vulneráveis a pelo menos um dos ataques avaliados. 5
6
No entanto, o material disponível não apresenta os aumentos exatos, modelo a modelo, na produção de conteúdo nocivo para o Llama-3-8B-Instruct ou o Qwen3-8B-Instruct sob a condição de degradação de até 10% no MMLU-Pro. Esses valores não devem ser deduzidos do resultado geral. A conclusão segura é qualitativa: os ataques conseguiram aumentar substancialmente o comportamento nocivo e preservar boa parte da capacidade de raciocínio, mas as evidências fornecidas não estabelecem um percentual preciso para nenhum dos dois modelos citados.
O estudo também indicou que versões base e versões submetidas a pós-treinamento não seguem um padrão único de resistência à adulteração. A resistência relativa pode variar entre as famílias, com tendências opostas relatadas para variantes do Llama 3 e do Qwen3. 6
Não. Os cinco modelos com defesas adicionais testados — incluindo variantes ReFAT e Circuit Breaking — também foram vulneráveis ao conjunto de ataques do benchmark. As defesas aumentaram a resistência em alguns cenários, mas não impediram de forma confiável a remoção da segurança diante de todas as ameaças avaliadas. 2
5
Nas comparações realizadas, o método Triplet apareceu como uma das defesas mais robustas e capazes de preservar o desempenho. Isso é um sinal promissor para a pesquisa, não uma garantia de segurança: o resultado principal do benchmark é que nenhuma defesa testada eliminou o problema da adulteração em todo o conjunto de ataques. 6
A pesquisa não mostra que modelos de pesos abertos sejam inúteis. A abertura pode favorecer a pesquisa, a auditoria e a prestação de contas. A lição mais específica é outra: passar por uma avaliação convencional de alinhamento ou segurança antes do lançamento não deve ser tratado como prova de que o modelo continuará seguro depois que seus pesos puderem ser modificados livremente. 5
Modelos comerciais fechados e serviços acessados por API também enfrentam questões relacionadas a ajuste fino e segurança após personalizações. A diferença é que seus provedores mantêm maior controle sobre o processo de treinamento e o ambiente de implantação. Esse controle permite aplicar salvaguardas durante o ajuste fino ou depois da personalização — medidas muito mais difíceis de impor quando os pesos são redistribuídos publicamente. 2
5
O risco destacado pelo TamperBench não se limita a alguém encontrar um prompt isolado que faça o modelo deixar de recusar uma solicitação. Se a adulteração preservar capacidades úteis, um modelo modificado poderia ser implantado repetidamente em atividades nocivas, como desinformação em larga escala, phishing, golpes ou assistência técnica perigosa. Os pesquisadores apresentam esses cenários como implicações da remoção de salvaguardas com preservação de capacidade — não como medições de uso indevido realizadas pelo próprio benchmark. 5
Para organizações que escolhem modelos, a consequência prática é separar dois tipos de avaliação:
Os pesquisadores defendem métodos mais fortes de resistência à adulteração, avaliações adversariais padronizadas — como o TamperBench — antes do lançamento e processos de avaliação e contratação de sistemas de IA mais baseados em evidências. Eles destacam especialmente áreas de alto impacto, como saúde, detecção de fraudes, educação e serviços públicos, nas quais o comportamento do modelo depois do lançamento pode ser tão importante quanto seu histórico inicial de segurança. 2
5
O TamperBench não mostra que todo modelo de pesos abertos será usado de forma indevida. O estudo mostra que, entre os 21 modelos testados, as proteções de segurança não eram garantias confiáveis quando um atacante podia adulterar o modelo. O ajuste fino para jailbreak foi geralmente a categoria de ataque mais forte; as defesas adicionais ajudaram em alguns casos, mas não eliminaram a vulnerabilidade; e as evidências fornecidas não permitem calcular percentuais precisos de aumento de conteúdo nocivo para modelos Llama ou Qwen3 específicos.
Para lançamentos de pesos abertos, a avaliação de segurança precisa testar não apenas o que o modelo consegue fazer no momento da publicação, mas também quanto de seu comportamento seguro permanece depois de uma modificação.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Todos os 21 modelos de pesos abertos testados foram vulneráveis a pelo menos uma das nove ameaças de adulteração, muitas vezes sem perder mais de 10% do desempenho de raciocínio no MMLU Pro.
Todos os 21 modelos de pesos abertos testados foram vulneráveis a pelo menos uma das nove ameaças de adulteração, muitas vezes sem perder mais de 10% do desempenho de raciocínio no MMLU Pro. Ataques de ajuste fino para jailbreak — especialmente as variantes de objetivos concorrentes, backdoor e modulação de estilo — foram geralmente os mais eficazes.
Modelos com defesas adicionais, incluindo variantes ReFAT e Circuit Breaking, apresentaram maior resistência em alguns cenários, mas não ofereceram uma proteção confiável contra a remoção das salvaguardas.
Todos os 21 modelos de pesos abertos testados foram vulneráveis a pelo menos uma das nove ameaças de adulteração, muitas vezes sem perder mais de 10% do desempenho de raciocínio no MMLU Pro. Ataques de ajuste fino para jailbreak — especialmente as variantes de objetivos concorrentes, backdoor e modulação de estilo —...
Publicado porEditado com GPT-5.6 LunaImagens geradas com GPT Image 1.5
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
O resultado central do TamperBench é direto: nenhum dos 21 modelos de linguagem de pesos abertos avaliados tinha proteções de segurança capazes de resistir de forma confiável às ameaças de adulteração testadas. Os modelos tinham entre cerca de 600 milhões e 8 bilhões de parâmetros e incluíam versões padrão e variantes com defesas adicionais. Em todos os casos, pelo menos um ataque conseguiu tornar o modelo mais propenso a produzir conteúdo nocivo, preservando boa parte de sua capacidade geral. 2
5
6
A descoberta é relevante porque modelos de pesos abertos podem ser copiados, ajustados e redistribuídos depois do lançamento. Uma camada de segurança que funciona durante a avaliação original do desenvolvedor não é necessariamente um controle durável quando os usuários podem modificar os pesos do modelo.
O TamperBench foi criado para medir a resistência à adulteração, e não apenas a resistência a jailbreaks feitos por meio de prompts. A estrutura combina ataques de ajuste fino no espaço dos pesos com ataques que manipulam representações latentes. Em seguida, avalia tanto o comportamento de segurança quanto a capacidade preservada do modelo. Para cada combinação entre modelo e ataque, o benchmark realizou buscas sistemáticas de hiperparâmetros, em vez de depender de uma única configuração. 2
O estudo analisou nove regimes de adulteração, incluindo:
O objetivo não era apenas verificar se um modelo poderia ser tornado inseguro. Os pesquisadores procuraram ataques que aumentassem as respostas nocivas enquanto mantivessem a queda na precisão de raciocínio do MMLU-Pro em, no máximo, 10% em relação ao desempenho do modelo sem ataque. 2
Os resultados mais graves geralmente vieram de ataques de ajuste fino para jailbreak. Entre as variantes analisadas estavam métodos baseados em objetivos concorrentes, backdoors e modulação de estilo. Esses ataques chamaram atenção porque podiam usar principalmente dados benignos, com uma parcela menor de dados nocivos. Assim, funcionavam menos como uma tentativa direta de treinar o modelo para gerar conteúdo inseguro e mais como uma alteração direcionada do comportamento de segurança, preservando sua utilidade. 2
6
A conclusão mais ampla do artigo é preocupante: segurança e capacidade podem ser separadas de maneira desfavorável. A adulteração pode enfraquecer o comportamento de recusa sem destruir proporcionalmente o desempenho de raciocínio. Por isso, um modelo pode continuar parecendo útil em benchmarks convencionais e, ao mesmo tempo, tornar-se significativamente mais arriscado para implantação.
O TamperBench avaliou 21 modelos de pesos abertos na faixa de 0,6 bilhão a 8 bilhões de parâmetros, incluindo famílias como Llama, Qwen3 e Mistral. As evidências fornecidas sustentam a conclusão geral do benchmark: todos os modelos testados eram vulneráveis a pelo menos um dos ataques avaliados. 5
6
No entanto, o material disponível não apresenta os aumentos exatos, modelo a modelo, na produção de conteúdo nocivo para o Llama-3-8B-Instruct ou o Qwen3-8B-Instruct sob a condição de degradação de até 10% no MMLU-Pro. Esses valores não devem ser deduzidos do resultado geral. A conclusão segura é qualitativa: os ataques conseguiram aumentar substancialmente o comportamento nocivo e preservar boa parte da capacidade de raciocínio, mas as evidências fornecidas não estabelecem um percentual preciso para nenhum dos dois modelos citados.
O estudo também indicou que versões base e versões submetidas a pós-treinamento não seguem um padrão único de resistência à adulteração. A resistência relativa pode variar entre as famílias, com tendências opostas relatadas para variantes do Llama 3 e do Qwen3. 6
Não. Os cinco modelos com defesas adicionais testados — incluindo variantes ReFAT e Circuit Breaking — também foram vulneráveis ao conjunto de ataques do benchmark. As defesas aumentaram a resistência em alguns cenários, mas não impediram de forma confiável a remoção da segurança diante de todas as ameaças avaliadas. 2
5
Nas comparações realizadas, o método Triplet apareceu como uma das defesas mais robustas e capazes de preservar o desempenho. Isso é um sinal promissor para a pesquisa, não uma garantia de segurança: o resultado principal do benchmark é que nenhuma defesa testada eliminou o problema da adulteração em todo o conjunto de ataques. 6
A pesquisa não mostra que modelos de pesos abertos sejam inúteis. A abertura pode favorecer a pesquisa, a auditoria e a prestação de contas. A lição mais específica é outra: passar por uma avaliação convencional de alinhamento ou segurança antes do lançamento não deve ser tratado como prova de que o modelo continuará seguro depois que seus pesos puderem ser modificados livremente. 5
Modelos comerciais fechados e serviços acessados por API também enfrentam questões relacionadas a ajuste fino e segurança após personalizações. A diferença é que seus provedores mantêm maior controle sobre o processo de treinamento e o ambiente de implantação. Esse controle permite aplicar salvaguardas durante o ajuste fino ou depois da personalização — medidas muito mais difíceis de impor quando os pesos são redistribuídos publicamente. 2
5
O risco destacado pelo TamperBench não se limita a alguém encontrar um prompt isolado que faça o modelo deixar de recusar uma solicitação. Se a adulteração preservar capacidades úteis, um modelo modificado poderia ser implantado repetidamente em atividades nocivas, como desinformação em larga escala, phishing, golpes ou assistência técnica perigosa. Os pesquisadores apresentam esses cenários como implicações da remoção de salvaguardas com preservação de capacidade — não como medições de uso indevido realizadas pelo próprio benchmark. 5
Para organizações que escolhem modelos, a consequência prática é separar dois tipos de avaliação:
Os pesquisadores defendem métodos mais fortes de resistência à adulteração, avaliações adversariais padronizadas — como o TamperBench — antes do lançamento e processos de avaliação e contratação de sistemas de IA mais baseados em evidências. Eles destacam especialmente áreas de alto impacto, como saúde, detecção de fraudes, educação e serviços públicos, nas quais o comportamento do modelo depois do lançamento pode ser tão importante quanto seu histórico inicial de segurança. 2
5
O TamperBench não mostra que todo modelo de pesos abertos será usado de forma indevida. O estudo mostra que, entre os 21 modelos testados, as proteções de segurança não eram garantias confiáveis quando um atacante podia adulterar o modelo. O ajuste fino para jailbreak foi geralmente a categoria de ataque mais forte; as defesas adicionais ajudaram em alguns casos, mas não eliminaram a vulnerabilidade; e as evidências fornecidas não permitem calcular percentuais precisos de aumento de conteúdo nocivo para modelos Llama ou Qwen3 específicos.
Para lançamentos de pesos abertos, a avaliação de segurança precisa testar não apenas o que o modelo consegue fazer no momento da publicação, mas também quanto de seu comportamento seguro permanece depois de uma modificação.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Todos os 21 modelos de pesos abertos testados foram vulneráveis a pelo menos uma das nove ameaças de adulteração, muitas vezes sem perder mais de 10% do desempenho de raciocínio no MMLU Pro.
Todos os 21 modelos de pesos abertos testados foram vulneráveis a pelo menos uma das nove ameaças de adulteração, muitas vezes sem perder mais de 10% do desempenho de raciocínio no MMLU Pro. Ataques de ajuste fino para jailbreak — especialmente as variantes de objetivos concorrentes, backdoor e modulação de estilo — foram geralmente os mais eficazes.
Modelos com defesas adicionais, incluindo variantes ReFAT e Circuit Breaking, apresentaram maior resistência em alguns cenários, mas não ofereceram uma proteção confiável contra a remoção das salvaguardas.