Nenhum dos 21 modelos avaliados manteve proteções robustas contra todas as ameaças de adulteração testadas. Os ataques de ajuste fino para jailbreak, especialmente variantes de objetivos concorrentes, backdoor e modulação de estilo, foram geralmente os mais severos.
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
O estudo TamperBench, apresentado no ACM KDD ’26, concluiu que nenhuma das 21 versões de modelos de linguagem de pesos abertos avaliadas tinha proteções de segurança fortes o bastante para resistir a todas as ameaças de adulteração testadas. Em cada modelo, os pesquisadores conseguiram aumentar de forma significativa a produção de respostas nocivas sem eliminar boa parte da capacidade de raciocínio. 25
O resultado inclui modelos de diferentes famílias, como Llama, Qwen3 e Mistral, com tamanhos entre 600 milhões e 8 bilhões de parâmetros. A conclusão central é que as salvaguardas atuais não devem ser tratadas como uma garantia de segurança quando os pesos do modelo podem ser modificados pelo usuário ou por terceiros.
O benchmark reuniu nove métodos de adulteração no espaço dos pesos e nas representações latentes — isto é, alterações feitas no próprio modelo ou em estruturas internas que influenciam seu comportamento. O conjunto incluiu: 2
Os ataques de jailbreak por ajuste fino foram, em geral, os mais graves. Entre eles, destacaram-se as variantes de objetivos concorrentes, backdoor e modulação de estilo. Esses métodos foram treinados majoritariamente com dados benignos, mas incluíram uma pequena parcela de dados nocivos, o que ajudou a reduzir a aparência de uma alteração claramente maliciosa. 2
Para comparar os ataques de maneira mais realista, o estudo procurou maximizar as pontuações de respostas nocivas, limitando ao mesmo tempo a queda de desempenho no MMLU-Pro, um benchmark de raciocínio e compreensão, a no máximo 10% em relação ao modelo não adulterado. 2
As cinco versões com mecanismos de defesa adicionais — incluindo variantes com ReFAT e Circuit Breaking — também se mostraram vulneráveis. Algumas defesas aumentaram a resistência em determinados cenários, mas nenhuma impediu de forma confiável a remoção das salvaguardas em todo o conjunto de ataques. 25
Os dados fornecidos não apresentam os aumentos exatos de nocividade para cada modelo individual. Por isso, não é possível afirmar com segurança valores numéricos específicos para o Llama-3-8B-Instruct ou o Qwen3-8B-Instruct.
Em modelos de pesos abertos, os arquivos necessários para executar o sistema podem ser copiados, ajustados e redistribuídos. Depois da publicação, o desenvolvedor original não consegue necessariamente controlar o ajuste fino nem aplicar as mesmas barreiras de segurança no uso posterior. 2
Os pesquisadores ressaltam que o estudo não é um argumento contra a abertura dos modelos. O acesso público pode favorecer a pesquisa, a auditoria e a responsabilização. O alerta é outro: um modelo não deve ser considerado seguro apenas porque passou por testes comuns de alinhamento antes do lançamento. 5
A remoção das salvaguardas sem perda proporcional de capacidade pode ampliar riscos como desinformação em escala, golpes e phishing sofisticados ou instruções técnicas perigosas. O problema, nesse caso, não ficaria limitado ao esforço manual de uma única pessoa. 5
A equipe defende mais pesquisas sobre resistência a adulterações, avaliações adversariais padronizadas — como o próprio TamperBench — antes da liberação de modelos e processos de análise e contratação de IA baseados em mais evidências. A recomendação ganha peso à medida que governos usam sistemas de IA em áreas como saúde, detecção de fraudes, educação e outros serviços públicos. 25
Também há uma ressalva para modelos comerciais fechados acessados por API: eles podem enfrentar riscos relacionados, mas seus provedores controlam o ajuste fino e a implantação. Isso permite aplicar defesas durante o treinamento ou depois dele que deixam de estar disponíveis quando os pesos são distribuídos livremente. 25
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Nenhum dos 21 modelos avaliados manteve proteções robustas contra todas as ameaças de adulteração testadas.
Nenhum dos 21 modelos avaliados manteve proteções robustas contra todas as ameaças de adulteração testadas. Os ataques de ajuste fino para jailbreak, especialmente variantes de objetivos concorrentes, backdoor e modulação de estilo, foram geralmente os mais severos.
Em todos os casos, foi possível aumentar substancialmente a disposição dos modelos para produzir respostas nocivas preservando boa parte de sua capacidade de raciocínio.