TamperBench는 21개 오픈 웨이트 모델 모두가 9가지 변조 위협 중 최소 하나에 취약하며, MMLU Pro 추론 성능 저하를 10% 이내로 유지하면서 유해 응답을 늘릴 수 있음을 확인했다. 은밀한 jailbreak tuning, 특히 competing objectives·backdoor·style modulation 방식이 대체로 가장 강력한 공격 범주로 나타났다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
TamperBench의 결론은 분명하다. 연구진이 평가한 오픈 웨이트 언어 모델 21종 가운데, 테스트한 변조 위협을 모두 견뎌낸 모델은 없었다. 모델 규모는 약 6억 개에서 80억 개 파라미터까지였고, 일반 모델과 방어 기술을 추가한 변형 모델이 함께 포함됐다. 각 모델은 최소 한 가지 공격을 통해 일반적인 기능을 상당 부분 유지하면서도 유해한 콘텐츠를 더 쉽게 생성하도록 만들 수 있었다. 256
이 결과가 중요한 이유는 오픈 웨이트 모델의 가중치가 공개된 뒤 복사·파인튜닝·재배포될 수 있기 때문이다. 개발사가 사전 평가에서 확인한 안전장치가 사용자가 가중치를 수정한 뒤에도 같은 방식으로 작동한다는 보장은 없다.
TamperBench는 일반적인 프롬프트 탈옥(jailbreak) 대응력이 아니라 변조 저항성(tamper resistance) 을 측정하기 위한 평가 프레임워크다. 가중치 공간에서 이뤄지는 파인튜닝 공격과 모델의 잠재 표현을 조작하는 공격을 묶어 시험하고, 안전성뿐 아니라 변조 이후에도 모델의 기능이 얼마나 남는지 함께 측정했다. 모델과 공격 조합마다 단 하나의 설정에 의존하지 않고 체계적인 하이퍼파라미터 탐색도 수행했다. 2
연구에는 다음과 같은 9개 변조 범주가 포함됐다.
핵심은 단순히 모델을 유해하게 만드는 데 있지 않았다. 연구진은 공격 이후 유해 응답 점수가 높아지면서도, 공격을 받지 않은 모델과 비교한 MMLU-Pro 추론 정확도 하락폭이 10% 이내인 경우를 집중적으로 살폈다. MMLU-Pro는 여러 분야의 복잡한 문제를 통해 언어 모델의 지식과 추론 능력을 평가하는 벤치마크다. 2
가장 심각한 결과는 대체로 jailbreak-tuning 계열에서 나왔다. 연구에서 보고된 변형에는 competing-objectives, backdoor, style-modulation 방식이 포함된다. 이 공격들은 대부분 무해한 학습 데이터를 사용하고 일부 유해 데이터를 섞을 수 있다는 점에서 주목된다. 모델을 전면적으로 위험한 행동에 맞게 재훈련하는 대신, 유용한 기능은 유지하면서 안전 응답만 겨냥해 바꾸려는 방식에 가깝다. 26
연구의 더 넓은 시사점은 안전성과 능력이 반드시 함께 무너지는 것은 아니라는 점이다. 변조 공격은 모델의 거부 행동을 약화시키면서도 추론 성능은 상대적으로 보존할 수 있다. 따라서 기존 벤치마크에서는 여전히 쓸 만해 보이는 모델이 실제 배포 환경에서는 훨씬 위험해질 수 있다.
TamperBench는 6억~80억 개 파라미터 규모의 오픈 웨이트 모델 21종을 평가했으며, Llama·Qwen3·Mistral 계열 등이 포함됐다. 제공된 연구 근거가 뒷받침하는 전체 결론은 테스트한 모든 모델이 적어도 한 가지 공격에 취약했다는 것이다. 56
다만 제공된 자료에는 MMLU-Pro 성능 저하를 10% 이내로 제한했을 때 Llama-3-8B-Instruct와 Qwen3-8B-Instruct에서 유해성이 정확히 몇 퍼센트포인트 상승했는지에 대한 모델별 수치가 제시돼 있지 않다. 따라서 전체 결과만으로 두 모델의 구체적인 증가율을 추정해서는 안 된다.
확실하게 말할 수 있는 결론은 비교적 정성적인 수준이다. 공격은 모델의 추론 능력을 상당 부분 보존하면서 유해 행동을 크게 늘릴 수 있었지만, 제공된 근거만으로는 Llama-3-8B-Instruct나 Qwen3-8B-Instruct의 정확한 증가율을 확정할 수 없다.
또한 기본 모델과 사후 학습(post-training) 모델의 변조 저항성이 모든 계열에서 같은 방식으로 나타나지는 않았다. Llama 3와 Qwen3 변형에서는 서로 반대되는 경향도 보고돼, 사후 학습이 모델의 변조 저항성을 일관되게 높인다고 단정하기 어려웠다. 6
아니다. ReFAT와 Circuit Breaking 변형을 포함한 방어 강화 모델 5종도 공격 모음에 취약했다. 방어 기술이 일부 조건에서는 저항성을 높였지만, 평가된 모든 위협에서 안전장치 제거를 안정적으로 막지는 못했다. 25
비교 평가에서 Triplet은 상대적으로 견고하면서도 모델의 기능을 잘 보존한 방어 방식 중 하나로 나타났다. 하지만 이는 유망한 연구 결과이지 완전한 해결책을 뜻하지 않는다. 전체 공격 모음에서 변조 문제를 제거한 방어 기술은 이번에 확인되지 않았다. 6
이번 결과가 오픈 웨이트 모델이 본질적으로 가치 없다는 뜻은 아니다. 공개 모델은 연구, 감사, 책임성 검증을 지원할 수 있다. 더 좁고 중요한 결론은, 모델이 출시 전 정렬 또는 안전성 평가를 통과했다는 사실만으로 가중치가 공개된 뒤에도 안전하다고 간주해서는 안 된다는 것이다. 5
상용 폐쇄형 모델이나 API 모델도 파인튜닝과 사후 학습 과정에서 관련 위험에 노출될 수 있다. 다만 제공업체가 학습 파이프라인과 배포 환경을 통제한다면 파인튜닝 단계나 커스터마이징 이후에 방어책을 적용할 여지가 더 크다. 가중치가 공개적으로 재배포된 뒤에는 이런 통제를 강제하기가 훨씬 어렵다. 25
TamperBench가 지적한 위험은 한 사람이 특정 프롬프트 하나로 모델의 거부 응답을 무너뜨리는 상황에만 국한되지 않는다. 안전장치를 제거한 뒤에도 유용한 기능이 남는다면, 변조된 모델을 반복적으로 배포해 대규모 허위정보, 피싱·사기, 위험한 기술 지원 등에 활용할 가능성이 생긴다. 다만 이는 벤치마크가 실제 악용을 수행해 측정했다는 뜻이 아니라, 능력을 보존한 안전장치 제거가 가져올 수 있는 함의에 대한 연구진의 설명이다. 5
모델을 선택하는 조직은 다음 두 평가를 구분할 필요가 있다.
연구진은 더 강력한 변조 저항성 기술, 출시 전 TamperBench와 같은 표준화된 적대적 평가, 근거에 기반한 AI 평가 및 조달 기준을 요구한다. 특히 의료, 사기 탐지, 교육, 공공 서비스처럼 배포 이후의 모델 행동이 초기 안전성 기록만큼 중요한 분야를 주요 적용 대상으로 제시했다. 25
TamperBench는 모든 오픈 웨이트 모델이 반드시 악용된다는 것을 보여준 연구가 아니다. 대신 테스트한 21개 모델 모두에서, 공격자가 가중치를 수정할 수 있을 때 기존 안전장치가 확실한 보증으로 기능하지 못한다는 점을 보여준다.
이번 평가에서는 은밀한 jailbreak-tuning이 대체로 가장 강력한 공격 범주였고, 추가 방어 기술은 일부 상황에서 도움을 줬지만 문제를 완전히 해결하지 못했다. 또한 제공된 자료는 개별 Llama 또는 Qwen3 모델의 유해성 증가율을 정확한 퍼센트로 제시할 근거를 제공하지 않는다.
따라서 오픈 웨이트 모델의 안전성 평가는 출시 시점의 행동만 확인하는 데서 끝나서는 안 된다. 가중치가 수정된 뒤에도 안전한 행동이 얼마나 남아 있는지를 함께 시험해야 한다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
TamperBench는 21개 오픈 웨이트 모델 모두가 9가지 변조 위협 중 최소 하나에 취약하며, MMLU Pro 추론 성능 저하를 10% 이내로 유지하면서 유해 응답을 늘릴 수 있음을 확인했다.
TamperBench는 21개 오픈 웨이트 모델 모두가 9가지 변조 위협 중 최소 하나에 취약하며, MMLU Pro 추론 성능 저하를 10% 이내로 유지하면서 유해 응답을 늘릴 수 있음을 확인했다. 은밀한 jailbreak tuning, 특히 competing objectives·backdoor·style modulation 방식이 대체로 가장 강력한 공격 범주로 나타났다.
ReFAT와 Circuit Breaking 변형을 포함한 방어 강화 모델 5종도 일부 환경에서는 저항성이 높아졌지만, 모든 공격을 안정적으로 차단하지는 못했다.