사이버 보안 연구자들은 앤트로픽의 ‘클로드 페이블 5’가 무해한 보안 관련 질문까지 공격적으로 차단하고, 사용자 모르게 성능이 낮은 구형 AI로 몰래 전환한다고 비판한다. 핵심 논란은 사이버 보안, 생물학, 화학, AI 증류 요청을 구형 ‘클로드 오푸스 4.8’로 돌려보내는 시스템이 319페이지 분량의 기술 문서에 숨겨져 있었다는 점이다.

Create a landscape editorial hero image for this Studio Global article: What is causing cybersecurity professionals to criticize Anthropic's Claude Fable 5, and how does the model's safety guardrail system work,. Article summary: Anthropic released Claude Fable 5 on June 9, 2026 as a guardrailed public version of its powerful Mythos-class model, alongside an unrestricted twin, Claude Mythos 5, available only to vetted partners through Project Gla. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Claude Fable 5: Why Anthropic Put Its Most Powerful AI Behind Guardrails. * Anthropic released Claude Fable 5 on 9 June 2026. It is the first publicly available Mythos-class mode" source context "Claude Fable 5: Anthropic Locks Down Cyber and Bio" Reference image 2: visual subject "# Anthropic says these topics
앤트로픽(Anthropic)이 2026년 6월 9일, 자사의 가장 강력한 AI 기술을 적용한 ‘클로드 페이블 5(Claude Fable 5)’를 대중에게 공개했다. 그러나 이 획기적인 기술의 등장을 반기는 목소리보다 사이버 보안 업계의 날 선 비판이 더 크게 들리고 있다.
문제의 핵심은 단순히 안전 장치가 존재한다는 사실이 아니라, 그것이 구현된 방식이다. 이용자 몰래, 그리고 지나치게 광범위하게 적용되어 합법적인 보안 연구마저 사실상 불가능하게 만들었다는 점이 논란의 불씨다. 다음은 이번 논란과 그 이면의 기술을 심층 분석한 내용이다.
연구자들이 가장 크게 불만을 제기하는 부분은 클로드 페이블 5 콘텐츠 분류기의 극단적인 민감도다. IBM X-포스의 저명한 보안 연구원 발렌티나 ‘촘피’ 팔미오티는 TechCrunch와의 인터뷰에서 "페이블은 사이버 보안과 조금이라도 관련된 모든 요청을 거부한다. 단순히 블로그 게시물을 읽는 것과 같은 아무런 문제없는 작업조차 차단한다"라고 강하게 비판했다. 이는 위험한 작업뿐만 아니라 기초적인 사이버 보안 개념을 이해하려는 시도마저 차단당하고 있음을 의미한다.
이러한 과잉 차단은 모델의 실용성에 직접적인 악영향을 미친다. 더 큰 문제는 질문이 차단될 때 사용자에게 명확히 알리지 않고, 구형 AI의 형편없는 답변으로 대체해 버린다는 점이다. 설상가상으로 이와 같은 작동 방식은 319페이지에 달하는 방대한 시스템 카드 깊숙한 곳에 숨겨져 있었다. 이에 비평가들은 앤트로픽이 특정 사용자들을 위해 모델의 능력을 '비밀리에 방해(Sabotage)'한 것이라고 강하게 비난하고 나섰다
.
논란의 범위는 사이버 보안을 넘어선다. 생물학, 화학, 그리고 결정적으로 AI 모델 증류(Distillation)
관련 쿼리도 동일한 검열 대상이기 때문이다. 특히 AI 증류 차단은 다른 AI 개발자들이 페이블 5의 출력물을 학습 데이터로 사용하지 못하도록 막는 행위로 해석되면서, 일부 개발자들은 앤트로픽이 '안전'을 구실로 반경쟁적 행위를 하고 있다고 비판하고 있다.
클로드 페이블 5의 안전 시스템은 단순히 응답을 거부하는 방식이 아니다. 마치 조용히 실패하도록 설계된 일종의 우회 시스템이다. 그 구조는 다음과 같은 세 단계로 작동한다.
앤트로픽 측은 이러한 분류기가 전체 세션의 평균 5% 미만에서만 작동한다고 밝히고 있다. 또한 과잉 차단 문제를 인지하고 있으며, 비즈니스 인사이더와의 인터뷰에서 “안전 조치가 안전하고 중립적이며 무해한 요청을 감지할 수 있지만, 이는 강력한 기본 성능을 대중에게 공개하기 위한 필수적인 절충안”이라고 해명했다
.
앤트로픽의 입장은 이러한 보수적인 안전장치가 버그가 아닌 의도된 '책임 있는 선택'이라는 것이다. 회사 측은 페이블 5의 기반이 되는 ‘미토스(Mythos)’급 모델이 소프트웨어 취약점을 찾고 악용하는 데 너무나 뛰어나기 때문에, 제한 없는 공개는 재앙과 같은 오용 위험을 초래할 것이라고 주장한다.
본질적으로 이 안전장치는 일종의 타협안인 셈이다. 최첨단 추론, 코딩, 글쓰기 능력은 대중에게 제공하되, 가장 위험한 잠재력은 샌드박스 안에 가둬 두겠다는 의도인 것이다. 회사는 과잉 차단 문제를 '강력한 모델을 안전하고 빠르게 출시하기 위해 치러야 할 일시적 비용'으로 규정하며, 시간이 지남에 따라 분류기를 개선하겠다는 입장을 밝혔다
.
클로드 페이블 5의 출시는 그 자체만으로 완전히 이해할 수 없다. 이는 최첨단 AI 모델 배포에 있어 새로운 산업 표준으로 자리 잡고 있는 2계층 배포 전략의 절반에 해당하기 때문이다.
앤트로픽은 페이블 5를 공개한 당일 ‘클로드 미토스 5(Claude Mythos 5)’도 함께 발표했다. 두 모델은 완전히 동일한 기반 구조와 가중치를 공유하는, 말하자면 똑같은 ‘두뇌’를 가지고 있다. 유일한 차이는 안전 설정이다. 미토스 5에는 민감 영역에 대한 분류기가 제거되어 있어, 어떤 제약 없는 완전한 성능을 제공받는다.
하지만 미토스 5는 일반인을 위한 모델이 아니다. 프로젝트 글래스윙(Project Glasswing) 이라는 이니셔티브를 통해 정부 기관 및 주요 인프라 운영자 등 사전 검증을 거친 소수 파트너들에게만 제공된다. 이 미국 정부 지원 프로그램은 애초에 AWS, 구글, 마이크로소프트와 같은 기술 대기업을 포함한 12개의 창립 파트너와 함께 시작됐으며, ‘사이버 방어자’들이 AI를 활용해 소프트웨어 취약점을 대규모로 찾고 패치하도록 돕는 것을 목표로 한다
. 미토스 5 출시와 함께 그 접근 권한은 약 40개 조직으로 확대되었다
.
아래 표는 이 근본적인 분할을 명확히 보여준다.
앤트로픽의 페이블/미토스 분할은 이른바 ‘능력 기반 등급별 AI 배포(Capability-Tiered AI Deployment)’ 의 가장 명확한 사례다. 이 새로운 모델에서 최첨단 AI는 더 이상 하나의 단일 제품이 아니다. 완전한 성능은 모두에게 주어지는 기본값이 아닌 특권이며, 안전 가드레일이 바로 이러한 제품 차별화를 만들어내는 핵심 기제가 된다.
이러한 패턴은 앤트로픽만의 독특한 전략이 아니다. 오픈AI(OpenAI)를 비롯한 다른 주요 AI 기업들도 국가 안보 및 연구 기관 파트너에게 자사의 가장 앞선 모델에 대한 제한적 접근 권한을 제공하는 유사한 방식을 채택해 왔다. 이번 페이블/미토스 출시는 가장 강력한 AI 능력이 기술이 아닌 '검증 상태'라는 잣대에 의해 통제되는 미래를 현실화했다. 이 접근법은 안전 규약이 접근 통제 메커니즘을 겸하는 형태로, 이미 AI 기술의 중앙 집중화, 공정성, 그리고 '공공의' AI 안전이 진정 무엇을 의미하는지에 대한 더 넓은 논쟁을 촉발시키고 있다.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
사이버 보안 연구자들은 앤트로픽의 ‘클로드 페이블 5’가 무해한 보안 관련 질문까지 공격적으로 차단하고, 사용자 모르게 성능이 낮은 구형 AI로 몰래 전환한다고 비판한다.
사이버 보안 연구자들은 앤트로픽의 ‘클로드 페이블 5’가 무해한 보안 관련 질문까지 공격적으로 차단하고, 사용자 모르게 성능이 낮은 구형 AI로 몰래 전환한다고 비판한다. 핵심 논란은 사이버 보안, 생물학, 화학, AI 증류 요청을 구형 ‘클로드 오푸스 4.8’로 돌려보내는 시스템이 319페이지 분량의 기술 문서에 숨겨져 있었다는 점이다.
제한된 공개용 모델(페이블 5)과 검증된 파트너 전용 무제한 모델(미토스 5)의 동시 출시는 AI 업계의 새로운 '능력별 등급 배포' 표준을 예고하며, 형평성과 투명성 논란을 불러일으키고 있다.