앤트로픽은 2026년 8월 2일 이후 출시된 지원 클로드 모델에 전 세계적으로 기계 판독 가능한 표시를 적용했지만, 4시간 만에 제거 우회 코드가 공개됐다. 개발자 기욤 메이어의 오픈소스 프로젝트에는 이후 100명 넘는 기여자가 참여했고, X에서 관련 게시물이 2만 회 넘게 북마크됐다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What happened after Anthropic began globally embedding a statistical, machine-readable watermark in all Claude-generated text on August 2 to. Article summary: Anthropic’s rollout was rapidly met by public circumvention tools, illustrating a core limitation of text watermarking: a statistical signal embedded in word choices can be weakened or erased by sufficiently extensive re. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wate
앤트로픽이 클로드 생성물에 기계 판독 가능한 표시를 도입하면서, AI 텍스트 워터마크가 실제 편집 환경에서도 버틸 수 있는지가 시험대에 올랐다. 회사가 전면 적용을 확인한 지 불과 4시간 만에 개발자 기욤 메이어가 오픈소스 우회 도구를 공개했다. 이 사건은 통계형 텍스트 워터마크가 일상적인 탐지에는 활용될 수 있지만, 충분히 광범위하게 다시 쓰인 텍스트에는 취약하다는 점을 보여준다.
앤트로픽에 따르면 2026년 8월 2일 이후 출시된 지원 클로드 모델은 출시 시점부터 생성 콘텐츠에 표시를 넣는다. 이 표시 기능은 지원 모델이 제공되는 전 세계 서비스에 적용된다. 생성 텍스트에는 사람이 알아볼 수 없는 워터마크가 들어가고, 지원되는 파일에는 디지털 서명 방식의 출처 메타데이터가 포함될 수 있다.
앤트로픽은 유럽연합(EU) 인공지능법의 투명성 의무를 이행하기 위해 이 조치를 도입했다고 밝혔다. EU AI Act는 기술적으로 가능한 범위에서 AI 시스템이 생성하거나 조작한 결과물을 기계가 읽고 탐지할 수 있도록 하는 기술적 해법을 요구한다.
전 세계 적용이 알려진 직후 텍스트 신호를 무력화하려는 시도도 공개됐다. 《와이어드》는 메이어가 4시간 안에 워터마크 제거용 오버라이드를 배포했다고 보도했다. 이후 이 프로젝트에는 100명이 넘는 기여자가 참여했고, X에서 프로젝트 홍보 게시물은 2만 회 넘게 북마크됐다. 다만 현재 공개된 보도만으로는 깃허브 별표 수, 다운로드 수, 실제 사용자 수를 신뢰성 있게 확정하기 어렵다.
클로드의 텍스트 워터마크는 보이지 않는 문자를 넣어두고 나중에 삭제하는 방식이 아니다. 앤트로픽은 이를 모델이 단어 또는 토큰을 선택하는 과정에 나타나는 통계적 패턴이라고 설명한다. 관련 탐지 방법을 가진 검증기는 해당 문장의 단어 배열이 클로드의 생성 과정과 통계적으로 일치하는지 평가한다.
메이어가 공개한 방식은 워터마크가 없는 대규모언어모델(LLM)을 활용해 여러 차례 문장을 다시 쓰는 접근법이다. 동의어를 바꾸고 문장 구성을 재배열하면서 의미는 유지하려고 한다. 이렇게 단어 선택 패턴 자체를 바꾸면 원래 텍스트에 분포하던 통계적 신호가 약해질 수 있다.
보도에 등장한 다른 브라우저 기반 도구들은 생성물의 다른 요소를 겨냥한다. 일부는 보이지 않는 유니코드 문자나 사람 눈에 비슷하게 보이는 문자를 제거하고, 문장 순서를 바꾸거나 동의어를 치환한다. 텍스트를 압축하거나 다른 언어로 번역한 뒤 다시 번역하는 방법도 통계적 패턴을 흐트러뜨릴 수 있는 방식으로 소개됐다. 다만 이런 방법을 클로드의 핵심 텍스트 워터마크를 직접 삭제하는 것과 혼동해서는 안 된다. 앤트로픽은 해당 워터마크가 숨은 문자나 텍스트에 추가된 메타데이터가 아니라고 밝히고 있다.
앤트로픽은 클로드의 워터마크가 구글 딥마인드의 ‘신스ID-텍스트(SynthID-Text)’ 접근법을 기반으로 한 변형이라고 설명한다. 모델은 앞서 나온 단어와 관련된 비밀 키 기반 무작위성을 활용해, 의미와 품질에 큰 영향을 주지 않는 다음 단어 선택 과정에 통계적 흔적을 남긴다. 검증기는 그 결과가 클로드의 선택 과정과 통계적으로 일치하는지 추정한다.
이 표시는 독자에게 보이지 않고, 문자를 추가하지 않으며, 추가 토큰도 사용하지 않는다. 앤트로픽은 워터마크가 의미·품질·창의성·가독성·비용에 실질적인 영향을 주지 않도록 설계됐다고 밝혔다. 또한 워터마크에는 개인 식별 정보가 없으며 특정 개인, 조직, 대화로 추적할 수도 없다고 설명했다.
따라서 워터마크는 개인 지문이 아니라 ‘관여 가능성’을 나타내는 신호에 가깝다. 앤트로픽이 말하는 탐지 결과는 클로드가 해당 문장 작성에 관여했을 확률이다. 누가 글을 썼는지, 사람이 전혀 쓰지 않았는지, 다른 AI 모델이 생성했는지까지 증명하지는 못한다. 짧은 문장이나 짧은 문단에서는 신뢰성 있는 판별도 어렵다.
이 차이는 클로드를 교정, 가벼운 편집, 요약, 번역에 사용하는 경우 특히 중요하다. 앤트로픽은 가볍게 편집된 텍스트에는 클로드가 선택한 일부 단어에만 표시가 남을 수 있고, 신호가 너무 약해 안정적인 탐지가 어려울 수 있다고 밝혔다.
메이어의 비판은 콘텐츠 출처를 밝히는 것 자체에 대한 반대가 아니다. 그는 콘텐츠 귀속과, 사람에게 불리한 증거로 취급될 수 있는 보이지 않는 워터마크를 구분한다. 확률적 신호만으로는 상당한 AI 작성과 단순 교정·편집 같은 제한적인 도움을 구별하기 어려울 수 있다는 것이 그의 우려다.
이는 더 큰 출처 추적 문제로 이어진다. 탐지기는 문장이 클로드의 관여와 통계적으로 일치한다고 판단할 수 있지만, 최종 문장 중 얼마만큼을 클로드가 작성했는지, 사람이 어느 정도 바꿨는지, 핵심 아이디어를 누가 처음 제시했는지는 알려주지 않는다. 텍스트가 크게 다시 쓰이거나 번역·축약·재구성되면 ‘AI 생성’과 ‘AI의 도움을 받은 인간 작성’ 사이의 경계는 더욱 흐려진다.
현재 제공된 근거는 워터마크가 클로드 출력물의 소유권이나 사용자의 실질적인 권리를 바꾼다는 점을 보여주지 않는다. 앤트로픽은 이 시스템을 소유권 주장 수단이 아니라 클로드 관여 가능성을 추정하는 기술로 제시한다.
통계형 워터마크는 수많은 단어 선택에 걸쳐 분산된 패턴에 의존한다. 원문이 대부분 그대로 유지되면 복사·붙여넣기 과정에서도 신호가 따라갈 수 있고, 일부 편집 뒤에도 남을 수 있다. 그러나 광범위한 바꿔쓰기, 번역, 재작성으로 단어가 충분히 달라지면 신호를 탐지하기 어려워진다.
《네이처》가 인용한 연구자들도 다른 언어모델을 이용한 재작성까지 포함해, 동기가 강한 사람이 AI 생성 텍스트를 다시 쓰는 것을 텍스트 워터마크가 안정적으로 막을 수 있을지 회의적인 입장을 보였다. 콘텐츠의 의미는 대체로 유지하면서 신호만 제거할 수 있다는 우려다.
그렇다고 워터마크가 쓸모없다는 뜻은 아니다. 텍스트가 충분히 길고 생성 당시 형태에 가깝게 유지됐다면, 일상적인 점검에서 기계가 읽을 수 있는 단서가 될 수 있다. 다만 사람이 상당 부분을 수정한 텍스트의 변하지 않은 출처나 저자를 입증하는 수단으로는 훨씬 약하다.
관련 EU 규정은 주로 AI 시스템 제공자에게 의무를 부과한다. 제공자는 기술적으로 가능한 범위에서 AI가 생성하거나 조작한 결과물을 기계 판독 가능한 형식으로 표시하고 탐지할 수 있는 기술적 해법을 적용해야 한다. 법 조문은 워터마크를 포함한 여러 기술을 가능한 접근법으로 제시할 뿐, 어떤 한 가지 방식이 모든 상황에서 작동한다고 보장하지는 않는다.
현재 제공된 자료만으로는 EU 법이 독립적인 제3자가 워터마크를 제거하는 도구를 만들거나 사용하는 행위를 일반적으로 금지한다고 볼 근거가 없다. 또한 앤트로픽이 처음부터 이 기능을 EU 사용자에게만 지리적으로 제한할 수 없었던 이유를 설명하는 기술적 근거도 확인되지 않는다. 회사의 발표된 방식은 지원 모델이 제공되는 곳이라면 전 세계에 표시를 적용하는 것이다.
결국 워터마크는 현실적인 절충안에 가깝다. 원문에 가까운 텍스트의 투명성을 높이고 후속 탐지를 쉽게 만들 수 있지만, 의도적인 재작성 이후에도 출처를 보장하지는 못한다. 긍정적인 탐지 결과만으로 저자, 의도, 책임 문제를 결론 내릴 수도 없다.
클로드의 워터마크 도입은 AI 텍스트 표시 기술의 가치와 취약성을 동시에 드러냈다. 워터마크는 클로드가 문장 작성에 관여했을 가능성을 보여주는 확률적 신호일 수 있지만, 숨은 메타데이터나 개인 식별자, 최종 텍스트의 저자임을 입증하는 결정적 증거는 아니다.
앤트로픽 발표 후 메이어의 프로젝트가 4시간 만에 등장한 일은 EU의 기계 판독 가능 표시 의무를 ‘완벽한 출처 보증’이 아니라 투명성을 높이기 위한 장치로 이해해야 하는 이유를 보여준다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
앤트로픽은 2026년 8월 2일 이후 출시된 지원 클로드 모델에 전 세계적으로 기계 판독 가능한 표시를 적용했지만, 4시간 만에 제거 우회 코드가 공개됐다.
앤트로픽은 2026년 8월 2일 이후 출시된 지원 클로드 모델에 전 세계적으로 기계 판독 가능한 표시를 적용했지만, 4시간 만에 제거 우회 코드가 공개됐다. 개발자 기욤 메이어의 오픈소스 프로젝트에는 이후 100명 넘는 기여자가 참여했고, X에서 관련 게시물이 2만 회 넘게 북마크됐다. 다만 정확한 사용자 수와 깃허브 별표 수는 확인되지 않았다.
클로드의 텍스트 워터마크는 숨은 문자나 개인 식별 메타데이터가 아니라 단어·토큰 선택에 남는 통계적 패턴이다. 앤트로픽도 이를 저자임을 입증하는 증거가 아니라 클로드 관여 가능성으로 설명한다.