튀빙겐 대학, 막스 플랑크 연구소, MATS Research, Snyk 연구진이 클로드·GPT·제미나이의 암호화된 추론 블록을 해독할 수 있는 '리플레이 공격'을 개발했다. 공격은 단 두 번의 API 호출만으로 가능하며, 강력한 모델의 암호화된 추론 블록을 보안이 약한 동일 제공사의 형제 모델에 주입해 평문으로 출력하게 한다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What technique did researchers from the University of Tübingen, the Max Planck Institute, MATS Research, and Snyk develop to extract hidden. Article summary: ## The Technique: "Replay Attack" on Encrypted Reasoning Traces. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
AI가 복잡한 문제를 풀 때 내부적으로 거치는 단계별 '사고 과정', 즉 추론 과정(reasoning traces)은 그동안 암호화된 블록 형태로 사용자에게 반환됐다. 서버 부하를 줄이기 위해 이 블록을 클라이언트에 저장했다가 다음 요청 시 다시 보내는 방식이었다. 이 블록은 아무도 읽을 수 없다고 믿어졌다.
하지만 2026년 8월, 튀빙겐 대학(University of Tübingen), 막스 플랑크 지능형 시스템 연구소(Max Planck Institute for Intelligent Systems), MATS Research, ELLIS 연구소 튀빙겐, 보안 기업 Snyk의 연구진은 이 암호화된 추론 블록이 사실상 '소금 없이 문이 열린 금고'나 다름없음을 증명했다 .
핵심은 간단하다. 오픈AI, 앤트로픽, 구글은 모든 세션과 사용자에게 단 하나의 글로벌 암호화 키를 사용했다 . 따라서 한 세션에서 캡처한 암호화 블록은 다른 세션, 다른 사용자, 심지어 다른 모델에서도 재사용할 수 있었다.
연구진은 강력한 프런티어 모델(예: Claude Opus 4.8)의 추론 블록을 캡처해, 보안 장치가 약한 동일 제공사의 형제 모델(예: Claude Haiku)에 주입했다. 그러자 보안이 약한 모델이 별다른 '탈옥(jailbreaking)' 없이도 그 블록을 해독해 평문으로 출력했다 . 이 공격은 단 두 번의 API 호출로 완료되며, 대규모로도 작동한다
.
이 기술이 단순한 보안 취약점 발견에 그치지 않은 이유는, 이를 통해 미·중 AI 패권 경쟁의 핵심 쟁점인 '모델 증류(model distillation)'에 대한 강력한 정황 증거가 드러났기 때문이다.
연구진은 Claude Opus 4.8과 GPT-5.6 Sol의 추론 과정을 추출한 후, 중국 Moonshot AI의 오픈 웨이트 모델 Kimi K3의 출력과 비교했다. 그 결과, Kimi K3의 출력에서 '비정상적 확률 현상(abnormal probability phenomena)'이 발견되었고, 이는 Claude와 GPT의 추론 패턴과 매우 유사했다 . 더욱이, Kimi K3는 자신의 정체를 묻는 질문에 처음에는 'Anthropic의 Claude'라고 답한 사례도 보고됐다
.
연구진과 독립적인 전문가들은 이 증거가 '결정적이지는 않지만, 중국 모델이 미국 모델의 추론 정보를 증류(distilling)하여 학습되었을 수 있다는 일부 증거를 제공한다'고 평가했다 .
그러나 증류 주장에는 치명적인 '시간표' 문제가 있다. Kimi K3가 출시된 2026년 7월 16일 직전에야 Claude Opus 4.8이 출시되었다 . 2조 8천억 개의 파라미터를 가진 거대 모델을 불과 며칠 만에 증류하여 학습시키는 것은 기술적으로 '실현 불가능하다(implausible)'는 것이 독립 연구자들의 중론이다 . Moonshot AI는 K3가 자체 연구를 통해 개발되었다고 주장하며, 오히려 K3가 여전히 GPT-5.6 Sol과 Claude Fable 5에 전반적으로 뒤처진다는 점을 솔직하게 인정하기도 했다
.
이 취약점은 단순한 이론적 위협이 아니었다. 연구진은 2026년 8월 이전에 공개된 약 7,000개의 에이전트 세션 로그(agent session logs)를 스캔한 결과, 암호화된 추론 블록 내부에 숨겨진 62개의 유효한 API 키, 33개의 비밀번호 등 총 704개의 개인정보를 발견했다 . 개발자들이 깃허브(GitHub) 같은 공개 저장소에 로그를 업로드할 때, 아무도 읽을 수 없다고 생각한 추론 블록 안에 중요 정보가 고스란히 노출되었던 것이다 .
연구진은 오픈AI, 앤트로픽, 구글, 마이크로소프트, 허깅페이스에 이 취약점을 책임 공개(responsible disclosure)했다 . 이후 세 기업 모두 서버 측 패치를 배포했으며, 현재 API에서는 해당 추출 기술이 더 이상 작동하지 않는다
. 그러나 이미 공개된 역사적 세션 로그는 여전히 접근 가능한 상태로 남아 있다 .
주목할 점은, 암호학자 매튜 그린(Matthew Green)이 2026년 5월에 이미 이와 동일한 취약점을 오픈AI와 앤트로픽의 버그 바운티 프로그램을 통해 신고했으나, 논문이 발표되기 전까지 모두 퇴짜를 맞았다는 사실이다 .
이번 '도난당한 생각(stolen thoughts)' 공격은 현대 AI API 설계의 근본적인 긴장 관계를 드러낸다. 확장성과 지연 시간 감소를 위해 추론 상태를 클라이언트에 오프로드하는 방식은 편리했지만, 이를 안전하게 묶어내는 암호화 설계는 허술했다. 단일 글로벌 암호화 키의 사용은 모든 사용자와 개발자의 보안과 프라이버시를 위협하는 지름길이었다.
동시에 이 연구는 미·중 간 AI 증류 갈등에 새로운 국면을 열었다. Kimi K3에 대한 증거는 결정적이지는 않지만, 증류가 실제로 대규모로 이루어지고 있을 수 있다는 가장 강력한 기술적 증거를 제시하며, 정책 입안자와 연구자들에게 AI 모델의 출처를 조사할 수 있는 새로운 도구를 제공했다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
튀빙겐 대학, 막스 플랑크 연구소, MATS Research, Snyk 연구진이 클로드·GPT·제미나이의 암호화된 추론 블록을 해독할 수 있는 '리플레이 공격'을 개발했다.
튀빙겐 대학, 막스 플랑크 연구소, MATS Research, Snyk 연구진이 클로드·GPT·제미나이의 암호화된 추론 블록을 해독할 수 있는 '리플레이 공격'을 개발했다. 공격은 단 두 번의 API 호출만으로 가능하며, 강력한 모델의 암호화된 추론 블록을 보안이 약한 동일 제공사의 형제 모델에 주입해 평문으로 출력하게 한다.
연구진은 이 방법으로 Kimi K3의 출력에서 클로드 오퍼스 4.8 및 GPT 5.6 솔의 추론 패턴과 일치하는 '비정상적 확률 현상'을 발견, 증류(distillation) 의혹을 뒷받침하는 정황 증거를 제시했다.