연구진, AI모델의 암호화된 추론 과정을 추출하는 '추론 노출 프롬프팅(REP)'과 '스털튼 락츠(Stolen Thoughts)' 재생 공격 발견 두 공격은 앤트로픽·오픈AI·구글 등 최첨단 AI 제공업체의 보안 체계를 무력화 추출된 추론 데이터는 중국 AI 'Kimi K3'가 미국 모델을 증류했다는 논란에 강력한 증거로 작용

Create a landscape editorial hero image for this Studio Global article: How did researchers discover a method to extract hidden reasoning traces from leading AI models, what did it reveal about potential distilla. Article summary: ## How researchers discovered the extraction method. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
2026년, 독립적인 두 연구팀이 최첨단 AI 모델의 숨겨진 추론 과정 보안을 무력화하는 방법을 발표했습니다. 첫 번째는 '추론 노출 프롬프팅(Reasoning Exposure Prompting, REP)'이라는 프롬프팅 기법으로, 모델이 의도적으로 숨긴 사고 과정(chain-of-thought)을 사용자에게 다시 표시하도록 유도합니다. 두 번째는 '도난된 생각(Stolen Thoughts)'이라는 재생 공격으로, 오픈AI, 앤트로픽, 구글이 API를 통해 반환하는 암호화된 추론 블록의 구조적 결함을 악용합니다. 이 두 취약점은 중국 AI 시스템(예: Moonshot의 Kimi K3)이 미국 독점 모델의 증류(distillation)를 통해 구축되었다는 논란에 새로운 법의학적 증거를 제공했습니다.
추론 노출 프롬프팅 (REP) — 2026년 5월 30일 발표된 논문 'Hidden Thoughts Are Not Secret: Reasoning Trace Exposure in LLMs'(arXiv:2606.00642)에서 연구진 Lu, Tsai, Tsai, Popa, Yu는 제공자가 의도적으로 추론 과정을 숨겨도, 가벼운 인컨텍스트 프롬프팅 기법으로 숨겨진 추론을 다시 사용자 출력으로 끌어낼 수 있음을 보여주었습니다. 이 방법은 '섀도우 모델 프롬프팅'으로 불리며, 제한이 없는 더 작은 모델의 데모를 보조 코드 형식으로 감싸 피해 모델의 내부 추적 정보를 추출합니다. 복구된 추적 정보는 더 작은 모델을 증류할 수 있을 만큼 상세합니다 .
'도난된 생각' 재생 공격 — 2026년 8월 10~11일 발표된 논문 'Stealing Reasoning Traces from Proprietary LLM APIs'(arXiv:2608.09867)에서 연구진 Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping, Andriushchenko는 치명적인 아키텍처 결함을 발견했습니다. 앤트로픽, 오픈AI, 구글이 API 클라이언트에 반환하는 암호화된 '생각' 블록이 출처에 제대로 연결되어 있지 않았습니다. 이 블록을 한 대화에서 들어내어 동일 제공업체의 덜 보호되는 형제 모델에 재생하면, 최첨단 모델의 숨겨진 추론을 일반 텍스트로 출력하게 됩니다 . 이 공격은 세션, 사용자 계정, 동일 제공업체 내 모델 간에 모두 작동합니다
. 연구진은 이 기술이 테스트한 모든 주요 최첨단 AI 기업에서 작동함을 확인했으며, 복구된 추론의 길이는 API가 보고한 숨겨진 생각 토큰 수와 거의 1:1로 일치합니다
.
추출된 추론 과정은 모델 증류(model distillation)—강력한 모델의 출력을 사용하여 더 작고 저렴한 경쟁 모델을 훈련하는 방법—를 위한 고품질 훈련 신호를 제공합니다 . 이 기술은 중국 AI 연구소를 둘러싼 격렬한 논란의 중심에 있습니다:
그러나 증거는 결정적이지 않습니다. Braden Hancock(Laude Institute)과 Nathan Lambert(Allen Institute for AI)를 포함한 연구진은 증류만으로 Kimi K3의 전체 능력을 설명할 수 없다고 주장합니다. 체인 오브 락트 증류의 증거를 주장하는 널리 유포된 PDF는 제한된 실험과 뒷받침되지 않는 주장을 결합한 것이라고 비판받았습니다 .
이 결함은 지적 재산 도난 외에도 여러 구체적인 위험을 초래합니다:
세 기업 모두 '도난된 생각' 연구진으로부터 사전에 연락을 받았습니다. 보도에 따르면, 오픈AI, 앤트로픽, 구글은 통보를 받은 후 크로스모델 추론 공격을 차단했습니다. 구체적인 완화 조치는 공개된 출처에 완전히 공개되지 않았지만, 취약점은 패치 전에 세 제공업체의 API 모두에 존재하는 것으로 확인되었습니다 . 공격이 '차단'되었다는 것은 기업이 서버 측 수정(아마도 암호화된 추론 블록을 다른 모델 컨텍스트나 계정에서 재사용하는 것을 제한)을 구현했음을 시사합니다
.
앤트로픽은 이미 대규모 증류와 공개적으로 싸우고 있었으며, 중국 연구소가 Claude 출력을 추출하기 위해 사용한 24,000개의 사기 계정과 1,600만 회의 교환을 보고했습니다 .
REP 및 Stolen Thoughts 논문의 핵심 교훈은 추론 과정을 숨기거나 암호화하는 것은 근본적으로 취약한 보안 전략이라는 것입니다. 추론이 모델 가중치에 존재한다면, 그것을 이끌어낼 수 있습니다 .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
연구진, AI모델의 암호화된 추론 과정을 추출하는 '추론 노출 프롬프팅(REP)'과 '스털튼 락츠(Stolen Thoughts)' 재생 공격 발견
연구진, AI모델의 암호화된 추론 과정을 추출하는 '추론 노출 프롬프팅(REP)'과 '스털튼 락츠(Stolen Thoughts)' 재생 공격 발견 두 공격은 앤트로픽·오픈AI·구글 등 최첨단 AI 제공업체의 보안 체계를 무력화
추출된 추론 데이터는 중국 AI 'Kimi K3'가 미국 모델을 증류했다는 논란에 강력한 증거로 작용