'도난된 생각' 재생 공격 — 2026년 8월 10~11일 발표된 논문 'Stealing Reasoning Traces from Proprietary LLM APIs'(arXiv:2608.09867)에서 연구진 Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping, Andriushchenko는 치명적인 아키텍처 결함을 발견했습니다. 앤트로픽, 오픈AI, 구글이 API 클라이언트에 반환하는 암호화된 '생각' 블록이 출처에 제대로 연결되어 있지 않았습니다. 이 블록을 한 대화에서 들어내어 동일 제공업체의 덜 보호되는 형제 모델에 재생하면, 최첨단 모델의 숨겨진 추론을 일반 텍스트로 출력하게 됩니다 . 이 공격은 세션, 사용자 계정, 동일 제공업체 내 모델 간에 모두 작동합니다 . 연구진은 이 기술이 테스트한 모든 주요 최첨단 AI 기업에서 작동함을 확인했으며, 복구된 추론의 길이는 API가 보고한 숨겨진 생각 토큰 수와 거의 1:1로 일치합니다 .
추출된 추론 과정은 모델 증류(model distillation)—강력한 모델의 출력을 사용하여 더 작고 저렴한 경쟁 모델을 훈련하는 방법—를 위한 고품질 훈련 신호를 제공합니다 . 이 기술은 중국 AI 연구소를 둘러싼 격렬한 논란의 중심에 있습니다:
그러나 증거는 결정적이지 않습니다. Braden Hancock(Laude Institute)과 Nathan Lambert(Allen Institute for AI)를 포함한 연구진은 증류만으로 Kimi K3의 전체 능력을 설명할 수 없다고 주장합니다. 체인 오브 락트 증류의 증거를 주장하는 널리 유포된 PDF는 제한된 실험과 뒷받침되지 않는 주장을 결합한 것이라고 비판받았습니다 .
이 결함은 지적 재산 도난 외에도 여러 구체적인 위험을 초래합니다:
세 기업 모두 '도난된 생각' 연구진으로부터 사전에 연락을 받았습니다. 보도에 따르면, 오픈AI, 앤트로픽, 구글은 통보를 받은 후 크로스모델 추론 공격을 차단했습니다. 구체적인 완화 조치는 공개된 출처에 완전히 공개되지 않았지만, 취약점은 패치 전에 세 제공업체의 API 모두에 존재하는 것으로 확인되었습니다 . 공격이 '차단'되었다는 것은 기업이 서버 측 수정(아마도 암호화된 추론 블록을 다른 모델 컨텍스트나 계정에서 재사용하는 것을 제한)을 구현했음을 시사합니다 .
앤트로픽은 이미 대규모 증류와 공개적으로 싸우고 있었으며, 중국 연구소가 Claude 출력을 추출하기 위해 사용한 24,000개의 사기 계정과 1,600만 회의 교환을 보고했습니다 .
REP 및 Stolen Thoughts 논문의 핵심 교훈은 추론 과정을 숨기거나 암호화하는 것은 근본적으로 취약한 보안 전략이라는 것입니다. 추론이 모델 가중치에 존재한다면, 그것을 이끌어낼 수 있습니다 .