O Ataque de Replay 'Stolen Thoughts' — Publicado entre 10 e 11 de agosto de 2026 no artigo "Stealing Reasoning Traces from Proprietary LLM APIs" (arXiv:2608.09867), os pesquisadores Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping e Andriushchenko descobriram uma falha arquitetônica crítica. Os blocos de 'pensamento' criptografados que Anthropic, OpenAI e Google retornam aos clientes de suas APIs não estão devidamente vinculados à sua fonte. Esses blocos podem ser retirados de uma conversa e reproduzidos em um modelo irmão mais fraco e menos protegido do mesmo provedor, que então imprime o raciocínio oculto do modelo de ponta em texto puro . O ataque funciona entre sessões, entre contas de usuário e entre modelos dentro do ecossistema do mesmo provedor . Os pesquisadores confirmaram que a técnica funciona em todas as principais empresas de IA de fronteira que testaram, e o comprimento do raciocínio recuperado corresponde quase 1:1 à contagem de tokens de 'pensamento' oculto relatada pela API .
Os traços de raciocínio extraídos fornecem sinais de treinamento de alta qualidade para destilação de modelos — a prática de usar as saídas de um modelo mais forte para treinar um modelo concorrente menor e mais barato . Esta técnica está no centro de uma controvérsia acalorada em torno dos laboratórios de IA chineses:
No entanto, as evidências não são definitivas. Pesquisadores como Braden Hancock (Laude Institute) e Nathan Lambert (Allen Institute for AI) argumentam que a destilação sozinha não pode explicar todas as capacidades do Kimi K3. Um PDF viral que alegava provar a destilação da cadeia de pensamento foi criticado por combinar um experimento limitado com alegações infundadas .
A falha introduz vários riscos concretos, além do roubo de propriedade intelectual:
As três empresas foram contatadas pelos pesquisadores do 'Stolen Thoughts' antes da publicação. De acordo com reportagens, OpenAI, Anthropic e Google bloquearam o ataque de raciocínio entre modelos após serem notificados. Detalhes específicos de suas mitigações não foram totalmente divulgados nas fontes publicadas, mas a vulnerabilidade foi confirmada como existente nas APIs de todos os três provedores antes da correção . O fato de o ataque ter sido 'bloqueado' sugere que as empresas implementaram correções no lado do servidor — provavelmente restringindo a reutilização de blocos de raciocínio criptografados em diferentes contextos de modelo ou contas .
A Anthropic já vinha lutando publicamente contra a destilação em escala, relatando as 24 mil contas fraudulentas e 16 milhões de interações usadas por laboratórios chineses para extrair saídas do Claude .
A lição central dos artigos REP e 'Stolen Thoughts' é que esconder ou criptografar traços de raciocínio é uma estratégia de segurança fundamentalmente frágil — se o raciocínio existe nos pesos do modelo, ele pode ser extraído .