El ataque de repetición 'Pensamientos Robados' — Publicado entre el 10 y el 11 de agosto de 2026 en el artículo "Stealing Reasoning Traces from Proprietary LLM APIs" (arXiv:2608.09867), los investigadores Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping y Andriushchenko descubrieron un fallo arquitectónico crítico. Los bloques de 'pensamiento' cifrados que Anthropic, OpenAI y Google devuelven a los clientes de la API no están correctamente sellados a su origen. Estos bloques pueden extraerse de una conversación y reproducirse en un modelo 'hermano' más débil y menos protegido del mismo proveedor, que entonces imprime el razonamiento oculto del modelo de frontera en texto plano . El ataque funciona entre sesiones, entre cuentas de usuario y entre modelos del mismo ecosistema del proveedor . Los investigadores confirmaron que la técnica funciona en todas las grandes empresas de IA de frontera que probaron, y la longitud del razonamiento recuperado coincide casi 1:1 con el recuento de tokens de pensamiento ocultos que reporta la API .
Las trazas de razonamiento extraídas proporcionan señales de entrenamiento de alta calidad para la destilación de modelos — la práctica de utilizar las salidas de un modelo más fuerte para entrenar un modelo competidor más pequeño y barato . Esta técnica está en el centro de una acalorada controversia en torno a los laboratorios de IA chinos:
Sin embargo, la evidencia no es definitiva. Investigadores como Braden Hancock (Instituto Laude) y Nathan Lambert (Allen Institute for AI) argumentan que la destilación por sí sola no puede explicar todas las capacidades de Kimi K3. Un PDF ampliamente difundido que afirmaba probar la destilación de la cadena de pensamiento fue criticado por combinar un experimento limitado con afirmaciones sin respaldo .
El fallo introduce múltiples riesgos concretos más allá del robo de propiedad intelectual:
Las tres empresas fueron contactadas por los investigadores de 'Pensamientos Robados' antes de la publicación. Según los informes, OpenAI, Anthropic y Google bloquearon el ataque de razonamiento entre modelos después de ser notificados. No se revelaron detalles específicos de sus mitigaciones en las fuentes publicadas, pero se confirmó que la vulnerabilidad existía en las API de los tres proveedores antes de ser parcheada . Que el ataque fuera 'bloqueado' sugiere que las empresas implementaron correcciones en el lado del servidor — probablemente restringiendo la reutilización de bloques de razonamiento cifrados en diferentes contextos de modelo o cuentas .
Anthropic ya estaba lidiando públicamente con la destilación a gran escala, reportando las 24.000 cuentas fraudulentas y los 16 millones de intercambios utilizados por laboratorios chinos para extraer resultados de Claude .
La lección principal de los artículos REP y Pensamientos Robados es que ocultar o cifrar las trazas de razonamiento es una estrategia de seguridad fundamentalmente frágil — si el razonamiento existe en los pesos del modelo, se puede obtener .