Un equipo de la Universidad de Tubinga, el Instituto Max Planck, MATS Research y Snyk descubrió un ataque que extrae el razonamiento oculto de la cadena de pensamiento de modelos como Claude, GPT y Gemini. La vulnerabilidad residía en que los bloques de razonamiento encriptados compartían una misma clave global, per...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What technique did researchers from the University of Tübingen, the Max Planck Institute, MATS Research, and Snyk develop to extract hidden. Article summary: ## The Technique: "Replay Attack" on Encrypted Reasoning Traces. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
En agosto de 2026, un equipo de investigadores de la Universidad de Tubinga, el Instituto Max Planck para Sistemas Inteligentes, MATS Research, el Instituto ELLIS de Tubinga y la firma de seguridad Snyk publicó un artículo describiendo un ataque sorprendentemente simple contra las trazas de razonamiento encriptadas de los modelos de IA más avanzados. El ataque funcionó en los tres principales proveedores (Anthropic, OpenAI y Google) y no requirió vulnerar ('jailbreak') a ningún modelo. En cambio, explotó una decisión arquitectónica fundamental: estas compañías devuelven 'bloques de razonamiento' encriptados al cliente de la API en lugar de almacenarlos en sus servidores, y esos bloques son portátiles entre sesiones, usuarios e incluso diferentes modelos del mismo proveedor . Los investigadores simplemente tomaron un bloque de razonamiento encriptado de un modelo y lo reenviaron a un modelo 'hermano' más débil, el cual lo decodificó y mostró la traza en texto plano
. Esta técnica, denominada en el artículo como un 'jailbreak de descifrado', se detalla en el preprint Stealing Reasoning Traces from Proprietary LLM APIs
.
Cuando un usuario consulta a un modelo de primer nivel como Claude Opus 4.8 o GPT-5.6 Sol a través de una API, el modelo realiza un razonamiento interno paso a paso —su 'cadena de pensamiento'— y devuelve ese razonamiento al cliente como un bloque opaco de texto encriptado. El cliente reenvía este bloque en cada solicitud subsiguiente para que el modelo continúe su razonamiento sin que el proveedor almacene el estado intermedio en su servidor .
Los investigadores descubrieron que estos bloques encriptados no están vinculados a una sesión, usuario o modelo específico. De hecho, comparten una única clave de encriptación global para todas las sesiones y usuarios . Esto significa que un bloque capturado de una conversación puede reenviarse en otro contexto. La idea clave: alimentar un bloque de un modelo de primer nivel fuertemente protegido a un modelo hermano más débil o con menos alineamiento del mismo proveedor (por ejemplo, Claude Haiku). El modelo más débil, al tener menos barreras de seguridad, decodificará y mostrará el contenido del bloque textualmente
.
El ataque requiere solo dos llamadas a la API: una para capturar el bloque encriptado y otra para enviarlo al modelo más débil. Los investigadores demostraron que el ataque funciona a gran escala .
El ataque no solo expuso el razonamiento de los modelos, sino que también proporcionó nuevas pruebas en el debate sobre si la empresa china Moonshot AI entrenó su modelo Kimi K3 destilando (esencialmente copiando) el razonamiento de modelos estadounidenses.
Tras extraer las trazas de razonamiento de Claude Opus 4.8 y GPT-5.6 Sol, los investigadores las compararon con las salidas de modelos de peso abierto, incluido Kimi K3. Encontraron que las salidas de Kimi K3 presentaban lo que describieron como 'fenómenos de probabilidad anormal' que coincidían estrechamente con los patrones encontrados en las trazas de Claude y GPT .
La evidencia es circunstancial, no definitiva. Investigadores independientes afirman que los hallazgos 'proporcionan cierta evidencia, aunque no una prueba concluyente, de que ciertos modelos chinos pueden haber sido entrenados mediante la destilación de información de razonamiento de modelos estadounidenses' . Otro hecho sugerente: al preguntarle su identidad, Kimi K3 se identificó inicialmente como 'Claude' de Anthropic, avivando aún más las acusaciones
.
Kimi K3 es un modelo de peso abierto de 2,8 billones de parámetros lanzado por Moonshot AI el 16 de julio de 2026. Supera a Claude Opus 4.8 en varios puntos de referencia, aunque no es un líder indiscutible. En el Índice de Inteligencia Artificial Analysis independiente, K3 obtiene 57 puntos frente a los 60 de Claude Fable 5 y los 59 de GPT-5.6 Sol. La propia Moonshot ha sido inusualmente sincera al afirmar que K3 todavía está por detrás de GPT-5.6 Sol y Claude Fable 5 en general .
La acusación de destilación no es nueva. Tanto Anthropic como OpenAI han acusado previamente a empresas chinas de destilar sistemáticamente sus modelos. Además, una revisión de artículos y patentes académicos chinos reveló que investigadores militares chinos utilizaban resultados de modelos de OpenAI y Anthropic para entrenar sistemas de IA domésticos .
El lanzamiento de Kimi K3 provocó una controversia inmediata. A las pocas horas de su lanzamiento el 16 de julio, Anthropic acusó a Moonshot de construir K3 destilando a Claude, y la acusación llegó a la Casa Blanca, lo que planteó la posibilidad de sanciones .
Sin embargo, los críticos de esta acusación señalan un problema de plazos. Claude Opus 4.8 se lanzó poco antes del lanzamiento de Kimi K3. Investigadores independientes afirman que la cronología hace que la copia directa sea 'poco plausible', ya que simplemente no hubo tiempo suficiente para entrenar un modelo de 2,8 billones de parámetros a partir de un modelo recién lanzado . Moonshot argumenta que K3 se construyó a partir de una investigación independiente
.
La misma falla arquitectónica expuso una vulnerabilidad de seguridad práctica. Dado que los modelos a veces incorporan credenciales y datos personales en su proceso de razonamiento, los bloques de razonamiento encriptados que los desarrolladores compartían públicamente —por ejemplo, en registros de sesiones de agentes— contenían información sensible que cualquiera que conociera el truco podía leer.
Al escanear aproximadamente 7000 registros de sesiones de agentes publicados antes de agosto de 2026, los investigadores encontraron 62 claves API activas, 33 contraseñas y otros datos de usuario sensibles —704 artefactos de privacidad en total— ocultos dentro de los bloques de razonamiento encriptados . Cualquier desarrollador que hubiera publicado registros de agente sin procesar pudo haber expuesto sin saberlo claves API, contraseñas e información de identificación personal dentro de bloques que creían ilegibles
. Esto incluía registros almacenados en repositorios públicos de GitHub .
Los investigadores identificaron cuatro vías de abuso distintas habilitadas por la vulnerabilidad: reconstrucción del razonamiento oculto, recuperación de secretos incrustados en trazas de agentes, inyección de instrucciones a través de un canal no inspeccionable y reenvío entre sesiones de bloques no caducados .
Las tres compañías implementaron mitigaciones del lado del servidor después de que el equipo de investigación siguiera los procedimientos de divulgación responsable .
Los investigadores notificaron sus hallazgos a OpenAI, Anthropic, Google, Microsoft y Hugging Face. Tras la implementación de los cambios por parte de los proveedores, las comprobaciones de reproducibilidad confirmaron que la técnica principal de extracción ya no funciona contra las versiones actuales de las API . La documentación ahora aconseja eliminar los bloques de razonamiento antes de compartir registros o cambiar de modelo en medio de una conversación
.
Es notable que el criptógrafo Matthew Green había informado por separado de la vulnerabilidad de reenvío entre sesiones a OpenAI y Anthropic a través de sus programas de recompensa por errores en mayo de 2026, pero recibió respuestas despectivas antes de la publicación del artículo académico .
Los parches están activos desde agosto de 2026, pero los registros de sesiones históricas con bloques de razonamiento descifrados que ya fueron extraídos de la web pública siguen siendo accesibles .
El ataque de 'pensamientos robados' revela una tensión fundamental en el diseño de las API de IA modernas. Los proveedores quieren externalizar el estado del razonamiento al cliente para mejorar la escalabilidad y la latencia, pero el vínculo criptográfico necesario para mantener ese estado seguro entre sesiones, usuarios y modelos requiere un diseño cuidadoso. El enfoque de clave de encriptación global única utilizado por Anthropic, OpenAI y Google fue un atajo que creó una vulnerabilidad de seguridad y privacidad que afectó a todos los usuarios y desarrolladores que interactuaron con estas API.
El ataque también aterriza en medio del creciente conflicto entre Estados Unidos y China por la destilación de IA. Si bien la evidencia sobre Kimi K3 es circunstancial, proporciona la evidencia técnica más sólida hasta la fecha de que la destilación puede estar ocurriendo a gran escala, y brinda a los responsables políticos e investigadores una nueva herramienta para investigar la procedencia de los modelos de IA.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Un equipo de la Universidad de Tubinga, el Instituto Max Planck, MATS Research y Snyk descubrió un ataque que extrae el razonamiento oculto de la cadena de pensamiento de modelos como Claude, GPT y Gemini.
Un equipo de la Universidad de Tubinga, el Instituto Max Planck, MATS Research y Snyk descubrió un ataque que extrae el razonamiento oculto de la cadena de pensamiento de modelos como Claude, GPT y Gemini. La vulnerabilidad residía en que los bloques de razonamiento encriptados compartían una misma clave global, permitiendo reenviarlos a un modelo 'gemelo' más débil para que los descifrara.
Al escanear registros públicos, los investigadores encontraron 62 claves API activas, 33 contraseñas y 704 artefactos de privacidad expuestos en estos bloques que se creían seguros.