L'attaque par rejeu « Stolen Thoughts » — Publiée les 10 et 11 août 2026 dans l'article « Stealing Reasoning Traces from Proprietary LLM APIs » (arXiv:2608.09867), les chercheurs Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping et Andriushchenko ont découvert une faille architecturale critique. Les blocs de « réflexion » chiffrés qu'Anthropic, OpenAI et Google renvoient aux clients API ne sont pas correctement scellés. Ces blocs peuvent être extraits d'une conversation et réinjectés dans un modèle frère plus faible du même fournisseur, qui imprime alors le raisonnement caché du modèle de pointe en texte clair . L'attaque fonctionne entre sessions, entre comptes utilisateur et entre modèles du même écosystème . Les chercheurs ont confirmé que la technique fonctionne sur toutes les grandes entreprises d'IA de pointe testées, et la longueur du raisonnement récupéré correspond presque parfaitement au nombre de jetons de réflexion cachés signalé par l'API .
Les traces de raisonnement extraites fournissent des signaux d'apprentissage de haute qualité pour la distillation de modèles — la pratique qui consiste à utiliser les sorties d'un modèle plus fort pour entraîner un modèle concurrent plus petit et moins coûteux . Cette technique est au cœur d'une vive controverse entourant les laboratoires d'IA chinois :
Cependant, les preuves ne sont pas définitives. Des chercheurs comme Braden Hancock (Laude Institute) et Nathan Lambert (Allen Institute for AI) soutiennent que la distillation seule ne peut expliquer l'ensemble des capacités de Kimi K3. Un PDF largement diffusé prétendant prouver la distillation de la chaîne de pensée a été critiqué pour avoir combiné une expérience limitée avec des affirmations non étayées .
La faille introduit plusieurs risques concrets au-delà du vol de propriété intellectuelle :
Les trois entreprises ont été contactées par les chercheurs de « Stolen Thoughts » avant la publication. Selon les rapports, OpenAI, Anthropic et Google ont bloqué l'attaque de raisonnement inter-modèles après avoir été notifiés. Les détails spécifiques de leurs mesures d'atténuation n'ont pas été entièrement divulgués dans les sources publiées, mais il a été confirmé que la vulnérabilité existait chez les trois fournisseurs avant les correctifs . Le fait que l'attaque ait été « bloquée » suggère que les entreprises ont mis en œuvre des correctifs côté serveur — probablement en restreignant la réutilisation des blocs de raisonnement chiffrés dans différents contextes de modèles ou comptes .
Anthropic luttait déjà publiquement contre la distillation à grande échelle, signalant les 24 000 comptes frauduleux et les 16 millions d'échanges utilisés par les laboratoires chinois pour extraire les sorties de Claude .
La leçon principale des articles REP et Stolen Thoughts est que cacher ou chiffrer les traces de raisonnement est une stratégie de sécurité fondamentalement fragile — si le raisonnement existe dans les poids du modèle, il peut être extrait .