'Stolen Thoughts' Yeniden Oynatma Saldırısı — 10-11 Ağustos 2026'da yayımlanan "Stealing Reasoning Traces from Proprietary LLM APIs" (arXiv:2608.09867) başlıklı makalede araştırmacılar Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping ve Andriushchenko kritik bir mimari kusur keşfetti. Anthropic, OpenAI ve Google'ın API istemcilerine döndürdüğü şifrelenmiş 'düşünme' blokları kaynağına uygun şekilde bağlı değil. Bu bloklar bir konuşmadan alınıp, aynı sağlayıcının daha az korumalı başka bir modeline yeniden oynatılabiliyor ve bu zayıf model, öncü modelin gizli akıl yürütmesini düz metin olarak yazdırıyor . Saldırı, farklı oturumlar, farklı kullanıcı hesapları ve aynı sağlayıcının ekosistemindeki farklı modeller arasında işe yarıyor . Araştırmacılar bu yöntemin test ettikleri her büyük öncü yapay zeka şirketinde çalıştığını doğruladı ve kurtarılan akıl yürütmenin uzunluğu, API tarafından rapor edilen gizli düşünme token sayısıyla neredeyse birebir örtüşüyor .
Çıkarılan akıl yürütme izleri, model damıtma (bir modelin çıktılarını kullanarak daha küçük ve ucuz bir rakip modeli eğitme) için yüksek kaliteli eğitim sinyalleri sağlıyor . Bu teknik, Çinli yapay zeka laboratuvarlarını çevreleyen hararetli bir tartışmanın merkezinde yer alıyor:
Ancak kanıtlar kesin değil. Braden Hancock (Laude Institute) ve Nathan Lambert (Allen Institute for AI) gibi araştırmacılar, damıtmanın tek başına Kimi K3'ün tüm yeteneklerini açıklayamayacağını savunuyor. Düşünce zinciri damıtmasının kanıtı olduğu iddia edilen ve yaygın olarak dolaşıma giren bir PDF dosyası, sınırlı bir deneyi desteklenmeyen iddialarla birleştirdiği için eleştirildi .
Açık, fikri mülkiyet hırsızlığının ötesinde birçok somut risk ortaya çıkarıyor:
Her üç şirket de 'Stolen Thoughts' araştırmacıları tarafından yayımdan önce bilgilendirildi. Gelen haberlere göre, OpenAI, Anthropic ve Google bu çapraz model akıl yürütme saldırısını engelledi. Aldıkları önlemlere ilişkin spesifik detaylar yayınlanan kaynaklarda tam olarak açıklanmadı, ancak güvenlik açığının yamalanmadan önce her üç sağlayıcının API'sinde de mevcut olduğu doğrulandı . Saldırının 'engellenmiş' olması, şirketlerin şifrelenmiş akıl yürütme bloklarının farklı model bağlamları veya hesaplar arasında yeniden kullanımını kısıtlayarak sunucu tarafında düzeltmeler uyguladığını gösteriyor .
Anthropic, Çinli laboratuvarların Claude çıktılarını çıkarmak için kullandığı 24.000 sahte hesap ve 16 milyon etkileşimi kamuoyuna bildirerek, damıtmayla büyük ölçekte mücadele ettiğini zaten duyurmuştu .
REP ve Stolen Thoughts makalelerinden çıkarılacak temel ders, akıl yürütme izlerini gizlemenin veya şifrelemenin temelde kırılgan bir güvenlik stratejisi olduğudur: eğer akıl yürütme model ağırlıklarında mevcutsa, ortaya çıkarılabilir .