Tübingen Üniversitesi, Max Planck Enstitüsü, MATS Research ve Snyk'ten araştırmacılar, Anthropic, OpenAI ve Google'ın öncü yapay zeka modellerinin şifrelenmiş 'düşünce zincirlerini' okuyabildi. Saldırı, güçlü bir modelin şifrelenmiş akıl yürütme bloğunu, aynı sağlayıcının daha zayıf ve daha az güvenlikli bir modelin...
Research answer

Create a landscape editorial hero image for this Studio Global article: What technique did researchers from the University of Tübingen, the Max Planck Institute, MATS Research, and Snyk develop to extract hidden. Article summary: ## The Technique: "Replay Attack" on Encrypted Reasoning Traces. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Ağustos 2026'da, Tübingen Üniversitesi, Max Planck Akıllı Sistemler Enstitüsü, MATS Research, ELLIS Enstitüsü Tübingen ve güvenlik firması Snyk'ten bir araştırma ekibi, öncü yapay zeka modellerinin şifrelenmiş akıl yürütme izlerine karşı şaşırtıcı derecede basit bir saldırıyı anlatan bir makale yayınladı. Saldırı, üç büyük sağlayıcıyı da (Anthropic, OpenAI ve Google) etkiliyordu ve tek bir öncü modeli 'jailbreak' (korumasını aşmak) gerektirmiyordu .
Araştırmacılar, temel bir mimari seçimden faydalandı: Bu şirketler, akıl yürütme durumlarını sunucuda saklamak yerine, istemciye şifrelenmiş 'akıl yürütme blokları' olarak geri gönderiyor. Bu bloklar oturumlar, kullanıcılar ve hatta aynı sağlayıcının farklı modelleri arasında taşınabilir . Araştırmacılar, bir öncü modelden alınan şifrelenmiş bloğu, aynı sağlayıcının daha zayıf bir 'kardeş' modeline besleyerek, bu zayıf modelin bloğu çözüp içindeki metni aynen okumasını sağladı
. 'Çalınan Düşünceler' (Stolen Thoughts) adı verilen bu teknik, 10 Ağustos 2026'da arXiv'de yayınlanan Stealing Reasoning Traces from Proprietary LLM APIs başlıklı ön baskıda detaylandırıldı
.
Bir kullanıcı, Claude Opus 4.8 veya GPT-5.6 Sol gibi bir öncü modele API üzerinden soru sorduğunda, model adım adım içsel bir akıl yürütme (düşünce zinciri) gerçekleştirir. Bu akıl yürütme, istemciye opak, şifrelenmiş bir metin bloğu olarak geri gönderilir. Sonraki sorgularda istemci bu bloğu tekrar API'ye göndererek modelin kaldığı yerden devam etmesini sağlar. Böylece sağlayıcının bu ara durumu sunucuda saklamasına gerek kalmaz .
Araştırmacıların keşfettiği kritik nokta, bu şifrelenmiş blokların belirli bir oturuma, kullanıcıya veya modele bağlı olmamasıydı. Tüm oturumlar ve kullanıcılar arasında tek bir küresel şifreleme anahtarı kullanılıyordu . Bu, bir konuşmadan alınan bir bloğun başka bir bağlamda tekrar kullanılabileceği anlamına geliyordu. Hüner, ağır korumalı bir öncü modelden alınan bloğu, aynı sağlayıcının daha zayıf ve daha az güvenlikli bir kardeş modeline (örneğin Claude Haiku) beslemekti. Zayıf model, daha az reddetme ve güvenlik kalkanına sahip olduğu için bloğu çözüp içeriği olduğu gibi aktarıyordu
.
Saldırıyı gerçekleştirmek için sadece iki API çağrısı yeterliydi: biri şifrelenmiş bloğu almak, diğeri de onu zayıf modele beslemek. Araştırmacılar, saldırının ölçeklenebilir olduğunu da gösterdi .
Bu saldırı sadece öncü modellerin akıl yürütmelerini açığa çıkarmakla kalmadı, aynı zamanda Çinli yapay zeka şirketi Moonshot AI'nın Kimi K3 modelini ABD modellerinin akıl yürütmelerini damıtarak (kopyalayarak) eğitip eğitmediği tartışmasına da yeni bir boyut kazandırdı.
Araştırmacılar, Claude Opus 4.8 ve GPT-5.6 Sol'dan çıkardıkları akıl yürütme izlerini, Kimi K3 de dahil olmak üzere açık ağırlıklı diğer modellerin çıktılarıyla karşılaştırdı. Kimi K3'ün çıktılarının, Claude ve GPT'nin akıl yürütme kalıplarıyla oldukça benzer 'anormal olasılık fenomenleri' sergilediğini buldular .
Bu bulgular kesin olmamakla birlikte güçlü birer belirti niteliğinde. Bağımsız araştırmacılar, bu durumun 'bazı Çin modellerinin ABD modellerinden akıl yürütme bilgilerini damıtarak eğitilmiş olabileceğine dair kesin olmasa da bazı kanıtlar sunduğunu' belirtiyor . Bir diğer dikkat çekici bulgu ise Kimi K3'ün kendini tanımlaması istendiğinde başlangıçta 'Anthropic'in Claude'u' olarak yanıt vermesiydi ki bu da suçlamaları körükledi
.
Kimi K3, 2,8 trilyon parametreli, Moonshot AI tarafından 16 Temmuz 2026'da yayınlanan açık ağırlıklı bir modeldir. Birçok kıyaslamada Claude Opus 4.8'i geride bırakmasına rağmen, bağımsız Artificial Analysis Intelligence Index'te Claude Fable 5'in 60 ve GPT-5.6 Sol'un 59 puanının gerisinde 57 puan almıştır. Moonshot AI da K3'ün genel olarak hâlâ GPT-5.6 Sol ve Claude Fable 5'in gerisinde olduğunu açıkça kabul etmiştir .
Damıtma suçlaması yeni değil. Hem Anthropic hem de OpenAI daha önce Çinli firmaları modellerini sistematik olarak damıtmakla suçlamıştı. Çinli askeri araştırmacıların, savunma amaçlı yapay zeka sistemleri geliştirmek için OpenAI ve Anthropic modellerinin çıktılarını kullandığı ortaya çıkmıştı .
Kimi K3'ün lansmanı anında tartışma yarattı. 16 Temmuz'daki lansmanından saatler sonra Anthropic, Moonshot AI'yı Claude'u damıtmakla suçladı. Bu iddia Beyaz Saray'a kadar ulaştı ve olası yaptırımları gündeme getirdi .
Ancak, damıtma iddiasının eleştirmenleri bir zamanlama sorununa işaret ediyor. Claude Opus 4.8, Kimi K3'ün lansmanından kısa bir süre önce piyasaya sürülmüştü. Bağımsız araştırmacılar, yeni piyasaya sürülen bir modelden damıtma yoluyla 2,8 trilyon parametreli bir modeli eğitmek için yeterli zaman olmadığını, bu nedenle doğrudan kopyalamanın 'inandırıcı olmadığını' söylüyor . Moonshot AI ise K3'ün bağımsız araştırmalar sonucu geliştirildiğini savunuyor
.
Aynı mimari kusur, pratik bir güvenlik açığını da ortaya çıkardı. Öncü modeller bazen akıl yürütme sürecine kimlik bilgileri ve kişisel verileri dahil ettiğinden, geliştiricilerin kamuya açık olarak paylaştığı (örneğin GitHub depolarında) ajan oturum günlüklerindeki şifrelenmiş bloklar, bu numarayı bilen herkes tarafından okunabiliyordu .
Araştırmacılar, Ağustos 2026 öncesinde yayınlanmış yaklaşık 7.000 kamuya açık ajan oturum günlüğünü tarayarak, şifrelenmiş blokların içinde saklanmış halde 62 canlı API anahtarı, 33 şifre ve diğer hassas kullanıcı verileri dahil toplam 704 gizlilik öğesi buldu . Kimse tarafından okunamayacağını düşündükleri bu blokları yayınlayan geliştiriciler, farkında olmadan bu hassas bilgileri ifşa etmiş oldu
.
Araştırmacılar, bu güvenlik açığı sayesinde dört farklı kötüye kullanım yolu tanımladı: gizli akıl yürütmenin yeniden yapılandırılması, ajan izlerine gömülü sırların kurtarılması, denetlenemeyen bir kanal üzerinden talimat enjekte edilmesi ve süresi dolmamış blokların oturumlar arası tekrar oynatılması .
Üç şirket de, araştırma ekibinin sorumlu ifşa (responsible disclosure) prosedürlerini izlemesinin ardından sunucu tarafında geçici çözümler uyguladı .
Araştırmacılar bulgularını OpenAI, Anthropic, Google, Microsoft ve Hugging Face'e bildirdi. Sağlayıcıların değişiklikleri uygulamasının ardından yapılan tekrarlanabilirlik kontrolleri, ana çıkarma tekniğinin mevcut API sürümlerine karşı artık işe yaramadığını doğruladı . Belgeler artık, günlükler paylaşılmadan veya konuşma ortasında model değiştirilmeden önce akıl yürütme bloklarının çıkarılmasını tavsiye ediyor
.
İlginç bir not: Kriptografi araştırmacısı Matthew Green, oturumlar arası tekrar oynatma zafiyetini Mayıs 2026'da OpenAI ve Anthropic'in hata ödülü programlarına ayrı ayrı bildirmiş ancak akademik makale yayınlanana kadar bu şirketlerden ilgisiz yanıtlar almıştı .
Yamalar Ağustos 2026 itibarıyla canlıya alındı, ancak daha önce kamuya açık web'den toplanmış ve kodu çözülmüş akıl yürütme bloklarını içeren geçmiş oturum günlükleri hâlâ erişilebilir durumda .
'Çalınan Düşünceler' saldırısı, modern yapay zeka API'lerinin tasarımındaki temel bir gerilimi ortaya koyuyor. Sağlayıcılar, ölçeklenebilirlik ve düşük gecikme için akıl yürütme durumunu istemciye yüklemek istiyor ancak bu durumu oturumlar, kullanıcılar ve modeller arasında güvende tutmak için gereken kriptografik bağlama, dikkatli bir tasarım gerektiriyor. Anthropic, OpenAI ve Google'ın kullandığı tek küresel şifreleme anahtarı yaklaşımı, bu API'lerle etkileşime giren her kullanıcı ve geliştiriciyi etkileyen bir güvenlik ve gizlilik açığı yaratan bir kestirme yoldu.
Ayrıca bu saldırı, ABD-Çin arasında tırmanan yapay zeka damıtma çatışmasının tam ortasına düştü. Kimi K3 ile ilgili kanıtlar kesin olmasa da, bugüne kadar damıtmanın büyük ölçekte gerçekleşiyor olabileceğine dair en güçlü teknik kanıtı sunuyor ve politika yapıcılara ve araştırmacılara yapay zeka modellerinin kökenini araştırmak için yeni bir araç veriyor.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Tübingen Üniversitesi, Max Planck Enstitüsü, MATS Research ve Snyk'ten araştırmacılar, Anthropic, OpenAI ve Google'ın öncü yapay zeka modellerinin şifrelenmiş 'düşünce zincirlerini' okuyabildi.
Tübingen Üniversitesi, Max Planck Enstitüsü, MATS Research ve Snyk'ten araştırmacılar, Anthropic, OpenAI ve Google'ın öncü yapay zeka modellerinin şifrelenmiş 'düşünce zincirlerini' okuyabildi. Saldırı, güçlü bir modelin şifrelenmiş akıl yürütme bloğunu, aynı sağlayıcının daha zayıf ve daha az güvenlikli bir modeline besleyerek çalışıyor; zayıf model bu bloğu çözüp düz metin olarak aktarıyor.
Yöntem sayesinde ortaya çıkarılan akıl yürütme kalıpları, Çinli Moonshot AI'nın Kimi K3 modelinin, ABD'li rakipleri Claude Opus 4.8 ve GPT 5.6 Sol'ün özel düşünce süreçlerini 'damıtarak' (distilasyon) eğitilmiş olabil...