रीज़निंग एक्सपोज़र प्रॉम्प्टिंग (REP) — 30 मई, 2026 को प्रकाशित पेपर "हिडन थॉट्स आर नॉट सीक्रेट: रीज़निंग ट्रेस एक्सपोज़र इन LLMs" (arXiv:2606.00642) में, शोधकर्ताओं लू, त्साई, त्साई, पोपा और यू ने दिखाया कि भले ही प्रदाता जानबूझकर चेन-ऑफ-थॉट रीज़निंग को छिपाते हैं, एक हल्की इन-कॉन्टेक्स्ट प्रॉम्प्टिंग तकनीक छिपी हुई रीज़निंग को वापस यूज़र-विज़िबल आउटपुट में खींच सकती है। इस विधि को शैडो-मॉडल प्रॉम्प्टिंग कहा जाता है, जो एक छोटे, अप्रतिबंधित मॉडल से जनरेट किए गए डेमॉन्स्ट्रेशन का उपयोग करती है ।
'स्टोलन थॉट्स' रीप्ले अटैक — 10-11 अगस्त, 2026 को प्रकाशित पेपर "स्टीलिंग रीज़निंग ट्रेसेस फ्रॉम प्रोप्राइटरी LLM APIs" (arXiv:2608.09867) में, शोधकर्ताओं पैनफिलोव, श्मोट्ज़, शुमेलोव, बेउरर-केलनर, शेफ़र, प्रभु, गीपिंग और एंड्रियुशचेंको ने एक गंभीर आर्किटेक्चरल खामी पाई। एन्क्रिप्टेड 'थिंकिंग' ब्लॉक्स जो Anthropic, OpenAI और Google API क्लाइंट्स को लौटाते हैं, वे अपने स्रोत से ठीक से सील नहीं होते। इन ब्लॉक्स को एक बातचीत से उठाकर उसी प्रदाता के कमजोर, कम सुरक्षित सिबलिंग मॉडल में रीप्ले किया जा सकता है, जो फिर फ्रंटियर मॉडल की छिपी रीज़निंग को सादे टेक्स्ट में प्रिंट कर देता है । यह हमला सेशन, यूज़र अकाउंट और एक ही प्रदाता के इकोसिस्टम के मॉडल्स के बीच काम करता है । शोधकर्ताओं ने पुष्टि की कि यह तकनीक हर बड़ी फ्रंटियर AI कंपनी पर काम करती है, और निकाली गई रीज़निंग की लंबाई API द्वारा रिपोर्ट किए गए हिडन थिंकिंग-टोकन काउंट से लगभग 1:1 मेल खाती है ।
निकाले गए रीज़निंग ट्रेसेस मॉडल डिस्टिलेशन के लिए उच्च गुणवत्ता वाले ट्रेनिंग सिग्नल प्रदान करते हैं — यह एक ऐसी प्रथा है जिसमें एक मजबूत मॉडल के आउटपुट का उपयोग एक छोटे, सस्ते प्रतिद्वंद्वी मॉडल को प्रशिक्षित करने के लिए किया जाता है । यह तकनीक चीनी AI लैब्स को लेकर एक गरम विवाद के केंद्र में है:
हालांकि, सबूत निर्णायक नहीं हैं। ब्रैडन हैनकॉक (लाउड इंस्टीट्यूट) और नाथन लैम्बर्ट (एलन इंस्टीट्यूट फॉर AI) सहित शोधकर्ताओं का तर्क है कि अकेले डिस्टिलेशन Kimi K3 की पूरी क्षमताओं की व्याख्या नहीं कर सकता है। चेन-ऑफ-थॉट डिस्टिलेशन के सबूत का दावा करने वाली एक व्यापक रूप से प्रसारित PDF की आलोचना की गई क्योंकि इसमें एक सीमित प्रयोग को असमर्थित दावों के साथ जोड़ा गया था ।
यह खामी बौद्धिक संपदा की चोरी से परे कई ठोस जोखिम पैदा करती है:
'स्टोलन थॉट्स' शोधकर्ताओं ने प्रकाशन से पहले तीनों कंपनियों से संपर्क किया। रिपोर्टिंग के अनुसार, OpenAI, Anthropic और Google ने सूचित किए जाने के बाद क्रॉस-मॉडल रीज़निंग अटैक को ब्लॉक कर दिया। उनके उपायों के विशिष्ट विवरण प्रकाशित स्रोतों में पूरी तरह से खुलासा नहीं किए गए थे, लेकिन पैच लगाने से पहले तीनों प्रदाताओं के API में कमजोरी मौजूद होने की पुष्टि हुई थी । 'हमले को ब्लॉक कर दिया गया' का मतलब है कि कंपनियों ने सर्वर-साइड फिक्स लागू किए — संभवतः विभिन्न मॉडल संदर्भों या खातों में एन्क्रिप्टेड रीज़निंग ब्लॉक्स के पुन: उपयोग को प्रतिबंधित करना ।
Anthropic पहले से ही बड़े पैमाने पर डिस्टिलेशन से सार्वजनिक रूप से जूझ रहा था, चीनी लैब्स द्वारा Claude आउटपुट निकालने के लिए उपयोग किए गए 24,000 फर्जी खातों और 16 मिलियन एक्सचेंज की रिपोर्ट कर रहा था ।
REP और स्टोलन थॉट्स दोनों पेपरों से मुख्य सबक यह है कि रीज़निंग ट्रेसेस को छिपाना या एन्क्रिप्ट करना एक मौलिक रूप से कमजोर सुरक्षा रणनीति है — यदि रीज़निंग मॉडल वेट्स में मौजूद है, तो इसे निकाला जा सकता है ।