Reasoning Exposure Prompting (REP) — เผยแพร่เมื่อวันที่ 30 พฤษภาคม 2026 ในรายงาน "Hidden Thoughts Are Not Secret: Reasoning Trace Exposure in LLMs" (arXiv:2606.00642) โดยนักวิจัย Lu, Tsai, Tsai, Popa และ Yu ได้แสดงให้เห็นว่า แม้ผู้ให้บริการจะจงใจซ่อนกระบวนการคิด (chain-of-thought) เทคนิคการตั้งคำถามแบบเบาๆ ที่เรียกว่า shadow-model prompting ก็สามารถดึงร่องรอยภายในเหล่านั้นออกมาได้ หลักฐานที่ได้นั้นละเอียดพอที่จะใช้ฝึกฝนโมเดลขนาดเล็กกว่า
การโจมตี 'Stolen Thoughts' — เผยแพร่เมื่อวันที่ 10–11 สิงหาคม 2026 ในรายงาน "Stealing Reasoning Traces from Proprietary LLM APIs" (arXiv:2608.09867) โดยนักวิจัย Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping และ Andriushchenko ค้นพบจุดบกพร่องเชิงสถาปัตยกรรมที่สำคัญ บล็อก 'ความคิด' ที่ถูกเข้ารหัสซึ่ง Anthropic, OpenAI และ Google ส่งคืนให้ลูกค้าผ่าน API ไม่ได้ถูกผนึกไว้อย่างดี ชิ้นส่วนเหล่านี้สามารถยกออกจากการสนทนาหนึ่งไปใส่อีกการสนทนาหนึ่งที่มีโมเดลพี่น้องที่อ่อนแอกว่าจากผู้ให้บริการรายเดียวกันได้ และโมเดลที่อ่อนกว่าจะพิมพ์ความคิดที่ซ่อนอยู่ของโมเดลระดับแนวหน้าออกมาเป็นข้อความธรรมดา การโจมตีนี้ใช้ได้ผลข้ามเซสชัน ข้ามบัญชีผู้ใช้ และข้ามโมเดลภายในระบบนิเวศของผู้ให้บริการรายเดียวกัน ทีมวิจัยยืนยันว่าเทคนิคนี้ใช้ได้ผลกับ ทุกบริษัท AI ชั้นนำที่พวกเขาทดสอบ และความยาวของความคิดที่กู้คืนได้นั้นเกือบจะตรงกับจำนวนโทเค็นความคิดที่ซ่อนอยู่ซึ่ง API แจ้งนับ 1:1
ร่องรอยความคิดที่ถูกสกัดออกมาเป็นสัญญาณการฝึกคุณภาพสูงสำหรับ การกลั่นกรองโมเดล (model distillation) ซึ่งเป็นแนวทางปฏิบัติที่ใช้ผลลัพธ์ของโมเดลที่แข็งแกร่งกว่ามาฝึกโมเดลคู่แข่งที่เล็กกว่าและถูกกว่า เทคนิคนี้เป็นประเด็นร้อนของข้อพิพาทที่เกี่ยวข้องกับห้องปฏิบัติการ AI ของจีน:
อย่างไรก็ตาม หลักฐานนี้ ยังไม่สิ้นสุด นักวิจัยรวมถึง Braden Hancock (จาก Laude Institute) และ Nathan Lambert (จาก Allen Institute for AI) ให้เหตุผลว่าการกลั่นกรองเพียงอย่างเดียวไม่สามารถอธิบายความสามารถทั้งหมดของ Kimi K3 ได้ เอกสาร PDF ที่แพร่หลายซึ่งอ้างว่าเป็นข้อพิสูจน์การกลั่นกรองสายใยแห่งความคิดนั้นถูกวิพากษ์วิจารณ์ว่ารวมการทดลองที่มีขอบเขตจำกัดเข้ากับข้อกล่าวหาที่ไม่มีหลักฐานสนับสนุน
จุดบกพร่องนี้ก่อให้เกิดความเสี่ยงที่เป็นรูปธรรมหลายประการนอกเหนือจากการขโมยทรัพย์สินทางปัญญา:
ทั้งสามบริษัทได้รับการติดต่อจากทีมวิจัย 'Stolen Thoughts' ก่อนการเผยแพร่ผลงาน ตามรายงานข่าว OpenAI, Anthropic และ Google ได้ปิดกั้นการโจมตีข้ามโมเดลดังกล่าว หลังจากได้รับแจ้ง รายละเอียดเฉพาะของมาตรการป้องกันไม่ได้รับการเปิดเผยอย่างเต็มรูปแบบในแหล่งข้อมูลที่เผยแพร่ แต่ยืนยันว่าช่องโหว่ดังกล่าวมีอยู่ใน API ของทั้งสามบริษัท ก่อนที่จะได้รับการแก้ไข การที่การโจมตีถูก 'ปิดกั้น' แสดงว่าบริษัทต่างๆ ได้ดำเนินการแก้ไขในฝั่งเซิร์ฟเวอร์ ซึ่งน่าจะเป็นการจำกัดการใช้ซ้ำบล็อกความคิดที่เข้ารหัสข้ามบริบทหรือบัญชีโมเดลที่แตกต่างกัน
ก่อนหน้านี้ Anthropic ได้ต่อสู้กับการกลั่นกรองขนาดใหญ่อย่างเปิดเผย โดยรายงานถึง บัญชีปลอม 24,000 บัญชี และ การแลกเปลี่ยน 16 ล้านครั้ง ที่ห้องปฏิบัติการจีนใช้เพื่อสกัดผลลัพธ์ของ Claude
บทเรียนสำคัญจากทั้งรายงาน REP และ Stolen Thoughts คือ การซ่อนหรือเข้ารหัสร่องรอยความคิดเป็นกลยุทธ์ด้านความปลอดภัยที่เปราะบางโดยพื้นฐาน — หากความคิดมีอยู่ในน้ำหนักของโมเดล มันก็สามารถถูกดึงออกมาได้