Reasoning Exposure Prompting (REP) — פורסם ב-30 במאי 2026 במאמר "Hidden Thoughts Are Not Secret: Reasoning Trace Exposure in LLMs" (arXiv:2606.00642). החוקרים Lu, Tsai, Tsai, Popa ו-Yu הראו שגם כשספקים מסתירים בכוונה את שרשרת החשיבה, טכניקת Prompting קלה במשקל ('in-context') יכולה למשוך אותה חזרה לפלט. השיטה, המכונה 'shadow-model prompting', משתמשת בדגימות ממודל קטן וחסר הגבלות, העטופות בפורמטים דמויי קוד עזר, כדי לחלץ עקבות פנימיות מהמודל המותקף. העקבות שמופקות מפורטות מספיק כדי לזקק מהן מודל קטן יותר .
מתקפת 'המחשבות הגנובות' (Stolen Thoughts) — פורסמה ב-10–11 באוגוסט 2026 במאמר "Stealing Reasoning Traces from Proprietary LLM APIs" (arXiv:2608.09867). החוקרים Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping ו-Andriushchenko גילו כשל ארכיטקטוני קריטי: בלוקי ה'חשיבה' המוצפנים שחברות Anthropic, OpenAI ו-Google מחזירות ללקוחות ה-API אינם אטומים כראוי למקורם. ניתן להרים בלוקים אלו משיחה אחת ולשדר אותם מחדש (replay) לתוך מודל אח חלש יותר מאותו ספק, אשר אז מדפיס את החשיבה הסמויה של מודל הקצה כטקסט פשוט . המתקפה עובדת על פני שיחות שונות, חשבונות משתמש שונים ועל פני מודלים שונים באותה מערכת ספק . החוקרים אישרו שהטכניקה עובדת על כל חברת AI מתקדמת מרכזית שבדקו, ואורך החשיבה שהם משחזרים תואם כמעט 1:1 למספר אסימוני החשיבה (thinking tokens) הנסתר שדווח על ידי ה-API .
עקבות החשיבה המופקות מספקות אותות אימון באיכות גבוהה לזיקוק מודלים (model distillation) — הפרקטיקה של שימוש בפלטים של מודל חזק כדי לאמן מודל מתחרה זול וקטן יותר . טכניקה זו עומדת במרכז מחלוקת סוערת סביב מעבדות AI סיניות:
עם זאת, הראיות אינן חד-משמעיות. חוקרים כמו Braden Hancock (מכון Laude) ו-Nathan Lambert (מכון Allen ל-AI) טוענים כי זיקוק לבדו אינו יכול להסביר את מכלול היכולות של Kimi K3. מסמך PDF ויראלי שטען להוכחה לזיקוק שרשרת חשיבה ספג ביקורת על שילוב של ניסוי מוגבל עם טענות לא מבוססות .
הכשל יוצר מספר סיכונים קונקרטיים נוספים מעבר לגניבת קניין רוחני:
כל שלוש החברות נוצרו קשר על ידי חוקרי 'המחשבות הגנובות' לפני הפרסום. על פי דיווחים, OpenAI, Anthropic ו-Google חסמו את מתקפת החשיבה החוצה-מודלים לאחר שקיבלו הודעה. פרטים ספציפיים על הצעדים שנקטו לא נחשפו במלואם במקורות שפורסמו, אך אושר שהחולשה התקיימה אצל כל שלושת הספקים לפני התיקון . חסימת המתקפה מרמזת על יישום תיקונים בצד השרת, ככל הנראה הגבלת השימוש החוזר בבלוקי חשיבה מוצפנים בין הקשרי מודל או חשבונות שונים .
Anthropic כבר ניהלה קרב פומבי נגד זיקוק בהיקף נרחב, תוך דיווח על 24,000 החשבונות המזויפים ו-16 מיליון האינטראקציות ששימשו מעבדות סיניות לחילוץ פלטים מ-Claude .
הלקח המרכזי הן ממאמרי REP והן ממאמרי 'Stolen Thoughts' הוא שהסתרה או הצפנה של עקבות חשיבה היא אסטרטגיית אבטחה שבירה מיסודה — אם החשיבה קיימת במשקלי המודל, ניתן לחלץ אותה .