Cuộc tấn công Phát lại 'Stolen Thoughts' — Được công bố vào ngày 10–11 tháng 8 năm 2026, trong bài báo 'Stealing Reasoning Traces from Proprietary LLM APIs' (arXiv:2608.09867), các nhà nghiên cứu Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping và Andriushchenko đã phát hiện ra một lỗ hổng kiến trúc nghiêm trọng. Các khối 'suy nghĩ' được mã hóa mà Anthropic, OpenAI và Google trả về cho các ứng dụng khách API không được gắn kết đúng cách với nguồn gốc của chúng. Các khối này có thể được lấy từ một cuộc hội thoại và phát lại vào một mô hình 'anh em' yếu hơn, ít được bảo vệ hơn từ cùng một nhà cung cấp, và mô hình này sau đó sẽ in suy luận ẩn của mô hình tiên tiến dưới dạng văn bản thuần . Cuộc tấn công hoạt động xuyên suốt các phiên, các tài khoản người dùng và các mô hình khác nhau trong cùng một hệ sinh thái của nhà cung cấp . Các nhà nghiên cứu xác nhận kỹ thuật này hoạt động trên mọi công ty AI tiên tiến lớn mà họ thử nghiệm, và độ dài của suy luận thu hồi khớp gần như 1:1 với số lượng token suy nghĩ ẩn được API báo cáo .
Các dấu vết suy luận được trích xuất cung cấp tín hiệu huấn luyện chất lượng cao cho quá trình chưng cất mô hình (model distillation) — thực hành sử dụng đầu ra của một mô hình mạnh hơn để huấn luyện một mô hình đối thủ nhỏ hơn, rẻ hơn . Kỹ thuật này nằm ở trung tâm của một cuộc tranh cãi nảy lửa xung quanh các phòng thí nghiệm AI Trung Quốc:
Tuy nhiên, bằng chứng là chưa chắc chắn. Các nhà nghiên cứu bao gồm Braden Hancock (Viện Laude) và Nathan Lambert (Viện AI Allen) cho rằng chỉ riêng việc chưng cất không thể giải thích toàn bộ khả năng của Kimi K3. Một tài liệu PDF lan truyền rộng rãi tuyên bố đưa ra bằng chứng về việc chưng cất chuỗi suy nghĩ đã bị chỉ trích vì kết hợp một thí nghiệm hạn chế với những tuyên bố không có cơ sở .
Lỗ hổng này gây ra nhiều rủi ro cụ thể vượt ra ngoài hành vi trộm cắp tài sản trí tuệ:
Cả ba công ty đã được các nhà nghiên cứu 'Stolen Thoughts' liên hệ trước khi công bố. Theo các báo cáo, OpenAI, Anthropic và Google đã chặn cuộc tấn công suy luận chéo mô hình sau khi được thông báo. Các chi tiết cụ thể về biện pháp giảm thiểu của họ không được tiết lộ đầy đủ trong các nguồn đã công bố, nhưng lỗ hổng đã được xác nhận là tồn tại trên API của cả ba nhà cung cấp trước khi được vá . Việc cuộc tấn công bị 'chặn' cho thấy các công ty đã triển khai các bản sửa lỗi phía máy chủ — có khả năng là hạn chế việc sử dụng lại các khối suy luận được mã hóa trên các ngữ cảnh hoặc tài khoản mô hình khác nhau .
Anthropic trước đó đã công khai chống lại việc chưng cất quy mô lớn, báo cáo về 24.000 tài khoản giả mạo và 16 triệu lượt tương tác được sử dụng bởi các phòng thí nghiệm Trung Quốc để trích xuất đầu ra của Claude .
Bài học cốt lõi từ cả hai bài báo REP và Stolen Thoughts là việc ẩn hoặc mã hóa các dấu vết suy luận về cơ bản là một chiến lược bảo mật mong manh — nếu suy luận tồn tại trong trọng số mô hình, nó có thể được trích xuất .