Các nhà nghiên cứu từ Đại học Tübingen, Viện Max Planck, MATS Research và Snyk đã phát triển một cuộc tấn công 'replay' để trích xuất chuỗi suy luận ẩn của các mô hình AI như Claude, GPT và Gemini. Bằng cách đưa một khối suy luận đã mã hóa của mô hình mạnh vào một mô hình 'anh em' yếu hơn, họ buộc mô hình yếu giải m...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What technique did researchers from the University of Tübingen, the Max Planck Institute, MATS Research, and Snyk develop to extract hidden. Article summary: ## The Technique: "Replay Attack" on Encrypted Reasoning Traces. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Vào tháng 8 năm 2026, một nhóm nghiên cứu từ Đại học Tübingen, Viện Max Planck về Hệ thống Thông minh, MATS Research, Viện ELLIS Tübingen và công ty bảo mật Snyk đã công bố một bài báo mô tả một cuộc tấn công đáng ngạc nhiên nhưng đơn giản vào các dấu vết suy luận đã được mã hóa của các mô hình AI tiên tiến. Cuộc tấn công hoạt động trên cả ba nhà cung cấp lớn—Anthropic, OpenAI và Google—và không yêu cầu phải 'jailbreak' bất kỳ mô hình tiên tiến nào. Thay vào đó, nó khai thác một lựa chọn kiến trúc cơ bản: các công ty này trả về các 'khối suy luận' đã mã hóa cho máy khách API thay vì lưu trữ chúng ở phía máy chủ, và các khối này có thể di chuyển qua các phiên, người dùng và thậm chí các mô hình khác nhau từ cùng một nhà cung cấp . Các nhà nghiên cứu chỉ cần lấy một khối suy luận đã mã hóa từ một mô hình tiên tiến và 'replay' nó vào một mô hình 'anh em' yếu hơn, mô hình này sẽ giải mã và xuất ra dấu vết dưới dạng văn bản thuần túy
. Kỹ thuật này, được bài báo gọi là 'decryption jailbreak', được trình bày chi tiết trong bản in thử Stealing Reasoning Traces from Proprietary LLM APIs, được gửi lên arXiv vào ngày 10 tháng 8 năm 2026
.
Khi người dùng truy vấn một mô hình tiên tiến như Claude Opus 4.8 hoặc GPT-5.6 Sol thông qua API, mô hình sẽ thực hiện suy luận từng bước nội bộ—'chuỗi suy luận' (chain of thought)—và trả về suy luận đó cho máy khách dưới dạng một khối văn bản đã mã hóa. Trong các lệnh gọi tiếp theo, máy khách chuyển khối này trở lại API, cho phép mô hình tiếp tục suy luận mà không cần nhà cung cấp lưu trữ trạng thái trung gian ở phía máy chủ .
Điều mà các nhà nghiên cứu phát hiện ra là các khối mã hóa này không bị ràng buộc với một phiên, người dùng hoặc thậm chí mô hình cụ thể nào. Chúng chia sẻ một khóa mã hóa toàn cầu duy nhất trên tất cả các phiên và người dùng . Điều này có nghĩa là một khối được lấy từ một cuộc trò chuyện có thể được phát lại trong một ngữ cảnh khác. Mấu chốt: đưa một khối từ một mô hình tiên tiến được bảo vệ nghiêm ngặt vào một mô hình 'anh em' yếu hơn, ít được căn chỉnh hơn từ cùng một nhà cung cấp (ví dụ: Claude Haiku), và mô hình yếu hơn—vốn có ít rào cản từ chối hơn—sẽ giải mã và xuất ra nội dung của khối một cách nguyên văn
.
Chỉ cần hai lệnh gọi API để thực hiện cuộc tấn công: một để lấy khối mã hóa và một để đưa nó vào mô hình yếu hơn. Các nhà nghiên cứu đã chứng minh rằng cuộc tấn công có thể hoạt động trên quy mô lớn .
Cuộc tấn công không chỉ phơi bày suy luận của các mô hình tiên tiến—nó còn cung cấp bằng chứng mới trong cuộc tranh luận đang diễn ra về việc liệu công ty AI Trung Quốc Moonshot AI có huấn luyện mô hình Kimi K3 của mình bằng cách sao chép suy luận (distillation) từ các mô hình Mỹ hay không.
Sau khi trích xuất các dấu vết suy luận từ Claude Opus 4.8 và GPT-5.6 Sol, các nhà nghiên cứu đã so sánh chúng với đầu ra của các mô hình trọng số mở, bao gồm cả Kimi K3. Họ phát hiện ra rằng đầu ra của Kimi K3 thể hiện 'hiện tượng xác suất bất thường' mà khớp chặt chẽ với các mẫu được tìm thấy trong các dấu vết suy luận của Claude và GPT .
Bằng chứng này mang tính gián tiếp, không phải là kết luận cuối cùng. Các nhà nghiên cứu độc lập cho rằng những phát hiện này 'cung cấp một số bằng chứng—mặc dù không phải là bằng chứng kết luận—rằng các mô hình Trung Quốc nhất định có thể đã được huấn luyện bằng cách sao chép thông tin suy luận từ các mô hình Mỹ' . Một phát hiện gợi ý khác: khi được yêu cầu tự nhận dạng, Kimi K3 ban đầu tự nhận là 'Claude' của Anthropic, càng làm dấy lên những cáo buộc
.
Kimi K3 là mô hình trọng số mở với 2,8 nghìn tỷ tham số được Moonshot AI phát hành vào ngày 16 tháng 7 năm 2026. Nó vượt trội hơn Claude Opus 4.8 trên một số điểm chuẩn, nhưng không phải là người dẫn đầu rõ ràng. Trên Chỉ số Trí tuệ Nhân tạo Độc lập (Artificial Analysis Intelligence Index), K3 đạt 57 điểm so với 60 điểm của Claude Fable 5 và 59 điểm của GPT-5.6 Sol. Bản thân Moonshot cũng khá thẳng thắn khi thừa nhận rằng K3 vẫn còn thua kém GPT-5.6 Sol và Claude Fable 5 về tổng thể .
Cáo buộc sao chép suy luận không phải là mới—cả Anthropic và OpenAI trước đây đều đã cáo buộc các công ty Trung Quốc có hệ thống sao chép mô hình của họ. Một đánh giá về các bài báo học thuật và bằng sáng chế của Trung Quốc đã tiết lộ các nhà nghiên cứu quân sự Trung Quốc sử dụng đầu ra từ các mô hình của OpenAI và Anthropic để huấn luyện các hệ thống AI trong nước cho khả năng quốc phòng .
Sự ra mắt của Kimi K3 ngay lập tức gây ra tranh cãi. Trong vòng vài giờ sau khi phát hành vào ngày 16 tháng 7, Anthropic đã cáo buộc Moonshot xây dựng K3 bằng cách sao chép Claude, và tuyên bố này đã đến được Nhà Trắng, làm dấy lên khả năng áp đặt các biện pháp trừng phạt .
Tuy nhiên, những người chỉ trích cáo buộc sao chép chỉ ra một vấn đề về thời gian. Claude Opus 4.8 được phát hành không lâu trước khi Kimi K3 ra mắt. Các nhà nghiên cứu độc lập cho rằng mốc thời gian này khiến việc sao chép trực tiếp là 'không hợp lý' vì đơn giản là không có đủ thời gian để huấn luyện một mô hình 2,8 nghìn tỷ tham số bằng cách sử dụng bản sao từ một mô hình mới được phát hành . Moonshot cho rằng K3 được xây dựng từ nghiên cứu độc lập
.
Cùng một lỗ hổng kiến trúc đã làm lộ ra một lỗ hổng bảo mật thực tế. Bởi vì các mô hình tiên tiến đôi khi kết hợp thông tin đăng nhập và dữ liệu cá nhân vào quá trình suy luận của chúng, các khối suy luận đã mã hóa mà các nhà phát triển chia sẻ công khai—ví dụ, trong nhật ký phiên agent—có chứa thông tin nhạy cảm mà bất kỳ ai biết thủ thuật này đều có thể đọc được.
Bằng cách quét khoảng 7.000 nhật ký phiên agent được chia sẻ công khai trước tháng 8 năm 2026, các nhà nghiên cứu đã tìm thấy 62 khóa API còn hoạt động, 33 mật khẩu và dữ liệu người dùng nhạy cảm khác—tổng cộng 704 artifact quyền riêng tư—ẩn bên trong các khối suy luận đã mã hóa . Bất kỳ nhà phát triển nào đã công bố nhật ký agent thô có thể vô tình làm lộ khóa API, mật khẩu và thông tin nhận dạng cá nhân bên trong các khối mà họ tin rằng không ai có thể đọc được
. Điều này bao gồm các nhật ký được lưu trữ trên các kho lưu trữ GitHub công khai .
Các nhà nghiên cứu đã xác định bốn đường dẫn lạm dụng riêng biệt do lỗ hổng này gây ra: tái tạo suy luận ẩn, phục hồi bí mật được nhúng trong dấu vết agent, tiêm các hướng dẫn thông qua một kênh không thể kiểm tra, và phát lại các khối chưa hết hạn qua nhiều phiên .
Cả ba công ty đều triển khai các biện pháp giảm thiểu phía máy chủ sau khi nhóm nghiên cứu tuân thủ quy trình tiết lộ có trách nhiệm .
Các nhà nghiên cứu đã tiết lộ phát hiện của họ cho OpenAI, Anthropic, Google, Microsoft và Hugging Face. Sau khi các nhà cung cấp triển khai các thay đổi, các kiểm tra khả năng tái tạo đã xác nhận rằng kỹ thuật trích xuất chính không còn thành công với các bản dựng API hiện tại . Tài liệu hiện nay khuyên bạn nên loại bỏ các khối suy luận trước khi chia sẻ nhật ký hoặc chuyển đổi mô hình giữa cuộc trò chuyện
.
Đáng chú ý, nhà mật mã học Matthew Green đã báo cáo riêng lỗ hổng phát lại qua nhiều phiên cho cả OpenAI và Anthropic thông qua chương trình tiền thưởng lỗi của họ vào tháng 5 năm 2026, nhưng đã nhận được phản hồi từ chối trước khi bài báo học thuật được công bố .
Các bản vá đã có hiệu lực kể từ tháng 8 năm 2026, nhưng các nhật ký phiên lịch sử với các khối suy luận đã được giải mã đã bị thu thập từ web công khai vẫn có thể truy cập được .
Cuộc tấn công 'đánh cắp suy nghĩ' (stolen thoughts) cho thấy một sự căng thẳng cơ bản trong thiết kế của các API AI hiện đại. Các nhà cung cấp muốn chuyển trạng thái suy luận cho máy khách để mở rộng quy mô và giảm độ trễ, nhưng việc liên kết mật mã cần thiết để giữ trạng thái đó an toàn qua các phiên, người dùng và mô hình đòi hỏi một thiết kế cẩn thận. Phương pháp sử dụng một khóa mã hóa toàn cầu duy nhất của Anthropic, OpenAI và Google là một lối tắt đã tạo ra một lỗ hổng bảo mật và quyền riêng tư ảnh hưởng đến mọi người dùng và nhà phát triển tương tác với các API này.
Cuộc tấn công cũng nằm giữa cuộc xung đột ngày càng leo thang giữa Mỹ và Trung Quốc về việc sao chép suy luận AI. Mặc dù bằng chứng liên quan đến Kimi K3 chỉ mang tính gián tiếp, nhưng nó cung cấp bằng chứng kỹ thuật mạnh mẽ nhất cho đến nay cho thấy việc sao chép có thể đang diễn ra trên quy mô lớn, và nó cung cấp cho các nhà hoạch định chính sách và nhà nghiên cứu một công cụ mới để điều tra nguồn gốc của các mô hình AI.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Các nhà nghiên cứu từ Đại học Tübingen, Viện Max Planck, MATS Research và Snyk đã phát triển một cuộc tấn công 'replay' để trích xuất chuỗi suy luận ẩn của các mô hình AI như Claude, GPT và Gemini.
Các nhà nghiên cứu từ Đại học Tübingen, Viện Max Planck, MATS Research và Snyk đã phát triển một cuộc tấn công 'replay' để trích xuất chuỗi suy luận ẩn của các mô hình AI như Claude, GPT và Gemini. Bằng cách đưa một khối suy luận đã mã hóa của mô hình mạnh vào một mô hình 'anh em' yếu hơn, họ buộc mô hình yếu giải mã và hiển thị toàn bộ nội dung suy luận.
Phương pháp này cung cấp bằng chứng gián tiếp cho thấy mô hình Kimi K3 của Moonshot AI có thể đã được huấn luyện bằng cách sao chép suy luận từ các mô hình Mỹ như Claude Opus 4.8 và GPT 5.6 Sol.