TamperBench kiểm tra 21 mô hình AI open weight, gồm các dòng Llama, Qwen3 và Mistral, với quy mô từ 0,6 đến 8 tỷ tham số. Cả 21 mô hình đều có thể bị can thiệp để trở nên sẵn sàng tạo nội dung có hại hơn, trong khi vẫn giữ phần lớn năng lực suy luận.
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
Nghiên cứu TamperBench, được trình bày tại Hội nghị ACM SIGKDD ’26, đưa ra một kết luận đáng chú ý: không mô hình nào trong 21 mô hình AI open-weight được thử nghiệm có lớp bảo vệ đủ bền vững trước toàn bộ các mối đe dọa can thiệp được đánh giá. 25
Các mô hình open-weight là những mô hình cho phép tải và chỉnh sửa trọng số. Điều này tạo điều kiện cho nghiên cứu, kiểm toán và triển khai linh hoạt, nhưng cũng đồng nghĩa nhà phát triển ban đầu khó kiểm soát cách mô hình bị fine-tune hoặc phân phối lại.
TamperBench kết hợp các cuộc tấn công trên không gian trọng số với những phương pháp can thiệp vào biểu diễn tiềm ẩn của mô hình. Phạm vi thử nghiệm bao gồm chín mối đe dọa, từ fine-tuning tưởng như vô hại đến tinh chỉnh trực tiếp trên dữ liệu có hại, tấn công kiểu đầu độc dữ liệu và các phương pháp đa ngôn ngữ hoặc dựa trên embedding/latent representation. 2
Trong đó, nhóm thường gây ảnh hưởng nghiêm trọng nhất là các cuộc tấn công jailbreak bằng fine-tuning ẩn. Ba biến thể nổi bật gồm:
Điểm đáng chú ý là những cuộc tấn công này chủ yếu được huấn luyện trên dữ liệu có vẻ lành tính, chỉ cần một phần nhỏ dữ liệu có hại. Vì vậy, chúng có thể làm thay đổi hành vi an toàn mà không nhất thiết khiến mô hình suy giảm rõ rệt ở các tác vụ thông thường. 2
Nhóm nghiên cứu lựa chọn cấu hình tấn công nhằm tối đa hóa mức độ tạo phản hồi có hại, đồng thời giới hạn mức giảm điểm trên MMLU-Pro—một bộ đánh giá năng lực hiểu biết và suy luận đa lĩnh vực—ở mức không quá 10% so với mô hình chưa bị can thiệp. 2
Nói cách khác, kết quả không chỉ cho thấy mô hình có thể bị buộc trả lời nội dung nguy hiểm. Nó còn cho thấy việc gỡ bỏ các cơ chế bảo vệ có thể diễn ra trong khi mô hình vẫn duy trì phần lớn năng lực giải quyết vấn đề. Đây là yếu tố khiến rủi ro trở nên đáng quan tâm hơn so với trường hợp mô hình bị chỉnh sửa đến mức hoạt động kém rõ rệt.
Dữ liệu được cung cấp không nêu chính xác mức tăng điểm gây hại riêng cho từng mô hình như Llama-3-8B-Instruct hay Qwen3-8B-Instruct, vì vậy không thể khẳng định các con số cụ thể cho từng model.
Nghiên cứu cũng thử nghiệm năm mô hình được bổ sung cơ chế phòng vệ, trong đó có các biến thể ReFAT và Circuit Breaking. Những biện pháp này giúp cải thiện khả năng chống chịu trong một số bối cảnh, nhưng không ngăn chặn đáng tin cậy việc gỡ bỏ lớp bảo vệ trên toàn bộ bộ tấn công. 25
Kết quả này cho thấy một mô hình vượt qua các bài kiểm tra alignment thông thường trước khi phát hành không đồng nghĩa với việc nó sẽ tiếp tục an toàn sau khi trọng số được công khai. Người dùng khác có thể sao chép, fine-tune và phân phối lại mô hình mà không cần sự cho phép hoặc giám sát liên tục của nhà phát triển ban đầu. 2
Các tác giả không cho rằng mô hình open-weight không có giá trị. Tính mở có thể hỗ trợ nghiên cứu, kiểm toán và trách nhiệm giải trình. Tuy nhiên, họ cảnh báo rằng việc công khai trọng số không nên được xem là an toàn chỉ vì mô hình đã vượt qua các bài kiểm tra bảo vệ trước khi phát hành. 5
Rủi ro tương tự cũng có thể tồn tại ở các mô hình thương mại đóng hoặc dịch vụ API. Điểm khác biệt là nhà cung cấp vẫn kiểm soát quá trình fine-tuning và triển khai, nhờ đó có thể áp dụng biện pháp phòng vệ ở giai đoạn tinh chỉnh hoặc sau khi tinh chỉnh—những biện pháp khó thực hiện một khi trọng số đã được phát tán tự do. 25
Theo các nhà nghiên cứu, nếu năng lực của mô hình vẫn được duy trì sau khi lớp bảo vệ bị gỡ bỏ, nguy cơ lạm dụng có thể mở rộng đáng kể, chẳng hạn như phát tán thông tin sai lệch trên quy mô lớn, hỗ trợ lừa đảo và phishing tinh vi, hoặc tạo hướng dẫn kỹ thuật nguy hiểm. 5
Nhóm nghiên cứu kêu gọi tăng cường nghiên cứu về khả năng chống can thiệp, đưa các đánh giá đối kháng tiêu chuẩn hóa như TamperBench vào quy trình kiểm tra trước phát hành, đồng thời dựa nhiều hơn vào bằng chứng khi đánh giá và mua sắm hệ thống AI. Điều này đặc biệt quan trọng khi chính phủ và các tổ chức triển khai AI trong y tế, phát hiện gian lận, giáo dục và những dịch vụ công khác. 25
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
TamperBench kiểm tra 21 mô hình AI open weight, gồm các dòng Llama, Qwen3 và Mistral, với quy mô từ 0,6 đến 8 tỷ tham số.
TamperBench kiểm tra 21 mô hình AI open weight, gồm các dòng Llama, Qwen3 và Mistral, với quy mô từ 0,6 đến 8 tỷ tham số. Cả 21 mô hình đều có thể bị can thiệp để trở nên sẵn sàng tạo nội dung có hại hơn, trong khi vẫn giữ phần lớn năng lực suy luận.
Nhóm tấn công jailbreak bằng fine tuning ẩn, đặc biệt là competing objectives, backdoor và style modulation, thường cho kết quả nghiêm trọng nhất.