TamperBench phát hiện cả 21 mô hình ngôn ngữ open weight được thử nghiệm, từ 0,6 đến 8 tỷ tham số, đều dễ bị ít nhất một trong chín mối đe dọa can thiệp mà không làm giảm quá 10% năng lực suy luận MMLU Pro. Các cuộc tấn công jailbreak tuning che giấu, đặc biệt là biến thể competing objectives, backdoor và style modu...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Kết luận trung tâm của TamperBench khá đáng lo ngại: không mô hình ngôn ngữ open-weight nào trong 21 mô hình được đánh giá có lớp bảo vệ đủ bền để chống lại toàn bộ các hình thức can thiệp đã thử nghiệm. Các mô hình, gồm những dòng như Llama, Qwen3 và Mistral, có quy mô khoảng 0,6–8 tỷ tham số và bao gồm cả các phiên bản được bổ sung cơ chế phòng vệ. Với mỗi mô hình, ít nhất một cuộc tấn công có thể khiến hệ thống dễ tạo ra nội dung gây hại hơn mà vẫn giữ lại phần lớn năng lực tổng quát. 256
Điểm đáng chú ý là nghiên cứu không chỉ hỏi liệu mô hình có thể bị bẻ khóa bằng một câu lệnh hay không. TamperBench kiểm tra điều gì xảy ra khi người dùng có quyền can thiệp trực tiếp vào trọng số hoặc các biểu diễn bên trong mô hình.
TamperBench được xây dựng để đo khả năng chống can thiệp (tamper resistance), khác với các bài kiểm tra bẻ khóa thông thường dựa trên lời nhắc. Khung đánh giá kết hợp các cuộc tấn công tinh chỉnh trong không gian trọng số với những phương pháp thao túng biểu diễn tiềm ẩn, sau đó đo đồng thời hành vi an toàn và năng lực còn lại của mô hình. Nhóm nghiên cứu cũng tiến hành tìm kiếm có hệ thống các siêu tham số cho từng cặp mô hình–tấn công, thay vì chỉ dựa vào một cấu hình duy nhất. 2
Chín nhóm phương pháp được đánh giá bao gồm:
Tiêu chí then chốt không đơn giản là làm cho mô hình trở nên thiếu an toàn. Các nhà nghiên cứu tìm những cuộc tấn công có thể làm tăng mức độ phản hồi gây hại, đồng thời giữ mức suy giảm độ chính xác suy luận trên MMLU-Pro trong phạm vi không quá 10% so với mô hình chưa bị can thiệp. MMLU-Pro là một bộ đánh giá kiến thức và suy luận đa lĩnh vực, được thiết kế khó hơn phiên bản MMLU thông thường. 2
Những kết quả nghiêm trọng nhất nhìn chung đến từ jailbreak-tuning. Các biến thể được báo cáo gồm competing-objectives, backdoor và style-modulation. Đáng chú ý, những phương pháp này có thể sử dụng phần lớn dữ liệu huấn luyện lành tính, chỉ kèm một thành phần gây hại nhỏ. Vì vậy, chúng giống một nỗ lực có mục tiêu nhằm thay đổi hành vi an toàn nhưng vẫn bảo toàn tính hữu dụng hơn là việc huấn luyện lại mô hình một cách thô bạo để tạo nội dung nguy hiểm. 26
Kết quả rộng hơn của bài nghiên cứu cho thấy năng lực và mức độ an toàn có thể bị tách rời theo hướng bất lợi: việc can thiệp làm suy yếu hành vi từ chối nhưng không nhất thiết phá hủy tương ứng năng lực suy luận. Do đó, một mô hình vẫn có thể đạt kết quả khá tốt trên các bài kiểm tra thông thường, đồng thời trở nên rủi ro hơn đáng kể khi triển khai.
TamperBench đánh giá 21 mô hình open-weight trong dải 0,6–8 tỷ tham số, bao gồm các dòng như Llama, Qwen3 và Mistral. Bằng chứng được cung cấp cho phép kết luận ở cấp độ toàn bộ benchmark rằng mọi mô hình được thử nghiệm đều dễ bị ít nhất một phương pháp tấn công đánh bại. 56
Tuy nhiên, các nguồn hiện có không nêu con số chính xác về mức tăng phản hồi gây hại của Llama-3-8B-Instruct hoặc Qwen3-8B-Instruct trong điều kiện suy giảm MMLU-Pro không quá 10%. Vì vậy, không nên suy ra các tỷ lệ cụ thể từ kết quả tổng thể. Kết luận có thể bảo vệ được là mang tính so sánh và định tính: các cuộc tấn công có thể làm hành vi gây hại tăng đáng kể trong khi vẫn giữ lại phần lớn năng lực suy luận, nhưng dữ liệu được cung cấp chưa đủ để xác lập phần trăm chính xác cho từng mô hình nói trên.
Nghiên cứu cũng cho thấy các biến thể nền tảng và các biến thể đã qua hậu huấn luyện không tuân theo một quy luật duy nhất về khả năng chống can thiệp. Mức độ chống chịu tương đối có thể thay đổi theo từng dòng mô hình; Llama 3 và Qwen3 thậm chí được ghi nhận có xu hướng trái ngược nhau. 6
Chưa. Cả năm mô hình được bổ sung cơ chế phòng vệ, trong đó có các biến thể ReFAT và Circuit Breaking, cũng dễ bị tổn thương trước nhóm tấn công của benchmark. Những cơ chế này giúp tăng khả năng chống chịu trong một số tình huống, nhưng không ngăn chặn đáng tin cậy việc loại bỏ hành vi an toàn trước mọi mối đe dọa được thử nghiệm. 25
Bài nghiên cứu xác định Triplet là một trong những cơ chế có kết quả bền vững hơn và bảo toàn năng lực tốt hơn trong các phép so sánh được thực hiện. Đây là tín hiệu tích cực cho hướng nghiên cứu, không phải sự bảo đảm tuyệt đối: kết luận chính vẫn là chưa có cơ chế phòng vệ nào được thử nghiệm loại bỏ hoàn toàn vấn đề can thiệp trên toàn bộ nhóm kiểm tra. 6
Khi trọng số được công khai, mô hình có thể bị sao chép, tinh chỉnh và phân phối lại mà nhà phát triển ban đầu không còn kiểm soát đầy đủ các lớp bảo vệ ở khâu triển khai. Vì thế, một cơ chế an toàn hoạt động tốt trong đợt đánh giá trước khi phát hành chưa chắc còn bền vững sau khi người dùng có thể sửa đổi trọng số. 25
Phát hiện này không có nghĩa mô hình open-weight không có giá trị. Việc mở mô hình có thể hỗ trợ nghiên cứu, kiểm toán và trách nhiệm giải trình. Bài học hẹp hơn là không nên xem việc vượt qua các bài đánh giá an toàn trước phát hành như bằng chứng cho thấy mô hình sẽ tiếp tục an toàn sau khi được tự do sửa đổi. 5
Các mô hình thương mại đóng hoặc được cung cấp qua API cũng phải đối mặt với những câu hỏi liên quan đến tinh chỉnh và an toàn sau huấn luyện. Tuy nhiên, nhà cung cấp vẫn giữ nhiều quyền kiểm soát hơn đối với quy trình huấn luyện và môi trường triển khai. Điều đó cho phép họ áp dụng biện pháp bảo vệ trong hoặc sau quá trình tùy biến—những lựa chọn khó thực thi hơn nhiều khi trọng số đã được phát hành rộng rãi. 25
Rủi ro mà TamperBench nêu bật không chỉ là một cá nhân tìm được một câu lệnh khiến mô hình từ chối sai. Nếu việc can thiệp vẫn giữ lại năng lực hữu ích, một mô hình đã bị sửa đổi về lý thuyết có thể được triển khai lặp đi lặp lại cho các hoạt động gây hại như phát tán thông tin sai lệch trên diện rộng, lừa đảo hoặc cung cấp hướng dẫn kỹ thuật nguy hiểm. Đây là những hệ quả được các nhà nghiên cứu chỉ ra từ việc gỡ bỏ lớp bảo vệ mà vẫn duy trì năng lực, không phải các hoạt động lạm dụng được benchmark trực tiếp đo lường. 5
Với các tổ chức đang lựa chọn mô hình, cần phân biệt hai lớp kiểm tra:
Các nhà nghiên cứu kêu gọi phát triển phương pháp chống can thiệp mạnh hơn, áp dụng các đánh giá đối kháng tiêu chuẩn hóa như TamperBench trước khi phát hành, đồng thời xây dựng quy trình đánh giá và mua sắm AI dựa trên bằng chứng hơn. Họ đặc biệt nhấn mạnh các lĩnh vực có tác động lớn như y tế, phát hiện gian lận, giáo dục và dịch vụ công—nơi hành vi của mô hình sau khi phát hành có thể quan trọng không kém hồ sơ an toàn ban đầu. 25
TamperBench không chứng minh rằng mọi mô hình open-weight chắc chắn sẽ bị lạm dụng. Nghiên cứu cho thấy trong 21 mô hình được thử nghiệm, các lớp bảo vệ an toàn không phải là một sự bảo đảm đáng tin cậy khi kẻ tấn công có thể can thiệp vào mô hình.
Jailbreak-tuning che giấu thường là nhóm tấn công mạnh nhất; các cơ chế phòng vệ bổ sung có ích trong một số trường hợp nhưng chưa khép được khoảng trống; và dữ liệu hiện có không cho phép đưa ra tỷ lệ tăng mức độ gây hại chính xác cho từng mô hình Llama hoặc Qwen3.
Với các mô hình open-weight, đánh giá an toàn cần kiểm tra không chỉ những gì mô hình làm được lúc ra mắt, mà còn cả mức độ hành vi an toàn của nó có thể tồn tại sau khi bị sửa đổi.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
TamperBench phát hiện cả 21 mô hình ngôn ngữ open weight được thử nghiệm, từ 0,6 đến 8 tỷ tham số, đều dễ bị ít nhất một trong chín mối đe dọa can thiệp mà không làm giảm quá 10% năng lực suy luận MMLU Pro.
TamperBench phát hiện cả 21 mô hình ngôn ngữ open weight được thử nghiệm, từ 0,6 đến 8 tỷ tham số, đều dễ bị ít nhất một trong chín mối đe dọa can thiệp mà không làm giảm quá 10% năng lực suy luận MMLU Pro. Các cuộc tấn công jailbreak tuning che giấu, đặc biệt là biến thể competing objectives, backdoor và style modulation, thường cho kết quả nghiêm trọng nhất.
Năm mô hình được bổ sung cơ chế phòng vệ, trong đó có các biến thể ReFAT và Circuit Breaking, tăng khả năng chống chịu ở một số tình huống nhưng không bảo đảm ngăn chặn việc gỡ bỏ lớp bảo vệ an toàn.