Các chuyên gia bảo mật đang chỉ trích Claude Fable 5 vì các hàng rào bảo vệ hung hăng đến mức chặn cả những truy vấn vô hại về an ninh mạng và âm thầm chuyển sang một mô hình yếu hơn. Tâm điểm của phản ứng dữ dội là cơ chế định tuyến các yêu cầu về an ninh mạng, sinh học, hóa học sang Claude Opus 4.8 cũ hơn, một sự...

Create a landscape editorial hero image for this Studio Global article: What is causing cybersecurity professionals to criticize Anthropic's Claude Fable 5, and how does the model's safety guardrail system work,. Article summary: Anthropic released Claude Fable 5 on June 9, 2026 as a guardrailed public version of its powerful Mythos-class model, alongside an unrestricted twin, Claude Mythos 5, available only to vetted partners through Project Gla. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Claude Fable 5: Why Anthropic Put Its Most Powerful AI Behind Guardrails. * Anthropic released Claude Fable 5 on 9 June 2026. It is the first publicly available Mythos-class mode" source context "Claude Fable 5: Anthropic Locks Down Cyber and Bio" Reference image 2: visual subject "# Anthropic says these topics
Anthropic đã phát hành Claude Fable 5 vào ngày 9 tháng 6 năm 2026, với tư cách là mô hình AI mạnh mẽ nhất từng được công bố rộng rãi của họ, nhưng màn ra mắt đã vấp phải phản ứng dữ dội từ cộng đồng an ninh mạng. Trong khi công ty định hình mô hình này như một bản phát hành 'có trách nhiệm' từ dòng công nghệ Mythos, các chuyên gia bảo mật lại cho rằng các hàng rào an toàn được tích hợp sẵn đã trở nên quá hung hăng, khiến mô hình trở nên vô dụng trên thực tế đối với các nghiên cứu hợp pháp .
Cốt lõi của sự chỉ trích không nằm ở việc các tính năng an toàn có tồn tại, mà nằm ở cách chúng được triển khai: một cách âm thầm, trên diện rộng và với một cơ chế dự phòng thay thế một AI kém cỏi hơn mà người dùng không hề hay biết. Dưới đây là phân tích chi tiết về cuộc tranh cãi và công nghệ đằng sau nó.
Lời phàn nàn điển hình từ các nhà nghiên cứu là độ nhạy cực đoan của các bộ phân loại nội dung trên Fable 5. Valentina “Chompie” Palmiotti, một nhà nghiên cứu bảo mật nổi tiếng tại IBM X-Force, nói với TechCrunch rằng mô hình này từ chối "bất kỳ yêu cầu nào có thể liên quan gián tiếp đến mạng—ngay cả những tác vụ vô hại như đọc một bài blog" . Điều này có nghĩa là các yêu cầu giúp đỡ để hiểu các khái niệm an ninh mạng cơ bản cũng bị gắn cờ, chứ không riêng gì những yêu cầu nguy hiểm.
Việc gắn cờ quá mức này có tác động tiêu cực trực tiếp đến tính hữu ích của mô hình. Khi một truy vấn bị gắn cờ, người dùng sẽ nhận được một phản hồi đã bị 'pha loãng' từ một AI đời cũ hơn, một sự chuyển đổi mà họ không hề được thông báo rõ ràng . Vấn đề càng trở nên nghiêm trọng bởi cách thức công bố thông tin. Những người chỉ trích cho rằng hành vi này chỉ được tiết lộ sâu bên trong một thẻ hệ thống (system card) dài 319 trang, dẫn đến cáo buộc Anthropic đã thực hiện hành vi "phá hoại bí mật" đối với năng lực của mô hình cho một số nhóm người dùng nhất định
.
Các hạn chế không chỉ giới hạn ở an ninh mạng. Các hàng rào bảo vệ cũng nhắm vào các truy vấn liên quan đến sinh học, hóa học và quan trọng là hành vi 'chưng cất' mô hình AI. Điểm cuối cùng này đã thổi bùng một làn sóng chỉ trích riêng biệt, với một số nhà phát triển cáo buộc Anthropic sử dụng 'an toàn' như một cái cớ cho hành vi phản cạnh tranh, nhằm ngăn chặn các nhà phát triển AI khác sử dụng đầu ra của Fable 5 cho việc huấn luyện .
Hệ thống an toàn của Anthropic trong Fable 5 không chỉ là một cơ chế từ chối đơn giản. Nó là một hệ thống định tuyến được thiết kế để thất bại một cách âm thầm . Kiến trúc này hoạt động theo ba bước:
Anthropic tuyên bố rằng các bộ phân loại này kích hoạt trung bình trong chưa đến 5% tổng số phiên làm việc . Công ty đã công khai thừa nhận vấn đề gắn cờ quá mức. Người phát ngôn của công ty nói với Business Insider rằng các biện pháp an toàn "có thể gắn cờ các yêu cầu an toàn, trung lập hoặc lành tính", nhưng biện minh đó là sự đánh đổi cần thiết để công khai phát hành một mô hình có năng lực cơ bản mạnh mẽ như vậy
.
Quan điểm của Anthropic là các hàng rào bảo vệ 'bảo thủ' này là một lựa chọn có chủ ý và có trách nhiệm, không phải là một lỗi. Công ty lập luận rằng mô hình dòng Mythos cơ bản quá thành thạo trong các tác vụ như tìm kiếm và khai thác lỗ hổng phần mềm đến mức một bản phát hành công khai không hạn chế sẽ tạo ra nguy cơ bị lạm dụng thảm khốc không thể chấp nhận được .
Theo quan điểm của họ, các hàng rào bảo vệ là một sự thỏa hiệp trong thiết kế—một cách để cung cấp cho công chúng quyền truy cập vào một mô hình lập luận, viết mã và viết lách tiên tiến nhất, đồng thời 'đóng hộp' các khả năng nguy hiểm tiềm tàng nhất của nó . Họ định hình việc gắn cờ quá mức là cái giá tạm thời cho việc phát hành nhanh chóng một mô hình mạnh mẽ một cách "an toàn và nhanh chóng", cùng với cam kết sẽ tinh chỉnh các bộ phân loại theo thời gian
.
Không thể hiểu đầy đủ về sự ra mắt của Claude Fable 5 một cách riêng lẻ. Nó là một nửa của chiến lược triển khai hai cấp, đang trở thành một tiêu chuẩn công nghiệp mới cho các mô hình AI tiên phong .
Cùng ngày Fable 5 được phát hành, Anthropic cũng công bố Claude Mythos 5. Cả hai mô hình đều chia sẻ cùng một kiến trúc và trọng số cơ bản—chúng có cùng một "bộ não". Điểm khác biệt duy nhất nằm ở cấu hình an toàn. Mythos 5 đã loại bỏ các bộ phân loại trong các lĩnh vực nhạy cảm, mang lại cho nó toàn bộ khả năng không hạn chế .
Tuy nhiên, Mythos 5 không dành cho công chúng. Nó bị giới hạn cho một nhóm nhỏ các đối tác đã được kiểm tra, bao gồm các cơ quan chính phủ và các nhà vận hành cơ sở hạ tầng quan trọng, thông qua một sáng kiến có tên là Dự án Glasswing . Chương trình do chính phủ Hoa Kỳ hậu thuẫn này ban đầu được khởi động với 12 đối tác sáng lập, bao gồm những gã khổng lồ công nghệ như AWS, Google và Microsoft, để cho phép "những người phòng thủ mạng" sử dụng AI để tìm và vá các lỗ hổng phần mềm trên quy mô lớn
. Với bản phát hành Mythos 5, quyền truy cập đã được mở rộng lên khoảng 40 tổ chức
.
Bảng bên dưới minh họa sự khác biệt cơ bản:
Sự phân tách Fable/Mythos của Anthropic là ví dụ rõ ràng nhất về cái có thể được gọi là triển khai AI phân cấp theo năng lực. Trong mô hình mới này, một AI tiên phong duy nhất không chỉ là một sản phẩm. Toàn bộ sức mạnh của nó là một đặc quyền, không phải là điều đương nhiên và các hàng rào an toàn chính là cơ chế tạo ra sự khác biệt hóa sản phẩm .
Mô hình này không phải là duy nhất ở Anthropic. Các công ty AI hàng đầu khác, bao gồm OpenAI, cũng đã áp dụng các cách tiếp cận tương tự bằng cách cung cấp các phiên bản truy cập hạn chế của các mô hình tiên tiến nhất cho các đối tác an ninh quốc gia và nghiên cứu . Sự ra mắt của Fable/Mythos kết tinh một tương lai nơi các khả năng AI mạnh mẽ nhất được kiểm soát không phải bởi công nghệ, mà bởi tình trạng được kiểm duyệt, với các giao thức an toàn đóng vai trò như một cơ chế kiểm soát truy cập, một cách tiếp cận đang làm dấy lên một cuộc tranh luận rộng lớn hơn về sự tập trung hóa, công bằng và ý nghĩa thực sự của an toàn AI "công cộng".
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Các chuyên gia bảo mật đang chỉ trích Claude Fable 5 vì các hàng rào bảo vệ hung hăng đến mức chặn cả những truy vấn vô hại về an ninh mạng và âm thầm chuyển sang một mô hình yếu hơn.
Các chuyên gia bảo mật đang chỉ trích Claude Fable 5 vì các hàng rào bảo vệ hung hăng đến mức chặn cả những truy vấn vô hại về an ninh mạng và âm thầm chuyển sang một mô hình yếu hơn. Tâm điểm của phản ứng dữ dội là cơ chế định tuyến các yêu cầu về an ninh mạng, sinh học, hóa học sang Claude Opus 4.8 cũ hơn, một sự thật mà các nhà phê bình cho rằng đã bị chôn vùi trong tài liệu dài 319 trang.
Việc ra mắt mô hình công khai bị hạn chế (Fable 5) cùng với mô hình không hạn chế dành cho đối tác (Mythos 5) báo hiệu một tiêu chuẩn mới trong việc phân cấp sức mạnh AI, làm dấy lên câu hỏi về sự công bằng và minh bạch.