Anthropic cho biết đã phát hiện và ngăn chặn các nỗ lực lạm dụng Claude Haiku, Sonnet và Opus từ tháng 12/2025 đến tháng 8/2026, thuộc 7 nhóm nguy hại, gồm vũ khí, giám sát, sinh học và sao chép mô hình. Thông điệp trọng tâm là AI có năng lực cao có thể giảm nhân lực, thời gian và chuyên môn cần thiết cho hành vi gâ...
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s 154-page September 10, 2026 threat-intelligence report reveal about adversaries’ eight-month misuse of its Claude Haiku. Article summary: Anthropic’s report documented attempted misuse—not verified successful deployment—of older Claude Haiku, Sonnet, and Opus models across seven harm areas from December 2025 through August 2026. Its core warning was that f. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
Anthropic công bố ngày 10/9/2026 rằng nhóm tình báo mối đe dọa của hãng đã phát hiện và phá vỡ các hoạt động tìm cách lạm dụng Claude trong giai đoạn 8 tháng, từ tháng 12/2025 đến tháng 8/2026. Các trường hợp liên quan đến Claude Haiku, Sonnet và Opus, trải rộng từ hoạt động mạng, thao túng thông tin, giám sát, lừa đảo và gian lận cho tới lạm dụng sinh học, phát triển vũ khí thông thường và sao chép mô hình trái phép. 16
Điểm cần phân biệt rất rõ: đây là các nỗ lực sử dụng AI để hỗ trợ hành vi nguy hại, không phải bằng chứng độc lập cho thấy những dự án vũ khí, giám sát hoặc sinh học bị cáo buộc đã được triển khai hay thành công ngoài thực tế. Anthropic cũng mô tả đây là các ví dụ điển hình được chọn lọc, không phải bức tranh đại diện cho cách Claude thường được sử dụng. 16
Cảnh báo lớn nhất của Anthropic là các mô hình AI tiên tiến có thể làm giảm lượng kiến thức chuyên môn, thời gian và nhân lực cần có để theo đuổi hoạt động gây hại. Trong các vụ việc được công bố, những đối tượng bị cáo buộc đã tìm sự hỗ trợ cho nhiều công đoạn, từ nghiên cứu, lập trình đến chuẩn bị tài liệu nhắm mục tiêu và phân tích vận hành. 1
16
Những cáo buộc nghiêm trọng nhất gồm nỗ lực dùng Claude phục vụ công việc liên quan đến vũ khí thông thường và giám sát. Các bài tường thuật về báo cáo đề cập đến phần mềm cho máy bay không người lái tấn công một chiều tự hành, hệ thống dẫn đường tên lửa và ứng dụng quân sự có liên hệ với các tác nhân từ Nga, Iran, Trung Quốc và Yemen. 1
Tài liệu vụ việc còn đề cập đến nỗ lực bị cáo buộc nhằm nhận diện và nhắm mục tiêu người Duy Ngô Nhĩ qua WhatsApp và Telegram, cũng như một hệ thống giám sát viễn thông quy mô lớn ở Mali. Những ví dụ này cho thấy rủi ro không chỉ nằm ở việc AI sinh mã nguồn: mô hình còn có thể được khai thác cho nghiên cứu, phân loại, phân tích và soạn thảo tài liệu phục vụ hoạt động. 1
16
Anthropic xác định 5 vụ việc lạm dụng liên quan đến sinh học. Theo các bài tường thuật về báo cáo, một vụ có liên quan đến nỗ lực làm tăng khả năng lây truyền của một loại virus do muỗi truyền. 1
Công ty cũng cho biết một số người dùng đã tìm đến các hệ thống AI cạnh tranh sau khi Claude từ chối những yêu cầu nhạy cảm. Điều này không chứng minh các nỗ lực đó đã thành công ở nơi khác, nhưng nêu bật giới hạn của biện pháp kiểm soát tại từng nhà cung cấp: một lần từ chối có thể làm gián đoạn hành vi trên một dịch vụ, song không nhất thiết chấm dứt ý định của đối tượng. 1
Một phần riêng của báo cáo nói về sao chép mô hình trái phép (illicit model distillation) — sử dụng đầu ra của mô hình mạnh hơn để hỗ trợ huấn luyện hệ thống khác. Anthropic quy các chiến dịch này cho 7 phòng thí nghiệm có trụ sở tại Trung Quốc, trong đó nêu tên Alibaba, Moonshot và DeepSeek; các bên được cho là dùng nhiều tài khoản cùng kỹ thuật chuyển tiếp câu lệnh để lấy đầu ra hoặc lập luận hữu ích từ mô hình. 1
Khác với giám sát hay phát triển vũ khí, đây là một dạng lạm dụng mang tính cạnh tranh công nghệ. Tuy vậy, nó tạo ra mối lo chiến lược cho các hãng AI: quyền truy cập mô hình có thể bị khai thác để tái tạo năng lực, và có thể né chi phí tự phát triển năng lực đó từ đầu.
Anthropic cho biết các trường hợp lạm dụng được báo cáo liên quan đến Claude Haiku, Sonnet và Opus. Hãng nói không có vụ nào liên quan đến các dòng mô hình mới hơn là Fable hoặc Mythos, ngoại trừ một trường hợp sao chép mô hình. 12
16
Ngoại lệ này rất quan trọng vì nó điều chỉnh nhận định quá rộng rằng Fable và Mythos hoàn toàn không xuất hiện trong báo cáo. Cách diễn đạt chính xác hơn là: hai dòng này không được dùng trong các vụ việc lạm dụng được công bố, trừ ngoại lệ về sao chép mô hình. 12
Anthropic cho biết họ đã phá vỡ các hoạt động, cấm những tài khoản liên quan, tăng cường phòng vệ và, khi phù hợp, chia sẻ thông tin với cơ quan chức năng cùng các đối tác trong ngành. 16
Tuy nhiên, đây vẫn là báo cáo do chính công ty lập dựa trên hoạt động quan sát được trên nền tảng của mình. Nó là bằng chứng đáng chú ý về những gì Anthropic phát hiện và xử lý, nhưng không nên được hiểu là xác nhận độc lập rằng mọi đối tượng bị cáo buộc đều hoàn thành mục tiêu của họ. Bản thân công ty cũng đóng khung tài liệu này như tập hợp các vụ việc đáng chú ý, thay vì khảo sát đại diện về mọi hành vi lạm dụng. 16
Hai ngày sau khi báo cáo được công bố, CEO Anthropic Dario Amodei đăng bài We Must Pace the Frontier (tạm dịch: Cần điều tiết nhịp độ phát triển AI tiên phong). Ông lập luận rằng các công ty AI nên chủ động làm chậm tốc độ tăng năng lực của các mô hình tiên phong, trong khi vẫn duy trì tiến bộ kỹ thuật, để nghiên cứu về căn chỉnh, biện pháp bảo vệ và hoạt động kiểm chứng có thời gian bắt kịp. 25
Đề xuất của Amodei không phải lời kêu gọi ngừng huấn luyện mô hình. Cam kết cụ thể đầu tiên là Anthropic sẽ cung cấp cho các đơn vị đánh giá bên thứ ba quyền truy cập thường trực ở cấp độ tương đương nhân viên, để họ có thể đánh giá thực hành an toàn, báo cáo sự cố và kiểm tra mức độ căn chỉnh trong quá trình huấn luyện. 18
25
Kế hoạch ba bước rộng hơn của ông gồm giám sát ở cấp công ty, phối hợp giữa các doanh nghiệp tại những nước dân chủ, và cuối cùng là phối hợp quốc tế rộng hơn. 23
25
Báo cáo xác lập rằng Anthropic nói họ đã phát hiện và ngăn chặn các nỗ lực sử dụng những mẫu Claude cũ hơn cho mục đích nguy hại trong giai đoạn nêu trên, thuộc 7 nhóm rủi ro. Nó cũng đưa ra cơ sở cụ thể cho quan điểm của công ty rằng biện pháp an toàn phải tiến hóa song hành với năng lực mô hình. 16
Nhưng các thông tin hiện có không xác lập rằng báo cáo này trực tiếp dẫn đến một hành động cụ thể của Quốc hội Mỹ, việc kết thúc kỳ nghỉ của Hạ viện Mỹ, hay một lệnh cấm lập pháp xác định nhắm vào “siêu trí tuệ”. Áp lực chính trị đối với giám sát an toàn AI là có thật, và Amodei cho rằng chính phủ cần giúp giữ cân bằng giữa năng lực và an toàn; song các tuyên bố nhân quả cụ thể đó cần thêm bằng chứng ngoài những nguồn đang có. 25
27
Kết luận thực tế, dù ít kịch tính hơn, lại quan trọng hơn: ngăn lạm dụng AI không chỉ là để mô hình từ chối câu lệnh nguy hiểm. Việc này cần theo dõi lạm dụng có tổ chức, ứng phó với hành vi né tránh ở cấp tài khoản và sao chép mô hình, chia sẻ tình báo mối đe dọa, đồng thời bảo đảm việc đánh giá an toàn đáng tin cậy khi năng lực AI tiếp tục tăng. 16
25
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Anthropic cho biết đã phát hiện và ngăn chặn các nỗ lực lạm dụng Claude Haiku, Sonnet và Opus từ tháng 12/2025 đến tháng 8/2026, thuộc 7 nhóm nguy hại, gồm vũ khí, giám sát, sinh học và sao chép mô hình.
Anthropic cho biết đã phát hiện và ngăn chặn các nỗ lực lạm dụng Claude Haiku, Sonnet và Opus từ tháng 12/2025 đến tháng 8/2026, thuộc 7 nhóm nguy hại, gồm vũ khí, giám sát, sinh học và sao chép mô hình. Thông điệp trọng tâm là AI có năng lực cao có thể giảm nhân lực, thời gian và chuyên môn cần thiết cho hành vi gây hại; việc chặn tài khoản hay từ chối yêu cầu có thể chỉ khiến đối tượng tìm sang dịch vụ khác.
Sau báo cáo, CEO Dario Amodei đề xuất “điều tiết nhịp độ ở tuyến đầu”: làm chậm tốc độ nâng năng lực mô hình để công tác an toàn và đánh giá độc lập theo kịp, chứ không dừng phát triển AI.