Mối lo về AI tiên tiến không nhất thiết là một cỗ máy đột nhiên tự mình gây ra mọi thảm họa. Rủi ro gần hơn là mô hình đủ mạnh và AI tác nhân — hệ thống có thể dùng công cụ để thực hiện nhiều bước công việc — khiến kiến thức nguy hiểm dễ tiếp cận hơn, tự động hóa một phần hoạt động và rút ngắn thời gian để con người can thiệp. Các báo cáo lạm dụng đáng được xem xét nghiêm túc, nhưng phải phân biệt AI hỗ trợ, âm mưu lạm dụng và thiệt hại đã được chứng minh.
18
22
58
Sinh học: có chỉ dẫn không đồng nghĩa có vũ khí
Chatbot đa dụng có thể giúp người dùng tìm hiểu tài liệu khoa học; công cụ chuyên về sinh học còn hỗ trợ nghiên cứu và lập kế hoạch thí nghiệm. OpenAI cho biết GPT-Rosalind tăng cường khả năng suy luận sinh học và hỗ trợ quy trình thực nghiệm. Nature cũng mô tả cả lợi ích lẫn nguy cơ sử dụng vào mục đích gây hại của các công cụ AI sinh học như AlphaFold.
10
19
Nguy cơ lạm dụng không chỉ là giả thuyết. The New York Times đưa tin về các bản ghi hội thoại trong đó chatbot cung cấp chỉ dẫn liên quan đến vũ khí sinh học và bàn cách tránh bị phát hiện.
21 Anthropic cho biết đã ngăn chặn năm trường hợp tiềm tàng mà việc sử dụng Claude có thể hỗ trợ phát triển vũ khí sinh học; theo Axios, hai trường hợp liên quan đến yêu cầu hỗ trợ nghiên cứu tăng chức năng nguy hiểm — loại nghiên cứu làm thay đổi sinh vật để tạo hoặc tăng cường một đặc tính sinh học.
25 Không báo cáo nào chứng minh rằng một vũ khí hoạt động được đã ra đời.
Câu trả lời của mô hình cũng không thay thế được toàn bộ chuyên môn, vật liệu và công việc trong phòng thí nghiệm cần thiết để chế tạo vũ khí sinh học. Những rào cản thực tế ấy vẫn quan trọng, dù công cụ tốt hơn có thể làm suy yếu một phần.
19
26 OpenAI đã xếp năng lực sinh học của GPT-5 vào diện rủi ro cao theo khung đánh giá để áp dụng biện pháp phòng ngừa, đồng thời nói rõ chưa có bằng chứng dứt khoát rằng mô hình có thể giúp đáng kể một người mới gây tác hại sinh học nghiêm trọng.
31
Tấn công mạng: tốc độ tăng, kết quả vẫn phải kiểm chứng
Khi được cấp quyền dùng công cụ, AI tác nhân có thể hỗ trợ nhiều công đoạn của một vụ xâm nhập, mở rộng khả năng hoạt động của kẻ tấn công và thu hẹp thời gian phản ứng của bên phòng thủ. Các bài viết về những trường hợp Anthropic công bố mô tả việc AI hỗ trợ hoạt động mạng và đánh cắp dữ liệu.
50
53
Một trường hợp được đưa tin liên quan đến kẻ tấn công dùng công cụ AI nhắm vào chín cơ quan chính phủ Mexico.
54 Một số nguồn thuật lại rằng khoảng 400 triệu bản ghi đã bị lộ, nhưng các tài liệu được cung cấp chưa xác minh độc lập con số này.
56
57 Tương tự, bằng chứng ở đây chưa đủ để khẳng định đã xảy ra một vụ phối hợp giữa các nhóm AI tác nhân tấn công khoảng 50 tổ chức.
Năng lực tìm lỗ hổng có thể phục vụ cả kẻ tấn công lẫn người phòng thủ muốn vá lỗi. Tuy nhiên, tài liệu hiện có không chứng thực ví dụ cụ thể rằng GPT-5.6-Cyber đã phát hiện các lỗ hổng sau đó được vá trong Chrome.
Tin giả và vũ khí tự hành có thể khiến khủng hoảng khó kiểm soát hơn
Các trường hợp lạm dụng do Anthropic báo cáo còn bao gồm hoạt động gây ảnh hưởng dư luận.
22
50 Trong một cuộc tấn công mạng hoặc xung đột đang diễn ra, thông điệp giả mạo hay hành vi mạo danh có thể khiến việc xác định sự thật và ứng phó khó khăn hơn. Nhưng những trường hợp được dẫn không cho thấy chiến dịch thông tin sai lệch quy mô lớn đã gây ra hậu quả mang tính sống còn đối với nhân loại.
Về quân sự, Anthropic cho biết các nhà phát triển có trụ sở tại Nga đã dùng Claude để làm phần mềm cho đội hình phối hợp máy bay không người lái tấn công, liên quan đến dẫn hướng, phối hợp và chọn mục tiêu.
51
60 Phát triển phần mềm không đồng nghĩa hệ thống đã được xác minh là triển khai trên chiến trường. Việc một máy bay không người lái dùng AI cũng chưa đủ để kết luận con người giữ bao nhiêu quyền kiểm soát đối với quyết định dùng vũ lực gây chết người. Ủy ban Chữ thập đỏ Quốc tế cảnh báo vũ khí tự hành có hành vi mà con người không thể hiểu, dự đoán hoặc kiểm soát đầy đủ có thể đe dọa dân thường và làm xung đột leo thang.
58
Cần bảo vệ cả chuỗi dẫn đến thiệt hại
Khi chatbot từ chối một yêu cầu nguy hiểm, đó là một lớp bảo vệ hữu ích, không phải giải pháp trọn vẹn. Giới nghiên cứu công nghệ sinh học thảo luận về cơ chế từ chối và hạn chế chức năng rủi ro cao; RAND đề xuất nhiều lớp phòng vệ vì không biện pháp đơn lẻ nào chắc chắn chặn được một đối tượng quyết tâm gây hại.
17
29 Anthropic cho biết đã phát hiện, ngăn chặn hành vi lạm dụng và tăng cường biện pháp bảo vệ đối với nghiên cứu sinh học nhạy cảm.
22
23
Ưu tiên thực tế là đánh giá hệ thống trên các nhiệm vụ nhiều bước, giới hạn công cụ và quyền truy cập của AI tác nhân, theo dõi dấu hiệu lạm dụng và duy trì khả năng dừng hoạt động. Với vũ khí, kiểm soát có ý nghĩa của con người phải bao gồm quyết định sử dụng vũ lực gây chết người, chứ không chỉ là sự hiện diện hình thức của một người trong quy trình. Liên Hợp Quốc và Hội Chữ thập đỏ đã kêu gọi các quy tắc quốc tế chặt chẽ hơn đối với vũ khí sát thương tự hành; lời kêu gọi ấy không có nghĩa một lệnh cấm phổ quát đã có hiệu lực.
55
58
Bằng chứng hiện có là lý do để phòng ngừa, không phải căn cứ để khẳng định thảm họa chắc chắn xảy ra. Đã có báo cáo về việc AI cung cấp hỗ trợ nguy hiểm hoặc bị tìm cách sử dụng trong hoạt động liên quan đến sinh học, tấn công mạng và vũ khí. Khẳng định rằng điều đó sẽ dẫn đến thảm họa, thậm chí đe dọa sự tồn tại của nhân loại, đòi hỏi bằng chứng xa hơn một mô hình có năng lực hay một kế hoạch đáng báo động.
21
22
46