Việc Jacob Coxon rời Anthropic khiến một tranh luận vốn khá trừu tượng về an toàn AI trở nên gần gũi và cấp bách. Ông nói mình đã dành ba năm làm nghiên cứu tiền huấn luyện — giai đoạn dùng dữ liệu quy mô lớn để đào tạo nền tảng cho mô hình AI — tại OpenAI và Anthropic, rồi cáo buộc hai phòng thí nghiệm AI tiên phong đang “chạy thẳng tới siêu trí tuệ tự cải thiện” và “đánh cược mạng sống của chúng ta”. Bài đăng của ông đạt hơn 90 triệu lượt xem trong chưa đầy 24 giờ.
2
44
Coxon thực sự cảnh báo điều gì?
Trọng tâm là khái niệm tự cải thiện đệ quy (recursive self-improvement): AI được dùng để thúc đẩy công việc tạo ra những AI có năng lực hơn. Theo Anthropic, ở điểm cực hạn của xu hướng này, một hệ thống có thể tự chủ thiết kế và phát triển phiên bản kế nhiệm của chính nó. Công ty cũng nhấn mạnh rằng điều đó chưa xảy ra và không phải kết cục tất yếu.
25
Nỗi lo của Coxon là tốc độ gia tăng năng lực có thể vượt quá khả năng của phòng thí nghiệm trong việc đánh giá mô hình, phát hiện sai lệch, bảo đảm hành vi phù hợp với mục tiêu của con người và kiểm soát việc triển khai. Theo lập luận của ông, áp lực thương mại và cạnh tranh chiến lược có thể khiến các công ty tiến lên trước khi chứng minh được rằng họ vẫn kiểm soát được hệ thống.
2
10
13
Điểm phân biệt này rất quan trọng: sự việc không chứng minh AI tự cải thiện đệ quy đã tồn tại. Đây là tranh chấp về việc cần có bằng chứng an toàn nào trước khi các công ty theo đuổi hoặc phát hành những hệ thống có thể tăng tốc đáng kể hoạt động nghiên cứu AI.
Vì sao phản hồi của Evan Hubinger làm câu chuyện nóng hơn?
Evan Hubinger, người phụ trách khoa học căn chỉnh AI tại Anthropic, công khai ủng hộ mức độ nghiêm trọng của mối lo Coxon nêu ra. Các báo cáo cho biết ông cá nhân đánh giá xác suất AI giết toàn bộ loài người trong thập niên tới là trên 10%, đồng thời nói Anthropic chưa có kế hoạch giải quyết vấn đề căn chỉnh đối với siêu trí tuệ.
4
6
14
Con số này cần được hiểu thận trọng. Đó là nhận định cá nhân trong điều kiện bất định rất lớn, không phải dự báo đã được đo lường, kết luận của cả công ty hay bằng chứng rằng thảm họa có xác suất cao. Tuy vậy, việc một nhà nghiên cứu căn chỉnh cấp cao trong Anthropic đồng tình công khai đã tạo sức nặng đặc biệt cho thông điệp của Coxon: đây không chỉ là chỉ trích từ bên ngoài.
48
Tranh luận không còn xoay quanh một vụ từ chức
Sự việc đã gộp ba vấn đề thường được bàn riêng rẽ:
- Kiểm soát kỹ thuật: Liệu con người có thể nhận diện và ngăn chặn đáng tin cậy các hành vi nguy hiểm ở những AI có thể lập kế hoạch, dùng công cụ hoặc hỗ trợ cải thiện mô hình tương lai?
- Động lực thể chế: Liệu các công ty chịu áp lực cạnh tranh, đầu tư và an ninh quốc gia có thể tự quyết định khi nào nên tạm dừng hay triển khai?
- Tính chính danh trong chính sách: Ai nên đặt ra luật chơi cho các hệ thống có thể gây tác động rộng tới nền kinh tế và an ninh?
Anthropic đã công bố các nghiên cứu về kỹ thuật căn chỉnh, cũng như việc sử dụng các “nhà nghiên cứu” tự động để giảm thiểu một số lỗi căn chỉnh đã được xác định. Nhưng các kết quả này xử lý những dạng lỗi cụ thể trong điều kiện được đánh giá; tự thân chúng chưa chứng minh có một lời giải tổng quát để kiểm soát một siêu AI giả định.
21
22
23
Lời kêu gọi giảm tốc — nhưng chưa có một kế hoạch chung
Sau bài đăng của Coxon, CEO Anthropic Dario Amodei kêu gọi phát triển AI chậm hơn và thận trọng hơn; Coxon công khai hoan nghênh động thái này. Một số báo cáo cũng cho biết CEO OpenAI Sam Altman và Elon Musk ủng hộ cuộc thảo luận rộng hơn về việc giảm tốc.
43
45
50
Tuy nhiên, ủng hộ việc “đi chậm lại” không đồng nghĩa họ đã thống nhất một chương trình vận hành chung. Các thông tin hiện có không cho thấy những nhân vật này đã chấp nhận cùng một tiêu chuẩn phát hành, ngưỡng an toàn hay cơ chế tắt khẩn cấp áp dụng phổ quát.
Một “nút tắt” cũng không thể là toàn bộ hệ thống quản trị. Nó chỉ hiệu quả nếu con người vẫn kiểm soát được mô hình, hạ tầng tính toán, các kênh truy cập, công cụ được kết nối và tổ chức vận hành hệ thống. Câu hỏi quan trọng hơn là: trước khi một mô hình được trao năng lực mạnh hoặc quyền truy cập lớn, liệu đã có biện pháp bảo vệ, giám sát, ứng phó sự cố và đánh giá độc lập đủ đáng tin hay chưa?
Điều gì đã được xác nhận về rủi ro tác tử AI và an ninh mạng?
Các tuyên bố về tác tử AI thoát khỏi môi trường thử nghiệm, tiến hành tấn công mạng hoặc tìm cách cài mã độc đã thu hút nhiều chú ý. Nhưng không phải mọi tuyên bố đều có mức độ kiểm chứng như nhau.
Anthropic cho biết họ đã xây dựng hệ thống giám sát nhằm nhận diện và chặn các nỗ lực của mô hình nhằm dò tìm hoặc thoát khỏi môi trường thử nghiệm, hay bất ngờ truy cập internet. Công ty cũng nói đã rà soát nhật ký đánh giá để tìm hành vi thoát “sandbox” — môi trường cô lập phục vụ thử nghiệm. Điều này cho thấy các phòng thí nghiệm đang kiểm tra những rủi ro đó; nó không chứng minh một hệ thống AI đã thoát khỏi sự kiểm soát của con người trong thế giới thực.
26
Kết luận thận trọng là rủi ro từ tác tử AI và lạm dụng an ninh mạng là vấn đề an toàn, bảo mật đang được quan tâm. Còn các khẳng định nghiêm trọng nhất cần có tài liệu gốc hoặc xác nhận độc lập mạnh trước khi được coi là sự thật đã ngã ngũ.
Washington biến lời cảnh báo thành câu hỏi về luật lệ
Vụ từ chức diễn ra khi các nhà đàm phán tại Thượng viện Mỹ đang thảo luận dự luật có thể buộc các công ty AI phải chứng minh họ đã thực hiện những biện pháp phòng ngừa hợp lý để tránh gây hại.
52
Trước đó, Anthropic từng đề nghị Quốc hội Mỹ yêu cầu kiểm tra an toàn độc lập với các mô hình mạnh nhất, đồng thời không gạt bỏ quy định AI của từng bang nếu chưa có một khuôn khổ liên bang nghiêm ngặt thay thế nhằm xử lý rủi ro thảm họa.
53
Tổng thống Donald Trump lại cho rằng Mỹ đã có sẵn các công cụ pháp lý để quản lý và truy cứu trách nhiệm các công ty AI, qua đó hạ thấp nhu cầu về các hạn chế mới dành riêng cho AI.
51
Đây là chia rẽ chính sách nằm dưới các tiêu đề gây chú ý:
- Quan điểm phòng ngừa cho rằng cam kết tự nguyện là không đủ khi chỉ một số ít công ty đang xây dựng hệ thống có thể tạo hậu quả rất lớn và khó đảo ngược.
- Quan điểm ưu tiên đổi mới cho rằng quy định quá chặt có thể làm suy yếu vị thế dẫn đầu của Mỹ, trong khi luật hiện hành đã có thể xử lý hành vi gây hại.
Không bên nào xóa được sự đánh đổi cốt lõi: phát triển nhanh hơn có thể đem lại lợi ích kinh tế và chiến lược, nhưng cũng rút ngắn thời gian để đánh giá hệ thống và xây dựng giám sát đáng tin cậy.
Tiền cược tài chính khiến tự quản lý khó hơn
Thời điểm này làm lộ rõ mâu thuẫn trong hình ảnh công khai của Anthropic. Công ty định vị mình quanh an toàn AI, song vẫn hoạt động trong thị trường mô hình tiên phong đòi hỏi vốn khổng lồ và liên tục gây áp lực phải nâng cấp năng lực. Một báo cáo tháng 6 cho biết các nhà đầu tư tư nhân định giá Anthropic trên 965 tỷ USD.
54
Điều đó không chứng minh động lực thương mại đã quyết định bất kỳ lựa chọn an toàn cụ thể nào. Nhưng nó cho thấy vì sao các nhà phê bình nghi ngờ việc tự kiềm chế có thể bền vững khi phần thưởng cho người về đích đầu tiên là quá lớn. Ở chiều ngược lại, nhà đầu tư và khách hàng cũng đối mặt rủi ro: một sự cố an toàn nghiêm trọng, hành động quản lý hoặc mất lòng tin có thể làm tổn hại mạnh đến giá trị doanh nghiệp.
Ý nghĩa lâu dài của lời cảnh báo
Vụ Coxon rời Anthropic không chứng minh AI đã không thể kiểm soát, một mô hình đã thoát ra ngoài, hay nguy cơ tuyệt chủng đang cận kề. Những phát biểu của Coxon và Hubinger là cảnh báo về rủi ro tương lai còn bất định, không phải dự đoán đã được xác minh.
5
48
Nhưng sự việc đã thay đổi cách đặt câu hỏi. Tranh luận không còn chỉ là liệu AI tiên phong có thể trở nên mạnh hơn đến đâu. Câu hỏi là: các công ty đang chạy đua tạo ra nó có nên giữ quyền chủ yếu quyết định khi nào bằng chứng an toàn là đủ hay không?
Với nhà hoạch định chính sách, các phòng thí nghiệm và công chúng, tiêu chuẩn thực tế phải cao hơn một lời cam kết trấn an: cần ngưỡng năng lực rõ ràng, đánh giá thực chất trước triển khai, báo cáo sự cố đáng tin cậy và cơ chế giám sát không chỉ phụ thuộc vào chính những công ty được hưởng lợi nhiều nhất khi đi trước.
52
53