Con số hơn 10% là nhận định cá nhân của Evan Hubinger, không phải lập trường chính thức, đồng thuận nội bộ hay kết luận khoa học của Anthropic. Điều đáng chú ý hơn con số là thừa nhận Anthropic chưa có kế hoạch giải quyết bài toán căn chỉnh cho siêu trí tuệ nhân tạo và chưa cho thấy lộ trình rõ ràng để đạt được điều...
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Anthropic alignment science lead Evan Hubinger’s public statement that he personally believes there is more than a 10% chance AI co. Article summary: Hubinger’s statement chiefly exposed a sharp mismatch between frontier-AI labs’ public safety posture and the private-level uncertainty described by people closest to the work: a senior alignment lead said the field may . Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Phát biểu công khai của Evan Hubinger không chứng minh AI chắc chắn sẽ gây ra tuyệt chủng loài người. Điều ông nêu ra cụ thể hơn — và có ảnh hưởng lớn hơn trong tranh luận — là: với tư cách cá nhân, người dẫn dắt mảng khoa học căn chỉnh (alignment science) tại Anthropic ước tính xác suất đó vượt 10% trong 10 năm tới. Đồng thời, ông thừa nhận Anthropic chưa có kế hoạch giải quyết bài toán căn chỉnh đối với siêu trí tuệ nhân tạo, cũng chưa có lộ trình rõ ràng để làm được điều này. 1
2
Sự kết hợp ấy khiến mối lo đứng sau quyết định từ chức của Jacob Coxon — cựu nghiên cứu viên từng làm tại cả Anthropic lẫn OpenAI — trở nên cụ thể hơn. Lập luận của Coxon là các phòng thí nghiệm AI tiên phong đang tiến tới những hệ thống mạnh hơn rất nhiều, trong khi cách bảo đảm các hệ thống đó luôn hành xử theo ý định và lợi ích của con người vẫn chưa được kiểm chứng. 2
3
Con số “hơn 10%” là đánh giá riêng của Hubinger. Nó không được trình bày như xác suất chính thức của Anthropic, quan điểm đồng thuận của nhân viên công ty hay một dự báo khoa học đã được xác lập. 1
2
Điểm phân biệt này rất quan trọng. Một ước tính xác suất tự nó không giải thích cơ chế dẫn tới thảm họa, không xác định thời điểm, cũng không chứng minh thảm họa có khả năng xảy ra cao. Hubinger được cho là đã nói rủi ro từ các mô hình hiện có là thấp. Điều ông lo ngại là các hệ thống tương lai có năng lực vượt trội, gồm cả khả năng tự cải thiện đệ quy: AI dùng năng lực của mình để hỗ trợ tạo ra AI mạnh hơn. 2
10
Tuy vậy, phát biểu này đáng chú ý vì nó đến từ người đứng đầu công việc căn chỉnh tại một phòng thí nghiệm AI hàng đầu. Trọng tâm không chỉ là một con số gây sốc, mà là khoảng cách giữa đà tăng năng lực của mô hình và mức độ tin chắc rằng con người có thể giữ siêu trí tuệ nhân tạo trong tầm kiểm soát. 1
2
Coxon, người từng làm việc tại OpenAI và Anthropic, rời Anthropic với lập luận rằng cả hai công ty không hành động đủ trách nhiệm và đang chạy đua tới siêu trí tuệ có thể tự cải thiện. Hubinger công khai đồng tình với nhận định của Coxon rằng những người xây dựng các hệ thống này thực sự xem khả năng hậu quả ở cấp độ tuyệt chủng là có thể xảy ra. 2
3
Dĩ nhiên, điều đó không chứng minh mọi nhân viên đều có cùng quan điểm, cũng không biến lời kể của Coxon thành một đánh giá độc lập đã được xác minh về cả hai công ty. Nhưng nó khiến việc xem đây chỉ là phàn nàn đơn lẻ của một cựu nhân viên trở nên khó hơn. Một lãnh đạo căn chỉnh đang đương nhiệm đã xác nhận điểm cốt lõi: mối lo nghiêm túc bên trong có thể song hành với việc tiếp tục phát triển AI tuyến đầu. 1
2
Các phát biểu liên quan của Samuel Marks cũng cần được đọc với sự thận trọng tương tự. Một số bản tin dẫn lời ông nói các nhà phát triển AI tin công nghệ của họ có thể dẫn đến tuyệt chủng hoặc hậu quả nghiêm trọng tương đương; nhưng đây là góc nhìn của một người trong cuộc, không phải bằng chứng về ước tính rủi ro chung của cả công ty. 5
Vụ việc thường bị giản lược thành đối đầu giữa “phe tận thế AI” và “phe lạc quan về AI”. Câu hỏi hữu ích hơn là: những hàng rào bảo vệ nào phải được yêu cầu khi thiệt hại tiềm tàng có thể mang tính toàn cầu, không thể đảo ngược, còn xác suất và thời điểm lại rất bất định?
Phát biểu của Hubinger làm nổi bật một số điểm:
Đây là các vấn đề quản trị, không phải bằng chứng cho một thảm họa cận kề. Nhưng chúng cũng là loại vấn đề sẽ khó giải quyết hơn nhiều nếu hệ thống đã có năng lực nguy hiểm.
Một số bản tin cho biết Anthropic đã không gửi mô hình mới nhất tới Viện An toàn AI của Anh để thử nghiệm trước khi phát hành. Thông tin này cần được nhìn nhận thận trọng: các tường thuật hiện có mô tả đây là nội dung báo chí đưa tin, thay vì một kết luận công khai đã được Anthropic hoặc chính phủ Anh xác nhận. 10
Dù vậy, cáo buộc này minh họa vì sao các cam kết an toàn tự nguyện dễ gặp hoài nghi. Nếu chính các lãnh đạo an toàn của công ty thừa nhận vấn đề căn chỉnh chưa có lời giải, các quan sát viên bên ngoài có lý do để hỏi: thử nghiệm nào đã được thực hiện, ai đánh giá, kết quả nào được chia sẻ và ngưỡng năng lực nào sẽ kích hoạt biện pháp kiểm soát nghiêm ngặt hơn?
Kêu gọi “giảm tốc” không nhất thiết đồng nghĩa dừng vĩnh viễn mọi hoạt động nghiên cứu hay triển khai AI. Lập luận chính sách ở đây là cần các bước kiểm tra có tính bắt buộc trước khi hệ thống vượt qua những ngưỡng năng lực đặc biệt hệ trọng.
Các biện pháp có thể bao gồm:
Lý do rất trực diện: nếu xác suất chưa chắc chắn nhưng hậu quả có thể cực lớn, các biện pháp bảo vệ phải được chứng minh trước khi mất kiểm soát, không phải sau đó.
Bài đăng của Hubinger cho thấy một mâu thuẫn nằm ở trung tâm AI tiên phong: các nhà phát triển hàng đầu có thể công khai thừa nhận rủi ro dài hạn nghiêm trọng, đồng thời vẫn tiếp tục xây dựng những năng lực khiến các rủi ro ấy trở nên cấp thiết hơn. 1
2
Nó không giải quyết được câu hỏi xác suất AI gây thảm họa, và không nên bị coi là dự báo chính thức của Anthropic. Nhưng nó khiến tranh luận về căn chỉnh trở nên cụ thể hơn. Câu hỏi giờ đây không chỉ là AI tiên tiến có thể trở nên nguy hiểm hay không, mà là liệu doanh nghiệp và chính phủ có thể chứng minh — bằng bằng chứng độc lập, quy định có thể thực thi và phối hợp quốc tế — rằng họ đã sẵn sàng trước khi các hệ thống liên quan trở nên quá mạnh để quản trị an toàn. 1
10
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Con số hơn 10% là nhận định cá nhân của Evan Hubinger, không phải lập trường chính thức, đồng thuận nội bộ hay kết luận khoa học của Anthropic.
Con số hơn 10% là nhận định cá nhân của Evan Hubinger, không phải lập trường chính thức, đồng thuận nội bộ hay kết luận khoa học của Anthropic. Điều đáng chú ý hơn con số là thừa nhận Anthropic chưa có kế hoạch giải quyết bài toán căn chỉnh cho siêu trí tuệ nhân tạo và chưa cho thấy lộ trình rõ ràng để đạt được điều đó.
Tranh luận thực chất xoay quanh các biện pháp kiểm chứng độc lập, minh bạch doanh nghiệp và phối hợp quốc tế trước khi AI đạt những ngưỡng năng lực khó kiểm soát.