Đây không phải là một lỗi cá biệt. Đó là màn trình diễn ấn tượng nhất về một lớp lỗ hổng chưa từng được ghi nhận trước đây mà Zenity gọi là "PleaseFix" — một họ lỗ hổng zero-click ảnh hưởng đến mọi trình duyệt tác tử (agentic browser) thương mại lớn mà các nhà nghiên cứu đã kiểm tra .
Cuộc tấn công bằng chứng minh khái niệm (proof-of-concept) của Zenity đã vượt qua hệ thống an toàn ba lớp của OpenAI bằng ba kỹ thuật :
Cùng một chuỗi khai thác cũng có thể được sử dụng để thực hiện các giao dịch mua hàng trái phép trên Amazon, cho thấy khả năng chiếm quyền kiểm soát tài khoản rộng hơn . Mã hóa đầu cuối của WhatsApp không bị phá vỡ — tác tử AI chỉ đơn giản là hoạt động trong phiên đã được xác thực của người dùng .
Zenity Labs đã tiết lộ PleaseFix như một họ lỗ hổng zero-click ảnh hưởng đến mọi trình duyệt tác tử thương mại lớn mà họ đã kiểm tra . Các lỗ hổng đã được trình diễn trên:
Tổng cộng, Zenity đã tìm thấy 20 lỗ hổng riêng biệt trên các nền tảng này . Vấn đề cốt lõi là kiến trúc: các trình duyệt tác tử được thiết kế để tự động đọc nội dung web, làm theo hướng dẫn và thực hiện các hành động thay mặt người dùng — và chính sự tự chủ đó là bề mặt tấn công . Kẻ tấn công chiếm quyền điều khiển các tác tử thông qua nội dung thông thường và các hành động dự kiến mà không cần phần mềm độc hại, không cần khai thác lỗ hổng và không cần người dùng nhấp chuột .
Các kết quả tấn công đã được trình diễn bao gồm :
Các nhà nghiên cứu bảo mật cho rằng cách tiếp cận hiện tại — đặt các bộ lọc an toàn và các rào chắn ở cấp độ lời nhắc (prompt-level guardrails) lên trên các tác tử AI có tính tự chủ cao — là không đủ về mặt cấu trúc . Nghiên cứu của Zenity đã chỉ ra rằng mọi trình duyệt tác tử đều có thể bị xâm phạm bằng cùng một kỹ thuật cơ bản: cung cấp cho tác tử nội dung độc hại mà nó được thiết kế để xử lý .
Vấn đề cốt lõi là các bộ lọc an toàn AI xác suất (vốn phỏng đoán liệu một hành động có an toàn hay không) không thể ngăn chặn một cách đáng tin cậy một kẻ tấn công có thể tạo ra các đầu vào mới lạ để lọt qua các bộ lọc đó. Các nhà nghiên cứu đang kêu gọi các rào cản bảo mật mang tính quyết định (deterministic security barriers) — các ràng buộc cứng, có thể thực thi đối với những gì một tác tử AI được phép làm, bất kể nó diễn giải các hướng dẫn như thế nào . Các ví dụ bao gồm:
Cho đến khi các biện pháp kiểm soát mang tính quyết định như vậy tồn tại, lớp lỗ hổng PleaseFix cho thấy rằng các trình duyệt tác tử có thể bị vũ khí hóa chống lại chính người dùng của chúng chỉ bằng cách xuất bản nội dung web có vẻ ngoài bình thường .