Kết quả quét của GPTZero trên 45 trích dẫn của báo cáo cho thấy một sự thất bại có hệ thống trong việc xác minh :
Nhìn chung, 89% tài liệu tham khảo bị gắn cờ là có vấn đề. Công cụ phát hiện AI của GPTZero còn thêm một lớp đáng lo ngại, đánh giá tài liệu 56% là "hỗn hợp," cho thấy nó có khả năng được tạo ra hoặc hỗ trợ nhiều bởi AI mà không qua kiểm duyệt đáng kể của con người .
Cuộc điều tra đã xác định bốn tổ chức nổi bật bị trích dẫn với các nghiên cứu tình huống giả mạo về việc triển khai "agentic AI" :
Trong mỗi trường hợp, các trích dẫn đều trỏ đến các báo cáo không tồn tại, tiêu đề của các ấn phẩm thực tế không liên quan đã bị diễn giải lại, hoặc các tham chiếu quá mơ hồ đến mức trở nên vô dụng .
Phân tích của GPTZero kết luận rằng các lỗi này có khả năng là kết quả của một công cụ nghiên cứu AI đã tuân thủ quá mức yêu cầu tìm các ví dụ thực tế về "agentic AI." Công cụ này đã tạo ra các nghiên cứu tình huống và trích dẫn nghe có vẻ hợp lý nhưng hoàn toàn hư cấu, sau đó lọt qua quy trình xem xét của KPMG mà không được sửa chữa .
Sự cố này nhấn mạnh một lỗ hổng nghiêm trọng: khi nghiên cứu do AI tạo ra được công bố mà không có sự xác minh nghiêm ngặt của con người, nó có thể tạo ra những thông tin vô nghĩa nhưng nghe có vẻ có thẩm quyền, gây tổn hại đến uy tín của tổ chức .
Báo cáo bị rút của KPMG không phải là một sự cố cá biệt. Nó nằm trong một xu hướng ngày càng mở rộng của các lỗi trích dẫn liên quan đến AI trên khắp các công ty tư vấn và luật lớn :
Những thất bại lặp đi lặp lại này làm nổi bật một rủi ro mang tính hệ thống: nếu không có sự giám sát chặt chẽ của con người, các công cụ nghiên cứu AI đang tạo ra bằng chứng trông có vẻ đáng tin cậy nhưng lại tan rã dưới sự xem xét kỹ lưỡng. Đối với một ngành công nghiệp bán niềm tin và chuyên môn, cái giá của việc sai lầm được tính bằng đô la, danh tiếng và sự chú ý của các cơ quan quản lý. Trường hợp của KPMG là một lời cảnh báo rõ ràng rằng "sự kiểm tra" trong quy trình làm việc có sự hỗ trợ của AI phải là thật, kỹ lưỡng và do con người thực hiện.