จากรายการอ้างอิงทั้งหมด 45 รายการ GPTZero ระบุว่า
โดยรวมแล้ว GPTZero ทำเครื่องหมายว่า 89% ของบรรณานุกรมมีข้อบกพร่อง นอกจากนี้ การสแกนเพื่อตรวจจับเนื้อหาที่สร้างโดย AI ให้ผลเป็น “ผสม” 56% ซึ่งสื่อว่าเอกสารอาจสร้างด้วย AI หรือใช้ AI ช่วยอย่างมาก แต่ไม่ผ่านการตรวจสอบโดยมนุษย์อย่างเพียงพอ
รายงานของ KPMG ยกองค์กรชื่อดัง 4 แห่งมาเป็นตัวอย่างการนำ agentic AI ไปใช้งาน แต่ GPTZero ไม่พบหลักฐานที่ยืนยันกรณีศึกษาเหล่านี้ได้
ในแต่ละกรณี รายการอ้างอิงนำไปสู่รายงานที่ไม่มีอยู่จริง ชื่อเรื่องที่ดัดแปลงจากสิ่งพิมพ์จริงแต่ไม่เกี่ยวข้อง หรือข้อมูลที่กว้างและคลุมเครือจนแทบไม่มีประโยชน์ในการตรวจสอบ
บทวิเคราะห์ของ GPTZero สรุปว่า ความผิดพลาดน่าจะเกิดจากเครื่องมือวิจัย AI ที่พยายามทำตามคำสั่งค้นหาตัวอย่างการใช้ “agentic AI” ในโลกจริงมากเกินไป เครื่องมือจึงสร้างกรณีศึกษาที่ฟังดูน่าเชื่อถือ พร้อมแหล่งอ้างอิงที่แต่งขึ้น แต่ข้อมูลเหล่านี้กลับหลุดผ่านกระบวนการตรวจทานของ KPMG
กรณีนี้ชี้ให้เห็นจุดเปราะบางสำคัญของการทำงานร่วมกับ AI นั่นคือ เนื้อหาที่เขียนด้วยน้ำเสียงมั่นใจและมีรูปแบบเหมือนงานวิจัย อาจเป็นเรื่องที่ไม่จริงได้ หากไม่มีมนุษย์ตรวจสอบเอกสารต้นทางทีละรายการก่อนเผยแพร่
ปัญหาของ KPMG เกิดขึ้นท่ามกลางเหตุการณ์ลักษณะเดียวกันในอุตสาหกรรมบริการวิชาชีพ ซึ่งมีทั้งบริษัทที่ปรึกษา สำนักงานบัญชี และสำนักงานกฎหมายใช้เนื้อหาจาก AI แล้วพบการอ้างอิงที่ตรวจสอบไม่ได้
ความล้มเหลวที่เกิดซ้ำทำให้เห็นว่า นี่ไม่ใช่เพียงความผิดพลาดเล็ก ๆ ของเครื่องมือ แต่เป็นความเสี่ยงเชิงระบบ เมื่อ AI สร้างหลักฐานที่ดูน่าเชื่อถือโดยไม่มีการควบคุมจากมนุษย์อย่างจริงจัง ความเสียหายอาจลุกลามไปถึงความน่าเชื่อถือขององค์กร เงินทุน และการตรวจสอบจากหน่วยงานกำกับดูแล
บทเรียนจากรายงาน KPMG จึงไม่ใช่การเลิกใช้ AI แต่คือการทำให้คำว่า “ตรวจสอบ” ในกระบวนการทำงานที่มี AI ช่วยนั้นเกิดขึ้นจริง ตรวจสอบแหล่งข้อมูลต้นทางทุกข้อกล่าวอ้าง และต้องมีมนุษย์ผู้รับผิดชอบก่อนเอกสารจะออกสู่สาธารณะ