Pemeriksaan GPTZero terhadap 45 sitasi dalam laporan menemukan kegagalan verifikasi yang sistematis :
Secara keseluruhan, 89% daftar pustaka ditandai bermasalah. Pemindaian deteksi AI GPTZero juga menilai dokumen tersebut 56% “mixed”, yang mengindikasikan kemungkinan konten dibuat atau banyak dibantu AI tanpa pemeriksaan manusia yang memadai .
Investigasi tersebut menemukan empat organisasi besar yang dikaitkan dengan studi kasus penerapan agentic AI yang tidak dapat diverifikasi .
Dalam kasus-kasus itu, sitasi mengarah ke laporan yang tidak pernah ada, judul publikasi nyata yang diubah dan dilekatkan pada klaim lain, atau referensi yang terlalu kabur untuk diperiksa .
GPTZero menyimpulkan bahwa kesalahan tersebut kemungkinan muncul karena sebuah alat riset AI terlalu mengikuti perintah untuk mencari contoh nyata penerapan “agentic AI”. Alat itu kemudian menghasilkan studi kasus dan sitasi yang terdengar masuk akal, tetapi sebenarnya fiktif. Hasil tersebut diduga lolos dari proses peninjauan KPMG tanpa dikoreksi .
Kasus ini menyoroti risiko mendasar dalam riset berbantuan AI: teknologi dapat menyusun narasi yang percaya diri dan tampak otoritatif, meski sumber pendukungnya tidak ada. Jika tidak diverifikasi secara ketat sebelum dipublikasikan, kesalahan seperti ini dapat merusak kredibilitas lembaga yang menerbitkannya .
Kasus KPMG muncul di tengah pola kegagalan sitasi berbasis AI yang lebih luas di perusahaan konsultan dan firma hukum besar .
Rangkaian insiden ini menunjukkan risiko sistemik bagi industri yang menjual keahlian, akurasi, dan kepercayaan. AI dapat mempercepat pekerjaan riset, tetapi tanggung jawab untuk memastikan setiap klaim dan sitasi tetap berada pada manusia serta organisasi yang menerbitkannya.
Pelajaran utama dari laporan KPMG sederhana: dalam alur kerja berbantuan AI, proses “pemeriksaan” harus benar-benar dilakukan—secara menyeluruh, berdasarkan sumber asli, dan dengan pengawasan manusia.