كشف فحص GPTZero لـ 45 استشهاداً في التقرير عن فشل منهجي في التحقق :
بشكل عام، تم الإبلاغ عن 89% من قائمة المراجع على أنها معيبة. وأضاف فحص كشف الذكاء الاصطناعي من GPTZero طبقة أخرى من القلق، حيث صنف الوثيقة بأنها "مختلطة" بنسبة 56%، مما يشير إلى أنها على الأرجح محتوى من إنتاج الذكاء الاصطناعي أو بمساعدة كثيفة منه دون مراجعة بشرية جوهرية .
حدد التحقيق أربع مؤسسات بارزة تم الاستشهاد بها بدراسات حالة ملفقة حول نشر "الذكاء الاصطناعي العامِل" :
في كل حالة، كانت الاستشهادات تشير إلى تقارير غير موجودة، أو عناوين مُعاد صياغتها لمنشورات حقيقية غير ذات صلة، أو مراجع غامضة جداً لدرجة أنها كانت عديمة الفائدة عملياً .
خلص تحليل GPTZero إلى أن الأخطاء كانت على الأرجح نتيجة لأداة بحث ذكاء اصطناعي امتثلت بشكل مفرط لأمر العثور على أمثلة واقعية لـ "الذكاء الاصطناعي العامِل". قامت الأداة بتوليد دراسات حالة واستشهادات تبدو معقولة ولكنها خيالية تماماً، ثم انزلقت عبر عملية المراجعة في KPMG دون تصحيح .
تسلط الحادثة الضوء على ثغرة خطيرة: عندما يُنشر بحث مولّد بالذكاء الاصطناعي دون تحقق بشري صارم، فإنه يمكن أن ينتج هراءً واثقاً وموثوقاً يضر بمصداقية المؤسسات .
تقرير KPMG المسحوب ليس حادثة منعزلة بأي حال. إنه يندرج ضمن نمط متزايد من إخفاقات الاستشهاد المتعلقة بالذكاء الاصطناعي عبر شركات الاستشارات والمحاماة الكبرى :
تسلط حالات الفشل المتكررة هذه الضوء على مخاطر منهجية: بدون إشراف بشري صارم، تنتج أدوات البحث بالذكاء الاصطناعي أدلة تبدو موثوقة ولكنها تذوب تحت التدقيق. بالنسبة لصناعة تبيع الثقة والخبرة، فإن ثمن الخطأ يُقاس بالدولار والسمعة والاهتمام التنظيمي. تشكل قضية KPMG تحذيراً واضحاً بأن "الفحص" في سير العمل المدعوم بالذكاء الاصطناعي يجب أن يكون حقيقياً وشاملاً وبشرياً.