בסך הכול, כ-89% מהביבליוגרפיה סומנו כפגומים. סריקת זיהוי ה-AI של GPTZero דירגה את המסמך כ-56% "מעורב", ממצא המתיישב עם תוכן שנוצר בעזרת AI או בסיוע משמעותי שלו — ועבר, לכאורה, ביקורת אנושית שלא הצליחה לאתר את הבעיות .
הבדיקה זיהתה ארבעה ארגונים מוכרים שהדו״ח הציג אותם כדוגמאות להפעלה של AI סוכני, אף שלא נמצא תיעוד מאמת לטענות שהופנו אליהם :
במקרים הללו, ההפניות הובילו לדו״חות שלא היו קיימים, לכותרות ששונו על בסיס פרסומים אמיתיים אך לא קשורים, או למקורות כלליים מדי מכדי שאפשר יהיה לבדוק אותם .
המסקנה של GPTZero הייתה שהשגיאות נבעו ככל הנראה מכלי מחקר מבוסס AI שניסה למלא בקפדנות יתרה בקשה למצוא דוגמאות אמיתיות לשימוש ב-AI סוכני . במקום להסתפק במידע שניתן לאמת, הכלי יצר מקרי בוחן והפניות שנשמעו סבירים — אך היו בדויים או פגומים.
החלק המדאיג הוא לא רק עצם היכולת של המערכת להמציא מידע, אלא העובדה שהמידע עבר את תהליך הבדיקה והגיע לפרסום ללא אימות יסודי של המקורות . בעולם הייעוץ, שבו האמינות היא חלק מרכזי מהמוצר, טעות כזו עלולה לפגוע בכסף, במוניטין ובאמון הציבור.
הדו״ח של KPMG מצטרף לשורה רחבה יותר של תקלות ציטוט הקשורות ל-AI בחברות ייעוץ ובמשרדי עורכי דין .
המסר אינו בהכרח שצריך להפסיק להשתמש ב-AI למחקר או לכתיבה. הלקח הוא שכל טענה, מספר, ציטוט וקישור שנוצרו בעזרת מערכת כזו חייבים להיבדק מול מקור ראשוני שניתן לאמת — לפני שהם יוצאים מהארגון.
במילים פשוטות: הבעיה אינה רק שה-AI עלול "להזות". הבעיה מתחילה כאשר אף אדם לא בודק אם מה שנכתב אכן קרה.