Kontrola bibliografie podle GPTZero odhalila systematické problémy :
Celkem GPTZero označil za chybných 89 % bibliografie. Jeho detekční sken navíc vyhodnotil dokument jako z 56 % „smíšený“, což podle nástroje odpovídá obsahu vytvořenému pomocí AI nebo výrazně podporovanému AI, který zřejmě neprošel smysluplnou lidskou kontrolou .
Analýza identifikovala čtyři známé organizace, kterým zpráva připisovala konkrétní využití „agentní AI“. Uvedené případy se však nepodařilo ověřit v citovaných materiálech .
V jednotlivých případech citace podle GPTZero odkazovaly na neexistující zprávy, pozměněné názvy skutečných, ale tematicky nesouvisejících publikací nebo na odkazy příliš neurčité k ověření .
GPTZero dospěl k závěru, že chyby pravděpodobně vznikly tak, že AI výzkumný nástroj příliš doslovně plnil zadání najít skutečné příklady využití „agentní AI“. Vytvořil proto přesvědčivě znějící, ale smyšlené případové studie a citace, které následně unikly kontrolou .
Případ ukazuje zásadní slabinu AI asistovaného výzkumu: jazykový model dokáže vytvořit text, který zní odborně a autoritativně, i když jeho důkazní základ neexistuje. Pokud nikdo ručně neověří každý klíčový údaj a zdroj, může se takový výstup dostat až do oficiální publikace .
Stažená zpráva zapadá do širšího vzorce selhání při používání AI v poradenských a právních službách .
Opakující se incidenty naznačují systémové riziko. AI nástroje mohou rychle vytvořit přesvědčivý text, ale samy o sobě nezaručí, že citace, čísla a případové studie odpovídají realitě. Pro firmy, které prodávají odbornost a důvěru, může být cena za neověřený výstup vysoká: finanční, reputační i regulatorní.
Případ KPMG proto není argumentem pro úplné odmítnutí AI. Je spíše připomínkou, že kontrolní krok v AI asistovaném pracovním procesu musí být skutečný, důkladný a především lidský.