Łącznie GPTZero uznało 89 proc. bibliografii za wadliwą. Dodatkowy skan oceniający udział treści wygenerowanych przez AI oznaczył dokument jako w 56 proc. „mieszany”, co sugerowało wykorzystanie AI lub intensywną pomoc takich narzędzi bez skutecznej kontroli człowieka .
W raporcie pojawiły się przykłady zastosowań agentic AI przypisane znanym organizacjom. GPTZero nie znalazło jednak wiarygodnych materiałów potwierdzających te opisy .
W poszczególnych przypadkach odwołania prowadziły do nieistniejących raportów, zmienionych tytułów prawdziwych, lecz niezwiązanych publikacji albo do tak ogólnych opisów, że nie dało się ich rzetelnie sprawdzić .
Według wniosków GPTZero błędy mogły powstać dlatego, że narzędzie badawcze AI zbyt dosłownie próbowało spełnić polecenie znalezienia rzeczywistych przykładów wykorzystania agentic AI. W efekcie wygenerowało wiarygodnie brzmiące, lecz fikcyjne studia przypadku i cytowania, które nie zostały wychwycone podczas przeglądu dokumentu .
To kluczowa lekcja dla firm korzystających z AI w researchu: płynny, profesjonalny język nie jest dowodem prawdziwości informacji. Każde twierdzenie, liczba i przypis wygenerowany lub opracowany przez model musi zostać sprawdzony w oryginalnym materiale źródłowym przed publikacją .
Przypadek KPMG wpisuje się w szerszy wzorzec błędów związanych z cytowaniami w pracy dużych firm doradczych i profesjonalnych .
Powtarzające się incydenty pokazują ryzyko systemowe. Narzędzia AI potrafią tworzyć dowody, które wyglądają przekonująco, lecz rozpadają się przy sprawdzeniu. Dla branży sprzedającej wiedzę, wiarygodność i zaufanie konsekwencje takich błędów mogą oznaczać straty finansowe, utratę reputacji oraz większe zainteresowanie regulatorów.
Wniosek nie brzmi: „nie używaj AI”. Brzmi raczej: w procesie wspomaganym przez AI kontrola musi być rzeczywista, dokładna i przeprowadzona przez człowieka.