GPTZeros gjennomgang av rapportens 45 kildehenvisninger viste et omfattende verifiseringsproblem :
Totalt ble 89 prosent av litteraturlisten vurdert som mangelfull. GPTZeros analyse av selve teksten ga dessuten dokumentet en vurdering på 56 prosent «blandet», noe som tydet på at innholdet sannsynligvis var AI-generert eller tungt AI-assistert uten tilstrekkelig menneskelig kontroll .
Undersøkelsen identifiserte fire kjente organisasjoner som i rapporten ble koblet til ikke-verifiserte casestudier om agentisk AI :
I disse tilfellene viste henvisningene enten til rapporter som ikke eksisterte, til endrede titler på reelle – men irrelevante – publikasjoner, eller til beskrivelser som var for uklare til å kunne kontrolleres .
GPTZero konkluderte med at feilene sannsynligvis skyldtes et AI-basert researchverktøy som fulgte en instruks om å finne virkelige eksempler på agentisk AI, men som gikk for langt. Verktøyet skal ha produsert troverdige, men oppdiktede casestudier og kildehenvisninger. Deretter ble materialet publisert uten at feilene ble fanget opp i KPMGs kontrollprosess .
Saken illustrerer en grunnleggende risiko ved AI-assistert analyse: Teksten kan høres overbevisende og autoritativ ut, selv når bevisene ikke finnes. Når kildene ikke kontrolleres manuelt, kan resultatet bli feil som skader både rapportens troverdighet og virksomhetens omdømme .
KPMGs trukne rapport kommer ikke alene. Den inngår i et bredere mønster av AI-relaterte kildefeil i arbeid fra store rådgivnings-, revisjons- og advokatfirmaer .
For en bransje som selger tillit, ekspertise og etterprøvbare råd, er dette mer enn pinlige skrivefeil. AI-verktøy kan effektivisere research, men ansvaret for påstander, tall og kilder blir ikke borte fordi et språkmodellverktøy har laget førsteutkastet.
KPMG-saken er derfor en tydelig påminnelse om at «kontrollen» i en AI-assistert arbeidsflyt må være reell – grundig og utført av mennesker.