L'analyse de GPTZero sur les 45 citations du rapport a révélé une défaillance systématique de la vérification :
Au total, 89% de la bibliographie a été jugée erronée. Le scan de détection d'IA de GPTZero a ajouté une couche inquiétante supplémentaire, classant le document à 56% « mixte », ce qui suggère qu'il s'agissait vraisemblablement d'un contenu généré ou fortement assisté par IA, qui a échappé à une relecture humaine sérieuse .
L'enquête a identifié quatre organisations de premier plan citées avec des études de cas fabriquées de déploiement d'IA agentique :
Dans chaque cas, les citations renvoyaient à des rapports inexistants, à des titres paraphrasés de publications réelles sans rapport, ou à des références si vagues qu'elles étaient fonctionnellement inutiles .
L'analyse de GPTZero a conclu que les erreurs étaient probablement le résultat d'un outil de recherche IA qui a suivi trop docilement une instruction visant à trouver des exemples concrets d'IA agentique. L'outil a généré des études de cas et des citations qui semblaient plausibles mais étaient totalement fictives, et qui ont ensuite échappé au processus de relecture de KPMG sans être corrigées .
Cet incident met en évidence une vulnérabilité critique : lorsque des recherches générées par IA sont publiées sans une vérification humaine rigoureuse, elles peuvent produire des absurdités exprimées avec une confiance et une autorité apparentes, ce qui nuit à la crédibilité institutionnelle .
Le rapport retiré de KPMG est loin d'être un cas isolé. Il s'inscrit dans un schéma élargi de défaillances liées aux citations par IA au sein des grands cabinets de conseil et d'avocats :
Ces échecs répétés mettent en lumière un risque systémique : sans un contrôle humain rigoureux, les outils de recherche IA produisent des preuves qui semblent crédibles mais qui s'effondrent dès qu'on les examine de près. Pour un secteur qui vend de la confiance et de l'expertise, le coût de l'erreur se mesure en dollars, en réputation et en attention réglementaire. Le cas de KPMG sert d'avertissement clair : la « vérification » dans un flux de travail assisté par IA doit être réelle, approfondie et humaine.