GPTZeros Scan der 45 Zitate im Bericht offenbarte ein systematisches Versagen bei der Überprüfung :
Insgesamt wurden 89 % der Bibliografie als fehlerhaft eingestuft. GPTZeros KI-Erkennung lieferte eine weitere beunruhigende Erkenntnis: Das Dokument wurde zu 56 % als 'gemischt' eingestuft, was darauf hindeutet, dass es wahrscheinlich KI-generiert oder stark KI-gestützt war und einer ernsthaften menschlichen Überprüfung entgangen ist .
Die Untersuchung identifizierte vier prominente Organisationen, die mit erfundenen Fallstudien zum Einsatz von 'agentischer KI' zitiert wurden :
In jedem Fall verwiesen die Zitate auf nicht existierende Berichte, umschriebene Titel echter, aber themenfremder Veröffentlichungen oder waren so vage, dass sie praktisch wertlos waren .
GPTZeros Analyse kam zu dem Schluss, dass die Fehler wahrscheinlich auf ein KI-Recherche-Tool zurückzuführen sind, das eine Aufforderung zur Suche nach realen Beispielen für 'agentische KI' übererfüllte. Das Tool generierte plausibel klingende, aber völlig fiktive Fallstudien und Zitate, die dann unkorrigiert durch KPMGs Überprüfungsprozess rutschten .
Der Vorfall unterstreicht eine kritische Schwachstelle: Wenn KI-generierte Forschung ohne strenge menschliche Prüfung veröffentlicht wird, kann sie selbstbewusst klingenden, aber unsinnigen Inhalt produzieren, der die Glaubwürdigkeit einer Institution beschädigt .
KPMGs zurückgezogener Bericht ist kein Einzelfall. Er reiht sich ein in eine Reihe von KI-bezogenen Zitierfehlern bei großen Beratungs- und Anwaltskanzleien :
Diese wiederholten Pannen verdeutlichen ein systemisches Risiko: Ohne strenge menschliche Aufsicht produzieren KI-Recherche-Tools Belege, die glaubwürdig wirken, aber bei näherer Prüfung zerfallen. Für eine Branche, die Vertrauen und Fachwissen verkauft, sind die Kosten eines Fehlers in Dollar, Reputation und regulatorischer Aufmerksamkeit zu messen. Der KPMG-Fall ist eine deutliche Warnung: Die ‚Prüfung‘ in einem KI-gestützten Workflow muss real, gründlich und menschlich sein.