El análisis de GPTZero sobre las 45 citas del informe reveló un fallo sistemático de verificación :
En total, el 89% de la bibliografía fue señalada como defectuosa. El análisis de detección de IA de GPTZero añadió otra capa preocupante, calificando el documento como 56% "mixto" , lo que sugiere que probablemente era contenido generado o muy asistido por IA que eludió una revisión humana significativa .
La investigación identificó cuatro organizaciones prominentes citadas con casos de estudio inventados sobre la implementación de "IA agente" :
En cada caso, las citas apuntaban a informes inexistentes, títulos parafraseados de publicaciones reales no relacionadas o referencias tan vagas que eran funcionalmente inútiles .
El análisis de GPTZero concluyó que los errores probablemente fueron el resultado de una herramienta de investigación de IA que cumplió en exceso con la instrucción de encontrar ejemplos del mundo real de "IA agente" . La herramienta generó casos de estudio y citas que sonaban plausibles pero eran completamente ficticios, que luego escaparon sin corrección del proceso de revisión de KPMG .
El incidente subraya una vulnerabilidad crítica: cuando la investigación generada por IA se publica sin una verificación humana rigurosa, puede producir contenido sin sentido que suena autoritario y que daña la credibilidad institucional .
El informe retirado de KPMG no es un caso aislado. Se inscribe en un patrón creciente de fallos de citas relacionados con la IA en las principales firmas de consultoría y jurídicas :
Estos fallos repetidos ponen de relieve un riesgo sistémico: sin una supervisión humana rigurosa, las herramientas de investigación de IA están produciendo evidencia que parece creíble pero se desvanece bajo escrutinio. Para una industria que vende confianza y experiencia, el costo de equivocarse se mide en dólares, reputación y atención regulatoria. El caso de KPMG sirve como una advertencia clara de que la "verificación" en un flujo de trabajo asistido por IA debe ser real, exhaustiva y humana.