GPTZero가 보고서의 참고문헌 45개를 스캔한 결과는 다음과 같다 :
종합적으로 참고문헌의 89%가 결함으로 판정됐다. GPTZero의 AI 생성 탐지 결과 보고서는 56% '혼합(mixed)' 등급을 받았는데, 이는 상당 부분 AI가 생성했거나 AI의 도움을 크게 받았으나 사람의 의미 있는 검토를 거치지 않았음을 시사한다 .
GPTZero 조사는 4개 주요 기관의 '에이전틱 AI' 도입 사례가 완전히 조작됐음을 확인했다 :
각 사례의 인용은 존재하지 않는 보고서, 실제 출판물과 전혀 다른 가짜 제목, 또는 사실상 무용지물인 모호한 참조로 연결됐다 .
GPTZero의 분석에 따르면, 이번 사고는 AI 연구 도구가 '에이전틱 AI의 실제 사례를 찾아라'는 프롬프트에 과잉 대응하면서 그럴듯하지만 완전히 허구인 사례와 인용을 생성했고, KPMG의 검토 과정에서 걸러지지 못했기 때문에 발생했다 .
이 사건은 AI가 생성한 연구를 엄격한 사람의 검증 없이 발행할 때 얼마나 큰 피해를 입힐 수 있는지를 극명하게 보여준다. 확신에 찬 권위적인 문장 뒤에 아무런 사실도 존재하지 않을 수 있다는 것이 핵심 교훈이다 .
KPMG의 이번 사건은 고립된 사례가 아니다. 주요 컨설팅 및 법률 회사들에서 유사한 AI 인용 오류가 잇따라 발생하고 있다 :
이러한 반복된 실패는 AI 연구 도구가 신뢰할 수 있는 증거처럼 보이지만 실상은 무너지기 쉬운 허상을 만드는 시스템적 위험을 드러낸다. 신뢰와 전문성을 파는 업계에서 이런 실수의 대가는 금전적 손실과 평판 추락, 규제 당국의 감시로 이어진다. KPMG 사건은 'AI 지원 작업 흐름'에서 검증 단계가 반드시 실제로 이루어져야 하며, 그것은 사람의 몫이라는 분명한 경고다.