AI Business Weekly의 독립적 평가에 따르면 **전체 사실 정확도는 94%**이며, 질문 유형에 따라 정확도가 달라졌습니다 :
업무 관련 질문(정책 분석, 기술 문제 해결, 기업 연구 등)에 초점을 맞춘 전문 벤치마크 테스트에서 Perplexity는 92%의 사실 정확도를 기록하며, 동일 테스트에서 87%를 기록한 ChatGPT를 앞질렀습니다 .
Perplexity 자체 DRACO 벤치마크(2026년 6월)에 따르면 Deep Research 모델은 Google DeepMind의 DeepSearchQA, Scale AI의 ResearchRubrics를 포함한 외부 벤치마크에서 최고 수준의 결과를 달성했습니다 .
벤치마크 점수가 이야기하는 것과 실제 뉴스 정확도는 다릅니다. 2025년 9월 NewsGuard의 감사 결과, AI 챗봇이 2025년 8월에 허위 뉴스 주장을 35%의 확률로 반복한 것으로 나타났습니다. 이는 전년도 18%에서 크게 증가한 수치입니다 . Perplexity는 테스트된 주요 챗봇 중 가장 큰 성능 하락을 보였습니다. 2024년 NewsGuard 테스트에서 Perplexity는 완벽한 성공률을 기록했지만, 2025년 감사에서는 거의 절반 가까운 시도에서 정답을 제공하지 못했습니다 .
독립적인 신뢰도 추적 기관인 TruthSignal은 @AskPerplexity의 평균 신뢰도를 **65%**로 평가하며, '일반 질문과 탐색적 연구에 유용한 도구'라고 언급했지만, '팩트체크나 민감한 주제에 대한 신뢰성은 논쟁의 여지가 있다'고 지적했습니다 .
벤치마크 점수와 실제 성능 간의 이러한 격차는 중요합니다. 벤치마크는 정적이고 잘 정립된 사실을 테스트합니다. 반면, 속보는 빠르게 변화하는 내러티브, 상충되는 출처, 아직 공식적이지 않은 정보를 다루며, 이는 AI 검색 도구가 가장 어려움을 겪는 조건입니다.
Perplexity의 핵심 가치 제안은 인용(citation)입니다. 모든 답변에는 번호가 매겨진 출처가 연결되어 있습니다. 하지만 이 인용 자체는 얼마나 신뢰할 수 있을까요?
2026년 2월부터 3월까지 진행된 실제 사용 테스트에서 한 리뷰어는 847개의 Pro Search 질문 중 200개의 인용을 무작위 점검했고, 78%가 정확한 것으로 확인되었습니다 . 즉, 약 5개 중 1개의 인용은 주장을 뒷받침하지 않는 출처로 연결되었습니다.
다른 리뷰어들은 인용 품질이 매우 다양하다고 지적합니다. 블로그 게시물이나 권위가 덜한 출처가 학술 논문이나 공식 문서와 함께 인용되기도 합니다 . 일부 인용은 실제로 존재하지 않거나 관련 없는 페이지로 연결되는 '환각(hallucination)' 현상을 보이기도 합니다 .
특히 학술 연구와 관련하여 Tow Center 연구에 따르면 Perplexity는 테스트된 AI 검색 엔진 중 잘못된 인용 비율이 가장 낮았지만, 여전히 약 37%의 경우에서 잘못된 답변을 제공했습니다. 즉, 세 번 출력 중 한 번 이상이 오류나 잘못된 출처 인용을 포함하고 있었습니다 .
독립적인 리뷰들은 Perplexity의 강점과 약점에 대해 일관된 의견을 보여줍니다 :
가장 강력한 분야:
가장 취약한 분야:
온라인에서 '95%'와 같은 수치가 자주 인용되지만, Perplexity는 모든 답변 유형을 포괄하는 보편적이고 독립적으로 감사된 평가를 발표한 적이 없습니다 . 측정된 성능은 벤치마크, 제품 모드, 선택된 언어 모델, 정보 출처, 질문 유형, 그리고 정확도가 정의되는 방식에 따라 달라집니다 .
모든 데이터를 종합한 가장 유용한 요약은 다음과 같습니다: 검증 가능한 출처를 활용한 일반적인 사실 연구, 특히 최신 이슈, 과학, 기술, 구조화된 주제에 있어 Perplexity는 가장 신뢰할 수 있는 AI 도구 중 하나입니다. 인용 모델은 정보를 확인하는 방식을 근본적으로 변화시켰으며, 벤치마크 점수도 확실히 강력합니다. 하지만 뉴스, 민감한 주장, 학술 작업의 경우, 그 결과물을 최종 답변이 아닌 출발점으로 간주해야 합니다. 정보가 빠르게 변화하거나 중요도가 높은 경우, 중요한 사실은 수동으로 직접 확인하십시오.