Avaliações independentes do AI Business Weekly relatam 94% de precisão factual geral, com a precisão variando conforme o tipo de consulta :
Em testes de benchmark profissionais focados em consultas relacionadas ao trabalho (cobrindo análise de políticas, solução de problemas técnicos, pesquisa empresarial e muito mais), o Perplexity alcançou 92% de precisão factual, superando os 87% do ChatGPT nos mesmos testes .
O próprio benchmark DRACO do Perplexity (junho de 2026) mostra que seu modelo Deep Research alcança resultados de ponta em benchmarks externos, incluindo o DeepSearchQA do Google DeepMind e o ResearchRubrics da Scale AI .
As pontuações dos benchmarks contam uma história. A precisão em notícias do mundo real conta outra. Uma auditoria de setembro de 2025 do NewsGuard descobriu que os chatbots de IA, no geral, repetiram alegações falsas de notícias 35% das vezes em agosto de 2025 — um aumento em relação aos 18% do ano anterior . O Perplexity foi destacado como tendo o pior declínio entre os principais chatbots testados. No teste de 2024 do NewsGuard, o Perplexity teve uma taxa de sucesso impecável; em 2025, ele não conseguiu fornecer respostas corretas em quase metade das tentativas .
O TruthSignal, um rastreador de credibilidade independente, avalia a credibilidade média do @AskPerplexity em 65%, chamando-o de "uma ferramenta confiável para consultas gerais e pesquisa exploratória", mas observando que sua confiabilidade "para verificação de fatos ou tópicos sensíveis é contestada" .
Esta lacuna entre as pontuações dos benchmarks e o desempenho no mundo real é importante. Os benchmarks testam fatos estáticos e bem fundamentados. Notícias de última hora envolvem narrativas que mudam rapidamente, fontes conflitantes e informações que podem ainda não ser autoritativas na web aberta — exatamente as condições onde as ferramentas de busca com IA têm dificuldades.
A principal proposta de valor do Perplexity são as citações. Cada resposta linka para fontes numeradas — mas quão confiáveis são essas próprias citações?
Em um teste prático realizado de fevereiro a março de 2026, um revisor verificou 200 citações em 847 consultas Pro Search e descobriu que 78% foram verificadas como precisas . Isso significa que aproximadamente 1 em cada 5 citações levava a uma fonte que não apoiava a afirmação feita.
Outros revisores observam que a qualidade das citações varia muito. Posts de blog e fontes menos autoritativas às vezes aparecem ao lado de artigos acadêmicos ou documentos oficiais . Algumas citações são genuinamente alucinadas — linkando para páginas inexistentes ou irrelevantes .
Para pesquisa acadêmica especificamente, um estudo do Tow Center descobriu que, embora o Perplexity tenha a menor taxa de citações incorretas entre os mecanismos de busca com IA testados, ele ainda respondeu incorretamente em aproximadamente 37% dos casos — o que significa que mais de uma em cada três saídas continha erros ou alegações mal atribuídas .
Análises independentes concordam consistentemente sobre os pontos fortes e fracos do Perplexity :
Mais forte para:
Mais fraco em:
Apesar de figuras como "95%" serem frequentemente repetidas online, o Perplexity não publicou uma avaliação universal e auditada de forma independente cobrindo todos os tipos de resposta . Seu desempenho medido muda dependendo do benchmark, modo do produto, modelo de linguagem, fonte de informação, tipo de pergunta e como a precisão é definida .
O resumo mais útil vem da combinação de todos os dados: Para pesquisa factual geral com fontes verificáveis — especialmente eventos atuais, ciência, tecnologia e assuntos estruturados — o Perplexity é uma das ferramentas de IA mais confiáveis disponíveis. Seu modelo de citação muda fundamentalmente a forma como você verifica informações, e suas pontuações de benchmark são genuinamente fortes. Mas para notícias, alegações sensíveis e trabalho acadêmico, trate seus resultados como um ponto de partida, não como uma resposta final. Verifique fatos críticos manualmente, especialmente quando a informação está mudando rapidamente ou quando os riscos são altos.