Evaluaciones independientes de AI Business Weekly reportan un 94% de precisión factual general, con una precisión que varía según el tipo de consulta :
En pruebas de benchmark profesionales centradas en consultas laborales (que cubren análisis de políticas, resolución de problemas técnicos, investigación de empresas y más), Perplexity alcanzó un 92% de precisión factual, superando el 87% de ChatGPT en las mismas pruebas .
El propio benchmark DRACO de Perplexity (junio de 2026) muestra que su modelo Deep Research logra resultados de última generación en benchmarks externos, incluyendo DeepSearchQA de Google DeepMind y ResearchRubrics de Scale AI .
Las puntuaciones de los benchmarks cuentan una historia. La precisión en el mundo real con las noticias cuenta otra. Una auditoría de NewsGuard de septiembre de 2025 encontró que los chatbots de IA en general repetían afirmaciones falsas de noticias un 35% de las veces en agosto de 2025, frente al 18% del año anterior . Perplexity fue señalado como el que tuvo el peor declive entre los principales chatbots evaluados. En la prueba de NewsGuard de 2024, Perplexity tuvo una tasa de éxito impecable; en 2025, no proporcionó respuestas correctas en casi la mitad de los intentos .
TruthSignal, un rastreador de credibilidad independiente, califica la credibilidad promedio de @AskPerplexity en 65%, calificándolo como "una herramienta creíble para consultas generales e investigación exploratoria", pero señala que su fiabilidad "para la verificación de datos o temas delicados es discutible" .
Esta brecha entre las puntuaciones de los benchmarks y el rendimiento en el mundo real es importante. Los benchmarks evalúan datos estáticos y bien documentados. Las noticias de última hora implican narrativas que cambian rápidamente, fuentes contradictorias e información que aún puede no ser autorizada en la web abierta, precisamente las condiciones en las que las herramientas de búsqueda con IA tienen dificultades.
La propuesta de valor clave de Perplexity son las citas. Cada respuesta enlaza a fuentes numeradas, pero ¿qué tan fiables son esas citas?
En una prueba práctica realizada de febrero a marzo de 2026, un revisor verificó 200 citas en 847 consultas de Pro Search y encontró que el 78% se verificaron como precisas . Eso significa que aproximadamente 1 de cada 5 citas conducía a una fuente que en realidad no respaldaba la afirmación hecha.
Otros revisores señalan que la calidad de las citas varía ampliamente. A veces, artículos de blogs y fuentes menos autorizadas aparecen junto a artículos académicos o documentos oficiales . Algunas citas son genuinamente alucinadas, enlazando a páginas inexistentes o irrelevantes .
Para la investigación académica específicamente, un estudio del Tow Center encontró que, si bien Perplexity tenía la tasa más baja de citas incorrectas entre los motores de búsqueda de IA evaluados, aún respondía incorrectamente en aproximadamente el 37% de los casos, lo que significa que más de una de cada tres respuestas contenía errores o afirmaciones mal atribuidas .
Las revisiones independientes coinciden sistemáticamente en las fortalezas y debilidades de Perplexity :
Más sólido para:
Más débil en:
A pesar de que cifras como "95%" se repiten con frecuencia en línea, Perplexity no ha publicado una evaluación universal e independiente que cubra todos los tipos de respuesta . Su rendimiento medido cambia según el benchmark, el modo de producto, el modelo de lenguaje, la fuente de información, el tipo de pregunta y cómo se define la precisión .
El resumen más útil proviene de combinar todos los datos: para la investigación factual general con fuentes verificables, especialmente eventos actuales, ciencia, tecnología y temas estructurados, Perplexity es una de las herramientas de IA más fiables disponibles. Su modelo de citas cambia fundamentalmente la forma en que verificas la información, y sus puntuaciones de benchmark son genuinamente sólidas. Pero para noticias, afirmaciones delicadas y trabajo académico, trata sus respuestas como un punto de partida, no como una respuesta final. Verifica los hechos críticos manualmente, especialmente cuando la información cambia rápidamente o hay mucho en juego.