Независимые оценки AI Business Weekly сообщают о 94% общей фактической точности, причем точность варьируется в зависимости от типа запроса :
В профессиональном бенчмарк-тестировании, ориентированном на рабочие запросы (анализ политик, техническое решение проблем, исследование компаний и другое), Perplexity достиг 92% фактической точности, превзойдя ChatGPT с его 87% на тех же тестах .
Собственный бенчмарк Perplexity DRACO (июнь 2026) показывает, что его модель Deep Research достигает передовых результатов на внешних бенчмарках, включая Google DeepMind DeepSearchQA и Scale AI ResearchRubrics .
Результаты бенчмарков рассказывают одну историю. Точность в реальных новостях — совсем другую. Аудит NewsGuard в сентябре 2025 года показал, что ИИ-чат-боты в целом повторяли ложные новостные утверждения в 35% случаев в августе 2025 года — по сравнению с 18% годом ранее . Perplexity был отмечен как показавший наихудшее снижение среди протестированных топ-чат-ботов. В тесте NewsGuard 2024 года у Perplexity был безупречный показатель успеха; в 2025 году он не смог дать правильные ответы почти в половине попыток .
TruthSignal, независимый трекер достоверности, оценивает среднюю достоверность @AskPerplexity в 65%, называя его "заслуживающим доверия инструментом для общих запросов и исследовательского поиска", но отмечая, что его надежность "для проверки фактов или чувствительных тем оспаривается" .
Этот разрыв между результатами бенчмарков и реальной производительности имеет значение. Бенчмарки тестируют статичные, хорошо подкрепленные факты. Срочные новости включают быстро меняющиеся нарративы, противоречивые источники и информацию, которая может еще не быть авторитетной в открытом интернете — именно те условия, в которых инструменты ИИ-поиска испытывают трудности.
Ключевое преимущество Perplexity — это цитаты. Каждый ответ содержит ссылки на пронумерованные источники — но насколько надежны сами эти цитаты?
В практическом тесте, проведенном с февраля по март 2026 года, один рецензент выборочно проверил 200 цитат из 847 запросов Pro Search и обнаружил, что 78% были подтверждены как точные . Это означает, что примерно каждая пятая цитата вела к источнику, который на самом деле не подтверждал сделанное утверждение.
Другие рецензенты отмечают, что качество цитирования сильно варьируется. Записи в блогах и менее авторитетные источники иногда появляются наряду с академическими статьями или официальными документами . Некоторые цитаты являются откровенными галлюцинациями — ссылками на несуществующие или нерелевантные страницы .
Что каса specifically академических исследований, исследование Tow Center показало, что, хотя Perplexity имел самый низкий уровень неверных цитат среди протестированных ИИ-поисковиков, он все равно отвечал неверно примерно в 37% случаев — то есть более чем в одном из трех ответов содержались ошибки или неверно приписанные утверждения .
Независимые обзоры сходятся во мнении о сильных и слабых сторонах Perplexity :
Наилучшие результаты для:
Наихудшие результаты в:
Несмотря на то, что в интернете часто повторяются цифры вроде "95%", Perplexity не публиковал универсальной, независимо проверенной оценки, охватывающей все типы ответов . Его измеряемая производительность меняется в зависимости от бенчмарка, режима продукта, языковой модели, источника информации, типа вопроса и определения точности .
Наиболее полезное резюме получается из объединения всех данных: Для общих фактологических исследований с проверяемыми источниками — особенно текущих событий, науки, технологий и структурированных предметов — Perplexity является одним из самых надежных доступных ИИ-инструментов. Его модель цитирования принципиально меняет способ проверки информации, а его результаты бенчмарков действительно сильны. Но для новостей, чувствительных утверждений и академической работы относитесь к его результатам как к отправной точке, а не к окончательному ответу. Проверяйте критические факты вручную, особенно когда информация быстро меняется или ставки высоки.