根據 AI Business Weekly 的獨立評估,Perplexity 的整體事實準確率為 94%,但依查詢類型而有所不同 :
在專注於工作相關查詢(涵蓋政策分析、技術疑難排解、公司研究等)的專業基準測試中,Perplexity 達到了 92% 的事實準確率,在同類測試中擊敗了 ChatGPT 的 87% 。
Perplexity 自家的 DRACO 基準測試(2026 年 6 月)也顯示,其 Deep Research 模型在 Google DeepMind 的 DeepSearchQA 和 Scale AI 的 ResearchRubrics 等外部基準上,都達到了最先進的成果 。
基準測試的成績只說明了部分故事。現實世界中的新聞準確度又是另一回事。新聞事實查核機構 NewsGuard 在 2025 年 9 月發布的審計報告指出,AI 聊天機器人整體在 2025 年 8 月重複虛假新聞聲明的比例高達 35%,較前一年的 18% 顯著上升 。Perplexity 在受測的頂尖聊天機器人中,被點名為表現下滑最嚴重的。在 NewsGuard 2024 年的測試中,Perplexity 曾創下完美的成功率;但在 2025 年的審計中,它在近半數的測試中無法給出正確答案 。
獨立可信度追蹤平台 TruthSignal 則給 @AskPerplexity 的平均可信度評分為 65%,稱其為「處理一般查詢和探索性研究的可靠工具」,但也指出其「在事實查核或敏感議題上的可靠性仍有爭議」。
基準測試分數與真實世界表現之間的這種落差至關重要。基準測試的對象是靜態的、來源明確的事實。而即時新聞則涉及快速變化的敘事、相互矛盾的資訊來源,以及可能尚未在開放網路上建立權威性的資訊——這正是 AI 搜尋工具最棘手的條件。
Perplexity 的核心賣點是引用來源。每個答案都會連結到編號的參考來源——但這些引用本身的可靠性如何?
在一項於 2026 年 2 月至 3 月進行的實測中,一位評論者在 847 次 Pro Search 查詢中抽查了 200 個引用,發現 78% 的引用經確認是準確的 。這意味著大約每 5 個引用中,就有 1 個實際上無法支持它所連結的陳述。
其他評論者也指出,引用的品質差異很大。部落格文章或權威性較低的來源,有時會與學術論文或官方文件並列 。有些引用甚至是完全虛構的——連結到不存在或不相關的頁面 。
針對學術研究的用途,一項 Tow Center 的研究發現,雖然 Perplexity 在受測的 AI 搜尋引擎中擁有最低的不正確引用率,但其回答的錯誤率仍然高達約 37%——也就是說,超過三分之一的輸出內容包含錯誤或錯誤歸屬的聲明 。
多個獨立評測對於 Perplexity 的優缺點看法一致 :
最擅長:
最不擅長:
儘管網路上經常流傳「95%」這類數字,但 Perplexity 從未發布過一個涵蓋所有答案類型的、經過獨立審計的通用評估報告 。其可測量的表現會因基準測試、產品模式、語言模型、資訊來源、問題類型以及對準確度的定義而改變 。
綜合所有數據,最實用的總結是:對於可驗證來源的一般事實性研究——尤其是時事、科學、科技和結構化主題——Perplexity 是目前最可靠的 AI 工具之一。它的引用模式從根本上改變了驗證資訊的方式,而且其基準測試成績確實出色。但是,對於新聞、敏感聲明和學術工作,請將其輸出視為起點,而非最終答案。特別是當資訊快速變化或影響重大時,請務必手動驗證關鍵事實。