AI Business Weekly 嘅獨立評估報告指出 整體事實準確率達 94%,準確率會因查詢類型而異 :
喺針對工作相關查詢(涵蓋政策分析、技術故障排查、公司研究等)嘅專業基準測試入面,Perplexity 達到 92% 事實準確率,喺同一測試中擊敗 ChatGPT 嘅 87% 。
Perplexity 自己嘅 DRACO 基準測試(2026 年 6 月)顯示,佢哋嘅 Deep Research 模型喺多個外部基準上達到業界頂尖水平,包括 Google DeepMind 嘅 DeepSearchQA 同 Scale AI 嘅 ResearchRubrics 。
基準測試分數只係故事嘅一面,現實世界中嘅新聞準確度又係另一回事。NewsGuard 喺 2025 年 9 月嘅審計發現,AI 聊天機器人整體喺 2025 年 8 月重複虛假新聞主張嘅比率達到 35%——比前一年嘅 18% 大幅上升 。Perplexity 被點名為跌幅最嚴重嘅頂尖聊天機器人之一。喺 NewsGuard 2024 年嘅測試入面,Perplexity 取得完美成功率;但到咗 2025 年,佢差唔多有一半嘅測試都答錯 。
獨立可信度追蹤平台 TruthSignal 將 @AskPerplexity 嘅平均可信度評為 65%,話佢「對於一般查詢同探索性研究係一個可信嘅工具」,但同時指出「佢喺事實核查或敏感議題上嘅可靠性存在爭議」。
呢個基準測試分數同現實表現之間嘅差距好重要。基準測試測試嘅係靜態、有良好來源支持嘅事實。突發新聞涉及快速變化嘅敘事、互相矛盾嘅來源,以及可能仲未喺公開網絡上建立權威性嘅資訊——呢啲正正係 AI 搜尋工具最難應付嘅情況。
Perplexity 嘅核心賣點係引用。每個答案都會連結返去編號來源——但呢啲引用本身有幾可靠?
喺 2026 年 2 月至 3 月進行嘅實測中,有位評測員抽查咗 847 個 Pro Search 查詢入面嘅 200 個引用,發現 78% 被證實係準確嘅 。即係大約每五個引用就有一個指向嘅來源唔能夠支持相關陳述。
其他評測員亦指出引用質素好參差。有時博客文章或者權威性較低嘅來源會同學術論文或官方文件一齊出現 。部分引用甚至係完全虛構嘅——連結到啲唔存在或者無關嘅頁面 。
具體到學術研究,一項 Tow Center 嘅研究發現,雖然 Perplexity 喺測試嘅 AI 搜尋引擎入面有最低嘅錯誤引用率,但佢仍然喺大約 37% 嘅情況 下答錯——即係每三個輸出就有超過一個包含錯誤或錯誤歸因嘅陳述 。
多個獨立評測一致認同 Perplexity 嘅強項同弱項 :
最適合:
最弱嘅地方:
雖然網上成日有人重複「95%」呢個數字,但 Perplexity 從來冇公布過一個涵蓋所有答案類型、經過獨立審計嘅全面評估 。佢哋嘅實際表現會隨基準測試、產品模式、語言模型、資訊來源、問題類型同準確度定義而改變 。
將所有數據綜合埋一齊,最有用嘅結論係咁:對於有可驗證來源嘅一般事實性研究——尤其係時事、科學、科技同結構化學科——Perplexity 係目前最可靠嘅 AI 工具之一。佢嘅引用模式從根本上改變咗你驗證資訊嘅方式,而且佢嘅基準測試分數真係好強。但對於新聞、敏感主張同學術工作,就要將佢嘅輸出當作起點,而唔係最終答案。尤其係資訊快速變化或者後果好嚴重嘅時候,一定要親手核查關鍵事實。