Perplexity AIの正確性はタスクによって大きく異なる。SimpleQAでは93.9%、ビジネス用途で92%と高スコアを記録 一方、NewsGuardの監査ではニュースの誤情報を35%の確率で繰り返すという結果に。前年18%から悪化 引用の正確性は78%(実地調査)。学術用途では3件に1件以上の誤りが含まれる可能性
公開者DeepSeek-V4-Flash で編集GPT Image 1.5 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: Searching with cited sources for How reliable is Perplexity AI?. Article summary: Perplexity AI's reliability varies notably by use case and metric. On standard factual benchmarks it scores in the low-to-mid 90% range, but independent audits show it still gets news facts wrong roughly one-third of the. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it
Perplexity AIの正確性を尋ねると、93.9%、94%、65%、78%──どれも間違いではありませんが、どれも全体像を伝えていません。Perplexity AIの性能は、質問の内容、情報源、測定方法によって劇的に変わります。一般的な事実確認では、現時点で最も信頼できるAI検索ツールのひとつです。しかし、速報ニュースやセンシティブな主張、学術的な深掘り調査では、その出力を慎重に検証する必要があります。本記事では、独立したベンチマーク、監査レポート、実機テストのデータをもとに、Perplexityをどこまで信頼してよいのか、どこでダブルチェックすべきなのかを徹底解説します。
標準的な事実確認ベンチマークでは、Perplexityは競争力のあるスコアを記録しています。特に**SimpleQAでは93.9%**を達成し、多くの汎用LLMを上回りました。これは選りすぐりの数字ではなく、業界で認知されたベンチマークであり、Perplexityの公式報告の中で最も強い結果とされています。
AI Business Weeklyの独立評価では、**全体の事実正確性は94%**と報告され、クエリの種類によって精度が変動することが示されています:
プロフェッショナル向けのワーク関連テスト(政策分析、技術トラブルシューティング、企業調査などを含む)では、Perplexityは92%の事実正確性を達成し、同じテストで87%だったChatGPTを上回りました。
Perplexity自身が開発したDRACOベンチマーク(2026年6月)でも、Deep ResearchモデルがGoogle DeepMindのDeepSearchQAやScale AIのResearchRubricsで最先端の結果を達成しています。
ベンチマークのスコアはひとつの側面に過ぎません。実際のニュース正確性は別の話です。2025年9月のNewsGuard監査によると、AIチャットボット全体で2025年8月に誤ったニュース主張を35%の確率で繰り返したことが判明。前年の18%から急増しました。特にPerplexityはテスト対象トップチャットボットの中で最も成績が悪化。2024年のテストでは完璧だったのに、2025年ではほぼ半数の試行で正しい回答を返せませんでした。
独立系信頼性トラッカーTruthSignalは、@AskPerplexityの平均信頼性を**65%**と評価し、「一般的なクエリや探索的リサーチには信頼できるツール」とする一方、「ファクトチェックやセンシティブなトピックへの信頼性は疑問視されている」と指摘しています。
このベンチマークと実世界のパフォーマンスの乖離は重要です。ベンチマークは静的で十分に裏付けられた事実をテストします。一方、速報ニュースは急速に変化するナラティブ、相反する情報源、まだ権威的とは言えないウェブ上の情報を扱います──まさにAI検索ツールが苦手とする条件です。
Perplexityの最大の価値提案は引用です。すべての回答に番号付きのソースがリンクされていますが、その引用自体はどの程度信頼できるのでしょうか?
2026年2月から3月にかけて実施された実地テストでは、847回のPro Searchクエリの中から200の引用をスポットチェックした結果、78%が正確であると確認されました。つまり、約5回に1回の割合で、主張を裏付けないソースが引用されていたことになります。
他のレビューでも、引用の品質にはばらつきがあり、ブログ投稿のような権威性の低いソースが学術論文と並んで引用されることがあると指摘されています。また、存在しないページや無関係なページにリンクする、完全な幻覚の引用も報告されています。
学術研究に特化したTow Centerの調査では、PerplexityはテストされたAI検索エンジンの中で誤った引用の発生率が最も低かったものの、それでも約37%のケースで誤った回答を返したと報告されています。つまり、3回に1回以上の出力に誤りや誤った帰属が含まれていたことになります。
複数の独立レビューで、Perplexityの強みと弱みは一貫しています:
最も得意な分野:
最も苦手な分野:
「95%」という数字がオンラインで頻繁に引用されていますが、Perplexityはすべての回答タイプをカバーする、独立監査を受けた普遍的な評価を公開していません。実際の測定パフォーマンスは、ベンチマーク、製品モード、選択する言語モデル、情報源、質問の種類、正確性の定義によって変化します。
すべてのデータを総合した最も有用なまとめはこうです:検証可能なソースを使った一般的な事実調査──特に時事問題、科学、テクノロジー、構造化されたトピック──において、Perplexityは最も信頼できるAIツールのひとつです。その引用モデルは情報検証の方法を根本的に変え、ベンチマークスコアも確かに強力です。しかし、ニュース、センシティブな主張、学術研究については、その出力を最終回答ではなくスタート地点として扱いましょう。特に情報が急速に変化している場合や重要な判断が伴う場合は、重要な事実を手動で検証してください。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Perplexity AIの正確性はタスクによって大きく異なる。SimpleQAでは93.9%、ビジネス用途で92%と高スコアを記録
Perplexity AIの正確性はタスクによって大きく異なる。SimpleQAでは93.9%、ビジネス用途で92%と高スコアを記録 一方、NewsGuardの監査ではニュースの誤情報を35%の確率で繰り返すという結果に。前年18%から悪化
引用の正確性は78%(実地調査)。学術用途では3件に1件以上の誤りが含まれる可能性