Perplexity AI在标准化事实基准测试SimpleQA上得分93.9%,整体事实准确率为94%,但可靠性因任务类型差异巨大; 突发新闻是最大短板:NewsGuard审计发现,AI聊天机器人整体在2025年8月重复虚假新闻的比例高达35%,Perplexity的表现下滑最为显著; 引用准确率约为78%(200次抽查),意味着约五分之一的引用链接无法支持其声称的内容;学术场景下仍有约37%的答案存在错误或归因不当;
发布者使用 DeepSeek-V4-Flash 编辑图片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: Searching with cited sources for How reliable is Perplexity AI?. Article summary: Perplexity AI's reliability varies notably by use case and metric. On standard factual benchmarks it scores in the low-to-mid 90% range, but independent audits show it still gets news facts wrong roughly one-third of the. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it
问 Perplexity AI 有多准,你会得到一堆令人困惑的数字:93.9%、94%、65%、78%。它们都没错,但每一个都无法反映全貌。Perplexity AI 的表现在很大程度上取决于你问什么、信息来自哪里以及你如何定义准确性。对于普通事实性问题,它是最优秀的 AI 搜索工具之一。但对于突发新闻、敏感声明或深入的学术研究,它的输出需要仔细核实。本文根据独立基准测试、审计和实际使用体验,解析 Perplexity 的真实可靠性数据,让你知道哪些地方可以信任,哪些地方需要再次确认。
在标准化事实基准测试中,Perplexity 表现出具有竞争力的分数。该平台在 SimpleQA(一个旨在测试简短事实答案的基准)上达到 93.9%,超越了一些通用大语言模型 。这不是一个被精心挑选的数字:SimpleQA 是业内公认的基准,这个分数是 Perplexity 报告中最强有力的官方成绩 。
AI Business Weekly 的独立评估报告 整体事实准确率为 94%,且准确率因查询类型而异 :
在针对工作相关查询(包括政策分析、技术故障排查、公司研究等)的专业基准测试中,Perplexity 的事实准确率达到 92%,高于 ChatGPT 在相同测试中的 87% 。
Perplexity 自家的 DRACO 基准(2026年6月)显示,其 Deep Research 模型在 Google DeepMind 的 DeepSearchQA 和 Scale AI 的 ResearchRubrics 等外部基准测试中达到了最先进的水平 。
基准测试分数只讲了一个故事,现实世界的新闻准确性讲的是另一个。NewsGuard 在 2025 年 9 月的一项审计发现,AI 聊天机器人整体在 2025 年 8 月重复虚假新闻断言的比例高达 35%,高于前一年的 18% 。Perplexity 被单独指出是受测顶级聊天机器人中表现下滑最严重的。在 NewsGuard 2024 年的测试中,Perplexity 取得了完美的成功率;而在 2025 年,它在近一半的测试中未能提供正确答案 。
独立的可信度追踪机构 TruthSignal 将 @AskPerplexity 的平均可信度评为 65%,称其是“一个用于一般性查询和探索性研究的可信工具”,但指出“其用于事实核查或敏感话题的可靠性存在争议” 。
基准测试得分与现实世界表现之间的差距很重要。基准测试测试的是静态的、来源明确的事实。突发新闻涉及快速变化的叙事、互相矛盾的信源,以及可能尚未在开放网络上建立权威性的信息——这正是 AI 搜索工具难以应对的条件。
Perplexity 的关键价值主张是提供引用。每个答案都链接到编号的来源——但这些引用本身有多可靠呢?
在 2026 年 2 月至 3 月进行的一项实际测试中,一位测试者在 847 次 Pro 搜索查询中抽查了 200 条引用,结果发现 78% 被验证为准确 。这意味着大约每 5 条引用中就有 1 条链接到的来源实际上并不支持其所声称的内容。
其他评测者也注意到引用质量参差不齐。博客文章和不太权威的信源有时会与学术论文或官方文件同时出现 。有些引用甚至是完全虚假的——链接到不存在的或不相关的页面 。
具体到学术研究,一项 Tow Center 的研究发现,虽然在受测 AI 搜索引擎中 Perplexity 的错误引用率最低,但仍有大约 37% 的案例回答不正确——这意味着超过三分之一的输出包含错误或归属不当的声明 。
独立评测一致认同 Perplexity 的优势和劣势 :
最适合:
最不擅长:
尽管“95%”之类的数字在网上频繁出现,但 Perplexity 并未发布一个涵盖所有答案类型的、独立审计的通用评估 。其可衡量的表现会随着基准测试、产品模式、所选语言模型、信息来源、问题类型以及对准确性的定义而变化 。
最实用的总结来自结合所有数据:对于带有可验证来源的常规事实性研究——尤其是时事、科学、技术和结构化主题——Perplexity 是目前最可靠的 AI 工具之一。它的引用模式从根本上改变了你验证信息的方式,其基准测试分数也确实很强。但对于新闻、敏感声明和学术工作,将其输出视为起点,而非最终答案。手动核实关键事实,尤其是在信息快速变化或后果严重的情况下。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Perplexity AI在标准化事实基准测试SimpleQA上得分93.9%,整体事实准确率为94%,但可靠性因任务类型差异巨大;
Perplexity AI在标准化事实基准测试SimpleQA上得分93.9%,整体事实准确率为94%,但可靠性因任务类型差异巨大; 突发新闻是最大短板:NewsGuard审计发现,AI聊天机器人整体在2025年8月重复虚假新闻的比例高达35%,Perplexity的表现下滑最为显著;
引用准确率约为78%(200次抽查),意味着约五分之一的引用链接无法支持其声称的内容;学术场景下仍有约37%的答案存在错误或归因不当;